阿斯麦、台积电和英伟达恐怕要睡不着了。7月13日,上海一家成立不足三年的企业,仅凭14nm工艺便造出一颗算力达520TFLOPS的AI芯片,既没用EUV,也没用HBM。
2026年7月13日,上海一场芯片发布会上,东方算芯首次公开DF1000。屏幕上最醒目的两项指标,是BF16算力达到520TFLOPS,访存带宽达到6.4TB/s。更受关注的是,它采用了14纳米工艺。
按照传统思路,高性能AI芯片往往要依赖先进制程和高带宽存储。东方算芯没有沿着这条拥挤的路线继续追赶,而是把突破口放在计算架构、存储方式和三维封装上。
这家公司成立于2024年5月,总部位于上海张江。董事长兼首席执行官魏少军长期从事集成电路研究和产业工作,也曾参与国家重大科技专项。公司现有团队已超过500人。
DF1000是一款软件定义近存计算3D芯片。它并非单纯依靠缩小晶体管尺寸提升性能,而是试图解决AI计算中长期存在的访存瓶颈,让数据尽量靠近计算单元,减少来回搬运造成的等待与能耗。
大模型运行时,大量参数需要不断在计算模块和存储模块之间传输。处理器即便拥有很高的理论算力,一旦数据供应跟不上,许多计算单元仍会处于空转状态。这也是行业常说的“存储墙”。
DF1000采用DRAM与逻辑晶圆混合键合的垂直堆叠方案。计算层和存储层被放得更近,互连距离缩短,通信通道数量增加。数据不必经过较长的外部路径,带宽因此得到明显提升。
这种设计并不是简单模仿现有高端GPU。它更像是重新安排计算、存储和通信之间的关系,用架构创新弥补成熟制程在晶体管密度上的差距。工艺没有追到最前沿,系统效率却获得了新的提升空间。
软件定义也是这颗芯片的重要特点。部分硬件资源可以根据不同任务进行灵活调度,使同一套计算单元适应训练、推理和多种数据精度需求。它追求的不是某个单项数字,而是提高真实场景中的算力利用率。
DF1000单卡还提供900GB/s的卡间互联带宽。围绕这颗芯片,东方算芯同步推出加速卡、服务器、超节点、智算集群和自主软件栈,说明其目标并非只卖一颗芯片,而是构建完整的算力系统。
目前,DF1000已经完成流片验证,并实现128卡集群稳定运行。公司还公布了后续产品路线,计划继续提升算力、访存和互联能力,在成熟制程基础上向更大规模的训练与推理场景推进。
全国产供应链也是这套方案的重要方向。14纳米工艺在国内拥有较好的制造基础,设计、制造和封装环节更容易形成稳定协同。对于需要长期运行的政务、金融、科研和能源系统,供应连续性具有现实价值。
当然,一款AI芯片能否真正立足,不能只看发布会上的峰值参数。实际模型性能、功耗、软件适配、集群效率和客户应用,都需要经过更长时间验证。DF1000迈出的关键一步,是把一条不同于先进制程竞赛的路线带到了现实产品阶段。
我认为,东方算芯最值得重视的地方,不是用14纳米制造了一个多么惊人的数字,而是中国芯片企业正在摆脱单纯追随的思维。先进制程必须持续突破,架构、封装和软件创新也应同步推进,两条路并不冲突。
真正可靠的技术进步,既要看到参数,也要经得住应用检验。只要坚持自主创新,把产品、生态和产业链一步步做扎实,中国完全有能力在全球AI算力竞争中形成自己的技术路线和发展节奏。
