东方算芯发布DF1000:14nm成熟制程实现520TFLOPS算力
用架构创新绕过制程封锁

7月13日,上海AI芯片创企东方算芯发布了一颗不太按常理出牌的芯片——DF1000。它最反直觉的地方在于:没有追先进制程,没有堆HBM,用14纳米成熟工艺就跑出了520 TFLOPS的算力,还配了6.4 TB/s的访存带宽。在所有人都在卷3纳米、卷HBM的当下,这条路显得有点「土」,却戳中了一个真问题。
传统高端算力有三道坎:先进制程被卡脖子、HBM产能紧俏、成本居高不下。DF1000的打法是「软件定义近存计算」的3D架构——把计算和存储贴得更近,用架构创新去 compensate 制程上的代差。它不依赖最尖的晶体管,也不依赖最贵的存储,而是靠芯片内部的布局把数据搬移的损耗压下去。
更关键的是工程落地。东方算芯宣布已经完成了128卡集群的全功能稳定运行,这意味着它不是一颗实验室里的样片,而是能真正组集群、跑业务的芯片。同期央视也报道了同类架构芯片亮相,说明「以架构创新代替制程追随」不是一家公司的孤例,而是在国产算力圈子里正在形成的一股共识。
为什么这件事值得放在台面上讲?因为过去两年国产算力的叙事总绕不开一个焦虑:别人制程领先,我们是不是永远差半代?DF1000这类芯片给出的回答是——算力不一定非得靠最细的线宽堆出来。当制程红利见顶、先进设备又受限,用体系结构和软硬协同去榨干成熟工艺的潜力,是一条更可控、也更不受制于人的路。
更现实的一层是成本。14纳米是早已摊薄的设备与产能,良率和单价都远好于先进制程,这意味着用「便宜且买得到的工艺」也能做出能用的高端算力,对预算敏感的场景尤其友好。DF1000把这点直接落到了产品里。
当然,成熟制程的天花板也摆在那。520 TFLOPS放到全球顶尖阵营里不算惊艳,14纳米的功耗和面积也必然有代价。但方向对了,比一时的峰值更重要。国产高端算力真正要补的课,从来不只是「能不能造出来」,而是「能不能在受限条件下,稳定、便宜、成规模地造出来」。这条路,DF1000算是踩实了一脚。