7月18日至20日,第三届中国计算机学会芯片大会(CCF Chip 2026)在太湖之滨无锡举办。
会场中,两院院士与顶尖工程师们的讨论话题直指底层架构的“根技术”创新。一个核心追问被反复推至台前:当摩尔定律逼近物理极限,制程红利日益稀薄,堆核心、拼频率的老路越走越窄,是否该彻底换一条路走?换言之,与其在通用架构上不断打补丁,能否从数据流动的本质出发,为特定场景原生设计一颗芯片?
作为全球首款RISC-V数据流架构视频智能AIGC芯片,金刚GC3芯片的出现,不仅是一次产品首发,更是为视频而生的专用算力。
视频洪流之下,通用芯片的搬运困局
当前,AI消耗的算力,大半都喂给了视频。从Sora引领的文生视频,到城市摄像头每秒数千路的实时解析,再到工业产线上毫秒级的质检判定,视频流不再是锦上添花的内容载体,而是AI基础设施的主航道。
然而,传统CPU、GPU骨子里流淌的是控制流的血液。它们依赖程序计数器一步步推进指令,数据在内存和计算单元之间来回搬砖。中科通量总工程师罗鑫算过一笔账:在视频处理中,数据搬运消耗的能量往往是实际计算的数倍,这种搬砖式算力,面对视频流的海量、连续、高并发特性,就像用快递三轮车去运洪峰期的集装箱。
更棘手的是,视频编解码与AI推理深度耦合,需要细粒度并行和极低延迟,而通用架构的缓存未命中、分支预测失败等老毛病,在视频场景下被成倍放大。当视频AI从可选变为必选,架构层面的结构性瓶颈,已不是堆更多晶体管能解决的。
数据流哲学:让数据自己“跑”起来
在CCF芯片大会的“数据流计算分论坛”上,论坛主席、中科院计算所研究员叶笑春表示:“数据流架构没有程序计数器,只有‘数据就绪即执行’。”
这听起来像哲学,实则是工程范式的颠覆。传统架构是指令驱动:CPU问“下一条指令是什么?”;数据流架构是数据驱动:哪个计算节点凑齐了所有输入,它自己就立刻触发,结果直接传给下游,无需折返全局内存打卡报到。
这种模式天然契合视频流:多路码流好比多条独立的数据河,每条河上的操作只依赖本地数据,互不等待,并行度被彻底释放;中间结果随流水传递,访存开销大幅削减。现场有技术专家比喻说:“如果说GPU是万人协同的大工厂,数据流芯片就是一条自动化的智能流水线——没有空转,没有堵车,每份数据到达即加工。”
当然,观众席上也有人抛出现实拷问:编译器好不好写?生态怎么建?大规模工程落地稳不稳?这些问题,恰好说明数据流已从理论探讨进入实战检验阶段。
金刚GC3:不只是参数,更是场景定制战
展台上的金刚GC3,给出了首份实战答卷。罗鑫表示,金刚GC3基于RISC-V架构的12核设计,主频2.0GHz,单芯片INT8算力200 TOPS,FP16达32 TFLOPS,同时支持128路1080P@30fps硬解码和64路硬编码。上海交通大学教授冷静文在现场评价:“在视频AI推理上,它有和主流GPU掰手腕的峰值能力,而同等功耗下的视频处理密度,是它的差异化杀手锏。”
值得注意的是其定位:不追求通吃所有AI负载,而是专注视频场景。AIGC视频生成、智慧城市分析、工业视觉感知。当大模型开始看长视频、理解多模态时,面向视频流优化的专用芯片,不再是大而全的配角,而是精而专的主角。
这也折射出国产算力演进的一条新路径:与其在通用赛道追赶巨头,不如在场景深水区构筑自己的护城河。从跟随适配到场景定义,金刚GC3释放的信号清晰而坚定:算力效率的最优解,不是对通用架构的修修补补,而是从数据流动的本质出发,为视频量身再造一颗“芯”。