Skip to main content
Aggregate 雷锋网 人工智能 3 Sep 2026 - 18:30

视频生成算力新选择:SmarCo GC3如何绕过“存储墙”这道硬门槛

RSS 官方收录 · 可信分层展示

关键摘要

大模型生成视频,正在成为这个算力饥渴时代最典型的应用场景之一。一段由AI生成的1080P视频,背后往往是数十亿参数神经网络的反复迭代,是海量张量运算在时空维度上的密集交织,也是无数像素数据在芯片与存储之间的辗转奔袭。…

  • 对于大多数创作者而言,按下"生成"按钮之后等待渲染完成的焦虑,以及不断攀升的GPU集群账单,几乎已经成为一种常态。
  • 这场无声的算力战争背后,一个结构性的困境正在浮出水面——传统芯片架构下,算力的大头消耗在了"搬运"而非"计算"上。
  • 存储墙:视频生成绕不开的硬约束视频生成场景的算力特征与静态图像处理截然不同。

摘要引擎:抽取

正文提要

大模型生成视频,正在成为这个算力饥渴时代最典型的应用场景之一。一段由AI生成的1080P视频,背后往往是数十亿参数神经网络的反复迭代,是海量张量运算在时空维度上的密集交织,也是无数像素数据在芯片与存储之间的辗转奔袭。

对于大多数创作者而言,按下"生成"按钮之后等待渲染完成的焦虑,以及不断攀升的GPU集群账单,几乎已经成为一种常态。这场无声的算力战争背后,一个结构性的困境正在浮出水面——传统芯片架构下,算力的大头消耗在了"搬运"而非"计算"上。

存储墙:视频生成绕不开的硬约束

视频生成场景的算力特征与静态图像处理截然不同。扩散模型、视频大模型等任务不仅涉及海量张量的矩阵乘法,还涉及时序建模、多帧依赖和长序列的上下文理解。在冯·诺依曼架构的GPU上,这些运算遵循"取指-译码-执行-写回"的控制流逻辑。参数和中间特征图在显存与计算核心之间来回搬运,算完再搬回去。

问题在于,这种"搬运-计算-搬运"的模式在面对视频生成这种动辄数十亿参数、长序列帧间关系的任务时,瓶颈被无限放大。4K视频每秒近2.5亿个像素数据在芯片与显存间反复搬运,大部分能耗和延迟消耗在了搬运而非实际计算上——这正是业内常说的"存储墙"。而在视频生成中,由于生成连贯动作需要多次迭代,数据搬运的开销呈指数级叠加。

数据流架构:让计算跟着数据走

针对这一难题,中科通量推出的SmarCo GC3芯片,提供了一种截然不同的解题思路。这款被定义为"全球首款基于RISC-V数据流架构的视频智能AIGC芯片",采用了不同于传统控制流的调度模式——没有程序计数器,没有复杂的乱序执行逻辑,取而代之的是一种基于数据依赖的动态触发机制。

简单来说,当计算节点所需的输入数据齐备时,计算便自动触发;结果生成后,直接流向下一个需要它的节点。整个过程没有多余的搬进搬出,没有全局同步等待,也没有缓存未命中的随机抖动。

这恰好与视频生成的内在逻辑形成了结构性的契合。以扩散式视频生成为例,其核心是带有时间依赖的降噪步骤,每一帧的生成都依赖前一步的全局张量状态,同时涉及时序注意力——这本身就是一个数据依赖图。SmarCo GC3将这张图直接映射到硬件上,中间特征图在片上计算节点间流转,直到最终生成完整帧才写出片外存储。

硬参数撑起场景野心

从规格来看,SmarCo GC3为视频生成场景做了相当针对性的配置。200 TOPS(INT8)的AI算力,足以支撑大规模扩散模型和视频生成模型的实时推理;128GB LPDDR5统一内存池配合ECC纠错,既保障了长视频生成任务中帧缓存的稳定性,也为每一次随机噪声采样和去噪更新提供了容错能力;而128路1080P硬解码引擎的配置,则意味着在视频生成工作流中,素材解码、预处理、AI生成和后处理可以无缝衔接,无需在多个专用芯片间倒腾数据。

值得关注的是SmarCo GC3在生态层面的选择。数据流架构解决了"高效计算"的问题,但如何被广泛采用是另一个挑战。中科通量选择将数据流架构与RISC-V开放生态绑定——借助RISC-V的向量扩展和可定制指令机制,将Transformer中的矩阵乘加等高频算子固化为专用执行单元。与此同时,全球范围内越来越多的 AI 框架和算法库将原生支持 RISC-V,视频生成开发者无需从零开始。这种"数据流提供效率上限,RISC-V提供生态下限"的组合,切实降低了开发者迁移的门槛。

从妥协到自由生成

在传统GPU上跑视频生成,开发者总是在妥协——妥协于batch size、分辨率、生成时长和实时性。因为控制流架构的存储墙和同步墙决定了,当数据洪流超过一定阈值,性能不是线性下降,而是断崖式崩溃。

SmarCo GC3的数据流架构提供了一种不同于"堆更多GPU"的解决路径。通过将计算与存储深度融合,让中间结果在计算节点间直接传递,而非反复存取片外内存,这颗芯片在理论上能够支撑多路视频生成并行执行,也让长时间的连续视频生成具备了更现实的硬件基础。

当然,数据流架构并非新鲜概念,学术界从上世纪70年代就开始了相关探索。SmarCo GC3的落地是否能在实际生产环境中兑现纸面参数的优势,编译工具链能否跟上模型算法的快速迭代,RISC-V生态在AI框架层面的兼容性究竟如何——这些都有待更多实测数据的验证。

但至少有一点值得行业关注:当摩尔定律放缓,制程红利消退,视频生成的性能提升不能再靠堆更多的GPU、烧更多的电。中科通量给出的方向是让数据不再需要被搬运,让计算跟随数据自然流动。这条路能否走通,将在很大程度上决定视频AIGC从"能生成"到"自由生成"的跨越速度。

视频生成的时代大潮已然到来,而算力架构的革新,正是支撑这一切的底层地基。在这条数据之河上,SmarCo GC3刚刚起航,前方还有更长的航程。

雷峰网 雷峰网

打开官方原文 站点原文页 可信分区 本信源更多 今日简报 分享图 RSS 稍后再看列表 官媒栏目