前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
技术/09.03 · 00:00/5 MIN/编译自 雷锋网/2 阅读

SmarCo GC3:绕过存储墙的视频生成新算力

中科通量推出全球首款基于 RISC-V 数据流架构的视频 AIGC 芯片 SmarCo GC3。计算跟随数据流动,避免数据搬运开销,200 TOPS 算力配合 128GB 内存,试图绕过视频生成的存储墙瓶颈。

AI 生成一段 1080P 视频,背后是数十亿参数神经网络的反复迭代,以及海量张量运算在时空维度上的密集交织。对创作者而言,等待渲染的焦虑和不断攀升的 GPU 账单几乎成为常态。这背后有一道结构性难题:传统芯片架构下,大量算力消耗在“搬运”数据,而不是“计算”本身。

存储墙:视频生成的硬约束

视频生成与静态图像处理的算力特征截然不同。扩散模型、视频大模型不仅要处理海量张量的矩阵乘法,还要完成时序建模、多帧依赖和长序列上下文理解。在冯·诺依曼架构的 GPU 上,这些运算遵循“取指—译码—执行—写回”的控制流逻辑,参数和中间特征图会在显存与计算核心之间来回搬运。

当任务动辄涉及数十亿参数和长序列帧间关系时,“搬运—计算—搬运”的瓶颈被无限放大。4K 视频每秒近 2.5 亿个像素数据在芯片与显存之间反复穿梭,大部分能耗和延迟其实花在了搬运环节,这正是业内常说的“存储墙”。而视频生成需要多轮迭代才能生成连贯动作,数据搬运开销会指数级叠加。

数据流架构:让计算跟着数据走

中科通量发布的 SmarCo GC3 提供了一种不一样的解题思路。这颗被称为“全球首款基于 RISC-V 数据流架构的视频智能 AIGC 芯片”的产品,没有程序计数器,也没有复杂的乱序执行逻辑,取而代之的是一种基于数据依赖的动态触发机制。

SmarCo GC3 视频生成芯片

简单说,当计算节点所需的输入数据齐备时,计算自动触发;结果生成后,直接流向下一个需要它的节点。整个过程没有多余的搬进搬出,没有全局同步等待,也没有缓存未命中带来的随机抖动。

这种机制恰好与视频生成的内在逻辑形成结构契合。以扩散式视频生成为例,核心是带有时间依赖的降噪步骤:每一帧的生成都依赖前一步的全局张量状态,同时涉及时序注意力,本质上就是一张数据依赖图。SmarCo GC3 可以把这张图直接映射到硬件上,让中间特征图在片上计算节点间流转,直到最终帧完整生成,才写回片外存储。

硬参数与生态选择

从规格看,SmarCo GC3 做了针对性配置:

  • 200 TOPS(INT8)AI 算力,可支撑较大规模扩散模型和视频生成模型的实时推理;
  • 128GB LPDDR5 统一内存池并支持 ECC 纠错,兼顾长视频任务中的帧缓存稳定性,以及随机噪声采样、去噪更新的容错需求;
  • 128 路 1080P 硬解码引擎,让素材解码、预处理、AI 生成和后处理可以在同一芯片内无缝衔接,不必在多个专用芯片之间来回倒腾数据。

生态层面也值得关注。数据流架构解决的是“高效计算”,但能否被广泛采用才是更大挑战。中科通量选择将数据流架构与 RISC-V 开放生态绑定,借助 RISC-V 的向量扩展和可定制指令,把 Transformer 中的矩阵乘加等高频算子固化为专用执行单元。与此同时,越来越多 AI 框架和算法开始原生支持 RISC-V,视频生成开发者不必从零起步。“数据流提供效率上限,RISC-V 提供生态下限”的组合,降低了迁移门槛。

从妥协到自由生成

在传统 GPU 上跑视频生成,开发者经常要妥协:batch size、分辨率、生成时长、实时性,每一项都可能被存储墙和同步墙卡住。一旦数据洪流超过阈值,性能不是线性下降,而是断崖式崩溃。

数据流架构则提供了另一条不同于“堆更多 GPU”的路径:计算与存储深度融合,中间结果在计算节点间直接传递,不再反复读写片外内存。理论上,这让多路视频生成并行执行成为可能,也为长时间连续视频生成提供了更现实的硬件基础。

当然,数据流架构并不是新概念,学术界早在上世纪 70 年代就开始探索。SmarCo GC3 能否在实际生产环境中兑现纸面参数,编译工具链能否跟上模型算法的快速迭代,RISC-V 生态在主流 AI 框架中的兼容性究竟如何,还需要更多实测数据来验证。

值得行业关注的是:当摩尔定律放缓、制程红利消退,视频生成的性能提升不能再依赖堆 GPU、烧电力。中科通量给出的方向,是让数据不再需要被搬运,让计算跟随数据自然流动。这条路能否走通,将在很大程度上决定视频 AIGC 从“能生成”到“自由生成”的跨越速度。

视频生成浪潮已至,算力架构革新正是支撑它的底层地基。SmarCo GC3 刚刚起航,前方还有更长的航程。

标签:视频生成RISC-V

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

350M 模型 100 步 GRPO 微调:结构化输出合规率从 22.6% 抬到 29.7%
置顶

350M 模型 100 步 GRPO 微调:结构化输出合规率从 22.6% 抬到 29.7%

「Next-token predictor」是错的心智模型:为什么它决定了你怎么用大模型
置顶

「Next-token predictor」是错的心智模型:为什么它决定了你怎么用大模型

前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
NeoMME:单塔 Transformer 取代 VLM+投影+解码器,索引缩到 6KB/页
置顶

NeoMME:单塔 Transformer 取代 VLM+投影+解码器,索引缩到 6KB/页

//

24小时热榜

Meta 自研加速器 MTIA 300:将 NIC 内嵌芯片,集合通信损耗降至不足 0.5%
TOP1

Meta 自研加速器 MTIA 300:将 NIC 内嵌芯片,集合通信损耗降至不足 0.5%

银河通用发布 Galbot ET1:24小时预订破200台,人形机器人仍难摆脱「表演」标签
TOP2

银河通用发布 Galbot ET1:24小时预订破200台,人形机器人仍难摆脱「表演」标签

3

350M 模型 100 步 GRPO 微调:结构化输出合规率从 22.6% 抬到 29.7%

12小时前
350M 模型 100 步 GRPO 微调:结构化输出合规率从 22.6% 抬到 29.7%
4

GitHub HydraFusion:多模型编排媲美 Opus 5,成本低 67%

12小时前
GitHub HydraFusion:多模型编排媲美 Opus 5,成本低 67%
5

Audacity 4.0 发布:Qt 重构界面,剪辑模型全面重做

12小时前
Audacity 4.0 发布:Qt 重构界面,剪辑模型全面重做
6

乌克兰战场无人机数据流向商业市场:超百家企业获取飞行数据

12小时前
乌克兰战场无人机数据流向商业市场:超百家企业获取飞行数据
7

微软 Project Zenith:面向开发者的开箱即用 Win11 配置

12小时前
微软 Project Zenith:面向开发者的开箱即用 Win11 配置
8

HEIR:Google 同态加密编译器让 ML 推理在密文上直接运行

12小时前
HEIR:Google 同态加密编译器让 ML 推理在密文上直接运行
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断