前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
技术/09.22 · 10:22/4 MIN/编译自 克雷西/0 阅读

浪潮信息发布两款智算产品,重构大模型推理架构

面对 AI 智能体带来的海量持续推理需求,浪潮信息推出元脑 SD200 Ultra 超节点与元脑 HC2000 机组,分别主打单机承载 10 万亿参数的能力型智算,以及异构协同降本增效的容量型智算,推动算力走向规模化智能生产。

多年以来,AI 算力领域的竞争往往集中在一个字——堆。堆计算卡、堆服务器机柜、堆电力设施,业内一度认为只要集群规模足够大,就能占据制高点。

然而,随着大模型与 AI 智能体(Agent)的演进,算力供需关系发生质变,单靠“堆料”已无法解决核心瓶颈。当前的算力挑战已经清晰地分化为两个维度:支撑前沿模型极限的智能上限(能力型智算),以及低成本大规模供应 Token 的智能规模(容量型智算)。

在 AICC 2026(人工智能计算大会)上,IDC 发布的《2026年中国人工智能计算力发展评估报告》指出了这一趋势。针对这两重挑战,浪潮信息推出了两款核心基础设施:超节点 AI 服务器元脑 SD200 Ultra 与多元算力机组元脑 HC2000。

智能体催生的双重算力缺口

AI 智能体接管复杂任务后,模型调用从单次“问答式”转变为数十次甚至上百次的连续推理,任务时长可拉长至数天。IDC 报告预测,到 2030 年全球每年的 AI 推理任务将增加 4000 万亿次,Token 消耗量的复合增长率高达 4822.6%。

IDC全球AI推理负载增长趋势预测

与此同时,全球 AI 算力供需缺口持续拉大,预计到 2030 年算力缺口绝对值将达到 3809 亿美元。更棘手的是负载特性的分化:Prefill 阶段属于高并行密集计算,Decode 阶段则高度依赖显存带宽,Attention 计算又被持续膨胀的 KV Cache 掣肘。

全球AI算力需求满足率走势

同一种算力无法高效通吃所有环节,单纯堆砌同构算力不仅无法实现线性性能扩展,还会导致显存与算力配比失衡。浪潮信息首席 AI 战略官刘军将其归结为两大方向:

  • 能力型智算(Capability):支撑超大规模前沿模型求解高难度科学计算、药物研发与芯片设计等超长链路任务;
  • 容量型智算(Capacity):让智能推理供给更廉价、更充沛,支撑海量应用落地的基础设施。

能力型智算与容量型智算的关系拆解

SD200 Ultra:突破单节点智能上限

针对前沿模型“装不下、跑不快、跑不稳”的痛点,元脑 SD200 Ultra 超节点服务器给出了系统级解决方案。

元脑 SD200 Ultra 超节点AI服务器

1. 紧致扩展与大容量承载
SD200 Ultra 延续了 3D Hyper Mesh 架构,整机芯片数量由 64 颗提升至 128 颗,显存与扩展存储分别达到 8TB 和 64TB。除了能单机高效承载 2.8 万亿参数开源模型 Kimi K3 之外,该架构设计支持部署最高 10 万亿参数的前沿模型。

2. 统一寻址与对称直连
为消除跨芯片通信延迟,SD200 Ultra 建立了全局统一编址空间,将跨节点数据交互转化为内存地址直接读写;再通过对称内存技术实现 GPU 显存直连,跳过地址转换与封包流程,使 All-to-All 通信时延压缩至 0.69 微秒。

SD200 Ultra对称直连与低时延通信架构

3. 超级算子协同优化
传统多算子调度会导致大量内核启动和显存搬迁开销。SD200 Ultra 将 Attention、FFN、MoE 等算子融合成计算与通信一体的“超级算子”,算子总量减少至原来的十分之一。在运行 Kimi K3 时,其推理性能提升 3 倍以上,Token 生成时延降至 5.85 毫秒。

超级算子架构大幅降低内核启动与显存开销

在长时间运行稳定性上,SD200 Ultra 采用铜互联方案,大幅降低光电转换元件的故障率,保障数小时乃至数天的连续任务不中断。

HC2000:多元算力分工释放产能

元脑 HC2000 机组的核心目标在于降低 Token 生产成本,通过异构协同化解产能焦虑。

元脑 HC2000 多元算力机组全景

1. 高密全液冷底座
HC2000 采用全液冷与高通流供电设计,单柜供电超 300kW,可容纳 256 张 AI 加速卡,算力密度提升至传统风冷机柜的 4 倍。其 Directcom 2.0 互联架构提供 200Tbps 的柜内聚合带宽,支持跨柜多平面无损扩展。

2. 异构芯片按需分工
HC2000 打破了单一芯片通用的逻辑:

  • Prefill 阶段:选用大算力芯片搭配性价比显存,匹配高计算密度需求;
  • Decode 阶段:配备大容量、高带宽的 HBM 芯片;
  • FFN 环节:采用 3D RAM 堆叠芯片,缓存带宽高达数十 TB/s。

多元算力机组内部芯片协同与模组化设计

3. MCIS 智能协同软件栈
软硬件协同是多元算力发挥潜能的关键。浪潮信息开发的 MCIS 软件栈覆盖了从请求路由、Prefill/Decode(PD)分离到资源动态调配的全流程。系统能根据实际负载动态重新评估 PD 配比,并将跨异构芯片的 KV Cache 点对点传输性能提升近 5 倍。通过分级冷热存储策略,节点内磁盘 I/O 吞吐提升 32 倍。在典型 Agent 场景中,HC2000 与 MCIS 的组合在相同投资下实现了 10 倍的 Token 产能增长。

MCIS软件栈实现全链路监控与动态PD调度

迈向“生产智能”的工业化演进

能力突破与规模普及并非孤立演进,而是构成了双螺旋关系:能力型算力攻克前沿大模型难关后,相关技术经工程优化沉淀为普惠方案,由容量型算力将其低成本输出给大众与企业;海量应用反馈的新需求,又反哺下一代算力基础设施继续上探极限。

从单纯“提供算力堆料”转向系统化“生产智能”,AI 算力基础设施正在向即插即用、稳定经济的工业化公用事业快速迈进。

标签:AI智能体推理

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

tokenizers v1 最高快 30 倍,中文却只快 6.8 倍
置顶

tokenizers v1 最高快 30 倍,中文却只快 6.8 倍

亚马逊封杀 Meta Muse:问题不在 AI 购物,在浏览器跑在谁的机器上
置顶

亚马逊封杀 Meta Muse:问题不在 AI 购物,在浏览器跑在谁的机器上

前途科技前途科技
服务关于快讯技术商业报告
微信咨询二维码

咨询微信

扫码添加微信咨询

前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
美军险些登临中国货船:出问题的不是 AI 幻觉,是那第二次调用
置顶

美军险些登临中国货船:出问题的不是 AI 幻觉,是那第二次调用

//

24小时热榜

OceanBase登顶国际数据智能体榜单,准确率突破90%
TOP1

OceanBase登顶国际数据智能体榜单,准确率突破90%

OpenAI呼吁建立前沿AI国际标准 应对递归自我改进风险
TOP2

OpenAI呼吁建立前沿AI国际标准 应对递归自我改进风险

3

大模型接管机械臂危险测试:GPT-6 Astra执行率达97%

21小时前
大模型接管机械臂危险测试:GPT-6 Astra执行率达97%
4

长三角安全AI实验室发布星界、星驭、星鉴三大解决方案

21小时前
长三角安全AI实验室发布星界、星驭、星鉴三大解决方案
5

API 成本吞噬利润,AI 初创公司集体转向开源权重模型

5小时前
API 成本吞噬利润,AI 初创公司集体转向开源权重模型
6

清华联手无问芯穹开源具身智能基建RPent

23小时前
清华联手无问芯穹开源具身智能基建RPent
7

海力士与兆易创新:同样做存储,为何逻辑迥异?

23小时前
海力士与兆易创新:同样做存储,为何逻辑迥异?
8

AI安全是工程问题:如何构筑Agent技术栈各层防御

14小时前
AI安全是工程问题:如何构筑Agent技术栈各层防御
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断