面对 AI 智能体带来的海量持续推理需求,浪潮信息推出元脑 SD200 Ultra 超节点与元脑 HC2000 机组,分别主打单机承载 10 万亿参数的能力型智算,以及异构协同降本增效的容量型智算,推动算力走向规模化智能生产。
多年以来,AI 算力领域的竞争往往集中在一个字——堆。堆计算卡、堆服务器机柜、堆电力设施,业内一度认为只要集群规模足够大,就能占据制高点。
然而,随着大模型与 AI 智能体(Agent)的演进,算力供需关系发生质变,单靠“堆料”已无法解决核心瓶颈。当前的算力挑战已经清晰地分化为两个维度:支撑前沿模型极限的智能上限(能力型智算),以及低成本大规模供应 Token 的智能规模(容量型智算)。
在 AICC 2026(人工智能计算大会)上,IDC 发布的《2026年中国人工智能计算力发展评估报告》指出了这一趋势。针对这两重挑战,浪潮信息推出了两款核心基础设施:超节点 AI 服务器元脑 SD200 Ultra 与多元算力机组元脑 HC2000。
AI 智能体接管复杂任务后,模型调用从单次“问答式”转变为数十次甚至上百次的连续推理,任务时长可拉长至数天。IDC 报告预测,到 2030 年全球每年的 AI 推理任务将增加 4000 万亿次,Token 消耗量的复合增长率高达 4822.6%。

与此同时,全球 AI 算力供需缺口持续拉大,预计到 2030 年算力缺口绝对值将达到 3809 亿美元。更棘手的是负载特性的分化:Prefill 阶段属于高并行密集计算,Decode 阶段则高度依赖显存带宽,Attention 计算又被持续膨胀的 KV Cache 掣肘。

同一种算力无法高效通吃所有环节,单纯堆砌同构算力不仅无法实现线性性能扩展,还会导致显存与算力配比失衡。浪潮信息首席 AI 战略官刘军将其归结为两大方向:

针对前沿模型“装不下、跑不快、跑不稳”的痛点,元脑 SD200 Ultra 超节点服务器给出了系统级解决方案。

1. 紧致扩展与大容量承载
SD200 Ultra 延续了 3D Hyper Mesh 架构,整机芯片数量由 64 颗提升至 128 颗,显存与扩展存储分别达到 8TB 和 64TB。除了能单机高效承载 2.8 万亿参数开源模型 Kimi K3 之外,该架构设计支持部署最高 10 万亿参数的前沿模型。
2. 统一寻址与对称直连
为消除跨芯片通信延迟,SD200 Ultra 建立了全局统一编址空间,将跨节点数据交互转化为内存地址直接读写;再通过对称内存技术实现 GPU 显存直连,跳过地址转换与封包流程,使 All-to-All 通信时延压缩至 0.69 微秒。

3. 超级算子协同优化
传统多算子调度会导致大量内核启动和显存搬迁开销。SD200 Ultra 将 Attention、FFN、MoE 等算子融合成计算与通信一体的“超级算子”,算子总量减少至原来的十分之一。在运行 Kimi K3 时,其推理性能提升 3 倍以上,Token 生成时延降至 5.85 毫秒。

在长时间运行稳定性上,SD200 Ultra 采用铜互联方案,大幅降低光电转换元件的故障率,保障数小时乃至数天的连续任务不中断。
元脑 HC2000 机组的核心目标在于降低 Token 生产成本,通过异构协同化解产能焦虑。

1. 高密全液冷底座
HC2000 采用全液冷与高通流供电设计,单柜供电超 300kW,可容纳 256 张 AI 加速卡,算力密度提升至传统风冷机柜的 4 倍。其 Directcom 2.0 互联架构提供 200Tbps 的柜内聚合带宽,支持跨柜多平面无损扩展。
2. 异构芯片按需分工
HC2000 打破了单一芯片通用的逻辑:

3. MCIS 智能协同软件栈
软硬件协同是多元算力发挥潜能的关键。浪潮信息开发的 MCIS 软件栈覆盖了从请求路由、Prefill/Decode(PD)分离到资源动态调配的全流程。系统能根据实际负载动态重新评估 PD 配比,并将跨异构芯片的 KV Cache 点对点传输性能提升近 5 倍。通过分级冷热存储策略,节点内磁盘 I/O 吞吐提升 32 倍。在典型 Agent 场景中,HC2000 与 MCIS 的组合在相同投资下实现了 10 倍的 Token 产能增长。

能力突破与规模普及并非孤立演进,而是构成了双螺旋关系:能力型算力攻克前沿大模型难关后,相关技术经工程优化沉淀为普惠方案,由容量型算力将其低成本输出给大众与企业;海量应用反馈的新需求,又反哺下一代算力基础设施继续上探极限。
从单纯“提供算力堆料”转向系统化“生产智能”,AI 算力基础设施正在向即插即用、稳定经济的工业化公用事业快速迈进。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断