论文解读、算法突破、架构分析
OpenAI 披露并阻断了一起协同对抗性模型蒸馏行动。攻击者试图通过操纵交互系统性窃取受保护的内部推理链以复现模型能力,核心活动被归因于月之暗面(Moonshot AI)相关人员。
技术博客与 Go 官方博客本周同时更新:一篇纠正关闭 channel 的常见误解并系统梳理并发机制,另一篇介绍 1.26/1.27 新增的跨平台 SIMD 实验 API,覆盖 amd64、arm64 和 wasm。
开源推理框架Colibrì在GitHub斩获超3万Star。该框架利用MoE稀疏激活特性与多层内存调度机制,直接将SSD作为模型后备存储,仅凭普通CPU和24GB内存即可运行744B参数模型,大幅降低超大模型本地运行门槛。
在云栖大会上,米哈游揭秘了其AI游戏研发与玩法落地的完整技术布局。从具备多层记忆与情绪表达的AI NPC,到内部协作研发的多Agent平台,再到用强化学习自进化的游戏闭环,米哈游正在押注千亿打造全新的动态互动体验。
推理初创公司Inferact通过手写megakernel与结合DeepSeek的DSpark推测解码框架,让16块谷歌TPU v7运行Kimi K3的速度达到每秒709 Token,比英伟达GB200快57%,相关代码已全面开源。
阿里平头哥在发布新一代真武V900芯片后,宣布进一步开源类CUDA软件栈T-Head SAIL,涵盖框架适配、算子优化与通信库。此举意在降低代码迁移门槛,让开发者与头部企业能够深度参与算子定制与底层调优。
Meta 在 Connect 大会上推出手持 AI 设备 Muse Charm;谷歌计划发射搭载 TPU 的试验卫星探索太空计算;Anthropic 内部测试揭示高阶 AI 具备更强议价能力;表演艺术家游本昌逝世。
高通推出2nm旗舰芯片第六代骁龙8超级至尊版。该平台针对端侧AI智能体彻底重构CPU、GPU和NPU架构,突破5GHz主频,支持端侧运行300亿参数MoE大模型,标志着移动计算全面迈入智能体时代。
机器人仿真正在全面转向GPU原生并行计算。NVIDIA Warp与MjWarp通过将Python代码即时编译为CUDA内核,结合MuJoCo物理引擎,实现了数万个环境的极速并行交互,大幅缩短强化学习训练周期。
从实验室首次点亮到AI工厂规模化部署,硬件验证是系统稳定的核心。NVIDIA揭示了验证团队的工程实践,展示工程师如何跨越芯片、固件与散热架构,确保Rubin等系统在极端负载下可靠运行。
Puffer 宣布与 Google Cloud 合作,由后者作为 Gateway 节点支持 Puffer UniFi 执行层并提供执行预确认。此举将企业级云服务直接嵌入以太坊原生排序架构,为解决 L2 性能与主网安全性割裂提供了新方案。
DeepSeek创始人梁文锋等署名公开最新架构论文,揭秘面向AI智能体训练的弹性计算系统DSec。系统单日可生成超300万个沙盒,峰值并发38万个,解决了智能体训练中环境开销大、资源争抢及作弊突破等系统性难题。
大模型架构正在向MoE(混合专家模型)加速迁移。从GPT-4到爆火的DeepSeek-V3,MoE凭借“大容量、低算力消耗”的稀疏激活特性成为主流。本文带你拆解其底层逻辑与极简代码实现方案。
敲代码变得前所未有地容易,但交付可靠软件却更难了。本文拆解从随意复制粘贴的“氛围编码”跃迁到企业级自主Agent架构的路径,通过ADK、GitOps与MCP构建生产级可靠系统。
在AI智能体快速落地的背景下,计算架构正迎来深刻转变。由于Agent涉及大量多轮工具调用、数据预处理和任务编排,英特尔指出AI集群中CPU与GPU的配比正从1:4迈向1:1,CPU的调度与执行价值亟待重估。
面对 AI 智能体带来的海量持续推理需求,浪潮信息推出元脑 SD200 Ultra 超节点与元脑 HC2000 机组,分别主打单机承载 10 万亿参数的能力型智算,以及异构协同降本增效的容量型智算,推动算力走向规模化智能生产。
oMLX创作者兼核心维护者Jun Kim宣布加入Hugging Face。他将重点推动Apple MLX开源生态与工具链的发展,帮助开发者在苹果芯片上实现更高效的模型部署与端侧AI创新。