MLC 团队的开源项目 WebLLM 借助 WebGPU 硬件加速,将大语言模型推理直接搬进浏览器,无需服务器,兼容 OpenAI API,支持 Llama 3、Qwen 等主流开源模型。
WebLLM 是 MLC(Machine Learning Compilation)团队开源的浏览器端大模型推理引擎,本周在 Hacker News 获得持续关注。它的核心思路:借助 WebGPU 标准调用本地 GPU,将模型推理直接在浏览器内完成,不依赖任何远程服务器。
WebLLM 完全兼容 OpenAI API,支持流式输出、JSON 模式、结构化生成等功能,函数调用处于开发中。这意味着现有的 OpenAI 客户端代码几乎无需改动,切换运行时即可实现本地化推理。支持的模型包括 Llama 3、Phi 3、Gemma、Mistral、Qwen(通义千问)等主流开源系列,完整列表通过 MLC Models 统一维护,格式为 MLC 编译格式,也支持接入自定义模型。
WebLLM 通过 Web Worker 或 Service Worker 将推理任务卸载到独立线程,避免阻塞主线程 UI 响应。结构化 JSON 输出在 WebAssembly 部分实现,可按自定义 Schema 约束模型输出。Chrome Extension 场景有对应示例,可将 LLM 能力直接嵌入浏览器插件。
WebLLM 是 MLC LLM 生态的前端组件,后者的目标是让 LLM 在所有硬件环境通用部署,两者共享同一套编译工具链。npm 包名为 @mlc-ai/web-llm,支持 CDN 直接引入,部署门槛很低。
运行 LLM 目前主要有两条路:云端 API 和本地安装客户端。WebLLM 走第三条:纯浏览器推理。对用户来说,无需安装任何软件;对开发者来说,无需维护推理服务器;对隐私敏感场景来说,数据不出本地设备。
限制同样明显:浏览器 WebGPU 的实际推理速度远低于专用服务器;大参数量模型受限于设备 VRAM,多数情况下只能跑数十亿参数以内的轻量模型。但对「零运维成本」或「隐私优先」的轻量应用场景,WebLLM 提供了可直接部署的选项。
WebGPU 是 W3C 推进的下一代 Web 图形与计算 API,2023 年在 Chrome 113 正式稳定落地。相比 WebGL,WebGPU 更贴近现代 GPU 架构,计算着色器性能显著提升,这为浏览器端大模型推理打开了技术窗口。MLC 团队的目标是打通从服务器到边缘设备再到浏览器的完整部署链路,WebLLM 是这条链路的最后一公里。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断