开发者 robss2020 做的免费网页工具 MicroLLM Lab,用 WebGPU 在浏览器里跑 7 款 Q4 量化的小语言模型,支持对话、客观打分基准测试、跨模型对比,还能生成可分享的性能证书,数据全程留在本机。
MicroLLM Lab 是一个纯前端网页工具,网址 stateofutopia.com/experiments/microllmlab,不用注册、不经过服务器,直接在浏览器里跑 7 款参数量在 2600 万到 3.6 亿之间的小语言模型(SLM)。它依赖 WebGPU——能让浏览器调用本机 GPU 算力的 W3C 标准接口,不可用时退到 WASM 或纯 JS。模型权重经 Q4(4 位)量化,体积缩小约 75%,单个只有 15~216MB,缓存进 IndexedDB 后不用重复下载。项目开源在 github.com/robss2020/microllm-lab,作者说明是受 yangqi0 的 PetitGPT 项目启发做的 WebGPU 移植版。9 月 28 日它作为 Show HN 帖子上了 Hacker News 首页,拿到 99 点赞、42 条评论。

MicroLLM Lab 页面里的 7 张模型卡片,标注了参数量、下载体积、开源协议和作者。来源:stateofutopia.com/experiments/microllmlab 页面截图
按体积从小到大:jingyaogong 的教学项目 MiniMind2 Small(2580 万参数,15.4MB)和 MiniMind2(1.04 亿参数,62.1MB),中文更强;PetitGPT research-v1(1.25 亿参数,74.4MB)由 yangqi0 用单张 RTX 4090 训练,是速度基准;GPT-2 124M(77.1MB,MIT)是 OpenAI 2019 年、nanoGPT 训练的经典架构;L20-Edu 135M(80.3MB)由 AliceYin 用单张 NVIDIA L20 训练;SmolLM2 135M 和 360M Instruct(80.3MB、215.9MB)出自 Hugging Face 的 Smol Models Research 团队。7 个模型加载完约 605.6MB,也提供 589MB 的离线 zip 包。
Benchmarks 标签页用正则或精确匹配给答案打分,不评判语言流畅度——页面原话是"一个 1.35 亿参数的模型答错是正常的,这本身就是要测的东西"。每次测试记录准确率(通过率)和速度(持续解码 tokens/s、单测耗时、总耗时),可只测当前模型,也可让所有已加载模型跑一遍对比。Compare & Certificate 标签页把速度和耗时汇总成图表,还能生成"性能证书":填入用户名和设备信息后导出 PNG,含峰值/持续 tokens/s 与硬件信息,可分享到 X 或 LinkedIn,数据都在本机生成,不上传服务器。
Custom eval 标签页让用户写一段 JavaScript 基准测试:代码在页面 origin 里被 eval() 执行,每条 check 函数拿模型解码出的文本做判断,页面附了对象式和函数式两种示例代码。想验证某个小模型能不能胜任固定格式的分类或抽取任务,不用离开浏览器调 API,直接在页面定义规则、跑通过率就行。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断