阿里开源的 Qwen3.8-27B 登顶 Hugging Face 热门榜。这个 27B 参数的模型在多项 Coding 与 Agent 基准上接近甚至超过 Claude Opus 4.6 Max,量化后可在 RTX 3090 上运行。这标志着前沿 Agent 能力正从云端下放到个人电脑。
8月17日,阿里开源的新模型 Qwen3.8-27B 登顶 Hugging Face 热门榜。一个仅 27B 参数的模型,为什么让全球 AI 社区如此兴奋?

27B 参数在动辄数千亿的旗舰模型面前不算大,但开源后反响热烈。在官方成绩中,Qwen3.8-27B 已开始在部分 Coding 和 Agent 测试中与 Claude Opus 4.6 Max 同台竞技。4bit 量化后约 17.1GB,一张 RTX 4090 或 3090 就能跑,个人设备也能尝试本地部署。
过去,本地部署往往意味着能力妥协:用户获得隐私、可控和低成本,但必须接受复杂 Coding、工具调用和长程 Agent 任务上的短板。Qwen3.8-27B 正在挑战这个默认前提。


Qwen3.8-27B 用 27B 尺寸同时承载了 Coding、Agent、长上下文和多模态能力。架构上,64 层中有 48 层采用 Gated DeltaNet,16 层保留完整 Attention,降低了长文本的显存压力。模型原生支持 262K 上下文,可扩展到 100 万 Token。

真正让它与顶级闭源模型并列的,是 Agent 和 Coding 成绩。官方数据显示,SWE-bench Pro 上它达到 61.7(Claude Opus 4.6 Max 为 53.4),OSWorld-Verified 为 84.3 对 72.7,AndroidWorld 为 81.9 对 62.0,CoWorkBench 为 70.7 对 68.2,LiveCodeBench v6 也达到 90.3。


社区横向测试也提供了直观参照。有开发者用相同 Prompt 让它与上一代 Qwen3.6-27B 生成同一场景,3.8 的完成度明显更高;与同体量的 Glimmer-30B 对比 Three.js 场景,用户同样把优势判给 Qwen。更有用户直接拿它与 Claude Opus 做同 Prompt 前端生成对比,至少在部分任务上,两者已可以放在一个画面里比较。



海外社区有人称它为“Opus at Home”,但最集中的争议也很明确:模型能力强,但推理时间太长;Benchmark 领先尚未完全转化成真实 Agent 体验。
问题首先出在默认推理强度。模型提供 xhigh、medium、low、none 四档,默认使用最高的 xhigh。Django 联合开发者 Simon Willison 做过一个典型测试:让它生成“骑自行车的鹈鹕”SVG,模型花了 21 分钟,产生 22,276 个推理 Token,输出仅 3,223 Token;关闭深度思考后,同一任务缩短到 137 秒。社区里类似反馈不少,有人让它写简单游戏,它先思考了半小时;有人接进 Coding Agent,一次任务跑掉数万 Token。


另一个需要降温的是“超 Opus”的说法。在更复杂的真实任务里,27B 的优势并不绝对。WildClawBench 的 60 项真实 Agent 任务中,Qwen3.8-27B 总分 48.0%,排名第 15,虽明显超过前代,但仍落后于一些更大的托管模型。

因此,它更准确的位置或许不是“本地 Opus”,而是:已证明 27B 开源模型有资格进入顶级闭源 Agent 的比较范围,但尚未证明能全面替代它们。
过去几年,本地模型一直有一个默认前提:隐私、便宜、可控,但能力要妥协。Qwen3.8-27B 第一次让这条分界线变得模糊——本地运行和前沿 Agent 能力正在变成可以同时追求的东西。
过去开源模型的叙事是“追上闭源”,而 Qwen3.8-27B 的叙事是“闭源能力以可部署的尺寸出现在本地硬件上”。追赶总是暂时的,能力下放则是结构性的:一旦被压缩进消费级硬件可承受的尺寸,它就不会再缩回去。
前沿 Agent 能力正在从云端下放到个人电脑,这才是 Qwen3.8-27B 真正值得被记住的原因。它也许不是最终答案,但它逼出了一个必须回答的问题:如果未来所有 27B 级别的模型都具备这种 Agent 能力,开发者的工作流、企业的部署策略、个人采购 GPU 的逻辑,是不是都要跟着重写一遍?
免费获取企业 AI 成熟度诊断报告,发现转型机会

关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断