阿里开源 Qwen3.8-27B 实测显示,标准部署下 vLLM 与 SGLang 吞吐均超 40 token/s,3bit-6bit 量化质量稳定,但接入 Agent 后 9 个任务烧掉近 1400 万 token,耗时 6 小时 17 分钟。模型能力逼近顶级闭源,却暴露任务拆分过重、上下文反复回灌的问题,开源底座落地仍需工程约束。
8 月 14 日,阿里 Qwen 团队开源 Qwen3.8-27B。社区很快从“能不能跑”转向“是不是新的斩杀线”,有人称它为“本地 Opus”,也有人认为它在部分代码和 Agent 任务上已经逼近顶级闭源模型。一个 27B 的开源 dense 模型,实际体验到底如何?

Qwen3.8-27B 拥有 27B 参数、Apache 2.0 许可、262K 原生长上下文,可扩展到 100 万 token,支持视觉理解,默认开启思考模式。官方定位是面向代码、专业工作、研究和长程 Agent 任务的本地开源模型。我们在一台 A100 服务器上,从标准部署、量化部署和 Agent 接入三个维度做了测试。
测试题目分为三类:直接推理题、指令跟随与事实校验题、接入 Agent 后的长上下文与文件生成任务。质量评分采用 0 到 2 分制,分别统计质量、吞吐、显存、耗时和 token 消耗。

标准部署对比了 vLLM、SGLang 和 Llama.cpp。vLLM 在 7 道题上拿到满分 14/14;SGLang 和 Llama.cpp 各有约束执行问题,比如 SGLang 的表格推理分析不够完整,Llama.cpp 写新闻稿时把约 800 字的要求写到了 1400 字。速度方面,vLLM 和 SGLang 平均吞吐分别为 41.77 token/s 和 40.06 token/s,Llama.cpp 只有 23.50 token/s。显存数据解释了差异:vLLM 和 SGLang 在两块 A100 上利用率接近 100%,Llama.cpp 只占用约 34GB 显存,GPU 利用率徘徊在 46%-53%。框架能否榨干 GPU 算力,是速度拉开差距的核心。

量化测试用 Llama.cpp 跑 2bit 到 16bit 的 GGUF 版本。文件体积从 7.27GB 到 54.7GB 不等。3bit、4bit、5bit、6bit 在 7 道题上全部拿到 14/14;2bit 和 8bit 都是 13/14,问题出在时间线校验——模型先识别出日期矛盾,修正时又把原错误写了回去;16bit 也是 13/14,但扣分变成了篇幅失控。
速度随比特数下降而提升:2bit 为 47.89 token/s,3bit 为 44.68,4bit 为 39.45,16bit 降到 23.50。显存占用也从 2bit 的约 14GB 上升到 16bit 的约 34GB。综合来看,文本任务中 3bit 到 6bit 是更稳的区间;2bit 最省最快,但已经出现事实修正错误;8bit 和 16bit 也没能靠更高精度完全规避问题。

Agent 测试把本地模型接入 DeepSeek Harness,用本地部署的 DeepSeek-V4-Flash-0731-Q4 做对照,任务从组合推理、新闻写作一路压到论文综述和 3D 网站生成。Qwen3.8-27B 质量得分 18/18,DeepSeek 为 14/18。在“颐和园 · 昆明湖与万寿山”3D 网站任务中,Qwen 生成的页面包含湖、山、佛香阁、桥和日景/暮色切换,基本可交付;DeepSeek 虽然搭好了框架,主画面却基本为空,主体元素没有渲染出来。

但质量优势的代价极高。Qwen 完成 9 个任务消耗 13,995,350 token、197 次请求,总耗时 22,564.37 秒(约 6 小时 17 分钟);DeepSeek 仅用 956,630 token 和 1,343.75 秒(约 22 分钟)。换算下来,Qwen 的总 token 是 DeepSeek 的 14.6 倍,总耗时是 16.8 倍。仅 A9 一个任务,Qwen 就烧掉 11,533,959 token,而 DeepSeek 只用了 161,019 token。
拆解日志后,问题更加清晰。Qwen 在 A1-A7 的思考时间占比约 55.6%,思考 token 占比 60.7%,意味着还没开始输出,一半以上资源已经花在内部推理上。A9 任务中,Qwen 拆出 75 个 step、124 次请求,DeepSeek 只有 8 个 step、15 次请求。Qwen 的步骤更多,但很多 step 目标仍然过重,上下文反复回灌,最终把输入 token 推到 DeepSeek 的 548 倍。换句话说,Qwen 更像是在“深思”而非“高效执行”,大量时间消耗在不可见的空转上。

官方模型卡显示,Qwen3.8-27B 相对前代的提升集中在更接近真实工作流的任务上:Terminal Bench 2.1、SWE-bench Pro、NL2Repo-Bench 等终端编码和软件工程指标明显提升,CoWorkBench、JobBench、Agents' Last Exam 也同步上涨,IFBench 从 69.1 涨到 79.5。这说明模型不只是单轮能力变强,而是读任务、规划步骤、调用工具和持续修正的整个 Agent 能力栈更完整,视觉理解和 computer use 能力也保留了下来。

如果只是本地部署,追求吞吐选 vLLM 或 SGLang,追求低门槛选 Llama.cpp;量化版本里 3bit 到 6bit 是文件体积、速度和质量的最佳平衡点。从开源角度看,Apache 2.0 许可的 27B dense 模型能在部分测试中与 Claude Opus 4.6 Max 同台竞技,对社区和私有化部署都是利好。
免费获取企业 AI 成熟度诊断报告,发现转型机会
但模型能力强不等于 Agent 适配好。Qwen3.8-27B 在复杂任务中表现出任务拆分过重、完成标准不清晰、上下文反复回灌的问题,导致大量 token 和时间空转。它更适合被看作一个“能力很强、但需要工程约束的开源底座”,用在质量优先、可控性和私有化的场景中,而不是替代一切模型。

关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断