DeepSeek开启V4.1 Flash内测并同步大幅降价,试图以更低成本和原生多模态能力替代Pro。当大模型推理能力普及后,兼顾速度与成本的“智能密度”正成为决定AI能否规模化落地的核心考题。
DeepSeek 最近给新版 Flash 出了一道题:能不能把自家的 Pro 替换下来?
随着 V4.1 Flash 中间版本开启内测,新模型结构、原生多模态能力与更快的推理速度成为主要卖点。而在配套的反馈问卷中,DeepSeek 直接向用户提问:“你觉得这个模型能全面替换线上的 DeepSeek V4 Pro 么?”

这番“自己打自己”的测试,核心在于验证轻量模型能否在实际效果上媲美高阶版本,从而把大量日常调用转移到更经济的型号上。在价格方面,Flash 与 Pro 之间原本就有三倍差距。而 DeepSeek 还在开放平台下调了 Flash 系列价格,空闲时段缓存命中输入降至每百万 Token 0.02 元,未命中输入降至 1 元,输出降至 4 元,降幅分别达到 60%、33% 和 11%。

门槛下降的同时,DeepSeek 的诉求很明确:让 Flash V4.1 兼具 Flash 的高速低价与 Pro 的强悍性能。一年前,R1 让市场接受了为深度思考等待;如今,行业要回答的是:高阶推理能力如何才能被更频繁、更廉价地使用?
R1 走红的核心原因在于让深度思考触手可及。2025 年 5 月 DeepSeek 更新 R1 时,重点还在于“思考更深”——在 AIME 2025 测试中,平均每题推理消耗从 1.2 万 Token 增加到 2.3 万 Token,准确率也相应由 70% 提升至 87.5%。对于没有现成答案的难题,翻倍的等待与算力是值得的。
但在随后的技术报告中,DeepSeek 提出了新目标:提高推理链的“智能密度”(Intelligence Density)。因为为了达到顶级模型的输出质量,模型往往会生成过长的推理过程,拉长响应时间并推高成本。
在大小模型分工中,这个问题更加尖锐。小模型单步计算虽便宜,却往往要耗费更多步数才能获得大模型的效果。如果不能提高智能密度,单价优势就会被漫长的推理步骤抵消。
学界与工业界正将延迟纳入核心优化目标。DeepSeek 在 DSpark 论文中指出,在维持相同吞吐水平下,推测解码优化使单用户生成速度提升了 60% 至 85%,有效减少了验证浪费。

“能不能解决问题”与“用户是否愿意等待解决问题”正演变为两道不同的考题。研究场景可以为极难问题投入海量算力,而日常助手必须迅速响应持续的调用请求。
在实际的 Agent 工作流中,单价低并不等于最终成本低。有开发者测试接入新 Flash 制作停机维护页面,模型不仅识别出废弃规范、安排审查流程,还复用了仓库已有插画,执行表现亮眼,但整个任务多轮后台调用累计花费了 15.5 元。
Agent 的特点在于后台的多轮交互:查阅规范、搜索文件、修改代码并根据工具反馈反复验证。如果大量确定性的中间步骤也要交由模型反复决策,不仅会拉长耗时,还会迅速撑爆上下文窗口。

为了解决这一瓶颈,DeepSeek 开源了 Harness 框架,提出“Agent = Model + Harness”的架构。模型负责核心判断,Harness 提供工具与运行环境支持。其引入的 PTC 模式允许模型一次性写出程序脚本批量执行文件筛选与操作,仅把必要结果返回给模型,避免了中间过程的多轮冗余调用。结合此前的连续工具推理保留机制,系统大幅减少了重复分析带来的开销。
重新定义模型分层已成为行业共同趋势。Anthropic 发布的 Opus 5,同样主打以更低成本提供逼近前沿水平的智能,直接瞄准任务级总成本的优化。
这为下一代模型的演进指明了路径:当高阶能力逐渐下沉到轻量级模型,高端旗舰模型就必须转向更具挑战性的长周期任务。无论是应对持续数天的工程编码,还是复杂的端到端调研,旗舰模型需要承担完整责任,给出直接可用的最终成果。
这也印证了原生多模态与执行框架的价值所在——独立完成任务的 AI 必须看懂界面、审查图表,并依托稳健的运行环境自主排错。
对于大模型厂商而言,效率提升带来两重回报:减少单次任务计算可以摊薄成本,而在相同等待时间内实现更多有效推理,则能攻克更复杂的难题。Flash 负责让广泛的日常工作变得更划算,而 Pro 则必须证明自己在极复杂任务中值得用户付出等待。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断