前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
洞察/09.09 · 00:00/5 MIN/编译自 象先志/0 阅读

DeepSeek测试新Flash:用智能密度重塑模型分层

DeepSeek开启V4.1 Flash内测并同步大幅降价,试图以更低成本和原生多模态能力替代Pro。当大模型推理能力普及后,兼顾速度与成本的“智能密度”正成为决定AI能否规模化落地的核心考题。

DeepSeek 最近给新版 Flash 出了一道题:能不能把自家的 Pro 替换下来?

随着 V4.1 Flash 中间版本开启内测,新模型结构、原生多模态能力与更快的推理速度成为主要卖点。而在配套的反馈问卷中,DeepSeek 直接向用户提问:“你觉得这个模型能全面替换线上的 DeepSeek V4 Pro 么?”

DeepSeek V4.1 Flash 内测问卷

这番“自己打自己”的测试,核心在于验证轻量模型能否在实际效果上媲美高阶版本,从而把大量日常调用转移到更经济的型号上。在价格方面,Flash 与 Pro 之间原本就有三倍差距。而 DeepSeek 还在开放平台下调了 Flash 系列价格,空闲时段缓存命中输入降至每百万 Token 0.02 元,未命中输入降至 1 元,输出降至 4 元,降幅分别达到 60%、33% 和 11%。

DeepSeek 开放平台降价公告

门槛下降的同时,DeepSeek 的诉求很明确:让 Flash V4.1 兼具 Flash 的高速低价与 Pro 的强悍性能。一年前,R1 让市场接受了为深度思考等待;如今,行业要回答的是:高阶推理能力如何才能被更频繁、更廉价地使用?

为什么“智能密度”开始变得关键

R1 走红的核心原因在于让深度思考触手可及。2025 年 5 月 DeepSeek 更新 R1 时,重点还在于“思考更深”——在 AIME 2025 测试中,平均每题推理消耗从 1.2 万 Token 增加到 2.3 万 Token,准确率也相应由 70% 提升至 87.5%。对于没有现成答案的难题,翻倍的等待与算力是值得的。

但在随后的技术报告中,DeepSeek 提出了新目标:提高推理链的“智能密度”(Intelligence Density)。因为为了达到顶级模型的输出质量,模型往往会生成过长的推理过程,拉长响应时间并推高成本。

在大小模型分工中,这个问题更加尖锐。小模型单步计算虽便宜,却往往要耗费更多步数才能获得大模型的效果。如果不能提高智能密度,单价优势就会被漫长的推理步骤抵消。

学界与工业界正将延迟纳入核心优化目标。DeepSeek 在 DSpark 论文中指出,在维持相同吞吐水平下,推测解码优化使单用户生成速度提升了 60% 至 85%,有效减少了验证浪费。

DSpark 架构设计

“能不能解决问题”与“用户是否愿意等待解决问题”正演变为两道不同的考题。研究场景可以为极难问题投入海量算力,而日常助手必须迅速响应持续的调用请求。

AI 智能体落地,核心在算总账

在实际的 Agent 工作流中,单价低并不等于最终成本低。有开发者测试接入新 Flash 制作停机维护页面,模型不仅识别出废弃规范、安排审查流程,还复用了仓库已有插画,执行表现亮眼,但整个任务多轮后台调用累计花费了 15.5 元。

Agent 的特点在于后台的多轮交互:查阅规范、搜索文件、修改代码并根据工具反馈反复验证。如果大量确定性的中间步骤也要交由模型反复决策,不仅会拉长耗时,还会迅速撑爆上下文窗口。

V3.2 工具调用推理保留机制

为了解决这一瓶颈,DeepSeek 开源了 Harness 框架,提出“Agent = Model + Harness”的架构。模型负责核心判断,Harness 提供工具与运行环境支持。其引入的 PTC 模式允许模型一次性写出程序脚本批量执行文件筛选与操作,仅把必要结果返回给模型,避免了中间过程的多轮冗余调用。结合此前的连续工具推理保留机制,系统大幅减少了重复分析带来的开销。

日常模型向上突破,旗舰模型负责攻坚

重新定义模型分层已成为行业共同趋势。Anthropic 发布的 Opus 5,同样主打以更低成本提供逼近前沿水平的智能,直接瞄准任务级总成本的优化。

这为下一代模型的演进指明了路径:当高阶能力逐渐下沉到轻量级模型,高端旗舰模型就必须转向更具挑战性的长周期任务。无论是应对持续数天的工程编码,还是复杂的端到端调研,旗舰模型需要承担完整责任,给出直接可用的最终成果。

这也印证了原生多模态与执行框架的价值所在——独立完成任务的 AI 必须看懂界面、审查图表,并依托稳健的运行环境自主排错。

对于大模型厂商而言,效率提升带来两重回报:减少单次任务计算可以摊薄成本,而在相同等待时间内实现更多有效推理,则能攻克更复杂的难题。Flash 负责让广泛的日常工作变得更划算,而 Pro 则必须证明自己在极复杂任务中值得用户付出等待。

标签:DeepSeek大语言模型推理AI 智能体

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

拒绝率清零,代价是拒掉 74% 的正常问题:安全对齐评测漏掉的另一半
置顶

拒绝率清零,代价是拒掉 74% 的正常问题:安全对齐评测漏掉的另一半

拆解 Claude 文本水印:不是绿名单,是锦标赛采样,以及它在中国合规里挡得住的那一半
置顶

拆解 Claude 文本水印:不是绿名单,是锦标赛采样,以及它在中国合规里挡得住的那一半

前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
NeoMME 拆解:单塔多模态编码器如何把视觉 RAG 索引压到每页 6 KB
置顶

NeoMME 拆解:单塔多模态编码器如何把视觉 RAG 索引压到每页 6 KB

//

24小时热榜

算力瓶颈转移:存储如何成为AI推理落地的胜负手
TOP1

算力瓶颈转移:存储如何成为AI推理落地的胜负手

研究发现:常用代糖木糖醇或使心脏病风险激增57%
TOP2

研究发现:常用代糖木糖醇或使心脏病风险激增57%

3

汉朔科技联手拓元智慧,具身机器人进驻全球7万门店

18小时前
汉朔科技联手拓元智慧,具身机器人进驻全球7万门店
4

手机破万、汽车下探:小米陷入业务割裂期

18小时前
手机破万、汽车下探:小米陷入业务割裂期
5

赵一鸣好想来缺斤短两背后:万店狂飙的系统性代价

18小时前
赵一鸣好想来缺斤短两背后:万店狂飙的系统性代价
6

英国裁员中国造车:捷豹路虎重构研发体系

18小时前
英国裁员中国造车:捷豹路虎重构研发体系
7

IFA喧嚣背后:中国AI硬件出海欧洲的冷思考

18小时前
IFA喧嚣背后:中国AI硬件出海欧洲的冷思考
8

大模型下半场:决策式AI如何切入产业核心业务

18小时前
大模型下半场:决策式AI如何切入产业核心业务
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断