DeepSeek 开启 V4.1 Flash 中期版本内测,并调研其全面替代在线 V4 Pro 的可行性。同时 Flash 系列 API 大幅降价,最高降幅达 60%,标志着大模型竞争正转向性价比更高的“智力密度”。
DeepSeek 正在主动对其既有的模型分级与定价体系发起冲击。
近期,DeepSeek 低调开启了 V4.1 Flash 中期检查点(Checkpoint)的小范围灰度测试。在面向测试用户的问卷中,DeepSeek 直接抛出了一个核心问题:新版 Flash 是否已经能够全面替代现有的在线 V4 Pro?
据了解,该测试版本采用全新架构,引入了原生多模态支持,在综合能力、生成速度与推理成本上均较此前的 Flash 版本有明显改善。测试期间,该模型遵循当前 V4 Flash 的计费标准,单账户限制 20 个并发请求。早期参与测试的开发者反馈,新模型在代码编写与信息检索任务上的生成速度提升尤为显著。
几乎在同一时间,DeepSeek 宣布下调 Flash 系列的价格。调整后,闲时缓存命中输入价格降至 0.02 元/百万 Tokens,未命中输入为 1 元/百万 Tokens,输出为 4 元/百万 Tokens;忙时价格为闲时的两倍。其中,缓存命中输入的降幅最高达到 60%,该优惠同时覆盖 Flash 主模型及其视觉实验分支。
长期以来,Flash 与 Pro 之间存在着清晰的价格鸿沟。在以往的忙时费率下,Flash 的输出定价为 9 元/百万 Tokens,而 Pro 的价格则高出数倍。开发者通常愿意为高难度、复杂的任务承担高昂溢价。但眼下的关键在于:如果一个速度更快、能力更强的 Flash 模型能够承接绝大多数中日常与中等难度的任务,那么昂贵的旗舰版(Pro)是否只需要保留给极端复杂的极端场景?
这一调整背后,对应着 DeepSeek 内部反复强调的核心指标——智力密度(Intelligence Density)。
早期的推理模型证明了更长的思维链可以提升难题的准确率。但随后的技术探讨迅速转向:是否可以用更少的 Token 和更短的时钟时间达到相同的解答质量?一个能在更少中间计算步骤下快速得出有效答案的模型,无论从用户体验还是单次调用成本来看,都具备明显优势。
在 AI 智能体(Agent)工作流爆发的背景下,这一算盘变得更加现实。在多轮工具调用、文件读取和自我纠错的过程中,单个用户请求往往会催生数十次底层模型调用。如果步骤成倍膨胀,单 Token 价格即便再低,累积下来的任务总成本依然惊人。因此,让模型能用更精炼的步骤规划工具、在跨步骤中保留有效推理,其价值不亚于单纯的模型权重升级。
类似的分工重构正在各大前沿实验室上演。当中端模型以极低的成本逼近上一代旗舰模型的实际表现时,旗舰模型必须用更高门槛、更长周期且高价值的任务来证明自身的溢价合理性。顶尖大模型的竞争焦点,正从各类通用基准测试的微小跑分差异,转向驱动长达数小时乃至数天的复杂 Agent 任务并确保可靠交付。
对于 DeepSeek 而言,本次测试是一次试水。如果打磨后的 V4.1 Flash 能够稳定接盘用户此前分流给 Pro 的大部分工作,公司便能将大批日常调用导向更低成本的轻量层级,从而将核心算力与研究资源集中投入更深层的算法突破中。让高质量的推理变成日常高频的工具,而非偶尔为之的昂贵尝试,这正是当下大模型演进的明确信号。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断