据行业内部消息,人工智能大模型领域正经历一场前所未有的变革,DeepSeek凭借其颠覆性的定价策略和技术创新,成为这场变革的核心驱动力。该公司近期宣布启动第二轮融资,目标募资规模达500亿元,投前估值已飙升至5000亿元,距离其完成首轮500亿元融资仅过去两个月。首轮融资后,其投后估值突破3500亿元,创下国内大模型行业融资纪录。
支撑其估值跃升的关键,在于DeepSeek重新定义了大模型行业的成本标准。第三方权威测试机构Artificial Analysis的最新数据显示,在完成相同基准测试任务时,DeepSeek V4-Flash的平均成本仅为3美分,而Anthropic的旗舰模型Claude Fable 5需3.15美元,GPT-5.6 Sol也高达1.86美元。这一数据意味着DeepSeek的成本优势达到百倍量级,同时其输出速度达113tokens/秒,较Claude Opus 5的74tokens/秒提升近50%。
技术层面,DeepSeek通过创新架构实现极致效率。V4-Flash模型虽拥有2840亿参数,但每次推理仅激活130亿,不足总量的5%。其独创的CSA(压缩稀疏注意力)与HCA(重度压缩注意力)混合架构,模拟人类记忆规律,对不同时间维度的信息采用差异化精度处理。这种设计使百万token上下文下的单token计算量较前代降低90%,KV缓存需求减少93%,且上下文越长优势越显著。
训练方法论的突破同样关键。DeepSeek采用两阶段后训练体系:第一阶段通过"分科培养"让数学、代码等领域的专家模型独立进化,运用GRPO强化学习技术替代传统PPO算法,在省略价值函数模型训练的同时提升效果;第二阶段通过"融会贯通"策略,利用在线策略蒸馏技术将多领域能力整合至单一模型,确保专项能力不因整合而退化。这种训练方式使Terminal Bench 2.1测试得分从61.8分跃升至82.7分,GitHub真实Issue解决能力基准DeepSWE得分暴涨645%。
成本革命正在重塑企业AI采购逻辑。以日均100万次API调用为例,采用Claude的年成本达1.13亿元,而DeepSeek仅需1095万元,差距超十倍。这种量级差异迫使企业重新评估模型部署策略,模型路由(Model Routing)概念应运而生。企业开始将高风险任务(如金融分析、法律审查)分配给旗舰模型,而将标准化作业(如数据清洗、客服响应)转向高性价比模型。Menlo Ventures调研显示,37%的企业已在生产环境部署5个以上模型,LMSYS团队研究证实智能路由可削减85%成本。
行业格局呈现明显分化趋势。Artificial Analysis绘制的模型性价比坐标系显示,DeepSeek V4-Flash正式版划出的"斩杀线"将全球70%模型纳入淘汰区,即便调整推理强度仍无法突破成本壁垒。当纳入V4-Pro正式版性能预测(输入缓存命中价降至1元/百万token)后,被淘汰模型比例升至90%,包括GPT-5.6和Fable 5等中间价位产品均面临生存危机。
技术生态的扩张进一步巩固DeepSeek的竞争优势。其自研的Agent运行时框架Harness已完成内测,该框架深度绑定V4系列模型,通过优化上下文组织、错误处理和任务规划等环节,显著提升Agent任务执行效率。测试数据显示,使用Harness的V4-Flash在代码生成任务中,token浪费率降低30%以上。随着Harness与V4-Pro正式版同步上线,行业性价比标准或将再次被重新定义。
这场变革正推动大模型市场向"哑铃型"结构演变:一端是聚焦极限智能的旗舰模型,另一端是作为AI基础设施的DeepSeek生态,中间价位产品面临被挤压出局的风险。企业AI战略从"模型选择"转向"任务分配",技术提供商的竞争焦点也从参数规模转向综合成本效率,整个行业进入价值重构的新阶段。




