首页 >科技
把高端AI门槛碾进尘埃:DeepSeek V4.1 Flash发布,推理账单又薄了一截
9月10日,DeepSeek正式发布V4.1 Flash模型。对普通用户来说,最直观的感受是生成速度更快了;对开发者而言,则是调用成本又往下走了一截。这次发布披露了更多基准测试细节,其中最值得关注的是它首次采用的非对称模型结构——官方称之为Causal-Encoder-Decoder,通俗讲就是把输入和输出拆成两块分别计算,输入侧只激活8B参数、输出侧激活16B参数,用多少算多少,不再为整模型的全量计算买单。
这种”小成本撬动大智能”的路线,直接反映在硬件开销上。官方称新架构把KV Cache对高带宽内存(HBM)的需求降到了上一代的四分之一,对固态硬盘(SSD)的需求降到八分之一。在Agent任务里,缓存开销往往占调用成本的大头,这一刀切下去,长链路任务的账单肉眼可见地变薄。同一天,V4.1 Flash还登陆了国家超算互联网中心,开发者在官网模型服务板块就能直接进入API调用界面。按照规划,从9月14日起,V4 Pro的接口会直接路由到Flash,按更便宜的那一档计费。

价格下探不是孤例。今年以来,国产开源模型的API报价一路走低,多家厂商把高端能力的单价压到过去的几分之一。OpenRouter最新数据显示,上一周全球大模型总调用量约115万亿Token,其中中国模型的周调用量达到56.72万亿Token,连续十九周超过美国、稳居全球第一;全球调用量前五里,四款来自中国。腾讯混元Hy4 preview以14.7万亿Token的周调用量登顶,环比暴涨379%。数字背后是一条清晰的曲线:从堆参数、拼榜单,到比谁更便宜、谁更能规模化落地,国产开源正在把”高端AI”的门槛一点点碾平。
便宜本身不是护城河,”越用越便宜”才是。过去硅谷闭源巨头靠按Token收高价维持利润空间,如今这套定价逻辑正被一条条填平。当推理成本降到中小团队也用得起的量级,AI应用会从”demo玩具”走向真实生产环境——客服、法务、研发辅助、数据分析,大量过去因为成本被卡住的场景会被重新打开。一家做电商客服的创业者算过账:同样的服务规模,上半年每月的模型账单要六位数,现在同样的活,账单薄了一大截,团队终于敢把AI铺到全部订单上。

行业基础设施也在同步铺路。9月7日,工信部印发《信息通信行业发展”十五五”规划》,提出到2030年智能算力规模达到9800 EFLOPS,部署万卡、十万卡及以上智算集群,并探索太空算力;同日开始实施的,还有最高法首部涉AI司法裁判规则《意见》,共24条,明确AI换脸、AI幻觉、自动驾驶的归责边界。模型更便宜、算力更充裕、规则更清晰,这三件事凑在一起,国产AI生态的话语权正在更快地向中国厂商集中。对普通用户和开发者来说,接下来能用到既强又省的AI工具,只会越来越多。
回望这一年,大模型竞争的重心已经悄悄转移。早几年大家比的是”谁的模型在某个榜单上多考了几分”,如今战场变成了”谁能让更多人在更低成本下用起来”。V4.1 Flash这类模型的真正意义,不在于它又刷新了哪项基准,而在于它把单位智能的价格继续往下推。当智能像水电一样可以按量取用,被改变的不只是几家公司的利润表,而是千千万万普通人把AI真正用进日常的方式。
