2026年9月的第一周,AI行业经历了一场前所未有的“密集发布周”。9月1日,Anthropic率先推出Claude Fable 5.1和Claude Mythos 5.1,主打编码、知识工作和长时间Agent任务。第二天,谷歌发布了Gemini 3.8 Flash和专攻网络安全的Gemini 3.8 Flash Cyber——距离上一代Gemini 3.7 Flash的发布仅过去三周,这已是Flash系列六周内的第三次迭代。紧接着,Meta祭出Muse Spark 1.3。9月4日凌晨,OpenAI正式发布新一代旗舰模型GPT-6 Astra,公司总裁格雷格·布罗克曼在发布会上宣告:“欢迎来到AGI时代”。Astra在多项基准测试中交出近乎满分的答卷——据OpenAI官方数据,FrontierMath Tier 4得分97.6%,ARC-AGI-3得分99.9%,ExploitBench网络安全测试更是拿到了100%。
参数在膨胀,上下文窗口在拉长,推理能力在攀升。几乎每一项指标都在告诉人们:大模型的技术能力正以前所未有的速度向上生长。
把目光从海外拉回国内,同样不乏重磅消息。就在7月,月之暗面发布了Kimi K3,总参数规模达到2.8万亿,采用稀疏混合专家架构,原生支持视觉理解,最高支持100万Tokens上下文窗口——这是当时全球参数最大的开源模型。Kimi K3在独立测评机构Artificial Analysis的智能排名中位列第三,发布后迅速引发全球AI行业和科研机构的广泛关注。
然而,当目光从实验室和发布会转向真实的商业世界和日常生活时,另一幅图景却悄然展开。
热与冷的温差
先看一组数字。麦肯锡2025年全球调研显示,约88%的企业已在至少一项业务职能中应用AI,但真正带来可衡量利润贡献的仅约39%;MIT NANDA同期发布的报告则指出,约95%的企业级生成式AI试点未能在短期内产生可衡量的经营回报。Gartner调研则更为直接——全球超九成企业已启动生成式AI试点,但真正跨入生产环境、形成规模化价值的项目仅约41%。更聚焦到代理式AI(Agentic AI),目前仅有16%的企业将其部署至生产环境,较2025年的9%仅提升7个百分点。
这些数字指向同一个结论:企业的AI尝试很普遍,但能跑通、能赚钱的,寥寥无几。
IDC预测,到2026年,50%的AI驱动数字化应用场景将无法达到ROI目标。而Gartner的另一项调研则显示,仅11%的CFO在2025年看到了AI带来的实际财务价值,真正通过AI实现营收增长的中国企业仅有8%。
技术的热浪与商业的冷静之间,横亘着一道巨大的温差。
被吞噬的护城河
这种温差并非凭空而来。一个值得深思的现象是:大模型的能力越强,围绕它搭建的应用生态反而越显贫瘠。
在ChatGPT刚问世的阶段,市场涌现了大量以“填补模型缺陷”为商业逻辑的AI应用——法律科技公司通过专业数据库降低模型幻觉,医疗咨询应用通过二次校验提升可靠性,营销文案工具依靠精心设计的提示词链生成内容。这些应用无一例外地抓住了大模型早期的能力短板,用工程化手段在模型的软肋处搭建起临时的支撑结构。
然而,随着模型迭代加速,这些护城河正在快速崩塌。GPT-4抹平了法条引用的精度差距,Claude在推理能力上的持续优化,也让医疗问诊等专业场景的可靠性明显提升,上下文窗口从几千个token扩展到百万级别后,那些依赖外部记忆机制的文案工具发现自己精心维护的壁垒变得毫无用武之地。应用层价值难成规模的困境,同样体现在宏观数据上——牛津大学研究团队发布的报告显示,全球AI年度投资总额已超过4000亿美元,但仅有约33%的企业成功将AI项目从试点推向规模化应用。
更令人担忧的是用户层面的变化。应用商店里标榜“AI驱动”的独立应用数量仍在增长,但月活用户超过百万的头部产品仍然是少数,大量应用上线不久便陷入用户流失与收入停滞。不少用户更换主要AI工具的动因,大多是“听说新的模型效果更好”,而非“新应用解决了老应用做不到的事”。
用户没有忠诚度,因为所有AI产品长得越来越像——清一色的对话框加输入框。当交互方式趋同、底层能力来自同一批大模型时,应用层的独立价值究竟在哪里?
结构性困局
如果说应用层的困境只是表象,那么更深层的问题藏在企业AI落地的结构性障碍中。
高昂的成本首当其冲。大模型训练所需的算力资源、数据中心背后的电力和用能支出,最终都会叠加到企业身上。虽然DeepSeek等公司已经在努力降低训练成本——2025年DeepSeek把R1系列强化学习等后训练的总成本压到了约29.4万美元——但推理成本依然是规模化应用的门槛。以谷歌最新发布的Gemini 3.8 Flash为例,虽然其现行推广价仅为每百万输入token 0.75美元、输出3.75美元(2027年起将上调至1.5美元和7.5美元),远低于Claude Opus 5的5美元和25美元,但对于需要大规模调用API的中小企业而言,这笔开支依然不容小觑。高端算力供给不足、应用成本高昂,仍是显著的壁垒。
其次是数据的质量困境。Gartner调研显示,仅有4%的企业自评拥有AI就绪数据,多数企业的数据仅为传统业务记录,缺乏结构化语义与业务场景适配。数据“可见不可用”,成为企业AI落地的一大堵点。
更深层的问题在于模型本身的认知局限。中数睿智发布的《因果世界模型技术体系蓝皮书》指出,当前多数AI模型停留在“因果之梯”的关联层,擅长回答“是什么”,但难以推演“干预后会怎样”。在油气、电力、高端制造等零容错的核心产业场景中,缺乏因果逻辑与推演能力的AI输出,无法满足严谨的决策要求。这正是大量AI项目“可用但不敢用、落地不深耕”的核心原因。
Gartner高级研究总监孙鑫对此有一个精辟的概括:顶尖AI模型每1.5至3个月完成一轮能力迭代,但企业承接AI、转化业务价值的能力并未同步增长。技术供给与企业落地需求之间,存在着严重的“影响力鸿沟”。
泡沫与沉淀
2026年上半年,一批曾被资本热捧的AI应用正在陆续退场。OpenAI宣布停用上线仅半年的Sora视频生成器;融资3300万美元的AI模型评测平台Yupp.ai宣布关停;Google开始收缩内部AI应用线。
这些退场并非全无价值。它们共同暴露出同一个问题:当底层模型继续升级,应用层到底有没有形成足够厚的独立价值。那些只靠模型红利撑起来的应用,正在失去继续独立存在的理由。
但泡沫的破裂并不意味着故事的终结。事实上,这更像是一场必要的出清——把那些“白牌化”大模型能力、仅靠界面包装的应用清理出去,让真正有价值的应用浮出水面。
中国信通院在2025年底的行业观察中提到,技术的不断迭代为大模型实用化打下坚实基础,而智能体正成为大模型应用落地的主要形式。GPT-6 Astra已经展示了一个直观的可能性——据OpenAI公布的数据,在OSWorld 2.0的离线评测中,Astra的计算机使用性能达到72.6%,每任务耗时约40分钟,比GPT-5.6 Sol的65.7%和75分钟实现了显著提升。当模型能够独立完成填写在线表格、更新CRM记录、整理日程、分析科学数据、创建网站等一系列任务时,应用层的形态势必会被重新定义。
从“智能助手”走向“数字员工”,从单点工具走向自主协作的智能体群体——这条路还很漫长,但方向已经开始清晰。
模型还在变强,这是事实。2026年9月仅仅过去了四天,就有四家海外巨头轮番上阵。但AI能真正闭环交付的问题范围扩大的速度,明显慢于模型能力的增长。缩小这个差距,让技术的狂奔真正转化为生产力的跃升,或许才是AI下半场最值得期待的命题。