财联社7月22日讯 瑞银在最新研报中指出,当前AI产业正同时经历两项重要变化:企业开始系统性压缩Token成本,以及工作负载加速转向更便宜的开放模型。

但这并不意味着AI需求减弱,而是资金和算力需求正从“无差别使用最强模型”,转向根据任务难度、成本、速度和数据安全进行精细配置。
开放模型崛起不会终结AI交易,但可能重塑模型厂商、芯片公司、云计算平台和软件企业之间的价值分配。
瑞银本次报告主要基于其私人AI与软件(Private AI & Software)大会上的一手反馈。该活动共邀请75多家私人公司,报告重点整理了15家以上AI原生企业的观点,涉及AlphaSense、Cursor、Fireworks、Glean、Harvey、Perplexity、Runway、Sierra等公司。
由于这些公司普遍同时调用多家第三方模型,因此能够较直接地观察企业模型份额和使用方式的变化。
开放模型崛起
近一个月,开放模型对AI产业链的影响成为科技投资者最关注的问题,主要由三个因素推动。
其一,智谱的GLM 5.2、月之暗面的Kimi K3等中国开放模型,在公开基准测试中的表现已接近OpenAI和Anthropic的高端模型。
其二,OpenRouter等第三方数据显示,中国开放模型的使用份额明显提升。
其三,OpenAI以及优步(Uber)、Coinbase等企业均开始公开讨论AI成本问题,部分企业已设置预算和使用限制,以控制意外飙升的Token开支。
这意味着企业对于AI模型的选择正从单纯追求性能,转向同时考虑价格、速度、Token效率和部署安全。
企业AI采用仍在高速增长
瑞银强调,企业并没有因为成本上升而停止部署AI。相反,多家AI原生企业过去半年收入增长极快。
报告列举了部分匿名案例,有企业收入从今年1月的4亿美元升至10亿美元,有企业年内收入增长至原来的3倍并突破5亿美元,还有公司在14个月内从零增长至5亿美元,另有企业年度经常性收入达到5亿美元,同比增长超过7倍。
收入加速主要来自模型能力提升、Token消耗更高的智能体应用扩张,以及部分公司从按席位收费转向按Token或使用量收费。这表明企业AI需求已经从编程领域扩展到更广泛的业务流程,对AI基础设施和算力供应商依然构成积极信号。
然而,伴随采用规模扩大,成本问题迅速浮出水面。
瑞银此前估计,约60%的机构已将AI计算和Token支出视为现实问题,此次调研后认为这一比例可能更高。
报告中的案例显示,Token成本上涨速度十分惊人:
某金融机构最初对Claude承诺支出1000万美元,三个月后已增至6000万美元;
一家AI公司的Anthropic支出由去年12月的2万美元,增至今年7月接近100万美元,七个月增加50倍;
部分企业的Token账单在短时间内增长10倍甚至100倍。
智能体应用尤其容易放大消耗,因为一次任务失败后会调用其他智能体再次尝试,形成“Token产生更多Token”的循环。
部分部门在AI上的支出甚至已经超过其员工薪酬,但企业同时还在增加招聘,说明AI短期内不一定直接减少人工成本,反而可能创造更多需要人类管理和检查的工作。
从“Token最大化”转向“价值最大化”
企业并不是停止使用AI,而是在减少浪费。
大量普通任务此前也被交给最昂贵的前沿模型。例如,某银行每月花费数十万美元调用高价模型,但员工使用场景包括查询天气、餐厅和会议地点,这些任务显然不需要最高等级的推理能力。
因此,企业AI管理的重点正由“Token最大化”转向“价值最大化”,即衡量每一单位Token能够产生多少业务回报。
高价值的编程、复杂推理和核心业务流程仍会调用OpenAI、Anthropic等前沿模型,而邮件撰写、数据提取和普通总结等任务,则更多转向便宜、快速的开放模型。
模型路由也由可选功能变为基础能力。AI应用可以把一项大型任务拆分为多个环节,再将不同子任务分配给最合适的模型。企业还可根据岗位、预算、合规和数据主权要求,限制员工能够使用的模型。
所谓模型路由,是根据任务难度、成本、延迟和合规要求,自动选择最合适的模型。
一家受访企业称,通过将30%至40%的支出转向自有低成本模型,并结合自动路由,客户平均可节省20%至30%的成本。
不过,瑞银认为,当几乎所有AI企业都开始宣传模型路由时,这项能力将迅速成为行业标配,未必能够单独形成长期商业化优势。真正的竞争还包括模型调用框架、任务拆分、Token监控以及企业级权限管理。
中国开放模型进入企业主流选择
GLM、Kimi、DeepSeek和Qwen等中国开放模型的性能和成本优势,是此次产业变化的另一条主线。
报告称,部分开放模型已经接近高端前沿模型的能力,但成本可能只有后者的三分之一至四分之一。
据AI初创公司Baseten估计,开放模型的性能通常落后闭源前沿模型约90天,但运行成本可低70%至90%。
一家AI企业称,今年初开放模型在其企业客户中的Token份额仅约0.1%,两个月后升至约1%,目前已经超过两位数,并预计未来12个月可能超过90%。
不过,这只是单家公司的判断,而且指的是Token数量,而非收入份额。即使前沿模型只处理少量Token,只要这些任务足够关键,OpenAI和Anthropic仍可能拥有较强定价权。
另一方面,企业对中国模型的接受度也并不一致。部分受监管行业仍拒绝使用中国模型,但亚马逊和微软通过AWS、Azure提供受控访问,有望降低企业使用门槛。
与此同时,美国企业也希望出现更多本土开放模型。
英伟达Nemotron在此次调研中被多次提及,反映其影响力较六个月前显著提升。除通用模型外,企业还开始根据内部数据训练专用模型,这推动Fireworks、Baseten和Together AI等“推理平台”崛起。
Fireworks披露,其收入已从今年1月的4亿美元升至超过10亿美元,每日处理超过40万亿个Token;Baseten每日处理约30万亿个Token;Together AI则称,开放模型的Token使用份额一年内从10%升至30%。
英伟达与云厂商或是主要受益者
开放模型份额上升并不意味着算力需求减少。
瑞银认为,需求只是从昂贵模型转向性价比更高的模型和工作负载。大多数开放模型仍使用英伟达硬件进行训练、微调和推理,而低成本模型能够扩大AI应用范围,增加推理计算、存储、网络和部署基础设施需求。
月之暗面因Kimi需求接近算力上限而暂停新增订阅,Databricks也表示亚洲等地区GPU供应紧张。瑞银因此认为,开放模型的普及对英伟达总体偏利好,尤其是其拥有Nemotron模型和开放模型软件生态优势。
AWS、Azure和Google Cloud同样已经成为多模型平台。无论客户最终使用闭源模型、开放模型还是定制模型,通常仍需要云端算力。模型单位成本下降还可能刺激更多企业采用AI,从而扩大云基础设施需求。
风险在于,如果OpenAI或Anthropic收入增长显著放缓,其新增算力需求可能下降;云厂商通过模型API获得的增量收入也可能受到影响。
不过,目前云计算平台和GPU云厂商仍面临明显的供不应求,瑞银尚未观察到GPU现货价格走弱,因此认为相关风险总体可控。
前沿模型和传统软件面临压力
对OpenAI、Anthropic等前沿模型厂商而言,长期市场空间仍然庞大,但短期收入增速可能受到Token优化影响。此前用于普通任务的高价模型调用一旦转向便宜模型,必然拖累收入增长。
瑞银将当前情况与2023年至2024年的云计算优化周期类比。当时企业压缩疫情期间过度扩张的AWS、Azure、Snowflake和Datadog支出,相关公司经历了超过四个季度的增长放缓。不同之处在于,AI产业仍处于更早的发展阶段,新增应用场景可能抵消成本优化带来的压力。
传统软件公司的处境可能更加复杂。
一方面,它们可以利用多模型和自动路由降低AI成本;另一方面,企业可能为了支付不断上升的AI账单而压缩应用软件席位、外部IT服务和其他技术预算。
与此同时,OpenAI和Anthropic可能加速向软件应用层扩张,与Salesforce、ServiceNow和Workday等公司直接竞争。企业自行训练专用模型的趋势,也可能削弱部分通用软件产品的价值。