登录
注册
据 Woofun AI 消息,2026 年 6 月 AI 模型市场在短短三周内呈现出两种截然相反的经济逻辑,OpenRouter 与 Cognition 分别发布的 Fusion Router 和 Devin Fusion,标志着行业对多模型协作价值的认知发生根本性分化。前者试图通过并行计算突破性能上限,后者则致力于在保持前沿表现的同时大幅削减成本,这种反差揭示了 Model Fusion 并非通用的技术升级方案,而是一种仅在特定条件下具备经济合理性的昂贵保险。市场正在迅速从盲目追求模型堆叠转向精细化的成本效益评估,真正决定产品生死的关键变量不再是单纯的准确率提升,而是单位结果成本与延迟控制的平衡能力。
这一趋势表明,狭义的模型融合架构正面临严峻的商业验证挑战,其生存空间被压缩至低频、高价值且缺乏外部验证器的尾部任务领域,而非成为主流应用的默认基础设施。
OpenRouter 于 6 月 12 日推出的 Fusion Router,其核心卖点建立在 "Surpassing Frontier Performance with Fusion" 的承诺之上,通过 DRACO 深度研究评测展示其技术可行性。在该评测体系中,由 Fable 5 与 GPT-5.5 组成的模型组获得了 69.0 分的高分,显著超过了 Fable 5 单模型运行的 65.3 分表现。
这一策略的逻辑基础在于,当单一模型的能力触及瓶颈时,引入多个模型对同一问题进行并行作答,再由评审模型进行比较与综合,有望挖掘出更优解。OpenRouter 的设计哲学是'以计算换上限',即通过增加候选答案的数量和多样性,来提高捕捉正确答案的概率。
这种模式在理论层面具备吸引力,特别是在面对复杂推理或多跳查询任务时,多视角的碰撞可能激发出单模型无法触及的思维路径。然而,这种提分并非无代价的魔法,它直接依赖于高昂的算力投入和复杂的编排逻辑。评测数据的背后,隐藏着对计算资源的大量消耗,以及对评审模型判断能力的极高依赖。
如果评审模型无法准确识别哪个候选答案更优,或者候选答案之间缺乏实质性的信息差异,那么这种'超越'就仅仅是数字游戏,无法转化为实际的生产力提升。因此,OpenRouter 的方案虽然证明了 Fusion 在特定基准测试中的有效性,但其经济可持续性仍存疑,特别是在成本敏感的企业级应用场景中,这种以倍数级增加计算量来换取小幅提分的做法,往往难以通过 ROI 审查。
相比之下,Cognition 于 6 月 29 日发布的 Devin Fusion 采取了完全不同的技术路线,其标题 "Frontier Performance at 35% Lower Cost" 直接击中了当前 AI 应用落地的痛点。Devin Fusion 并未采用让多个模型重复完成整项任务的策略,而是引入了动态切换机制,将任务分解为规划、判断、执行等不同阶段。前沿模型仅负责高价值的规划和关键环节的判断,而将测试、机械修改等低价值工作委派给更便宜的 sidekick 模型。
这种动态路由与任务委派策略,本质上是对计算资源的精准分配,旨在减少昂贵计算的冗余使用,同时守住原有的质量底线。通过这种方式,Cognition 试图在性能与成本之间找到更优的平衡点,避免为那些可以通过低成本模型解决的任务支付溢价。
这一方案反映了市场对'效率'而非'绝对智能'的追求,特别是在企业级应用中,成本控制往往是决定技术采纳与否的首要因素。Devin Fusion 的成功案例表明,通过智能调度模型资源,可以在不牺牲最终结果质量的前提下,显著降低整体运营成本。
这种模式不仅提升了系统的经济性,还增强了其可扩展性,使其能够适应更大规模的业务流量。因此,Cognition 的路径更接近于长期可持续的商业模型,它不再将 Fusion 视为一种独立的架构范式,而是作为动态路由策略中的一个优化选项,仅在必要时调用高价模型,从而实现了成本与性能的双赢。
面对相同的质量缺口,市场目前存在四种主要的购买策略,每种策略在经济逻辑上各有侧重。第一种是直接升级到更强的单模型,这是最简单且易于审计的方式,只要高端模型的边际提价低于错误或返工成本,这通常仍是首选方案。第二种是在同一个模型上增加测试时计算,例如延长推理时间、使用 self-consistency 或多次采样,以换取更高的稳定性。
第三种是路由、级联和任务委派,先用便宜模型处理可验证或机械性的部分,只有遇到困难才升级,这种方式已被证明能显著降低成本。第四种才是狭义的 Model Fusion,让多个模型对同一问题重复作答,再由评审和综合模型形成最终答案。这四种方式都能 "用更多计算换质量",但区别在于计算花在哪里。单模型扩展购买更深的推理,路由购买更准确的资源分配,Fusion 则购买更多候选答案。
前三种方法把预算集中在最可能改变结果的环节;Fusion 却先为重复意见付费,再赌评审模型能从中找出有效差异。路由已经证明,模型之间的能力差异首先是一项调度机会。RouteLLM 在部分评测中把成本降低超过 2 倍而不损失质量;Switchcraft 以 82.9% 的准确率实现 84% 的成本下降,按论文测算,每百万次请求可节省超过 3,600 美元。结果仍需在企业自己的流量上复现,但经济逻辑很直接:不必让多个模型开会,只需把每项任务交给最便宜的合格模型。
这意味着,市场会先用升级、路由和验证解决质量缺口;只有当这些方法仍然不够时,才有理由为 Fusion 购买更多候选答案。
Woofun AI 整理数据显示,Fusion 的成本账本揭示了其提分背后的巨大算力代价。OpenRouter 的 DRACO 评测显示,Fable 5 + GPT-5.5 从 65.3 分升至 69.0 分;Opus 4.8 自融合从 58.8 分升至 65.5 分;低成本三模型组从 60.3 分升至 64.7 分。但 Opus 自融合的提升更大,说明收益可能来自额外搜索和采样,而非跨模型知识互补。
公平对照应比较相同 token 预算下的 self-consistency、更长推理和强单模型。现有研究也显示:多智能体在约 20 倍计算量下最多提升 7.1 个百分点;预算相同时,debate 和 Mixture of Agents 仅比 self-consistency 高 1.3 和 2.7 个百分点,另一项等 reasoning-token 研究则发现单 agent 持平或更优。
不少 "协作收益" 会在计算账对齐后消失。OpenRouter 默认 3 模型 panel 的成本约为普通生成的 4-5 倍,速度慢 2-3 倍,但没有披露各 DRACO 配置的完整 token、成本和延迟,无法判断 3.7 分提升是否值得。评测也只有 100 个纯文本英文任务,Fable 相关配置只完成 93 项;更换评审模型可让绝对分数移动 10-25 个百分点。
它证明了 Fusion 能提分,没有证明 Fusion 改善了生产 ROI。选择性调用只能摊薄成本。按 OpenRouter 披露的区间估算,触发率为 1% 时,整体成本约为 1.03-1.04 倍;10% 时为 1.30-1.40 倍;25% 时已达 1.75-2.00 倍。这表明,除非 Fusion 仅在极少数极端情况下被触发,否则其成本优势将迅速被侵蚀,特别是在高并发场景下,这种成本结构难以维持竞争力。
延迟与风险是选择性调用 Fusion 下的另一大系统瓶颈。最难的请求最可能触发 Fusion,系统却必须等待最慢的 panel 成员,再串行完成评审和生成,因此尾延迟集中在最有价值的任务上。多供应商调用还扩大故障面、审计复杂度和隐私暴露。Fusion 的成本不只是 API 价格,也包括等待时间和新增的系统风险。在实时性或高吞吐要求严格的场景中,这种延迟是不可接受的。
此外,引入多个模型意味着需要管理更多的 API 密钥、监控更多的服务状态,以及处理潜在的供应商锁定问题。对于企业级用户而言,系统的稳定性和可维护性往往比单纯的准确率提升更为重要。
如果 Fusion 导致系统复杂度呈指数级增长,而其带来的质量提升微乎其微,那么这种架构选择就是得不偿失的。因此,Fusion 的适用场景必须严格限定在那些对延迟不敏感、且错误代价极高的任务中,否则其系统风险将抵消其潜在收益。
这种结构性缺陷使得 Fusion 难以成为通用型解决方案,而只能作为特定垂直领域的补充工具。
信息互补陷阱进一步削弱了 Fusion 的价值主张。Fusion 的价值取决于候选模型是否带来独立信息,但不同模型往往共享训练语料、网页来源和错误前提。研究任务中,这会导致 "引用洗白":多个模型追溯到同一来源,却被包装成多份独立证据。若系统不保留 claim-level provenance 和搜索路径,随着模型数量增加,API 成本几乎线性上升,证据多样性却未必增加。
KAIKAKU.AI 联合创始人兼 CEO Josef Chen 在 2026 年的论文 "When Does Combining Language Models Help?" 中研究了 21 家服务商的 67 个模型。开放式数学任务中,所有模型同时答错的预测概率为 2.3%,实测却达到 5.2%------约为预测值的 2.3 倍;执行评分代码任务和自由回答版 GPQA-Diamond 的共同失败率进一步升至 7.9% 和 12.7%。
换成 100 道 GPQA-Diamond,大约有 13 道题会让所有候选模型一起答错,投票、评审或综合都无正确答案可选。模型在容易题上的分歧会放大组合价值,而在最需要保险的尾部问题上,它们反而可能一起失手。LitBench 中最强的现成评审模型与人类创意写作偏好的一致率也只有 73%。当任务已有廉价外部验证器,或'好'本身依赖主观判断时,Fusion 的提分很难转化为可付费价值。
这意味着,Fusion 所依赖的'独立信息'假设在许多实际场景中并不成立,模型之间的相关性远高于预期,导致其边际效用递减。
付费意愿分析揭示了 Fusion 的市场验证困境。Fusion 的需求取决于两道门槛:任务是否能从多模型中获益,以及这种收益是否足以形成持续付费。前者是技术问题,后者才是市场问题。从技术适用到经济成立,Fusion 把错误改对的概率 × 单次错误可避免的损失,必须大于新增的 API 成本、延迟、运维复杂度和隐私风险。基准分数无法回答这道损益题。Fusion 只有在错误代价高、候选模型提供互补搜索路径、缺少更便宜的外部验证器,而且业务能接受额外延迟和供应商风险时才可能成立;最终结果仍应由人或外部证据确认。
符合这些条件的主要是高价值研究与尽调、架构与安全评审,以及不可逆决策前的'第二意见'。它们的共同点是约束不完整、遗漏代价高,另一条独立思路本身就有价值。相反,常规代码、实时消费应用、高吞吐低毛利工作流,以及能由测试或规则直接验证的任务,通常不需要 Fusion。受监管机构也可能因数据边界和审计要求拒绝多供应商 panel。从付费意愿到可持续需求,技术上有用可以带来高付费意愿,却不等于可规模化需求。
要形成持续需求,错误损失必须可量化,任务要重复发生,组织内要有明确的预算负责人,Fusion 还必须持续胜过人工专家、强单模型和外部验证。但尽调预算往往流向分析师与可信来源,安全预算流向专业审计,不可逆决策又发生得太少。因此,我们不看好只做多模型 wrapper、默认运行 panel,或把静态模型选择算法当作护城河的公司。连接 API 容易复制,固定策略也会随模型能力和价格变化迅速失效;
如果不知道错误值多少钱、Fusion 实际改对了多少次,就无法为这份保险定价。更可能捕获价值的是掌握真实结果的一方:网关和 agent 平台、垂直应用、工作流所有者,以及评测和可观测性产品。它们知道错误成本,能观察结果,也能优化触发策略。真正难复制的不是 panel 名单,而是判断何时不调用 Fusion。
未来竞争格局由 Devin Fusion 案例与 Stripe 收购信号共同塑造。Cognition 的 Devin Fusion 展示了这场竞争的方向:把昂贵模型留给判断环节,把可验证、机械性的工作交给更便宜的模型。厂商自测中,Fusion + Fable 5 的总分从 57.0 小幅升至 57.6,平均成本从 5.12 美元降至 3.00 美元;但在公布的 5 个案例中,成本均下降 25%-62%,任务得分却在+12 至-27 之间波动。
边界清楚、测试充分的 ES6 重构从 98 分升至 100 分;依赖交互理解和隐含需求的 React/Redux 功能被错误委派后,则从 54 分跌至 27 分。这些是厂商挑选的案例,不代表总体分布,但指向清楚:未来多模型系统的核心能力不是调用更多模型,而是划定正确的降级边界。可验证、机械性的任务可以交给便宜模型,判断密集型任务必须留给前沿模型。OpenRouter 出售 "更多智能",Cognition 出售 "同等智能,更低成本";第二种命题更接近长期方向。
一个系统越接近生产经济学,就越不像狭义的 Model Fusion,而越像路由、委派和验证。7 月下旬,媒体报道称 Stripe 正洽谈以约 100 亿美元收购 OpenRouter,交易尚未确认。这个信号不应被解读为 Fusion 已经获得市场验证:OpenRouter 的核心价值并非某一种 panel,而是连接超过 500 万开发者与 400 多个模型的中立调用层。
Stripe 已经为 OpenRouter 提供计费、税务和风控,并允许开发者通过 Stripe Projects 直接创建账户、取得 API key 和接通付款。Stripe 真正可能购买的是 AI 推理的交易入口:OpenRouter 掌握模型选择、token 用量与成本,Stripe 则处理定价、账单和支付。这为前文的价值判断提供了市场信号:多模型时代的价值更可能留在能够观察任务、分配调用并完成结算的 orchestration layer,Fusion 只是其上的一种高成本升级策略。
结论:Fusion 作为低频功能的定位与价值归属已逐渐清晰。未来的多模型系统不会默认召集 panel,而会先估计任务难度、验证成本和错误损失;只有当更强单模型、延长推理和外部工具仍不足时,才进入多模型分歧搜索。触发率、增量成功率和经验证的单位结果成本,才是有意义的产品指标。Fusion 会作为低频功能留下,而不是成为默认架构或独立品类。
这一判断基于对当前市场动态、技术瓶颈和经济逻辑的综合考量。随着模型能力的持续提升和成本的不断下降,单模型与动态路由的组合将能够满足绝大多数应用场景的需求,Fusion 的生存空间将被进一步压缩。只有在那些对准确性要求极高、且缺乏其他验证手段的极端场景中,Fusion 才能证明其存在的价值。因此,开发者和企业应谨慎对待 Fusion 技术,避免将其作为默认的架构选择,而应将其视为一种在特定条件下使用的补充工具。通过精确控制触发率,优化增量成功率,并严格核算单位结果成本,才能在享受 Fusion 带来的质量提升的同时,避免陷入成本失控的陷阱。这是继模型商品化之后,AI 基础设施演进的另一重要趋势,标志着行业从盲目追求智能上限转向务实的成本效益优化。