登錄
註冊
據 Woofun AI 消息,2026 年 6 月 AI 模型市場在短短三週內呈現出兩種截然相反的經濟邏輯,OpenRouter 與 Cognition 分別發佈的 Fusion Router 和 Devin Fusion,標誌着行業對多模型協作價值的認知發生根本性分化。前者試圖通過並行計算突破性能上限,後者則致力於在保持前沿表現的同時大幅削減成本,這種反差揭示了 Model Fusion 並非通用的技術升級方案,而是一種僅在特定條件下具備經濟合理性的昂貴保險。市場正在迅速從盲目追求模型堆疊轉向精細化的成本效益評估,真正決定產品生死的關鍵變量不再是單純的準確率提升,而是單位結果成本與延遲控制的平衡能力。
這一趨勢表明,狹義的模型融合架構正面臨嚴峻的商業驗證挑戰,其生存空間被壓縮至低頻、高價值且缺乏外部驗證器的尾部任務領域,而非成爲主流應用的默認基礎設施。
OpenRouter 於 6 月 12 日推出的 Fusion Router,其核心賣點建立在 "Surpassing Frontier Performance with Fusion" 的承諾之上,通過 DRACO 深度研究評測展示其技術可行性。在該評測體系中,由 Fable 5 與 GPT-5.5 組成的模型組獲得了 69.0 分的高分,顯著超過了 Fable 5 單模型運行的 65.3 分表現。
這一策略的邏輯基礎在於,當單一模型的能力觸及瓶頸時,引入多個模型對同一問題進行並行作答,再由評審模型進行比較與綜合,有望挖掘出更優解。OpenRouter 的設計哲學是'以計算換上限',即通過增加候選答案的數量和多樣性,來提高捕捉正確答案的概率。
這種模式在理論層面具備吸引力,特別是在面對複雜推理或多跳查詢任務時,多視角的碰撞可能激發出單模型無法觸及的思維路徑。然而,這種提分並非無代價的魔法,它直接依賴於高昂的算力投入和複雜的編排邏輯。評測數據的背後,隱藏着對計算資源的大量消耗,以及對評審模型判斷能力的極高依賴。
如果評審模型無法準確識別哪個候選答案更優,或者候選答案之間缺乏實質性的信息差異,那麼這種'超越'就僅僅是數字遊戲,無法轉化爲實際的生產力提升。因此,OpenRouter 的方案雖然證明了 Fusion 在特定基準測試中的有效性,但其經濟可持續性仍存疑,特別是在成本敏感的企業級應用場景中,這種以倍數級增加計算量來換取小幅提分的做法,往往難以通過 ROI 審查。
相比之下,Cognition 於 6 月 29 日發佈的 Devin Fusion 採取了完全不同的技術路線,其標題 "Frontier Performance at 35% Lower Cost" 直接擊中了當前 AI 應用落地的痛點。Devin Fusion 並未採用讓多個模型重複完成整項任務的策略,而是引入了動態切換機制,將任務分解爲規劃、判斷、執行等不同階段。前沿模型僅負責高價值的規劃和關鍵環節的判斷,而將測試、機械修改等低價值工作委派給更便宜的 sidekick 模型。
這種動態路由與任務委派策略,本質上是對計算資源的精準分配,旨在減少昂貴計算的冗餘使用,同時守住原有的質量底線。通過這種方式,Cognition 試圖在性能與成本之間找到更優的平衡點,避免爲那些可以通過低成本模型解決的任務支付溢價。
這一方案反映了市場對'效率'而非'絕對智能'的追求,特別是在企業級應用中,成本控制往往是決定技術採納與否的首要因素。Devin Fusion 的成功案例表明,通過智能調度模型資源,可以在不犧牲最終結果質量的前提下,顯著降低整體運營成本。
這種模式不僅提升了系統的經濟性,還增強了其可擴展性,使其能夠適應更大規模的業務流量。因此,Cognition 的路徑更接近於長期可持續的商業模型,它不再將 Fusion 視爲一種獨立的架構範式,而是作爲動態路由策略中的一個優化選項,僅在必要時調用高價模型,從而實現了成本與性能的雙贏。
面對相同的質量缺口,市場目前存在四種主要的購買策略,每種策略在經濟邏輯上各有側重。第一種是直接升級到更強的單模型,這是最簡單且易於審計的方式,只要高端模型的邊際提價低於錯誤或返工成本,這通常仍是首選方案。第二種是在同一個模型上增加測試時計算,例如延長推理時間、使用 self-consistency 或多次採樣,以換取更高的穩定性。
第三種是路由、級聯和任務委派,先用便宜模型處理可驗證或機械性的部分,只有遇到困難才升級,這種方式已被證明能顯著降低成本。第四種纔是狹義的 Model Fusion,讓多個模型對同一問題重複作答,再由評審和綜合模型形成最終答案。這四種方式都能 "用更多計算換質量",但區別在於計算花在哪裏。單模型擴展購買更深的推理,路由購買更準確的資源分配,Fusion 則購買更多候選答案。
前三種方法把預算集中在最可能改變結果的環節;Fusion 卻先爲重複意見付費,再賭評審模型能從中找出有效差異。路由已經證明,模型之間的能力差異首先是一項調度機會。RouteLLM 在部分評測中把成本降低超過 2 倍而不損失質量;Switchcraft 以 82.9% 的準確率實現 84% 的成本下降,按論文測算,每百萬次請求可節省超過 3,600 美元。結果仍需在企業自己的流量上覆現,但經濟邏輯很直接:不必讓多個模型開會,只需把每項任務交給最便宜的合格模型。
這意味着,市場會先用升級、路由和驗證解決質量缺口;只有當這些方法仍然不夠時,纔有理由爲 Fusion 購買更多候選答案。
Woofun AI 整理數據顯示,Fusion 的成本賬本揭示了其提分背後的巨大算力代價。OpenRouter 的 DRACO 評測顯示,Fable 5 + GPT-5.5 從 65.3 分升至 69.0 分;Opus 4.8 自融合從 58.8 分升至 65.5 分;低成本三模型組從 60.3 分升至 64.7 分。但 Opus 自融合的提升更大,說明收益可能來自額外搜索和採樣,而非跨模型知識互補。
公平對照應比較相同 token 預算下的 self-consistency、更長推理和強單模型。現有研究也顯示:多智能體在約 20 倍計算量下最多提升 7.1 個百分點;預算相同時,debate 和 Mixture of Agents 僅比 self-consistency 高 1.3 和 2.7 個百分點,另一項等 reasoning-token 研究則發現單 agent 持平或更優。
不少 "協作收益" 會在計算賬對齊後消失。OpenRouter 默認 3 模型 panel 的成本約爲普通生成的 4-5 倍,速度慢 2-3 倍,但沒有披露各 DRACO 配置的完整 token、成本和延遲,無法判斷 3.7 分提升是否值得。評測也只有 100 個純文本英文任務,Fable 相關配置只完成 93 項;更換評審模型可讓絕對分數移動 10-25 個百分點。
它證明了 Fusion 能提分,沒有證明 Fusion 改善了生產 ROI。選擇性調用只能攤薄成本。按 OpenRouter 披露的區間估算,觸發率爲 1% 時,整體成本約爲 1.03-1.04 倍;10% 時爲 1.30-1.40 倍;25% 時已達 1.75-2.00 倍。這表明,除非 Fusion 僅在極少數極端情況下被觸發,否則其成本優勢將迅速被侵蝕,特別是在高併發場景下,這種成本結構難以維持競爭力。
延遲與風險是選擇性調用 Fusion 下的另一大系統瓶頸。最難的請求最可能觸發 Fusion,系統卻必須等待最慢的 panel 成員,再串行完成評審和生成,因此尾延遲集中在最有價值的任務上。多供應商調用還擴大故障面、審計複雜度和隱私暴露。Fusion 的成本不只是 API 價格,也包括等待時間和新增的系統風險。在實時性或高吞吐要求嚴格的場景中,這種延遲是不可接受的。
此外,引入多個模型意味着需要管理更多的 API 密鑰、監控更多的服務狀態,以及處理潛在的供應商鎖定問題。對於企業級用戶而言,系統的穩定性和可維護性往往比單純的準確率提升更爲重要。
如果 Fusion 導致系統複雜度呈指數級增長,而其帶來的質量提升微乎其微,那麼這種架構選擇就是得不償失的。因此,Fusion 的適用場景必須嚴格限定在那些對延遲不敏感、且錯誤代價極高的任務中,否則其系統風險將抵消其潛在收益。
這種結構性缺陷使得 Fusion 難以成爲通用型解決方案,而只能作爲特定垂直領域的補充工具。
信息互補陷阱進一步削弱了 Fusion 的價值主張。Fusion 的價值取決於候選模型是否帶來獨立信息,但不同模型往往共享訓練語料、網頁來源和錯誤前提。研究任務中,這會導致 "引用洗白":多個模型追溯到同一來源,卻被包裝成多份獨立證據。若系統不保留 claim-level provenance 和搜索路徑,隨着模型數量增加,API 成本幾乎線性上升,證據多樣性卻未必增加。
KAIKAKU.AI 聯合創始人兼 CEO Josef Chen 在 2026 年的論文 "When Does Combining Language Models Help?" 中研究了 21 家服務商的 67 個模型。開放式數學任務中,所有模型同時答錯的預測概率爲 2.3%,實測卻達到 5.2%------約爲預測值的 2.3 倍;執行評分代碼任務和自由回答版 GPQA-Diamond 的共同失敗率進一步升至 7.9% 和 12.7%。
換成 100 道 GPQA-Diamond,大約有 13 道題會讓所有候選模型一起答錯,投票、評審或綜合都無正確答案可選。模型在容易題上的分歧會放大組合價值,而在最需要保險的尾部問題上,它們反而可能一起失手。LitBench 中最強的現成評審模型與人類創意寫作偏好的一致率也只有 73%。當任務已有廉價外部驗證器,或'好'本身依賴主觀判斷時,Fusion 的提分很難轉化爲可付費價值。
這意味着,Fusion 所依賴的'獨立信息'假設在許多實際場景中並不成立,模型之間的相關性遠高於預期,導致其邊際效用遞減。
付費意願分析揭示了 Fusion 的市場驗證困境。Fusion 的需求取決於兩道門檻:任務是否能從多模型中獲益,以及這種收益是否足以形成持續付費。前者是技術問題,後者纔是市場問題。從技術適用到經濟成立,Fusion 把錯誤改對的概率 × 單次錯誤可避免的損失,必須大於新增的 API 成本、延遲、運維複雜度和隱私風險。基準分數無法回答這道損益題。Fusion 只有在錯誤代價高、候選模型提供互補搜索路徑、缺少更便宜的外部驗證器,而且業務能接受額外延遲和供應商風險時纔可能成立;最終結果仍應由人或外部證據確認。
符合這些條件的主要是高價值研究與盡調、架構與安全評審,以及不可逆決策前的'第二意見'。它們的共同點是約束不完整、遺漏代價高,另一條獨立思路本身就有價值。相反,常規代碼、實時消費應用、高吞吐低毛利工作流,以及能由測試或規則直接驗證的任務,通常不需要 Fusion。受監管機構也可能因數據邊界和審計要求拒絕多供應商 panel。從付費意願到可持續需求,技術上有用可以帶來高付費意願,卻不等於可規模化需求。
要形成持續需求,錯誤損失必須可量化,任務要重複發生,組織內要有明確的預算負責人,Fusion 還必須持續勝過人工專家、強單模型和外部驗證。但盡調預算往往流向分析師與可信來源,安全預算流向專業審計,不可逆決策又發生得太少。因此,我們不看好只做多模型 wrapper、默認運行 panel,或把靜態模型選擇算法當作護城河的公司。連接 API 容易複製,固定策略也會隨模型能力和價格變化迅速失效;
如果不知道錯誤值多少錢、Fusion 實際改對了多少次,就無法爲這份保險定價。更可能捕獲價值的是掌握真實結果的一方:網關和 agent 平臺、垂直應用、工作流所有者,以及評測和可觀測性產品。它們知道錯誤成本,能觀察結果,也能優化觸發策略。真正難複製的不是 panel 名單,而是判斷何時不調用 Fusion。
未來競爭格局由 Devin Fusion 案例與 Stripe 收購信號共同塑造。Cognition 的 Devin Fusion 展示了這場競爭的方向:把昂貴模型留給判斷環節,把可驗證、機械性的工作交給更便宜的模型。廠商自測中,Fusion + Fable 5 的總分從 57.0 小幅升至 57.6,平均成本從 5.12 美元降至 3.00 美元;但在公佈的 5 個案例中,成本均下降 25%-62%,任務得分卻在+12 至-27 之間波動。
邊界清楚、測試充分的 ES6 重構從 98 分升至 100 分;依賴交互理解和隱含需求的 React/Redux 功能被錯誤委派後,則從 54 分跌至 27 分。這些是廠商挑選的案例,不代表總體分佈,但指向清楚:未來多模型系統的核心能力不是調用更多模型,而是劃定正確的降級邊界。可驗證、機械性的任務可以交給便宜模型,判斷密集型任務必須留給前沿模型。OpenRouter 出售 "更多智能",Cognition 出售 "同等智能,更低成本";第二種命題更接近長期方向。
一個系統越接近生產經濟學,就越不像狹義的 Model Fusion,而越像路由、委派和驗證。7 月下旬,媒體報道稱 Stripe 正洽談以約 100 億美元收購 OpenRouter,交易尚未確認。這個信號不應被解讀爲 Fusion 已經獲得市場驗證:OpenRouter 的核心價值並非某一種 panel,而是連接超過 500 萬開發者與 400 多個模型的中立調用層。
Stripe 已經爲 OpenRouter 提供計費、稅務和風控,並允許開發者通過 Stripe Projects 直接創建賬戶、取得 API key 和接通付款。Stripe 真正可能購買的是 AI 推理的交易入口:OpenRouter 掌握模型選擇、token 用量與成本,Stripe 則處理定價、賬單和支付。這爲前文的價值判斷提供了市場信號:多模型時代的價值更可能留在能夠觀察任務、分配調用並完成結算的 orchestration layer,Fusion 只是其上的一種高成本升級策略。
結論:Fusion 作爲低頻功能的定位與價值歸屬已逐漸清晰。未來的多模型系統不會默認召集 panel,而會先估計任務難度、驗證成本和錯誤損失;只有當更強單模型、延長推理和外部工具仍不足時,才進入多模型分歧搜索。觸發率、增量成功率和經驗證的單位結果成本,纔是有意義的產品指標。Fusion 會作爲低頻功能留下,而不是成爲默認架構或獨立品類。
這一判斷基於對當前市場動態、技術瓶頸和經濟邏輯的綜合考量。隨着模型能力的持續提升和成本的不斷下降,單模型與動態路由的組合將能夠滿足絕大多數應用場景的需求,Fusion 的生存空間將被進一步壓縮。只有在那些對準確性要求極高、且缺乏其他驗證手段的極端場景中,Fusion 才能證明其存在的價值。因此,開發者和企業應謹慎對待 Fusion 技術,避免將其作爲默認的架構選擇,而應將其視爲一種在特定條件下使用的補充工具。通過精確控制觸發率,優化增量成功率,並嚴格覈算單位結果成本,才能在享受 Fusion 帶來的質量提升的同時,避免陷入成本失控的陷阱。這是繼模型商品化之後,AI 基礎設施演進的另一重要趨勢,標誌着行業從盲目追求智能上限轉向務實的成本效益優化。