格付けの引き上げから支払いまで:モデル融合における需要の錯覚
chaincatcherI. モデル融合とは何ですか?
2026年6月、AI市場には「Fusion」と呼ばれる2つの製品が3週間足らずの間に登場した。
6月12日、OpenRouterは「 Fusionで最先端性能を超える」と題したFusion Routerをリリースした。DRACOによる詳細な評価では、Fable 5とGPT-5.5で構成されるモデル群が69.0ポイントを獲得し、Fable 5単体モデルの65.3ポイントを上回った。OpenRouterのセールスポイントはシンプルだ。単一モデルでは不十分な場合、複数のモデルが同じ質問に答え、その後、レビュー担当者がモデルを比較・統合するというものだ。

6月29日、CognitionはDevin Fusionをリリースしたが、そのタイトルは「 35%低いコストで最先端のパフォーマンスを実現」だった。複数のモデルにタスク全体を繰り返し実行させるのではなく、フロントエンドモデルが計画と判断を担当し、テスト、機械的な変更、その他のタスクはより安価なサイドキックに任せ、実行中にモデルを動的に切り替える。

同じ用語が、相反する2つの経済論理を示唆している。OpenRouterはより多くの計算能力を用いてより高いキャップを獲得しようとする一方、 Cognitionは本来の品質を維持しながら、コストのかかる計算能力を削減しようとする。この対照は、いかなるモデルランキングよりも雄弁に物語っている。モデル融合の技術的な命題は確かに正しい。複数回の試行は、単一の試行を上回る可能性を秘めている。しかし、市場が真に評価するのは「より多くのモデル呼び出し」ではなく、品質基準を満たした後、より少ない費用でより迅速に成果を出すことができるかどうかである。
▲ 図 1: 同じ月に登場した 2 種類のフュージョン。この記事では、モデルフュージョンをより狭義のアーキテクチャとして定義しています。複数のモデルが同じタスクに並行して応答し、モデルがレビューされ、結果が比較され、最終的に 1 つのモデルが回答を出力します。Devin Fusion はこの定義には当てはまりません。これは、動的ルーティングとタスク委譲に近いものです。市場では「フュージョン」がすべてのマルチモデルオーケストレーションの一般的な用語として使用されている一方で、真に効果的な製品はモデルフュージョンの狭義の定義から離れつつあるため、Devin Fusion を冒頭に配置しました。
私たちの評価は悲観的です。モデル融合は高価な品質保険のようなものです。特定のタスクの絶対的なパフォーマンスを向上させることはできますが、コスト、品質、レイテンシの効率性を真に向上させることは稀です。この保険をかける価値のあるタスクはごくわずかです。モデル融合は今後も存続するでしょうが、デフォルトのアーキテクチャというよりは、低頻度でトリガーされる機能となる可能性が高く、独立したカテゴリになる可能性は低いでしょう。
II.現在利用可能なモデルオプションは何ですか?
Fusionに関する議論は、精度ランキングの話になりがちですが、企業はランキング順位を買うわけではありません。価格、レイテンシー、プライバシー、安定性も考慮に入れつつ、タスクに対して許容できる結果を求めているのです。安価なモデルが既に存在する限り…
ビジネス上の受け入れ基準を超えると、「より高度な」機能への投資を継続することは経済的に成り立たなくなる可能性がある。モデル市場における真の原動力はコスト効率である。
▲ 図2:モデルインテリジェンスとシングルタスクコスト。対数スケール上で最も注目すべき点は、右上隅の最高スコアではなく、価格と性能の傾向から逸脱している点です。これらの点は、より低い価格で十分な性能を提供し、特定のワークロードに対して効率の面で突出しています。この複合指標は、コードレビュー、中国での研究、規制された展開にどのモデルが最適かを直接的に答えることはできませんが、モデルの供給がコモディティ化し、「最強のモデル」と「最適な選択肢」が乖離しつつあるという傾向を示しています。
現在、市場には同じ品質ギャップに対処するための主な購買戦略が4つ存在する。
最初の方法は、より強力な単一モデルに直接アップグレードすることです。これは最もシンプルで監査も容易であり、ハイエンドモデルのコストのわずかな増加がエラーや手戻りのコストよりも低い限り、一般的に依然として好ましい選択肢です。2番目の方法は、推論、自己整合性、多重サンプリングの拡張など、同じモデル上でのテスト時の計算を増やすことです。3番目の方法は、ルーティング、カスケード、タスク委任です。まず、より安価なモデルを使用して検証可能な部分または機械的な部分を処理し、困難が生じた場合にのみアップグレードします。4番目の方法は、より狭義にはモデル融合です。複数のモデルで同じ質問に繰り返し回答し、その後、モデルのレビューと統合によって最終的な回答を形成します。
4つの手法はいずれも「計算量を増やして品質を向上させる」ことができるが、違いは計算量の配分方法にある。単一モデル拡張はより深い推論を可能にし、ルーティングはより正確なリソース配分を可能にし、フュージョンはより多くの候補回答を可能にする。最初の3つの手法は、結果を変える可能性が最も高い段階に予算を集中させるが、フュージョンはまず重複意見に費用をかけ、その後、レビューモデルが有効な相違点を識別できるかどうかに賭ける。候補モデルは十分な独立した情報を提供する必要があり、レビュー担当者はその情報を認識できなければならない。
Fusionは、他の3つの選択肢を凌駕できる唯一の選択肢です。
ルーティングの検証により、モデル間の機能差は主にスケジューリングの機会であることが証明されました。RouteLLMは、一部の評価において品質を損なうことなくコストを2倍以上削減しました。Switchcraftは、82.9%の精度で84%のコスト削減を達成し、論文によると、これは100万リクエストあたり3,600ドル以上の節約に相当します。これらの結果はまだ企業のトラフィックで再現する必要がありますが、経済的な論理は単純明快です。複数のモデルを会議で運用するのではなく、各タスクを最も安価で適格なモデルに割り当てるだけです。
これはつまり、市場はまずアップグレード、ルーティング、検証を通じて品質ギャップに対処し、これらの方法でも不十分な場合にのみ、Fusion用の候補回答をさらに購入する理由が生じるということである。
III.なぜスコアを上げることが価値を持つことと同義ではないのか?
Fusion は、次の 3 つのハードルを同時に克服する必要があるためです。増分品質は追加コストと遅延をカバーする必要があり、候補モデルは独立した情報を提供する必要があり、レビュー担当者は一貫してより良い回答を特定する必要があります。これらのいずれかが失敗すると、スコアの改善は生産価値に変換できません。計算コスト: 追加の予算と遅延はどれくらい必要ですか? Fusion のスコアの改善は、何よりもまず明確な計算コストです。OpenRouter は複数のパネルモデルを並列に呼び出し、その後、レビュー担当者と統合モデルが回答を生成します。DRACO の 3 つのコントロール グループすべてでスコアの改善が見られました。Fable 5 + GPT-5.5 は 65.3 から 69.0 に増加しました。Opus 4.8 自己融合は 58.8 から 65.5 に増加しました。低コストの 3 つのモデル グループでは 60.3 から 64.7 に増加しました。
しかし、Opusの自己融合の改善はより大きく、これは、モデル間の知識の相補性ではなく、追加の検索とサンプリングから利益が得られることを示唆しています。同じトークン予算の下で、自己一貫性、より長い推論、および強力なシングルエージェントモデルを公平に比較する必要があります。既存の研究でも、マルチエージェントモデルは、約20倍の計算コストで最大7.1パーセントポイントのパフォーマンスを向上させることができることが示されています。同じ予算では、ディベートとエージェントの混合は、それぞれ自己一貫性よりもわずか1.3パーセントポイントと2.7パーセントポイント高いだけですが、同じ推論トークンを使用した別の研究では、シングルエージェントモデルが同等かそれ以上であることがわかりました。多くの「コラボレーションの利益」は、計算台帳のアライメント後に消えます。
▲ 図 3: OpenRouter のベンチマーク改善と製品コスト。OpenRouterのデフォルトの 3 モデル パネルは、標準生成パネルの約4〜5 倍のコストがかかり、 2〜3 倍遅くなります。ただし、各 DRACO 構成の完全なトークン、コスト、レイテンシは公開されていないため、3.7 ポイントの改善が価値があるかどうかを判断することはできません。評価には、プレーンな英語のテキスト タスク 100 個のみが含まれており、Fable 関連の構成は 93 個しか完了していません。レビュー モデルを変更すると、絶対スコアが 10〜25 パーセント ポイント変動する可能性があります。これは、Fusion がスコアを改善できることは証明していますが、Fusion が生産 ROI を改善できることは証明していません。
選択的呼び出しはコスト削減にしかならない。OpenRouterが公表した推定によると、トリガー率が1%の場合、全体のコストは約1.03~1.04倍、10%の場合は1.30~1.40倍、25%の場合は1.75~2.00倍となる。
▲ 図 4: 選択的融合呼び出しの全体的な経済性。最も難しいリクエストが融合をトリガーする可能性が最も高いですが、システムはレビューと生成を順次完了する前に、最も遅いパネルメンバーを待つ必要があります。したがって、テールレイテンシは最も価値の高いタスクに集中します。マルチベンダー呼び出しは、障害領域、監査の複雑さ、プライバシーの露出も拡大します。融合のコストは、API の価格だけでなく、待ち時間と追加のシステムリスクも含まれます。情報の補完性: 複数のモデルは本当に異なる情報を提供しますか?融合の価値は、候補モデルが独立した情報をもたらすかどうかに依存しますが、異なるモデルはトレーニング コーパス、Web ページ ソース、誤った前提を共有することがよくあります。研究タスクでは、これは「引用のホワイトウォッシング」につながります。複数のモデルが同じソースに遡りますが、複数の独立した証拠としてパッケージ化されます。システムがクレーム レベルの来歴と検索パスを保持しない場合、 API コストはモデルの数にほぼ比例して増加しますが、証拠の多様性は必ずしも増加しません。
KAIKAKU.AI の共同創設者兼 CEO である Josef Chen 氏は、2026 年の論文「言語モデルの組み合わせはいつ役立つのか?」で、21 社のサービス プロバイダーから 67 個のモデルを調査しました。自由形式の数学タスクでは、すべてのモデルが同時に間違った回答をする予測確率は 2.3% でしたが、実際の確率は5.2% に達し、予測値の約 2.3 倍になりました。スコアリング コード タスクと GPQA-Diamond の自由回答バージョンでは、同時失敗率はそれぞれ7.9% と 12.7%にさらに増加しました。100 個の GPQA-Diamond 問題では、約 13 問ですべての候補モデルが間違った回答をすることになり、投票、レビュー、または合成のための正しい回答が残らないことになります。簡単な問題でのモデルの発散は組み合わせた価値を増幅しますが、最も重要な末尾の問題では、すべてが失敗する可能性があります。信頼性の評価: システムはより良い回答を識別して合成できますか?たとえ候補者の回答が互いに補完し合うものであっても、その価値は依然としてレビューに左右される。候補者の回答が一貫している場合、レビュー担当者は関連する誤りを高い確信度と誤解する可能性がある。候補者の回答が食い違う場合、正しい回答を選択するには十分な専門知識が必要となる。また、複合モデルは重要な少数意見を覆い隠したり、実際の意見の相違を決定的な結論に書き換えたりする可能性もある。
コーディング作業においては、コンパイラ、テスト、静的解析は、他のモデルの意見よりも信頼性が高い場合が多い。一方、創作作業においては、レビューと統合によって差異を容易に平均的な回答に集約できる。LitBenchに搭載されている市販のレビューモデルの中でも最も強力なものでさえ、人間の創作文章の好みとの一致率はわずか73%に過ぎない。安価な外部検証ツールが存在する場合、あるいは「良い」という基準自体が主観的な判断に左右される場合、Fusionのスコア向上を有料価値に結びつけるのは難しい。
IV.Fusionの費用は誰が負担するのか?
Fusionの需要は、2つのハードルに左右されます。1つは、タスクが複数のモデルから恩恵を受けられるかどうか、もう1つは、その恩恵が持続的な収益を生み出すのに十分かどうかです。前者は技術的な問題であり、後者は市場の問題です。技術的な適用性から経済的な実現可能性まで、 Fusionでは、エラーを修正できる確率と、単一のエラーによる回避可能な損失を掛け合わせた値が、新しいAPIを追加する際のコスト、遅延、運用上の複雑さ、プライバシーリスクを上回る必要があります。
ベンチマークスコアでは、この損益に関する疑問に答えることはできません。融合は、エラーのコストが高く、候補モデルが補完的な探索経路を提供し、より安価な外部検証ツールが不足しており、かつ企業が追加の遅延とベンダーリスクを許容できる場合にのみ有効です。最終結果は、人間または外部の証拠によって確認される必要があります。
▲ 図 5: 技術的適用性から持続可能なニーズへこれらの基準を満たすものには、主に価値の高い研究とデューデリジェンス、アーキテクチャとセキュリティのレビュー、取り返しのつかない決定の前の「セカンド オピニオン」が含まれます。これらには共通点があります。不完全な制約、省略の高コスト、独立したアプローチの固有の価値です。逆に、通常のコード、即時消費アプリケーション、高スループット、低マージンワークフロー、テストまたはルールによって直接検証可能なタスクは、通常、融合を必要としません。規制機関は、データの境界と監査要件のために、マルチベンダーパネルを拒否することもあります。支払意思から持続可能なニーズへ技術的な有用性は高い支払意思を生み出すことができますが、拡張可能な需要とは等しくありません。持続的な需要を実現するには、エラーによる損失を定量化できること、タスクが繰り返し発生すること、組織内に明確な予算責任が存在すること、そしてフュージョンが人間の専門家、強力な単一エンティティモデル、外部検証を常に上回る性能を発揮することが必要です。しかしながら、デューデリジェンスの予算はアナリストや信頼できる情報源に、セキュリティ予算は専門監査に流れ、取り返しのつかない決定はめったに行われません。
したがって、マルチモデルラッパーのみを提供し、デフォルトでパネルを実行し、静的モデル選択アルゴリズムを堀として扱う企業については楽観視していません。接続 API は簡単に複製でき、固定戦略はモデル機能と価格が変化するとすぐに効果を失います。エラー率と Fusion が実際にエラーを修正した回数がわからないと、この保険の価格設定は不可能です。実際の結果を制御する人が価値を獲得する可能性が高くなります。ゲートウェイおよびエージェントプラットフォーム、垂直アプリケーション、ワークフロー所有者、評価および可観測性製品などです。彼らはエラーのコストを知っており、結果を観察でき、トリガー戦略を最適化できます。本当に複製が難しいのはパネルリストではなく、Fusion を呼び出さないタイミングを決定することです。市場検証:公開市場は Fusion の需要規模を判断するには不十分ですが、すでにその使用方法を示しています。Perplexity Model Council は、月額 200 ドルを支払う Max および Enterprise Max ユーザーのみが利用できます。ユーザーは、投資調査、複雑な意思決定、および情報検証のために、Web 上で 3 つのモデルを手動で選択します。公開されているユースケースとしては、ブラウザの自動化を通じてモデル評議会を株式調査ワークフローに統合する例が挙げられます。HermesのMixture of Agentsでは、Fusionをエージェント内で選択可能な仮想モデルとして提供しています。ユーザーは/moa経由で単一の困難な問題にアップグレードすることも、複数の参照モデルによる分析とタスクを完了するためのツール呼び出しを行う複雑なセッションで継続的に有効化することもできます。Hermesは後にデフォルトのファンアウト頻度を減らし、コストを抑えるために以前のモデルからのフィードバックを再利用しました。これらの例は、Fusionの実際の需要が、調査、デバッグ、レビュー、重要な意思決定といった低頻度で困難なタスクに集中していることを示しています。典型的な使用方法は、デフォルトで有効化されている高頻度の自動化プロセスではなく、単一のモデルがボトルネックに遭遇した後のプロアクティブなアップグレードです。既存の証拠はこの需要が存在することを証明していますが、独立した大規模な有料市場を形成できるかどうかを判断するには、公開されている情報はまだ不十分です。
V. 核融合の未来
推論コストの低下はFusionにとって有利に働くように見えるが、同時に強力なシングルモデル、ルーティング、外部検証のコストも削減する。Fusionは過去のモデル呼び出しで競争するのではなく、次世代のシングルモデルとオーケストレーションのベースラインを継続的に改善することで競争している。
Cognition の Devin Fusion は、この競争の方向性を示しています。高価なモデルは意思決定段階に残し、検証可能な機械的なタスクはより安価なモデルに委任します。ベンダーの自己テストでは、Fusion + Fable 5 の総合スコアは 57.0 から 57.6 にわずかに上昇し、平均コストは $5.12 から $3.00 に減少しました。しかし、公開された 5 つのケーススタディでは、コストが 25% ~ 62% 減少した一方で、タスク スコアは +12 ~ -27 の間で変動しました。明確に定義され、徹底的にテストされた ES6 リファクタリングは 98 から 100 ポイントに上昇しました。相互作用の理解と暗黙の要件に依存する React/Redux 関数は、誤って委任された場合、54 から 27 ポイントに低下しました。
▲ 図 6: Devin Fusion タスクのスコアとコスト。これらはベンダーが選択した例であり、全体的な分布を表すものではありませんが、次の点を明確に示しています。将来のマルチモデルシステムのコア機能は、より多くのモデルを呼び出すことではなく、適切な劣化境界を定義することです。検証可能な機械的なタスクはより安価なモデルに割り当てることができますが、判断を要するタスクは最先端のモデルに任せる必要があります。OpenRouter は「より多くのインテリジェンス」を売りにしていますが、Cognition は「より低いコストで同等のインテリジェンス」を売りにしています。後者の提案の方が長期的な方向性に近いと言えます。システムが生産経済に近づくほど、狭義のモデル融合とは似なくなり、ルーティング、委任、検証に似てきます。
7月下旬、StripeがOpenRouterを約100億ドルで買収する交渉を行っているとの報道があったが、この取引はまだ確認されていない。このシグナルは、Fusionが市場で認められたと解釈すべきではない。OpenRouterのコアバリューは特定のパネルにあるのではなく、500万人以上の開発者と400以上のモデルを接続する中立的なコールレイヤーにある。StripeはすでにOpenRouterの請求、課税、リスク管理を提供しており、開発者はStripe Projectsを通じてアカウントを作成し、APIキーを取得し、支払いに直接接続できる。Stripeが買収しようとしているのは、AI推論のためのトランザクションゲートウェイである可能性が高い。OpenRouterはモデルの選択、トークンの使用、コストを管理し、Stripeは価格設定、請求、支払いを処理する。これは、先に述べた価値判断に対する市場シグナルとなる。マルチモデル時代の価値は、タスクを監視し、コールを割り当て、決済を完了できるオーケストレーションレイヤーにある可能性が高く、Fusionは単にその上に構築された高コストのアップグレード戦略に過ぎない。
将来のマルチモデルシステムは、パネルを自動的に呼び出すのではなく、まずタスクの難易度、検証コスト、およびエラーペナルティを推定します。マルチモデルの発散探索は、より強力な単一モデル、拡張推論、および外部ツールが不十分な場合にのみ実行されます。トリガー率、増分成功率、および単位結果あたりの検証済みコストが、唯一意味のある製品指標です。フュージョンは、デフォルトのアーキテクチャや独立したカテゴリになるのではなく、低頻度の機能として残ります。
VI. 情報源
OpenRouter:Fusionで最先端のパフォーマンスを凌駕する
OpenRouter Fusion Routerのドキュメント
認知:デビン・フュージョン --- 35%のコスト削減で最先端のパフォーマンスを実現
マイクロソフトリサーチ:Switchcraft --- エージェントツール呼び出しのためのAIモデルルーター
言語モデルを組み合わせることは、どのような場合に役立つのか?
マルチエージェント推論により計算効率が向上する
単一エージェントLLMは、思考トークン予算が同等の場合、マルチホップ推論においてマルチエージェントシステムよりも優れた性能を発揮する。
エージェントの混合により、大規模言語モデルの機能が強化される
RouteLLM: 選好データを用いたLLMのルーティング学習
LitBench:クリエイティブライティング評価のためのベンチマーク
人工分析モデルの比較
進歩の代償:価格性能比とAIの未来
疑問点:モデル評議会とは何ですか?
Perplexityのユーザー例:金融研究のためのモデル評議会
Hermes Agent: エージェントの組み合わせに関するドキュメント
StripeがOpenRouterのグローバルAIモデルへのアクセスを支えています
Axios:StripeがOpenRouterに移行したとされる背景には何があるのか
この内容は情報提供および教育目的であり、BTCCに関連する投資助言ではありません。BTCCは信頼性・正確性・独自性に努めていますが、これらを完全に保証するものではありません。