AIの岐路:ウォール街がChatGPTとClaudeに「ノー」と言う理由とは?
chaincatcher著者:ジェフ(@IOSG)
民間AIが必要な理由
7月1日、パランティアのCEOアレックス・カープはCNBCで20分間のインタビューに応じたが、一部メディアはこれを「精神崩壊」と評した。カープによれば、企業は最先端の研究所にわずかなプレミアム料金を支払う一方で、自社の知的財産がモデルベンダーに流出するのを傍観しているという。彼はこの情報漏洩を「アルファの移転」と呼び、これはアーキテクチャレベルで発生していると述べた。つまり、クローズドソースのモデルに送信されるすべてのリクエストは、サービスプロバイダーのサーバーにプレーンテキストで届くということだ。番組放送の数日前、パランティアはNVIDIAと提携し、顧客が管理する環境でオープンなNemotronモデルを実行することを発表し、同時に9項目のAI主権宣言を発表していた。CNBCの番組放送後、PLTRの株価は8%上昇した。
過去20年間、企業はプロトコルレベルでの信頼に基づいてクラウドソフトウェアを採用し、それが機能してきました。各SaaSベンダーは企業データのごく一部しか把握しておらず、顧客データをコア製品にフィードバックするインセンティブはほとんどありません。Salesforceは販売チャネル、Workdayは人事、Jiraは開発イテレーションを把握し、AWSはストレージとコンピューティングの基盤を提供しています。しかし、今日のAIワークフローは、生産性を最大化するために、さまざまな部門を結びつける構造化されたコンテキストとともに、すべての資産を一度アップロードすることを推奨しています。善意はさておき、上流のサービスプロバイダーは、サーバー上で埃をかぶらせておくのではなく、このデータを使用して新機能を開発できるようになりました。
どちらの企業も勢いを緩める気配はない。Anthropicの年間売上高は5月に470億ドルに達し、2025年末の90億ドルから大幅に増加した。一方、OpenAIは2月に週間アクティブユーザー数が9億人を突破した。両社とも今春、新たな資金調達ラウンドを完了し、企業価値は1兆ドルに迫る勢いで、さらに高い評価額での新規株式公開(IPO)が期待されている。長年にわたるプライバシー侵害や知的財産権侵害の申し立ても、両社の勢いを衰えさせることはなかった。
既に対策を講じている企業もある。ChatGPTのローンチから3か月も経たない2023年2月、ウォール街の大手銀行はChatGPTの利用を制限した。同年5月、サムスンのエンジニアがChatGPTにチップのソースコードを漏洩させたことを受け、同社はネットワーク全体で生成型AIの利用を禁止した。これに対し、OpenAIは同年8月にChatGPT Enterpriseをローンチし、商用データをトレーニングに使用しないこと、そしてデータ保持ゼロ(ZDR)プロトコルを導入した。このプロトコルはその後、企業調達における標準要件となった。
しかし、契約は会社のアカウントのみを拘束するものです。IBMの調査によると、2025年までに、シャドウAI(従業員が個人アカウントを通じて会社のデータを無許可のAIツールに入力すること)がデータ侵害事件の5分の1に関与し、シャドウAIの多用によって侵害コストが平均67万ドル増加することが判明しました。セキュリティトレーニング会社Anagramが2025年に実施した調査では、4人の従業員が、タスクをより早く完了するためにAI使用ポリシーに違反しても構わないと回答しました。
企業は少なくとも、ZDR契約やトレーニングなしのサービスティアといった形で資金を投じることで、この状況から抜け出すことができる。また、政府機関やパランティアの顧客であれば、独自の導入オプションも用意されている。しかし、私たちのような一般ユーザーにとって、プライバシーAIの重要性は、裁判所からの召喚状が届くまで議論され続けるだろう。
2025年5月の裁判所命令により、OpenAIはユーザーが削除した消費者のチャットログさえも保持することを余儀なくされ、11月には、裁判官が2000万件のログを証拠としてニューヨーク・タイムズの弁護士に引き渡すよう命じた。その後、刑事事件が続いた。パリセーズ放火事件の被告のChatGPT記録が証拠として提出され、フロリダ州の二重殺人事件の宣誓供述書には、遺体の処理方法に関する容疑者の質問が記載されていた。サム・アルトマンは2025年7月のインタビューで、ChatGPTの会話は法的特権によって保護されておらず、訴訟ではOpenAIがユーザーのチャットログを「引き渡すよう求められる可能性がある」と認めた。
重要なのは、プライベートな会話を必要とするのは犯罪者だけではないということだ。人とAIとの会話が記録され、召喚状の対象となることは、ほとんどのユーザーが気づいていない監視の一側面を表している。2025年10月にコルモゴロフ法律事務所がアメリカのAIユーザー1,000人を対象に行った調査では、50%がこうした会話が召喚状の対象となる可能性があることを知らず、3分の2がこうした会話は弁護士や医師との相談と同様の保護を受けるべきだと考えていることが分かった。
検証可能な環境で動作する自己ホスト型またはオープンソースのモデルは急速に追いつきつつありますが、最も強力なバッチでも、最先端のクローズドソースモデルに比べて総合的な機能で約4ヶ月遅れています。このため、トークンマックス化に取り組む企業や個人は岐路に立たされています。プライバシー保護のためにモデルの品質を数ヶ月犠牲にするか、競合他社が生産性の向上を図っているにもかかわらず、機密情報をAnthropicのサーバーにアップロードし続けるか、どちらかを選択しなければなりません。
現在、市場には完璧な解決策は存在しない。本レポートでは、様々な関係者によるギャップを埋めるための取り組みを概説し、証明可能なプライバシー保護の下で最先端のインテリジェンスが企業や一般ユーザーに提供されるまでには、どれほどの道のりがあるかを考察する。
プライバシーは現在どのように実現されているか
プライバシーAIは単一のプロジェクトではなく、現在市場に出回っているすべての仕組みは、同じ事象に対応しています。つまり、デバイスから送信されたメッセージがネットワークを経由して、モデルを実行するマシンに到達し、応答を返すという流れです。仕組み間の違いは、この経路上のどこに平文が存在するか、誰がそれを読み取れるか、そして応答のプライバシーを検証するために何を使用するかという点にあります。
プロトコルレベルのプライバシー
このレベルでは、あなた以外にも他の人があなたの平文プロンプトを読むことができ、次に何が起こるかは完全に約束に依存します。
契約に基づくデータ保持ゼロは、企業向けのソリューションです。サービスプロバイダーは、お客様の身元を把握し、お客様のリクエストを処理した上で、契約と信頼に基づき、データを保持しないことを約束します。
匿名プロキシはあなたの身元を消去しますが、あなたの発言内容を暗号化しません。下流のサービスプロバイダーは、それぞれのポリシーに従って平文を扱います。利用規約はプロバイダーによって異なります。例えば、Duck.ai(DuckDuckGoのチャットボット製品)はモデルベンダーと削除に関する契約を交渉する場合がありますが、Veniceはユーザーがサービスプロバイダーがすべてのデータを保持すると想定していることを前提としており、どちらの側もそれを検証することはできません。
マシン間の経路の各セグメントはTLS上で動作しますが、TLSはパイプラインのみを暗号化するため、受信側はすべての情報を読み取ることができます。リレーは通常、この情報へのアクセス権限を分離するためにオブリビアスHTTP(RFC 9458)を使用します。これは、友人がメモを渡すような仕組みです。友人は誰が渡したかは分かりますが、内容を読むことはできません。一方、受信者は内容を読むことはできますが、誰が書いたかは分かりません。OHTTPは2024年1月にIETF標準となり、現在では多くの企業がCloudflareやFastlyからレンタルしたOHTTPリレー上で本番トラフィックを運用しています。
これは、数学的な問題により、クローズドソースモデルへのアクセス時に達成可能なプライバシーの限界でもあります。現在、フラッグシップレベルのトレーニングには数十億ドルもの費用がかかり、これらの研究所の1兆ドル近い評価額は、モデルの重みの独占性に基づいています。モデルの能力ギャップの期間がプレミアムの期間を決定するため、研究所は重みファイルを国家機密として厳重に管理しています。
Meta社はこの実験を間接的に実施した。2023年2月にリリースされたLLaMAモデルは当初研究者のみに公開されていたが、1週間以内に重みがシード形式で4chanに流出した。その1週間後、llama.cppによって最小の7BモデルをMacBook上でローカルに実行できるようになり、さらに3日後、スタンフォード大学は同じモデルでチャットアシスタントAlpacaを600ドル未満で微調整した。この流出により、Llamaの運用コストは電気代のみにまで削減され、ファイルを持っている人なら誰でも自宅で実行できるようになった。2023年7月、Meta社はLlama 2を正式にオープンソース化し、7億人の月間アクティブユーザーに関する条項を除外した商用ライセンスを付与した。重みは実行され、プレミアムがそれに続いた。
理論上、最先端の研究室はクローズドソースモデルの推論に対する証明(リモート証明)を提供できるが、証明はどのコードセグメントがプロンプトを読み取ったかを証明するだけで、そのコードがそれに対して何をしたかを証明することはできない。サーバーがデータを保持したかどうかを判断するには、サービスコードを監査し、ハードウェアによって報告されたハッシュに再構築する必要がある。しかし、サービスコードが渡されると、研究室は利益率を支えるバッチ処理とキャッシュ技術も放棄することになり、これらの技術は将来のすべての世代のモデルに移行していくことになる。AppleとMetaは、iPhoneとWhatsAppの背後にあるサービススタックのリモート証明を提供できる。なぜなら、彼らの利益はデバイスと広告から得られており、サービスコードを公開してもほとんどコストがかからないからだ。
これが、主力モデルの重み付けやサービスコードが外部オペレーターに提供されない理由です。外部オペレーターがいなければ第三者による認証は存在せず、認証がなければ検証可能なプライバシーはオープンソースモデルでのみ実現します。
構造レベルのプライバシー
このカテゴリーの各メカニズムは、信頼の約束をハードウェア、暗号技術、または物理的な証明に置き換えるものですが、それぞれプライバシーの向上にかかるコストが異なります。これは主に、オープンソースのモデルしか実行できないためです。
TEE(Trusted Execution Environment)機密コンピューティングは、ハードウェアエンクレーブ(マシンオペレーターでさえ開けることができない、チップ上の密閉されたチャンバー)内で推論を実行します。チップは、実行されたコードのモデルとセグメントの詳細を示す証明書に署名します。
プロンプトはエンドポイントでのみ封印されます。プロキシを介した経路には、平文を読み取ることができる役割が残っており、プロトコルによってのみ、プロキシがリレーの内容を記録したり漏洩したりすることが防止されます。
E2EE(エンドツーエンド暗号化)は、読み取り可能な中継地点を遮断します。ユーザーのデバイスは、エンクレーブの鍵を使用してプロンプトを暗号化し、途中のすべての中継地点は、エンクレーブのみが開封できる封印された封筒を伴います。
信頼はクライアント側にある。プロンプトの暗号化と認証の検証を担当するコードは、この保証を取り消すこともできる。したがって、検証可能なエンドツーエンド暗号化(E2EE)には、実績のあるエンクレーブと、オープンで再現可能なクライアントコードの両方が必要となる。
TEEのシンプルさと比較すると、E2EEのコストはエンジニアリング上の負担であり、機能統合の速度も低下させる。E2EEではプロキシがブラインドメッセンジャーとなるため、平文の読み取りに依存するすべての機能はクライアントキーを中心に再構築するか、エンクレーブ内部でのみ再構築する必要がある。
FHE(完全準同型暗号、およびそのMPC派生版)は、信頼できる第三者の存在を完全に排除します。サーバーは、決して開けることのできない鍵のかかった箱の中で暗号文の計算を実行します。鍵はあなただけが持っています。一方、MPC(マルチパーティ計算)は、プロンプトを複数の参加者に分散された秘密の共有に分割し、すべての参加者が共謀しない限り、同じ効果を実現します。
その代償は速度です。FHEは本来、加算と乗算しか実行できないため、変換処理に必要な非線形ステップを高コストで再構築する必要があります。暗号文に対する推論コストは平文の1万倍から10万倍にもなり、小規模モデルではトークン1つあたり数秒から数分かかりますが、暗号化されていない状態ではわずか数ミリ秒で済みます。
暗号化計算に特化したチップによってこの差は縮まることが期待されているが、最初のプロトタイプのデモが完了するのは2026年初頭になる見込みで、商用版の登場にはさらに数年かかるだろう。
ローカル推論は、この経路を直接排除します。モデルは、中継器、サーバー、サービスプロバイダー、検証要件を一切必要とせず、お客様自身のハードウェア上で動作します。
明らかなコストは、費用とモデル性能です。gpt-oss-120bは、人工知能分析指標でGLM-5.2の約半分のスコアですが、サイズは65GBで、市販のフラッグシップゲーミンググラフィックカード2枚のVRAMの合計を上回ります。フル精度のGLM-5.2は、8枚のカードを搭載したデータセンターノードでしか動作せず、GPUだけで30万ドル以上かかります。
しかし、こうした構造的な制約を超えて、推論処理をエンクレーブに組み込むコストは低下しています。シングルカード推論では、エンクレーブクラウドサービスプロバイダーであるPhalaのベンチマークによると、エンクレーブモードのH100のスループット損失は平均で7%未満であり、大規模モデルではほぼゼロです。これは、主なコストがチップ内部での計算ではなく、チップへのデータ転送にあるためです。マルチカード推論では、NVIDIAの次世代GPUであるBlackwellがチップ間トラフィックの直接暗号化をサポートするようになりましたが、旧型のH100では、同じ効果を得るにはCPUホストを経由してルーティングする必要があり、帯域幅は7分の1に低下します。NVIDIA独自のBlackwellベンチマークによると、エンクレーブモードの397Bモデルのスループット損失は8%未満です。こうした進歩により、プライバシー推論のパフォーマンス損失はもはや決定的な制約ではなくなりました。
実際、エンクレーブ自体は、オペレーターにとって運用コストをほとんど増加させません。2023 年以降のすべての H100 にはエンクレーブ モードが付属しており、追加コストは暗号化によるスループットの低下であり、追加のチップではありません。現在、Azure の機密 H100 SKU のレンタル価格は、依然として 1 時間あたり 8.90 ドルですが、エンクレーブなしの場合は 6.98 ドルで、従来のクラウド設備よりも 27% 高いマークアップとなっています。一方、エンクレーブを専門とする Phala などのオペレーターは、機密モードの H100 を 1 時間あたり 3.80 ドルからレンタルしており、Lambda の標準 SXM カードの価格帯である 3.99 ドルから 4.29 ドルよりも低くなっています。ホスト型 API ソリューションでは、NEAR AI は、gpt-oss-120b の場合、100 万トークン入力あたり 0.15 ドル、出力あたり 0.55 ドルでアテステーション付きのエンドポイントを提供しており、Amazon Bedrock、Together、Groq のプレーンテキスト ルートと同等です。マルチチップ並列処理を必要とするモデルであっても、NEAR AIのGLM 5.2の価格はFireworksと同一であり、より大型のKimi K2.6では、入力コストが15%、出力コストが4%安くなっています。
これらの新しいプライバシー推論プロバイダーは、市場シェアを獲得するために利益を浪費しているかもしれないが(これは成長を目指す市場企業すべてに当てはまる)、構造的な傾向としては、消費者と事業者双方にとってプライバシーのコストが低下している。
オープンソースモデルが勝利する方法
パフォーマンス上のオーバーヘッドは圧縮されているものの、最先端モデルとSOTAオープンソースモデルの間には依然として明らかなギャップが存在する。生産性の最大化を目指す企業は、最先端の研究機関が自社の知的財産を盗用しないという信頼を依然として必要としている。
ギャップは依然として存在するが、ブリッジウォーター傘下のAIAラボとシンキング・マシーンズは6月30日に事例を示した。専門家の注釈で微調整されたオープンモデルが、精度とコストの両面で最先端モデルを凌駕したのだ。
本研究では、研究チームはTinker(Thinking Machinesが提供するファインチューニングAPIサービス)上でQwen3-235Bのファインチューニングを行った。まずベンダーからアノテーションを取得し、このデータバッチで最初のラウンドをトレーニングした後、分岐したサンプルを同社の投資担当者に送り返して再アノテーションを依頼した。トレーニングには強化学習(GRPO)に加え、ラウンドロビン・バッチ処理(各タスクが順番にバッチを生成する)、CISPO損失(単一の回答がモデルをどれだけ引き伸ばせるかを制限する)、オンポリシー蒸留(現在の最適なチェックポイントに固定することで、モデルがより弱いコピーから学習しないようにする)という3つの改良を加えた。
すべてのタスクは、投資担当者の日常業務から抽出されました。ニュース記事が経営幹部の投資専門家にとって重要かどうか、中央銀行の文書が将来の金利変更を示唆しているかどうか、文書や電子メールでテンプレートフレーズをどこから始めるかなどです。スコアは独立したテストセットから取得され、最先端のモデルは簡単なプロンプトで平均約50%、専門家のプロンプトでは78.2%にしか達せず、投資担当者が設定した80%のしきい値を下回りました。微調整されたQwenは84.7%を達成し、これは元のテキストによると、最先端の最適モデルよりも29.8%少ない間違いを犯し、推論コストが13.8分の1になったことを意味します。
https://thinkingmachines.ai/news/learning-to-replicate-expert-judgment-in-financial-tasks/
この事例は、オープンソースモデルが精度とコストの両面で優位に立てることを示していますが、トレーニングプロセスは依然として非公開ではありません。プロセスで使用される専門家の注釈は、ブリッジウォーター社の専有データであり、ティンカー社のサードパーティサービスを経由し、ZDRプロトコルと同じ信頼レベルに達しています。また、同ファンドはコンピューティングパワーをレンタルしており、トレーニング全体は同社が管理していないマシン上で実行されました。信頼を前提とせずにこの方式を求める購入者にとって、現在選択肢は非常に限られています。ベアGPUクラスターをレンタルすることで、トレーニングプロセスをクラウドオペレーターが読み取れるようになります。クラスターを購入すればデータホスティングの問題は解決しますが、コストが急騰します。
認証付きのルートがようやく登場しました。3月にWorkshop LabsとTinfoilは、顧客のみがキーを管理できる単一の8カードノード上のTinfoilエンクレーブで動作するポストトレーニングスタックであるSiloをリリースしました。記事によると、エンクレーブのコストにより2時間のトレーニングセッションに11分が追加され、このスタックはベースウェイトを固定し、その上に小さなアダプタのみをトレーニングすることで、1兆パラメータのモデル(Kimi K2 Thinking)に対応できます。課題は、強化学習ではコンポーネント間でデータをやり取りする必要があり、まさにそのデータ移動でエンクレーブのコストが発生するという点にあります。
Siloのリリースから1ヶ月も経たないうちに、Workshop LabsはThinking Machinesに買収され、同コミュニティ内で次世代のBridgewater型強化学習ループを実行するために必要なすべてのコンポーネントが、現在では同じ会社の傘下にある。
ハーネス層におけるプライバシー
プライベート推論メカニズムの外部に存在する別の問題があります。これらのメカニズムはそれぞれプロンプトからモデルへのパスを管理しますが、エージェントによって開始されるすべての外部ツール呼び出しは、推論レイヤーが根本的にアクセスできない経路を開きます。最近のハーネスエンジニアリングの傾向は、この問題をさらに悪化させます。モデルを取り巻くすべてのツール、メモリ ストア、データ ソースは、ワークフローの一部をプレーンテキストで読み取る別の宛先となります。カレンダー サーバーはスケジュールを読み取り、データベース サーバーはクエリを読み取ります。完全にローカルなエージェントであっても、トレーニング セット外の情報が必要な場合は、検索語をプレーンテキストで検索エンジンに送信する必要があります。サーバーはプレーンテキストを読み取ることができないため、質問に答えることができないからです。
主流のソリューションは依然としてプロトコル層をデフォルトとしています。RunlayerやMintMCPのような企業は、中央ゲートウェイを使用してすべてのツールトラフィックを制御し、リクエストが送信される前に個人識別情報(PII)をマスキングします。ゲートウェイはまた、トラフィックを受信できるサーバーを決定し、検証されていないサーバーをブロックし、将来の参照のために各呼び出しの宛先と内容をログに記録します。これらの制御が独立した監査(SOC 2)を受けている場合でも、ツールサーバーは応答するために平文クエリを読み取る必要があり、コピーを保持するかどうかは、ツールハーネス内のすべてのツールごとに乗算される独自の保持ポリシーに依存します。さらに、ゲートウェイ自体が、検証ではなく経路上の信頼に依存する追加の読み取り側となります。
構造レベルのソリューションは、中間層を対象としています。例えば、Phalaはウォレット、コード実行、データソースをカバーするTEE内にMCPサーバーを直接ホストし、ユーザーがオペレーターを信頼するのではなく、証明書によってプライバシーステートメントを検証できるようにします。しかし、TEEでホストされるツールは、依然として平文でクエリをサービスプロバイダーに送信する必要があり、エンクレーブは送信者のみを保護し、送信先は保護しません。
読み取りを行わずに応答できるようになった宛先はごくわずかで、しかも構造化クエリの場合に限られます。AppleはiPhone向けにプライベート情報取得機能を提供しており、発信者番号を公開することなく、迷惑電話データベースと照合できます。MicrosoftもEdgeブラウザのパスワードに同様の仕組みを採用しています。MongoDBのクエリ可能暗号化機能を使えば、クライアントは送信前にフィールドを暗号化できるため、サーバーは暗号文のみに基づいて等価性や範囲のマッチングを実行できます。
しかし、自由形式の検索では、今日の最良の回答は依然として信頼に依存しており、検証可能な暗号化検索はまだ研究室から実用化されていません。Braveは、Googleではなく独自の400億ページのインデックスでデータ保持ゼロを約束していますが、それでもプロトコル層に属します。Exaは、ユーザーのキーワードを意味的に埋め込み、意味に基づいて結果をマッチングするニューラルインデックスを構築しましたが、この埋め込みステップは依然としてExaサーバー上のプレーンテキストから始まります。MITの2023年のTiptoe論文は、クエリを公開せずに3億6000万のウェブページでランキングを達成しましたが、各検索はサーバーのコンピューティングパワーを大量に消費し、ランキングの品質は暗号化されていない検索とは異なります。Appleの2024年のWally論文は、実際のクエリをおとりの中に隠すことで通信コストを最大31倍削減しますが、この計算は数百万の同時クエリでのみ安価になり、現在のプライベート検索システムでその規模を持つものはありません。
暗号化検索は実現可能だが、性能と価格の面で商業的に採算の取れるレベルにはまだ達していない。
見通し
プライベートAIの需要は高まっている。Venice AIは最近、登録ユーザー数が350万人を超え、月間処理量が1兆3000億トークンに達した。その後、10億ドル相当のシリーズA資金調達ラウンドを完了した。ProtonはVenice AIの直接の競合相手であり、同社のチャット製品Lumoはローンチから1年以内にユーザー数が1000万人を超えた。インフラストラクチャの面では、Phalaは現在、OpenRouter上で1日あたり20億~30億トークンを処理している。Duck.aiはgpt-oss-120bとGemmaをTinfoilのエンクレーブにルーティングし、ユーザープロキシを超えた検証可能なプライバシーを提供している。これは、おそらくプライベート推論の最大のチャネルである自己ホスティングを考慮に入れていない。モデルは自身のハードウェア上で実行され、使用痕跡を残さないからである。
しかし、主流のAIの大きな流れの中で、プライバシーAIはごくわずかな部分しか占めておらず、このギャップは最先端の研究所が意図的にこの需要を満たすときにのみ埋まるだろう。5月、Googleはすべての製品で320兆トークンを処理したが、これはVeniceの月間スループットがGoogleの18分にほぼ相当することを意味する。昨年11月、GoogleはプライベートAIコンピューティング(PAC)を立ち上げ、Gemini駆動の機能を会社自体から隔離された密閉されたTPUエンクレーブで実行し、設計はNCCグループによって独立して監査された。しかし、問題は、PACがパーソナライズされたレコメンデーションや音声要約などのPixelのいくつかの機能をカバーしているだけで、何億人ものユーザーが使用しているGeminiアプリケーションはカバーしていないことである。Googleは、これらの機能がトークンの販売ではなく、デバイスと広告を通じて収益化されているため、設計を監査人に渡すことをいとわない。
現在のホスティング型ソリューションも完璧ではありません。エンドツーエンド暗号化(E2EE)による最高のプライバシーを求めるユーザーは、サービスプロバイダが読み取れない場所に新機能が再構築されるまで待たなければなりません。プライベートハーネスは依然としてサービス層のプロトコルに依存しています。適正価格のトレーニング後サポートでは、最適な微調整結果を得るためにサードパーティのサプライヤーを信頼する必要があります。セルフホスティングはすべてのサービスプロバイダを完全に排除しますが、最も強力なオープンソースモデルをローカルで実行するには、それらを収容する建物よりもコストがかかる可能性があります。
欠点はあるものの、プライベートAIは現実的かつ手頃な価格の選択肢となり、残りのギャップは縮小しています。一般消費者にとって、LumoやVeniceのオープンモデルのプライベートチャットはログなしの約束のもと無料で利用できます。一方、VeniceやTinfoilのサブスクリプションは18ドルから20ドルで同じチャットをエンクレーブにカプセル化しており、ChatGPTのサブスクリプションよりも高価ではありません。企業ワークフローでは、認証付きエンドポイントはプレーンテキストのルートよりもさらに安価になっています。NEARのE2EE APIのようなエンドポイントは、暗号化されたコンテキストをエンクレーブに取り込むことができ、メモリ、ファイルアップロード、カスタム命令は現在E2EE上で動作します。認証付きトレーニング後処理に関しては、NVIDIAの次期Vera Rubin NVL72は、機密コンピューティングをBlackwellの8カードノードから72カードラックに拡張し、IPを公開することなく最先端のRLループをより実現可能にします。
しかし、真の価値獲得は、こうした価格圧縮レベルの先にあります。プライバシーは既に存在する場所ではほぼ無料ですが、主流のエージェントワークフローにはまだ適用されていません。エンクレーブのレンタルと販売に注力する事業者は、堀ではなく標準チップ上のスイッチを握っているに過ぎず、プロトコルレイヤーゲートウェイは従来のミドルウェアと競合しています。防御可能な領域は、このレポートで未解決のまま残されている半分の部分、つまりエンクレーブに閉じ込められたトレーニングループ、エンドツーエンドで密封されたツール呼び出し、そして目に見えない用語検索インデックスです。これらのいずれかを最初に実現した者は、価格競争ではコモディティ化できないものを販売することになるでしょう。プライバシーAIを追求する資本は、スイッチではなく、ギャップを買収すべきです。
では、信頼するか検証するか?実行負荷が高くエージェント負荷の高いタスクでは、信頼を選択してください。なぜなら、すべてのツール呼び出しは本質的に、エンクレーブで封印できない宛先にプレーンテキストを送信するため、最先端のモデルはこのようなループにおいてその価格に見合う価値があるからです。一方、企業を競合他社と差別化する高度な思考に関しては、検証を選択してください。長年の専門経験から抽出された戦略、計画、判断こそが、まさに競争の激しいアルファです。前進するための道は、企業管理の範囲内で、これらの独自の知見を用いてオープンソースモデルを微調整することです。企業のアルファが存在する領域では、専門家によって調整されたオープンモデルは、精度とコストの両面で最先端のモデルを同時に凌駕しており、プライバシー環境でそれらを構築するためのインフラストラクチャは、着実に整備されつつあります。
この内容は情報提供および教育目的であり、BTCCに関連する投資助言ではありません。BTCCは信頼性・正確性・独自性に努めていますが、これらを完全に保証するものではありません。