人工智能的十字路口:为什么华尔街对 ChatGPT 和 Claude 说“不”?
chaincatcher作者:Jeff @IOSG
为什么需要私有人工智能
7月1日,Palantir首席执行官Alex Karp接受了CNBC长达20分钟的采访,一些媒体称之为“精神崩溃”。Karp表示,企业向尖端实验室支付象征性的溢价,却眼睁睁地看着自己的知识产权流向模型供应商。他将这种泄露称为“alpha转移”,这种转移发生在架构层面:发送给闭源模型的每一个请求都会以明文形式到达服务提供商的服务器。就在节目播出前几天,Palantir宣布与NVIDIA合作,在客户可控的环境中运行开源的Nemotron模型,并同时发布了一份包含九点人工智能主权声明的声明。CNBC节目播出后,PLTR股价上涨了8%。
过去二十年来,企业采用云软件主要基于协议层面的信任,而且这种模式行之有效。每个SaaS供应商只能看到企业数据的一部分,而且大多数供应商缺乏将客户数据反馈到其核心产品中的动力。Salesforce关注销售渠道,Workday关注人力资源,Jira关注开发迭代,而AWS则提供存储和计算的基础架构。然而,如今的AI工作流程提倡一次性上传所有资产以及连接各个部门的结构化上下文,以最大限度地提高生产力。抛开善意不谈,上游服务提供商现在可以利用这些数据开发新功能,而不是让它们闲置在服务器上积灰。
两家公司的发展势头都丝毫没有减弱;Anthropic 的年收入在 5 月份达到了 470 亿美元,较 2025 年底的 90 亿美元实现了显著增长;OpenAI 的周活跃用户数在 2 月份也突破了 9 亿。这两家公司都在今年春季完成了新一轮融资,估值均接近 1 万亿美元,预计 IPO 时的估值还会更高。多年来,隐私和知识产权方面的争议并没有让这两家公司失去发展动力。
一些公司已经采取了行动。2023年2月,在ChatGPT发布不到三个月后,华尔街主要银行就限制了它的使用。2023年5月,在一名三星工程师将芯片源代码泄露给ChatGPT后,该公司在其网络中禁止使用生成式人工智能。作为回应,OpenAI于同年8月推出了ChatGPT Enterprise,承诺不使用商业数据进行训练,并采用了零数据保留(ZDR)协议,该协议随后成为企业采购的标准要求。
然而,合同仅能锁定公司账户。IBM发现,到2025年,影子AI(员工通过个人账户将公司数据输入未经授权的AI工具)将导致五分之一的数据泄露事件,而大量使用影子AI平均会使泄露成本增加67万美元。安全培训公司Anagram在2025年进行的一项调查显示,四名员工表示,为了更快地完成任务,他们愿意违反AI使用政策。
企业至少可以通过零数据限制 (ZDR) 合同和非训练服务层级来花钱规避风险;如果您是政府机构或 Palantir 的客户,还可以选择自主部署方案。然而,对于像你我这样的普通用户而言,隐私人工智能的重要性仍然存疑,直到法院传票送达家门口。
2025年5月的一项法院命令迫使OpenAI保留用户已删除的聊天记录。同年11月,一名法官下令将其中2000万条聊天记录移交给《纽约时报》的律师作为证据。随后,刑事案件接踵而至:在帕利塞兹纵火案中,被告的ChatGPT聊天记录被作为证据提交;在佛罗里达州的一起双重谋杀案中,一份宣誓书引用了嫌疑人关于如何处理尸体的提问。萨姆·奥特曼在2025年7月的一次采访中也承认,ChatGPT对话不受法律特权保护,在诉讼中,OpenAI“可能被要求交出”用户聊天记录。
关键在于,并非只有犯罪分子才需要私密对话。人与人工智能之间的对话被存档并可能被传唤,这构成了一种监控手段,而大多数用户对此却毫不知情。科尔莫戈罗夫律师事务所于2025年10月对1000名美国人工智能用户进行的一项调查发现,50%的用户不知道这些对话可能被传唤,而三分之二的用户认为这些聊天记录应该像咨询律师或医生一样受到保护。
在可验证环境中运行的自托管或开源模型正在迅速追赶,但即使是最强大的模型,其整体性能也比最先进的闭源模型落后约四个月。这使得从事代币最大化的企业和个人面临抉择:要么为了隐私而牺牲几个月的模型质量,要么继续将敏感材料上传到 Anthropic 的服务器,因为竞争对手正通过这种方式获得生产力优势。
目前市场上尚无完美解决方案。一份报告概述了各方为缩小差距所做的努力,并指出,在可验证隐私的前提下,尖端智能技术距离真正惠及企业和普通用户还有很长的路要走。
目前如何实现隐私
隐私人工智能并非单一项目,但目前市面上所有机制都旨在解决同一问题:用户发出请求,信息在网络中传输,最终到达运行模型的机器,并返回响应。不同机制之间的区别在于,明文数据在传输过程中存在于何处、谁可以读取这些数据,以及用于验证响应隐私性的机制。
协议级隐私
在这个级别,除了你之外,其他人也可以阅读你的纯文本提示,接下来发生的事情完全取决于一个承诺。
零保留合约是企业级解决方案。服务提供商了解您的身份,处理您的订单,并承诺不会保留您的订单,这一承诺由合同和信誉共同保障。
匿名代理会抹去你的真实身份,但不会加密你所说的话;下游服务提供商仍然会根据各自的政策处理明文数据。条款因服务提供商而异;例如,Duck.ai(DuckDuckGo 的聊天机器人产品)可能会与模型供应商协商删除协议,而 Venice 则假定用户会认为服务提供商会保留所有数据,但双方都无法核实。
机器间路由的每个环节都运行在 TLS 协议上,TLS 仅加密传输管道;接收方可以读取所有信息。中继服务器通常使用不经意 HTTP(Oblivious HTTP,RFC 9458)来分离这种知情权,其工作原理类似于朋友传递纸条。朋友知道是谁传递的,但无法读取内容;接收者可以读取内容,但不知道是谁写的。OHTTP 于 2024 年 1 月成为 IETF 标准,许多公司现在都在从 Cloudflare 和 Fastly 租用的 OHTTP 中继服务器上运行生产流量。
由于数学上的限制,这也是访问闭源模型时所能达到的隐私极限。目前旗舰级模型的训练成本高达数十亿美元,而这些实验室近万亿美元的估值正是基于模型权重的独占性。模型能力差距的持续时间决定了溢价的持续时间;因此,实验室将权重文件视为国家机密进行保护。
Meta 一直在暗中进行这项实验。2023 年 2 月发布的 LLaMA 模型最初仅对研究人员开放,但不到一周,其权重就以种子文件的形式泄露到了 4chan 论坛。一周后,llama.cpp 文件使得最小的 7B 模型能够在 MacBook 上本地运行;三天后,斯坦福大学利用同一模型,以不到 600 美元的价格对聊天助手 Alpaca 进行了微调。这次泄露将 Llama 的运行成本降低到了电费,使得任何拥有该文件的人都可以在家运行它。2023 年 7 月,Meta 正式开源了 Llama 2,并采用商业许可,但其中排除了 7 亿月活跃用户的限制条款。权重得以运行,付费用户也随之而来。
理论上,尖端实验室可以为闭源模型的推理提供证明(远程验证),但证明只能证明哪段代码读取了提示信息,而无法证明该代码如何处理提示信息。要确定服务器是否保留了数据,我们需要审核服务代码,并根据硬件报告的哈希值进行重构。然而,一旦服务代码移交,实验室也放弃了支撑利润的批处理和缓存技术,而这些技术将会迁移到未来每一代模型中。苹果和Meta可以为iPhone和WhatsApp背后的服务栈提供远程验证,因为它们的利润来自设备和广告,公开服务代码几乎没有任何成本。
这就是为什么旗舰模型的权重和服务代码不会泄露给外部运营商的原因。没有外部运营商,就没有第三方认证;没有认证,可验证的隐私保护就只能存在于开源模型中。
结构级隐私
该类别中的每种机制都用硬件、加密或物理证明来取代信任承诺,但每种机制在隐私升级方面都会产生不同的成本,主要是因为它们只能运行开源模型。
TEE(可信执行环境)机密计算在硬件隔离区(芯片上的一个密封腔室,即使是机器操作员也无法打开)内运行推理;芯片将签署一份证明,详细说明运行的是哪个模型和代码段。
提示信息仅在终端端被密封。代理服务器所经过的路径上仍然存在可以读取明文的节点,只有协议才能阻止代理服务器记录或泄露中继的内容。
端到端加密 (E2EE) 可隔离可读中继。用户设备使用安全区域的密钥加密提示信息,并且中间的每一跳都携带一个密封的信封,只有安全区域才能打开。
信任在于客户端。负责加密提示信息和验证认证的代码也有权撤销此保证。因此,可验证的端到端加密既需要经过验证的安全区域,也需要开放且可复现的客户端代码。
与TEE的简洁性相比,E2EE的缺点在于其工程负担,这也会减缓功能集成。E2EE将代理服务器变成了一个盲信使,因此所有依赖读取明文的功能都必须围绕客户端密钥进行重建,或者只能在安全区内部进行重建。
全同态加密(FHE,及其多方计算变体)完全移除了可信方。服务器在一个永远无法打开的加密容器中对密文进行计算;密钥仅掌握在您手中。而多方计算(MPC)则将提示信息分割成多个秘密份额,分发给多个参与方,除非所有参与者串通,否则也能达到同样的效果。
代价是速度。全同态加密(FHE)本身只执行加法和乘法运算,因此Transformer操作所需的非线性步骤必须以极高的代价进行重构。密文推理的成本是明文的1万到10万倍,在小型模型上,每个令牌的推理需要几秒到几分钟,而在未加密的情况下,只需几毫秒。
为加密计算定制的芯片有望缩小差距,但第一个原型要到 2026 年初才能完成演示,而商业版本还需要几年时间才能问世。
本地推理直接消除了这一环节。模型运行在您自己的硬件上,无需中继、服务器、服务提供商,也无需验证。
显而易见的成本是费用和模型性能。gpt-oss-120b 在人工智能分析指数上的得分约为 GLM-5.2 的一半,但其体积高达 65GB,超过了市面上两款旗舰级游戏显卡显存的总和。全精度 GLM-5.2 只能在配备 8 张显卡的数据中心节点上运行,仅 GPU 的成本就超过 30 万美元。
然而,除了这些结构性限制之外,将推理部署到安全区的成本正在降低。在单卡推理中,安全区云服务提供商 Phala 的基准测试表明,H100 安全区模式下的吞吐量损失平均低于 7%,在大模型上几乎为零,因为主要成本在于将数据传输到芯片内部,而不是芯片内部的计算。在多卡推理中,NVIDIA 的下一代 GPU Blackwell 现在支持芯片间流量的直接加密,而旧款 H100 只能通过 CPU 主机路由流量来实现相同的效果,且带宽仅为 H100 的七分之一。NVIDIA 在 Blackwell 上进行的基准测试表明,397B 模型在安全区模式下的吞吐量损失低于 8%。随着这些技术的进步,隐私推理的性能损失不再是决定性的制约因素。
事实上,加密隔离区本身几乎不会给运营商增加任何额外的运营成本。2023 年之后生产的所有 H100 都自带加密隔离区模式,额外的成本是加密造成的吞吐量损失,而不是额外的芯片费用。目前,Azure 上保密型 H100 SKU 的租赁价格仍为每小时 8.90 美元,而未启用加密隔离区的租赁价格为每小时 6.98 美元,比传统云设施的价格高出 27%。另一方面,像 Phala 这样专注于加密隔离区的运营商,其保密模式 H100 的租赁价格低至每小时 3.80 美元,低于 Lambda 标准 SXM 卡 3.99 美元至 4.29 美元的价格区间。在托管 API 解决方案方面,NEAR AI 提供带有认证功能的端点,输入每百万个令牌 0.15 美元,输出每百万个令牌 0.55 美元(gpt-oss-120b 编码),与 Amazon Bedrock、Together 和 Groq 上的明文路由价格相当。即使对于需要多芯片并行处理的模型,NEAR AI 的 GLM 5.2 定价也与 Fireworks 相同,而对于更大的 Kimi K2.6,输入价格便宜 15%,输出价格便宜 4%。
尽管这些新的隐私推断提供商可能正在烧钱抢占市场份额(这适用于市场上任何想要发展壮大的公司),但结构性趋势是,消费者和运营商的隐私成本都在下降。
开源模式如何取胜
尽管性能开销有所降低,但尖端模型与最先进的开源模型之间仍然存在明显的差距。追求最高生产力的企业仍然需要信任尖端实验室不会窃取其知识产权。
尽管差距依然存在,但 Bridgewater 旗下的 AIA Labs 和 Thinking Machines 在 6 月 30 日提供了一个案例:一个通过专家注释进行微调的开放模型,在准确性和成本方面都同时优于尖端模型。
在这项研究中,研究团队使用 Tinker(Thinking Machines 提供的托管微调 API 服务)对 Qwen3-235B 模型进行了微调。他们首先从供应商处获取标注数据,用这批数据进行第一轮训练,然后将训练结果不同的样本发送给公司的投资人员进行重新标注。训练过程中使用了强化学习(GRPO),并进行了三项改进:轮询批处理(每个任务轮流生成一批数据)、CISPO 损失(限制单个答案对模型的影响范围)以及策略内蒸馏(锚定到当前最优检查点,以确保模型不会从较弱的副本中学习)。
所有任务均源自投资人员的日常工作流程:例如,一篇新闻文章对高管投资专业人士是否重要,央行文件是否暗示未来利率变动,以及在文档或电子邮件中使用模板短语时应该从何入手。评分来自一个独立的测试集,最先进的模型在简单提示下的平均准确率约为 50%,在专家提示下也仅达到 78.2%,低于投资人员设定的 80% 的阈值。经过微调的 Qwen 模型达到了 84.7%,根据原文,这意味着它比最先进的最优模型少犯了 29.8% 的错误,推理成本也降低了 13.8 倍。
https://thinkingmachines.ai/news/learning-to-replicate-expert-judgment-in-financial-tasks/
这个案例表明,开源模型在准确性和成本方面都能胜出,但训练过程仍然不具备私密性。训练过程中使用的专家标注数据是桥水基金的专有数据,经过廷克的第三方服务处理,最终达到与零信任度协议相同的信任级别。该基金还租用了计算资源,整个训练过程都在其从未控制过的机器上运行。如今,想要采用这种模式但又不想承担信任风险的买家选择非常有限。租用裸GPU集群可以让云运营商了解训练过程。购买集群可以解决数据托管问题,但成本会急剧上升。
带有认证机制的方案已经问世。今年三月,Workshop Labs 和 Tinfoil 联合发布了 Silo,这是一个后训练堆栈,运行在单个 8 卡节点上的 Tinfoil 安全区内,密钥完全由客户控制。文章指出,安全区的成本会使原本两小时的训练过程增加 11 分钟,但该堆栈可以通过冻结基础权重并仅基于这些权重训练小型适配器,来支持拥有万亿参数的模型(例如 Kimi K2 Thinking)。挑战在于,强化学习需要在组件之间来回传输数据,而数据传输正是安全区成本的来源。
Silo 发布不到一个月后,Workshop Labs 就被 Thinking Machines 收购了,现在运行下一个 Bridgewater 式 RL 循环所需的所有组件都归同一家公司所有。
安全层隐私
还有一个问题存在于所有私有推理机制之外。这些机制各自管理从提示到模型的路径,而代理发起的每一次外部工具调用都会开辟一条推理层根本无法触及的路径。最近兴起的“工具集成”趋势加剧了这个问题;模型周围的每个工具、内存存储和数据源都成为了另一个目标,它们以明文形式读取其工作流片段。日历服务器读取日程安排,数据库服务器读取查询。即使是完全本地化的代理,如果想要获取训练集之外的任何内容,仍然需要以明文形式向搜索引擎提交搜索词,因为服务器无法读取明文,因此无法回答问题。
主流解决方案仍然默认采用协议层控制。像 Runlayer 和 MintMCP 这样的公司使用中央网关来控制所有工具流量,在请求发出前对个人身份信息 (PII) 进行屏蔽。网关还会决定哪些服务器可以接收流量,屏蔽未经审核的服务器,并记录每次调用的目标地址和内容以供将来参考。即使这些控制措施经过了独立的审计(SOC 2),工具服务器仍然需要读取明文查询才能做出响应,而它们是否保留副本取决于自身的保留策略,并且会受到整个流程中每个工具的影响。此外,网关本身也是一个额外的读取方,其读取依赖于路径上的信任,而不是验证。
结构层解决方案针对的是中间层。例如,Phala 直接在 TEE 内托管 MCP 服务器,涵盖钱包、代码执行和数据源,使用户能够通过认证来验证隐私声明,而无需信任运营商。然而,托管在 TEE 中的工具仍然需要以明文形式向服务提供商提交查询;安全区仅对发送方进行加密,而不对接收方进行加密。
只有少数目标服务器学会了在不读取数据的情况下响应,而且仅限于结构化查询。苹果为 iPhone 提供隐私信息检索功能,允许在不暴露号码的情况下将来电号码与垃圾电话数据库进行匹配;微软在 Edge 浏览器中也采用了相同的密码加密方案。MongoDB 的可查询加密功能允许客户端在离开服务器之前加密字段,从而使服务器能够仅基于密文执行相等性和范围匹配。
然而,对于开放式搜索,目前最佳答案仍然依赖于信任;可验证的加密搜索尚未走出实验室。Brave 承诺在其 400 亿页的自有索引(而非 Google 的索引)上实现零数据保留,但它仍然处于协议层之下。Exa 构建了一个神经索引,将用户关键词语义嵌入其中,并基于语义匹配结果,但这一嵌入步骤仍然从 Exa 服务器上的明文开始。麻省理工学院 2023 年发表的 Tiptoe 论文在不暴露查询的情况下实现了对 3.6 亿个网页的排名,但每次搜索都会消耗大量的服务器计算能力,而且排名质量与未加密搜索有所不同。苹果公司 2024 年发表的 Wally 论文通过将真实查询隐藏在诱饵中,将通信成本降低了高达 31 倍,但这种计算方式只有在数百万并发查询的情况下才具有成本效益,而目前没有任何隐私搜索系统能够达到这种规模。
加密搜索是可行的;只是在性能和价格方面还没有达到商业上可行的水平。
前景
对私有人工智能的需求正在增长。Venice AI 近期注册用户突破 350 万,月吞吐量达到 1.3 万亿代币,随后完成了价值 10 亿美元的 A 轮股权融资。Proton 是其直接竞争对手,旗下聊天产品 Lumo 在上线一年内用户就突破了 1000 万。在基础设施方面,Phala 目前每天在 OpenRouter 上运行 20 亿至 30 亿代币。Duck.ai 将 gpt-oss-120b 和 Gemma 路由到 Tinfoil 的安全飞地,从而提供超越用户代理的可验证隐私。这还不包括自托管,而自托管可能是私有推理的最大渠道,因为模型运行在用户自己的硬件上,不会留下任何使用痕迹。
然而,在主流人工智能的浪潮中,隐私人工智能仅占极小一部分,只有当尖端实验室主动满足这一需求时,这一差距才会缩小。今年5月,谷歌在其所有产品中处理了320万亿个代币,这意味着Venice的月吞吐量大约相当于谷歌18分钟的处理量。去年11月,谷歌推出了私有人工智能计算(PAC),在与公司隔离的封闭TPU飞地中运行一些基于Gemini的功能,其设计由NCC集团进行独立审计。然而,问题在于PAC仅涵盖了Pixel手机的少数功能,例如个性化推荐和音频摘要,而没有涵盖数亿用户使用的Gemini应用程序。谷歌愿意将设计交给审计人员,是因为这些功能是通过设备和广告盈利,而不是通过出售代币。
目前的托管解决方案也并非完美无缺。寻求通过端到端加密 (E2EE) 实现最高隐私保护的用户,必须等待服务提供商无法读取的底层代码,才能看到新功能的重建。私有安全框架仍然依赖于服务层的协议。即使拥有价格合理的后续训练服务,也仍然需要信任第三方供应商才能获得最佳的微调效果。自托管虽然可以完全摆脱服务提供商,但本地运行最强大的开源模型可能比建造这些模型的办公楼还要昂贵。
撇开缺陷不谈,私有人工智能已成为一种切实可行且价格合理的选择,剩余的差距也在不断缩小。对于普通消费者而言,在 Lumo 和 Venice 等平台,以开放模式进行私密聊天,并承诺不记录日志,完全免费;而 Venice 或 Tinfoil 提供的订阅服务,每月收费 18 至 20 美元,将同样的聊天内容封装在加密飞地中,价格并不比 ChatGPT 的订阅服务更高。对于企业工作流程而言,带有认证功能的端点现在甚至比纯文本路由更便宜。像 NEAR 的 E2EE API 这样的端点现在可以将加密的上下文信息引入加密飞地,内存、文件上传和自定义指令等操作如今都基于 E2EE 运行。至于带有认证功能的训练后处理,NVIDIA 即将推出的 Vera Rubin NVL72 将把机密计算从 Blackwell 的 8 卡节点扩展到 72 卡机架,使尖端的强化学习循环在不暴露知识产权的情况下变得更加可行。
然而,关键价值的获取远不止于价格压缩层面。隐私保护在现有领域几乎是免费的,但它尚未覆盖主流的智能体工作流程。专注于出租和出售隐私飞地的运营商掌握的是标准芯片上的开关,而非护城河;协议层网关则与传统中间件展开竞争。本报告中尚未解决的难题是真正可防御的领域:锁定在隐私飞地中的训练循环、端到端密封的工具调用以及不可见的词项搜索索引。谁能率先实现其中一项,谁就能提供任何价格战都无法将其商品化的产品。追逐隐私人工智能的资本应该关注的是技术缺口,而不是开关本身。
那么,信任还是验证?对于执行密集型和代理密集型任务,选择信任,因为每次工具调用都会将明文发送到安全区域无法密封的目标位置,而尖端模型在这种循环中理应付出相应的代价。至于能够使公司区别于竞争对手的高级思维,则选择验证。多年专业经验提炼出的战略、规划和判断,正是这种备受争议的“阿尔法”。未来的发展方向是在公司控制范围内,利用这些专有洞察来微调开源模型。在公司拥有“阿尔法”的领域,专家调校的开源模型在准确性和成本方面已经同时超越了尖端模型,而构建这些模型的隐私环境基础设施也正在逐步完善。
以上内容仅用作资讯或教育之目的,不构成与BTCC相关的任何投资建议。BTCC竭力但不能保证上述全部内容的真实性、准确性和原创性。