Khi khả năng lập luận trở thành một nguồn lực khan hiếm, ai sẽ nắm bắt được giá trị của nó?

chaincatcherchaincatcher

Tác giả: Frank Fu, IOSG

 

"Lỗ hổng" mà David Cahn đề xuất vào năm 2023 chưa bao giờ được lấp đầy ở khía cạnh huấn luyện. Nó đã được lấp đầy ở khía cạnh suy luận, và thị trường chỉ mới bắt đầu tính đến điều này trong việc định giá trong vài tuần gần đây. Khi Nvidia tổ chức lại báo cáo tài chính của mình xung quanh "mã thông báo dịch vụ" và Cerebras được chào bán công khai với số lượng đăng ký vượt quá 20 lần, cuộc tranh luận về nút thắt cổ chai đã kết thúc, và câu hỏi thực sự trở thành: khi suy luận trở thành một nguồn tài nguyên khan hiếm, giá trị sẽ tập trung ở đâu trong hệ thống điện toán?

 

1. Theo đuổi GPU: Từ câu hỏi 200 tỷ đô la đến câu hỏi 600 tỷ đô la

Năm 2023, David Cahn từ Sequoia đã nêu lên câu hỏi bao trùm toàn bộ cơ sở hạ tầng AI, được gọi là "Câu hỏi 200 tỷ đô la". Cứ mỗi đô la chi cho GPU, cần phải chi thêm khoảng một đô la nữa để cung cấp năng lượng cho chúng trong các trung tâm dữ liệu, có nghĩa là chi phí đầu tư GPU hàng năm đòi hỏi những con chip này cuối cùng phải tạo ra khoảng 200 tỷ đô la doanh thu để thu hồi vốn. Ngay cả với những giả định rất lạc quan về doanh thu AI, ông vẫn phát hiện ra khoảng cách hơn 125 tỷ đô la giữa "đầu tư" và "khoản thanh toán thực tế từ khách hàng cuối cùng". Mối lo ngại rất đơn giản: GPU đang được sản xuất quá mức so với nhu cầu thực tế.

 

Một năm sau, khoảng cách không những không thu hẹp mà còn nới rộng. Trong báo cáo tiếp theo năm 2024, Cahn đã định nghĩa lại nó là "Câu hỏi 600 tỷ đô la" khi chi phí đầu tư (CapEx) của các nhà cung cấp dịch vụ siêu quy mô tăng vọt. Logic bi quan hội tụ về một hình dạng quen thuộc: xây dựng quá mức dẫn đến cung vượt cầu, và cung vượt cầu sẽ đốt cháy vốn.

 

Về cơ bản, cả hai bài báo đều đặt ra cùng một câu hỏi: ai sẽ lấp đầy khoảng trống này? Câu trả lời chưa bao giờ xuất hiện ở khía cạnh "đào tạo". Nó xuất hiện ở khía cạnh suy luận, và thị trường chỉ mới bắt đầu tính đến điều này trong việc định giá trong vài tuần gần đây.

 

2. IPO của Cerebras và hiện tượng "ép giá" trong suy luận

Cerebras đã chính thức niêm yết cổ phiếu vào thứ Năm. Đợt IPO này đã nhận được lượng đăng ký mua vượt mức 20 lần, với giá chào bán gần gấp đôi so với mức tăng cuối cùng vào thứ Tư. Nhu cầu này không xuất phát từ việc đặt cược vào "kẻ hủy diệt Nvidia tiếp theo", mà từ một nhận thức đơn giản hơn: thị trường đang bắt đầu hiểu rằng nút thắt thực sự trong trí tuệ nhân tạo nằm ở khả năng suy luận, chứ không phải huấn luyện.

 

Điểm đặc biệt của Cerebras là kiến trúc chip giúp quá trình suy luận diễn ra cực kỳ nhanh chóng. Vấn đề không nằm ở việc huấn luyện, mà là ở quá trình suy luận. Đây chính là điều khiến Phố Wall hào hứng. Thị trường suy luận có tính chất tái diễn, mở rộng theo mức độ sử dụng. Mỗi lần Claude trả lời một câu hỏi, mỗi lần một tác nhân thực hiện một nhiệm vụ, đều tiêu tốn sức mạnh tính toán. Quá trình huấn luyện chỉ diễn ra một lần, trong khi quá trình suy luận không bao giờ dừng lại.

 

JP Morgan ước tính quy mô thị trường suy luận lớn gấp 10 đến 50 lần so với thị trường huấn luyện. Khi máy móc bắt đầu thực hiện các nhiệm vụ được giao bởi các máy móc khác, tức là sự mở rộng theo kiểu tác nhân, nhu cầu về suy luận không còn tăng theo số lượng người dùng mà tăng theo chính sức mạnh tính toán.

 

3. Nvidia định hình lại cục diện: Suy luận trở thành trọng tâm

Nếu Cerebras đại diện cho sự thức tỉnh của thị trường, thì báo cáo quý mới nhất của Nvidia là sự xác nhận từ đỉnh cao của chuỗi cung ứng. Trong cuộc họp báo cáo thu nhập gần đây, Jensen Huang đã làm rõ sự thật ngầm hiểu: nhu cầu về AI đang tăng trưởng theo cấp số nhân. Lý do rất đơn giản: AI tác nhân đã xuất hiện. AI chính thống đã chuyển từ suy luận một lần sang suy luận logic, và giờ đây là giai đoạn tác nhân, nơi nó có thể gọi các công cụ và điều phối các tác vụ một cách tự động. Huang tuyên bố, "Các token giờ đây đã có lợi nhuận." Trong kỷ nguyên AI, sức mạnh tính toán tương đương với doanh thu và lợi nhuận.

 

Điều này định hình lại toàn bộ ngành công nghiệp. Huấn luyện là chi phí một lần để xây dựng mô hình, trong khi suy luận là chi phí định kỳ để vận hành nó, và nút thắt cổ chai hiện tại nằm ở khâu suy luận, chứ không phải huấn luyện.

 

Nvidia đã tích hợp phán quyết này vào báo cáo tài chính của mình. Giờ đây, công ty công bố kết quả kinh doanh trên hai nền tảng thay vì một: Trung tâm dữ liệu và Điện toán biên. Mảng Trung tâm dữ liệu (khoảng 75 tỷ đô la trong quý này, tăng 92% so với cùng kỳ năm ngoái) được chia nhỏ hơn nữa thành Siêu quy mô (khoảng 38 tỷ đô la, tăng 12% so với quý trước) và ACIE, bao gồm điện toán đám mây AI, công nghiệp và doanh nghiệp (khoảng 37 tỷ đô la, tăng 31% so với quý trước). Một mảng mới là Điện toán biên: 6,4 tỷ đô la, tăng 29% so với cùng kỳ năm ngoái, bao gồm các điểm cuối nơi trí tuệ nhân tạo tác nhân và trí tuệ nhân tạo vật lý thực sự hoạt động, chẳng hạn như máy tính cá nhân, máy trạm, trạm gốc AI-RAN, robot và ô tô.

 

Hiện tại, Edge chỉ chiếm chưa đến 8% tổng doanh thu, nhưng Nvidia đã nâng tầm nó lên thành "nền tảng thứ hai" bên cạnh Trung tâm dữ liệu. Điều này báo hiệu rằng suy luận đang được chia thành hai hướng: suy luận đám mây trong trung tâm dữ liệu và suy luận điểm cuối ở biên, nơi AI cần nhìn, di chuyển và hành động trong thế giới vật lý. Lộ trình cũng tuân theo logic tương tự: Vera Rubin, dự kiến bắt đầu được xuất xưởng vào quý 3, có thể đạt được thông lượng suy luận cao gấp 35 lần so với Blackwell; Huang cũng đưa ra một thị trường tiềm năng (TAM) mới trị giá 200 tỷ đô la cho CPU Vera được thiết kế cho các tác vụ dựa trên tác nhân. Dự kiến mọi công ty hàng đầu về mô hình sẽ chuyển hướng hoàn toàn sang nó ngay từ ngày đầu tiên.

 

Khi công ty có giá trị cao nhất trên Trái đất tổ chức lại các báo cáo tài chính của mình xoay quanh "mã thông báo dịch vụ", cuộc tranh luận về điểm nghẽn đã được giải quyết. Phần còn lại của bài viết này sẽ thảo luận về việc ai sẽ nắm bắt được giá trị khi suy luận (thay vì huấn luyện) trở thành một nguồn lực khan hiếm.

 

Trước tiên, cần làm rõ phạm vi. Bài viết này thảo luận về suy luận đám mây, đề cập đến việc thuê GPU tại trung tâm dữ liệu để cung cấp dịch vụ mã thông báo API. Suy luận điểm cuối chạy trên các chip cục bộ bên trong chính thiết bị (Jetson, RTX, Drive, AI-RAN của Nvidia), hoàn toàn bỏ qua tầng cho thuê và tổng hợp GPU bên dưới. Ở đây, hãy xem nó như một động lực thúc đẩy toàn bộ nền kinh tế suy luận và củng cố lập luận về điểm nghẽn, chứ không phải là các thị trường mà Hyperbolic và Venice hoạt động, vốn hoàn toàn thuộc về phía đám mây.

 

4. Áp lực đã ập đến

Anthropic giống như con chim hoàng yến trong mỏ than. Mức sử dụng vượt xa dung lượng được cấu hình sẵn, và các khiếu nại về việc Claude bị "lạm dụng trí não" đang tràn lan trên internet, bao gồm cả việc phản hồi bị hạn chế, suy luận chậm lại và cửa sổ ngữ cảnh bị thu hẹp. Giải pháp nằm ở sức mạnh tính toán: vào tháng 5 năm 2026, Anthropic đã tiếp quản toàn bộ trung tâm dữ liệu Colossus 1 từ SpaceX, với hơn 220.000 GPU Nvidia và hơn 300 megawatt, dành riêng cho suy luận thay vì huấn luyện.

 

Khả năng này mở khóa một loạt các thay đổi về hạn mức, mỗi thay đổi đều đóng vai trò như một tín hiệu. Vào ngày 6 tháng 5, Anthropic đã tăng gấp đôi giới hạn năm giờ cho Claude Code, dỡ bỏ việc điều tiết trong giờ cao điểm và tăng đáng kể giới hạn tốc độ API cho Opus. Vào ngày 13 tháng 5, họ đã tăng giới hạn hàng tuần cho Claude Code thêm 50% (cho đến ngày 13 tháng 7). Sau đó, bắt đầu từ ngày 15 tháng 6, họ đã làm điều ngược lại với sự "hào phóng": họ tách biệt việc sử dụng tác nhân và lập trình (Agent SDK, chế độ headless claude -p, đường dẫn CI) khỏi gói đăng ký cố định thành một nhóm tín dụng được đo lường độc lập (dao động từ 20 đến 200 đô la mỗi tháng, được tính theo giá API). Bước cuối cùng này đã cô đọng toàn bộ lập luận thành một hành động duy nhất: tốc độ mà các tác nhân tiêu thụ suy luận vượt xa khả năng thiết kế của các gói đăng ký cố định, do đó nó phải được định giá theo "chi phí định kỳ" ban đầu của nó.

 

Đào tạo là một khoản đầu tư vốn một lần. Suy luận là một chi phí vận hành định kỳ, tăng lên theo từng người dùng và từng tác nhân mới.

 

5. Cấu trúc này: Sáu lớp, một điểm nghẽn.

Mỗi ứng dụng AI đều nằm trên một chuỗi cung ứng bắt đầu từ khâu sản xuất tấm bán dẫn của TSMC và kết thúc ở điểm cuối API:

 

 

 

Hầu hết các công ty chỉ sở hữu một lớp trong kiến trúc này. Nvidia sở hữu chip bán dẫn, CoreWeave sở hữu phần cứng vật lý, Together AI sở hữu tối ưu hóa suy luận, và OpenRouter sở hữu định tuyến API mô hình.

 

Chỉ có một ngoại lệ.

 

6. Hyperbolic: Công ty duy nhất hoạt động trên ba tầng

Hyperbolic đã ra mắt thị trường GPU theo yêu cầu của mình vào tháng 6 năm 2025. Trong vài tháng đầu tiên, số lượng nhà phát triển của họ đã vượt quá 200.000, bao gồm các phòng thí nghiệm AI tiên tiến, công cụ tìm kiếm và các nền tảng tiêu dùng lớn.

 

Điều thú vị là kiến trúc của nó.

 

Hyperbolic không sở hữu bất kỳ GPU nào. Mọi card đồ họa đều đến từ neocloud và các trung tâm dữ liệu, bao gồm CoreWeave, Lambda Labs, Nebius và các nhà khai thác nhỏ hơn có công suất nhàn rỗi. Điều này nghe có vẻ là điểm yếu, nhưng thực chất lại là lợi thế cạnh tranh.

 

Bằng cách đóng vai trò trung gian giữa nhà cung cấp GPU và người tiêu dùng, Hyperbolic có thể nắm được dữ liệu thời gian thực mà các đơn vị khác không thể. Họ biết ai đang mua loại GPU nào, với giá bao nhiêu và khi nào. Họ phát hiện ra tình trạng dư cung trước khi thông tin được công khai và nhận biết được sự tăng đột biến về nhu cầu trước khi chúng tác động đến thị trường.

 

Hiện nay, rào cản cạnh tranh chính là khả năng tổng hợp nhiều đám mây này. Hyperbolic kết nối dung lượng phân tán từ hàng chục đám mây và trung tâm dữ liệu độc lập thành một nhóm thống nhất được tiêu chuẩn hóa, cho phép các nhà phát triển thuê GPU rẻ nhất hiện có ở bất cứ đâu mà không cần phải đàm phán với từng nhà mạng hoặc quản lý nhiều tài khoản. Càng kết nối với nhiều đám mây, tính thanh khoản càng cao và dữ liệu giá cả càng phong phú. Hơn nữa, nhóm đang nghiên cứu cách mô hình hóa đường cong giá GPU bằng dữ liệu này và cuối cùng đầu tư vốn của chính mình để làm giảm sự biến động cung cầu, đóng vai trò là nhà tạo lập thị trường cho sức mạnh tính toán vật lý; nhưng mục tiêu này vẫn đang ở giai đoạn đầu, và điều thực sự đang phát triển mạnh mẽ hiện nay là lớp tổng hợp.

 

Đây là bánh đà:

 

Kết nối nhiều đám mây hơn → Nguồn cung tổng hợp lớn hơn

 

Nguồn cung dồi dào hơn → Thị trường đa dạng hơn và dữ liệu giá cả theo thời gian thực.

 

Dữ liệu tốt hơn → Định tuyến thông minh hơn ngay bây giờ và các mô hình định giá dài hạn

 

Tính thanh khoản và giá cả tốt hơn → Nhiều nhà phát triển hơn → Nhiều nhà cung cấp dịch vụ đám mây muốn kết nối

 

Không có công ty nào khác đang cố gắng thực hiện điều này. Hyperbolic là công ty duy nhất bao quát toàn bộ lớp cho thuê GPU, lớp triển khai và lớp API mô hình.

 

7. Venice như một tấm gương

Venice là minh chứng rõ ràng nhất cho nền kinh tế suy luận ở lớp ứng dụng và là một sự tương phản hữu ích với vị thế của Hyperbolic. Đây là một ứng dụng suy luận ưu tiên quyền riêng tư: một tập hợp các API tương thích với OpenAI, cùng với các gói đăng ký người dùng (Miễn phí / Pro / Pro+ / Max), định tuyến các yêu cầu đến khoảng 75 mô hình, trong đó hai phần ba là các mô hình mã nguồn mở hoặc tự lưu trữ (Llama, Mistral, Qwen, DeepSeek), còn lại là các kết nối ẩn danh từ các mô hình tiên tiến mã nguồn đóng. Điểm mấu chốt là Venice không sở hữu sức mạnh tính toán đáng kể. Nó thuê từ các đối tác GPU không được tiết lộ và các nhà cung cấp điện toán bí mật (NEAR AI Cloud, Phala) và trả tiền cho các phòng thí nghiệm tiên tiến để sử dụng các kết nối này, vì vậy chi phí doanh thu thực sự của nó là sức mạnh tính toán suy luận, chứ không phải là dịch vụ lưu trữ SaaS.

 

Điều mà Venice thực sự bán là sự riêng tư. "Sự tư nhân hóa" ở đây không có nghĩa là biến sức mạnh tính toán công cộng thành tài sản tư nhân, mà là bao bọc quá trình suy luận được thương mại hóa trong một lớp bảo đảm: không lưu giữ dữ liệu, không đào tạo, ẩn danh yêu cầu và một số khối lượng công việc chạy trong TEE, khiến người vận hành không thể xem văn bản gốc. Sức mạnh tính toán cơ bản là ở mức thương mại, và giá thành đến từ lớp bảo mật này. Hơn nữa, sự đảm bảo này được phân lớp và không đồng nhất: đối với các mô hình mã nguồn mở chạy trên GPU dưới sự kiểm soát của Venice hoặc TEE, nó có thể đạt được khả năng tính toán bảo mật gần như từ đầu đến cuối; nhưng đối với các luồng ẩn danh của các mô hình mã nguồn đóng như Claude và GPT, sự riêng tư chỉ đơn thuần loại bỏ danh tính, trong khi các phòng thí nghiệm tiên tiến ở đầu kia vẫn đang xử lý yêu cầu ban đầu của bạn. Do đó, sự bảo mật mạnh nhất chỉ bao gồm phần mã nguồn mở, trong khi phần mô hình tiên tiến chỉ là "ẩn danh" chứ không phải "thực sự bảo mật". Lợi nhuận gộp của Venice = giá đăng ký - chi phí suy luận được trả ở khâu sau, và phần lợi nhuận mà họ có thể tính phí cao hơn giá API cơ bản gần như hoàn toàn phụ thuộc vào lớp phí bảo mật này, đó là lý do tại sao họ hoạt động với biên lợi nhuận thấp và bị hạn chế bởi chính sách định giá chuyển tiếp tiên tiến.

 

Thiết kế token đã gói gọn phần nhu cầu suy luận này. Venice hoạt động trên hai token: VVV (đặt cọc và truy cập nền tảng) và DIEM, trong đó DIEM là tín dụng suy luận, mỗi DIEM tương đương khoảng 1 đô la sức mạnh tính toán mỗi ngày. Các gói đăng ký trả phí sẽ kích hoạt việc mua lại VVV theo chương trình (Pro / Pro+ / Max khoảng 2 đô la / 5 đô la / 10 đô la), với lượng phát hành giảm dần theo một lịch trình cố định: từ 6 triệu → 5 triệu → 4 triệu VVV mỗi tháng, và điều chỉnh xuống còn 3 triệu vào ngày 1 tháng 7. Việc mua lại là có thật nhưng mang tính tùy ý và vẫn còn nhỏ: khoảng 103.000 đô la đã bị mất trong cả tháng 4 và tháng 5, và tháng 6 đang tăng dần lên khoảng 110.000 đô la, thấp hơn nhiều so với mốc 200.000 đô la hàng tháng.

 

Tình hình kinh doanh thực tế khả quan hơn những gì báo chí đưa tin. Con số "doanh thu hàng năm 70 triệu đô la" được lan truyền rộng rãi gần như chắc chắn là kết quả của việc nhầm lẫn giữa việc gia hạn đăng ký và việc thu hút khách hàng mới; phạm vi doanh thu hàng năm hợp lý hơn nằm trong khoảng từ 6 triệu đến 15 triệu đô la. Dưới mức này, doanh thu đang tăng trưởng mạnh mẽ: khoảng 136.000 địa chỉ ví điện tử duy nhất, khoảng 9,9 triệu lượt truy cập trang web mỗi tháng (khoảng 330.000 lượt mỗi ngày), và số lượng đăng ký gói Pro mới dao động quanh mức 1.400 mỗi ngày. Đây là một mô hình kinh doanh thực sự, nhưng là mô hình có biên lợi nhuận thấp, và hiệu quả kinh tế bị hạn chế bởi sức mạnh tính toán mà nó chi trả.

 

Đây chính xác là lý do tại sao Hyperbolic được đặt ở vị trí cao hơn một bậc. Nếu Venice là một trạm xăng, thì Hyperbolic là một nhà máy lọc dầu. Venice mua sức mạnh tính toán từ cùng một nguồn cung hạn chế mà mọi người đều phụ thuộc vào; Hyperbolic tổng hợp và chuẩn hóa nguồn cung phân tán đó và bán cho Venice và tất cả các bên tương tự. Khi nhu cầu suy luận tăng lên, giá trị tích lũy không chỉ hướng đến các ứng dụng tiêu thụ sức mạnh tính toán mà còn hướng đến lớp tổng hợp, định tuyến sức mạnh tính toán và thu phí doanh thu do các ứng dụng này trả.

 

8. Tại sao điều này lại quan trọng vào lúc này

Nvidia đã tái cấu trúc tài chính của mình dựa trên "mã thông báo dịch vụ". Việc IPO của Cerebras chứng minh thị trường đã hiểu rằng suy luận là nút thắt cổ chai. Việc Anthropic gấp rút tìm kiếm năng lực cho thấy đây là một vấn đề thực sự. Trí tuệ nhân tạo tác nhân và vật lý sẽ khuếch đại nhu cầu lên nhiều bậc, trải rộng cả trên nền tảng đám mây và điện toán biên.

 

Hơn nữa, nó cũng đã khép lại vòng xoáy của "Câu hỏi 600 tỷ đô la" từ một khía cạnh khác. Logic bi quan của Cahn, rằng việc xây dựng quá mức dẫn đến nguồn cung dư thừa, có thể sẽ được chứng minh là đúng. Nhưng nguồn cung dư thừa lại chính xác là kịch bản tối ưu cho các nhà tổng hợp không sở hữu nhiều tài sản: khi giá GPU giảm và nguồn cung phân tán trên hàng chục đám mây, người chơi không sở hữu bất kỳ phần cứng nào và định tuyến mọi khối lượng công việc đến các card rẻ nhất hiện có sẽ kiếm được lợi nhuận từ chênh lệch giá, trong khi các nhà điều hành nắm giữ GPU đang giảm giá trị sẽ gánh chịu thua lỗ. Hyperbolic đang đặt cược vào nguồn cung dư thừa chứ không phải bán khống nó.

 

Công ty chiến thắng cuối cùng sẽ không phải là công ty sở hữu nhiều GPU nhất, mà là công ty có thể cho bạn biết GPU nào có sẵn ở đâu và với giá bao nhiêu, từ đó định tuyến mọi khối lượng công việc đến nơi có thể chạy với chi phí thấp nhất.

 

Hyperbolic đang xây dựng một công ty như vậy. Họ không sở hữu GPU, hoạt động hoàn toàn dựa trên phần mềm, trải rộng trên ba lớp, nhưng đang trở thành lớp tổng hợp tối ưu cho sức mạnh tính toán suy luận.

Nội dung này chỉ mang tính chất tham khảo và cung cấp thông tin, không phải lời khuyên đầu tư liên quan đến BTCC. BTCC luôn cố gắng cung cấp thông tin chính xác, nhưng không đảm bảo tuyệt đối về tính xác thực, độ chính xác hoặc bản quyền nội dung trên.