Đêm qua, Thung lũng Silicon chứng kiến cuộc chiến của các vị thần AI

PanewslabPanewslabAuthor: 01 Founder

Tác giả: Max, 01 Founder

Biên tập: Max

 

Đêm qua ở Thung lũng Silicon đã xảy ra ba sự kiện lớn.

Google phát hành Gemini 3.8 Flash, Meta phát hành Muse Spark 1.3, và một startup trước đây chưa ai bàn tán là Mostik thì xuất hiện trong bài phỏng vấn độc quyền trên tạp chí uy tín WIRED.

Nếu chỉ nhìn vào hai sự kiện đầu, đây có vẻ như một đêm bảng xếp hạng AI bình thường khác.

Google vừa đưa Gemini lên vị trí dẫn đầu DeepSWE, mấy giờ sau, Meta lại công bố điểm số cao hơn, danh hiệu số một thế giới thậm chí chỉ giữ được mấy giờ.

Đến năm 2026, mọi người gần như đã chai lì với những chuyện như thế này.

Phát hành mô hình, làm mới benchmark, ăn mừng trên X vài giờ, rồi chờ công ty tiếp theo tiếp tục làm mới.

Nhưng nếu kết nối ba sự kiện đêm qua lại với nhau, tôi nghĩ điều thực sự đáng chú ý hoàn toàn không nằm trên những bảng xếp hạng đó.

Kinh tế học của AI đang có sự thay đổi đột biến.

Trong vài năm qua, khi thảo luận về chi phí AI, con số chúng ta thường xem xét nhất là giá bao nhiêu cho mỗi triệu token.

Nhưng sau khi Agent xuất hiện, cách đo lường này ngày càng trở nên không còn đủ.

Trong tương lai, câu hỏi thực sự quan trọng có thể không phải là "một triệu token giá bao nhiêu", mà là sửa một lỗi giá bao nhiêu, hoàn thành một nghiên cứu giá bao nhiêu, để một Agent làm việc liên tục ba giờ thì chi phí bao nhiêu.

Và đêm qua, chi phí suy luận đang giảm đồng thời từ nhiều hướng hoàn toàn khác nhau.

Google đang đưa năng lực cấp frontier vào các mô hình ngày càng rẻ hơn, Meta đang giúp Agent hoàn thành cùng một nhiệm vụ với ít token và lệnh gọi công cụ hơn, còn Mostik thì tiến xa hơn, họ bắt đầu đặt câu hỏi:

Nếu cả hai bên giao tiếp đều là AI, tại sao các mô hình vẫn cần dùng ngôn ngữ tự nhiên để trao đổi?

 

PHẦN 01, Gemini đã trở lại

Trước tiên hãy xem Google.

Google đã phát hành mô hình hàng đầu hoàn toàn mới Gemini 3.8 Flash, được họ gọi là mô hình suy luận và lập trình mạnh nhất từ trước đến nay.

Đây là bản cập nhật thứ ba cho dòng Flash trong vòng sáu tuần, từ 3.6 lên 3.7, rồi đến 3.8 hiện tại.

Trước đây, ấn tượng về Flash luôn rất đơn giản: nhanh hơn, rẻ hơn, nhưng năng lực kém hơn một ít so với mô hình mạnh nhất.

Google hiện đang dần thay đổi định nghĩa này.

Lần này, cải tiến cốt lõi nhất của 3.8 Flash tập trung vào lập trình dài hạn (long-horizon coding) và quy trình làm việc agent (agentic workflow).

Trên DeepSWE v1.1, bài kiểm tra năng lực kỹ thuật phần mềm dài hạn của AI, nó đạt khoảng 74%.

Điểm khác biệt lớn nhất giữa DeepSWE và các benchmark lập trình truyền thống là nó không đưa cho mô hình một bài toán thuật toán, mà thực sự thả Agent vào trong một kho mã nguồn.

Mô hình cần hiểu vấn đề, tìm kiếm mã, sửa tệp, gọi công cụ, chạy kiểm thử, và sau khi gặp lỗi thì tiếp tục tìm nguyên nhân.

Một nhiệm vụ hoàn chỉnh có thể mất hàng chục thậm chí hàng trăm bước.

Trong bài kiểm tra như vậy, Gemini 3.8 Flash từng đạt vị trí số một thế giới.

Image

Claude Opus 5 cũng đạt khoảng 74%, GPT-5.6 Sol khoảng 73%, và Fable 5 trước đây dẫn đầu thì khoảng 70%.

Nếu chỉ nhìn vào năng lực, giữa các mô hình mạnh nhất này không có sự khác biệt quá lớn.

Điều thực sự đáng kinh ngạc là một con số khác: tiền.

Giá API ra mắt của Gemini 3.8 Flash vẫn giữ ở mức 0,75 USD / 1 triệu token đầu vào và 3,75 USD / 1 triệu token đầu ra.

Để hoàn thành một nhiệm vụ hoàn chỉnh trên DeepSWE, chi phí trung bình của nó chỉ là 2,36 USD.

Để so sánh, Claude Opus 5 với cùng mức khoảng 74% có chi phí trung bình mỗi tác vụ lên tới 11,84 USD; GPT-5.6 Sol khoảng 73% cũng tốn trung bình 6,46 USD.

Image

Nói cách khác, với cùng một cấp độ năng lực kỹ thuật phần mềm, chi phí thực thi đã có thể chênh lệch gấp vài lần.

Điều này sẽ rất quan trọng trong kỷ nguyên Agent.

Thời chatbot, một câu trả lời đắt hơn hay rẻ hơn vài xu thì người dùng thông thường gần như không nhận ra.

Nhưng Agent thì hoàn toàn khác, một coding agent có thể thực thi liên tục 100 bước, một research agent có thể tìm kiếm hàng chục trang web, đọc hàng trăm trang tài liệu, và trong tương lai, các Agent trong doanh nghiệp thậm chí có thể làm việc liên tục vài giờ.

Google thậm chí còn đề cập rằng khi gặp nhiệm vụ phức tạp, 3.8 Flash sẽ chủ động nỗ lực hơn, thực hiện nhiều suy luận và lệnh gọi công cụ hơn.

Google không cắt giảm suy nghĩ của mô hình để tiết kiệm tiền, mà vì token đã đủ rẻ nên có thể cho phép nó chạy các vòng lặp dài hơn.

Vì vậy, tôi nghĩ điều thực sự quan trọng của 3.8 Flash không phải là lại giành ngôi đầu thế giới.

Mà là nó đang đưa những năng lực trước đây chỉ có ở các mô hình frontier đắt đỏ nhất vào khung giá của Flash.

 

PHẦN 02, Ba tiếng rưỡi sau Meta phản công

Ngay khi mọi người ở Google đang ăn mừng việc phát hành Gemini 3.8 Flash, Meta đột ngột phản công.

Meta đột ngột tung ra mô hình Muse Spark 1.3.

Theo kết quả do Meta công bố, Muse Spark 1.3 đạt 75,4% trên DeepSWE v1.1.

Kết quả này vượt qua Gemini 3.8 Flash, Claude Opus 5 và GPT-5.6 Sol.

Image

Đáng kinh ngạc hơn, Muse Spark 1.2 chỉ đạt khoảng 55% trong bài kiểm tra này.

Từ 1.2 lên 1.3, một bản cập nhật nhỏ đã tăng khoảng 20 điểm phần trăm.

Nhưng tôi nghĩ điều thực sự đáng xem của Meta lần này cũng không phải là 75,4%.

Còn hai con số nữa: số lần gọi công cụ giảm khoảng 20%, mức tiêu thụ token giảm khoảng 25%.

Điều này rất dễ bị bỏ qua, nhưng nó thực sự rất gần với vấn đề quan trọng nhất sau khi Agent được thương mại hóa.

Chỗ lãng phí tiền nhất của một Agent nhiều khi không phải là suy nghĩ bình thường, mà là lạc hướng.

Ví dụ, coding agent ở bước thứ 20 hiểu sai yêu cầu, nó có thể tiếp tục sửa năm tệp, chạy ba vòng kiểm thử, tìm kiếm rất nhiều mã, cuối cùng mới phát hiện ra hướng đi sai, rồi làm lại.

Hàng chục lần gọi công cụ và hàng chục nghìn token như vậy bị lãng phí.

Vì vậy, nếu một mô hình có thể phát hiện sớm hơn rằng nhiệm vụ có sự mơ hồ, biết sớm hơn rằng mình không thể tiếp tục, hỏi người dùng sớm hơn, thì thực chất là đang trực tiếp giảm chi phí.

Nhiều năng lực được tăng cường lần này của Muse Spark 1.3 thuộc loại này: nó có thể duy trì đồng thời nhiều workflow trong một chuỗi dài, chủ động hỏi khi gặp nhiệm vụ mơ hồ, chủ động yêu cầu trợ giúp khi không giải quyết được, xác nhận trước khi thực hiện các thao tác không thể đảo ngược, và sau nhiều vòng thực thi nhiệm vụ dài cũng ít quên các ràng buộc ban đầu hơn.

Meta thậm chí bắt đầu nhấn mạnh nhận thức của mô hình về ranh giới năng lực của chính mình: biết điều mình biết và điều mình không biết.

Image

Những năng lực này trong thời Chatbot có thể không hấp dẫn bằng việc benchmark tăng 20 điểm, nhưng đến kỷ nguyên Agent, chúng đều có thể quy đổi trực tiếp thành tiền.

Agent mắc ít lỗi hơn một lần, bản thân nó đã là một sự tối ưu hóa suy luận.

Vì vậy, khi đặt Google và Meta cạnh nhau, đơn vị đo lường của cuộc cạnh tranh mô hình lớn đang dần dần thay đổi.

Sau này, mọi người có thể ngày càng ít quan tâm đến "một triệu token giá bao nhiêu", mà ngày càng quan tâm đến một con số khác:

Chạy một nhiệm vụ thực tế từ đầu đến cuối, cuối cùng tốn bao nhiêu tiền.

 

PHẦN 03, Mostik, một đột phá mang tính lật đổ

Nếu Google và Meta vẫn đang nghiên cứu cách hoàn thành nhiệm vụ với token rẻ hơn và ít hơn, thì Mostik bắt đầu đặt ra một vấn đề nền tảng hơn:

Tại sao những token này nhất định phải tồn tại?

Mostik trong tiếng Nga có nghĩa là "cầu".

Image

CEO Sasha Malysheva là người phát triển chính của phương pháp này, còn giám đốc khoa học của họ là giáo sư Đại học Geneva, người đoạt Huy chương Fields năm 2010, Stanislav Smirnov.

Họ đang cố gắng làm một việc nghe có vẻ đơn giản nhưng thực tế cực kỳ khó khăn: làm cho hai mô hình AI không còn giao tiếp với nhau thông qua ngôn ngữ tự nhiên.

Ngày nay, hầu hết các hệ thống đa tác tử (Multi-Agent) đều hoạt động theo cách này:

Sau khi Mô hình A nhận được một số thông tin, nó tạo ra hàng trăm thậm chí hàng nghìn token, diễn đạt kết luận của mình bằng ngôn ngữ tự nhiên; Mô hình B sau đó đọc toàn bộ văn bản đó, hiểu và xây dựng biểu diễn nội bộ của riêng mình, rồi tiếp tục suy luận.

Nhưng vấn đề là, thứ mà mô hình lớn thực sự tính toán bên trong vốn không phải là tiếng Trung hay tiếng Anh, mà là:

biểu diễn toán học liên tục đa chiều.

Điều này giống như hai máy tính rõ ràng có thể truyền dữ liệu trực tiếp, nhưng máy A lại in tệp ra hàng trăm trang giấy, rồi để máy B dùng camera quét OCR từng trang một.

Mọi người trước đây luôn nghiên cứu cách giảm chi phí in ấn, còn Mostik muốn bỏ hẳn máy in.

Họ cố gắng xây dựng một cây cầu (Bridge) giữa các biểu diễn nội bộ của các mô hình khác nhau, để các mô hình trao đổi trực tiếp biểu diễn ẩn (latent representation), thay vì tạo ra ngôn ngữ tự nhiên trước.

Một thí nghiệm được tạp chí uy tín WIRED tiết lộ rất thú vị.

Mostik đã bắc cầu giữa phiên bản đầy đủ GLM-5.2 753B và Qwen 3.5 chỉ có 4B, có thể chạy trên thiết bị di động.

Hệ thống lai cuối cùng có năng lực nằm giữa hai mô hình, nhưng chi phí suy luận chỉ còn 1/20 so với GLM-5.2 đầy đủ.

Tất nhiên, nói rằng Mostik đã giải quyết được giao tiếp mô hình thì còn quá sớm.

Bản thân giao tiếp tiềm ẩn (latent communication) cũng không phải lần đầu xuất hiện từ hôm qua, trong vài năm qua đã có không ít nghiên cứu thử trao đổi embedding, hidden state, KV cache và các biểu diễn nội bộ khác.

Điều thực sự khó khăn là kiến trúc, tham số, dữ liệu huấn luyện và hệ tọa độ nội bộ của các mô hình khác nhau đều không giống nhau, làm sao để hai mô hình thực sự hiểu không gian ẩn của nhau, bản thân nó đã là một vấn đề rất khó.

Chính Smirnov cũng thừa nhận rằng hiện tại thậm chí còn thiếu ngôn ngữ toán học trưởng thành để mô tả biểu diễn chung giữa các mô hình khác nhau.

Nhưng con số 1/20 vẫn khiến tôi rất hào hứng.

Bởi vì nó khiến tôi bắt đầu nghiêm túc suy nghĩ về một kiến trúc AI hoàn toàn khác trong tương lai.

 

PHẦN 04, Tương lai bạn chỉ cần một mô hình vài phần mười B

Hai năm qua, khi thảo luận về AI trên thiết bị (on-device AI), chúng ta luôn nghiên cứu cách nhét các mô hình lớn hơn vào điện thoại: 7B, 4B, 3B, 1B, liên tục tinh chế, lượng tử hóa, nén.

Nhưng nếu con đường này của Mostik cuối cùng thực sự chạy được, tôi nghĩ điện thoại trong tương lai có lẽ không cần một mô hình lớn "biết mọi thứ".

Thiết bị của bạn có thể chỉ cần chạy một mô hình nhỏ 0.xB hoặc một vài B.

Nó rất rẻ, có thể chạy liên tục, có nhiệm vụ hiểu bạn đang ở ứng dụng nào, vừa làm gì, trạng thái thiết bị ra sao, và xử lý phần lớn các nhiệm vụ đơn giản, tần suất cao.

Khi thực sự gặp vấn đề khó, nó sẽ gọi mô hình lớn từ xa thông qua giao tiếp tiềm ẩn.

Nhưng điểm khác biệt then chốt là, nó không cần như hiện nay, phải gửi toàn bộ ngữ cảnh 100 nghìn token lên đám mây để mô hình từ xa đọc lại.

Nó có thể chỉ cần truyền một đoạn trạng thái tiềm ẩn được nén mạnh.

Image

Sau khi mô hình lớn từ xa hoàn thành suy luận phức tạp, cũng không nhất thiết phải tạo ra hàng nghìn token giải thích bằng ngôn ngữ tự nhiên cho mô hình cục bộ, mà có thể truyền trực tiếp biểu diễn nội bộ mới trả về.

Như vậy, mô hình nhỏ cục bộ chịu trách nhiệm chạy liên tục với tần suất cao và chi phí thấp, mô hình frontier trên đám mây chỉ chịu trách nhiệm suy luận khó với tần suất thấp, và giữa chúng dùng một loại Bridge nào đó để giao tiếp hiệu quả.

Nếu tương lai thực sự làm được điều này, mức giảm chi phí suy luận có thể không chỉ là giảm giá API 30% hay 50%.

Nó có thể thay đổi chính cách chúng ta tổ chức việc tính toán AI.

 

PHẦN 05, Kết luận

Vì vậy, nhìn lại đêm qua, thoạt nhìn là ba tin tức hoàn toàn khác nhau.

Google phát hành Gemini 3.8 Flash, đưa năng lực cấp frontier vào khung giá của Flash;

Meta phát hành Muse Spark 1.3, giúp Agent làm được nhiều việc hơn với ít token và lời gọi công cụ hơn;

Mostik thì tiến xa hơn, bắt đầu thử nghiệm để một phần token giữa các mô hình từ đầu không cần được tạo ra.

Chúng thực ra đều chỉ về cùng một sự thay đổi:

Trí tuệ đang trở nên rẻ đi với tốc độ rất nhanh.

Và sự giảm giá này không còn chỉ là giảm giá đơn vị API.

Giá mô hình đang giảm, lượng tính toán cần thiết để hoàn thành nhiệm vụ đang giảm, và giờ đây ngay cả cách các mô hình trao đổi thông tin cũng bắt đầu được thiết kế lại.

Tác động cuối cùng của việc này có thể lớn hơn nhiều so với benchmark tăng thêm vài điểm phần trăm.

Bởi vì nhiều công nghệ thực sự bùng nổ không bao giờ xảy ra vào lúc "lần đầu tiên dùng được", mà xảy ra vào lúc "cuối cùng đã rẻ đến mức có thể dùng thoải mái".

Ngày nay, để một Agent tốn vài chục đô la để hoàn thành một nhiệm vụ nhỏ của người bình thường, có lẽ hoàn toàn không đáng chút nào.

Nếu tương lai chỉ cần vài xu, rất nhiều ứng dụng mà hiện tại không ai nghĩ tới sẽ đột nhiên có thể thực hiện được.

Ngày nay chúng ta không thể để hàng chục Agent chạy liên tục 24 giờ xung quanh một người, nhưng nếu chi phí suy luận giảm thêm một đến hai bậc độ lớn, điều đó có thể trở thành trạng thái mặc định.

Bây giờ đã là bảy giờ sáng, lẽ ra tôi nên đi ngủ từ vài giờ trước rồi.

Kết quả là Gemini vừa phát hành, Meta mấy giờ sau lại đuổi theo, rồi tôi lại thấy thí nghiệm 1/20 của Mostik.

Sau khi nằm lên giường, đầu tôi cứ nghĩ mãi về mấy chuyện này, nghĩ đến mô hình 0.xB trong điện thoại, nghĩ đến mô hình lớn trên đám mây, nghĩ đến việc chúng có lẽ không cần dùng ngôn ngữ tự nhiên để giao tiếp với nhau nữa.

Càng nghĩ càng không ngủ được, cuối cùng vẫn phải ngồi dậy, viết xong bài viết này.

74% của Gemini, 75,4% của Muse, vài ngày nữa có thể sẽ xuất hiện những con số mới thay thế chúng.

Nhưng hiện tại tôi thực sự khó có thể bình tĩnh lại với sự phấn khích này.

Bởi vì so với việc ai lại giành vị trí số một thế giới, tôi ngày càng quan tâm đến một câu hỏi khác:

Một AI thông minh như vậy, có thể rẻ đến mức nào?

Một khi trí tuệ mạnh mẽ thực sự rẻ đến mức có thể được gọi thoải mái, tôi nghĩ rất nhiều sản phẩm AI mà ngày nay trông có vẻ rất điên rồ, có lẽ chỉ mới bắt đầu.

Nội dung này chỉ mang tính chất tham khảo và cung cấp thông tin, không phải lời khuyên đầu tư liên quan đến BTCC. BTCC luôn cố gắng cung cấp thông tin chính xác, nhưng không đảm bảo tuyệt đối về tính xác thực, độ chính xác hoặc bản quyền nội dung trên.

Đề xuất

Vàng phá vỡ dưới 4.300 USD khi áp lực vĩ mô gia tăng; BTC giữ mức 77KYên đạt đỉnh bảy tháng, Ethereum lên kế hoạch kháng lượng tử L1 vào năm 2029Zuckerberg từng gọi riêng cho Trump: Đừng lập cơ quan quản lý AIPhỏng vấn mới nhất với Altman: Vì sao OpenAI đột ngột phanh lại? Astra, AI mất kiểm soát và kế hoạch IPOMicroStrategy Biến Bản Sắc Bitcoin Thành Đôi Giày Jordan 250 USD