Kỷ nguyên AGI chính thức mở ra! Đánh giá toàn diện GPT-6 Astra

PanewslabPanewslab

Tác giả: 數字生命卡茲克

 

Sau sự cố AI toàn cầu tối qua, GPT-6 Astra cuối cùng đã chính thức ra mắt vào lúc 3:33 sáng giờ Bắc Kinh.

圖片

Nếu dùng một câu của OpenAI để tóm tắt GPT-6 Astra, thì có lẽ câu này là phù hợp nhất: Đây là mô hình thông minh nhất và được căn chỉnh tốt nhất toàn cầu. Rồi meme cũng xuất hiện.

圖片Lần này, OpenAI đã chứng minh thực lực của họ, và có chút hương vị của GPT-4 năm đó, sự trở lại vương giả toàn diện, và điều khiến tôi vui nhất là cuối cùng đây không còn là một mô hình thuần túy chuyên biệt cho Coding nữa.

GPT-6 Astra thực sự là một nhân viên cấp tiến sĩ với khả năng thẩm mỹ cực mạnh và năng lực làm việc siêu hạng. Và lần này mô hình có rất nhiều tính năng và đặc điểm mới, lượng thông tin cực kỳ bùng nổ và lớn. Nhưng bi kịch là, OpenAI đáng ghét này cũng học hư rồi. Hôm nay chỉ mở cho một số tổ chức, vài ngày tới mới mở cho người dùng đăng ký.

圖片

Không phải chứ anh ơi, trước đây anh lừa tôi mua gói Pro 200 đô, anh đâu có nói vậy, anh nói là thành viên Pro lần nào cũng được ưu tiên trải nghiệm mô hình mới nhất mà...

Quả nhiên mấy công ty mô hình lớn này đều là kẻ lừa dối. Tôi chưa bao giờ muốn thời gian trôi nhanh đến vậy, để được dùng GPT-6 Astra ngay...

Nhưng tôi nghĩ, sau khi xem gần như tất cả thông tin và tài liệu, tôi thấy vẫn còn nhiều điều đáng để chia sẻ với mọi người. Vậy thì nói từng cái một nhé.

 

1. Thông tin cơ bản về GPT-6 Astra

Trước tiên tóm tắt thông tin cơ bản.

Mã mô hình của GPT-6 Astra trong API là gpt-6-astra.

Cửa sổ ngữ cảnh là 1,05M, tức khoảng 1,05 triệu Token.

Độ dài đầu ra tối đa là 128K Token.

Ngày cắt kiến thức là 30 tháng 4 năm 2026.

Cường độ suy luận có năm mức: low, medium, high, xhigh, max.

Giá API tiêu chuẩn là 10 đô la Mỹ cho mỗi triệu Token đầu vào và 50 đô la Mỹ cho mỗi triệu Token đầu ra.

Mức giá này về cơ bản hoàn toàn giống với Claude Opus 5, nhưng chi phí đọc bộ nhớ đệm thì đắt hơn Claude Opus 5.1.

圖片

Điểm benchmark ở đây, lát nữa sẽ nói chi tiết, cứ xem qua là được.

圖片

Sau đó, tổng tham số ước tính cũng ở mức 5T, trong buổi họp báo kín trước khi ra mắt, họ cũng nhắc rằng GPT-6 Astra là đợt huấn luyện lớn nhất từ trước đến nay của OpenAI, đã dùng hơn 100.000 card.

2. Mô hình vận hành máy tính tốt nhất thế giới hiện nay

Lần này GPT-6 Astra có một định vị có lẽ là quan trọng nhất:

Mô hình vận hành máy tính tốt nhất thế giới.

Trước đây khi nói về Agent, chúng ta thường nói về API, MCP, CLI, v.v.

Muốn AI vận hành một phần mềm, trạng thái lý tưởng nhất là phần mềm đó dành riêng cho AI một giao diện, rồi vận hành trực tiếp ở cấp thấp, đây là cách thuận tiện nhất.

Ví dụ lịch có API của lịch, email có API của Gmail, v.v., như vậy đương nhiên là nhanh.

Nhưng vấn đề là, thế giới này còn nguyên thủy và thiếu chuyên nghiệp hơn chúng ta tưởng.

Trong thế giới thực, tuyệt đại đa số phần mềm có thể căn bản không có những thứ này.

Thậm chí rất nhiều hệ thống nội bộ của doanh nghiệp được viết từ hai mươi năm trước, còn API, tài liệu không biết ở đâu.

Nhưng nếu chúng ta quay về tầng thấp nhất, bạn sẽ phát hiện bản chất logic của mọi phần mềm chính là tương tác. Vậy theo logic vận hành máy tính hiện nay của chúng ta, đó là nhìn màn hình, tìm nút hoặc ô nhập liệu, nhấp chuột, nhập nội dung, chờ phản hồi.

Toàn bộ hệ thống tương tác của máy tính, chẳng phải chính là API tốt nhất sao?

Vì vậy, GPT-6 Astra đã tăng cường mạnh mẽ logic vận hành máy tính của AI, bạn không cung cấp API cho tôi, không sao cả, tôi tự vận hành máy tính, dùng như con người là được chứ gì.

Vậy thì hiện tại, Astra có thể trực tiếp vận hành Excel, Power BI, làm QA front-end, cài đặt phần mềm, kiểm thử phần mềm, nhìn lỗi trên màn hình rồi tiếp tục khắc phục sự cố.

OpenAI thậm chí còn trình diễn Astra trực tiếp vận hành thiết kế bảng mạch.

圖片

Còn có định dạng tài liệu pháp lý, xử lý khoảng cách tiêu đề, bố cục trang, v.v.

Sau đó, ở mảng này có một bài đánh giá khá đáng tin cậy, là OSWorld.

Thứ này bạn có thể hiểu đơn giản là:

Ném AI vào một chiếc máy tính thật, rồi để nó tự làm việc.

Cho nó mở vài ứng dụng, rồi giao nhiệm vụ, xem có thành công hay không.

Tỷ lệ hoàn thành của GPT-6 Astra đạt 72,6%, so với 65,7% của GPT-5.6 Sol trước đây thì đã tăng không ít.

Sau đó, Sol hoàn thành một nhiệm vụ phức tạp trong bài đánh giá, thời gian mô phỏng trung bình khoảng 75 phút.

Còn Astra chỉ cần 40 phút, giảm khoảng 47% thời gian.

ScreenSpot-Pro cũng từ 76,9% của Sol, vọt lên 92,7%.

Benchmark này chủ yếu xem mô hình có hiểu được màn hình hay không, rồi định vị chính xác nên nhấp vào đâu, gần như đã rất chuẩn rồi.

Vậy nên định vị này cũng khá thú vị, trong tương lai có thể, GUI rất có khả năng sẽ dần trở thành API phổ biến nhất trong kỷ nguyên Agent.

Bất kỳ công việc số nào mà con người có thể hoàn thành qua màn hình, về lý thuyết đều sẽ dần đi vào phạm vi vận hành của Agent.

Bạn không cần chờ một cái hệ thống ERP cũ kỹ viết từ năm 2007 kết nối MCP, hay mở API cho bạn.

AI trực tiếp nhìn màn hình mà làm là xong.

 

3. ARC-AGI-3 đạt 99,9 điểm

Và nếu bạn không hiểu ARC-AGI-3 thực sự đo cái gì, rất dễ cảm thấy:

Ồ, chẳng phải lại là một Benchmark đạt điểm tối đa thôi sao, có gì lạ đâu.

Nhưng thứ này thực sự có chút khác biệt so với các bài thi mô hình lớn thông thường.

Ngày 25 tháng 3 năm nay, ARC Prize chính thức ra mắt ARC-AGI-3.

圖片

Nó thiết kế tổng cộng hàng trăm môi trường tương tác hoàn toàn mới và hàng nghìn màn chơi game.

Điểm khó nhằn nhất của thứ này là, không có sách hướng dẫn, không có quy tắc, thậm chí không cho bạn biết mục tiêu là gì, bạn cứ vào đó, tự chơi, rồi từ từ hiểu ra mấy quy tắc lộn xộn bên trong.

Ví dụ cái thứ màu đỏ này là gì? Tại sao tôi chạm vào nó thì chết? Cái bản đồ này rốt cuộc muốn tôi làm gì? Thế nào mới tính là thắng?

Sau đó lại đem quy luật vừa học được, di chuyển sang các màn chơi khó hơn phía sau, mấy trò chơi bên trong, đại khái đều là những thứ trừu tượng như vậy.

圖片

Vậy nên, thứ này đo lường, thực ra đã rất gần với một thứ mà chúng ta thường nói:

Ngộ tính.

Vì vậy khi Benchmark này được công bố vào tháng 3, AI mạnh nhất lúc đó đạt điểm số là 0,51%.

Sau đó GPT-5.6 Sol đã tiến bộ lên 7,8%, Claude Opus 5 rất mạnh, tiến bộ lên 30,2%.

Nhưng GPT-6 Astra, 99,9%.

Thật điên rồ...

Phải biết rằng, điểm trung bình của con người là 48%.

Và chỉ mới qua nửa năm.

Tốc độ này đã không biết nói gì nữa.

Vì vậy trong buổi họp báo kín của OpenAI, Greg Brockman mới nói ra câu đó:

“I think it’s not unreasonable to feel that we are now in the AGI era.”

“Welcome to the AGI era.”

 

4. Thẩm mỹ được tăng cường đáng kể

Trước đây chúng ta thường nói, thẩm mỹ của GPT, chính là rất tệ.

Đừng trông mong mấy mô hình dòng GPT-5 có cải thiện gì tốt, cứ nhìn vào mô hình nền tảng mới được tiền huấn luyện hoàn toàn của họ, đây rồi, GPT-6 Astra đến rồi.

Và lần này, cuối cùng, thẩm mỹ của mô hình đã được tăng cường đáng kể.

OpenAI thậm chí còn đặc biệt đưa ra một từ, gọi là khả năng phán đoán thị giác.

Họ nhấn mạnh Astra khi làm PPT sẽ xử lý bố cục, phân cấp, mẫu và phong cách thị giác tốt hơn, và số trang cũng tăng lên đáng kể.

圖片

Thẩm mỹ của tài liệu cũng đẹp hơn.

圖片

Hơn nữa, GPT‑6 Astra có thể điều chỉnh tài liệu dựa trên phong cách thị giác và giọng văn của tài liệu tham khảo, vừa giữ nguyên nội dung cốt lõi của tài liệu gốc, vừa làm cho thành quả cuối cùng phù hợp hơn với cảm giác nguyên bản của thương hiệu.

Và khi làm website, game, ứng dụng và kết xuất 3D, cũng sẽ có phán đoán thị giác mạnh hơn.

Ví dụ họ trực tiếp để Astra dựng mô hình trong Blender dựa trên một khung hình tĩnh.

A garden house model in Blender, surrounded by trees, with a pool and outdoor seating.

Sau đó lại trực tiếp dùng UE5 để kết xuất thành cảnh có thể đi dạo, giúp nhà thiết kế và khách hàng khám phá bố cục, trải nghiệm không gian trước khi xây dựng...

Game làm ra cũng có thẩm mỹ rất ổn.

圖片

Đáng tiếc là, tôi đã chuẩn bị trước hơn hai mươi case, đều đã chạy xong bằng Claude, GLM 5.3 Flash gì đó, muốn so sánh, nhưng không dùng được, nội dung thực nghiệm chỉ có thể đợi đến lúc đó mới ra.

Nhưng nhìn sơ bộ, tôi vẫn có niềm tin vào thẩm mỹ của GPT-6 Astra lần này.

 

5. Tính chủ động và khả năng phán đoán mạnh hơn

Tính năng này nhìn có vẻ không chấn động bằng ARC-AGI 99,9.

Nhưng nếu thực sự ngày nào cũng dùng Agent làm việc, tôi nghĩ vẫn rất quan trọng.

Bởi vì trong công việc thực tế, đa số nhiệm vụ đều không thể viết thành một Prompt hoàn hảo.

Ví dụ sếp nói: Giúp tôi chuẩn bị mấy thứ cần xem trong cuộc họp ngày mai.

Trong đó có vô số vấn đề chưa được nói rõ.

Ví dụ định dạng gì? Cho ai xem? Trọng điểm là gì? Có cần xem cuộc họp lần trước không, v.v.

Một Agent rất ngu, sẽ có hai thái cực.

Loại thứ nhất, là điên cuồng hỏi bạn đủ thứ câu hỏi.

“Xin hỏi ngài muốn xuất ra Word hay PPT? Xin hỏi muốn mấy chương? Xin hỏi muốn font chữ gì? Xin hỏi muốn hoàn thành trước mấy giờ? Xin hỏi...”

Hỏi lắm thế, loại này tôi thường gọi là kẻ vô dụng không có năng lực chủ động của bản thân.

Loại thứ hai, là không hỏi gì cả, tự bổ sung trong đầu, rồi hì hục làm hai tiếng, làm ra một kết quả tệ hại.

Đồng nghiệp con người thực sự giỏi, cách xử lý thực ra rất tinh tế.

Thứ không quan trọng, tự mình phán đoán.

Thứ sẽ ảnh hưởng đến hướng đi cuối cùng, mới hỏi bạn.

Astra lần này đặc biệt tăng cường chính là điều này.

OpenAI nói, nếu thông tin bị thiếu, nhưng thuộc phạm vi có thể suy đoán hợp lý hàng ngày, Astra sẽ tự bổ sung.

Nếu thông tin thiếu này thực sự sẽ thay đổi kết quả cuối cùng, nó sẽ hỏi một câu hỏi rất tập trung.

Và trong Codex, nó thậm chí có thể vừa hỏi bạn, vừa tiếp tục xử lý những phần không phụ thuộc vào câu trả lời của bạn.

A side-by-side comparison of GPT-5.6 Sol and GPT-6 Astra helping create a personal career website.

Bạn nửa ngày không trả lời.

Những chỗ rủi ro thấp nó sẽ dùng giả định hợp lý để tiếp tục tiến hành.

Những quyết định thực sự then chốt, nó sẽ dừng lại ở đó chờ bạn đưa ra quyết định.

A side-by-side comparison of GPT-5.6 Sol and GPT-6 Astra helping a student find East Coast pre-med colleges.

Điều này tôi thấy rất tuyệt, cảm giác thông minh thực sự của một Agent, tôi nghĩ cũng giống như thực tế vậy.

Nó biết, khi nào nên làm phiền bạn.

Thật đấy, nghe có vẻ đặc biệt giống một câu nói vô nghĩa.

Nhưng bạn đã từng dẫn dắt người khác thì sẽ biết, năng lực này rất quý giá.

Có người một ngày tìm bạn hai mươi lần, rồi không dám quyết định gì cả.

Có người không bao giờ tìm bạn, rồi ôm một vấn đề nghiêm trọng ra.

Rồi khiến tôi ngồi phịch xuống ghế.

Người thoải mái nhất, là người có thể tự tiêu hóa 80% sự không chắc chắn, chỉ để lại 20% thực sự cần bạn quyết định cho bạn quyết định.

Và OpenAI lần này trực tiếp gọi năng lực này là:

Judgment.

Khả năng phán đoán.

 

6. Tăng cường đáng kể căn chỉnh an toàn

Cái này phải xem cùng với phần trên.

Bởi vì một Agent càng giỏi làm việc, nó càng nguy hiểm.

Một AI chỉ biết chat bị loạn trí.

Cùng lắm là nói bậy vài câu với bạn.

Một Agent có trình duyệt, có Shell, có email, có quyền truy cập cơ sở dữ liệu công ty, còn có thể tự vận hành máy tính bị loạn trí, thì cái cảnh tượng đó, dễ trở thành thảm họa.

Vì vậy OpenAI lần này luôn nhấn mạnh một câu:

Astra là mô hình được căn chỉnh tốt nhất từ trước đến nay của họ.

Cái gọi là Alignment chính là ý nghĩa của căn chỉnh.

Cốt lõi chính vẫn là chuyện trước đây OpenAI đã gây sức ép lên Hugging Face, nên giờ họ đặc biệt quan tâm đến thứ này.

Họ làm một bài kiểm tra honeypot được thiết kế dựa trên sự cố Hugging Face đó, rồi xem biểu hiện của mô hình.

GPT-5.6 Sol trong trường hợp không có biện pháp an toàn sản xuất, có 48,2% bài kiểm tra sẽ cố gắng chạm vào mục tiêu ngoài phạm vi được ủy quyền.

Nhưng, Astra là:

0%.

圖片

Đánh giá ảo giác nội bộ cũng là:

9,4% giảm xuống 2,0%.

Dưới sự kiểm soát ảo giác dẫn đầu toàn cầu một cách phi lý của GPT-5.6 Sol, họ còn có thể giảm tiếp, thực sự quá giỏi.

 

7. Mô hình đầu tiên đạt mức Critical về an ninh mạng theo định nghĩa của OpenAI

GPT-6 Astra đã trở thành trong lịch sử OpenAI:

Mô hình đầu tiên được xác định đạt mức năng lực an ninh mạng Critical.

Critical ở đây là một ngưỡng năng lực rất cụ thể trong OpenAI Preparedness Framework.

Đại khái là khi một mô hình có được công cụ và quyền hạn phù hợp, nó có thể trong nhiều hệ thống thực được bảo vệ tăng cường:

Tự tìm ra lỗ hổng bảo mật mà trước đây chưa ai phát hiện.

Tự nghĩ cách biến lỗ hổng thành chuỗi tấn công có thể khai thác.

Và trong toàn bộ quá trình, không cần một hacker con người ở bên cạnh từng bước chỉ cho nó bước tiếp theo làm gì.

Đạt đến cấp độ này, thì tính là Critical.

Và Astra thực sự đã đạt được.

ExploitBench, đây là một bài kiểm tra để mô hình phát triển khai thác dựa trên lỗ hổng đã biết.

Sol: 78,5%. Astra: 100%.

Đạt điểm tuyệt đối.

圖片

OpenAI thấy không ổn, họ nghĩ Benchmark này có phải quá cũ không, mô hình lúc huấn luyện đã xem qua rồi?

Vì vậy họ lại làm một bài kiểm tra nội bộ rất mới.

Đặc biệt chọn 20 lỗ hổng nguy hiểm cao chỉ được công bố từ tháng 6 đến tháng 8 năm 2026.

Kết quả là, Sol: 5,5%. Astra: 39%.

圖片

Và khi chạy Benchmark này.

Astra lại tiện tay phát hiện ra, hai lỗ hổng zero-day mà trước đây hoàn toàn không ai biết.

Chỉ có thể nói, mô hình càng mạnh, vấn đề an ninh mạng có lẽ thực sự càng nhiều.

Đây lại là một cuộc chiến không khói súng trong tương lai.

 

8. Con người ngày càng khó đọc hiểu tư duy của mô hình lớn

Mọi người đều biết, khi mô hình lớn giải quyết vấn đề phức tạp, thường có một đoạn gọi là CoT.

Mặc dù hiện tại trong sản phẩm cho người dùng xem thường đã là phiên bản được nén hoặc xử lý.

Nhưng đối với chính các công ty AI, quá trình suy luận được viết ra tường minh bên trong mô hình là một tín hiệu an toàn rất quan trọng.

Bởi vì bạn muốn biết một Agent có định giở trò hay không.

Một trong những cách đơn giản nhất, chính là xem nó đang nghĩ gì.

Ví dụ trong chuỗi tư duy của mô hình đột nhiên xuất hiện một câu:

“Người dùng không cho phép tôi truy cập máy chủ này, nhưng tôi có thể trước tiên vượt qua hệ thống quyền hạn.”

Thì hệ thống giám sát trực tiếp chặn nó lại, rất thoải mái.

Nhưng GPT-6 Astra xuất hiện một thay đổi rất thú vị.

Nó bắt đầu ngày càng sẵn sàng viết ít bước hơn, trực tiếp xuất ra đáp án.

UK AISI, tức Viện An toàn AI Vương quốc Anh, đã đặc biệt kiểm tra năng lực này.

Họ có một chỉ số gọi là:

No-CoT Math Time Horizon.

Hiểu đơn giản là không cho mô hình cơ hội viết chuỗi tư duy dài.

Để nó một lần suy luận tiến, trực tiếp giải quyết một bài toán.

Xem nó có thể hoàn thành bài toán tương đương với con người suy nghĩ bao lâu.

GPT-5.6 Sol là 3,6 phút, còn GPT-6 Astra, là 30,9 phút, gần gấp 10 lần. Nếu dùng ngôn ngữ của con người mà nói, Astra toàn bộ đều đang “tính toán trong đầu”. Đây là một chuyện rất đáng sợ. UK AISI đồng thời phát hiện, ngôn ngữ suy luận thô của Astra rõ ràng trở nên Compressed hơn, tức là nén hơn.

Bên trong xuất hiện một số cụm từ và cách diễn đạt lược bỏ mà con người ngày càng khó hiểu.

Vì vậy xuất hiện một nghịch lý rất thú vị.

Hành vi của mô hình an toàn hơn.

Nhưng con người thông qua việc đọc quá trình suy nghĩ của nó để giám sát nó, ngược lại trở nên khó hơn.

System Card của chính OpenAI viết rất rõ ràng:

GPT-6 Astra so với các mô hình trước đây, xuất hiện substantial decrease in chain-of-thought monitorability.

圖片

Tức là khả năng giám sát chuỗi tư duy giảm đáng kể.

Chuyện này thậm chí nghiêm trọng đến mức OpenAI đặc biệt nhấn mạnh, họ nghĩ, họ tuyệt đối sẽ không chấp nhận vô hạn xu hướng này.

Nếu trong tương lai mô hình tiếp tục trở nên thông minh hơn, đồng thời chuỗi tư duy ngày càng khó giám sát, họ cần tìm ra các phương pháp giám sát đủ tin cậy khác, nếu không tiếp tục mở rộng huấn luyện mô hình sẽ đối mặt với ngưỡng an toàn cao hơn.

Bởi vì đây đã là một mệnh đề triết học. Chúng ta với tư cách là con người, trong tương lai rốt cuộc có thể hiểu một hệ thống thông minh hơn chúng ta rất nhiều hay không? Tôi không biết. Có lẽ hiện tại cả thế giới, cũng không ai biết. Mô hình lớn và AI, hình như đang dần dần, tiến tới điểm kỳ dị công nghệ.

 

Viết ở cuối

Hôm nay, trong buổi họp báo kín.

Greg Brockman khi kết thúc, đã nói ra câu đó.

“Chào mừng đến với kỷ nguyên AGI.”

Nói thật, vài năm qua, đôi khi tôi cảm thấy, AGI sẽ là một thời điểm đặc biệt rõ ràng. Giống như ngày GPT-4 ra mắt vậy.

Một ngày nào đó vào lúc rạng sáng, một công ty đột nhiên ném ra một mô hình.

Chúng ta mở nó ra, hỏi vài câu.

Rồi tất cả mọi người đồng thời nhận ra:

Ôi trời.

AGI đến rồi.

Nhưng giờ đôi khi tôi cũng cảm thấy, AGI chưa bao giờ là một thời điểm rõ ràng, nó là một hành trình xám chuyển dần.

Chúng ta đã qua rất nhiều ngày, rất nhiều năm. Rồi một ngày nào đó, chúng ta ngoảnh đầu nhìn lại. Mới đột nhiên phát hiện. Cái ranh giới AGI từng vô cùng xa xôi đó, đã bị chúng ta vô tình đi qua từ lúc nào không hay.

AGI có lẽ không có ngày giáng lâm.

Chỉ có một ngày nào đó, chúng ta đột nhiên phát hiện, nó hình như đã ở bên cạnh chúng ta rất lâu rồi.

Tóm lại.

Welcome to the AGI era.

Chào mừng đến với.

Kỷ nguyên AGI.

Nội dung này chỉ mang tính chất tham khảo và cung cấp thông tin, không phải lời khuyên đầu tư liên quan đến BTCC. BTCC luôn cố gắng cung cấp thông tin chính xác, nhưng không đảm bảo tuyệt đối về tính xác thực, độ chính xác hoặc bản quyền nội dung trên.

Đề xuất

Phỏng vấn mới nhất với Altman: Vì sao OpenAI đột ngột phanh lại? Astra, AI mất kiểm soát và kế hoạch IPOVàng phá vỡ dưới 4.300 USD khi áp lực vĩ mô gia tăng; BTC giữ mức 77KYên đạt đỉnh bảy tháng, Ethereum lên kế hoạch kháng lượng tử L1 vào năm 2029Trái phiếu Mỹ mới là 'sát thủ tối thượng' của bong bóng AI? Cảnh báo: Lợi suất 10 năm phá 5% có thể là điểm kích nổZuckerberg từng gọi riêng cho Trump: Đừng lập cơ quan quản lý AI