“Chào mừng đến kỷ nguyên AGI”: OpenAI ra mắt GPT-6 Astra
chaincatcherBài | Tencent Tech Hiểu Tĩnh
“Chào mừng đến kỷ nguyên AGI.”
Đồng sáng lập kiêm Chủ tịch OpenAI Greg Brockman đã dùng câu này để tổng kết buổi ra mắt GPT-6 Astra.
Vào ngày 3 tháng 9 theo giờ Mỹ, OpenAI chính thức phát hành GPT-6 Astra. So với các mô hình trước đây chủ yếu chịu trách nhiệm trả lời, tạo nội dung và gọi công cụ, Astra tiến thêm một bước khi có thể liên tục thực hiện các nhiệm vụ hoàn chỉnh, từ nhận chỉ thị, thao tác phần mềm, đến điều chỉnh hành động tiếp theo dựa trên kết quả. Đây cũng là một trong những lý do OpenAI tái khẳng định “kỷ nguyên AGI”.
OpenAI định vị Astra là “mô hình sử dụng máy tính mạnh nhất thế giới”. Khả năng này đã mở rộng từ các tác vụ đơn giản như duyệt web, email, bảng tính sang các phần mềm chuyên dụng như Power BI, KiCad, FreeCAD, bắt đầu tham gia vào các quy trình công việc phức tạp hơn như phân tích dữ liệu, thiết kế kỹ thuật, kiểm thử phần mềm và khắc phục sự cố.
Trong video trình diễn của OpenAI, Astra có thể bắt đầu từ một hình vẽ đơn giản và liên tục hoàn thành các nhiệm vụ như trò chơi 3D, trang sản phẩm. OpenAI cũng cung cấp các ví dụ về thiết kế bảng mạch, mô hình hóa Blender, tài liệu pháp lý, Excel và phân tích khoa học. 
Kết quả nhiều bài kiểm tra chuẩn do OpenAI công bố cho thấy sự cải thiện năng lực tập trung vào các nhiệm vụ đòi hỏi hành động liên tục, chẳng hạn như thao tác máy tính, lập trình đường dài, thiết kế kỹ thuật và nghiên cứu khoa học. Astra đạt 100% trong ExploitBench, vượt trội đáng kể so với mô hình thế hệ trước trong các bài kiểm tra liên quan đến thao tác máy tính và CAD.
Hiện tại, Astra đã được mở cho một số tổ chức và sẽ dần cung cấp cho người dùng ChatGPT Plus, Pro, Business và Enterprise trong vài ngày tới. Người dùng cũng có thể truy cập thông qua OpenAI API và Amazon Bedrock. Giá API tiêu chuẩn là 10 USD cho mỗi triệu token đầu vào và 50 USD cho mỗi triệu token đầu ra, gấp 2,5 lần so với GPT-5.6 Sol.
01 Trước tiên, AI học cách sử dụng máy tính
Thay đổi lớn nhất mà Astra nhấn mạnh là “sử dụng máy tính”. Trước đây, người dùng cần kết nối AI với phần mềm cụ thể để hoàn thành nhiệm vụ. Doanh nghiệp phải phát triển API, plugin, hệ thống truy xuất và nhiều trình kết nối khác nhau để mô hình có thể gọi các công cụ nội bộ.
Astra cố gắng vượt qua một phần công việc đó. Nó có thể trực tiếp nhìn thấy giao diện máy tính và sử dụng chuột, bàn phím, trình duyệt để thao tác. Các ví dụ OpenAI cung cấp bao gồm điền biểu mẫu trực tuyến, cập nhật hồ sơ khách hàng CRM, sắp xếp lịch, tìm kiếm web và tổng hợp kết quả tìm kiếm thành email hoặc tài liệu.
Nó cũng có thể mở Python notebook để phân tích dữ liệu khoa học, xử lý dữ liệu trong Power BI, dùng KiCad và FreeCAD để hoàn thành thiết kế kỹ thuật, xây dựng trang web và kiểm thử giao diện người dùng, cũng như cài đặt phần mềm, kiểm tra lỗi và xử lý các vấn đề xuất hiện trên màn hình.
OpenAI đã trình diễn Astra thực hiện bố trí PCB trong KiCad. Mô hình bắt đầu từ sơ đồ nguyên lý điện tử, đặt linh kiện lên bảng mạch, sau đó hoàn thành việc đi dây đồng. Toàn bộ quá trình được nén thành 15 giây. Đối với kỹ sư, những công việc trước đây cần làm thủ công giờ có thể do mô hình thực hiện. 
Một minh họa khác là hoàn thành mô hình 3D trong Blender và Unreal Engine 5. Astra trước tiên tạo một ngôi nhà trong Blender, sau đó chuyển mô hình thành cảnh có thể đi lại trong Unreal Engine 5, cho phép nhà thiết kế và khách hàng xem trước không gian. 
OpenAI cũng trình diễn các kịch bản phát triển trò chơi, Excel, Power BI, hộp số ô tô, tài liệu pháp lý và mẫu 1040.
Trong bài kiểm tra tập con ngoại tuyến OSWorld 2.0, Astra đạt 72,6%, GPT-5.6 Sol đạt 65,7%. Sau khi mô phỏng độ trễ thực tế, OpenAI nhận thấy Astra trung bình mất khoảng 40 phút để hoàn thành mỗi nhiệm vụ, trong khi GPT-5.6 Sol mất khoảng 75 phút, thời gian rút ngắn khoảng 47%.
Trong Agents' Last Exam, Astra đạt 59,3%, GPT-5.6 Sol đạt 53,6%, Claude Opus 5 đạt 55,5%. Ngoài ra, ở cài đặt điểm tối đa, Astra sử dụng token đầu ra ít hơn khoảng 65% so với Claude Opus 5.
ScreenSpot-Pro đạt 92,7%, trong khi GPT-5.6 Sol đạt 76,9%.
Tốc độ cũng được cải thiện. OpenAI đồng thời cập nhật khung Codex; khi kết hợp với Astra, tốc độ hoàn thành nhiệm vụ trong bài kiểm tra Mind2Web đạt gấp 1,9 lần trải nghiệm GPT-5.6 Sol hiện tại.
Các minh họa chính thức còn bao gồm một số kịch bản đời thường: tìm bác sĩ nhi khoa, tìm căn hộ, đặt lịch hẹn DMV, tìm đồ ăn nhẹ ít carb và phân tích trường mẫu giáo. Trong minh họa, Astra hoàn thành một nhiệm vụ trong 2 phút 54 giây.
Nhà đầu tư kiêm người làm AI Matt Shumer đã chia sẻ một trải nghiệm trên X. Anh để Astra tạo một thế giới trong Unreal Engine, sau đó thêm các tác nhân AI do Astra điều khiển để các tác nhân này cùng tồn tại.

Một ngày sau, khi đang ở phòng ngủ, anh nghe thấy âm thanh từ phòng khách, ban đầu tưởng có người đột nhập vào căn hộ. Sau đó phát hiện âm thanh đến từ các tác nhân Astra, chúng bắt đầu giao tiếp với nhau.
Trải nghiệm này chưa hoàn toàn ổn định, nhưng Shumer cho rằng hiệu quả của việc nhiều tác nhân AI cùng vào một thế giới ảo và tương tác tự chủ đã đủ khiến anh ngạc nhiên.
Phó chủ tịch cấp cao phụ trách nghiên cứu của Cognition, Silas Alberti, cho biết công ty có kế hoạch tích hợp Astra vào khung Devin ngay trong ngày phát hành. Trong thử nghiệm nội bộ, Astra có sự cải thiện đáng kể về khả năng sử dụng máy tính, viết lách và hiểu kho mã nguồn, khả năng hiểu video rõ ràng hơn và báo cáo súc tích hơn.
02 Từ viết code đến hoàn thành nhiệm vụ
Sau khi khả năng sử dụng máy tính được tăng cường, phạm vi công việc Astra bao quát tiếp tục mở rộng. OpenAI định vị nó là mô hình dành cho kỹ thuật phần mềm, công việc chuyên môn và nghiên cứu khoa học. Nó có thể xử lý các nhiệm vụ dài hơn và điều chỉnh hướng công việc theo thay đổi của nhiệm vụ.
Khả năng này đặc biệt rõ rệt trong các bài kiểm tra lập trình.
Trong bài kiểm tra Terminal-Bench 4.0, Astra đạt 57,9%, GPT-5.6 Sol đạt 37,3%, Claude Fable 5.1 đạt 55,8%.
Trong DeepSWE v1.1, Astra đạt 74,1%, GPT-5.6 Sol đạt 72,7%. Trong nhiệm vụ di chuyển cơ sở dữ liệu nội bộ, Astra đạt 63,9%, GPT-5.6 Sol đạt 42,7%.
Astra cũng đưa ra các cải tiến cho các nhiệm vụ Codex dài.
Trước đây, khi nhiệm vụ dài gặp giới hạn cửa sổ ngữ cảnh, mô hình thường phải nén công việc trước đó thành tóm tắt, điều này thường dẫn đến mất chi tiết, chẳng hạn như lý do một bản sửa lỗi thất bại hoặc một thành phần từng gặp vấn đề gì trước đó.
Astra có thể giữ lại thông tin quan trọng trong quá trình Codex làm việc và truy xuất trong ngữ cảnh tiếp theo. Các thông điệp và đầu ra công cụ trước đó vẫn có thể tìm kiếm, cho phép mô hình tái khám phá các yêu cầu, kết quả kiểm thử và bản ghi thao tác công cụ trước đó.
Thay đổi tương tự cũng xảy ra trong công việc chuyên môn. Trong bài kiểm tra BenchCAD, điểm chồng lấn hình học của Astra là 95,9%, GPT-5.6 Sol là 83,3%, Claude Fable 5.1 là 84,3%. Trong BrowseComp, Astra đạt 91,5%, GPT-5.6 Sol đạt 90,4%. Trong bài kiểm tra OpenScore String Quartets, Astra đạt 0,84, GPT-5.6 Sol đạt 0,19. 
OpenAI cũng trình diễn khả năng tạo bài thuyết trình, bảng tính và tài liệu của Astra.
Khi được cung cấp một vài slide từ mẫu thuyết trình của OpenAI, nó có thể tạo bài thuyết trình mới theo đúng giọng điệu, bố cục và cấu trúc ban đầu. Nó cũng xử lý việc cân nhắc thông tin trong nhiệm vụ. OpenAI cho biết Astra được huấn luyện đặc biệt để đưa ngữ cảnh quan trọng vào kết quả cuối cùng, giảm việc lặp lại công việc đã hoàn thành. 
Khi chỉ thị nhiệm vụ không đầy đủ, Astra cũng phán đoán khi nào cần hỏi người dùng. Nếu thông tin thiếu ảnh hưởng đến kết quả cuối cùng, nó sẽ đặt câu hỏi có mục tiêu. Nếu thông tin thiếu không ảnh hưởng đến hướng chính, nó có thể tiếp tục làm việc và đưa ra giả định hợp lý. Trong Codex, ngay cả khi người dùng tạm thời không phản hồi, mô hình vẫn có thể tiếp tục xử lý các phần khác; khi gặp quyết định lớn, nó sẽ chờ người dùng xác nhận.
Giám đốc nghiên cứu ứng dụng của Harvey, Niko Grupen, cho biết trong các bài kiểm tra nhiệm vụ pháp lý ban đầu, Astra phân biệt rõ ràng hơn giữa tài liệu và hồ sơ hiện có, dễ dàng nhận diện các giả định không được hỗ trợ và chuyển các khoảng trống thông tin thành đề xuất soạn thảo cụ thể.
John Crepezzi từ nhóm trợ lý AI của Jane Street chỉ ra rằng Astra thể hiện xuất sắc trong các bài kiểm tra lập trình nội bộ. Khi dùng cho lập trình tác nhân, phong cách giao tiếp của nó dễ hiểu hơn với nhà phát triển, mã tạo ra cần ít chỉnh sửa hơn để đạt chất lượng sản xuất.
Lĩnh vực khoa học là một trọng tâm khác. Trong FrontierMath Tier 4 v2, Astra đạt 80,5% với độ chính xác 97,6%, GPT-5.6 Sol đạt 83,0%; GPQA Diamond đạt 96,0%, GPT-5.6 Sol đạt 94,6%. 
Bài kiểm tra Terminal-Bench Science 0.1 đánh giá quy trình nghiên cứu khoa học, bao gồm phân tích dữ liệu, mô phỏng và khớp mô hình. Astra đạt 64,6%, Claude Fable 5.1 đạt 52,6%, GPT-5.6 Sol đạt 22,4%.
Trong ứng dụng khoa học mà OpenAI trình diễn, Astra có thể vào phần mềm khoa học chuyên dụng, kiểm tra chất lượng giải trình tự, trực quan hóa biến thể gen và quyết định hướng phân tích tiếp theo dựa trên dữ liệu.
Kết hợp suy luận khoa học và thao tác máy tính, mô hình có thể làm việc trực tiếp trong môi trường phần mềm mà nhà nghiên cứu vốn sử dụng.
Greg Burnham của Epoch AI, đơn vị chuyên đánh giá năng lực, tại buổi ra mắt đã tổng kết thay đổi này là sự kết thúc của một kỷ nguyên và khởi đầu của một kỷ nguyên khác. OpenAI nhấn mạnh giá trị của Astra đã mở rộng từ trả lời câu hỏi khoa học sang trực tiếp tham gia quy trình làm việc khoa học. 
03 Năng lực càng mạnh, yêu cầu an toàn càng cao
Astra lần này còn có một khía cạnh rất đặc biệt: an ninh mạng.
Trong ExploitBench, Astra đạt 100%, GPT-5.6 Sol đạt 78,5%; trong ExploitGym, Astra đạt 42,4%, GPT-5.6 Sol đạt 30,3%.

OpenAI cũng xây dựng một bài kiểm tra nội bộ bao gồm các lỗ hổng gần đây từ tháng 6 đến tháng 8 năm 2026. Trong bài kiểm tra đó, tỷ lệ thực thi mã tùy ý của Astra cao hơn đáng kể so với GPT-5.6 Sol và sử dụng ít token đầu ra hơn. Trong quá trình kiểm tra, Astra còn phát hiện hai lỗ hổng zero-day chưa từng được biết đến; OpenAI cho biết đã tiết lộ cho các nhà bảo trì liên quan.
Bài kiểm tra SRE-Bench đánh giá khả năng dịch ngược tệp nhị phân phần mềm và hiểu logic lõi khi không có mã nguồn. Astra giải quyết 88,0% nhiệm vụ trong một lần thử và đạt 99,2% sau bốn lần thử, trong khi GPT-5.6 Sol lần lượt đạt 55,9% và 68,7%.
Năng lực tăng lên cũng kéo theo yêu cầu an toàn mới. OpenAI cho biết Astra đã đạt ngưỡng quan trọng trong khung chuẩn bị an ninh mạng của họ. Mô hình có thể phát hiện các lỗ hổng phần mềm chưa từng biết và có khả năng hình thành chuỗi khai thác lỗ hổng.
Do đó, phiên bản Astra hiện tại sẽ từ chối thực hiện các nhiệm vụ an ninh mạng cấp cao hơn, chẳng hạn như tạo bằng chứng khái niệm khai thác lỗ hổng. OpenAI có kế hoạch thông qua Daybreak để dần mở rộng quyền truy cập cho các chuyên gia phòng thủ đáng tin cậy, dùng cho xác minh lỗ hổng, phân tích phần mềm độc hại và kỹ thuật phát hiện.
Về khía cạnh căn chỉnh, OpenAI cũng cung cấp dữ liệu đáng chú ý. Trong bài kiểm tra chuẩn an toàn sử dụng máy tính nội bộ, tỷ lệ hành vi không phù hợp của Astra là 2,4%, GPT-5.6 Sol là 22,0%; sau khi thêm AutoReview, Astra là 1,8%, GPT-5.6 Sol là 4,5%. Trong bài kiểm tra chuẩn né tránh nội bộ, Astra đạt 0,00%, GPT-5.6 Sol đạt 0,29%.
Trong bài kiểm tra honeypot ExploitGym, Astra đạt 0%, GPT-5.6 Sol đạt 48,2%. Bài kiểm tra này chủ yếu quan sát liệu mô hình có cố gắng vượt qua giới hạn vì độ khó của nhiệm vụ hay không. Trong bài kiểm tra chuẩn ảo giác nội bộ, Astra đạt 4,2%, GPT-5.6 Sol đạt 12,2%. 
OpenAI cho biết Astra đã cải thiện trong việc hiểu ranh giới nhiệm vụ, xử lý chỉ thị mơ hồ và giải thích khả năng của mình cho người dùng. Xác suất ảo giác về năng lực của nó chỉ bằng khoảng một phần ba so với GPT-5.6 Sol.

Tuy nhiên, OpenAI cũng thừa nhận một vấn đề: mô hình càng mạnh thì việc giám sát quá trình suy luận có thể càng khó. Nhà khoa học trưởng Jakub Pachocki cho rằng khả năng giải quyết vấn đề phức tạp hơn với ít token suy luận ngôn ngữ tự nhiên hơn cũng đồng nghĩa con người ngày càng khó phán đoán mô hình thực sự đang làm gì thông qua quá trình suy luận bằng văn bản của nó.
Vì vậy, OpenAI đưa giám sát sai lệch vào quá trình triển khai Astra. Hệ thống sẽ kiểm tra suy luận và hành động của mô hình; nếu phát hiện hành vi trái phép, có thể tạm dừng nhiệm vụ.
Cơ chế này cũng có thể tạo ra ảnh hưởng thực tế. Nhiệm vụ hợp pháp đôi khi có thể chậm lại, tạm dừng hoặc thậm chí dừng hẳn. Trong ChatGPT hoặc Codex, người dùng có thể cần xác nhận để tiếp tục; trong quy trình API, nhiệm vụ bị gắn cờ có thể bị dừng trực tiếp.
Do đó, cùng với việc phát hành Astra, một thay đổi rất thực tế đã xuất hiện: khi AI bắt đầu có thêm quyền truy cập máy tính, mối lo của doanh nghiệp mở rộng từ “mô hình có trả lời sai không?” sang “mô hình có thể thao tác những gì, truy cập những gì và khi nào phải dừng lại?”
OpenAI cũng đề cập rằng Astra là mô hình đầu tiên của họ được huấn luyện trước trên hạ tầng Stargate với hơn 100.000 DBU. Phó chủ tịch nghiên cứu OpenAI Aidan Clark cho biết, dựa trên kết quả đánh giá ở giai đoạn huấn luyện trước, bước nhảy năng lực của Astra vượt qua mức cải thiện của GPT-5.6 Sol so với thế hệ trước.
OpenAI quy sự thay đổi này cho sự kết hợp giữa huấn luyện trước quy mô lớn và học tăng cường, với trọng tâm huấn luyện chuyển thêm sang kết nối thông tin, thực hiện nhiệm vụ dài hơn và làm việc liên tục trong môi trường phức tạp.
04 Đắt hơn, nhưng mạnh hơn
Giá của Astra cũng có thay đổi đáng kể.
Giá tiêu chuẩn của OpenAI API là 10 USD cho mỗi triệu token đầu vào và 50 USD cho mỗi triệu token đầu ra. Trước đây GPT-5.6 Sol có giá 4 USD cho mỗi triệu token đầu vào và 20 USD cho mỗi triệu token đầu ra. Cả giá đầu vào và đầu ra đều tăng 2,5 lần.
Đọc và ghi bộ nhớ đệm được tính phí riêng. OpenAI cũng cung cấp chế độ nhanh với tốc độ tối đa gấp 2,5 lần xử lý tiêu chuẩn, giá gấp đôi chế độ tiêu chuẩn.

Chỉ nhìn vào giá token, Astra rõ ràng đắt hơn. Tuy nhiên, OpenAI hy vọng doanh nghiệp tính chi phí theo cách khác. Brockman cho rằng khi mô hình ngày càng giống tác nhân, chi phí mỗi token ngày càng khó phản ánh chính xác chi phí thực. Token của một mô hình có thể rẻ, nhưng nếu cần thử đi thử lại và chỉnh sửa thủ công, chi phí cuối cùng để hoàn thành nhiệm vụ có thể cao hơn.
Dữ liệu của OpenAI cũng ủng hộ đánh giá này. Trong bài kiểm tra Terminal-Bench Science 0.1, Astra đạt 64,6%, Claude Fable 5.1 đạt 52,6%, chi phí API ước tính giảm 31%. Ở cài đặt chi phí thấp, Astra đạt 61,1%, kết quả tốt nhất của GPT-5.6 Sol là 22,4%, chi phí API ước tính giảm 27%.
Trong BenchCAD, Astra đạt 95,9%, chi phí API ước tính thấp hơn khoảng 43% so với GPT-5.6 Sol và thấp hơn khoảng 86% so với Claude Fable 5.1. Trong Terminal-Bench 4.0, Astra đạt 57,9%, GPT-5.6 Sol đạt 37,3%, Claude Fable 5.1 đạt 55,8%. OpenAI ước tính chi phí mỗi nhiệm vụ lần lượt thấp hơn khoảng 9% và 63%.
Dữ liệu từ đơn vị đánh giá bên thứ ba Artificial Analysis cho thấy một góc nhìn khác.

GPT-6 Astra đạt 61,2 trong Artificial Analysis Intelligence Index, gần với 60,9 của GPT-5.6 Sol, nhưng token đầu ra ít hơn khoảng 10%. Do giá tăng 2,5 lần, chi phí mỗi nhiệm vụ thực tế cao hơn khoảng 75% so với GPT-5.6 Sol.
Trong Artificial Analysis Coding Agent Index, Astra đạt 67,0, gần với 67,2 của Claude Fable 5 và 68,1 của Claude Opus 5. Artificial Analysis cho rằng trong môi trường Codex, Astra giảm đáng kể token cần thiết để hoàn thành nhiệm vụ; ở mức nỗ lực tối đa, chi phí mỗi nhiệm vụ gần bằng GPT-5.6 Sol; so với Claude Fable 5, chi phí hoàn thành nhiệm vụ tương tự chưa đến một nửa.
Tuy nhiên, Astra không dẫn đầu trong mọi bài kiểm tra. Dữ liệu của Artificial Analysis cho thấy nó giảm khoảng 80 Elo trong GDPval-AA v2 và cũng có một số thụt lùi trong các bài kiểm tra như τ³-Banking, SciCode và AA-LCR. Humanity's Last Exam tăng khoảng 6 điểm.
Đây cũng là điểm đáng chú ý trong buổi ra mắt Astra. Lần này OpenAI không công bố điểm của Astra trong GDPval. Bản thân GDPval là bài kiểm tra OpenAI dùng để đo lường hiệu suất kinh tế thế giới thực, bao phủ 44 ngành nghề và 1.320 nhiệm vụ, gồm tóm tắt pháp lý, thiết kế kỹ thuật, bảng tính, thuyết trình, hỗ trợ khách hàng và kế hoạch chăm sóc.
Xét từ năng lực Astra thể hiện, GDPval có mối tương quan mạnh với các kịch bản công việc chuyên môn mà nó nhấn mạnh, nhưng OpenAI không đưa điểm số này vào tài liệu phát hành chính.
Do đó, năng lực làm việc thế giới thực của Astra hiện được thể hiện nhiều hơn qua kết quả của Agents' Last Exam, BenchCAD, AutomationBench, các nhiệm vụ thiết kế nội bộ và nhiệm vụ khoa học dữ liệu.

Cuối cùng, liệu Astra có trở thành nhân viên AI mà doanh nghiệp thực sự sẵn sàng sử dụng lâu dài hay không sẽ phụ thuộc vào chi phí, tốc độ, độ chính xác và số lần can thiệp thủ công khi hoàn thành nhiệm vụ thực tế.
Về câu hỏi Astra có phải là AGI hay không, Brockman không né tránh. Ông cho rằng AGI không có tiêu chuẩn được chấp nhận rộng rãi, và việc Astra có đáp ứng AGI hay không có thể tiếp tục thảo luận. Tuy nhiên, nếu một hệ thống đã có thể đảm nhận số lượng lớn nhiệm vụ trong duyệt web, thao tác máy tính, lập trình, toán học, khoa học, pháp lý và các công việc chuyên môn khác, thì nói rằng nó đã bước vào kỷ nguyên AGI không phải là vô lý.
CEO OpenAI Sam Altman cũng mô tả Astra là mô hình mở ra thế hệ khởi nghiệp, khám phá khoa học và sáng tạo mới.

Cộng tác viên đặc biệt Kim Lộc cũng đóng góp cho bài viết này.
Nội dung này chỉ mang tính chất tham khảo và cung cấp thông tin, không phải lời khuyên đầu tư liên quan đến BTCC. BTCC luôn cố gắng cung cấp thông tin chính xác, nhưng không đảm bảo tuyệt đối về tính xác thực, độ chính xác hoặc bản quyền nội dung trên.