Cuộc tìm kiếm Trí thông minh tổng quát nhân tạo (AGI) vừa trở nên thú vị và thách thức hơn rất nhiều! Trong một phát triển mang tính đột phá đang gửi những làn sóng qua thế giới AI, Quỹ Giải thưởng Arc, do nhân vật nổi bật trong lĩnh vực AI François Chollet dẫn dắt, đã công bố một bài kiểm tra AGI mới, cực kỳ khó khăn. Được gọi là ARC-AGI-2, tiêu chuẩn này được thiết kế để thực sự đo lường trí thông minh tổng quát của các mô hình AI, và kết quả ban đầu thì, ồ, khiêm tốn ngay cả với những hệ thống tiên tiến nhất.

Tại sao ARC-AGI-2 lại là rào cản mới cho các mô hình AI?

Theo một bài viết gần đây từ Quỹ Giải thưởng Arc, ARC-AGI-2 đang chứng tỏ là một thử thách đáng gờm. Các mô hình AI "lý luận" hàng đầu như o1-pro của OpenAI và R1 của DeepSeek chỉ mới chạm vào bề mặt, ghi được chỉ 1% đến 1.3% trên bảng xếp hạng bài kiểm tra AGI. Ngay cả các mô hình không lý luận mạnh mẽ, bao gồm GPT-4.5, Claude 3.7 Sonnet và Gemini 2.0 Flash, cũng chỉ đạt khoảng 1%. Điều này hoàn toàn đối lập với hiệu suất của con người, khi các ban trung bình đạt độ chính xác 60% trên cùng các câu hỏi ARC-AGI-2.

Vậy, điều gì làm cho tiêu chuẩn AI mới này trở nên khác biệt và khó khăn đến vậy?

  • Vấn đề câu đố hình ảnh: ARC-AGI-2 trình bày các mô hình AI với các vấn đề giống như câu đố liên quan đến việc xác định các mẫu hình ảnh trong các lưới hình vuông màu. Mục tiêu là để AI tạo ra lưới "đáp án" chính xác dựa trên những mẫu này.

  • Khả năng thích ứng: Không giống như các bài kiểm tra trước, ARC-AGI-2 được thiết kế đặc biệt để buộc các mô hình AI thích ứng với những loại vấn đề hoàn toàn mới mà họ chưa gặp phải trong quá trình huấn luyện. Điều này kiểm tra khả năng giải quyết vấn đề thực sự thay vì chỉ nhớ lại.

  • Chỉ số hiệu quả: Một đổi mới quan trọng trong ARC-AGI-2 là việc giới thiệu một chỉ số hiệu quả. Điều này có nghĩa là không chỉ đơn thuần là đưa ra câu trả lời đúng, mà còn là cách mà mô hình AI đạt được giải pháp một cách hiệu quả. Điều này trực tiếp giải quyết những lo ngại về sức mạnh tính toán thô che giấu trí thông minh thực sự trong các tiêu chuẩn trước đó.

Dưới đây là một so sánh về cách các loại mô hình khác nhau đang hoạt động:

Ví dụ về loại mô hình AI Điểm số ARC-AGI-2 (Gần đúng) Mô hình AI Lý luận OpenAI o1-pro, DeepSeek R1 1% – 1.3% Mô hình AI Không Lý luận GPT-4.5, Claude 3.7 Sonnet, Gemini 2.0 Flash Khoảng 1% Các Ban Trung bình của Con người 60%

Nguồn: Bảng xếp hạng Giải thưởng Arc

ARC-AGI-2 so với ARC-AGI-1: Điều gì đã thay đổi?

François Chollet tự mình đã tuyên bố trên X (trước đây là Twitter) rằng ARC-AGI-2 là một thước đo vượt trội về trí thông minh thực sự của mô hình AI so với người tiền nhiệm của nó, ARC-AGI-1. Mục tiêu cốt lõi của các bài kiểm tra của Quỹ Giải thưởng Arc vẫn nhất quán: để đánh giá khả năng của một hệ thống AI trong việc học các kỹ năng mới vượt ra ngoài dữ liệu huấn luyện của nó.

Tuy nhiên, ARC-AGI-2 giải quyết một sai sót nghiêm trọng trong ARC-AGI-1 – sự phụ thuộc quá mức vào tính toán thô. ARC-AGI-1, mặc dù là một tiêu chuẩn AI thách thức trong nhiều năm, đã cuối cùng được "giải quyết" bởi mô hình o3 (thấp) của OpenAI. Trong khi o3 (thấp) đạt được 75.7% ấn tượng trên ARC-AGI-1, thể hiện hiệu suất tương đương con người, điểm của nó đã giảm xuống chỉ còn 4% trên ARC-AGI-2, ngay cả với chi phí tính toán đáng kể là 200 đô la cho mỗi nhiệm vụ. Điều này nhấn mạnh sự chuyển biến cơ bản trong việc tập trung vào hiệu quả và trí thông minh thực sự trong bài kiểm tra mới.

Tại sao tiêu chuẩn AI mới này lại quan trọng ngay bây giờ?

Sự xuất hiện của ARC-AGI-2 là đúng lúc. Nhiều tiếng nói trong ngành công nghệ, bao gồm đồng sáng lập Hugging Face Thomas Wolf, đã kêu gọi các tiêu chuẩn mạnh mẽ và mới mẻ hơn để thực sự đo lường tiến bộ của AI, đặc biệt trong các lĩnh vực như sáng tạo – một thành phần chính của Trí thông minh tổng quát nhân tạo.

Các hạn chế của các tiêu chuẩn trước đây ngày càng trở nên rõ ràng. Các mô hình có thể đạt điểm cao thông qua các phương pháp không nhất thiết phản ánh trí thông minh thực sự, như ghi nhớ rộng rãi hoặc tính toán thô. ARC-AGI-2 tìm cách giải quyết những thiếu sót này một cách trực tiếp, đẩy ranh giới của việc đánh giá AI.

Giải thưởng Arc 2025: Một Thử Thách Để Thúc Đẩy Trí Thông Minh AI

Thêm một lớp thú vị nữa, Quỹ Giải thưởng Arc đã công bố cuộc thi Giải thưởng Arc 2025. Thử thách này mời gọi các nhà phát triển đạt độ chính xác 85% trên bài kiểm tra ARC-AGI-2 trong khi tuân thủ một giới hạn chi phí nghiêm ngặt chỉ 0.42 đô la cho mỗi nhiệm vụ. Cuộc thi này không chỉ là việc đạt điểm cao; mà còn là việc thúc đẩy các mô hình AI hiệu quả và thực sự thông minh.

Bài kiểm tra AGI mới này, ARC-AGI-2, đại diện cho một bước tiến quan trọng trong khả năng của chúng ta để đo lường và hiểu trí thông minh tổng quát nhân tạo. Đây là một lời nhắc nhở rõ ràng rằng trong khi các mô hình AI đã đạt được những bước tiến đáng kể, trí thông minh thực sự tương đương con người, được đặc trưng bởi khả năng thích ứng và hiệu quả, vẫn là một biên giới đáng gờm. Thử thách đã được đặt ra, và cuộc đua để xây dựng AI thực sự thông minh đã bắt đầu, với ARC-AGI-2 phục vụ như một tiêu chuẩn mới, nghiêm ngặt hơn.

Để tìm hiểu thêm về các xu hướng tiêu chuẩn AI mới nhất, hãy khám phá bài viết của chúng tôi về những phát triển chính đang định hình sự tiến bộ của AI.