Поиск Искусственного Общего Интеллекта (AGI) стал значительно более интересным и сложным! В groundbreaking развитии, которое вызывает волну в мире ИИ, Фонд премии Arc, возглавляемый выдающимся ИИ-экспертом Франсуа Шолле, представил новый, невероятно сложный тест AGI. Названный ARC-AGI-2, этот бенчмарк предназначен для истинного измерения общего интеллекта моделей ИИ, и ранние результаты, что ж, смиряющие даже для самых продвинутых систем.

Почему ARC-AGI-2 является новым препятствием для моделей ИИ?

Согласно недавнему блогу Фонда премии Arc, ARC-AGI-2 оказывается серьезным испытанием. Ведущие модели «рассуждений» ИИ, такие как o1-pro от OpenAI и R1 от DeepSeek, едва ли касаются поверхности, набирая всего 1% до 1.3% на лидерборде теста AGI. Даже мощные модели, не занимающиеся рассуждениями, включая GPT-4.5, Claude 3.7 Sonnet и Gemini 2.0 Flash, достигают всего около 1%. Это резко контрастирует с производительностью человека, где панели в среднем набрали солидные 60% точности на тех же вопросах ARC-AGI-2.

Итак, что делает этот новый бенчмарк ИИ таким отличительным и сложным?

  • Задачи визуальных головоломок: ARC-AGI-2 представляет моделям ИИ головоломки, связанные с выявлением визуальных паттернов в сетках цветных квадратов. Цель состоит в том, чтобы ИИ сгенерировал правильную «ответную» сетку на основе этих паттернов.

  • Адаптивность: В отличие от предыдущих тестов, ARC-AGI-2 специально разработан, чтобы заставить модели ИИ адаптироваться к совершенно новым типам задач, с которыми они не сталкивались во время обучения. Это тестирует истинные способности к решению проблем, а не просто воспроизведение.

  • Метрика эффективности: Ключевое нововведение в ARC-AGI-2 - это введение метрики эффективности. Это означает, что дело не только в том, чтобы получить правильный ответ, но и в том, насколько эффективно модель ИИ приходит к решению. Это непосредственно решает проблемы, связанные с тем, что вычислительная мощь в грубом режиме маскирует истинный интеллект в предыдущих бенчмарках.

Вот сравнение того, как разные типы моделей показывают себя:

Примеры типов моделей ИИ Оценка ARC-AGI-2 (приблизительно) Модели ИИ, занимающиеся рассуждениями OpenAI o1-pro, DeepSeek R1 1% – 1.3% Модели ИИ, не занимающиеся рассуждениями GPT-4.5, Claude 3.7 Sonnet, Gemini 2.0 Flash Около 1% Человеческие панели Средняя оценка участников 60%

Источник: Лидерборд премии Arc

ARC-AGI-2 против ARC-AGI-1: Что изменилось?

Сам Франсуа Шолле заявил в X (ранее Twitter), что ARC-AGI-2 является более лучшим показателем истинного интеллекта модели ИИ по сравнению с его предшественником ARC-AGI-1. Основная цель тестов Фонда премии Arc остается неизменной: оценить способность ИИ-системы учиться новым навыкам за пределами своих обучающих данных.

Тем не менее, ARC-AGI-2 решает критический недостаток ARC-AGI-1 – избыточную зависимость от грубой вычислительной мощности. Несмотря на то, что ARC-AGI-1 был сложным бенчмарком ИИ в течение многих лет, его в конечном итоге «решила» модель o3 (low) от OpenAI. Хотя o3 (low) добилась впечатляющих 75.7% на ARC-AGI-1, демонстрируя очевидное человеческое уровень производительности, ее оценка упала до всего 4% на ARC-AGI-2, даже с значительными затратами в $200 на каждую задачу. Это подчеркивает фундаментальный сдвиг в фокусе на эффективность и истинный интеллект в новом тесте.

Почему этот новый бенчмарк ИИ имеет значение сейчас?

Появление ARC-AGI-2 своевременно. Многие представители технологической индустрии, включая соучредителя Hugging Face Томаса Вольфа, выступают за более надежные и новые бенчмарки для истинной оценки прогресса ИИ, особенно в таких областях, как креативность – ключевой компонент Искусственного Общего Интеллекта.

Ограничения предыдущих бенчмарков становились все более очевидными. Модели могли достигать высоких оценок с помощью методов, которые не обязательно отражали истинный интеллект, таких как обширное запоминание или грубая вычислительная мощь. ARC-AGI-2 стремится напрямую решить эти недостатки, расширяя границы оценки ИИ.

Премия Arc 2025: Вызов для повышения интеллекта ИИ

Добавляя еще один уровень волнения, Фонд премии Arc объявил о конкурсе Arc Prize 2025. Этот вызов приглашает разработчиков достичь точности 85% на тесте ARC-AGI-2, соблюдая строгие ограничения по стоимости всего $0.42 за задачу. Этот конкурс не просто о достижении высоких баллов; он направлен на содействие эффективным и действительно интеллектуальным моделям ИИ.

Этот новый тест AGI, ARC-AGI-2, представляет собой значительный шаг вперед в нашей способности измерять и понимать искусственный общий интеллект. Это резкое напоминание о том, что, хотя модели ИИ добились невероятного прогресса, истинный человеческий уровень интеллекта, характеризующийся адаптивностью и эффективностью, остается серьезным рубежом. Вызов установлен, и гонка за созданием действительно интеллектуального ИИ началась, при этом ARC-AGI-2 служит новым, более строгим мерилом.

Чтобы узнать больше о последних тенденциях в бенчмарках ИИ, изучите нашу статью о ключевых разработках, формирующих прогресс ИИ.