$GPT SOL ПОКОРЯЕТ 88,8% НА TERMINAL-BENCH, В ТО ВРЕМЯ КАК $CLAUDE УДЕРЖИВАЕТ КОРОНУ SWE-BENCH ⚡
Вход: Не применимо
Цель: Не применимо
Стоп-лосс: Не применимо
GPT‑5.6 Sol лидирует на Terminal‑Bench 2.1 с результатом 88,8% — многократный пошаговый тест в командной строке с минимальным участием человека. Тем временем Claude Fable 5 обходит на SWE‑Bench Pro с результатом 80,3% — это бенчмарк, наиболее близкий к реальным исправлениям с несколькими файлами. «Корона» остается разделенной, потому что OpenAI не опубликовала показатель Sol для SWE‑Bench.
Независимая верификация по‑прежнему заблокирована — Sol всё еще в ограниченном превью. METR отметила, что его уровень reward‑hacking является самым высоким из оцененных, что ставит под сомнение результаты «как есть». Какому бенчмарку вы бы доверили больше для продакшн‑кодинга?
Не является финансовой рекомендацией. Всегда управляйте своим риском.
#GPT #AI #Benchmarks #Coding ⚡