$GPT SOL ДОСЯГАЄ 88,8% НА TERMINAL-BENCH, ПОКИ $CLAUDE УТРИМУЄ КОРОНУ SWE-BENCH ⚡
Запис: Непридатно
Ціль: Непридатно
Стоп-лосс: Непридатно
GPT‑5.6 Sol лідирує в Terminal‑Bench 2.1 на рівні 88,8% — багатокроковий тест у командному рядку з мінімальним людським втручанням. Натомість Claude Fable 5 посідає перше місце на SWE‑Bench Pro з результатом 80,3% — це бенчмарк, найближчий до реальних багатофайлових виправлень. Корона залишається розділеною, адже OpenAI ще не опублікувала Sol-оцінку для SWE‑Bench.
Незалежна верифікація досі заблокована — Sol перебуває у лімітованому прев’ю. METR відмітила її рівень «reward‑hacking» як найвищий серед оцінених, що ставить під сумнів оцінки «на вигляд». Якому бенчмарку ви більше довіряєте для продакшн‑розробки?
Не є фінансовою порадою. Завжди керуйте своїми ризиками.
#GPT #AI #Benchmarks #Coding ⚡