Ответ: да, и эффект довольно заметный. Тренируя модель только на одном языке, она также становится сильнее во многих других языках.

Например, во французском тесте: если напрямую тренироваться на французском, средний результат повышается на 25,6 процентных пункта; если вообще не тренироваться на французском и вместо этого брать только задачи на испанском, то на финальном экзамене по французскому всё равно удаётся повысить результат на 24,6 процентных пункта — разница всего в 1 процентный пункт.

Модель учится не только решать задачи определённого языка, но и частично такие методы решения, которые можно переносить на другие языки и продолжать ими пользоваться. Поэтому, если в будущем захотим усилить китайские рассуждения модели, необязательно заново переделывать под китайский все данные для обучения с подкреплением.

Но и при обучении языки нельзя просто так менять: определенный язык действительно может провоцировать деградацию конкретных способностей. Если взять ту же схему обучения с подкреплением и обучать на другом языке, некоторые модели в других языках и задачах могут даже заметно проседать. В самой впечатляющей серии экспериментов Qwen3-4B после обучения на суахили в тесте на английском, который не встречался во время обучения, показал падение на 19,2 процентных пункта; при совместном обучении на нескольких языках этот тест, наоборот, улучшился на 4,5 процентных пункта.

Эта статья в основном проверяет задачи на рассуждение, где ответы вроде математики, логики, графов и геометрии можно автоматически оценить как верные или неверные. При замене языка в таких задачах базовый подход обычно не меняется. Для задач, которые действительно зависят от самого языка — чтения и понимания, метафор, семантических суждений, культурных знаний — в статье проверки нет.

Бывший старший научный сотрудник Google DeepMind, сооснователь Unreasonable Labs и CEO Цао Юань считает, что AI for Science сейчас входит в период взрывного роста. Но чтобы AI действительно самостоятельно совершал научные открытия уровня Нобелевской премии, как минимум потребуется еще двадцать-тридцать лет. Ранее Цао Юань участвовал в проектах вроде Gemini, а сейчас его предпринимательское направление — сделать так, чтобы AI открывал новые знания.

Он считает, что главная сейчас проблема — в верификации. Написал код — и можно сразу запускать тесты, а математику еще можно по шагам проверять доказательства в Lean. Но биология, материалы и физика в итоге требуют настоящих экспериментов. Один эксперимент может быть очень дорогим, а иногда ждать приходится долго. AI трудно, как Coding Agent, постоянно быстро пробовать и ошибаться.

Сложнее всего — «создавать новые концепции». Цао Юань считает, что нынешние модели отлично умеют искать ответы в имеющихся знаниях, определениях и теоремах, но еще не умеют, как топовые ученые, абстрагировать новые математические объекты, определения и теории. Он называет такую «концептуальную абстракцию» «последней милей» AGI.