Đáp án là có, hơn nữa hiệu quả khá rõ ràng. Chỉ cần huấn luyện bằng một ngôn ngữ, thì mô hình ở nhiều ngôn ngữ khác cũng sẽ cùng trở nên mạnh hơn.

Ví dụ, trong bài kiểm tra tiếng Pháp, chỉ cần trực tiếp huấn luyện bằng tiếng Pháp thì điểm trung bình tăng 25,6 điểm phần trăm; hoàn toàn không cần huấn luyện tiếng Pháp, chỉ lấy các câu hỏi tiếng Tây Ban Nha để luyện, cuối cùng khi làm bài tiếng Pháp cũng vẫn tăng 24,6 điểm phần trăm, chỉ kém 1 điểm phần trăm.

Mô hình học được không chỉ là cách làm các bài thuộc một ngôn ngữ cụ thể, mà còn có một phần phương pháp giải bài có thể chuyển đổi sang ngôn ngữ khác để tiếp tục dùng. Vì vậy, sau này nếu muốn tăng cường khả năng suy luận bằng tiếng Trung của mô hình, thì không nhất thiết phải biến toàn bộ dữ liệu tăng cường học thành tiếng Trung một lần nữa.

但訓練語言也不能隨便換,特定語言確實可能觸發特定能力退化。同樣一套強化學習,換一種訓練語言,有些模型在其他語言和任務上反而會明顯退步。最誇張的一組實驗裡,Qwen3-4B 用斯瓦希里語訓練後,一組訓練時沒見過的英語測試比原模型掉了 19.2 個百分點;多語言一起訓練時,這項測試反而提升了 4.5 個百分點。

這篇論文驗證的主要還是數學、邏輯、圖、幾何等答案可以自動判斷對錯的推理題。這些題換一種語言後,底層解法往往沒有變。對於閱讀理解、隱喻、語義判斷、文化知識這些真正依賴語言本身的任務,論文沒有驗證。

前 Google DeepMind 資深研究科學家、Unreasonable Labs 聯合創始人兼 CEO 曹原認為,AI for Science 正進入爆發期。但 AI 要真正獨立做出諾貝爾獎級別的科學發現,至少還需要二三十年。曹原此前參與過 Gemini 等項目,現在創業方向也是讓 AI 發現新知識。

他認為,眼下最大的瓶頸是驗證。寫程式碼可以馬上運行測試,數學還能用 Lean 逐步檢查證明。但生物、材料和物理最終都要做真實實驗。一次實驗可能很貴,也可能要等很久,AI 很難像 Coding Agent 一樣連續快速試錯。

更難的是「創造新概念」。曹原認為,現在的模型很會在已有知識、定義和定理裡搜索答案,但還不會像頂尖科學家一樣,抽象出新的數學對象、定義和理論。他把這種「概念抽象」稱為 AGI 的「最後一英里」。