蘋果研究團隊拿 9 款模型、11 種語言做了一輪強化學習實驗,想搞清楚:如果訓練數據只有一種語言,模型學到的解題能力能不能拿去做其他語言的題?
答案是,可以,而且效果相當明顯。只用一種語言訓練,模型在很多其他語言上也會一起變強。
比如在法語測試上,直接用法語訓練,成績平均提升 25.6 個百分點;完全不用法語訓練,只拿西班牙語的題來練,最後考法語也能提升 24.6 個百分點,只差 1 個百分點。
模型學到的不只是某一種語言裡的題,還有一部分可以換語言繼續用的解題方法。所以以後想把模型的中文推理練強,未必所有強化學習數據都得重新做成中文。
但訓練語言也不能隨便換,特定語言確實可能觸發特定能力退化。同樣一套強化學習,換一種訓練語言,有些模型在其他語言和任務上反而會明顯退步。最誇張的一組實驗裡,Qwen3-4B 用斯瓦希里語訓練後,一組訓練時沒見過的英語測試比原模型掉了 19.2 個百分點;多語言一起訓練時,這項測試反而提升了 4.5 個百分點。
這篇論文驗證的主要還是數學、邏輯、圖、幾何等答案可以自動判斷對錯的推理題。這些題換一種語言後,底層解法往往沒有變。對於閱讀理解、隱喻、語義判斷、文化知識這些真正依賴語言本身的任務,論文沒有驗證。
前 Google DeepMind 資深研究科學家、Unreasonable Labs 聯合創始人兼 CEO 曹原認為,AI for Science 正進入爆發期。但 AI 要真正獨立做出諾貝爾獎級別的科學發現,至少還需要二三十年。曹原此前參與過 Gemini 等項目,現在創業方向也是讓 AI 發現新知識。
他認為,眼下最大的瓶頸是驗證。寫程式碼可以馬上運行測試,數學還能用 Lean 逐步檢查證明。但生物、材料和物理最終都要做真實實驗。一次實驗可能很貴,也可能要等很久,AI 很難像 Coding Agent 一樣連續快速試錯。
更難的是「創造新概念」。曹原認為,現在的模型很會在已有知識、定義和定理裡搜索答案,但還不會像頂尖科學家一樣,抽象出新的數學對象、定義和理論。他把這種「概念抽象」稱為 AGI 的「最後一英里」。