動察Beatingのモニタリングによると、Appleの研究チームは9つのモデルと11の言語を使って強化学習実験を行い、次のことを解明しようとした:もしトレーニングデータが1つの言語だけだった場合、モデルが学習した問題解決能力を他の言語の問題にも応用できるのか?
答えは「できる」であり、その効果はかなり顕著である。1つの言語だけでトレーニングしても、モデルは他の多くの言語でも同時に強くなる。
例えばフランス語のテストでは、フランス語で直接トレーニングすると、スコアは平均25.6ポイント向上する。フランス語を一切使わず、スペイン語の問題だけでトレーニングしても、最終的にフランス語のテストで24.6ポイント向上し、差はわずか1ポイントである。
モデルが学習するのは特定の言語の問題だけでなく、言語を変えても使える解法の一部も含まれる。つまり、今後モデルの中国語推論能力を強化したい場合、必ずしもすべての強化学習データを中国語で作り直す必要はない。
しかし、トレーニング言語を自由に変えるわけにもいかない。特定の言語は特定の能力の退化を引き起こす可能性がある。同じ強化学習でも、トレーニング言語を変えると、一部のモデルは他の言語やタスクで明らかに性能が低下することがある。最も極端な実験グループでは、Qwen3-4Bをスワヒリ語でトレーニングした後、トレーニング時に見たことのない英語テストで、元のモデルより19.2ポイント低下した。一方、多言語を一緒にトレーニングした場合は、このテストで4.5ポイント向上した。
この論文が検証したのは主に、数学、論理、グラフ、幾何学など、答えを自動判定できる推論問題である。これらの問題は言語を変えても、根本的な解法は変わらないことが多い。読解、比喩、意味判断、文化知識など、言語自体に依存するタスクについては、この論文では検証されていない。