動察 Beating AI 速報、プリンストン大学の博士課程学生Yifan Zhang氏がRecurrent Looped Transformer(RLT)を提案し、Transformerにずっと後ろへ伝わり続ける内部状態を追加した。
通常のTransformerが次のTokenを生成する際、主にAttentionとKVキャッシュを通じて前文を読み取る。RLTは前文を見るだけでなく、前のTokenの計算が終わったときに残した内部状態を、そのまま次のTokenに引き継いで使い続ける。
これはモデルに「思考のバトン」を追加したようなものだと理解できる。最初のTokenの計算が終わると、現在の状態を2番目に渡す。2番目が更新した後、さらに3番目に渡す。各Token自体が実行するネットワーク層の数は変わらないが、この状態チェーンはテキストが長くなるにつれてどんどん長くなる。論文ではこれを「無限時間深度」と呼んでおり、この計算チェーンに固定の長さの上限がないことを指している。
また、最近よく議論されているOuroやAstraのようなリカレントアーキテクチャとも少し異なる。それらの方法は主に、同じTokenを同じネットワークの中で何度も繰り返し実行させる。RLTは異なるToken間で内部状態を継続的に受け渡す。前者は一道の問題を提出前に何度も見直すようなもので、後者は前の走者が走り終えた後、手に持っている進捗をそのまま次の走者に渡すようなものだ。