動察 Beating AI 速報、OpenAI がまもなく発表する Astra は、循環推論アーキテクチャ「recurrent depth」、別名ループ型トランスフォーマーを採用している。通常の Transformer は各トークンを生成する際、固定された層を順に通過するが、Astra は同じ情報を同一の層群に繰り返し通し、数回の計算を経てから出力することができる。
このアプローチは、バイトダンスが昨年すでに公開している。Seed チームが発表した Ouro は、ループ型言語モデルであり、同様に Transformer の層群を循環させ、より多くの計算をモデル内部に組み込む。モデルは長い思考連鎖を生成し続けることなく、推論の計算量を増やせるため、小規模モデルでもより多くの計算を活用し、より大規模なモデルに近い性能を実現できる。
このアーキテクチャは、セキュリティ上の課題ももたらす。推論の一部が内部の隠れ状態で行われるため、人間は完全なテキスト記録を見ることができず、思考連鎖を通じてモデルが規則に違反していないかを確認するのが難しくなる。そのため OpenAI は、Astra における recurrent depth の使用範囲を制限し、読み取り可能な思考連鎖を維持しつつ、追加の CoT モニタリングを導入する準備を進めている。