動察Beatingのモニタリングによると、オープンソースモデルGLM-5.2が自主微調整ベンチマークPostTrainBenchでトップに立ったが、批判者scaling01は「実質的な価値に欠ける」と指摘。モデルのランキングが数ヶ月で22位から急上昇して1位になったのは極めて不自然であり、テストに隠しセットがないため、エージェントがスコア稼ぎによる最適化に誘導されやすく、現実世界での実用性は低いと述べている。
しかし、支持派は反論し、単一のH100 GPUで10時間という制限下で、エージェントに汎用的な微調整を完了させるのは非現実的であり、ターゲットを絞った最適化こそ機械学習の常態だと主張。公開ログによれば、GLM-5.2は明確な実験ロジックを持ち、異なるサンプリング仮説のデータを自動収集し、性能ベースラインの確立、微調整、拒否サンプリングによるデータフィルタリングの完全なパイプラインを自律的に計画。思考連鎖の中で過学習を回避する試みも行っている。
この騒動のより大きな価値は、本来微調整能力を評価するための公開実行軌跡が、国内大規模モデルにおける「Claudeの過度な蒸留」という業界の噂を偶然にも打ち破った点にある。ベンチマーク作成者のMaksym AndriushchenkoはGLM-5.2のログを精査した後、データ収集、戦略の組み合わせ、意思決定経路のいずれにおいてもClaudeとの本質的な差異があり、模倣や蒸留の兆候は見られないと指摘。第三者ベンチマークの公開透明性が、オープンソース大規模モデルが独自の研究開発力を証明する最も直接的な窓口となった。