動察 Beating AI 速報、AnthropicはClaude Codeの公式claude-api Skillに自動チューニングワークフローを追加した。build-evalはまず実際の会話、バグ、または人手によるケースからテストセットと評価方法を作成し、hillclimbはClaude Codeにシステムプロンプト、ツール説明、モデル、推論強度を繰り返し修正させる。修正のたびにテストを再実行し、効果が良くなれば保持し、悪くなればロールバックする。
Claudeがテスト問題だけに最適化するのを避けるため、すべてのサンプルをまとめてチューニングに使うことはしない。一部のケースは問題の発見と設定の修正に使い、別のケースは修正が見たことのない問題に適用できるかを確認するために残す。前者のスコアが上がっても、留保したテスト結果が改善しなければ、その修正は過学習と判定され撤回される可能性がある。
Anthropicは44件のカスタマーサポートチケットでこのフローを実演した。Claude Codeは順にプロンプトを整理し、業務ルールを補足し、異なるモデルを試し、推論強度を下げた。最終的にSonnet 5の低effort構成を見つけた。チューニングに参加していない14件のチケットで、精度は初期構成の78.6%から90.5%に向上し、コストは約5分の1に削減された。