lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
ホーム
OPRR
速報
深堀り
イベント
BlockBeats Pro
もっと見る
資金調達情報
特集
オンチェーン生態系
用語
ポッドキャスト
データ
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%

OpenAIが出資する110億ドル評価の法律AIユニコーンが、中国のオープンソースモデルを「ラッピング」し始めた

この記事を読むのに必要な時間は 31 分
モデル企業のもう一つのビジネス。
原文タイトル:《OpenAIが出資した110億ドル評価の法律AIユニコーン、中国製オープンモデルを「転用」開始》
原文著者:動察Beating


8月20日、OpenAIが出資する法律AI企業HarveyがTenetを発表した。2022年に設立されたこの企業は現在評価額110億ドルで、世界で最も評価額が高い法律AI企業であり、数千の機関にサービスを提供している。株主名簿にはSequoia、a16z、GICも名を連ねている。


Tenetは同社初の独自モデルであり、基盤には月之暗面(Moonshot AI)が7月にオープンウェイトを公開したKimi K3を使用している。Tenetは現在も研究プレビュー段階にあり、Harveyは検証済みの機能を段階的に製品に組み込む計画だ。


Harveyの創業者Winston Weinbergは元々O'Melveny & Myersの訴訟弁護士であり、Gabe PereyraはGoogle BrainとMetaで大規模言語モデルの研究に携わっていた。OpenAIは早い段階から同社に出資しており、その後双方は共同で判例法モデルを訓練し、約100億トークンの米国判例法データを訓練に加えた。OpenAIが当時公開した顧客事例の中で、PereyraはHarveyがさまざまな選択肢を評価した結果、最終的にOpenAIとの共同カスタム訓練のみを信頼したと述べている。


過去数年間、同社はほぼ常にクローズドソースモデルが専門サービス業界で最も典型的な顧客であり、常に世界最強クラスのクローズドソースモデルを呼び出すことができた。しかし、初めて自社の法律タスク、弁護士の評価基準、2か月分の計算リソースを実際にウェイトに組み込むことを決定したとき、選ばれた基盤は中国製のオープンウェイトモデルだった。


モデルが発表されると、業界はすぐに2つのことを知ることになる。それがどれほど賢いか、そしてその能力がいくらで売られているかだ。数時間以内にベンチマークテストが更新され、Arenaのランキングが変動し、各種の知能と価格の座標図が流布し始める。数か月間訓練され、大量の計算リソースを消費したモデルが、最終的にグラフ上の1つの点に圧縮される。


ほとんどの開発者にとって、この方法は依然として有効だ。その背後にある前提は、モデルがユーザーの手に渡った時点で、能力がほぼ確定しているということだ。クローズドソースAPIが主流だった時代には、この前提は成立していた。モデル企業が事前訓練と事後訓練を完了し、能力をAPIとしてカプセル化する。下流の企業はプロンプトを変更したり、検索を行ったり、エージェントを構築したりできるが、モデル自体をさらに変更することは難しい。


オープンウェイトはこの前提を打ち破った。企業はウェイトを取得した後、自社のデータと専門家のフィードバックを追加し、実際のタスクと評価基準を訓練に持ち込むことができる。発表時に同じ90点を獲得した2つのモデルが、同じデータと計算リソースで訓練を続けた場合、一方は最終的に91点で止まるが、もう一方は97点に達することができる。数か月の時間、計算リソース、専門家リソースを投入する準備がある企業にとって、発表時の同じ90点は、すでに雲泥の差なのである。


ただし、この話には前提がある。企業が数か月の時間と一批の計算リソースを費やして継続トレーニングを行うには、まずトレーニングに値する重み付けセットが必要だ。過去数年間、オープンモデルと最先端のクローズドモデルの間には常に隔たりがあり、一般的なQAや日常的なコーディングでは差はそれほど大きくないが、エラーコストが高い専門シーンに入ると、その隔たりは拡大する。法律はその中でも最も要求水準が高い分野の一つであり、過去にHarveyのような企業のコア業務に実際に入り込めたのは、基本的に当時最も能力の高いクローズドモデルの一群だった。オープンウェイトは確かに制御や改変が容易だが、最も基本的な専門タスクすら達成できなければ、その後のトレーニング余地は語るべくもない。



Kimi K3は、この長年にわたるハードルを初めて越えた。その総パラメータは2.8兆に達し、100万トークンのコンテキストをサポートし、長期的なタスク、ツール使用、複雑な推論においてすでに優れた基礎能力を備えている。Harveyにとって、オープンウェイトモデルは初めて、単なる低コストで制御性の高い代替案ではなくなり、最先端モデルと並んで真剣に評価される範囲に入り始めた。


そこで彼らは、これまで単独で議論されることがほとんどなかった問題を気にし始めた。このウェイトセットは、どれほど容易に継続トレーニングできるのか、ということだ。


CursorがComposer 2をトレーニングする際、一般的なコーディングエージェントのリーダーボードに従ってモデルを選ぶことはしなかった。その判断は、エージェントと長期的タスク能力は強化学習プロセス中に大きく変化し、トレーニング開始前のランキングが最終結果を予測できるとは限らないというものだった。リーダーボードのスコアよりも、Cursorはモデルのプログラミング知識、状態追跡能力、内部コードベースでの困惑度、そして自社インフラでの実行効率を重視した。最終的に選ばれたベースモデルはKimi K2.5だった。


Devinの背後にあるCognitionも同じ判断を下した。K3のオープンウェイト公開後、すぐにモデルをDevin DesktopとCLIに統合し、自社のFrontierCode 1.1 Extendedで、K3は58.2%のスコアと63.6%の合格率を獲得した。このテストは実際のエンジニアリングタスクを評価し、コードが最終的にメインブランチに統合できるか、品質が十分かもすべて考慮される。Cognitionはまた、K3がバグの再現と自身の実行環境の管理において特に優れており、この2つはまさに長期的なコーディングタスクで最も失敗しやすい部分だと述べている。その後、同社もこのウェイトセットで後トレーニングを実施した。


本当に希少なのは法律データではない


Harveyは急速に成長している。今年3月時点で約1300の機関と10万人以上の弁護士にサービスを提供していたが、5か月後には顧客数がほぼ倍増し、70か国をカバーし、AmLaw 100の4分の3以上の法律事務所がHarveyを利用している。


法律サービスのプロジェクト金額は高額であり、エラーに対する許容度は非常に低い。M&Aデューデリジェンス報告書では、数百から数千の文書の中から変更管理条項を見つけ出し、取引が発動されるかどうかを判断し、リスクを特定して原文の根拠を添付する必要がある。その過程には数十の判断が連続して成立する必要があり、取引に本当に影響を与える問題を一つでも見逃せば、それまでに正しく行った大部分の作業はあまり意味をなさない。


サービスを提供する法律事務所が増えるにつれ、Harveyは基礎モデル企業が自ら入手するのが難しいデータも蓄積してきた。弁護士がどのように作業を配置するか、最終的に結果を受け取るパートナーがどこからミスを指摘するかを、Harveyは把握している。



これらの経験は後にLegal Agent Benchmarkとして形作られた。そこにはすでに1200以上の長期的な法律タスクが含まれ、24の実務分野をカバーしている。各タスクの説明は平均約50語で、モデルはその後、閉鎖されたクライアント案件環境に入る。関連文書と大量の無関係な資料が混在しており、モデルは自ら検索・読解・判断を行い、最終的に項目ごとにチェック可能な成果物を提出する必要がある。


各タスクには平均約50の評価基準があり、複雑なタスクでは数百に達することもある。事実が漏れなく収集されているか、結論が成立するか、引用が原文に対応しているか、リスクレベルと提案が合理的かは、すべて個別に判定可能な評価項目に分解される。1つのタスクは最長で1000ラウンド以上続き、数十万トークンを消費する。


若手弁護士は数年働くうちに、クライアントが本当に懸念していることを徐々に理解し、一見目立たない条項でも見逃せないものを覚えていく。これらの経験はこれまで教科書に完全に書き留めることが難しく、その多くはパートナーの修正、チーム内の業務習慣、そして納品済みの各文書に残されている。


Harveyはその一部をタスク、資料、評価基準に分解し、モデルが作業を完了するたびに、計算可能で比較可能なフィードバックが得られるようにした。


プロンプトと検索はモデルにどこを探すべきかを示し、評価基準は別の問いに答え始める。つまり、法律業務がどこまで達成されれば完了と言えるのかということだ。Harveyが過去数年間に実際に蓄積してきたのは、クライアントと法律データに加えて、モデルトレーニングに直接使用できる専門的な評価体系である。


法律経験を重みに書き込む


それらのタスクと評価基準は実際のトレーニングに組み込まれ始め、データは公開法律資料、合成データ、人間の専門家データから得られ、実務弁護士がタスク構築、評価、合成データのレビューに参加している。Harveyは合計約1750の法律エージェントタスク環境を準備した。


モデルが材料とツールを備えたワークスペースに入ると、自らファイルを読み、ツールを呼び出して結果を提出します。その後、システムは弁護士が策定した基準に従って作業の全軌跡を検査し、具体的な要求がどの程度達成されたか、法的問題がどの程度解決されたかを確認します。主要な要求をすべて満たした場合、追加の報酬も得られます。


各トレーニングサイクルで1万件以上のタスク軌跡が生成されます。Harveyはグループシーケンス戦略最適化(GSPO)を使用し、モデルが同じタスクで複数のアプローチを生成できるようにし、結果間の品質差に基づいて重みを更新します。2つの軌跡のスコアが近すぎる場合、システムは再評価を行い、評価ノイズがトレーニングに与える影響を軽減します。


プロセス全体は約2か月続き、約150枚のNVIDIA B300を使用します。最先端モデルの事前トレーニングには通常1万枚以上のGPUが必要ですが、Harveyが今回投入した計算リソースは別の規模です。Harveyはrank-64 LoRAを採用し、Kimi K3のアテンション層、フィードフォワードネットワーク、ルーティング専門家の重みをカバーし、約50万の専門家テンソルに関わります。


長い軌跡のトレーニングには、もう1つの工学的問題も伴います。法的タスクは数百ラウンドに及ぶことがあり、モデルがタスク軌跡を生成している間に、トレーニング側の重みはすでに更新されています。トレーナーが後でこの軌跡を再計算する際、両側のモデル状態が一致しない場合、当時の各ステップのアクションに対応する確率も変化し、報酬が元の決定に正確に作用しにくくなります。



Kimi K3の混合専門家構造は、この問題をさらに複雑にします。各トークンがモデルに入ると、ルーターは896の専門家から16を選択して計算に参加させます。トレーニング側と実行側で数値精度やバッチ処理方法にわずかな違いがあるだけで、同じトークンが異なる専門家に割り当てられる可能性があり、元の軌跡を完全に再現することが難しくなります。


そのため、Harveyとそのサプライヤーは、トレーナーと実行環境をカーネルレベルで数値的に整合させました。重みが更新されるたびに、直接実行環境にホットロードされ、タスク生成を繰り返し停止する必要はありません。システムはまた、トークンに対応する専門家ルーティング結果を記録し、トレーナーが再計算する際に、モデルがこの軌跡を生成したときに通った経路に可能な限り戻れるようにします。


ここまで来ると、Tenetはもはや法律コーパスをモデルに追加する通常のファインチューニングとは言えません。Harveyが構築したのは、繰り返し実行可能なトレーニングプロセスです。法的タスクが絶えず環境に入り、モデルが作業を完了し、弁護士が策定した基準が全軌跡を評価し、重みが更新され、新しいモデルが再び環境に戻って次のラウンドのタスクを実行します。


Kimi K3が安定してトレーニングを継続できるかどうかも、このようなループの中で実際に検証されています。


トレーニング後、それはより法律エージェントらしくなった


Harveyが本当に向上させたかったのは、モデルが長期的な法律業務を完了する能力だ。同社は非常に厳格なオールパス基準を採用しており、タスク内の主要な評価基準をすべて満たす必要がある。Harveyが公表した内部結果によると、トレーニングに参加していないLAB保留セットでは、Tenetが完全に完了したタスク数は元のKimi K3の約2倍に近く、オールパス率は約11%から19.7%に向上し、約9ポイント増加した。


契約書の起草、審査、交渉を専門にテストするLAB Contractsでは、完了タスク数が約20%増加し、オールパス率は11.3%に達し、約2ポイント向上した。Harvey自身のランキングによると、TenetはLAB Contractsで第1位、完全なLABでは第2位となっている。


その後、Tenetを2つの外部テスト、MercorのAPEX Agents Corporate LawとCrosbyのRedline Benchに投入した。前者は模擬作業環境での長期的な専門タスクをテストし、後者はモデルに契約書を連続修正させ、弁護士が策定した基準に従って採点する。



Tenetはこれら2つのテストのトレーニングデータに触れておらず、それでも成績は元のKimi K3を明らかに上回っており、Harveyのタスク環境で鍛えた能力が新しい法律タスクに移行できることを示している。


ただし、もう1つの問題は、専門的な後トレーニングによってモデルが特定の種類の作業にますます特化し、元の知識や推論能力の一部を失うことがある点だ。


LegalBench、CUAD、MAUDでは、Tenetに明らかな退歩は見られなかった。Scale Professional Reasoning Benchmarkの困難なサブセットでは、スコアが36.0%から36.8%へとわずかに上昇した。少なくともこの一連の結果から、Kimi K3は法律タスクでより強力になった後も、明らかな能力忘却の問題は発生していない。


Harveyの報酬設計は、結果の品質が近い場合に短い軌跡を優先する。法律エージェントがファイルを1つ多く読んだり、ツールを1回多く呼び出したりするたびに、トークン消費と待機時間が増加するためだ。トレーニング後、Tenetは一部の無効なステップを削減し、タスク品質が向上すると同時に、作業完了コストは基本的に安定を維持している。


今回のポストトレーニングでより大きく変わったのは、Kimi K3が複雑な法律業務を処理する方法だ。ステップの整理やツールの呼び出しがより上手くなり、タスク内の重要な要件を見落とすことも少なくなった。


Harveyは2025年からすでにマルチモデル戦略を採用しており、今年も引き続きOpenAIやAnthropicの新モデルを統合している。Tenetによって、この体系に初めてHarvey自身がトレーニングし、自ら制御するオープンウェイトモデルが加わった。


必要なのは、ベース自体がすでに優れたモデルだ。Harveyの法律タスクでは大量の文書を処理し、数百から数千回の連続操作を実行する必要があり、モデルは長い作業プロセスの中で状態を維持しなければならない。ポストトレーニングは法律業務の処理方法をさらに形作ることはできるが、ベースに元々備わっていない能力をゼロから補うのは難しい。


もう一つの条件は制御権だ。HarveyはAPIを通じてGPTやClaudeを呼び出せるが、1750の法律タスク環境や弁護士の評価基準をこれらのクローズドソースモデルに書き込むことはできない。オープンウェイトにより、自らトレーニング方法や報酬設計を決められ、トレーニングで得た専門能力を自ら保持するウェイトに留めることもできる。


ただし、ウェイトを取得した後も、このモデルが継続トレーニングに適しているかを検証する必要がある。長軌跡強化学習が安定して実行できるか、混合専門家のルーティングが正確に再現できるか、専門能力が向上した後に元の知識を失わないか、推論コストを本番利用可能な範囲に抑えられるか——これらはすべて実際に試してみないと分からない。


Tenetが2ヶ月間稼働した後、Kimi K3はこのラウンドの答えを示した。トレーニングプロセスは安定して実行でき、法律タスク能力は明らかに向上し、顕著な能力忘却は見られず、コストも効果とともに制御不能にはならなかった。


Harveyにとって、これらの結果は「オープンウェイト」そのものよりも重要だ。ウェイトをダウンロードできることは、企業が継続トレーニングを行う資格があることを示すに過ぎない。トレーニング後にどれだけの能力が残るかが、このモデルに計算リソース、データ、専門家の時間を投資し続ける価値があるかを決める。


モデル企業のもう一つのビジネス


Harveyは、その目標は法律事務所がオープンウェイト上で自社専用モデルをトレーニングし、トレーニング後に形成された能力を所有できるようにすることだと述べている。Tenetが提供したのは、モデルというよりはむしろ一連の手法だ。


これまで、基盤モデル企業のビジネスは主にモデル公開後のAPI呼び出しにあった。オープンウェイトは別の関係をもたらした。企業は既存の基盤モデルを取得して継続トレーニングし、自社の業界知識をウェイトに留め、最終的に自社業務により近いモデルを得ることができる。


このような需要は、以前は真の市場を形成することが難しかった。汎用モデルの能力が十分に強くない場合、垂直企業はウェイトを取得しても、後続トレーニングだけで長距離推論、ツール呼び出し、複雑なタスク処理を補完するのは難しい。ゼロから事前トレーニングを行うにはコストが高すぎ、ほとんどの企業にはそもそも必要がなかった。



Cursorはプログラミング分野でComposer 2を訓練し、Cognitionも同じウェイト上でDevin用のモデルを訓練し続け、Harveyは法律分野でTenetを開発した。プログラミングと法律はかけ離れているが、どちらもKimiがすでに訓練した汎用能力から出発し、自分たちが最も熟知している専門業務をさらに組み込むことを選んだ。


Tenetはこのプロセスのハードルを具体的なものにした。2ヶ月、約150枚のGPU、そして執務弁護士が定義した評価基準があれば、1社で汎用ウェイトを自社の業界の最前線に押し上げられる。計算リソースのハードルは一桁下がり、再現が難しい部分はもう一方の端に移り始めた。つまり、専門業務がどの程度まで達成されれば完了と言えるのかを明確に説明できる人がいるかどうかだ。


ソフトウェア開発と法律は、すでに現れた2つの事例に過ぎない。金融、コンサルティング、医薬、会計、そして多くの専門サービス業界には、それぞれ独自のデータ、ワークフロー、専門家の判断がある。これらの業界は、規模が数兆ドルに達する知識労働市場そのものだ。その中でトップクラスの企業は、必ずしも自社で基礎モデルを事前トレーニングするわけではないが、成熟したウェイト上で自社専用のモデルを訓練し続ける条件はますます整ってきている。


この道筋が引き続き成立するなら、Kimiが直面する市場は、単にどれだけの人がそれを呼び出すかだけではなくなる。次に注目すべきは、Harvey、Cursor、Devinの後、さらにどれだけの企業がKimi上で自社モデルを訓練することを選ぶかだ。


原文リンク


BlockBeats の公式コミュニティに参加しよう:

Telegram 公式チャンネル:https://t.me/theblockbeats

Telegram 交流グループ:https://t.me/BlockBeats_App

Twitter 公式アカウント:https://twitter.com/BlockBeatsAsia

举报 訂正/通報
ライブラリを選択
新しいライブラリを追加
キャンセル
完了
新しいライブラリを追加
自分のみが閲覧可
公開
保存
訂正/通報
送信