動察 Beating AI 速報、Perplexity が2つのマルチモーダル embedding モデル pplx-embed-v2-late をオープンソース化、それぞれ 0.6B と 9B。2つのモデルのベクトルは相互互換性があり、開発者は 9B の大モデルでデータベースを構築し、0.6B の小モデルで日常の検索を処理でき、毎回のクエリで大モデルを実行する必要がない。
新モデルはテキスト、画像、PDF ページの検索にも対応。通常の embedding モデルは一段の内容を1つのベクトルに圧縮するため、細部が失われやすい。新モデルは各 token に 128 次元のベクトルを保持し、検索語が文書内の関連内容にそれぞれマッチングできる。PDF、PPT、スキャン文書を処理する際、ページ画像を直接ベクトルに変換でき、まず OCR で文字を抽出する必要がなく、図表、表、レイアウト情報も保持できる。
2つのモデルは同じ 18B の教師モデルから訓練され、1つのベクトル空間を共有している。公式が ViDoRe v3 の画像検索テストで発見したところ、0.6B モデルでデータベース構築とクエリを行うとスコアは 62.3%、9B でデータベース構築、0.6B でクエリを行うとスコアは 63.5% に向上。完全に 9B モデルを使用した場合のスコアは 65.2%。
2つのモデルの重みは Hugging Face で MIT ライセンスの下で公開されている。