lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
ホーム
OPRR
速報
深堀り
イベント
BlockBeats Pro
もっと見る
資金調達情報
特集
オンチェーン生態系
用語
ポッドキャスト
データ
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%

Perplexityが新しい検索モデルをオープンソース化:0.6Bの小型モデルが9Bで構築されたインデックスを直接検索可能

動察 Beating AI 速報、Perplexity が2つのマルチモーダル embedding モデル pplx-embed-v2-late をオープンソース化、それぞれ 0.6B と 9B。2つのモデルのベクトルは相互互換性があり、開発者は 9B の大モデルでデータベースを構築し、0.6B の小モデルで日常の検索を処理でき、毎回のクエリで大モデルを実行する必要がない。


新モデルはテキスト、画像、PDF ページの検索にも対応。通常の embedding モデルは一段の内容を1つのベクトルに圧縮するため、細部が失われやすい。新モデルは各 token に 128 次元のベクトルを保持し、検索語が文書内の関連内容にそれぞれマッチングできる。PDF、PPT、スキャン文書を処理する際、ページ画像を直接ベクトルに変換でき、まず OCR で文字を抽出する必要がなく、図表、表、レイアウト情報も保持できる。


2つのモデルは同じ 18B の教師モデルから訓練され、1つのベクトル空間を共有している。公式が ViDoRe v3 の画像検索テストで発見したところ、0.6B モデルでデータベース構築とクエリを行うとスコアは 62.3%、9B でデータベース構築、0.6B でクエリを行うとスコアは 63.5% に向上。完全に 9B モデルを使用した場合のスコアは 65.2%。


2つのモデルの重みは Hugging Face で MIT ライセンスの下で公開されている。

訂正/通報
送信
新しいライブラリを追加
自分のみが閲覧可
公開
保存
ライブラリを選択
新しいライブラリを追加
キャンセル
完了