動察 Beating AI 速報、Appleが長文書処理に特化した視覚言語モデルLensVLM-9Bをオープンソース化した。モデルはQwen3.5-9B-Baseをベースにトレーニングされている。長文書を処理する際、まず文書全体を低解像度ページに圧縮して素早くスキャンし、関連ページを特定した後、その中の元のテキストや高解像度画像を読み取る。
これにより、全文をモデルのコンテキストに詰め込む必要がなくなる。論文では100ページの文書をテストした際、全文を直接読み取ると51,273トークンが必要だったが、LensVLMはわずか8,090トークンで済んだ。対応するKVキャッシュは約1.6GBから253MBに削減され、84.2%の減少となった。
圧縮後も精度は顕著に低下しなかった。7項目の文書Q&Aテストにおいて、全文を直接読み取った場合の平均精度は72.4%だったが、LensVLMは約4.3倍の圧縮下でも68.9%を維持した。テキストを直接画像に縮小してモデルに認識させる方法と比較すると、同程度の約5倍圧縮時で、精度は31.3%から68.9%に向上した。
ただし、現時点では処理速度が遅い。LensVLMは関連ページを見つけた後、さらにツールを呼び出して原文を読み取る必要があるため、連続して2回の推論を実行しなければならない。論文のテストでは、1回の回答に約17秒かかった。この圧縮方案を使わず、文書全体をテキストとしてQwen3.5-9Bに直接入力した場合、1回の回答生成は約8秒で済む。