lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
ホーム
OPRR
速報
深堀り
イベント
BlockBeats Pro
もっと見る
資金調達情報
特集
オンチェーン生態系
用語
ポッドキャスト
データ
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%

百度、PP-OCRv6を発表:千万パラメータで十億規模のVLMに匹敵、単一モデルで50言語対応

動察 Beatingのモニタリングによると、百度飛桨(PaddlePaddle)チームは次世代OCRシステム「PP-OCRv6」を発表した。Tiny 1.5M、Small 7.7M、Medium 34.5Mの3つのバージョンを提供し、エッジデバイス、ブラウザ、クラウドデプロイメントの各シナリオをカバーする。前世代のPP-OCRv5と比較して、検出精度は4.6%、認識精度は5.1%向上し、中国語、英語、日本語、および46のラテン語系言語を1つの統一モデルに統合した。

PP-OCRv6は、検出ネットワークと認識ネットワークを再設計し、統一モジュール構造と構造再パラメータ化(Structural Reparameterization)技術を導入することで、精度を向上させつつ計算コストを削減した。OpenVINOの最適化により、MediumバージョンのエンドツーエンドCPU推論速度は最大5.2倍向上した。

公式発表のテスト結果によると、PP-OCRv6は複数のOCRベンチマークにおいて、千万パラメータ規模で、一部の十億パラメータ規模の視覚言語モデル(VLM)に匹敵する、あるいはそれを上回る性能を達成した。チームはまた、手書き文字、工業部品識別、デジタル管、PCBシルクスクリーン、CAD図面などのシナリオ向けに特別な最適化を実施した。現在、関連コードはPaddleOCRプロジェクトに統合され、オープンソース化されている。

举报 訂正/通報
訂正/通報
送信
新しいライブラリを追加
自分のみが閲覧可
公開
保存
ライブラリを選択
新しいライブラリを追加
キャンセル
完了