動察 Beatingのモニタリングによると、百度飛桨(PaddlePaddle)チームは次世代OCRシステム「PP-OCRv6」を発表した。Tiny 1.5M、Small 7.7M、Medium 34.5Mの3つのバージョンを提供し、エッジデバイス、ブラウザ、クラウドデプロイメントの各シナリオをカバーする。前世代のPP-OCRv5と比較して、検出精度は4.6%、認識精度は5.1%向上し、中国語、英語、日本語、および46のラテン語系言語を1つの統一モデルに統合した。
PP-OCRv6は、検出ネットワークと認識ネットワークを再設計し、統一モジュール構造と構造再パラメータ化(Structural Reparameterization)技術を導入することで、精度を向上させつつ計算コストを削減した。OpenVINOの最適化により、MediumバージョンのエンドツーエンドCPU推論速度は最大5.2倍向上した。
公式発表のテスト結果によると、PP-OCRv6は複数のOCRベンチマークにおいて、千万パラメータ規模で、一部の十億パラメータ規模の視覚言語モデル(VLM)に匹敵する、あるいはそれを上回る性能を達成した。チームはまた、手書き文字、工業部品識別、デジタル管、PCBシルクスクリーン、CAD図面などのシナリオ向けに特別な最適化を実施した。現在、関連コードはPaddleOCRプロジェクトに統合され、オープンソース化されている。