baidu/Qianfan-OCR
par Baidu
Baidu/Qianfan-OCR is a 4B-parameter end-to-end multimodal model for document intelligence, unifying OCR, layout analysis, and document understanding in a single vision-language architecture. It directly converts images to Markdown and supports tasks like table extraction, chart understanding, key information extraction (KIE), and multilingual OCR (192 languages). Powered by Qianfan-ViT (vision encoder) + Qwen3-4B (language model), it achieves #1 rankings on OmniDocBench v1.5 (93.12), OlmOCR Bench (79.8), and KIE benchmarks (87.9). The model introduces Layout-as-Thought, an optional thinking phase (⟨think⟩ tokens) for structured layout recovery, and delivers high throughput (1.024 PPS on A100 with W8A8 quantization). It is open-source (Apache 2.0 License) and deployable via transformers or vLLM.
Score de transparence
Pondéré sur quatre piliers · mis à jour le June 30, 2026
Capacités
Informations sur le fournisseur
Informations complètes sur le fournisseur/prestataire de cette application IA
Informations fournisseur (Règlement IA de l’UE)
Risques potentiels
1 points d'attention identifiés
Révision recommandée avant utilisation
Ces points d'attention sont automatiquement identifiés sur la base d'informations publiquement disponibles sur le fournisseur et les données du catalogue IA. Les risques réels peuvent varier selon votre cas d'usage et votre implémentation spécifiques.
Obtenez des informations sur les risques en exécutant des évaluations sur cette application IA.
Vous travaillez chez Baidu ? Revendiquez cette fiche pour corriger ou compléter les données.
Prêt à gérer vos applications IA ?
Suivez, évaluez et gouvernez vos applications IA avec Anove.