baidu/Qianfan-OCR
von Baidu
Baidu/Qianfan-OCR is a 4B-parameter end-to-end multimodal model for document intelligence, unifying OCR, layout analysis, and document understanding in a single vision-language architecture. It directly converts images to Markdown and supports tasks like table extraction, chart understanding, key information extraction (KIE), and multilingual OCR (192 languages). Powered by Qianfan-ViT (vision encoder) + Qwen3-4B (language model), it achieves #1 rankings on OmniDocBench v1.5 (93.12), OlmOCR Bench (79.8), and KIE benchmarks (87.9). The model introduces Layout-as-Thought, an optional thinking phase (⟨think⟩ tokens) for structured layout recovery, and delivers high throughput (1.024 PPS on A100 with W8A8 quantization). It is open-source (Apache 2.0 License) and deployable via transformers or vLLM.
Transparenz-Score
Gewichtet über vier Säulen · aktualisiert June 30, 2026
Funktionen
Anbieterinformationen
Vollständige Informationen zum Anbieter/Provider dieser KI-Anwendung
Anbieterinformationen gemäß EU AI Act
Potenzielle Risiken
1 identifizierte Hinweise
Prüfung vor der Nutzung empfohlen
Diese Hinweise werden automatisch auf Basis öffentlich verfügbarer Informationen über den Anbieter und KI-Katalogdaten identifiziert. Tatsächliche Risiken können variieren abhängig von Ihrem spezifischen Anwendungsfall und Ihrer Implementierung.
Erhalten Sie Einblicke in Risiken, indem Sie Bewertungen für diese KI-Anwendung durchführen.
Arbeiten Sie bei Baidu? Übernehmen Sie diesen Eintrag, um die Daten zu korrigieren oder zu vervollständigen.
Bereit, KI-Anwendungen zu verwalten?
Verfolgen, bewerten und steuern Sie Ihre KI-Anwendungen mit Anove.