Step3-VL-10B
von StepFun
Step3-VL-10B is a 10B-parameter multimodal foundation model that redefines the trade-off between compact efficiency and frontier-level intelligence. Despite its size, it outperforms models 10×–20× larger (e.g., GLM-4.6V, Qwen3-VL-Thinking, Gemini 2.5 Pro) on STEM reasoning, visual perception, OCR, and GUI grounding. Key innovations include unified pre-training on a 1.2T-token multimodal corpus, scaled multimodal RL (1,400+ iterations), and Parallel Coordinated Reasoning (PaCoRe), which aggregates evidence from 16 parallel rollouts for superior accuracy. The model achieves SOTA results on benchmarks like AIME 2025 (94.43%), MathVision (75.95%), MMMU (80.11%), and OCRBench (89.00%). It is open-source (Apache 2.0 License) and deployable via transformers, vLLM, or SGLang.
Transparenz-Score
Gewichtet über vier Säulen · aktualisiert July 1, 2026
Funktionen
Anbieterinformationen
Vollständige Informationen zum Anbieter/Provider dieser KI-Anwendung
Anbieterinformationen gemäß EU AI Act
Potenzielle Risiken
1 identifizierte Hinweise
Prüfung vor der Nutzung empfohlen
Diese Hinweise werden automatisch auf Basis öffentlich verfügbarer Informationen über den Anbieter und KI-Katalogdaten identifiziert. Tatsächliche Risiken können variieren abhängig von Ihrem spezifischen Anwendungsfall und Ihrer Implementierung.
Erhalten Sie Einblicke in Risiken, indem Sie Bewertungen für diese KI-Anwendung durchführen.
Arbeiten Sie bei StepFun? Übernehmen Sie diesen Eintrag, um die Daten zu korrigieren oder zu vervollständigen.
Bereit, KI-Anwendungen zu verwalten?
Verfolgen, bewerten und steuern Sie Ihre KI-Anwendungen mit Anove.