Step3-VL-10B
par StepFun
Step3-VL-10B is a 10B-parameter multimodal foundation model that redefines the trade-off between compact efficiency and frontier-level intelligence. Despite its size, it outperforms models 10×–20× larger (e.g., GLM-4.6V, Qwen3-VL-Thinking, Gemini 2.5 Pro) on STEM reasoning, visual perception, OCR, and GUI grounding. Key innovations include unified pre-training on a 1.2T-token multimodal corpus, scaled multimodal RL (1,400+ iterations), and Parallel Coordinated Reasoning (PaCoRe), which aggregates evidence from 16 parallel rollouts for superior accuracy. The model achieves SOTA results on benchmarks like AIME 2025 (94.43%), MathVision (75.95%), MMMU (80.11%), and OCRBench (89.00%). It is open-source (Apache 2.0 License) and deployable via transformers, vLLM, or SGLang.
Score de transparence
Pondéré sur quatre piliers · mis à jour le July 1, 2026
Capacités
Informations sur le fournisseur
Informations complètes sur le fournisseur/prestataire de cette application IA
Informations fournisseur (Règlement IA de l’UE)
Risques potentiels
1 points d'attention identifiés
Révision recommandée avant utilisation
Ces points d'attention sont automatiquement identifiés sur la base d'informations publiquement disponibles sur le fournisseur et les données du catalogue IA. Les risques réels peuvent varier selon votre cas d'usage et votre implémentation spécifiques.
Obtenez des informations sur les risques en exécutant des évaluations sur cette application IA.
Vous travaillez chez StepFun ? Revendiquez cette fiche pour corriger ou compléter les données.
Prêt à gérer vos applications IA ?
Suivez, évaluez et gouvernez vos applications IA avec Anove.