Step3-VL-10B
door StepFun
Step3-VL-10B is a 10B-parameter multimodal foundation model that redefines the trade-off between compact efficiency and frontier-level intelligence. Despite its size, it outperforms models 10×–20× larger (e.g., GLM-4.6V, Qwen3-VL-Thinking, Gemini 2.5 Pro) on STEM reasoning, visual perception, OCR, and GUI grounding. Key innovations include unified pre-training on a 1.2T-token multimodal corpus, scaled multimodal RL (1,400+ iterations), and Parallel Coordinated Reasoning (PaCoRe), which aggregates evidence from 16 parallel rollouts for superior accuracy. The model achieves SOTA results on benchmarks like AIME 2025 (94.43%), MathVision (75.95%), MMMU (80.11%), and OCRBench (89.00%). It is open-source (Apache 2.0 License) and deployable via transformers, vLLM, or SGLang.
Transparantiescore
Gewogen over vier pijlers · bijgewerkt July 1, 2026
Functionaliteiten
Leveranciersinformatie
Volledige informatie over de leverancier/provider van deze AI-applicatie
Leveranciersinformatie volgens de EU AI Act
Potentiële risico's
1 aandachtspunten geïdentificeerd
Beoordeling aanbevolen vóór gebruik
Deze aandachtspunten worden automatisch geïdentificeerd op basis van openbaar beschikbare informatie over de leverancier en AI-catalogusgegevens. Werkelijke risico's kunnen variëren afhankelijk van uw specifieke use case en implementatie.
Krijg inzicht in risico's door beoordelingen uit te voeren op deze AI-applicatie.
Werk je bij StepFun? Claim deze vermelding om de gegevens te corrigeren of aan te vullen.
Klaar om AI-applicaties te beheren?
Volg, beoordeel en beheer je AI-applicaties met Anove.