Tým Weibo AI vydal technickou zprávu o modelu VibeThinker-3B, kompaktním modelu se 3 miliardami parametrů, který v testech uvažování překonává modely o řád větší včetně Claude Opus 4.5. Na benchmarku AIME26 dosáhl skóre 94,3 a po aplikaci test-time scaling dokonce 97,1, na LiveCodeBench v6 získal 80,2 % Pass@1 a u neviděných LeetCode úloh uspěl v 96,1 % případů. Vývojáři použili optimalizovaný post-tréninkový pipeline zahrnující curriculum SFT, multi-doménové reinforcement learning a offline self-distillation založený na Spectrum-to-Signal paradigmatech. Výsledek ukazuje, že agresivní optimalizace tréninku a nové techniky reinforcement learningu mohou malé modely posunout na úroveň špičkových reasoningových systémů, což má zásadní dopad na efektivitu inference a dostupnost výkonné AI v prostředích s omezenými výpočetními zdroji. VibeThinker-3B je postaven na otevřené vizi Spectrum-to-Signal, která se zaměřuje na maximalizaci využití každého parametru.
Malý model VibeThinker-3B poráží v uvažování daleko větší konkurenty
Kompaktní model se 3 miliardami parametrů od Weibo AI překonává v testech uvažování Claude Opus 4.5 i další modely o řád větší.