Qwen i Gemini mogą się schować. Meta ma nowego króla
AI to nie tylko zamknięte, płatne rozwiązania od OpenAI czy Anthropic. Sporo osób nie ufa korporacjom i woli hostować modele na własnym PC.
Meta zaprezentowała Muse Glimmer, nowy otwarty model sztucznej inteligencji przygotowany z myślą o pracy lokalnej. Zamiast kolejnego ogromnego systemu wymagającego całych farm serwerów dostajemy rozwiązanie liczące 30 miliardów parametrów, które ma działać na komputerze wyposażonym w standardową kartę graficzną.
Niewielki model, duże możliwości
Muse Glimmer potrafi znacznie więcej niż tylko prowadzić rozmowę. Całość wyternowano go pod kątem wieloetapowego rozumowania, obsługi narzędzi, samodzielnego wykonywania złożonych zadań oraz radzenia sobie z błędami podczas pracy. Model obsługuje również obrazy, dzięki czemu może analizować m.in. zrzuty ekranu, wykresy i dokumenty. Do tego został wytrenowany na danych w ponad 100 językach.
Meta porównała Muse Glimmer 30B z najpopularniejszymi obecnie lokalnymi AI, czyli Gemma 4-31B oraz Qwen 3.6-27B, w wielu testach jej nowość okazała się lepsza. W MCP Atlas, sprawdzającym korzystanie z narzędzi, Glimmer uzyskał 75,5 punktu wobec 54,2 dla Gemmy i 62,5 dla Qwena. W DeepSearch QA było to odpowiednio 74,6, 61,7 oraz 71,1 punktu, natomiast w WildClawBench model Meta zdobyła 47,6 punktu przy 37,6 i 43,2 u rywali.
Glimmer nie wygrywa jednak wszędzie - Qwen3.6-27B pozostaje lepszy m.in. w SWE-Bench Verified, Terminal-Bench 2.1 oraz OSWorld-Verified. Warto przy tym zaznaczyć, że część wyników pochodzi z wewnętrznych testów Meta, choć firma starała się stosować wspólne środowisko i metodologię dla wszystkich modeli.
GeForce RTX 5090 rozpędza go do 233 tokenów na sekundę
Pełna wersja Muse Glimmer 30B wymagałaby ponad 55 GB pamięci, dlatego Meta zastosowała około 4-bitową kwantyzację. Pozwoliło to zmniejszyć sam model do mniej niż 20 GB. Wariant K-Quant-17GB przygotowano z myślą o układach z 24 GB VRAM, a według pomiarów Meta średni spadek jakości względem pełnej precyzji wynosi około 1%.
Jeszcze ciekawiej prezentuje się szybkość generowania. Dzięki technice "speculative decoding" i dodatkowej sieci DFlash Muse Glimmer na GeForce RTX 5090 przyspiesza z 74,9 do 233 tokenów na sekundę, czyli około 3,1 raza. Na Apple M5 Max wzrost wynosi z 26,6 do 50 tokenów na sekundę, a na M4 Max z 23,7 do 38 tokenów na sekundę. Wszystko działa przy tym lokalnie, bez konieczności wysyłania zapytań do chmury.
Muse Glimmer jest już dostępny do pobrania. Meta zapowiada również wsparcie m.in. dla Ollama, LM Studio, Unsloth, llama.cpp, MLX i ExecuTorch, co powinno znacząco ułatwić uruchomienie modelu na własnym PC.