Open-weight iz Mete – nakon dugo vremena!
Neobičan obrat događaja: Meta je prije dva dana objavila novi model otvorenih težina. Riječ je o Muse Glimmeru, multimodalnom modelu od 30 milijardi parametara, i to pod licencom Apache 2.0, dakle bez ograničenja koja su pratila kasnije Llama licencije. Težine su na Hugging Faceu, a Meta uz njih objavljuje i službene kvantizirane inačice
Glimmer je destiliran iz većeg modela Muse Spark i za razliku od dosadašnjih Metinih objava nije zamišljen kao chatbot nego kao pogon za agente koji rade na lokalnom računalu. Meta navodi sedam ciljanih sposobnosti: dovršavanje zadataka od početka do kraja, pouzdano pozivanje alata prema zadanoj shemi, višekoračno zaključivanje, oporavak od pogrešaka, multimodalni ulaz, kompatibilnost s uobičajenim obrascima orkestracije agenata i podesivu razinu razmišljanja. Podržava više od stotinu jezika, a granica znanja (cutoff-date) mu je 4. siječnja ove godine.
Arhitektura posuđena od Gemme
Glimmer je gusti kauzalni transformer s 52 sloja, s kliznim prozorom od 2048 tokena. Grupirana pozornost radi s 32 upitne i samo dvije KV glave, dakle u omjeru 16:1, uz dimenziju glave 128.
Vizualni dio obavlja zaseban koder od približno 1,8 milijardi parametara, ViT-G/14 s 50 slojeva, koji prima do 4096 vizualnih tokena po slici. Ukupno to daje 29,6 milijardi parametara zajedno s vizualnim tornjem. Kontekst je 131.072 tokena, rječnik 202.048 tokena. Ulaz je tekst i slika, izlaz je tekst. Zvuk ne podržava, a videozapis obrađuje kao niz pojedinačnih sličica.
Ima li ga za Mac i Linux?
Ima i to bez ograničenja. Podrška u llama.cppu stigla je istoga dana kada i model - 10. kolovoza i izašla u izdanju b10353, a Meta uz nju nudi i vlastiti službeni GGUF. To automatski znači i Linux i macOS i Windows, jer se llama.cpp izvodi na sve tri platforme. Na Appleovim čipovima radi preko Metal sučelja, umjesto CUDA-e.
Za Mac postoji i put preko MLX-a, a Ollama je Glimmer uvrstila u svoj MLX pogon s podrškom za ulaz slika. Tu je i ExecuTorch za mobilne i ugradbene uređaje. Na poslužiteljskoj strani, dakle na Linuxu, model se poslužuje kroz vLLM i SGLang. Ako netko ne želi ništa instalirati, model je dostupan i preko Together AI-ja, Fireworks AI-ja i OpenRoutera. Unsloth je objavio svoje dinamičke kvantizacije s uputama za oba puta, i za llama.cpp i za vlastiti alat.
Koliko memorije treba?
U punoj BF16 preciznosti model traži oko 58 GB, što nijedna potrošačka grafička kartica nema. Meta zato isporučuje kvantizirane inačice i tvrdi da gubitak točnosti gotovo da nema. Njihova vlastita tablica navodi dvije varijante: K-Quant-Dynamic za 32 GB memorije, s prosječnim padom točnosti od 0,2 posto na petnaest testova, i K-Quant-17GB za 24 GB memorije, s padom od jedan posto.
Unslothova tablica preporučene ukupne memorije, dakle zbroja radne memorije i memorije grafičke kartice ili objedinjene memorije na Macu, ide ovako: dvobitna inačica traži 12 do 14 GB, trobitna 14 do 15 GB, četverobitna 17 GB, šestbitna 20 do 22 GB, osmobitna 34 GB. Kao primjere hardvera navode RTX 4080 za dvobitnu, RTX 4090 za trobitnu, Mac s 32 GB za četverobitnu i RTX 5090 ili Mac s 48 GB za šestbitnu. Tim se brojkama mora dodati prostor za KV cache, perceptivni koder i pomoćni model za spekulativno dekodiranje, pa je Metina računica da sve zajedno mora stati u 24 ili 32 GB.
Unslothove preporuke ukupne memorije
| Kvantizacija | Preporučena ukupna memorija | Primjer hardvera |
| 2-bitna | 12 - 14 GB | RTX 4080 |
| 3-bitna | 14 - 15 GB | RTX 4090 |
| 4-bitna | 17 GB | Mac s 32 GB |
| 6-bitna | 20 - 22 GB | RTX 5090 ili Mac s 48 GB |
| 8-bitna | 34 GB | - |
Taj pomoćni model zove se DFlash, a riječ je o malenoj mreži koja odjednom predlaže blok od šesnaest tokena, a glavni model taj blok provjerava u jednom paralelnom prolazu umjesto da generira token po token. Izlaz je identičan, jer glavni model i dalje potvrđuje svaki token. Meta je izmjerila ubrzanje dekodiranja od 3,1 puta na RTX-u 5090, 1,8 puta na Appleovu M5 Maxu i 1,5 puta na M4 Maxu.
Koliko je dobar?
Metina objavljena usporedba stavlja Glimmer u načinu visokog zaključivanja protiv Gemme 4 31B i Qwena 3.6 27B u načinu razmišljanja. Glimmer vodi na IFBenchu sa 77,0 naspram 76,0 i 70,8, na AIME 2026 s 94,7 naspram 89,2 i 94,1, na AA-LCR-u s 80,0 naspram 68,3 i 73,3 te na Beamu 128K sa 65,1 naspram 58,2 i 63,0. Gubi na GPQA Diamondu, gdje Gemma ima 85,7 naspram njegovih 83,5, i na Humanity's Last Exam bez alata, gdje su Gemma i Qwen ispred.
Metina usporedba
| Test | Glimmer | Gemma 4 31B | Qwen 3.6 27B |
| IFBench | 77,0 | 76,0 | 70,8 |
| AIME 2026 | 94,7 | 89,2 | 94,1 |
| AA-LCR | 80,0 | 68,3 | 73,3 |
| Beam 128K | 65,1 | 58,2 | 63,0 |
| GPQA Diamond | 83,5 | 85,7 | - |
| Humanity's Last Exam (bez alata) | zaostaje | ispred | ispred |
Glimmer, dakle, dobiva agentske kategorije i pozivanje alata i to na MCP Atlasu s više od dvadeset bodova razlike, dok je u općem zaključivanju i čistom programiranju razlika prema Qwenu 3.6 27B tanka. Qwen mu, uostalom, uzima Terminal-Bench 2.1 s devet bodova prednosti. Usporedni set i postavke birala je Meta, pa vrijedi uobičajeni oprez.
Kupovati karticu ili ne?
Ovdje se priča o modelu koji staje na jednu potrošačku karticu sudara s time što se u dućanima danas može kupiti, prema podacima s Nabava.net stranica.
Problem nije cijena nego memorija. Cijela potrošačka serija RTX 50 ispod vrha staje na 16 GB: RTX 5060 Ti sa 16 GB kreće od 639 eura, RTX 5070 Ti od 1085 eura, RTX 5080 od 1357 eura, a sve tri imaju istih 16 GB. Dvadeset i četiri gigabajta u aktualnoj generaciji jednostavno ne postoje. Prvi model s više memorije je RTX 5090 s 32 GB, koji kreće od 3419 eura za Asusov ROG Astral, odnosno 3679 eura za TUF i 3949 eura za Gigabyteov Windforce. To je pet do šest puta skuplje od kartice sa 16 GB.
Na kartici sa 16 GB Glimmer se vrti, ali u trobitnoj kvantizaciji, uz gubitak točnosti i uz vrlo malo prostora za perceptivni koder i pomoćni model. Preporučena četverobitna inačica traži 17 GB, dakle točno gigabajt više nego što te kartice imaju. Za udobnu upotrebu treba ili RTX 5090, ili rabljeni 3090 odnosno 4090 s njihova 24 GB, ili objedinjena memorija.
Potrošačke kartice serije RTX 50 - memorija i početna cijena
| Kartica | Memorija | Cijena od |
| RTX 5060 Ti | 16 GB | 639 eura |
| RTX 5070 Ti | 16 GB | 1.085 eura |
| RTX 5080 | 16 GB | 1.357 eura |
| RTX 5090 (Asus ROG Astral) | 32 GB | 3.419 eura |
| RTX 5090 (Asus TUF) | 32 GB | 3.679 eura |
| RTX 5090 (Gigabyte Windforce) | 32 GB | 3.949 eura |
Objedinjena memorija tu je zapravo najzanimljivija. Mac mini M4 Pro sa 48 GB memorije kreće od 2.649 eura, dakle 770 eura jeftinije od najjeftinijeg 5090, a nudi 16 GB memorije više. Mini računalo GMKtec EVO-X2 s AMD-ovim Ryzenom AI Max+ 395 i 64 GB stoji 2.458 eura, a inačica sa 128 GB od 4.499 eura. Nijedno od toga neće imati propusnost memorije kakvu ima 5090, pa će i broj tokena u sekundi biti niži, što potvrđuje i sama Metina tablica: DFlash na 5090 daje 3,1 puta, a na Appleovim čipovima 1,5 do 1,8 puta.
Uređaji s objedinjenom memorijom
| Uređaj | Memorija | Cijena od |
| Mac mini M4 Pro | 48 GB | 2.649 eura |
| GMKtec EVO-X2 (Ryzen AI Max+ 395) | 64 GB | 2.458 eura |
| GMKtec EVO-X2 (Ryzen AI Max+ 395) | 128 GB | 4.499 eura |
Zaključak je neugodno jednostavan. Ako već imate karticu s 12 ili 16 GB, Glimmera vrijedi skinuti i isprobati, jer trobitna inačica radi, a KV cache mu je toliko štedljiv da dugačak kontekst nije problem. Ako hardver tek trebate kupiti, ne isplati se. Za 3419 eura koliko traži 5090 dobiva se jako puno tokena kod Together AI-ja, Fireworksa ili na OpenRouteru, gdje je isti model dostupan od prvoga dana.
Lokalno izvođenje ima smisla samo ondje gdje ga opravdava nešto drugo osim cijene: podaci koji ne smiju napustiti zgradu, rad bez mreže, ili to što agent gleda snimke zaslona pa se svaka slika inače šalje nekamo van.
Glimmer je dobar argument za lokalne modele, ali ne i argument za kupnju grafičke kartice po današnjim cijenama.
Ako ionako trebate novo računalo, a ne gadite se Macova, neki od njih s objedinjenom memorijom bi mogao biti dobro rješenje za dvije muhe jednim udarcem - i novo računalo i mogućnost lokalnog pokretanja ovoga i sličnih modela koji će doći.