Hugging Face je objavio da biblioteka Transformers sada podržava direktno učitavanje i izvođenje GGUF kvantiziranih modela putem postojećeg from_pretrained API-ja. GGUF format, razvijen od strane tima iza llama.cpp, pakira težine i metapodatke (uključujući tokenizator i opcionalni chat template) u jednu datoteku i podržava više razina kvantizacije kako bi se smanjila memorijska zauzetost modela.
Prema objavi, GGUF checkpointi su preuzimani milijunima puta, a izdavači poput Unsloth i drugih nude varijante u kvantizacijama (npr. Q4_K_M, Q5_K_M, Q6_K) koje korisnicima omogućuju kompromis između veličine datoteke i preciznosti. Početna fokusna platforma za podršku je Apple Silicon, počevši s arhitekturom Qwen3.5. Da bi se postigla izvedba bliska llama.cpp, Transformers ponovno koristi ggml kernela kroz posebnu kernels biblioteku i smanjuje režijske troškove u funkciji generate; ako su kompatibilni ggml/Metal kernele dostupni, Transformers ih automatski učitava, a u suprotnom loader se vraća na alternativu uz upozorenje.
Praktični koraci uključuju instalaciju najnovije verzije Transformers iz glavne grane, odgovarajućih kernels buildova i učitavanje GGUF datoteke pomoću parametra gguf_file pri pozivu from_pretrained. Benchmark testovi na MacBook Pro M2 Max (32 GB) pokazuju da je throughput generate blizu onoga koji pruža llama.cpp za testirane GGUF checkpointe, iako su mjerenja različita jer Transformers uključuje i prefill dok llama-bench izvještava samo decode-throughput. Integracija omogućava razvoj u Pythonu i PyTorchu: ispitivanje aktivacija, modifikacija forward pass-a, evaluacija kvantiziranih checkpointa i dekvantizacija za daljnje fino podešavanje.
ŠTA OVO ZNAČI?
Za developere i napredne korisnike: možete koristiti iste GGUF datoteke s Huba izravno u Transformers radnim tokovima te iskoristiti PyTorch alate za eksperimente i provjeru konverzija kvantiziranih modela bez prebacivanja između odvojenih runtime‑ova. Za korisnike Apple Silicon laptopa: preporučene kvantizirane varijante (npr. Q4_K_M) smanjuju memorijske zahtjeve i olakšavaju lokalno testiranje modela, uz napomenu da stvarna kvaliteta ovisi o modelu i zadatku te zahtijeva provjeru na konkretnim slučajevima.
Izvor: Hugging Face · 2026-09-22
Ilustracija: COIN.BA



