Preskoči na sadržaj

Kriptovalute • AI • Blockchain • Digitalna ekonomija

Transformers sada direktno pokreće GGUF kvantizirane modele za lokalnu inferencu na laptopima

Autor: ·

Transformers sada direktno pokreće GGUF kvantizirane modele za lokalnu inferencu na laptopima — ilustracija COIN.BA

Hugging Face je objavio da biblioteka Transformers sada podržava direktno učitavanje i izvođenje GGUF kvantiziranih modela putem postojećeg from_pretrained API-ja. GGUF format, razvijen od strane tima iza llama.cpp, pakira težine i metapodatke (uključujući tokenizator i opcionalni chat template) u jednu datoteku i podržava više razina kvantizacije kako bi se smanjila memorijska zauzetost modela.

Prema objavi, GGUF checkpointi su preuzimani milijunima puta, a izdavači poput Unsloth i drugih nude varijante u kvantizacijama (npr. Q4_K_M, Q5_K_M, Q6_K) koje korisnicima omogućuju kompromis između veličine datoteke i preciznosti. Početna fokusna platforma za podršku je Apple Silicon, počevši s arhitekturom Qwen3.5. Da bi se postigla izvedba bliska llama.cpp, Transformers ponovno koristi ggml kernela kroz posebnu kernels biblioteku i smanjuje režijske troškove u funkciji generate; ako su kompatibilni ggml/Metal kernele dostupni, Transformers ih automatski učitava, a u suprotnom loader se vraća na alternativu uz upozorenje.

Praktični koraci uključuju instalaciju najnovije verzije Transformers iz glavne grane, odgovarajućih kernels buildova i učitavanje GGUF datoteke pomoću parametra gguf_file pri pozivu from_pretrained. Benchmark testovi na MacBook Pro M2 Max (32 GB) pokazuju da je throughput generate blizu onoga koji pruža llama.cpp za testirane GGUF checkpointe, iako su mjerenja različita jer Transformers uključuje i prefill dok llama-bench izvještava samo decode-throughput. Integracija omogućava razvoj u Pythonu i PyTorchu: ispitivanje aktivacija, modifikacija forward pass-a, evaluacija kvantiziranih checkpointa i dekvantizacija za daljnje fino podešavanje.

ŠTA OVO ZNAČI?

Za developere i napredne korisnike: možete koristiti iste GGUF datoteke s Huba izravno u Transformers radnim tokovima te iskoristiti PyTorch alate za eksperimente i provjeru konverzija kvantiziranih modela bez prebacivanja između odvojenih runtime‑ova. Za korisnike Apple Silicon laptopa: preporučene kvantizirane varijante (npr. Q4_K_M) smanjuju memorijske zahtjeve i olakšavaju lokalno testiranje modela, uz napomenu da stvarna kvaliteta ovisi o modelu i zadatku te zahtijeva provjeru na konkretnim slučajevima.


Izvor: Hugging Face · 2026-09-22
Ilustracija: COIN.BA

Teme:

Povezani članci

Ostavite komentar

Vaša adresa e-pošte neće biti objavljena. Obavezna polja označena su sa *