Table of Contents

AI locală este practică pentru lucrări limitate cu verificări clare. Înlocuirea lucrului trimis către ChatGPT sau Claude cere trei lucruri: capacitatea modelului, memoria disponibilă și un agent care își inspectează și verifică rezultatul.

Un model care încape în stația ta are nevoie și de instrumente potrivite și de viteză pentru încercări repetate. Acest articol separă rezultatele benchmarkurilor, estimările de memorie și dovezile sarcinilor finalizate.

Concluzii principale

  • Capacitate: scorurile de referință descriu setări concrete, nu versiunea ta locală cuantizată.
  • Memorie: bugetează împreună greutățile, cache-ul de context și memoria runtime.
  • Viteză: reluarea unei conversații de agent măsoară servirea, nu corectitudinea.
  • Verificare: agentul are nevoie de controale potrivite rezultatului cerut.
  • Alegere: compară sarcini repetate, timpul de reparare și costul total înainte de cumpărare.

Citește scorurile în context

Artificial Analysis Intelligence Index agregă mai multe evaluări într-un scor de referință. Clasamentul modelelor și rezultatele hardware locale afișează intrările verificate la 6 octombrie 2026.

Model și setareScor indexImplementare în această comparație
Qwen3.8 27B, xhigh34Greutăți descărcabile
GLM-5.3, max45Greutăți descărcabile
GPT-6 Astra, max53Serviciu găzduit
Claude Opus 5.5, max cu fallback58Serviciu găzduit

Punctele indexului nu sunt procente de inteligență sau succes. O diferență de 13 puncte între GLM și Claude nu dovedește o diferență de 13% la programare. Setarea de raționament contează și ea.

Metodologia publicată descrie testul. Unele evaluări includ instrumente și infrastructură de agenți. Scorul rămâne un rezultat în acele condiții. Nu îl transfera direct la o copie locală comprimată care rulează în altă aplicație.

ChatGPT și Claude sunt produse, iar tabelul compară modele subiacente. Abonamentul, modelul ales, instrumentele disponibile și contextul sarcinii introduc diferențe suplimentare. Testează configurația completă pe o sarcină repetată.

Bugetează întreaga cerere

Potrivirea memoriei are trei componente. Greutățile păstrează parametrii învățați. Cache-ul cheie-valoare, sau cache KV, păstrează datele de atenție folosite la inferență. Bufferele runtime și software-ul consumă restul.

Required memory = resident weights + context cache + runtime allowance
Available memory = physical capacity - operating system and application reserve

Cuantizarea reduce precizia de stocare a greutăților. Precizia mai mică reduce memoria, cu un compromis de calitate dependent de model și build. Precizia cache-ului este separată. Un fișier Q4 nu dovedește un cache de patru biți.

Pentru 27 de miliarde de parametri la 16 biți, greutățile cer aproximativ 50,3 GiB. La opt biți sunt 25,1 GiB, iar la patru biți 12,6 GiB. Dimensiunile publicate ale fișierelor includ metadate, împachetare și precizie mixtă. Folosește fișierele exacte pentru planificare.

Model cardul Qwen3.8-27B și model cardul GLM-5.3 descriu arhitecturi diferite. Un model mixture-of-experts activează doar o parte din parametri pentru fiecare token, dar restul greutăților tot trebuie stocate. Offloading schimbă plasarea și latența, nu elimină greutățile.

Începe cu fișiere publicate

Dimensiunea descărcării este un punct de pornire mai concret decât numărul parametrilor. Buildurile Qwen și GLM publicate de Unsloth arată efectul cuantizării.

Build cuantizatDimensiune publicată, GB zecimaliGiB aproximativ
Qwen3.8 27B Q4_016.115.0
Qwen3.8 27B Q8_029.027.0
GLM-5.3 UD-Q4_K_XL467434.9
GLM-5.3 UD-IQ2_M239222.6

Surse fișiere: Qwen Q4_0 , Qwen Q8_0 , fragmente GLM UD-Q4_K_XL și fragmente GLM UD-IQ2_M . Valorile au fost verificate la 6 octombrie 2026. Conversia GiB împarte octeții zecimali la 2³⁰.

Acestea sunt dimensiuni ale fișierelor de greutăți, nu măsurători ale memoriei rezidente. Încărcarea, cache-urile, bufferele temporare și componentele modelului schimbă memoria procesului. Nu compara 29 GB direct cu o alocare de 30 GiB.

Contextul schimbă potrivirea

Cache-ul de atenție Qwen oferă un exemplu calculat. Configurația publicată specifică 64 de straturi, atenție completă la fiecare al patrulea strat, patru capete key-value și dimensiunea capului 256.

Full-attention KV bytes per token:
16 layers × 4 KV heads × 256 dimensions × 2 (K and V) × 2 bytes
= 65,536 bytes

8,192 tokens  = 0.5 GiB
32,768 tokens = 2.0 GiB

Acest component calculat al cache-ului presupune chei și valori de 16 biți pentru o secvență. Exclude starea atenției liniare, bufferele runtime, overheadul alocatorului și componentele opționale de viziune sau decodare speculativă. Păstrează rezervă pentru ele.

Într-un buget ilustrativ, adaugă 3–5 GiB pentru alocările rămase la dimensiunile rotunjite ale greutăților. Înlocuiește ipoteza cu măsurători din runtime-ul ales.

Build și contextInterval de planificare calculat
Qwen Q4_0, 8K18.5–20.5 GiB
Qwen Q8_0, 8K30.5–32.5 GiB
Qwen Q8_0, 32K32.0–34.0 GiB

O alocare utilizabilă de 30 GiB lasă loc pentru Q4, în timp ce scenariile Q8 depășesc limita. O rezervă măsurată mai mică schimbă limita. Un prompt scurt reușit nu dovedește capacitate pentru o sesiune lungă de cod.

Cererile concurente adaugă o altă dimensiune. Ollama documentează creșterea memoriei la cereri paralele și controale separate pentru precizia cache-ului. Cache-ul Q8 folosește aproximativ jumătate din memoria F16, iar Q4 aproximativ un sfert, cu compromisuri dependente de model. Vezi FAQ-ul Ollama .

Potrivește hardware-ul cu alocarea

RTX 5090 oferă 32 GB memorie grafică dedicată. DGX Spark cu 128 GB folosește memorie partajată. Artificial Analysis documentează ambele configurații. Capacitatea mai mare permite alocări mai mari, dar nu stabilește viteza.

Scenariu hardwareImplicație practică
RTX 5090, 32 GBQwen Q4 lasă mai mult context decât Q8
DGX Spark, 128 GBÎncape orice build Qwen, cu overhead runtime necesar
Mac Studio, 256 GBSeturile mai mari sunt candidate, în funcție de runtime și alocare

GLM UD-Q4_K_XL depășește toate cele trei capacități înainte de cache. Setul IQ2 de aproximativ 222,6 GiB depășește și un sistem de 128 GB. Pe un Mac de 256 GB, fezabilitatea depinde de memoria accesibilă GPU și overheadul rămas. Specificațiile Apple descriu hardware-ul, nu o alocare garantată.

Un buget ipotetic utilizabil de 240 GiB lasă aproximativ 17,4 GiB după greutățile IQ2. Un buget de 192 GiB eșuează doar la greutăți. Niciun buget nu dovedește setările sistemului, cache comprimat, throughput util sau calitate IQ2 acceptabilă. Cere o configurație runtime demonstrată înainte de cumpărare.

Viteza este un rezultat separat

Benchmarkul de inferență locală Artificial Analysis redă o sarcină înregistrată de 168 de ture. Rezultatele pentru laptopuri și stații arată următoarele valori pentru Qwen3.8 27B.

SistemTimp de redare a servirii
DGX Spark, 128 GB24.2 minute
RTX 50904.9 minute
Mac Studio, 256 GBFără rezultat în această comparație

Rezultatul RTX cere aproximativ o cincime din timpul Spark. Configurația de servire contează, deci raportul nu este universal. Buildurile testate diferă și de exemplele GGUF de mai sus.

Timpul de redare exclude execuția instrumentelor și impune lungimi înregistrate. Nu verifică dacă răspunsurile rezolvă sarcina originală. O măsurătoare MacBook nu dovedește performanța Mac Studio.

Oferă agentului feedback

Un sistem de execuție al agentului oferă instrumente, context, buclă de acțiuni și verificare. Modelul alege acțiuni în acest sistem. Pentru un export CSV sunt utile citirea fișierelor, schimbarea codului, rularea testelor și primirea erorilor.

Consideră o sarcină ilustrativă de export, nu un experiment măsurat. Agentul scrie funcția de descărcare, dar folosește formatul de dată greșit. Revizuirea vizuală ratează problema. Un test deschide fișierul și compară datele cu formatul cerut. Agentul primește eroarea, schimbă formatterul și repetă verificarea.

Componentă lipsăEșec probabil
Context relevantEditează fișierul greșit
Instrumente de execuțieDescrie corecția fără să o aplice
VerificareSe oprește după cod plauzibil
Feedback de eroareRepetă abordarea eșuată

Raportul LangChain indică o schimbare de la 52,8% la 66,5% în Terminal Bench 2.0 cu GPT-5.2-Codex fix. Raportul de inginerie a agenților descrie ghidarea verificării, contextul mediului, detectarea editărilor repetate și schimbările bugetului de raționament.

Aceasta este dovadă raportată de furnizor, nu dovadă că un model local mic egalează un model de frontieră. Susține concluzia mai restrânsă că alegerea modelului singură nu explică rezultatele agenților. LangChain raportează rezultate mai slabe cu raționament maxim permanent din cauza timeouturilor.

Potrivește verificările cu munca

O verificare trecută stabilește numai acoperirea ei. Un test CSV pentru nume de coloane nu verifică date, citate, Unicode sau controlul accesului. Definește rezultatul înainte să alegi verificarea.

SarcinăDovadă utilă de finalizare
Schimbare de codTeste relevante și inspecția comportamentului rezultat
Răspuns de cercetareSurse pentru afirmațiile individuale
Rezervare sau rambursareStare salvată corect și politică aplicabilă
Export de documentIeșire analizată cu câmpurile și formatele cerute

Studiul τ-bench evaluează agenți care interacționează cu instrumente, utilizatori și reguli de domeniu. Lucrarea compară starea finală a bazei de date cu rezultatul așteptat. Un text fluent de confirmare nu este suficient pentru o tranzacție.

Local nu înseamnă offline

Inferența locală controlează unde rulează modelul. Aplicația stabilește în continuare unde ajung documentele, căutările, urmele și rezultatele instrumentelor. Un model local de cod conectat la căutare la distanță rămâne un sistem conectat la rețea.

Ollama afirmă că nu primește prompturi sau răspunsuri la execuție locală și documentează dezactivarea funcțiilor cloud. Aceasta este o afirmație specifică runtime-ului, nu o garanție pentru fiecare agent conectat. Verifică endpointul modelului și fiecare integrare în documentația runtime-ului .

Calea datelorCe verifici
Endpoint de inferențăProces local, server la distanță sau fallback automat
Căutare și recuperareInterogări și fragmente trimise extern
Conexiuni ale instrumentelorFișiere și înregistrări expuse fiecărui serviciu
Jurnale și urmeLocație, retenție și acces

Un flux hibrid are nevoie de o regulă explicită de predare. Păstrează extragerea documentelor private locală, apoi trimite doar rezultate agregate aprobate. Revizuiește materialul transmis. Un rezumat rămâne sensibil dacă păstrează nume, date despre clienți sau constatări confidențiale.

Testează înainte de cumpărare

Alege o sarcină repetată cu o condiție clară de final. Compară configurația locală cu produsul găzduit pe care îl folosești, inclusiv instrumentele. Dă ambelor aceleași intrări și criterii, apoi repetă sarcina pe exemple reprezentative.

  1. Înregistrează configurația: fișierul exact, cuantizarea, versiunea backendului, limita de context și raționamentul.
  2. Definește succesul: artefactul, comportamentul cerut și efectele secundare interzise.
  3. Măsoară finalizarea: timpul, verificările trecute, încercările eșuate și reparațiile manuale.
  4. Include costul deținerii: hardware, electricitate, API, întreținere și timpul tău.
  5. Clasifică eșecurile: raționament, memorie, latență, context lipsă sau verificare lipsă.

Inferența locală se potrivește când calitatea și latența evaluate ating cerințele. Un model găzduit rămâne util când capacitatea suplimentară reduce erorile sau revizuirea. Un flux hibrid atribuie sarcini diferite după definirea datelor permise să părăsească mașina.

Calculează costul pe rezultat acceptat

Timpul de reparare umană schimbă economia. Un răspuns local rapid care cere zece minute de corecție consumă mai mult timp decât unul lent care trece revizuirea. Numără rezultatele acceptate împreună cu costul inferenței.

Cost per accepted task =
(hardware allocation + electricity + service fees + maintenance + review time)
÷ accepted tasks

Cost ilustrativ de revizuire: la 30 USD pe oră, opt minute costă 4 USD pe sarcină. O sută de astfel de sarcini consumă 400 USD. Acestea sunt exemple aritmetice, nu rate măsurate de eșec.

Compară rezultate echivalente. Include încercările respinse în timp și cost. Pentru hardware deținut, distribuie cumpărarea pe o perioadă și un volum realist. Pentru serviciu, include abonamentul sau API-ul și revizuirea necesară.

Pentru hardware, continuă cu ghidul modelelor locale, GPU și context . Pentru capacitate și preț, citește comparația memoriei DGX Spark . Alege cea mai mică configurație care atinge cerințele de calitate, viteză și date.

Videoclip de referință

Referințe