Table of Contents

AI local oferă o graniță de date mai mică. Un prompt procesat de un runtime local rămâne pe dispozitiv când modelul, instrumentele, logurile și calea de rețea rămân locale. Un GPU local nu transformă computerul într-un sistem etanș.

Runtime-urile modelelor, pluginurile, extensiile browserului, accesul la distanță, API-urile expuse și descărcările modelelor îți modelează în continuare riscul. Contează și costul. Electricitatea poate costa mai puțin decât un token găzduit, în timp ce deținerea hardware-ului poate împinge pragul complet de rentabilitate mult în viitor.

Acest ghid mapează mai întâi granița de confidențialitate. Apoi verifică prețul folosind prețuri actuale ale furnizorilor, o presupunere explicită de consum și cifrele raportate în videoclipul furnizat.

Această comparație a costurilor locale și găzduite oferă context pentru formulele de mai jos. Nu copia cifrele de throughput fără să testezi același fișier de model și runtime pe hardware-ul tău.

Videoclipul raportează un runtime de 2 minute și 31 de secunde. I-am verificat titlul și durata prin pagina videoclipului. Nu am repetat testul hardware, deci vitezele raportate rămân măsurători furnizate de sursă.

Răspunsul scurt

  • Alege inferență locală pentru o cale de date controlată. Ține serverul modelului pe dispozitiv, leagă-l la loopback și restricționează accesul instrumentelor.
  • Alege inferență găzduită pentru lucrări ocazionale. Evită cheltuiala hardware când volumul este mic sau modelul preferat nu încape în sistem.
  • Tratează costul local ca două numere. Separă energia pe oră activă de deținerea hardware-ului.
  • Tratează confidențialitatea ca proprietate a sistemului. Un model privat își pierde beneficiul când un plugin încarcă fișiere sau un API local ascultă pe fiecare interfață de rețea.

Inferența locală ajută când textul sensibil trebuie să rămână într-o stație de lucru sau într-o rețea izolată. Ajută și pentru operare offline, o versiune fixă de model sau acces previzibil fără o cotă de furnizor.

Aceste beneficii nu dovedesc răspunsuri mai bune. Un model găzduit se poate potrivi mai bine unei sarcini, poate termina mai repede sau poate cere mai puțină întreținere. Măsoară volumul înainte să cumperi hardware.

Urmărește calea datelor

Mapează fiecare componentă implicată într-o cerere. Numele modelului singur nu arată unde călătoresc datele.

ComponentăÎntrebare de confidențialitateDovezi de colectat
Server de model localRămâne promptul pe host?Configurația procesului, adresa de ascultare și traficul de ieșire
Model cloudCe text, fișiere și rezultate ale instrumentelor părăsesc hostul?Endpoint API, termenii furnizorului, logurile cererilor și setările contului
Mod cloud într-o aplicație localăRulează modelul ales pe dispozitiv?Identificatorul modelului, eticheta furnizorului și conexiunea de rețea
Plugin de instrumentPrimește modelul fișiere, ieșire shell sau conținut de browser?Lista instrumentelor, permisiunile și datele capturate ale cererii
Descărcare modelCe cod și greutăți intră pe host?Depozitul sursă, licența, checksum-ul versiunii și calea descărcării
Loguri localeUnde persistă prompturile și rezultatele instrumentelor?Loguri runtime, istoricul shell, rapoarte de crash și aria backupului

Un model local elimină un furnizor din calea promptului. Nu elimină nevoia de a verifica restul căii.

Local nu înseamnă privat implicit

Ollama’s privacy policy spune că Ollama nu vede prompturi sau date când un model rulează local. Politica separă și operarea locală de modelele găzduite în cloud. Un model cloud creează totuși o graniță de serviciu, chiar când aceeași aplicație pornește ambele moduri.

llama.cpp’s server documentation arată un server local care ascultă implicit pe 127.0.0.1:8080. Exemplele Docker arată și --host 0.0.0.0, care expune serviciul pe toate interfețele. O adresă de bind mai largă schimbă granița accesului.

Verifică adresa de ascultare înainte să trimiți text sensibil:

lsof -nP -iTCP -sTCP:LISTEN | rg 'ollama|llama|8080|11434'

127.0.0.1 sau localhost limitează accesul la același host în cazul normal. O adresă LAN sau 0.0.0.0 cere o regulă de firewall și un plan de autentificare. Nu expune endpointul modelului în rețea înainte să testezi ambele cazuri.

Verifică și numele modelului selectat. Documentația cloud Ollama descrie modelele cloud ca o cale separată de serviciu. O interfață locală nu dovedește execuție locală.

FAQ-ul Ollama documentează un mod exclusiv local. Setează disable_ollama_cloud în ~/.ollama/server.json sau setează OLLAMA_NO_CLOUD=1 înainte de repornirea serviciului. Asta elimină modelele cloud Ollama și căutarea web din runtime-ul selectat. Nu restricționează alte aplicații, instrumente browser, pluginuri sau accesul la rețea pe host.

{
  "disable_ollama_cloud": true
}

Verifică setarea după repornire. Un runtime exclusiv local restrânge o cale. Nu stabilește un host privat.

Calculează costul găzduit

Prețurile tokenurilor separă intrarea de ieșire. Anthropic lists Claude Haiku 5.5 at $0.10 per million input tokens and $0.50 per million output tokens for prompts up to 100,000 tokens . Prompturile peste 100.000 de tokenuri folosesc tarifele mai mari listate.

OpenAI’s token guide explică de ce numărul de cuvinte nu este egal cu numărul de tokenuri. Separă și tokenurile de intrare, ieșire, intrare memorată și raționament. Folosește câmpurile de utilizare ale furnizorului, nu o estimare din numărul de cuvinte.

Pentru o comparație simplă, folosește un milion de tokenuri generate și un milion de tokenuri de intrare ca volume separate. Un agent de programare trimite adesea context repetat și produce un răspuns mai mic, deci o singură cifră combinată ascunde amestecul costurilor.

Calculează energia locală

NVIDIA’s RTX 5070 launch announcement a listat un preț inițial de $549. NVIDIA’s RTX 5070 family page listează 12 GB de memorie și 250 W putere grafică totală pentru designul de referință Founders Edition. Pagina de produs NVIDIA încă listează $549 și arăta placa fără stoc în timpul acestei verificări.

Puterea GPU nu este consumul întregului sistem. Folosește un wattmetru pentru PC. Exemplul de mai jos presupune un consum de 400 W pentru întregul sistem, inclusiv GPU, procesor, memorie, stocare, ventilatoare și pierderile sursei. Este o presupunere pentru calcul, nu un rezultat măsurat.

The U.S. Energy Information Administration forecast a folosit 18,2 cenți pe kilowatt-oră ca preț mediu rezidențial al electricității pentru 2026. Tariful tău schimbă rezultatul.

Folosește formula aceasta pentru rezultatul generat:

local cost per 1M output tokens =
(whole_system_watts / 1,000)
× (1,000,000 / output_tokens_per_second / 3,600)
× electricity_price_per_kWh

La 400 W și $0.182 pe kilowatt-oră, sistemul costă $0.0728 pe oră activă.

Viteza ieșiriiTimp pentru 1M tokenuriCostul energiei pentru 1M tokenuri
20 tokens per second13 ore 53 minute$1.01
50 tokens per second5 ore 33 minute$0.40
94 tokens per second2 ore 57 minute$0.22

La 50 tokenuri de ieșire pe secundă, energia locală costă mai puțin decât prețul de $0.50 pentru ieșirea Haiku 5.5. La 20 tokenuri pe secundă, energia locală costă mai mult. Pragul vitezei de ieșire în aceste ipoteze este aproximativ 40 de tokenuri pe secundă.

Calculul intrării folosește aceeași formulă. La 2.650 tokenuri de intrare pe secundă, un milion de tokenuri de intrare durează aproximativ 6 minute și 17 secunde și costă aproximativ $0.008 în energie. La 1.000 de tokenuri pe secundă, aceeași muncă costă aproximativ $0.020.

Transcrierea furnizată raportează 94 tokenuri de ieșire pe secundă și 2.650 tokenuri de intrare pe secundă pentru exemplul său cu RTX 5070. Calculul de mai sus corespunde acestor cifre la ipoteza de 400 W. Transcrierea nu oferă un raport de laborator independent, hash-ul fișierului modelului, build-ul runtime-ului, promptul sau citirea wattmetrului. Tratează vitezele ca rezultat de referință, nu ca garanție de cumpărare.

Hardware-ul schimbă break-even-ul

Economiile de energie nu plătesc hardware-ul singure. Compară achiziția completă cu diferența dintre costul ieșirii găzduite și costul variabil local.

La 50 tokenuri de ieșire pe secundă:

$0.50 hosted output price - $0.40 local power = $0.10 saved per 1M tokens
$549 GPU price / $0.10 = about 5.5 billion output tokens

La 94 tokenuri de ieșire pe secundă, economia rotunjită crește la aproximativ $0.28 pe milion de tokenuri. Recuperarea unei plăci GPU de $549 cere apoi aproximativ 2 miliarde de tokenuri de ieșire. Ambele cifre exclud memoria sistemului, stocarea, placa de bază, sursa, răcirea, mentenanța și valoarea de revânzare.

Prețul de lansare nu este o ofertă universală. Pagina actuală NVIDIA afișa prețul oficial fără stoc. O listare de $819 a unui vânzător cere verificare separată înainte de folosirea într-un model break-even. Folosește factura reală și consumul măsurat la priză.

Hardware-ul existent schimbă decizia. Dacă stația ta are deja memorie suficientă și un GPU potrivit, costul hardware este deja plătit pentru următoarea sarcină. Compară energia, timpul, calitatea, confidențialitatea și mentenanța. Dacă trebuie să cumperi un sistem complet, compară sistemul complet cu utilizarea găzduită.

Pentru detalii despre potrivirea modelelor, citește local AI model and GPU context guide și 16GB VRAM sizing guide . Pentru o configurație raportată de agent local de programare, citește Strata and OpenCode guide .

Ce îți oferă confidențialitatea locală

  • O cale de date mai scurtă: promptul nu trebuie să ajungă la un furnizor de modele când inferența rămâne locală.
  • Operare offline: un model descărcat și un runtime local nu au nevoie de conexiune activă la furnizor pentru generarea textului.
  • Controlul versiunii: alegi fișierul modelului și versiunea runtime-ului în loc să primești o schimbare automată a furnizorului.
  • Controlul utilizării: inferența locală evită contorul cloud per cerere după ce iei în calcul hardware-ul și energia.
  • Controlul politicii de rețea: firewall-ul și controalele hostului definesc cine ajunge la endpointul modelului.

Aceste câștiguri contează mai ales pentru cod sursă, date de clienți, proiecte nelansate, notițe private și muncă într-un mediu deconectat. Inferența locală tot are nevoie de criptarea discului, actualizări ale hostului, separarea conturilor și instrumente restricționate.

Ce nu îți oferă confidențialitatea locală

  • Garanția calității: modelele mai mici sau cuantizate trebuie testate față de criteriile tale reale de acceptare.
  • Garanția lanțului de aprovizionare: fișierele modelelor, runtime-urile, pluginurile și imaginile containerelor au nevoie de surse de încredere și verificări de integritate.
  • Un host curat: malware-ul, extensiile browserului, backupurile, raportorii de crash și administrarea la distanță văd în continuare datele hostului.
  • Un endpoint de rețea sigur: un server legat de fiecare interfață creează un serviciu nou de apărat.
  • Un sistem gratuit: electricitatea, stocarea, răcirea, uzura hardware-ului și mentenanța au în continuare un cost.

Strata local coding-agent guide arată de ce memoria sistemului, contextul, accesul instrumentelor și setările runtime-ului intră în evaluare. Memoria GPU singură nu definește limita de confidențialitate sau performanță.

Alege granița potrivită

SituațiePrima alegere mai bunăMotiv
Documente sensibile și un PC compatibil existentLocal inferencePăstrează prompturile într-un host controlat și evită cheltuiala pentru hardware nou
Redactare generică ocazionalăHosted API sau chat servicePlătește pentru volumul mic și evită mentenanța
Un model frontier sau un instrument cloud specializatHosted serviceModelul sau instrumentul necesar nu este disponibil pe hostul local
Volum mare recurent cu model local verificatLocal sau hybridCompară energia, calitatea, timpul de suport și prețul furnizorului
Volume mixteHybrid routingȚine sarcinile sensibile local și trimite sarcinile generice aprobate către un model găzduit

Rutarea hibridă cere o regulă explicită de clasificare. Marchează datele ca doar locale, aprobate pentru procesare găzduită sau interzise până la revizuire. Nu te baza pe numele modelului sau pe pictograma aplicației pentru aplicarea regulii.

Verifică înainte să ai încredere

  1. Numește calea modelului. Notează identificatorul modelului, runtime-ul, versiunea și sursa descărcării.
  2. Verifică adresa de bind. Confirmă că serverul ascultă pe loopback, cu excepția unei nevoi documentate pentru o cale mai largă.
  3. Listează fiecare instrument. Verifică accesul la fișiere, shell, browser, rețea și pluginuri.
  4. Inspectează persistența. Găsește logurile prompturilor, ieșirea instrumentelor, rapoartele de crash, backupurile și directoarele comune ale modelelor.
  5. Testează comportamentul rețelei. Observă conexiunile în timpul unui test sensibil cu un prompt reprezentativ.
  6. Măsoară sistemul. Notează puterea la priză, viteza ieșirii, viteza intrării, lungimea contextului și reîncercările.
  7. Testează munca acceptată. Compară sarcinile finalizate și efortul de revizuire, nu doar tokenurile pe secundă.

local AI versus ChatGPT guide acoperă compromisurile capacităților modelelor. Folosește această listă de confidențialitate alături de testul de calitate.

Referințe