Cât costă de fapt o aplicație AI?
Este simplu să compari 1M tokeni Gemini, Claude sau ChatGPT, dar mult mai greu să estimezi costul unei aplicații AI folosite în producție. AI în producție poate însemna printre altele:
- LLM (AI generativ)
- Grounding, alte instrumente externe, guardrails și observabilitate
- Căutare semantică, indecși vectoriali, feature stores
- Document parsing, reranking
- Găzduire, ingestie și interogare date
În prima jumătate a anului 2026, costul unor modele LLM a continuat să fie redus, cu tehnici noi de optimizare cost. În același timp, modelele de frontieră (SOTA) și aplicațiile agentice au dus la costuri totale mai mari pentru aplicațiile care le folosesc. Costul per token poate scădea deși investiția totală crește.
Costul relevant pentru business este costul aplicației funcționale cu toate serviciile și resursele. În 2026, concurenții folosind AI, vechile aplicații sunt upgradate continuu, rezultând un cost total crescut și în cheltuieli masive de capital. Cum spune Gartner:
„The improved predictability of ROI must occur before AI can truly be scaled up by the enterprise." (Sursa: Gartner)
Notă: Prețurile din articol sunt verificate în 7 august 2026. Articolul va fi actualizat periodic în viitor.
1. Prețurile LLM au variat în ambele direcții
Se spune „modelele AI se ieftinesc", acest lucru fiind adevărat pentru modelele rapide și compacte. Dar în paralel, modelele premium și execuția agentică au dus la costuri mari în 2026.
În primul semestru din 2026 s-au întâmplat simultan trei lucruri:
- pragul minim pentru procesarea textului a rămas redus
- performanța disponibilă la nivelurile intermediare a crescut
- modelele SOTA și reasoning-ul avansat au ridicat plafonul de cost
Costuri pentru 1M tokeni
Tabelul de mai jos estimează costul unei solicitări (sau mai multor solicitări, în funcție de furnizor) de 1 milion de tokeni de intrare și 200.000 de tokeni de ieșire, utilizând tarife standard, fără caching sau batching și fără suprataxă de long context.
Capabilitățile între modele nu sunt echivalente, tocmai de aceea este de remarcat intervalul mare de cost pentru același volum.
| Cloud și model | Input / 1M | Output / 1M | Cost 1M input, 200k output |
|---|---|---|---|
| Google Gemini 2.5 Flash-Lite | $0,10 | $0,40 | $0,18 |
| Google Gemini 2.5 Flash | $0,30 | $2,50 | $0,80 |
| Google Gemini 2.5 Pro | $1,25 | $10,00 | $3,25 |
| AWS Bedrock: Claude Haiku 4.5 | $1,00 | $5,00 | $2,00 |
| AWS Bedrock: Claude Sonnet 4.5 | $3,00 | $15,00 | $6,00 |
| Azure: GPT-5.2 Global | $1,75 | $14,00 | $4,55 |
| Azure: GPT-5.5 Global | $5,00 | $30,00 | $11,00 |
| Azure: GPT-5.5 Pro | $30,00 | $180,00 | $66,00 |
În Google Cloud, prețurile Gemini 2.5 variază între $0,10/$0,40 pentru Flash-Lite și $1,25/$10 pentru Pro. Flex și Batch pot reduce tarifele standard aproximativ la 50%, iar inputul din cache este taxat mult mai puțin decât cel procesat integral. (Sursa: Google Cloud)
AWS chiar estimează că inputul din cache poate costa cu până la 90% mai puțin, iar trecerea sarcinilor simple de la Sonnet la Haiku poate reduce cu aproximativ două treimi costul. Batch inference este disponibil pentru unele modele la 50% din prețul on-demand, iar Intelligent Prompt Routing este taxat cu $1 la 1.000 de solicitări și poate reduce costul modelului cu până la 30% în AWS pentru combinațiile suportate. (Sursa: Amazon Web Services)
Prețuri, optimizare și SOTA
Google a lansat în luna mai Gemini 3.1 Flash-Lite și Gemini 3.5 Flash. Ultimul este poziționat ca model cu inteligență apropiată de nivelul Pro, dar la cost și viteză de tip Flash. Prețul standard publicat pentru Gemini 3.5 Flash este de $1,50 pentru input și $9 pentru output, per milion de tokeni. (Sursa: Google Cloud Documentation)
AWS a pus mai mult accent vizibil pe optimizarea utilizării LLM. În ianuarie, Bedrock a extins prompt caching de la cinci minute la o oră pentru anumite modele Claude, ceea ce permite reutilizarea contextului în conversații și workflow-uri agentice mai lungi. (Sursa: Amazon Web Services)
Azure exemplifică de ce evoluția prețurilor nu înseamnă neapărat ieftinire. GPT-5.2 avea un preț global de $1,75 pentru input și $14 pentru output. Dar GPT-5.5 a urcat la $5 și $30, iar varianta Pro la $30 și $180. Nivelurile suplimentare cumpără capabilități SOTA. (Sursa: Microsoft Azure)
Calitate de execuție versus costul sarcinii
Din aceste motive, în 2026, a devenit populară clasificarea solicitărilor și utilizarea modelului premium (SOTA) numai când rezultatul superior justifică costul (routing).
De ce routing? Modelul cu cel mai mic preț / token nu duce mereu la cost optim
MODEL IEFTIN
│
├── răspuns corect zero-shot ──────────────────> cost redus
│
└── răspuns incorect
│
├── retry
├── schimbare model
├── intervenție inginer
└── refacere sarcină ─────────────────────> cost total mare
MODEL SOTA
│
├── solicitare simplă ─────────────────────────> cost nejustificat
│
└── solicitare complexă rezolvată corect ──> cost justificat 2. Costurile fluxurilor AI pe lângă tokeni
Costul modelului lingvistic (LLM) se calculează în linii mari astfel:
Cost LLM =
tokeni input fără cache x tarif input
+ tokeni cached x tarif cache
+ tokeni output facturabili x tarif output
+ reasoning tokens
Costul aplicației AI este însă:
Cost aplicație AI =
Cost LLM
+ căutare și retrieval
+ index și stocare
+ grounding
+ tool calls
+ guardrails
+ observabilitate și loguri
+ retries și erori
+ infrastructura aplicației
Chiar mai important, retry-urile sunt una dintre cele mai neglijate surse de cost, în special în AI agentic. Costul aplicației AI trebuie să identifice nivelurile la care un flux AI poate să dea greș și să fie reluat obligatoriu. În aplicațiile agentice apărute, retry poate însemna zeci sau sute de pași taxabili repetați.
Costul unei aplicații AI care funcționează corect se calculează pe livrabil:
- cost / răspuns acceptat
- cost / comandă procesată
- cost / document validat
- cost / recomandare aprobată
- cost / incident rezolvat
Google Cloud: grounding-ul poate costa mai mult ca modelul
Să presupunem că o solicitare Gemini 2.5 Flash utilizează 2.000 de tokeni de intrare și produce 500 de tokeni de ieșire.
Costul LLM este aproximativ:
2.000 / 1.000.000 x $0,30
+
500 / 1.000.000 x $2,50
=
$0,00185
Dacă dorești să folosești grounding (căutare pe Google pentru informații actuale care cresc substanțial calitatea răspunsului), nu mai poți calcula doar prețul tokenilor.
După depășirea cotei gratuite disponibile, grounding-ul pentru Gemini 2.5 costă $35 la 1.000 de grounded prompts, adică aproximativ $0,035 unul singur. Deci serviciul de grounding va costa de aproape 19 ori mai mult decât procesarea tokenilor. Iar pentru modelele Gemini 3, Google taxează grounding cu $14 la 1.000 de query-uri după primele 5.000 pe lună. Și, în acest caz, o singură solicitare a utilizatorului poate implica mai multe căutări facturabile. (Sursa: Google Cloud)
AWS: RAG poate costa cel mai mult înainte de model
AWS a publicat un exemplu pentru o bază de cunoaștere de 50 GB și 100.000 de căutări lunare.
- Cu standard retrieval, costul este de $250 pentru stocarea indexului și $100 pentru căutări, în total $350 / lună.
- Cu agentic retrieval și o medie de două căutări interne pentru fiecare apel, același volum ajunge la: $250 stocarea indexului + $400 apelurile agentice + $200 căutările subiacente. În total $850 / lună.
Acestea sunt costurile înainte de apelarea modelului care generează răspunsul final, taxat separat. (Sursa: Amazon Web Services)
Bedrock Guardrails (filtrele de siguranță AI în AWS) folosesc la rândul lor unități distincte de cost, printre care text units, image processing, input vs output metering. De exemplu, filtrele de conținut text sunt taxate cu $0,15 la 1.000 de text units, iar contextual grounding checks cu $0,10 / text unit. (Sursa: Amazon Web Services)
Azure: exemplu de zeci de variabile de cost pentru un singur serviciu
Foundry IQ este evoluția Azure AI Search, care construiește o bază de cunoaștere administrată pentru toată compania în vederea folosirii AI agentic. Așadar, agregă o paletă largă de tehnologii AI-related, ceea ce rezultă în pricing foarte detaliat, până a ajunge la costul LLM. Planurile dedicate sunt facturate printre altele pe oră, în funcție de Search Units, replici și partiții și folosirea unor facilități speciale ca Semantic Ranker, agentic retrieval sau accesare de surse externe.
Azure va oferi și modele Serverless adică usage-based (bazate strict pe consum) cu facilitatea de economisire scale-to-zero (când nu este folosit se închide), dar, ca și în alte clouduri, prețurile efective depind de regiune, nivel și acordul comercial. (Sursa: Microsoft Azure)
Am enumerat 12 variabile de cost în două paragrafe, motiv pentru care recomandăm configurarea serviciilor în calculatorul Azure sau al celorlalte cloud-uri.
Calculatoarele oficiale de cost
Investigați direct și paginile serviciilor AI dorite, deoarece unele add-on-uri sau modele noi nu sunt mereu în calculatoarele oficiale.
3. Produsele AI complexe nu sunt tarifate în tokeni
Inteligența artificială include și sistemele de recomandări, căutarea pentru e-commerce, forecasting-ul (prognoză temporală), computer vision, detectarea fraudei, OCR, care ocupă o bună parte din folosirile reale AI.
Dar AI predictiv folosește alte unități de facturare decât LLM-urile. Când folosești un serviciu OCR din cloud, vei plăti per pagină sau imagine, nu per tokeni ca atunci când transcrii cu LLM (cu riscul inerent al halucinațiilor pentru LLM).
Google AI Commerce Search
AI Commerce Search (fost Google Retail / Google Vertex AI Search for Commerce) oferă căutare și recomandări personalizate pentru magazine online și pentru aplicații B2B, cum am detaliat în Ghidul 1 AI în vânzări.
Google gestionează infrastructura, stocarea și algoritmii, fiind un motor de recomandări în care compania își urcă datele, iar experiența Google oferă facilități de top înapoi în aplicațiile proprii.
Costurile AI Commerce Search
Căutările și browsingul sunt taxate cu $2,50 la 1.000 de solicitări.
Pentru recomandări, primele 20 de milioane de predicții lunare costă $0,27 la 1.000, următoarele până la 300 de milioane $0,18, iar volumul de peste 300 de milioane $0,10.
Antrenarea și tuning-ul costă $2,50 per node-hour și nu există o taxă separată per token LLM. (Sursa: Google Cloud)
Exemplu Google pentru un retailer cu 10 milioane de predicții pe lună
| Componentă | Cost lunar |
|---|---|
| 10 milioane de predicții | $2.700 |
| 150 node-hours de training | $375 |
| 30 node-hours de tuning | $75 |
| Total | $3.150 |
Predicțiile reprezintă aproximativ 85,7% din cost, iar training-ul și tuning-ul 14,3%. (Sursa: Google Cloud)
Amazon Personalize
Pentru soluția concurentă Amazon Personalize v2, AWS taxează:
- $0,05 per GB de date ingerate;
- $0,002 la 1.000 de interacțiuni utilizate la training;
- $0,15 la 1.000 de cereri de recomandări.
Într-un exemplu oficial cu 200 GB de date, opt antrenări și aprox. 12,3 milioane solicitări lunare, costul este de $2.016,80. Din această sumă, aproximativ 91,6% reprezintă inferența, 7,9% training-ul și 0,5% ingestia datelor.
Se aplică însă și un prag de minim un request / secundă pentru campaniile real-time. Un serviciu cu trafic redus poate fi facturat pentru capacitatea minimă chiar dacă nu o folosește (Sursa: Amazon Web Services). Alte tipuri de recsys sunt tarifate per oră și în funcție de numărul de utilizatori.
Google Agent Search și căutarea enterprise
Acest produs care permite căutări și aplicații asistenți (ca chatbot) peste date arată cum se combină mai multe tehnologii într-o variantă administrată (managed):
| Funcționalitate | Preț |
|---|---|
| Standard Search | $1,50 / 1.000 query-uri |
| Enterprise Search cu răspunsuri generative simple | $4 / 1.000 |
| Răspunsuri generative avansate | $4 / 1.000 în plus |
| Stocarea indexului (în general) | $5 / GB / lună |
(Sursa: Google Cloud)
Așadar, chiar dacă costul LLM poate fi exact zero, un produs AI sofisticat are cost considerabil. Serviciile se plătesc în general la unități de utilizare, nu la tokeni, ceea ce dă previzibilitate dar crește complexitatea.
Unități de cost pentru diferite tipuri de AI
LLM / CHAT
tokeni input + tokeni output + cache + reasoning
RAG / SEARCH
query-uri + retrieval + index GB + reranking + grounding
RECOMANDĂRI
predicții + utilizatori + minimum TPS + training + tuning
DOCUMENT AI
pagini + imagini + caractere + extragere structurată
AGENTIC AI
toate cele de mai sus + tool calls + retries + guardrails + tracing / observabilitate
Concluzie: investiția și optimizarea merg în paralel
Am găsit studiul Gartner din mai 2026 care estimează că cheltuielile globale asociate AI vor ajunge la peste $2,5 trilioane în 2026, cu aproape +50% față de 2025. Din această sumă, categoria financiară „AI Models" este infimă, de doar $32,6 miliarde.
| Categoria | 2026 | % |
|---|---|---|
| AI Infrastructure | $1.431,5 miliarde | 55,1% |
| AI Services | $585,5 miliarde | 22,6% |
| AI Software | $453,2 miliarde | 17,5% |
| AI Models | $32,6 miliarde | 1,3% |
| Alte categorii (AI cyber, data) | $92,8 miliarde | 3,6% |
| Total | $2.595,7 miliarde | 100% |
Gartner măsoară de fapt investițiile furnizorilor în infrastructură și produse software în care AI este integrat, în timp ce AI Models reprezintă numai aproximativ 1,3% din piața AI extinsă. (Sursa: Gartner)
Synergy Research Group afirmă că în al doilea trimestru al 2026, piața cloud a crescut cu 43% anual, iar serviciile cloud dedicate GenAI cu 165%. Tehnologia îmbunătățește și accelerează servicii care nu au eticheta explicită de GenAI:
„AI technology has lit a fire under the cloud market and is now driving unprecedented growth." (Sursa: Synergy Research Group)
Așadar, pe lângă costul tehnologiilor AI propriu-zise, infrastructura necesară pentru adaptarea la ele (ex: Data Warehouse ca BigQuery) duce la costuri în creștere, care sunt investiții.
Pentru costurile de rulare efectivă, prețul a scăzut în 2026 pentru modele compacte și prin mecanisme de optimizare. Dar modelele SOTA și sistemele agentice au crescut plafonul de preț. Planificarea trebuie să plece de la tipul de aplicație dezvoltat:
- Chatbot simplu: LLM poate fi cheltuiala principală
- RAG: retrieval-ul, indexul și grounding-ul pot depăși modelul
- Sistem de recomandări: predicțiile și reantrenarea pot domina costul
- AI agentic: retry-urile, instrumentele (tool calls) și regulile sunt mare parte a cheltuielilor
Din acest motiv, arhitectura contează. După ce alegeți cloud-ul (Google Cloud, AWS sau Azure), trebuie să decideți pentru orice aplicație AI ce fluxuri are, ce modele folosește pentru ce sarcini și ce alte optimizări de cost se pot face.
Aveți un proiect AI? OPTI poate construi un model de cost optim pentru performanța dorită.