English

Costurile AI în prima jumătate din 2026: Google Cloud, AWS și Azure. Nu doar LLM-uri!

Costurile AI în prima jumătate din 2026: Google Cloud, AWS și Azure. Nu doar LLM-uri!
07.08.2026

Cât costă de fapt o aplicație AI?

Este simplu să compari 1M tokeni Gemini, Claude sau ChatGPT, dar mult mai greu să estimezi costul unei aplicații AI folosite în producție. AI în producție poate însemna printre altele:

  • LLM (AI generativ)
  • Grounding, alte instrumente externe, guardrails și observabilitate
  • Căutare semantică, indecși vectoriali, feature stores
  • Document parsing, reranking
  • Găzduire, ingestie și interogare date

În prima jumătate a anului 2026, costul unor modele LLM a continuat să fie redus, cu tehnici noi de optimizare cost. În același timp, modelele de frontieră (SOTA) și aplicațiile agentice au dus la costuri totale mai mari pentru aplicațiile care le folosesc. Costul per token poate scădea deși investiția totală crește.


Costul relevant pentru business este costul aplicației funcționale cu toate serviciile și resursele. În 2026, concurenții folosind AI, vechile aplicații sunt upgradate continuu, rezultând un cost total crescut și în cheltuieli masive de capital. Cum spune Gartner:

„The improved predictability of ROI must occur before AI can truly be scaled up by the enterprise." (Sursa: Gartner)


Notă: Prețurile din articol sunt verificate în 7 august 2026. Articolul va fi actualizat periodic în viitor.


1. Prețurile LLM au variat în ambele direcții

Se spune „modelele AI se ieftinesc", acest lucru fiind adevărat pentru modelele rapide și compacte. Dar în paralel, modelele premium și execuția agentică au dus la costuri mari în 2026.

În primul semestru din 2026 s-au întâmplat simultan trei lucruri:

  • pragul minim pentru procesarea textului a rămas redus
  • performanța disponibilă la nivelurile intermediare a crescut
  • modelele SOTA și reasoning-ul avansat au ridicat plafonul de cost

Costuri pentru 1M tokeni

Tabelul de mai jos estimează costul unei solicitări (sau mai multor solicitări, în funcție de furnizor) de 1 milion de tokeni de intrare și 200.000 de tokeni de ieșire, utilizând tarife standard, fără caching sau batching și fără suprataxă de long context.

Capabilitățile între modele nu sunt echivalente, tocmai de aceea este de remarcat intervalul mare de cost pentru același volum.

Cloud și model Input / 1M Output / 1M Cost 1M input, 200k output
Google Gemini 2.5 Flash-Lite $0,10 $0,40 $0,18
Google Gemini 2.5 Flash $0,30 $2,50 $0,80
Google Gemini 2.5 Pro $1,25 $10,00 $3,25
AWS Bedrock: Claude Haiku 4.5 $1,00 $5,00 $2,00
AWS Bedrock: Claude Sonnet 4.5 $3,00 $15,00 $6,00
Azure: GPT-5.2 Global $1,75 $14,00 $4,55
Azure: GPT-5.5 Global $5,00 $30,00 $11,00
Azure: GPT-5.5 Pro $30,00 $180,00 $66,00

În Google Cloud, prețurile Gemini 2.5 variază între $0,10/$0,40 pentru Flash-Lite și $1,25/$10 pentru Pro. Flex și Batch pot reduce tarifele standard aproximativ la 50%, iar inputul din cache este taxat mult mai puțin decât cel procesat integral. (Sursa: Google Cloud)

AWS chiar estimează că inputul din cache poate costa cu până la 90% mai puțin, iar trecerea sarcinilor simple de la Sonnet la Haiku poate reduce cu aproximativ două treimi costul. Batch inference este disponibil pentru unele modele la 50% din prețul on-demand, iar Intelligent Prompt Routing este taxat cu $1 la 1.000 de solicitări și poate reduce costul modelului cu până la 30% în AWS pentru combinațiile suportate. (Sursa: Amazon Web Services)


Prețuri, optimizare și SOTA

Google a lansat în luna mai Gemini 3.1 Flash-Lite și Gemini 3.5 Flash. Ultimul este poziționat ca model cu inteligență apropiată de nivelul Pro, dar la cost și viteză de tip Flash. Prețul standard publicat pentru Gemini 3.5 Flash este de $1,50 pentru input și $9 pentru output, per milion de tokeni. (Sursa: Google Cloud Documentation)

AWS a pus mai mult accent vizibil pe optimizarea utilizării LLM. În ianuarie, Bedrock a extins prompt caching de la cinci minute la o oră pentru anumite modele Claude, ceea ce permite reutilizarea contextului în conversații și workflow-uri agentice mai lungi. (Sursa: Amazon Web Services)

Azure exemplifică de ce evoluția prețurilor nu înseamnă neapărat ieftinire. GPT-5.2 avea un preț global de $1,75 pentru input și $14 pentru output. Dar GPT-5.5 a urcat la $5 și $30, iar varianta Pro la $30 și $180. Nivelurile suplimentare cumpără capabilități SOTA. (Sursa: Microsoft Azure)



Calitate de execuție versus costul sarcinii

Din aceste motive, în 2026, a devenit populară clasificarea solicitărilor și utilizarea modelului premium (SOTA) numai când rezultatul superior justifică costul (routing).

De ce routing? Modelul cu cel mai mic preț / token nu duce mereu la cost optim
MODEL IEFTIN
   │
   ├── răspuns corect zero-shot ──────────────────> cost redus
   │
   └── răspuns incorect
        │
        ├── retry
        ├── schimbare model
        ├── intervenție inginer
        └── refacere sarcină ─────────────────────> cost total mare

MODEL SOTA
   │
   ├── solicitare simplă ─────────────────────────> cost nejustificat
   │
   └── solicitare complexă rezolvată corect ──> cost justificat

2. Costurile fluxurilor AI pe lângă tokeni

Costul modelului lingvistic (LLM) se calculează în linii mari astfel:


Cost LLM =

tokeni input fără cache x tarif input

+ tokeni cached x tarif cache

+ tokeni output facturabili x tarif output

+ reasoning tokens


Costul aplicației AI este însă:


Cost aplicație AI =

Cost LLM

+ căutare și retrieval

+ index și stocare

+ grounding

+ tool calls

+ guardrails

+ observabilitate și loguri

+ retries și erori

+ infrastructura aplicației


Chiar mai important, retry-urile sunt una dintre cele mai neglijate surse de cost, în special în AI agentic. Costul aplicației AI trebuie să identifice nivelurile la care un flux AI poate să dea greș și să fie reluat obligatoriu. În aplicațiile agentice apărute, retry poate însemna zeci sau sute de pași taxabili repetați.


Costul unei aplicații AI care funcționează corect se calculează pe livrabil:

  • cost / răspuns acceptat
  • cost / comandă procesată
  • cost / document validat
  • cost / recomandare aprobată
  • cost / incident rezolvat


Google Cloud: grounding-ul poate costa mai mult ca modelul

Să presupunem că o solicitare Gemini 2.5 Flash utilizează 2.000 de tokeni de intrare și produce 500 de tokeni de ieșire.


Costul LLM este aproximativ:

2.000 / 1.000.000 x $0,30
+
500 / 1.000.000 x $2,50
=
$0,00185


Dacă dorești să folosești grounding (căutare pe Google pentru informații actuale care cresc substanțial calitatea răspunsului), nu mai poți calcula doar prețul tokenilor.

După depășirea cotei gratuite disponibile, grounding-ul pentru Gemini 2.5 costă $35 la 1.000 de grounded prompts, adică aproximativ $0,035 unul singur. Deci serviciul de grounding va costa de aproape 19 ori mai mult decât procesarea tokenilor. Iar pentru modelele Gemini 3, Google taxează grounding cu $14 la 1.000 de query-uri după primele 5.000 pe lună. Și, în acest caz, o singură solicitare a utilizatorului poate implica mai multe căutări facturabile. (Sursa: Google Cloud)


AWS: RAG poate costa cel mai mult înainte de model

AWS a publicat un exemplu pentru o bază de cunoaștere de 50 GB și 100.000 de căutări lunare.

  • Cu standard retrieval, costul este de $250 pentru stocarea indexului și $100 pentru căutări, în total $350 / lună.
  • Cu agentic retrieval și o medie de două căutări interne pentru fiecare apel, același volum ajunge la: $250 stocarea indexului + $400 apelurile agentice + $200 căutările subiacente. În total $850 / lună.

Acestea sunt costurile înainte de apelarea modelului care generează răspunsul final, taxat separat. (Sursa: Amazon Web Services)

Bedrock Guardrails (filtrele de siguranță AI în AWS) folosesc la rândul lor unități distincte de cost, printre care text units, image processing, input vs output metering. De exemplu, filtrele de conținut text sunt taxate cu $0,15 la 1.000 de text units, iar contextual grounding checks cu $0,10 / text unit. (Sursa: Amazon Web Services)


Azure: exemplu de zeci de variabile de cost pentru un singur serviciu

Foundry IQ este evoluția Azure AI Search, care construiește o bază de cunoaștere administrată pentru toată compania în vederea folosirii AI agentic. Așadar, agregă o paletă largă de tehnologii AI-related, ceea ce rezultă în pricing foarte detaliat, până a ajunge la costul LLM. Planurile dedicate sunt facturate printre altele pe oră, în funcție de Search Units, replici și partiții și folosirea unor facilități speciale ca Semantic Ranker, agentic retrieval sau accesare de surse externe.

Azure va oferi și modele Serverless adică usage-based (bazate strict pe consum) cu facilitatea de economisire scale-to-zero (când nu este folosit se închide), dar, ca și în alte clouduri, prețurile efective depind de regiune, nivel și acordul comercial. (Sursa: Microsoft Azure)

Am enumerat 12 variabile de cost în două paragrafe, motiv pentru care recomandăm configurarea serviciilor în calculatorul Azure sau al celorlalte cloud-uri.


Calculatoarele oficiale de cost

Investigați direct și paginile serviciilor AI dorite, deoarece unele add-on-uri sau modele noi nu sunt mereu în calculatoarele oficiale.



3. Produsele AI complexe nu sunt tarifate în tokeni

Inteligența artificială include și sistemele de recomandări, căutarea pentru e-commerce, forecasting-ul (prognoză temporală), computer vision, detectarea fraudei, OCR, care ocupă o bună parte din folosirile reale AI.

Dar AI predictiv folosește alte unități de facturare decât LLM-urile. Când folosești un serviciu OCR din cloud, vei plăti per pagină sau imagine, nu per tokeni ca atunci când transcrii cu LLM (cu riscul inerent al halucinațiilor pentru LLM).


Google AI Commerce Search

AI Commerce Search (fost Google Retail / Google Vertex AI Search for Commerce) oferă căutare și recomandări personalizate pentru magazine online și pentru aplicații B2B, cum am detaliat în Ghidul 1 AI în vânzări.

Google gestionează infrastructura, stocarea și algoritmii, fiind un motor de recomandări în care compania își urcă datele, iar experiența Google oferă facilități de top înapoi în aplicațiile proprii.


Costurile AI Commerce Search

Căutările și browsingul sunt taxate cu $2,50 la 1.000 de solicitări.

Pentru recomandări, primele 20 de milioane de predicții lunare costă $0,27 la 1.000, următoarele până la 300 de milioane $0,18, iar volumul de peste 300 de milioane $0,10.

Antrenarea și tuning-ul costă $2,50 per node-hour și nu există o taxă separată per token LLM. (Sursa: Google Cloud)



Exemplu Google pentru un retailer cu 10 milioane de predicții pe lună

Componentă Cost lunar
10 milioane de predicții $2.700
150 node-hours de training $375
30 node-hours de tuning $75
Total $3.150

Predicțiile reprezintă aproximativ 85,7% din cost, iar training-ul și tuning-ul 14,3%. (Sursa: Google Cloud)


Amazon Personalize

Pentru soluția concurentă Amazon Personalize v2, AWS taxează:

  • $0,05 per GB de date ingerate;
  • $0,002 la 1.000 de interacțiuni utilizate la training;
  • $0,15 la 1.000 de cereri de recomandări.

Într-un exemplu oficial cu 200 GB de date, opt antrenări și aprox. 12,3 milioane solicitări lunare, costul este de $2.016,80. Din această sumă, aproximativ 91,6% reprezintă inferența, 7,9% training-ul și 0,5% ingestia datelor.

Se aplică însă și un prag de minim un request / secundă pentru campaniile real-time. Un serviciu cu trafic redus poate fi facturat pentru capacitatea minimă chiar dacă nu o folosește (Sursa: Amazon Web Services). Alte tipuri de recsys sunt tarifate per oră și în funcție de numărul de utilizatori.


Google Agent Search și căutarea enterprise

Acest produs care permite căutări și aplicații asistenți (ca chatbot) peste date arată cum se combină mai multe tehnologii într-o variantă administrată (managed):

Funcționalitate Preț
Standard Search $1,50 / 1.000 query-uri
Enterprise Search cu răspunsuri generative simple $4 / 1.000
Răspunsuri generative avansate $4 / 1.000 în plus
Stocarea indexului (în general) $5 / GB / lună

(Sursa: Google Cloud)

Așadar, chiar dacă costul LLM poate fi exact zero, un produs AI sofisticat are cost considerabil. Serviciile se plătesc în general la unități de utilizare, nu la tokeni, ceea ce dă previzibilitate dar crește complexitatea.


Unități de cost pentru diferite tipuri de AI

LLM / CHAT

tokeni input + tokeni output + cache + reasoning

RAG / SEARCH

query-uri + retrieval + index GB + reranking + grounding

RECOMANDĂRI

predicții + utilizatori + minimum TPS + training + tuning

DOCUMENT AI

pagini + imagini + caractere + extragere structurată

AGENTIC AI

toate cele de mai sus + tool calls + retries + guardrails + tracing / observabilitate



Concluzie: investiția și optimizarea merg în paralel

Am găsit studiul Gartner din mai 2026 care estimează că cheltuielile globale asociate AI vor ajunge la peste $2,5 trilioane în 2026, cu aproape +50% față de 2025. Din această sumă, categoria financiară „AI Models" este infimă, de doar $32,6 miliarde.

Categoria 2026 %
AI Infrastructure $1.431,5 miliarde 55,1%
AI Services $585,5 miliarde 22,6%
AI Software $453,2 miliarde 17,5%
AI Models $32,6 miliarde 1,3%
Alte categorii (AI cyber, data) $92,8 miliarde 3,6%
Total $2.595,7 miliarde 100%

Gartner măsoară de fapt investițiile furnizorilor în infrastructură și produse software în care AI este integrat, în timp ce AI Models reprezintă numai aproximativ 1,3% din piața AI extinsă. (Sursa: Gartner)


Synergy Research Group afirmă că în al doilea trimestru al 2026, piața cloud a crescut cu 43% anual, iar serviciile cloud dedicate GenAI cu 165%. Tehnologia îmbunătățește și accelerează servicii care nu au eticheta explicită de GenAI:

„AI technology has lit a fire under the cloud market and is now driving unprecedented growth." (Sursa: Synergy Research Group)


Așadar, pe lângă costul tehnologiilor AI propriu-zise, infrastructura necesară pentru adaptarea la ele (ex: Data Warehouse ca BigQuery) duce la costuri în creștere, care sunt investiții.

Pentru costurile de rulare efectivă, prețul a scăzut în 2026 pentru modele compacte și prin mecanisme de optimizare. Dar modelele SOTA și sistemele agentice au crescut plafonul de preț. Planificarea trebuie să plece de la tipul de aplicație dezvoltat:

  • Chatbot simplu: LLM poate fi cheltuiala principală
  • RAG: retrieval-ul, indexul și grounding-ul pot depăși modelul
  • Sistem de recomandări: predicțiile și reantrenarea pot domina costul
  • AI agentic: retry-urile, instrumentele (tool calls) și regulile sunt mare parte a cheltuielilor

Din acest motiv, arhitectura contează. După ce alegeți cloud-ul (Google Cloud, AWS sau Azure), trebuie să decideți pentru orice aplicație AI ce fluxuri are, ce modele folosește pentru ce sarcini și ce alte optimizări de cost se pot face.

Aveți un proiect AI? OPTI poate construi un model de cost optim pentru performanța dorită.


Întrebări rapide

De ce a scăzut prețul per token, dar cresc costurile totale AI?

Pentru că modelele compacte s-au ieftinit, dar modelele SOTA, reasoning-ul avansat și aplicațiile agentice cu retry-uri repetate au ridicat plafonul de cost, iar volumul de utilizare a crescut mult mai rapid decât a scăzut prețul per token.

Cum se calculează costul real al unei aplicații AI?

Costul LLM (tokeni input, cache, output, reasoning) este doar o parte. Se adaugă căutare și retrieval, index și stocare, grounding, tool calls, guardrails, observabilitate și, mai ales, costul retry-urilor și erorilor.

Ce este grounding-ul și de ce poate costa mai mult decât modelul?

Grounding-ul este căutarea pe internet sau surse externe pentru informații actuale, folosită pentru a crește calitatea răspunsului AI. La Google Cloud, grounding-ul pentru Gemini 2.5 poate costa de aproape 19 ori mai mult decât procesarea tokenilor pentru aceeași solicitare.

Ce este agentic retrieval și de ce e mai scump decât retrieval-ul standard?

Agentic retrieval presupune mai multe căutări interne pentru fiecare apel al agentului AI. Într-un exemplu AWS, agentic retrieval a crescut costul lunar de la $350 la $850 pentru aceeași bază de cunoaștere de 50 GB.

Toate produsele AI sunt tarifate per token?

Nu. Sistemele de recomandări, căutarea pentru e-commerce, OCR și alte forme de AI predictiv sunt tarifate în alte unități: predicții, pagini, imagini, node-hours de training sau GB de date ingerate, nu în tokeni.

Ce este routing-ul între modele și de ce este important pentru costuri?

Routing-ul înseamnă clasificarea solicitărilor și folosirea unui model premium (SOTA) doar când rezultatul superior justifică costul, evitând atât cheltuiala inutilă pe sarcini simple, cât și costul retry-urilor repetate pe modele ieftine care greșesc sarcini complexe.

Cum aleg între Google Cloud, AWS și Azure pentru un proiect AI?

Alegerea depinde de tipul aplicației: costul principal poate fi LLM-ul pentru un chatbot simplu, retrieval-ul și grounding-ul pentru RAG, sau predicțiile și reantrenarea pentru un sistem de recomandări. Fiecare cloud are calculatoare oficiale de preț pentru a estima costul exact al arhitecturii alese.

Care sunt tehnologiile și metodologiile implicate?

Tehnologii: Google Cloud, Gemini, AWS Bedrock, Claude, Azure OpenAI, GPT-5.2, GPT-5.5, AI Commerce Search, Amazon Personalize, Google Agent Search, Foundry IQ, Azure AI Search, BigQuery
Metodologii: Routing între modele ieftine și SOTA, Prompt caching, Batch inference, Intelligent Prompt Routing, Grounding cu căutare, RAG cu retrieval standard și agentic, Guardrails AI

Nicolae Amarghioalei

Articol scris de

Nicolae Amarghioalei

Customer Success Manager. Specialist în cloud și onboarding.

Vezi profil LinkedIn →
Interesat?

Ești interesat?

programează o întâlnire

Cere consultanță gratuită

Noutăți și ghiduri

Mai multe noutăți