vreme čitanja : 22 minutes

Često mi se pita koliko košta moja potrošnja AI. Odgovaram « 20 evra po mjesecu » i gledaju mi na oči kao da sam lud. Zatim danas otvaram crnu kutiju. Ovaj članak je kompletan audit mojih 73 dana vibe kodiranja: metodologija za izvadanje podataka iz SQLite baze OpenCode, SQL kod za upitivanje tabela i sveobuhvatna poređenja sa svim dobavljačima na tržišti — zapadnim kao i kineskim. Rezultat je tako asimetričan što sam morao da proveram svoje račune tri puta.

uckucaj

[]

Разумевање стека : Ко шта ради ?

Pre nego što se uručimo u brojeve, objasnimo arhitekturu. Postoje tri različita aktora u mom setup-u, i važno je da ih ne pomiješamo:

@startuml
skinparam backgroundColor #FEFEFE
skinparam defaultFontSize 12

title Tri aktera moje LLM steka
left to right direction

actor "Ja (razvijalac)" as Dev

package "OpenCode
(github.com/anomalyco/opencode)" as OC {
  rectangle "CLI od vibe kodiranja
Otvoreni kod, besplatno" as CLI
  note right of CLI
    C'est l'outil que j'utilise
    pour coder avec des agents IA.
    Il ne fournit AUCUN modèle.
    C'est un terminal + un orchestrateur.
  end note
}

package "Ollama (Lokalna instalacija)" as OL {
  rectangle "Klijent inferencije
Instalirano na moj računar" as Client
  note right of Client
    C'est le logiciel qui fait tourner
    les modèles. Il peut les exécuter
    en local OU les déléguer au cloud
    selon le tag (:cloud).
    Il s'authentifie via clé SSH.
  end note
}

package "Ollama Cloud
(ollama.com)" as OCloud {
  rectangle "Usluga oblačne inferencije
Pro pretplata: 20€/mesec" as Cloud
  note right of Cloud
    C'est le fournisseur d'inférence.
    Mes modèles avec le tag :cloud
    sont exécutés sur LEURS serveurs.
    L'abonnement Pro donne accès
    à des quotas supérieurs.
  end note
}

Dev --> CLI : "Ја укацујем промптс"
CLI --> Client : "Zovi ovaj model"
Client --> Cloud : "SSH ključ + zahtev
(modeli :cloud)"
Client --> Client : "Локално извршавање
(модели без :cloud)"

@enduml

OpenCode NIJE davač modelaOvo je CLI otvorenog izvora (github.com/anomalyco/opencode) koji orkestruje AI-agente. Ne prodaje pretplatu, ne pruža inferenciju. To je ekvivalent`git`за верзионирање : алат, а не услуга. Ollama Cloud je pružač inferencije.Moja lokalna instalacija Ollama radi kao klijent — authentifikuje se kod servera Ollama kroz jedinstvenu SSH ključ (Device Key) i deleguje im izvršavanje označenih modela`:cloud`. Pro abonman (20€/mesec) otključava veće kvote i omogućava kombinovanje više naloga na istoj mašini koristeći Docker.

Uvod: Zašto audit?

Prije dva meseca, koristio sam modele besplatno na svojoj lokalnoj instalaciji Ollama. Zatim sam preuzeo prvu pretplatu Ollama Cloud Pro po 20 evra mjesečno, koji mi omogućava da koristim cloud modele (oni sa tagom`:cloud`) kroz pružač`ollama-cloud`. Drugi abonnement je počeo mesec kasnije, na odvojenoj Docker instanci sa svojim nalogom i svojim SSH ključem — metoda kumulacije opisana u moj članak o kumulaciji abonamenta

Питање које ме мучало : Да ли су ови 20€ месечно оправдани? Не на очу. Са подацима.

Da bih odgovorio, mi je bilo potrebno tačnih podataka. Ne procene. Ne proseci. Moja potrošnja realna, token po token, model po model, sesija po sesiji.

I OpenCode — CLI — sve to čuva u SQLite bazi.

OpenCode baza podataka: zlatni rudnik

OpenCode persistuje kompletan istoriju svojih sesija u SQLite fajlu koji se nalazi u`~/.local/share/opencode/opencode.db`. La mienne pèse 660 Mo pour 73 jours d’utilisation — une base de données de production tout à fait respectable.

$ ls -lh ~/.local/share/opencode/opencode.db
-rw-r--r-- 1 cheroliv cheroliv 660M mai 18 12:25 opencode.db

Šema

Baza sadrži oko dvadeset tabela, ali tri od njih su ključne za naš audit:

@startuml
skinparam backgroundColor #FEFEFE
skinparam defaultFontSize 12

title Опрошћена шема — OpenCode SQLite
entity "сесија" as S {
  * id : TEXT
  --
  * model : TEXT (JSON)
  * cost : REAL
  * tokens_input : INTEGER
  * tokens_output : INTEGER
  * tokens_reasoning : INTEGER
  * tokens_cache_read : INTEGER
  * tokens_cache_write : INTEGER
  * time_created : INTEGER
  * project_id : TEXT
}

entity "poruka" as M {
  * id : TEXT
  --
  * session_id : TEXT <<FK>>
  * data : TEXT (JSON)
  * time_created : INTEGER
}

entity "projekat" as P {
  * id : TEXT
  --
  * worktree : TEXT
  * name : TEXT
}

S ||--o{ M : "id_sesije"
S }o--|| P : "id_projekta"

note right of S
  La table session agrège
  tokens + coût + modèle.
  C'est notre point d'entrée
  principal.
end note

note right of M
  Les messages individuels.
  Le champ data contient
  le modèle utilisé (format JSON)
  même si la session change
  de modèle en cours de route.
end note

@enduml

Сто`session`savršena je za globalni audit : svaka sesija ima svoj agregirani broj token, korišćen model i trošak. Polje`model`је сировић JSON :

{
  "id": "deepseek-v4-pro:cloud",
  "providerID": "ollama-cloud",
  "variant": "default"
}

Polje`cost`U OpenCode bazi se odražavaju samo vanjski API troškovi plaćeni po potrošnji putem API ključa (Google Gemini, OpenAI, itd.). Pozivi kroz Ollama — bilo lokalno ili kroz Ollama Cloud Pro — su označeni.`cost=0`Jer je trošak fiksni (pretplata), a ne po tokenu. Stvarni trošak ovih poziva je mesečna pretplata.

Kod ekstrakcije

Није потребно инсталирати ништа. Node.js 22+ sadrži eksperimentalni SQLite modul (node:sqlite) koji savršeno funkcioniše. Ovde je skript koji mi je sve dao :

const { DatabaseSync } = require('node:sqlite');
const db = new DatabaseSync(
  `${process.env.HOME}/.local/share/opencode/opencode.db`,
  { readonly: true }
);

// 1. Statistiques globales
const global = db.prepare(`
  SELECT
    COUNT(*) as sessions,
    SUM(tokens_input) as total_input,
    SUM(tokens_output) as total_output,
    SUM(tokens_reasoning) as total_reasoning,
    SUM(tokens_cache_read) as total_cache_read,
    SUM(cost) as total_cost
  FROM session
`).get();

// 2. Ventilation par modèle et fournisseur
const byModel = db.prepare(`
  SELECT
    json_extract(model, '$.id') as model_id,
    json_extract(model, '$.providerID') as provider,
    COUNT(*) as sessions,
    SUM(tokens_input) as total_input,
    SUM(tokens_output) as total_output,
    SUM(cost) as total_cost
  FROM session
  WHERE model IS NOT NULL
  GROUP BY model_id, provider
  ORDER BY SUM(tokens_input) DESC
`).all();

// 3. Par mois
const monthly = db.prepare(`
  SELECT
    strftime('%Y-%m', datetime(time_created/1000, 'unixepoch')) as month,
    COUNT(*) as sessions,
    SUM(tokens_input) as total_input,
    SUM(tokens_output) as total_output,
    SUM(cost) as total_cost
  FROM session
  WHERE time_created IS NOT NULL
  GROUP BY month
  ORDER BY month
`).all();

// 4. Messages par modèle (détection des changements intra-session)
const msgByModel = db.prepare(`
  SELECT
    json_extract(m.data, '$.model.providerID') as provider,
    json_extract(m.data, '$.model.modelID') as model_id,
    COUNT(*) as messages
  FROM message m
  WHERE json_extract(m.data, '$.model') IS NOT NULL
  GROUP BY provider, model_id
  ORDER BY COUNT(*) DESC
`).all();

console.log({ global, byModel, monthly, msgByModel });
db.close();

Застава`--experimental-sqlite`је потребан на Node.js 22.x. Na Node.js 24+, modul je stabilan i više ne zahteva flag.

Резултати : 73 дана потрошње

Globalni pregled

Метрика Vrednost Контекст

Sesije OpenCode

1 022

~14 sesija/dan u proseku

Ulažni Tokeni

2,62 милијарде

Od kojih 94,5M u keš pogodak

Tokens Output

21 miliona

(Empty)

Tokens Reasoning

141 000

Zanemarivo — gotovo nema razmišljanja

Trošak vanjskog API

$0,22

naknade izvan abonmana (Gemini + besplatni nivoji)

Ovaj iznos od \$0,22 je ključan: On predstavlja sve što sam plaćao en plus uz moje pretplate Ollama Cloud Pro. To jest, praktično ništa. Pretplata pokriva najvažnije.

@startuml
skinparam backgroundColor #FEFEFE
skinparam defaultFontSize 12

title Mesečna evolucija — Ulazni tokeni
rectangle "Mart 2026
9 sesija
37,7M tokena" as MARS #FFE082
rectangle "April 2026
486 sesija
1,33 mld tokena" as AVR #81C784
rectangle "Maj 2026
527 sesija
1,25 mld tokena" as MAI #64B5F6

MARS -right-> AVR : ×35
AVR -right-> MAI : stable (période en cours)

note bottom of MAI
  Mai comptabilisé jusqu'au 18.
  Projection mois complet : ~2,1 Md tokens
  si la tendance se maintient.
end note
@enduml

Ovo je prelazak od « test » korišćenja ka « production » korišćenju — kada sam počeo da neprestano pokrećem OpenCode agente za swoje Gradle plugins.

ventilacija po model i dobavljač

Polje`model`od stola`session`smanje JSON,`json_extract()`omogućava čisto ventiliranje :

Model × pružač Sesije Suvrati sve backtick kod spanove (…​) tačno po originalu — nikada ne menjati sadržaj backtick-a, razmak ili poziciju. Output Trošak

deepseek-v4-pro @ ollama-cloud

63

220 M

1,94 M

\$0

deepseek-v4-pro @ ollama-b

124

463 M

4,15 M

\$0

deepseek-v4-pro @ ollama

100

252 M

2,25 M

\$0

deepseek-v4-flash-free @ opencode

16

1,3 M

279 K

\$0

qwen3.6-plus-free @ opencode

1

369 K

25 K

\$0

gemini-2.5-flash @ google

1

211 K

19 K

\$0,04

Tri različiti provajderi za točno isti model DeepSeek V4 Pro: * ollama-cloud→ plaćeni Pro abonament (oblak koji upravlja Ollama) * ollama-b→ drugi Pro abonman, izolovan u posebnnom Docker kontejneru * ollama→ instanca lokalnog jezika, besplatna (se pokreće direktno na moj računar) Suma od trije daje 936M ulaz, 8,4M izlaz — to je moja ukupna potrošnja DeepSeek V4 Pro, svi provajderi uključen. Samo`ollama-cloud`(220M input) košta pretplatu. Preostalih 716M je besplatno (lokalno ili kumulacija pretplata).

Modeli unutar sesije : Šta tabela sesije ne vidi

сто`session`Ne zabeležuje samo glavni model sesije. Ali tokom iste sesije, agent OpenCode može prebacivati između više modela. Tabela`message`otkriva :

Modèles utilisés dans les messages (ollama-cloud provider) :
├─ deepseek-v4-pro      1 441 msgs  (32%)
├─ qwen3.5:397b         1 217 msgs  (27%)
├─ glm-5.1                712 msgs  (16%)
├─ kimi-k2.6:cloud        634 msgs  (14%)
├─ qwen3-coder:480b       414 msgs   (9%)
├─ gpt-oss:20b             34 msgs  (0,8%)
├─ qwen3-coder-next        27 msgs  (0,6%)
└─ gemma4:31b               7 msgs  (0,2%)

Više ne koristim Qwen, GLM, Kimi ni druge modele. Pojavljuju se u istoriji jer sam testirao mnogo stvari u april. Od polovine maja, zaključan sam na DeepSeek V4 Pro — to je jedini koji drži opterećenje na dugoročnom kontekstu sa agenskom upravljanjem (cf. moja poređenja Kimi/GLM/DeepSeek). 32% poruka DeepSeek u istoriji je zavedeško: danas je 100%.

Тарифна Успоредба — Запaдни Провајдери

Питање која узарађује: колико би ишта потрошња код традиционалних добavljaча костила?

Moj izračun za poređenje :220M tokena ulaz + 1,9M tokena izlaz— samo volumen prošao kroz`ollama-cloud`(jedini koji odgovara mojoj plaćenoj pretplati). Preostalih 716M je besplatno (Ollama lokalno i instanca Docker B).

dostavljač Model $/M Output \$/M Кошта/месец × moja pretplata

Moj setup

DeepSeek V4 Pro

0

0

\~20€

1×

antropički — Claude

Model $/M Izlaz $/M Cena/mesec × moja pretplata

Opus 4.7

\$5

\$25

\$1 148

57×

Sonet 4.6

\$3

\$15

\$689

34×

Haiku 4.5

\$1

\$5

\$230

11×

Čak i Haiku 4.5, najekonomiji model Claude-a, košta 11× moju pretplatu. I on ne zna ništa o mom kodbazi, ne generiše u mom stilu, i halucinira na Gradle Kotlin DSL API-jeve.

OpenAI — GPT

Модел \$/M Излаз \$/M Цена/месец × moja pretplata

GPT 5.5

\$5

\$30

\$1 157

58×

GPT 5.4

\$2,50

\$15

\$579

29×

GPT 5.4 Mini

\$0,75

\$4,50

\$174

9×

Google — Gemini

Model $/M Изалаз \$/M Cena/mesec × moja pretplata

Gemini 3.1 Pro

\$2,00

\$10

\$459

23×

Gemini 3 Flash

\$0,30

\$1,50

\$69

3,5×

Gemini 3 Flash po 69€ je jedini konkurent « blizu » po čistoj ceni — ali je to lagani gust model, nije MoE 1.6T kao DeepSeek V4 Pro. Kvalitet generisanog koda nema veze.

HuggingFace Inference Providers

HuggingFace ne vrši inferenciju sam — on agregira providers treće strane (Novita, Together, DeepInfra, Cerebras, SambaNova, Fireworks, Groq…) putem jedinstvenog API-ja. Odabira se najjeftiniji ili najbrži provider. Evo tarifa koji su primeteni u maju 2026. za DeepSeek V4 Pro:

Провајдер HF $/M Izlaz $/M Trošak/mesec × моја преплата

Novita (najjeftiniji)

\$1,67

\$3,38

\$374

19×

DeepInfra

\$1,74

\$3,48

\$389

19×

Zajedno

\$2,10

\$4,40

$470

23×

вежињаци

nejavni tarif

—

—

—

Čak i najjeftiniji provider na HuggingFace-u (Novita) naplaćuje 19× cijenu moje pretplate. I nasuprot Ollama Cloud-u, HuggingFace naplaćuje uz to platforme trošak ako nemate PRO HF pretplatu (\$9/mois).

Groq

Groq nema ni jedan od modela koje koristim — njihov katalog se ograničava na GPT-OSS, Llamu i Qwen 32B. Ne može se porediti.

Usporedba tarifa — Kineski dobavljači

Pravi test je kineski tržište. Ako je DeepSeek kineski model, njegov nativni API bi trebao da bude jeftiniji, nije li?

DeepSeek API Direct (platform.deepseek.com)

Period \$/M $/M Цена/месец

Akcija -75% (do 31. maja)

\$0,435

\$0,87

$98

Pun tarif (od juna)

\$1,74

\$3,48

\$390

Čak i sa agresivnom akcijom DeepSeek (-75% produžena), izravni API košta5×скожije. При обычном тарифу,20×. И то је само DeepSeek — нема приступа другим моделима.

Kimi Moonshot (platform.kimi.com)

Kimi nudi samo svoje modele. Bez DeepSeek.

Alibaba Bailian (bailian.aliyun.com)

Jedini dobavljač koji zagreguje sve kineske modele — ali putem reprodaje sa maržom. Cene se dinamički učitaju u JavaScriptu, čime je skraćivanje nemoguće.

Сажетна табела — Сви пружаоци

Dobavljač Model \$/M Output \$/M Trošak/mesec × moja pretplata

Ollama Cloud Pro

DeepSeek V4 Pro

0

0

~20€

1×

Gemini 3 Flash

Gemini 3 Flash

\$0,30

\$1,50

\$69

3,5×

DeepSeek API (promo)

DeepSeek V4 Pro

\$0,44

\$0,87

\$98

5×

GPT 5.4 Mini

GPT 5.4 Mini

\$0,75

\$4,50

\$174

9×

Claude Haiku 4.5

Claude Haiku 4.5

\$1

\$5

\$230

11×

HuggingFace/Novita

DeepSeek V4 Pro

\$1,67

\$3,38

\$374

19×

DeepSeek API (normalno)

DeepSeek V4 Pro

\$1,74

\$3,48

\$390

20×

Zajedno AI

DeepSeek V4 Pro

\$2,10

\$4,40

\$470

23×

GPT 5.4

GPT 5.4

\$2,50

\$15

\$579

29×

Claude Sonnet 4.6

Claude Sonnet 4.6

\$3

\$15

\$689

34×

Claude Opus 4.7

Claude Opus 4.7

\$5

\$25

\$1 148

57×

GPT 5.5

GPT 5.5

\$5

\$30

\$1 157

58×

@startuml
skinparam backgroundColor #FEFEFE
skinparam defaultFontSize 11

title Prognozovani mesečni trošak — 220M Input + 1,9M Output
rectangle "Ollama Cloud Pro
~20 evra" as OC #4CAF50
rectangle "Gemini Flash
\$69" as GF #8BC34A
rectangle "DeepSeek promo
\$98" as DSP #FFC107
rectangle "GPT Mini
$174" as GM #FF9800
rectangle "Claude Haiku\n\$230" as CH #FF5722
rectangle "HF/Novita
\$374" as HF #F44336
rectangle "DeepSeek standardno
\$390" as DSN #F44336
rectangle "GPT 5.4
$579" as G4 #D32F2F
rectangle "Claude Sonnet
$689" as CS #D32F2F
rectangle "Claude Opus
\$1 148" as CO #B71C1C
rectangle "GPT 5.5
\$1 157" as G5 #880E4F

note bottom of OC
  DeepSeek V4 Pro 1.6T MoE
  + accès à tout le catalogue
  Ollama Cloud (Qwen, GLM, Kimi...)
  Inclus dans l'abonnement
end note
@enduml

Sakriveni trošak : Prompt Engineering i iteracije

Trošak tokena je samo jedan deo jednačine. Stvarni trošak je vreme programera.

Sa OpenCode + Ollama Cloud Pro + moj agent upravljanja (EAGER/LAZY/Hot/Warm/Cold, opisano u članak o upravljanju), dobijam :

  • 0 ponavljajuće inženjerstvo prompta: kontekst se automatski injektuje

  • 90%+ prvi pokusaj tačan: kod se kompajlira od prvog puta

  • Нула халциноци deepseek за 8 узастопних сесија(dokumentirano u uporedba Kimi/GLM/DeepSeek)

Sa Claudom ili GPT bez fine-tuninga ni upravljanja:

  • 2-3 iteracije po zadatku u proseku

  • Sistematsko prompt inženjerstvo

  • Halucinacije na API-je Kotlin/Gradle kada kontekst prelazi 30K tokena

Mesečni efikasan trošak — tokens × iteracije × vreme korekcije — iznosi 27× do 54× onog mojeg rešenja, kao što sam pokazao u l’article sur le ratio d’efficacité.

Кумулисање претплата Ollama Cloud Pro: Докер метод

Ako jedan abonman ne dostaća, kombinujemo ih. Princip je da se svaki abonman izoliere u sopstnoj instalaciji Ollama, sa sopstnim SSH ključem za autentifikaciju. Docker to čini trivijalnim.

Kompletna metoda je detaljno opisana u članak o kumuliranju Docker, evo principa :

@startuml
skinparam backgroundColor #FEFEFE
skinparam defaultFontSize 12

title Arhitektura — Dva abonmana Ollama Cloud Pro na jednoj mašini
left to right direction

node "Moja fizička mašina" {
  frame "Ollama instanca A (prirodni)
ulazni port :11434" as Native {
    database "Identitet A
/usr/share/ollama/.ollama/id_ed25519"
  }
  frame "Instanca Ollama B (Docker)
vrata :11435" as Docker {
    database "Identity B
~/ollama-b-data/id_ed25519"
  }
}

cloud "Ollama Cloud" {
  actor "Račun Pro A\n(e-mail 1)" as A
  actor "Račun Pro B\n(e‑mail 2)" as B
}

Native --> A : "Ključ uređaja A"
Docker --> B : "Ključ uređaja B"

note bottom of Docker
  Conteneur Docker isolé :
  - Clé SSH distincte
  - Port réseau distinct (11435)
  - Volume persistant (~/ollama-b-data)
  - restart: always
end note
@enduml

Шема је једноставана :

  1. Створити волуме`~/ollama-b-data`

  2. Pokreni Docker kontejner`ollama/ollama:0.20.2`мапиран на`11435:11434`

  3. Preuzeti SSH ključ iz kontejnera → ga sacuvati na ollama.com

  4. Правити`ollama signin`sa drugim e-mailom

  5. Konfigurisati OpenCode sa dva pružatelja (`ollama`на :11434,`ollama-b`на :11435

Dva računa, plava kartica, nula konflikata.

Šta Audit Ne Meri

слепи угао Утицај

Kvalitet proizvedenog koda

2,6 miliјарди tokena ne kažu da li kod kompajlira. Moje 8 sesija DeepSeek V4 Pro ima stopu prvog pokusa >90%.

ekosistem OpenCode

CLI je besplatan, ali njegova vrednost (agenti, sandboxes, istorija, keširanje prompta) je ogromna. Nije uključen u cenu pretplate — to je poseban alat.

gelekost troška

Trošenje 2 sata dnevno na ispravljanje halucinacija manjeg modela košta više od 20€ mesečno.

мир духа

Fiksna cena = bez iznenađenja. Sa cenom po tokenu, skok u aktivnosti može da nanese vešta štetu.

Navedene cene su one od maja 2026. Za šest meseci sve će biti sniženo. Ali strukturani odnos snaga — fiksna pretplata vs. naplaćivanje po korišćenju — ostatiće pogodan za pretplatu za velike potrošače.

Закључак: Пресуда бројева

Posle 73 dana, 1 022 sesije OpenCode, i 2,6 miljarde tokena :

metrički вердикт

Kumulativni vanjski trošak API

$0,22(skoro nula)

Cena pretplate Ollama Cloud Pro

~20€/mesec

Ekvivalent Claude Opus

$1 148/mesec— 57× skuplje

Ekvivalent GPT 5.5

$1 157/месец— 58× skuplje

Ekivalent HuggingFace/Novita

\$374/mesec— 19× scupije

direktni ekvivalent DeepSeek API

$390/mesec— 20 puta skuplji

Najjeftiniji ekvivalent (Gemini Flash)

\$69/mesec— 3,5× skuplji, niži model

Najbolja ponuda na tržištu

Ollama Cloud Pro po 20€/mesec— neporaziv

__ Za 20€ mesečno za pristup DeepSeek V4 Pro (1.6T parametara, MoE, CSA+HCA, 1M kontekst) putem Ollama Clouda, imam najbolji odnos cena/kvaliteta na svetskom tržištu. Čak i kineski dobavljači koji rade direktno su 5× do 20× skuplji. Čak i HuggingFace, sa svojom agregacijom low-cost provajdera, je 19× skuplji. Zapadni tržište (Claude, GPT) košta 50-60× više — to je druga planeta.

Ovaj odnos je toliko neujednačen da ne može da traje vekom. Iskoristite ga dok postoji. __

Onda da, moj mesečni iznos od 20 para, to je najbolji tehnički ulaganje u mom životu programera. I sad imate brojeve da to dokazujete.


Повезани чланци