Umetna inteligenca ni več "enkrat na mesec fantje napišejo objavo na blogu". Postaja arhitektura – klici k LLM, vektorske baze za semantično iskanje, vdelava cevovodov, agenti, ki delujejo v ozadju. To je vodnik, ki ga morate vedeti za gostovanje sodobnih aplikacij umetne inteligence v letu 2026.
Vrste aplikacij umetne inteligence in kaj vsaka od njih zahteva
1. Proxy/agent za klepet LLM API
Najenostavnejše – klepet na strani frontenda ali končna točka API-ja, ki posreduje poizvedbo modelu OpenAI/Anthropic/Mistral/local in vrne odgovor. Večina infrastrukture ostane na strani ponudnika LLM.
Potrebe gostovanja: običajni spletni sklad (PHP, Node, Python). Glavna stvar — dolgi odzivni časi (odziv LLM lahko traja 10–60 sekund), podpora pretakanju (dogodki, poslani s strežnika, ali WebSockets za odzive v skupinah).
2. RAG (generiranje z razširjenim iskanjem)
LLM, ki odgovarja na vprašanja iz vaše baze znanja – npr. podpora strankam z umetno inteligenco, ki ve vse iz vaših člankov baze znanja. Cevovod: uporabnik vpraša → vdelava poizvedbe → vektorsko iskanje po vaših dokumentih → prvih N rezultatov se vstavi v poziv LLM → LLM odgovori s kontekstom.
Potrebe gostovanja: spletna aplikacija + vektorska baza (Postgres s pgvector, Pinecone, Weaviate, Qdrant). Periodično vdelava novih dokumentov.
3. Agent umetne inteligence (avtonomen)
Proces v ozadju, ki izvaja več korakov – npr. agent, ki bere e-pošto, kategorizira, odgovarja. Zanka: misel → klic orodja → opazovanje → ponovno.
Potrebe gostovanja: delavec čakalne vrste (Laravel Horizon, Sidekiq, Celery), vztrajne seje, dolgotrajni procesi (ne funkcije brez stanja).
4. Samostojno gostovanje LLM
Lasten model Llama/Mistral/Qwen na strežniku GPU. Zasebnost, brez stroškov API-ja, vendar z ogromnimi stroški infrastrukture.
Zahteve za gostovanje: strežnik z grafično kartico NVIDIA (A100, H100, RTX 4090+), 32–256 GB RAM-a, hiter NVMe, vLLM ali Ollama za streženje.
Kaj razlikuje gostovanje z umetno inteligenco od običajnega gostovanja?
- Dolge časovne omejitve. Odgovor LLM 5–60 sekund. Standardno 30-sekundno časovno omejitev spletnega strežnika je treba povečati na 120–300 sekund ali pa uporabiti pretakanje.
- Pretočno predvajanje odgovora. Uporabniki pričakujejo, da bodo videli odgovor sproti, ko bo ustvarjen (del za delom). Potrebna je podpora za SSE ali WebSockets na vseh plasteh (PHP-FPM, nginx, Cloudflare).
- Višja poraba CPU/RAM-a na zahtevo. Generiranje vdelave, razčlenjevanje dokumentov in tokenizacija intenzivno porabljajo CPU.
- Vektorsko shranjevanje. 1536-dimenzionalni vektor na dokument × 100.000 dokumentov = nekaj GB. Potrebna je hitra baza.
- Omejitev hitrosti glede na zunanje API-je. OpenAI 10.000 RPM, vendar lahko vaše spletno mesto impulzivno zahteva več – potrebuje čakalno vrsto + ponovni poskus z eksponentnim umikom.
- Stroški so vidni v realnem času. Vsak klic LLM = strošek. Izmeriti jih je treba in jih alarmirati.
Vektorske baze – kako izbrati
Postgres + pgvector
Najenostavnejše za večino primerov. Dodajte CREATE EXTENSION vector; , ustvarite tabelo z vektorskim stolpcem, za hitro iskanje uporabite indeks HNSW.
Plus: ena podatkovna baza za vse (relacijsko + vektorsko), ACID, SQL poizvedbe z vektorskimi združevanjem. Idealno do nekaj milijonov vektorjev.
Slabost: pri >50 milijonih vektorjev se zmogljivost v primerjavi s specializiranimi podatkovnimi bazami zmanjša.
Cena: stroški strežnika Postgres (8 GB RAM-a, 4 vCPU dovolj za 1 milijon vektorjev).
Kvadrant
Vektorska baza podatkov z odprto kodo, gostovanje v lastnem oblaku ali upravljanje v njem. Hitrost, dobre funkcije filtriranja.
Plus: hitro, filtriranje koristnega tovora, lastno gostovanje.
Minus: dodatna vzdrževalna baza poleg primarne.
Cena: brezplačno lastno gostovanje (stroški strežnika). Oblak od ~25 EUR/mesec.
Tkati
Odprtokodno, ima vgrajeno integracijo z OpenAI/Cohere/HuggingFace za vdelavo.
Plus: samodejno vgrajevanje, GraphQL API.
Minus: bolj zapletena namestitev.
storži
Vektorska baza podatkov, ki jo je mogoče upravljati samo s poudarkom na podjetjih.
Plus: ni potrebno vzdrževanje, skalabilnost, dobra dokumentacija.
Slabosti: vezava na prodajalca, drago (~70+ USD/mesec za produkcijo), podatke hranijo oni (upošteva GDPR).
Vgradnja cevovoda
Da bi RAG deloval, mora biti vsak vaš dokument vdelan (pretvorjen v vektor) in shranjen v vektorski zbirki podatkov. Cevovod:
- Razdelitev na dele – razdeli dokument na dele (500–1500 žetonov na del, s prekrivanjem 100–200 žetonov).
- Vdelava – pokličite API za vdelavo (OpenAI text-embedding-3-small, Cohere, Voyage AI). 100 tisoč žetonov = ~0,005 EUR.
- Shranjevanje — zapis vektorja + metapodatkov (vir, chunk_id, datum) v bazo podatkov.
- Ponovno vdelava ob spremembi dokumenta – izbriši staro, vdelaj novo.
Cevovod mora biti v ozadju (delavec čakalne vrste), sicer blokirate spletno zahtevo za več kot 30 sekund na dokument.
Strežniška arhitektura za umetno inteligenco
Minimalno (agent za klepet + RAG do 100 tisoč dokumentov)
- Spletni strežnik: 8 vCPU, 16 GB RAM-a, NVMe
- Postgres + pgvector: 4 virtualni procesorji, 8 GB RAM-a, 100 GB NVMe
- Redis (čakalna vrsta + predpomnilnik): 2 vCPU, 2 GB RAM-a
- Cena: 60–120 EUR/mesec na upravljanem VPS-ju
Srednji (več uporabnikov, več dokumentov, agentov)
- Spletni strežnik z uravnoteženo obremenitvijo 2x
- Gruča Postgres pgvector (replikacija): 16 GB RAM-a
- Gruča Redis
- Skupina delavcev v čakalni vrsti (Laravel Horizon)
- Stroški: 250–500 EUR/mesec
Samostojno gostovanje LLM (GPU)
- Strežnik NVIDIA A100 80GB ali H100
- vLLM ali Ollama za serviranje
- Zakasnitev sklepanja: 30–200 žetonov/sekundo, odvisno od modela
- Stroški: 1000–3000 EUR/mesec za namensko grafično kartico
Pretočno predvajanje – izvedba
LLM API vrača dele, ko jih generira. Vaš zaledni sistem jih mora pretakati odjemalcu:
- Laravel:
return response()->stream(...)+ dogodki, poslani s strežnika. - Node/Express:
res.write(chunk)+Content-Type: text/event-stream. - Proxy Cloudflare: omogočite »Onemogoči medpomnjenje« ali pošljite
X-Accel-Buffering: noglave. - nginx:
proxy_buffering off;v bloku lokacije.
Sledenje stroškom
Umetna inteligenca je edini primer uporabe gostovanja, kjer se stroški prilagajajo prometu v realnem času. Meriti jih je treba:
- Na zahtevo: vhodni žetoni, izhodni žetoni, uporabljeni model, stroški EUR.
- Na uporabnika: dnevna/mesečna omejitev (npr. 100.000 žetonov na uporabnika/mesec).
- Alarm: če dnevni strošek preseže X, pošlji obvestilo (cron + Telegram bot ali Sentry).
Pri OpenAI/Anthropic nastavite fiksno omejitev za svoj API ključ – npr. 100 $/mesec. V nasprotnem primeru lahko zaradi zanke, ki se je zanesla, porabite 1000 $, preden se zaveste.
Varnost in GDPR
- Ključ API-ja skrit na strani strežnika – nikoli v kodi za vmesnik.
- Omejitev hitrosti na uporabnika/IP – preprečuje prekoračitve kvote.
- Takojšnja zaščita pred vbrizgavanjem – očisti uporabniški vnos, preden ga pošlje LLM.
- GDPR: če pošiljate osebne podatke podjetju OpenAI, potrebujete z njimi DPA. Anthropic, OpenAI in Mistral imajo dokumente EU DPA. Samostojno gostovanje LLM odpravlja to težavo.
- Beleženje: ne beležite celotnih pozivov, če vsebujejo osebne podatke. Zgoščena vrednost ali psevdoanonimni podatek.
Primerjava modelov (približno)
| Model | Ponudnik | Hitrost | Kakovost | Cena (vhod/izhod na 1 milijon žetonov) |
|---|---|---|---|---|
| GPT-4.5 | OpenAI | srednje | vrhunsko | ~2 / 8 EUR |
| Claude Sonnet 4.6 | Antropično | hitro | vrhunsko | ~2,5 / 12 EUR |
| Mistral Velika | Mistral (EU) | hitro | zelo dobro | ~1,5 / 4 EUR |
| Lama 3.x (samostojno gostovanje) | vaš grafični procesor | odvisno | zelo dobro | fiksni stroški strežnika |
Gostovanje orožja za množično uničevanje in umetne inteligence
WMD ima namenske VPS in upravljane VPS pakete, primerne za delovne obremenitve umetne inteligence – z NVMe shrambo, dovolj RAM-a za pgvector in podporo za pretakanje WebSockets/SSE na ravni spletnega strežnika. Za stranke, ki gradijo agente umetne inteligence, nastavimo sklad Postgres + pgvector + Redis, nastavimo delavce čakalne vrste (Horizon ali Sidekiq) in spremljamo stroške na zahtevo. Za stranke LLM, ki gostujejo sami, ponujamo ponudbe za strežnike GPU (razred Hetzner GPU ali partnerski DC). Po potrebi dokumentacijo EU DPA za integracije OpenAI/Anthropic/Mistral.
Pogosta vprašanja
Ali potrebujem grafični procesor za RAG? Ne. Vdelava se izvaja prek API-ja (OpenAI), pridobivanje pa prek pgvectorja na procesorju. Grafični procesor je potreben samo za samostojno gostovanje LLM.
Kakšna je razlika med modeloma vdelave in klepeta? Model vdelave pretvori besedilo v vektor (številsko polje) za iskanje. Model klepeta ustvari besedilo kot odgovor. Različne cene, različni API-ji.
Kako preprečiti vbrizgavanje pozivov? Filtrirajte uporabniški vnos (regex za fraze tipa »prezri prejšnja navodila«), uporabite sistemske pozive z jasnimi mejami, izolacijo konteksta agenta, dnevnik nadzora.
Cloudflare blokira pretakanje odgovorov – kaj pa zdaj? Prepričajte se, da možnost »Auto Minify« ni vklopljena, dodajte glavo X-Accel-Buffering: no ali pa namesto SSE uporabite WebSockets.
Kakšna je latenca Mistral EU API-ja? Podobno kot pri OpenAI (200–800 ms za prvi žeton, odvisno od regije).
Gradite aplikacijo umetne inteligence in potrebujete infrastrukturo? WMD nastavi sklad delovnih procesov Postgres + pgvector + Redis + queue, optimizira nginx/PHP-FPM za pretakanje in nastavi stroške spremljanja. Stopite v stik z nami prek kontaktnega obrazca .