LLM Gateway 2026: LiteLLM vs Portkey vs OpenRouter — Praktické porovnanie pre produkciu

Kedy dáva zmysel LiteLLM, kedy Portkey a kedy OpenRouter? Porovnávacia tabuľka, config súbory a rozhodovací strom pre výber LLM gateway v roku 2026, plus reálne latencie z produkcie.

LiteLLM vs Portkey vs OpenRouter (2026)

Aktualizované: 27. júla 2026

LLM gateway je proxy vrstva medzi vašou aplikáciou a viacerými poskytovateľmi LLM (OpenAI, Anthropic, Groq, self-hosted modely), ktorá zjednocuje API, spravuje fallback, cache a sledovanie nákladov. V roku 2026 sa LiteLLM stal predvolenou voľbou pre self-hosted produkčné nasadenia, Portkey vedie v oblasti observability a governance a OpenRouter vyhráva na rýchlosť prototypovania a šírku katalógu modelov. Nižšie nájdete porovnaciu tabuľku, funkčné config súbory a rozhodovací strom podľa fázy projektu.

  • LiteLLM v1.77+ je open-source proxy s podporou 100+ providerov, Redis semantic cache a fallback chain. Nulový markup, ale musíte spravovať vlastnú infra.
  • Portkey pridáva pod 1 ms latencie a poskytuje semantic caching, RBAC a real-time cost dashboard. Pricing od $49/mesiac, čiastočne self-hostable.
  • OpenRouter je čisto SaaS marketplace s 300+ modelmi za jedným API kľúčom, poplatok 5,5 % zo spotreby a latencia +100 až 150 ms.
  • Semantic cache dokáže znížiť LLM náklady o 30 až 50 % pri opakujúcich sa dopytoch v customer supporte a interných search rozhraniach.
  • Typická produkčná architektúra: OpenRouter na experimenty, LiteLLM na horúce cesty s vysokým objemom, Portkey ako observability vrstva nad oboma.
  • LLM router (rozhoduje o modeli) a LLM gateway (spravuje traffic) sú dve rôzne vrstvy. Najlepšie gateway obsahujú aj router logiku.

Čo je LLM gateway a prečo ju v roku 2026 potrebujete

Poviem to na rovinu: LLM gateway je centralizovaná kontrolná rovina, ktorá sedí medzi vašou aplikáciou a poskytovateľmi modelov. Namiesto toho, aby aplikácia volala priamo openai.chat.completions.create(), volá vlastnú OpenAI-kompatibilnú endpoint na gateway. Gateway požiadavku autentikuje, aplikuje rate limit a routing pravidlá, skontroluje cache, pošle ju správnemu providerovi, zaznamená latenciu a tokeny a vráti štandardizovanú odpoveď. Celý proces pridá 3 až 10 ms overhead. Pre používateľa neviditeľné, pre operatívne tímy nezaplatiteľné.

Prečo je to v roku 2026 povinnosť? Za posledný rok Anthropic dvakrát menil ceny Sonnet variantov, OpenAI deprekoval štyri modely a nový Groq inference tier znížil cenu Llama 3.3 na tretinu. Aplikácia, ktorá je hardkódovaná na jedného providera, sa každou takou zmenou láme. Buď platí staré ceny, alebo trávi sprint prepisovaním klientskeho kódu. Gateway túto zmenu absorbuje v jednom YAML súbore.

Druhý dôvod je dostupnosť. Verejné status stránky Anthropic aj OpenAI evidovali v prvom polroku 2026 spolu 14 hodín degradovanej služby. Bez automatického fallback chain-u to znamená 14 hodín ticha alebo 5xx pre vašich používateľov. S gateway to znamená pár desatinníc percenta latency spike, request pretiekol na sekundárneho providera skôr, než klient stihol timeoutnúť.

Tretí dôvod je viditeľnosť nákladov. AI spend ostáva nepriehľadný do momentu, keď dorazí faktúra. Gateway vám v reálnom čase ukazuje, ktorá feature, ktorý používateľ a ktorý model spaľuje ako. Bez toho neviete, či Claude Opus prompt v onboarding wizarde stojí 3 centy alebo 30 dolárov mesačne (áno, presne tento typ prekvapenia som u jedného klienta vlani riešil o polnoci).

LiteLLM vs Portkey vs OpenRouter: porovnávacia tabuľka

Nasledujúca tabuľka zachytáva rozhodovacie dimenzie, ktoré tímy skutočne porovnávajú pri výbere v druhej polovici roku 2026. Latencie sú z verejných benchmarkov a mojich vlastných meraní na eu-central-1 za posledné 3 mesiace.

DimenziaLiteLLMPortkeyOpenRouter
Model hostingSelf-hosted (MIT)Managed + Self-hostedFully managed SaaS
Cenový modelZadarmo (platíte len infra)Free tier 10k logov, potom od $49/mesiac5,5 % markup nad kredit
Gateway latencia (P95)8 až 20 ms< 1 ms100 až 150 ms
Počet podporovaných modelov100+ providerov200+ variantov300+ variantov
Fallback chainÁno (YAML)Áno (JSON config)Áno (automatický)
Semantic cachingÁno (Redis)Áno (managed)Obmedzene
Cost tracking granularitaPer virtual key + userPer feature + user + modelPer API key
GuardrailsCez pluginyVstavané (PII, jailbreak)Žiadne
EU data residencyÁno (self-host)Áno (EU hosting)Nie
Ideálne preProdukčné tímy s DevOpsEnterprise s compliancePrototypy a experimenty

LiteLLM: open-source proxy pre plnú kontrolu

LiteLLM je Python SDK a proxy server, ktorý vystavuje 100+ providerov za jedným OpenAI-kompatibilným API. Preloží každý request do natívneho formátu daného providera a vráti odpoveď v OpenAI schéme. Verejné benchmarky projektu na GitHube udávajú 8 ms P95 pri 1000 RPS. V reálnej prevádzke som meral 10 až 20 ms vrátane fallback logiky. MIT licencia, zero markup, ale zodpovednosť za škálovanie, monitoring a upgrady je na vás.

Odporúčaný produkčný stack je dockerizovaný: dve inštancie LiteLLM proxy za load balancerom, PostgreSQL pre virtual keys a Redis 7.4 pre caching a rate limity. Nižšie je minimálny config.yaml, ktorý používam ako štartovaciu šablónu pre klientske projekty. Definuje tri model aliasy, fallback poradie a semantic cache s prahom 0,85.

Konfigurácia s fallback chain-om a semantic cache

model_list:
  - model_name: chat-fast
    litellm_params:
      model: groq/llama-3.3-70b-versatile
      api_key: os.environ/GROQ_API_KEY
      rpm: 500
  - model_name: chat-fast
    litellm_params:
      model: openai/gpt-4o-mini
      api_key: os.environ/OPENAI_API_KEY
      rpm: 1000
  - model_name: chat-smart
    litellm_params:
      model: anthropic/claude-sonnet-4-5
      api_key: os.environ/ANTHROPIC_API_KEY

router_settings:
  routing_strategy: latency-based-routing
  fallbacks:
    - chat-fast: ["chat-smart"]
  num_retries: 2
  timeout: 30
  allowed_fails: 3
  cooldown_time: 60

litellm_settings:
  cache: true
  cache_params:
    type: "redis-semantic"
    host: os.environ/REDIS_HOST
    port: os.environ/REDIS_PORT
    password: os.environ/REDIS_PASSWORD
    namespace: "prod_cache"
    ttl: 600
    similarity_threshold: 0.85
    redis_semantic_cache_embedding_model: "text-embedding-3-small"

general_settings:
  master_key: os.environ/LITELLM_MASTER_KEY
  database_url: os.environ/DATABASE_URL
  alerting: ["slack"]
  alerting_threshold: 300

Sekvencia požiadavky vyzerá takto. Klient pošle POST na /chat/completions s model: "chat-fast". Router najprv skontroluje Redis semantic cache. Ak nájde embedding s kosínusovou podobnosťou nad 0,85, vráti cached response za ~5 ms. Ak cache miss, router vyberie deployment s najnižšou pozorovanou latenciou (Groq má typicky 400 ms, OpenAI 800 ms). Ak Groq vráti 5xx alebo timeoutuje, po dvoch retries proxy preskočí na chat-smart a klient nezaznamená chybu. Alerty do Slacku vidím pri každej fallback udalosti, takže degradácie chytám skôr, než ich chytia používatelia.

Kedy self-hosting nedáva zmysel

LiteLLM predpokladá DevOps kapacitu. Ak nemáte niekoho, kto rieši Kubernetes deploymenty, Redis TLS a Postgres backupy, prevádzkové náklady zjete v hodinách seniorného inžiniera skôr, než ušetríte na markup-e. Pre tímy pod 5 inžinierov s LLM spend pod $2000/mesiac je Portkey alebo OpenRouter takmer vždy lacnejšia voľba.

Portkey: kontrolný panel pre produkčné AI

Portkey pozicionuje seba ako "control panel for production AI". Kým OpenRouter rieši prístup k modelom a LiteLLM self-hosted routing, Portkey sa sústredí na to, čo príde po deploymente: observabilita, spoľahlivosť, guardrails a governance. Latencia gateway pridáva pod 1 ms, čo je najlepšie číslo v tejto trojici, vďaka edge nasadeniu vo viacerých regiónoch vrátane Frankfurtu.

Každý request cez Portkey je logovaný, tracovaný a atribuovaný. V dashboarde vidíte distribúciu latencií, cost breakdown podľa feature/používateľ/model, error rates, guardrail violations a cache hit rates. Toto je hlavný dôvod, prečo Series A a neskoršie AI-first startupy prechádzajú z čistého LiteLLM na Portkey. Keď LLM náklady prekročia $10k/mesiac, potrebujete vedieť, kto ich generuje, a nie hádať z faktúry.

Vstavaný semantic caching pri identifikovanom overlap-e v customer support workflowoch typicky ušetrí 30 až 50 % nákladov. Napríklad projekt, kde sme vlani nahradili priame OpenAI volania Portkey vrstvou, spadol z $4200/mesiac na $2400/mesiac za dve prompt paths: retrieval-augmented FAQ a summary generovanie e-mailov. Nič sme nezmenili v prompt engineeringu, len sme zapli semantic cache s prahom 0,92 a TTL 3600 s. Priznám sa, prvý mesiac som tomu neveril, kým som nevidel Grafana graf.

Cenový model má háčik: fakturujete za "recorded logs". Ak prekročíte limit, gateway ďalej routuje requesty, len prídete o observabilitu na nadlimitný objem. Znie to neškodne, kým vám neupadne alerting práve v deň, keď backend generuje 10× viac dopytov než zvyčajne. Ak si vyberiete Portkey, plánujte log kapacitu ako pri APM tooloch (Datadog logika), nie ako pri API rate limitoch.

OpenRouter: rýchly prístup k 300+ modelom

OpenRouter je čistý SaaS marketplace. Jeden API kľúč, jeden účet, 300+ variantov modelov od Anthropic, OpenAI, Google, Mistral, Meta, Cohere a desiatok menších providerov. Setup do prvého API volania je 3 minúty vrátane registrácie. Poplatok 5,5 % zo spotreby, žiadne mesačné fixné náklady, žiadny self-host. Detaily aktuálneho cenníka a modelov nájdete v oficiálnej dokumentácii OpenRouter.

Latencia pridáva 100 až 150 ms, čo je znateľné pri konverzačnom UI a takmer nepodstatné pri batch spracovaní. OpenRouter je fenomenálny pre tri prípady: (1) produkty, ktoré nechávajú používateľa vybrať model, každý user si zvolí "svoj" a routing spraví za vás gateway; (2) prototypy, kde experimentujete s Llama 3.3, Mistral Large a Claude Sonnet za týždeň; (3) tímy bez DevOps kapacity, ktoré potrebujú fallback za deň a nie za mesiac.

Kde OpenRouter zaostáva: nemá self-hosting option, takže tímy s data residency (GDPR, HIPAA, DORA) alebo on-prem požiadavkami nemôžu túto voľbu použiť. Cost tracking je per API key, nie per feature. Ak chcete vidieť, koľko utráca konkrétny endpoint, musíte vytvoriť N kľúčov a udržiavať ich rotáciu. A guardrails prakticky žiadne, kontent moderácia je vaša zodpovednosť.

Aký je rozdiel medzi LLM gateway a LLM routerom?

Terminológia sa v roku 2026 ustálila, ale marketing ju stále zamieňa. LLM router je klasifikačná vrstva, ktorá pred každým volaním rozhodne, ktorý model je pre daný prompt najvhodnejší, na základe zložitosti dopytu, latency budgetu a ceny per call. Router sám nerobí LLM volanie; vráti odporúčanie a aplikácia (alebo gateway) potom pošle request do zvoleného providera. LLM gateway je infra vrstva, ktorá spravuje traffic: autentikáciu, rate limity, cache, fallback, cost tracking a observabilitu. Router je "decision engine", gateway je "control plane".

V praxi sa hranica zmazáva. LiteLLM, Portkey aj OpenRouter obsahujú aj jednoduché routing pravidlá (latency-based, cost-based, weighted round-robin). Samostatné routery ako RouteLLM alebo Martian LLM Router idú ďalej. Klasifikátor odhadne, či prompt zvládne Haiku alebo potrebuje Opus, a routing rozhoduje na základe embedding klasifikácie. Typický produkčný setup: samostatný router pred gateway, ktorý najprv rozhodne o triede modelu (fast/smart/reasoning), a gateway potom spraví konkrétny call s fallback a cache.

Ak riešite customer support s 60 % triviálnych dopytov a 40 % komplexného reasoning-u, samostatný router zníži cost per query o 50 až 70 % bez merateľnej straty kvality. Ak máte homogénnu záťaž (všetky prompty potrebujú rovnakú triedu modelu), stačí gateway a routing pravidlá v YAML-e.

Ako si vybrať gateway podľa fázy projektu

Toto je rozhodovací strom, ktorý používam pri architektonických review pre klientov. Fázu určuje kombinácia LLM spend, počet inžinierov a compliance požiadavky.

Fáza 1: Experimentácia (0 až 500 $/mesiac)

OpenRouter. Bodka. Nezakladajte Redis cluster kvôli tomu, čo je dnes hackaton demo. Do prvej revenue je markup 5,5 % marginálny. Použite OpenRouter aj na finálne rozhodnutie, ktoré modely testovať, jeho analytics ukáže, ktoré 3 až 4 modely dávajú najlepšiu odpoveď za danú cenu, čo je cenný signál pre neskoršiu voľbu primárneho modelu.

Fáza 2: Rast (500 až 5000 $/mesiac)

Portkey managed tier alebo LiteLLM na malom VPS. Ak už máte DevOps engineer, prejdite na LiteLLM, investícia sa vráti pri $2000+/mesiac. Ak nemáte, Portkey $49 plán pokryje observabilitu bez ops overhead-u. V tejto fáze zapnite semantic caching a začnite atribuovať cost per feature. Bez toho nebudete vedieť, ktoré prompt paths optimalizovať.

Fáza 3: Scale (5000+ $/mesiac)

Portkey enterprise alebo dockerizovaný LiteLLM za load balancerom. Pridajte samostatný router (RouteLLM) pred gateway, ak máte zmiešanú záťaž. Compliance-heavy odvetvia (finance, healthcare, verejný sektor) potrebujú self-hosted LiteLLM alebo Portkey EU hosting. V tejto fáze je gateway súčasťou incident response — ak vypadne, cielia sa naň všetky alerty a musí mať vlastný runbook.

Ak vás zaujíma, ako observabilitu doplniť o full-trace pohľad na prompty, spans a evaluácie, pozrite si moje detailné porovnanie LLM observabilita nástrojov Langfuse, LangSmith a Helicone. Gateway a observability sú komplementárne. Gateway rieši prevádzku, observability rieši introspection.

Bezpečnosť a governance, čo často preskočíte

Väčšina gateway porovnaní končí pri feature matrix. Governance je pritom to, čo v produkcii zvyčajne rozhodne o výbere. Nižšie sú štyri oblasti, ktoré preverujem pri každom nasadení.

API key management. Nikdy nenechávajte raw provider keys v aplikačnom kóde. LiteLLM aj Portkey podporujú virtual keys, každá služba, tím alebo dokonca používateľ dostane vlastný kľúč s definovaným budgetom a expiráciou. Rotácia keys sa deje na úrovni gateway, aplikácia nemení kód. Vždy používajte os.environ/NAME syntax v config súboroch, nikdy raw hodnoty.

PII redakcia a guardrails. Portkey má vstavané guardrails pre PII detekciu (mená, e-maily, IBAN, rodné čísla) a jailbreak pokusy. LiteLLM to rieši cez pluginy, oficiálna dokumentácia guardrails pokrýva integrácie s Presidio, Aporia a Lakera. OpenRouter to nerieši vôbec, čo v regulovaných odvetviach automaticky diskvalifikuje.

Rate limiting a budget enforcement. Bez rate limitov na úrovni virtual key jedna cyklická chyba v kóde môže vygenerovať $5000 v tokenoch za noc (osobne som podobný incident riešil, keď sme mali retry loop bez cap-u). Nastavte hard budgets aj alertingy. LiteLLM podporuje per-key monthly budget s automatickým 429 responsom, Portkey rovnako. Testujte cez smoke test v staging environmente, nie prvýkrát v produkcii.

Audit trail. V EÚ pre AI Act článok 12 potrebujete logovať systémový prompt, používateľský input, model output a rozhodovaciu logiku, minimálne pre high-risk aplikácie. Portkey a self-hosted LiteLLM to spĺňajú out of the box, OpenRouter len čiastočne (logy sú ich vlastníctvo, nie vaše). Pre kontext o širšej infraštruktúre pre pokročilé AI aplikácie odporúčam môj text o vektorových databázach. Bez retrieval vrstvy semantic caching stráca časť zmyslu.

Často kladené otázky

Aká je najlacnejšia LLM gateway pre malé projekty?

Pre projekty pod $500/mesiac je OpenRouter najlepšia voľba, 5,5 % markup je nižší než čas na správu vlastnej infraštruktúry. Portkey má free tier s 10 000 logmi mesačne, čo pokryje väčšinu prototypov. Self-hosted LiteLLM je "zadarmo" len ak už máte DevOps kapacitu.

Podporuje LiteLLM semantic caching s Redis?

Áno, LiteLLM podporuje Redis semantic cache od verzie 1.60+. Konfigurácia sa robí v config.yaml pod litellm_settings.cache_params s typom redis-semantic. Potrebujete Redis s modulom RediSearch a embedding model (typicky text-embedding-3-small od OpenAI). Similarity threshold 0,85 je dobré východisko pre väčšinu use-casov.

Môžem používať LLM gateway s data residency v EÚ?

Áno. Self-hosted LiteLLM viete deployovať na akékoľvek EÚ hosted Kubernetes. Portkey ponúka managed EU hosting vo Frankfurte. OpenRouter neponúka EU data residency, takže pre GDPR-citlivé workloady nie je vhodný. Ak riešite AI Act compliance, pripočítajte aj audit trail požiadavky. Portkey a LiteLLM ich spĺňajú, OpenRouter len čiastočne.

Ako LLM gateway zvláda výpadky providerov?

Cez fallback chain a circuit breaker. Definujete poradie modelov (napr. Groq, potom OpenAI, potom Anthropic) a gateway pri 5xx alebo timeoute automaticky preskočí na ďalší. LiteLLM podporuje num_retries, allowed_fails a cooldown_time, Portkey má configurable circuit breaker s exponential backoffom. Bez fallback chain-u sú výpadky providera vaším incidentom.

Oplatí sa mať samostatný LLM router pred gateway?

Oplatí sa, ak máte heterogénnu záťaž: 60 %+ dopytov zvláda malý model a zvyšok potrebuje frontier model. Samostatný router (RouteLLM, Martian) zníži cost per query o 50 až 70 % pri zachovaní kvality. Pre homogénnu záťaž stačia routing pravidlá v gateway (latency-based, weighted round-robin) a extra vrstva je zbytočná komplikácia.

Emma Bergstrom
O Autorovi Emma Bergstrom

Workflow architect designing zero-touch pipelines that span Zapier, n8n, and code. Calls herself a recovering ops engineer.