OmniRoute ist jetzt Teil von Cheaper InferenceCheaper Inference entdecken

#1 Open-Source-KI-Router

Route über 352 Anbieter durch einen OpenAI-kompatiblen Endpunkt, mit automatischem Fallback.

OpenAI-kompatibel Kostenlos und Open Source71.6k Stars (öffnet in neuem Tab)

OmniRoute × Cheaper Inference

Kombiniere den automatischen Fallback und die Entwickler-Tools von OmniRoute mit dem kostensortierten Marktplatz von Cheaper Inference. Jede berechtigte Anfrage startet bei der günstigsten verfügbaren Anbieterroute.

72 ModelleDirekter Listenpreis im Vergleich zum Cheaper-Inference-Preis
Direkte Listenpreise im Vergleich zu Cheaper-Inference-Preisen je Modell
ModellEingabepreisAusgabepreisErsparnisKontextDetails
gpt-5.6-terraOpenAI · text$2.00$0.80/ 1M tokens$12.00$4.80/ 1M tokens60 % Rabatt1.1M
gpt-oss-120bOpenAI · text$0.10$0.04/ 1M tokens$0.50$0.20/ 1M tokens60 % Rabatt131K
deepseek-v4.1-flashDeepSeek · text$0.15$0.075/ 1M tokens$0.60$0.30/ 1M tokens50 % Rabatt1.0M
gpt-5.6-solOpenAI · text$4.00$2.00/ 1M tokens$20.00$10.00/ 1M tokens50 % Rabatt1.1M
glm-4.5Z.ai · text$0.60$0.33/ 1M tokens$2.20$1.21/ 1M tokens45 % Rabatt128K
glm-4.5-airZ.ai · text$0.20$0.11/ 1M tokens$1.10$0.605/ 1M tokens45 % Rabatt128K
glm-4.6Z.ai · text$0.60$0.33/ 1M tokens$2.20$1.21/ 1M tokens45 % Rabatt198K
glm-4.7Z.ai · text$0.60$0.33/ 1M tokens$2.20$1.21/ 1M tokens45 % Rabatt128K
8 von 72 Modellen angezeigt

Zentrale Steuerung

Ein Endpunkt für deine konfigurierten Anbieter.

Core control

Anfragen am Laufen halten

Ist ein Ziel nicht erreichbar oder das Kontingent aufgebraucht, wählt OmniRoute das nächste gesunde Ziel.

Core control

Berechtigten Kontext komprimieren

Eine Pipeline mit 12 Engines reduziert berechtigten Kontext um 15–95%. Im dokumentierten Tool-lastigen Beispiel waren es ~89%.

Core control

Start mit 0 $

90+ Free-Tiers und 56 wiederkehrende oder schlüssellose Free-Forever-Anbieter. Für den schlüssellosen Schnellstart ist keine Kreditkarte nötig.

Core control

35 unterstützte Integrationen

Konfiguriere Claude Code, Codex, Cursor, Cline, Copilot, Antigravity und weitere unterstützte Clients über einen Endpunkt.

Core control

Ein Endpunkt

Nimmt OpenAI-, Claude-, Gemini- und Responses-API-Anfragen unter /v1 an.

Core control

Betriebliche Kontrollen

Circuit Breaker, verschlüsselte Zugangsdaten, MCP, A2A, Memory, Guardrails und Evals sind im selbst gehosteten Gateway enthalten.

Der Katalog

Alle hinter einem Endpunkt.

Ein Katalog mit Chat, Medien, Suche, lokalen Runtimes, Cloud-Agenten und Systemintegrationen.

352 Anbieter

Alle davon hinter einem einzigen lokalen Endpunkt.

Der eine Endpunkt, auf den jeder Client zeigthttp://localhost:20128/v1

14 Search12 Audio-only2 Upstream proxy3 Cloud agent1 System
ImageOpenAIImageAnthropicImageGoogleImageDeepSeekImagexAIImageZ.aiImageMoonshotImageMiniMaxImageAlibabaImageMetaImageBytedanceImageAion Labs
25OAuthClaude Code, Codex, Cursor, GitHub Copilot, Kimi Code…
233API-SchlüsselOpenAI, Anthropic, Groq, NVIDIA, Cerebras, Mistral…
35Web-CookieChatGPT Web, Claude Web, Gemini Web, Grok Web…
14LokalOllama, LM Studio, vLLM, llama.cpp…
13Ohne AuthentifizierungOpenCode Free, Felo, Pollinations und weitere schlüssellose Routen…
Zur Anbieterreferenz (opens in a new tab)

Schnellstart

Installieren, starten, verbinden.

Installiere das Paket, starte das Gateway und richte einen beliebigen OpenAI-kompatiblen Client auf Port 20128.

Anbieterkatalog
352
Routing-Strategien
19
Lokaler Endpunkt
:20128/v1

Step 1: Installieren

Installiere das npm-Paket omniroute global.

omniroute: install
$ npm install -g omnirouteadded 1 package

Step 2: Starten

Startet API und Dashboard zusammen auf Port 20128.

omniroute: run
$ omniroute▸ dashboard ✓ http://localhost:20128/dashboard▸ api ...... ✓ serving on :20128

Step 3: Tool verbinden

Nutze http://localhost:20128/v1; die schlüssellose Auto-Route funktioniert direkt nach der Installation.

omniroute: connect
$ curl localhost:20128/v1/models✓ models listed

Gateway-Steuerung

Zentrale Gateway-Steuerung in einem Prozess.

Konfiguriere Fallback, Kontingente, Kompression, Memory, MCP und A2A im lokalen Dashboard.

Gateway control

Smart Combos

Setze ein Modell auf auto oder baue deine eigene Combo mit 19 Strategien und gestuftem Fallback.

Nutze einen fertigen Modus oder kombiniere 19 Strategien rund um das Ziel, das zählt.

Gateway control

Memory

Persistentes Konversationsgedächtnis mit FTS5-Stichwortsuche und Qdrant-Vektorabruf.

Gateway control

Resilienz auf 3 Ebenen

Provider-Breaker, Verbindungs-Cooldown und Modell-Lockout isolieren Fehler im kleinstmöglichen sinnvollen Umfang.

Gateway control

Freikontingent

Pool-dedupliziertes Accounting über 90+ Free-Tiers.

Veröffentlichte Free-Tier-Kapazität, dedupliziert.

Gateway control

Kompression

12 kombinierbare Engines für Tool-Ausgaben, Kontext und Antwortstil.

Berechtigte Tokens um 15–95% reduzieren.

Gateway control

MCP-Server

Ein integrierter Server mit 110 Gateway-Tools in 33 Scopes.

110 Tools · 33 Scopes · stdio / HTTP

Gateway control

A2A-Protokoll

Ein JSON-RPC-Agent-Server mit 6 Skills.

6 Skills · JSON-RPC 2.0 · Agent Card

Gateway control

Semantischer Cache

Eine wiederholte Anfrage kann aus dem Cache kommen, und der Response-Header zeigt, was das gespart hat.

X-OmniRoute-Cache: HIT

Client-Kompatibilität

Behalte deine bestehenden Coding-Tools.

Richte eine OpenAI-kompatible CLI oder einen Editor auf eine lokale Basis-URL; OmniRoute kümmert sich um die Anbieter dahinter.

Claude Code
Codex CLI
Cursor
Cline
GitHub Copilot
Gemini CLI
OpenCode
Kilo Code
Factory Droid
Continue
Roo Code
Antigravity
Aider
OpenClaw
Goose
Grok Build
Windsurf
Devin CLI

http://localhost:20128/v1

request.sh
curl http://localhost:20128/v1/chat/completions \
  -H "Authorization: Bearer $OMNIROUTE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"auto","messages":[{"role":"user","content":"Hello"}]}'

OmniCopilot

OmniRoute-Modelle in Copilot Chat nutzen.

OmniCopilot ergänzt die bestehende Modellauswahl um OmniRoute-Modelle.

Offizieller Marketplace

Läuft in VS Code Stable und Insiders. Installation über den Marketplace oder die Extensions-Ansicht.

Open VSX Registry

Für Cursor, Windsurf, VSCodium, Theia, code-server, Gitpod und andere kompatible Editoren.

Kein Copilot-Plan nötig

Anbietermodelle laufen über OmniRoute in Copilot Chat, ohne die Inferenz über einen Copilot-Plan zu leiten.

Typische Fehlerbilder

Warum OmniRoute

Welche Kontrolle welches typische Fehlerbild adressiert.

Without routing
With OmniRoute
Kontingent verfällt ungenutzt
Vorhandenes Kontingent verfolgen und aufbrauchen
Rate-Limits stoppen dich mitten in der Arbeit
Auto-Fallback über 4 Stufen in Millisekunden
Tool-Ausgaben verbrennen Tokens
Kompression mit 12 Engines, 15–95% bei berechtigtem Inhalt
Teure APIs summieren sich
Kostenoptimiertes Routing kann das günstigste berechtigte Ziel wählen
Jedes Tool braucht sein eigenes Setup
Ein Endpunkt und ein Dashboard
Ein Anbieter ist aus deinem Netzwerk nicht erreichbar
Proxy-Scopes und Client-Fingerprint-Kontrollen
Ein toter Schlüssel legt einen Anbieter lahm
Breaker, Cooldown und Lockout isolieren den Fehler
Ein Team teilt sich ein Abonnement
Schlüssel-Pools und Fair-Share-Kontingente
Du brauchst lokale Kontrolle über Routing-Daten
Local-First-Speicherung mit verschlüsselten Zugangsdaten
Keine Sicht auf Ausgaben oder Zustand
Analysen zu Nutzung, Kontingent, Einsparung und Latenz

Dokumentations-Snapshot

So vergleichen sich die Gateways

Fähigkeiten geprüft anhand der verlinkten Projektdokumentation am 2026-08-30.

FähigkeitOmniRoute (öffnet in neuem Tab)9Router (öffnet in neuem Tab)LiteLLM (öffnet in neuem Tab)CLIProxyAPI (öffnet in neuem Tab)
Anbieter35240+100+8+ upstreams
Routing-Strategien193-tierretry / priorityround-robin / fill-first
Gestufter Fallback mit UIYesYesManual policyMulti-account
Token-Kompression12 engines · 15–95%RTK / Headroom / CavemanNo built-in pipelineHTTP compression

Snapshot aus öffentlicher README und offizieller Dokumentation; verlinkte Quellen vor Kauf- oder Deployment-Entscheidungen prüfen.

Routing

Wähle eine Auto-Route.

Nutze einen fertigen Modus oder kombiniere 19 Strategien rund um das Ziel, das zählt.

Modell · Fallback aktiviertautoBalanced default
OpenAI-kompatible Anfrage
curl http://localhost:20128/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model":"auto","messages":[{"role":"user","content":"Write a TypeScript retry helper."}]}'

Routing alias auto selected. Objective: Balanced default. Fallback enabled.

Abo-Kontingent aufbrauchen

Nutze vorhandenes Kontingent, bevor bezahlte APIs angefasst werden.

priority · fill-first

Last verteilen

Verteile Traffic auf Schlüssel und Konten, um Rate-Limit-Druck zu senken.

weighted · round-robin · p2c · least-used · headroom

Günstigstes zuerst

Route zum günstigsten berechtigten Ziel.

cost-optimized

Kontextbewusst

Lange Kontexte auf passenden Modellen halten, bei Bedarf weiterreichen.

context-relay · context-optimized · cache-optimized

Zufällig

Berechtigten Traffic auf Ziele verteilen.

random · strict-random

Adaptives Scoring

Scoring mit 15 Faktoren, Last-Known-Good und Reset-bewusste Zeitfenster.

reset-window · reset-aware · lkgp · auto · fusion · pipeline

Free-Tier-Accounting

Veröffentlichte Free-Tier-Kapazität, dedupliziert.

455 Katalogeinträge werden zu 40 wiederkehrenden Pools dedupliziert; nur veröffentlichte positive Budgets fließen in die Kennzahl ein.

1.51B

Pool-dedupliziertes Accounting verhindert, dass geteilte Kontingente mehrfach gezählt werden. Anbieter ohne Obergrenze bleiben sichtbar, ohne die Token-Summe aufzublähen. Checked 2026-08-30.

Berechnung ansehen (öffnet in neuem Tab)
Wiederkehrende oder schlüssellose Free-Forever-Anbieter56
  • Mistral1B/month
  • LLM7150M/month
  • Nara150M/month
  • Gemini CLI · forever60M/month
  • Kiro50 credits/month
  • Qoder · foreverFree catalog
  • LongCat · forever50M/day
  • Cerebras1M/day
  • NVIDIA NIM~40 RPM
  • Pollinations · foreverNo key
  • Cloudflare Workers AI · foreverDaily neurons
  • OpenCode Free · foreverNo-auth catalog

Kontextkompression

Berechtigte Tokens um 15–95% reduzieren.

Tool-Ausgaben, wiederholter Kontext und aufgeblähte strukturierte Daten lassen sich komprimieren, bevor sie das Modell erreichen.

Kontext um 15–95% bei berechtigten Tokens reduziert

Vorher: The function should iterate over the list of items, and for each item, it should check whether the value is greater than zero, and if so, add it to the running total. Nachher: sum all list items where value > 0

  1. Session-Dedup
  2. CCR
  3. Lite
  4. RTK
  5. Responses Tool Output
  6. Headroom
  7. Relevance
  8. Caveman
  9. Aggressive
  10. LLMLingua-2
  11. Ultra
  12. OmniGlyph

Gleiche Anweisung. Weniger Kontext zu bezahlen.

Vorher69 tokens
The function should iterate over the list of items, and for each item, it should check whether the value is greater than zero, and if so, add it to the running total.
Nachher19 tokens
sum all list items where value > 0

Kombinierbare Pipeline

  1. Session-Dedup
    Inhalte verwerfen, die in der Session bereits gesendet wurden.
  2. CCR
    Große Blöcke archivieren und bei Bedarf wiederherstellen.
  3. Lite
    Konservative verlustfreie Bereinigung anwenden.
  4. RTK
    Befehls- und Tool-Ausgaben filtern und deduplizieren.
  5. Responses Tool Output
    Responses-API-Tool-Payloads verdichten.
  6. Headroom
    Reversible Verdichtung tabellarischer und strukturierter Daten.
  7. Relevance
    Sätze mit höchster Relevanz für die letzte Anfrage behalten.
  8. Caveman
    Regelbasierte Textverdichtung anwenden.
  9. Aggressive
    Stärkeres konfiguriertes Pruning anwenden.
  10. LLMLingua-2
    Code-sicheres semantisches Pruning in einem isolierten Worker.
  11. Ultra
    Stufen mit hoher Einsparung mit Schutzmechanismen kombinieren.
  12. OmniGlyph
    Berechtigte wiederholte Strukturen kompakt codieren.

Profile

Veröffentlichter Profilbereich~30%x-omniroute-compression: standard

Kompression Standard ausgewählt. Veröffentlichter Bereich ~30%.

Steuerung und Ausgabestile

  • Benannte Profile und aktiver Selektor
  • Visuelles Compression Studio
  • Anthropic Context Editing
  • Adaptiver Kontextbudget-Regler
  • Pro Anfrage \
  • Header
  • Offline-Eval-Harness
  • Auto-Trigger bei Token-Schwelle
  • Terse prose
  • Less code (YAGNI)
  • Terse CJK 文言

Steuerungsreihenfolge: Request-Header → Combo → Profil → adaptive Richtlinie → Standard.

Fehlerisolation

Anbieter-, Verbindungs- und Modellfehler isolieren.

Ein defekter Schlüssel darf keinen Anbieter lahmlegen. Ein limitiertes Modell keine Verbindung.

Modell ⊂ Verbindung ⊂ Anbieter
Provider-Circuit-BreakerIst ein Anbieter ungesund, überspringt das Combo-Routing ihn, bis eine Half-Open-Probe erfolgreich ist.
Verbindungs-CooldownEinen Schlüssel oder ein Konto abkühlen lassen, während Geschwisterverbindungen weiter bedienen.
Modell-LockoutEin rate-limitiertes oder nicht verfügbares Modell sperren, während andere Modelle der Verbindung verfügbar bleiben.

Netzwerkkontrollen

Netzwerk-Routing und lokale Datenkontrolle.

Proxy-Scopes steuern das Netzwerk-Routing, während Local-First-Speicherung Betriebsdaten auf deinem Rechner hält.

Drei Proxy-Scopes

Global, pro Anbieter oder pro einzelner Verbindung routen.

  • Global · pro Anbieter · pro Verbindung
  • SOCKS5- und HTTP(S)-Proxys
  • Proxy-Marketplace-Integration

TLS- und Client-Fingerprint-Kontrollen

Unterstützte Anbieter-Clients bis zu ausgewählten Transportmerkmalen nachbilden.

  • JA3/JA4-fähiger Transport über wreq-js
  • Anbieterspezifische Client-Profile
  • IPv4- und IPv6-Egress-Kontrollen

Privat und Local-First

Schlüssel, Nutzung und Verlauf bleiben auf dem Host, den du kontrollierst.

  • SQLite auf der Festplatte mit AES-256-GCM-verschlüsselten Zugangsdaten
  • Kein OmniRoute-Konto erforderlich
  • Self-Hosting auf Infrastruktur deiner Wahl
RusslandChinaIranKubaTürkei

Lokales Dashboard

OmniRoute konfigurieren, ohne YAML zu bearbeiten.

Verwalte Anbieter, Combos, Analysen, Zustand und Kosten unter localhost:20128/dashboard.

localhost:20128/dashboardBeispieldaten
352Anbieter verbunden
90+Free-Tiers verfügbar
198gesund in diesem Beispiel
  • Claude Code · OAuth · live
  • Cerebras · kostenlos · live
  • Groq · Cooldown-Beispiel
  • NVIDIA NIM · kostenlos · live

Agent-Protokolle

OmniRoute über MCP und A2A bereitstellen.

OmniRoute kann sein Gateway für MCP-Clients, A2A-Netzwerke und unterstützte Cloud-Coding-Agenten bereitstellen.

MCP-Server

110 Tools in 33 Scopes über stdio- und HTTP-Transport.

110 Tools · 33 Scopes · stdio / HTTP

claude mcp add omniroute --type http --url http://localhost:20128/api/mcp/stream

A2A-Server

6 Skills für Smart Routing, Kontingente, Discovery, Kostenanalyse und Zustandsberichte über JSON-RPC 2.0.

6 Skills · JSON-RPC 2.0 · Agent Card

Cloud-Agenten

Verbinde unterstützte Codex-, Cursor-, Devin- und Jules-Workflows über eine Orchestrierungsoberfläche.

Codex · Cursor · Devin · Jules

Zusätzliche Dienste

Das Gateway erweitern.

Eingebettete Dienste

Betreibe Bifrost, 9Router oder CLIProxy als verwaltete Sidecars oder fahre ein vollständiges Cluster-Profil.

Dein Wissen, im Kontext

Verbinde Notion und Obsidian als MCP-gestützte Kontextquellen.

Guardrails integriert

Prompt-Injection-Prüfungen, optionale PII-Schwärzung und normalisierte Sicherheitsfilter ohne Anbieterbindung.

Nutzungsziele

Verfolge Streaks, Erfolge und Live-Einsparungen neben den Betriebsanalysen.

Aus der Community

So wird OmniRoute genutzt und diskutiert.

Sieh, was Entwickler auf X, Reddit und YouTube bauen, fragen und teilen.

32 Videos von 32 KanälenAlle 32 Community-Videos ansehen

one local endpoint for cursor / cline / claude code / copilot 😳 OmniRoute (24.7k★ on GitHub) runs a self-hosted router on your machine so you only need one base URL for all your coding agents. wha…
Image

25 posts from X · 25 Reddit postsAlle Beiträge ansehen

Offen entwickelt

Repository-Aktivität

Stars, Forks, Contributors und Releases aus dem eingecheckten GitHub-Snapshot.

OmniRoute von Cheaper Inference

Wähle, wie du OmniRoute betreibst.

Hoste OmniRoute selbst oder starte mit Cheaper Inference als gehostetem, kostensortiertem Gateway.