Keera Engine

Offene Modelle, effizient betrieben

Keera Engine ist die Inferenz-Engine hinter dem Gateway. Sie betreibt jedes offene Modell - mit offener Technik wie Kubernetes, vLLM und llm-d, auf Schweizer GPUs oder in deinem eigenen Cluster. Mehr Antworten pro GPU, und keine Schicht ist eine Blackbox.

Keera testen Keera Gateway ansehen ➔

Keera programmiert am Laptop

Was Keera Engine ist

Eine Inferenz-Engine aus offenen Bausteinen: Kubernetes plant die GPUs, vLLM und llm-d rechnen, darauf laufen offene Modelle. Obendrauf liegt eine ganz normale API - was heute mit OpenAI spricht, spricht morgen mit Keera.

Die API

OpenAI-kompatibel. Eine Base-URL, ein Schlüssel, und jeder Client, der schon mit OpenAI redet, redet mit Keera - ohne neues SDK und ohne Plugin.

Die Modelle

Modellagnostisch: jedes offene Modell, das vLLM kennt, dazu drei Keera-Fine-Tunes und deine eigenen. Du kannst nachlesen, was drinsteckt, und alles jederzeit mitnehmen.

Der Inferenz-Server

vLLM bündelt viele Anfragen auf einer GPU. llm-d schickt jede dorthin, wo ihr Kontext schon im Cache liegt. So rechnet dieselbe Hardware mehr Tokens.

Die Plattform

Kubernetes verteilt die Modelle auf die GPUs und skaliert sie mit der Last. In Schweizer Rechenzentren oder in deinen eigenen Racks, auch ganz ohne Internet.

Von oben nach unten: was dein Client sieht, und was darunter läuft.

Die Modelle

Die Engine betreibt jedes offene Modell, das vLLM kennt - Qwen, Llama, Mistral, Apertus oder deinen eigenen Fine-Tune. Drei Fine-Tunes von uns laufen ab dem ersten Tag. Wähle pro Workspace - oder lass das Gateway routen: kleine Aufgaben an das schnelle Modell, schwieriges Reasoning an das starke.

Modell Kontext Ideal für
Keera Deep 256k Agentische Arbeit über viele Dateien
Keera Swiss 128k Code und Dokumentation auf Deutsch, Französisch, Italienisch
Keera Fast 64k Completion, Tests, Commit-Hygiene
Dein Fine-Tune - Interne Frameworks und Legacy-Code
Jedes andere offene Modell - Was dein Anwendungsfall braucht

Keera Deep und Keera Fast sind von Qwen-Coder abgeleitet, Keera Swiss von Apertus. Alle drei stehen unter Apache-2.0: du kannst die Weights herunterladen und mitnehmen.

Gehostete Anbieter - heute die OpenAI-Modelle - hängen hinter denselben Policies, laufen aber auf der Infrastruktur des Anbieters und nicht auf Schweizer GPUs. Sie sind standardmässig gesperrt; ein Tenant gibt sie pro Team und Datenklasse frei, oder gar nicht. Stand September 2026.

Offene Technik, von uns betrieben

Kubernetes, vLLM und llm-d sind Open Source und breit im Einsatz. Wir erfinden nichts davon neu. Wir stimmen die Teile aufeinander ab und betreiben sie - in Schweizer Rechenzentren oder zusammen mit deinem Team im eigenen Cluster.

Jedes Token, das die Engine rechnet, läuft vorher durch Keera Gateway: dieselben Policies, dasselbe Audit-Log wie überall sonst.

Keera und ein Engineer am selben Bildschirm

Häufige Fragen

Das fragen uns Plattform- und Engineering-Teams am häufigsten, bevor sie Keera Engine ausprobieren.

Bleiben meine Daten im Haus?

Ja. Die Modelle laufen auf Schweizer GPUs oder in deinen eigenen Racks; Prompts und Code gehen zur Inferenz dorthin und wieder zurück. Gespeichert werden sie nicht, die Antwort des Modells auch nicht, und trainiert wird damit nichts. Festgehalten wird nur die Anfrage selbst - wer, wann, welches Modell - im Log in deiner Infrastruktur.

Sind offene Modelle gut genug?

Für die tägliche Arbeit ja: Refactorings über viele Dateien, Tests, Migrationen, Reviews. Beim schwierigsten Reasoning liegen die grossen proprietären Modelle weiter vorn - deshalb hängen sie am selben Gateway und lassen sich pro Team und Datenklasse freigeben. Wir behaupten nicht, dass offene Weights überall gewinnen. Wir behaupten, dass du die Wahl behältst.

Wie hängt das mit Keera Gateway zusammen?

Keera Engine steht hinter dem Gateway und betreibt die offenen Modelle, an die es routet. Das Gateway entscheidet, wer welches Modell nutzen darf, und schreibt jede Anfrage ins Audit-Log; die Engine rechnet die Antwort. Du kannst mit dem Gateway und den Anbietern anfangen, die du schon hast, und die Engine dazunehmen, sobald die Modelle ins eigene Haus sollen.

Keera testen

Wir schalten ein Team auf die Engine, messen mit dir Durchsatz und Kosten und zeigen dir die Zahlen. Nach 30 Tagen entscheidest du.

Interesse an
Wir nutzen deine Angaben nur für die Antwort auf diese Anfrage.