Keera Engine
Offene Modelle, effizient betrieben
Keera Engine ist die Inferenz-Engine hinter dem Gateway. Sie betreibt jedes offene Modell - mit offener Technik wie Kubernetes, vLLM und llm-d, auf Schweizer GPUs oder in deinem eigenen Cluster. Mehr Antworten pro GPU, und keine Schicht ist eine Blackbox.
Was Keera Engine ist
Eine Inferenz-Engine aus offenen Bausteinen: Kubernetes plant die GPUs, vLLM und llm-d rechnen, darauf laufen offene Modelle. Obendrauf liegt eine ganz normale API - was heute mit OpenAI spricht, spricht morgen mit Keera.
Die API
OpenAI-kompatibel. Eine Base-URL, ein Schlüssel, und jeder Client, der schon mit OpenAI redet, redet mit Keera - ohne neues SDK und ohne Plugin.
Die Modelle
Modellagnostisch: jedes offene Modell, das vLLM kennt, dazu drei Keera-Fine-Tunes und deine eigenen. Du kannst nachlesen, was drinsteckt, und alles jederzeit mitnehmen.
Der Inferenz-Server
vLLM bündelt viele Anfragen auf einer GPU. llm-d schickt jede dorthin, wo ihr Kontext schon im Cache liegt. So rechnet dieselbe Hardware mehr Tokens.
Die Plattform
Kubernetes verteilt die Modelle auf die GPUs und skaliert sie mit der Last. In Schweizer Rechenzentren oder in deinen eigenen Racks, auch ganz ohne Internet.
Die Modelle
Die Engine betreibt jedes offene Modell, das vLLM kennt - Qwen, Llama, Mistral, Apertus oder deinen eigenen Fine-Tune. Drei Fine-Tunes von uns laufen ab dem ersten Tag. Wähle pro Workspace - oder lass das Gateway routen: kleine Aufgaben an das schnelle Modell, schwieriges Reasoning an das starke.
| Modell | Kontext | Ideal für |
|---|---|---|
| Keera Deep | 256k | Agentische Arbeit über viele Dateien |
| Keera Swiss | 128k | Code und Dokumentation auf Deutsch, Französisch, Italienisch |
| Keera Fast | 64k | Completion, Tests, Commit-Hygiene |
| Dein Fine-Tune | - | Interne Frameworks und Legacy-Code |
| Jedes andere offene Modell | - | Was dein Anwendungsfall braucht |
Keera Deep und Keera Fast sind von Qwen-Coder abgeleitet, Keera Swiss von Apertus. Alle drei stehen unter Apache-2.0: du kannst die Weights herunterladen und mitnehmen.
Gehostete Anbieter - heute die OpenAI-Modelle - hängen hinter denselben Policies, laufen aber auf der Infrastruktur des Anbieters und nicht auf Schweizer GPUs. Sie sind standardmässig gesperrt; ein Tenant gibt sie pro Team und Datenklasse frei, oder gar nicht. Stand September 2026.
Offene Technik, von uns betrieben
Kubernetes, vLLM und llm-d sind Open Source und breit im Einsatz. Wir erfinden nichts davon neu. Wir stimmen die Teile aufeinander ab und betreiben sie - in Schweizer Rechenzentren oder zusammen mit deinem Team im eigenen Cluster.
Jedes Token, das die Engine rechnet, läuft vorher durch Keera Gateway: dieselben Policies, dasselbe Audit-Log wie überall sonst.
Häufige Fragen
Das fragen uns Plattform- und Engineering-Teams am häufigsten, bevor sie Keera Engine ausprobieren.
Bleiben meine Daten im Haus?
Ja. Die Modelle laufen auf Schweizer GPUs oder in deinen eigenen Racks; Prompts und Code gehen zur Inferenz dorthin und wieder zurück. Gespeichert werden sie nicht, die Antwort des Modells auch nicht, und trainiert wird damit nichts. Festgehalten wird nur die Anfrage selbst - wer, wann, welches Modell - im Log in deiner Infrastruktur.
Sind offene Modelle gut genug?
Für die tägliche Arbeit ja: Refactorings über viele Dateien, Tests, Migrationen, Reviews. Beim schwierigsten Reasoning liegen die grossen proprietären Modelle weiter vorn - deshalb hängen sie am selben Gateway und lassen sich pro Team und Datenklasse freigeben. Wir behaupten nicht, dass offene Weights überall gewinnen. Wir behaupten, dass du die Wahl behältst.
Wie hängt das mit Keera Gateway zusammen?
Keera Engine steht hinter dem Gateway und betreibt die offenen Modelle, an die es routet. Das Gateway entscheidet, wer welches Modell nutzen darf, und schreibt jede Anfrage ins Audit-Log; die Engine rechnet die Antwort. Du kannst mit dem Gateway und den Anbietern anfangen, die du schon hast, und die Engine dazunehmen, sobald die Modelle ins eigene Haus sollen.
Keera testen
Wir schalten ein Team auf die Engine, messen mit dir Durchsatz und Kosten und zeigen dir die Zahlen. Nach 30 Tagen entscheidest du.