Keera Engine

Des modèles ouverts, exploités efficacement

Keera Engine est le moteur d'inférence derrière la passerelle. Il exploite tout modèle ouvert avec des technologies ouvertes - Kubernetes, vLLM et llm-d - sur des GPU suisses ou dans votre propre cluster. Plus de réponses par GPU, et aucune couche n'est une boîte noire.

Essayer Keera Voir Keera Gateway ➔

Keera programme sur son portable

Ce qu'est Keera Engine

Un moteur d'inférence fait de briques ouvertes : Kubernetes planifie les GPU, vLLM et llm-d servent les requêtes, les modèles ouverts tournent dessus. Tout en haut, une API tout à fait ordinaire : ce qui parle à OpenAI aujourd'hui parle à Keera demain.

L'API

Compatible OpenAI. Une base URL, une clé, et tout client qui parle déjà à OpenAI parle à Keera - sans nouveau SDK ni plugin.

Les modèles

Agnostique : tout modèle ouvert que vLLM sait servir, plus trois fine-tunes Keera et les vôtres. Vous pouvez lire ce qu'ils contiennent et tout emporter quand vous voulez.

Le serveur d'inférence

vLLM regroupe de nombreuses requêtes sur un seul GPU. llm-d envoie chacune là où son contexte est déjà en cache. Le même matériel calcule plus de tokens.

La plateforme

Kubernetes répartit les modèles sur les GPU et les adapte à la charge. Dans des centres de données suisses ou dans vos propres baies, sans aucune connexion s'il le faut.

De haut en bas : ce que voit votre client, et ce qui tourne en dessous.

Les modèles

Le moteur exploite tout modèle ouvert que vLLM sait servir - Qwen, Llama, Mistral, Apertus ou votre propre fine-tune. Trois fine-tunes de notre main tournent dès le premier jour. Choisissez par espace de travail - ou laissez la passerelle router : les petites tâches au modèle rapide, le raisonnement difficile au plus puissant.

Modèle Contexte Idéal pour
Keera Deep 256k Travail agentique sur de nombreux fichiers
Keera Swiss 128k Code et documentation en allemand, français et italien
Keera Fast 64k Complétion, tests, hygiène des commits
Votre propre fine-tune - Frameworks internes et code légataire
Tout autre modèle ouvert - Ce dont votre cas d'usage a besoin

Keera Deep et Keera Fast sont dérivés de Qwen-Coder, Keera Swiss d'Apertus. Tous trois sont sous Apache-2.0 : vous pouvez télécharger les poids et les emporter.

Les fournisseurs hébergés - aujourd'hui les modèles OpenAI - passent par les mêmes politiques, mais tournent sur l'infrastructure du fournisseur et non sur des GPU suisses. Ils sont bloqués par défaut ; un tenant les ouvre par équipe et par classe de données, ou pas du tout. État : septembre 2026.

Des technologies ouvertes, exploitées par nous

Kubernetes, vLLM et llm-d sont open source et largement utilisés. Nous ne réinventons rien. Nous accordons les briques entre elles et les exploitons - dans des centres de données suisses ou avec votre équipe, dans votre propre cluster.

Chaque token calculé par le moteur passe d'abord par Keera Gateway : les mêmes politiques et le même journal d'audit que partout ailleurs.

Keera et un ingénieur devant le même écran

Questions fréquentes

Ce que les équipes plateforme et d'ingénierie nous demandent le plus souvent avant d'essayer Keera Engine.

Mes données restent-elles chez moi ?

Oui. Les modèles tournent sur des GPU suisses ou dans vos propres baies ; prompts et code y partent pour l'inférence et reviennent. Ils ne sont pas conservés, la réponse du modèle non plus, et rien n'est entraîné avec. Ce qui est conservé, c'est la requête elle-même - qui, quand, quel modèle - dans le journal de votre propre infrastructure.

Les modèles ouverts sont-ils assez bons ?

Pour le travail quotidien, oui : refactorings sur de nombreux fichiers, tests, migrations, revues. Sur le raisonnement le plus difficile, les grands modèles propriétaires gardent une avance - c'est pourquoi ils passent par la même passerelle et s'ouvrent par équipe et par classe de données. Nous ne prétendons pas que les poids ouverts gagnent partout. Nous prétendons que le choix vous reste.

Quel rapport avec Keera Gateway ?

Keera Engine se place derrière la passerelle et exploite les modèles ouverts vers lesquels elle route. La passerelle décide qui peut utiliser quel modèle et inscrit chaque requête au journal d'audit ; le moteur calcule la réponse. Vous pouvez commencer avec la passerelle et les fournisseurs que vous avez déjà, puis ajouter le moteur quand les modèles doivent venir chez vous.

Essayer Keera

Nous mettons une équipe sur le moteur, mesurons avec vous débit et coûts et vous remettons les chiffres. Après 30 jours, c'est vous qui décidez.

Intérêt pour
Nous utilisons vos données uniquement pour répondre à cette demande.