In deiner IDE
Basis-URL in Continue, Zed oder Cline eintragen — Autocomplete und Chat laufen souverän, ohne dass Code das Land verlässt.
Amt für hochsichere, souveräne Inferenz · Dokument BB-2026/01
bundesbrain betreibt ausschließlich offene KI-Modelle auf eigener Hardware in Deutschland — hochsichere Inferenz, Ende-zu-Ende vertraulich, mit Ökostrom und ohne proprietäre Blackbox. Gebaut für Programmierung und Workflows.
Grundordnung
Datenschutz ist bei uns keine Einstellung, die man aktiviert. Er ist die Verfassung, auf der der Dienst gebaut ist.
Prompts und Antworten werden nicht protokolliert, nicht gespeichert und niemals zum Training verwendet. Zero-Retention ist der Standard, nicht das Upgrade.
Verschlüsselt im Transit und im Speicher, isolierte Mandanten, Confidential Computing auf der GPU. Auch wir sehen nicht, was du rechnest.
Ausschließlich offene Gewichte — prüfbar, portierbar, ohne versteckte Systemprompts. Kein Vendor-Lock-in, keine proprietäre Blackbox.
Hardware und Daten bleiben in Deutschland, betrieben mit Ökostrom, allein nach EU-Recht. Kein US-Cloud-Unterbau, kein Zugriff nach CLOUD Act.
Modellregister
Ein kuratiertes Register führender offener Modelle — mit Schwerpunkt auf Code-Generierung, Repo-Reasoning und Agenten-Workflows.
| Modell | Lizenz | Kontext | Schwerpunkt | Status |
|---|---|---|---|---|
| Qwen3.6 35B-A3B MXFP8 | Apache-2.0 | 256k | Code & Agenten | live |
| DeepSeek V4 Pro | MIT | 1M | Code & Reasoning | in Vorbereitung |
| GLM 5.2 | MIT | 1M | Agenten & Reasoning | in Vorbereitung |
| Qwen2.5-Coder 32B | Apache-2.0 | 128k | Code-Generierung | in Vorbereitung |
| DeepSeek-Coder-V2 | MIT | 128k | Repo-Reasoning | in Vorbereitung |
| Llama 3.3 70B | Llama-Community | 128k | Agenten & Tools | in Vorbereitung |
| Codestral 22B | MNPL | 256k | Fill-in-the-Middle | in Vorbereitung |
| Qwen2.5 72B | Qwen | 128k | Reasoning | in Vorbereitung |
| StarCoder2 15B | OpenRAIL-M | 16k | Autovervollständigung | in Vorbereitung |
Betriebsnachweis
Kein abstraktes „die Cloud“. Eigene Hardware, grüner Strom, messbare Effizienz — alles innerhalb deutscher Grenzen. Die genauen Standorte halten wir aus Sicherheitsgründen vertraulich.
Verschlusssache
Sicherheit ist bei uns keine Schicht obendrauf, sondern die Topologie selbst. Zwischen deinem Client und der GPU gibt es keine Stelle, die aufmacht, mitliest und wieder zumacht.
Die Verschlüsselung wird auf der gesamten Strecke an keinem Punkt gebrochen. HTTPS endet erst dort, wo gerechnet wird.
Nach der Provisionierung ist der Inferenz-Host auch für uns nicht mehr erreichbar: kein SSH, keine Management-Ebene, kein Admin-Konto. Versiegelt und gemessen.
Die TLS-Verbindung wird ausschließlich im Inferenz-Host abgeschlossen — nicht in einem Gateway, nicht in einem Load-Balancer davor. Ein Endpunkt, kein Umweg.
Zwischen dir und dem Host liegt keine Station, die entschlüsselt und neu verschlüsselt. Die Vertraulichkeit bleibt auf der ganzen Strecke gewahrt.
Per Remote-Attestation weist der Host kryptografisch nach, dass exakt das veröffentlichte, offene Image läuft — bevor das erste Byte fließt.
Prompt, Kontext und KV-Cache liegen nur im geschützten Speicher und werden nach der Antwort genullt. Keine Auslagerung, kein Log, keine Spur.
Der private Schlüssel entsteht im Host und wird nie exportiert. Keine zentrale Ablage, die jemand kompromittieren könnte — auch wir nicht.
Vermittlungsstelle
Ein zentrales Gateway müsste deine Anfrage öffnen, um das Modell zu erkennen — genau die Mittelbox, die es hier nicht geben darf. Deshalb übernimmt der bundesbrain-Agent das lokal: ein kleines Programm in der Menüleiste, das Anfragen annimmt und selbst die direkte Leitung zum richtigen versiegelten Host legt.
inferenz.bundesbrain.de zeigt auf 127.0.0.1. Deine Tools
sprechen eine echte HTTPS-URL mit gültigem Zertifikat — angenommen wird auf
deiner Maschine, nicht auf unserer.
Der Agent liest allein den Modellnamen und schlägt den zuständigen Host in einer
signierten Tabelle nach — qwen3.6 → host-1,
deepseek → host-4.
Eine durchgehende TLS-1.3-Leitung zu host-N.api.bundesbrain.de — sie
endet erst im versiegelten Host. Kein Proxy, kein Load-Balancer, kein Zwischenhalt.
0 Byte gespeichert · 0 Byte verließen DE
Schnittstelle
Kompatibel zur OpenAI-API. Zeig deine bestehenden Tools auf
inferenz.bundesbrain.de/v1 — der lokale bundesbrain-Agent
nimmt an und verbindet direkt zum richtigen Host. IDE, Terminal und Pipeline laufen weiter.
// OpenAI-kompatibel — der lokale Agent nimmt an, routet nach Modell
curl https://inferenz.bundesbrain.de/v1/chat/completions \
-H "Authorization: Bearer $BB_KEY" \
-d '{
"model": "qwen2.5-coder-32b",
"messages": [{"role":"user",
"content":"Refactor diese Funktion"}]
}'
# pip install openai — nichts Neues zu lernen
from openai import OpenAI
client = OpenAI(
base_url="https://inferenz.bundesbrain.de/v1",
api_key=os.environ["BB_KEY"],
)
resp = client.chat.completions.create(
model="deepseek-coder-v2",
messages=[{"role": "user",
"content": "Schreib Tests dafür"}],
)
// Drop-in im TypeScript-SDK
import OpenAI from "openai";
const bund = new OpenAI({
baseURL: "https://inferenz.bundesbrain.de/v1",
apiKey: process.env.BB_KEY,
});
const out = await bund.chat.completions.create({
model: "llama-3.3-70b",
stream: true,
messages: [{ role: "user", content: "Baue mir ein CLI" }],
});
# Die bundesbrain-CLI bringt Agent & Tray gleich mit
$ brew install bundesbrain/tap/bb
$ bb auth login
$ bb agent start # Menüleisten-Verteiler läuft, hört auf 127.0.0.1
# In der Pipeline: Diff prüfen lassen, exit-code 1 bei Findings
$ git diff | bb review --model qwen2.5-coder-32b --fail-on high
# Ganze Datei umschreiben, direkt in place
$ bb edit src/server.ts "Rate-Limiting einbauen"
Basis-URL in Continue, Zed oder Cline eintragen — Autocomplete und Chat laufen souverän, ohne dass Code das Land verlässt.
Die bb-CLI liest Diffs, schreibt Patches und erklärt Stacktraces —
skriptbar und ohne Telemetrie.
Deterministische Code-Reviews in CI, mit klarem Exit-Code. Abrechnung pro Token, protokollfrei.
Gebührenordnung
Getrennt abgerechnet nach Eingabe- und Ausgabe-Token — Ausgabe ist
rechenintensiver und daher teurer. Keine Mindestabnahme, keine versteckten Kosten.
Preise pro 1 Mio. Token für qwen3.6:35b-a3b-mxfp8.
Pay-as-you-go, sofort startklar.
Volumen-Staffel für Teams & Produkte.
Dedizierte Hardware für Behörden und regulierte Branchen.
Antrag auf Zugang
Trag dich für den Zugang ein. Wir melden uns aus Deutschland, von einem Menschen, meist binnen eines Werktags.
Ganz ohne Formular
Passend zu unserem Versprechen: kein Formular, kein Tracking. Schreib uns direkt — eine dienstliche E-Mail genügt. Nenn kurz deinen Einsatzzweck; wir antworten aus Deutschland, von einem Menschen, meist binnen eines Werktags.
Sende eine E-Mail an unskontakt@bundesbrain.de