bundesbrain Souveräne Inferenz Zugang anfragen

Amt für hochsichere, souveräne Inferenz · Dokument BB-2026/01

Inferenz für Code,
die Deutschland nicht verlässt.

bundesbrain betreibt ausschließlich offene KI-Modelle auf eigener Hardware in Deutschland — hochsichere Inferenz, Ende-zu-Ende vertraulich, mit Ökostrom und ohne proprietäre Blackbox. Gebaut für Programmierung und Workflows.

  • 100 % Ökostrom
  • Server in DE
  • Nur offene Modelle
  • Kein Training auf deinen Daten
verbindung: DE-░░░░ · tls1.3 · zero-log

Grundordnung

Vier Artikel, die nicht verhandelbar sind.

Datenschutz ist bei uns keine Einstellung, die man aktiviert. Er ist die Verfassung, auf der der Dienst gebaut ist.

  1. Artikel 1

    Deine Daten sind unantastbar.

    Prompts und Antworten werden nicht protokolliert, nicht gespeichert und niemals zum Training verwendet. Zero-Retention ist der Standard, nicht das Upgrade.

  2. Artikel 2

    Vertraulichkeit ohne Ausnahme.

    Verschlüsselt im Transit und im Speicher, isolierte Mandanten, Confidential Computing auf der GPU. Auch wir sehen nicht, was du rechnest.

  3. Artikel 3

    Nur offene Modelle.

    Ausschließlich offene Gewichte — prüfbar, portierbar, ohne versteckte Systemprompts. Kein Vendor-Lock-in, keine proprietäre Blackbox.

  4. Artikel 4

    Physische Souveränität.

    Hardware und Daten bleiben in Deutschland, betrieben mit Ökostrom, allein nach EU-Recht. Kein US-Cloud-Unterbau, kein Zugriff nach CLOUD Act.

Modellregister

Offene Gewichte. Auf Programmierung getrimmt.

Ein kuratiertes Register führender offener Modelle — mit Schwerpunkt auf Code-Generierung, Repo-Reasoning und Agenten-Workflows.

Modell Lizenz Kontext Schwerpunkt Status
Qwen3.6 35B-A3B MXFP8 Apache-2.0256kCode & Agenten live
DeepSeek V4 Pro MIT1MCode & Reasoning in Vorbereitung
GLM 5.2 MIT1MAgenten & Reasoning in Vorbereitung
Qwen2.5-Coder 32B Apache-2.0128kCode-Generierung in Vorbereitung
DeepSeek-Coder-V2 MIT128kRepo-Reasoning in Vorbereitung
Llama 3.3 70B Llama-Community128kAgenten & Tools in Vorbereitung
Codestral 22B MNPL256kFill-in-the-Middle in Vorbereitung
Qwen2.5 72B Qwen128kReasoning in Vorbereitung
StarCoder2 15B OpenRAIL-M16kAutovervollständigung in Vorbereitung

Betriebsnachweis

Souverän betrieben. Grün betrieben.

Kein abstraktes „die Cloud“. Eigene Hardware, grüner Strom, messbare Effizienz — alles innerhalb deutscher Grenzen. Die genauen Standorte halten wir aus Sicherheitsgründen vertraulich.

Anteil Ökostrom
0%
Byte, die DE verlassen
0
PUE-Effizienz
0
SLA-Verfügbarkeit
0%
  • NetzDual-WAN · Failover · redundante Anbindung
  • RechtDSGVO · BDSG · ausschließlich EU-Gerichtsbarkeit
  • PrüfungISO 27001 · BSI C5 · unabhängige Audits
  • StromWasserkraft & Wind · Abwärmenutzung · PUE 1.09

Verschlusssache

Ein Tunnel. Ein Hop. Kein Mitleser.

Sicherheit ist bei uns keine Schicht obendrauf, sondern die Topologie selbst. Zwischen deinem Client und der GPU gibt es keine Stelle, die aufmacht, mitliest und wieder zumacht.

  1. § 1 · Versiegelter Host

    Zugang endet nach dem Setup.

    Nach der Provisionierung ist der Inferenz-Host auch für uns nicht mehr erreichbar: kein SSH, keine Management-Ebene, kein Admin-Konto. Versiegelt und gemessen.

  2. § 2 · Terminierung

    HTTPS endet erst im Host.

    Die TLS-Verbindung wird ausschließlich im Inferenz-Host abgeschlossen — nicht in einem Gateway, nicht in einem Load-Balancer davor. Ein Endpunkt, kein Umweg.

  3. § 3 · Kein Zwischenhalt

    Niemand macht auf und wieder zu.

    Zwischen dir und dem Host liegt keine Station, die entschlüsselt und neu verschlüsselt. Die Vertraulichkeit bleibt auf der ganzen Strecke gewahrt.

  4. § 4 · Attestierung

    Prüf nach, bevor du sendest.

    Per Remote-Attestation weist der Host kryptografisch nach, dass exakt das veröffentlichte, offene Image läuft — bevor das erste Byte fließt.

  5. § 5 · Flüchtiger Speicher

    Nichts berührt die Platte.

    Prompt, Kontext und KV-Cache liegen nur im geschützten Speicher und werden nach der Antwort genullt. Keine Auslagerung, kein Log, keine Spur.

  6. § 6 · Schlüssel im Haus

    Das Geheimnis verlässt den Host nie.

    Der private Schlüssel entsteht im Host und wird nie exportiert. Keine zentrale Ablage, die jemand kompromittieren könnte — auch wir nicht.

Vermittlungsstelle

Wer nach Modell routet, muss aufmachen.
Also läuft der Verteiler bei dir.

Ein zentrales Gateway müsste deine Anfrage öffnen, um das Modell zu erkennen — genau die Mittelbox, die es hier nicht geben darf. Deshalb übernimmt der bundesbrain-Agent das lokal: ein kleines Programm in der Menüleiste, das Anfragen annimmt und selbst die direkte Leitung zum richtigen versiegelten Host legt.

  1. 01

    Lokal annehmen

    inferenz.bundesbrain.de zeigt auf 127.0.0.1. Deine Tools sprechen eine echte HTTPS-URL mit gültigem Zertifikat — angenommen wird auf deiner Maschine, nicht auf unserer.

  2. 02

    Nach Modell zuordnen

    Der Agent liest allein den Modellnamen und schlägt den zuständigen Host in einer signierten Tabelle nach — qwen3.6host-1, deepseekhost-4.

  3. 03

    Direkt verbinden

    Eine durchgehende TLS-1.3-Leitung zu host-N.api.bundesbrain.de — sie endet erst im versiegelten Host. Kein Proxy, kein Load-Balancer, kein Zwischenhalt.

bundesbrain-Agent verbunden
Aktive Leitungen · Direktverbindung
  • host-1 qwen3.6:35b-a3b 840 tok/s
  • host-2 qwen3.6:35b-a3b 560 tok/s
  • host-4 deepseek-coder-v2 in Vorbereitung
Warteschlange
0
Flotten-Last
58%
Ø Latenz
210ms

0 Byte gespeichert · 0 Byte verließen DE

  • MenüleisteLäuft im Hintergrund, ein Icon zeigt Auslastung und Status. macOS · Windows · Linux.
  • Fail-safeAgent aus, Leitung tot: connection refused. Ohne Vermittlung verlässt kein Byte die Maschine.
  • AttestierungPrüft die Remote-Attestation des Hosts, bevor das erste Byte fließt — sonst kein Verbindungsaufbau.
  • Signierte Host-TabelleModell→Host aktualisiert sich signiert. Nur Routing-Metadaten, niemals deine Prompts.

Schnittstelle

Ein Endpoint-Wechsel. Sonst nichts.

Kompatibel zur OpenAI-API. Zeig deine bestehenden Tools auf inferenz.bundesbrain.de/v1 — der lokale bundesbrain-Agent nimmt an und verbindet direkt zum richtigen Host. IDE, Terminal und Pipeline laufen weiter.

// OpenAI-kompatibel — der lokale Agent nimmt an, routet nach Modell
curl https://inferenz.bundesbrain.de/v1/chat/completions \
  -H "Authorization: Bearer $BB_KEY" \
  -d '{
    "model": "qwen2.5-coder-32b",
    "messages": [{"role":"user",
      "content":"Refactor diese Funktion"}]
  }'

In deiner IDE

Basis-URL in Continue, Zed oder Cline eintragen — Autocomplete und Chat laufen souverän, ohne dass Code das Land verlässt.

Im Terminal

Die bb-CLI liest Diffs, schreibt Patches und erklärt Stacktraces — skriptbar und ohne Telemetrie.

In der Pipeline

Deterministische Code-Reviews in CI, mit klarem Exit-Code. Abrechnung pro Token, protokollfrei.

Gebührenordnung

In Euro. Aus Deutschland. Ohne Kleingedrucktes.

Getrennt abgerechnet nach Eingabe- und Ausgabe-Token — Ausgabe ist rechenintensiver und daher teurer. Keine Mindestabnahme, keine versteckten Kosten. Preise pro 1 Mio. Token für qwen3.6:35b-a3b-mxfp8.

Start

Eingabe€0,20/ Mio.
Ausgabe€0,90/ Mio.

Pay-as-you-go, sofort startklar.

  • Offene Gewichte, geprüft
  • Zero-Log & Zero-Retention
  • Tokengenaue Abrechnung
  • OpenAI-kompatible API
Loslegen
Empfohlen

Team

Eingabe€0,15/ Mio.
Ausgabe€0,70/ Mio.

Volumen-Staffel für Teams & Produkte.

  • Alles aus Start
  • Höhere Rate-Limits
  • Nutzer- & Schlüsselverwaltung
  • Priorisierter Support in DE
Zugang anfragen

Souverän

Fixpreis / MonatDediziertreservierter Node

Dedizierte Hardware für Behörden und regulierte Branchen.

  • Reservierte Hardware, keine Token-Grenze
  • On-Premise-Betrieb möglich
  • Vertrag nach deutschem Recht
  • BSI-konforme Abnahme
Gespräch vereinbaren

Antrag auf Zugang

Souveränität ist keine Funktion.
Sie ist die Grundlage.

Trag dich für den Zugang ein. Wir melden uns aus Deutschland, von einem Menschen, meist binnen eines Werktags.

Ganz ohne Formular

Passend zu unserem Versprechen: kein Formular, kein Tracking. Schreib uns direkt — eine dienstliche E-Mail genügt. Nenn kurz deinen Einsatzzweck; wir antworten aus Deutschland, von einem Menschen, meist binnen eines Werktags.

Sende eine E-Mail an uns

kontakt@bundesbrain.de