Belege · Stand 25. Juli 2026
Benchmarks & Belege
Auf der Startseite steht, dass auf dem Bus ein offenes Modell der Spitzenklasse läuft. Das ist eine nachprüfbare Aussage — hier stehen die Zahlen dahinter, mit Datum und Quelle, samt der Disziplinen, in denen das Modell verliert. Wenn eine dieser Zahlen veraltet ist, sagen Sie uns bitte Bescheid: kontakt@llm-bus.de.
Kimi K2.6 gegen das geschlossene Spitzenmodell
Beide Modelle im Stand April 2026. K2.6 ist das Modell, das auf dem Starter-Bus läuft; GPT-5.5 war zu diesem Zeitpunkt OpenAIs Spitzenmodell.
| Benchmark | Was er misst | Kimi K2.6 | GPT-5.5 | Ergebnis |
|---|---|---|---|---|
| SWE-bench Pro reale Software-Aufgaben, agentisch gelöst | Programmieren | 58,6 | 58,6 | gleichauf |
| DeepSearchQA Recherche über viele Quellen hinweg | Recherche | 92,5 | 78,6 | K2.6 vorn |
| HLE, mit Werkzeugen schwere Fachfragen, Tool-Nutzung erlaubt | Fachwissen | 54,0 | 52,2 | K2.6 vorn |
| GPQA Diamond Naturwissenschaft auf Promotionsniveau | Fachwissen | 90,5 | 93,6 | GPT-5.5 vorn |
| HLE, ohne Werkzeuge dieselben Fragen, ohne Hilfsmittel | Fachwissen | 34,7 | 41,4 | GPT-5.5 vorn |
Was diese Zahlen nicht sagen
- Es sind überwiegend englischsprachige Programmier- und Reasoning-Benchmarks. Über die Qualität deutscher Fachsprache — Schriftsätze, Arztbriefe, Gutachten, Angebote — sagen sie nichts. Das müssen Sie mit Ihren eigenen Dokumenten prüfen; genau dafür ist die Pilotwoche da.
- Gleichstand in einem Benchmark ist keine Produktgleichheit. Kontextfenster, Werkzeug-Anbindung und Multimodalität unterscheiden sich deutlich.
- Geschlossene Modelle ziehen im Monatsrhythmus nach. Zum Stand dieser Seite ist bereits GPT-5.6 verfügbar; die offene Kimi-Linie folgt der jeweiligen Spitze bei Programmier- und Agenten-Aufgaben mit rund 0–3 Monaten Abstand, bei rein akademischem Fachwissen mit mehr.
- Die Werte stammen aus veröffentlichten Benchmark-Berichten, nicht aus eigenen Messungen.
Modellgröße gegen die On-Prem-Appliance
Der Vergleich, der auf der Startseite steht — hier mit den konkreten Angaben. Beide laufen auf derselben GPU-Familie.
| System | Modell | Parameter | GPUs |
|---|---|---|---|
| Fujitsu Private GPT die bekannteste On-Prem-Appliance am deutschen Markt | Mistral Small 3.2 | 24 Mrd. | 1× RTX PRO 6000 |
| LLM BUS Starter | Kimi K2.6 | 1.000 Mrd. davon 32 Mrd. pro Anfrage aktiv (MoE) | 8× RTX PRO 6000 |
Dieselbe Hardware-Familie, rund das 40-fache Modell. Angaben zu Fujitsu aus dem öffentlichen Private-GPT-Whitepaper; Preise veröffentlicht Fujitsu nicht.
Geschwindigkeit — was gemessen ist und was gerechnet
Wir trennen das bewusst, weil der Unterschied im Verkaufsgespräch regelmäßig verwischt wird.
| Angabe | Konfiguration | Durchsatz | Status |
|---|---|---|---|
| Referenz-Benchmark veröffentlichte Messung auf fremder Hardware | Kimi K2.5 auf 8× NVIDIA B300 | ~1.900 Tok/s aggregiert | gemessen — aber nicht unsere Konfiguration |
| Starter-Bus unsere Konfiguration | Kimi K2.6 INT4 auf 8× RTX PRO 6000 | ~20–40 Tok/s je Nutzer ~400–1.000 Tok/s bei 32–64 Sitzungen | gerechnet, noch nicht gemessen |
- Die Starter-Zahl stammt aus Bandbreiten-Rechnung und veröffentlichten Werten derselben Hardware-Klasse, nicht aus einer Messung an unserem Fahrzeug. Die Karten sind über PCIe verbunden, nicht über NVLink — das kostet bei einem Mixture-of-Experts-Modell Parallelität.
- Vor dem ersten Piloten messen wir den fertigen Bus selbst und veröffentlichen das Ergebnis hier, mit Datum. Auch wenn es schlechter ausfällt als die Rechnung.
- Der spürbare Engpass im Alltag ist selten die Tokenrate, sondern die Zeit, bis ein sehr langes Dokument eingelesen ist (Prefill). Deshalb begrenzen wir im Pilotprofil das Kontextfenster, statt mit der theoretischen Obergrenze zu werben.
Modelle und Lizenzen
- Kimi K2.6 — Modified-MIT. Kommerzielle Nutzung erlaubt, Gewichte offen und inspizierbar. Das ist das Modell im Starter-Bus.
- Kimi K3 — offene Gewichte für Ende Juli 2026 angekündigt, der Lizenztext lag zum Stand dieser Seite noch nicht vor. Deshalb steht der Flagship-Bus bei uns auf der Warteliste und nicht im Preisblatt. Wir verkaufen keine Konfiguration, deren Lizenz wir nicht gelesen und deren Leistung wir nicht gemessen haben.
- Alternativen auf derselben Hardware — Mistral (Apache 2.0, Frankreich), Llama, Qwen, GPT-OSS. Der Bus ist nicht auf einen Modellanbieter festgelegt.
- Teuken / OpenGPT-X (Fraunhofer) — für Häuser, die ausdrücklich ein in Deutschland trainiertes Modell wollen. Die Lizenz der jeweiligen Fassung klären wir vorher im Einzelfall; frühere Versionen standen unter einer nicht-kommerziellen Lizenz.
Quellen
- CodingFleet — GPT-5.5 vs. Kimi K2.6 (Juni 2026) — Benchmark-Gegenüberstellung
- Moonshot AI — Kimi-Modellblog — Herstellerangaben zur Kimi-Linie
- Hugging Face — Kimi K3, MXFP4, offene Gewichte — Format und Ankündigung
- Benchmarking Kimi K2.5 auf NVIDIA B300 (SGLang vs. vLLM) — die gemessene Durchsatzangabe
- K2.6 Self-Hosting-Guide (vLLM / SGLang / KTransformers) — Speicher- und Laufzeitangaben
- Fujitsu — Private GPT Whitepaper (PDF) — Modell und Hardware der Appliance
Diese Seite lädt nichts von Drittservern; die Links öffnen erst, wenn Sie sie anklicken. Letzte Aktualisierung: 25. Juli 2026.