Unsere lokalen LLMs im Einsatz

Auf diese lokalen Open-Source-Modelle setzen wir aktuell. Wir versuchen, so viel wie möglich unserer KI-Arbeit mit lokalen Modellen abzubilden — alle laufen auf unserer eigenen Infrastruktur, im hauseigenen Bürokeller.

Reasoning & Coding

Die Denker: komplexe Analysen, Geschäftslogik und Unterstützung beim Programmieren.

deepseek-v4:flash
Flaggschiff: Analysen, Buchungslogik, komplexes Coding
DeepSeek AI (CN) ~102 GB RAM MIT
kimi-linear:48b
Alltags-Sprinter, lange Dokumente & Kontextverständnis
Moonshot AI (CN) 30 GB RAM MIT
qwen3-coder:30b
Coding-Spezialist für schnelle Iterationen & Agenten-Tasks
Alibaba / Qwen (CN) 18 GB RAM Apache 2.0
qwen3.6:35b
Reserve-Mittelklasse
Alibaba / Qwen (CN) 23 GB RAM Apache 2.0

Vision & Dokumente

Die Augen: Bilder verstehen und gescannte Dokumente in verwertbaren Text verwandeln.

qwen3-vl:32b
Detailliertes Bildverständnis: Screenshots, Diagramme, Belege
Alibaba / Qwen (CN) 20 GB RAM Apache 2.0
qwen3-vl:8b
Schnelle Vision-Variante für einfache Bildaufgaben
Alibaba / Qwen (CN) 6,1 GB RAM Apache 2.0
gemma4:31b
Bild-Input + stilsichere Texte
Google 19 GB RAM Gemma-Lizenz
deepseek-ocr
PDF/Scan → Markdown
DeepSeek AI (CN) 6,7 GB RAM MIT

Retrieval & Suche

Das Gedächtnis: findet in grossen Datenbeständen die passenden Inhalte.

qwen3-embedding:8b
Vektoren für Ähnlichkeitssuche
Alibaba / Qwen (CN) 4,7 GB RAM Apache 2.0

Unsere Infrastruktur

Hier laufen unsere lokalen Modelle.

Hardware
MacBook Pro 16" M5 Max, 128 GB RAM.
Modellverwaltung
LiteLLM für Verwaltung und Autorisierung, Ollama betreibt die Modelle.
Zugang & Sicherheit
Cloudflare Tunnel auf das lokale MacBook.
Strom
USV Ubiquiti UniFi.

Archiv

Modelle, die wir inzwischen abgelöst haben — der Vollständigkeit halber.

Reasoning & Coding

qwen3.5:122b
Abgelöst durch: deepseek-v4:flash
qwen3.6:35b-a3b
Abgelöst durch: kimi-linear:48b
qwen3.6:27b
Abgelöst durch: qwen3.6:35b
qwen3.5:9b
Abgelöst durch: kimi-linear:48b
qwen3.5:4b
Abgelöst durch: kimi-linear:48b

Vision & Dokumente

gemma4:12b
Abgelöst durch: qwen3-vl:8b
gemma4:e4b
Abgelöst durch: qwen3-vl:8b

Retrieval & Suche

qwen3-embedding:4b
Abgelöst durch: qwen3-embedding:8b
qwen3-reranker:8b
Abgelöst durch: