Zum Inhalt springen
Mankei-Wappen: Murmeltier in Bronze
Mankei
Deutsche Sprachmodelle, von Grund auf trainiert.

Mankei

Souveräne deutsche Sprachmodelle für Retrieval und RAG.

Deutsche Modelle, die deutsche Dokumente verstehen — und auf Ihrer eigenen Hardware laufen. Von Grund auf in Deutschland trainiert, eigener Tokenizer, lizenzgeprüfte Daten, Apache 2.0. Ohne Cloud, ohne Konto, ohne Datenabfluss.

Deutsches Retrieval96,4 % · GermanDPR
Betriebon-premise, CPU-fähig
LizenzApache 2.0

Verfügbar Die Retrieval-Familie ist veröffentlicht — der deutsche Embedder führt auf GermanDPR vor e5-large und Qwen, bei einem Bruchteil der Größe. Offen auf Hugging Face: Gewichte, Tokenizer und Datendokumentation unter Apache 2.0.

Rahmen

Wie die Modelle gebaut sind

Drei Festlegungen, die für jedes Modell der Reihe gelten.

Lokaler BetriebDie Modelle sind klein genug für gewöhnliche Hardware und laufen ohne Netzverbindung. Kein Konto, kein Dienst dazwischen.
Offene GewichteApache 2.0. Gewichte, Tokenizer und die Beschreibung der Trainingsdaten werden zusammen veröffentlicht.
Dokumentierte HerkunftJede Trainingsquelle ist einzeln auf ihre Lizenz geprüft und benannt. Was nicht belegbar war, wurde nicht verwendet.
Belegt

Gemessen, nicht behauptet

Deutsches Retrieval im direkten Vergleich — und ein dokumentierter Befund aus dem juristischen Fachtext.

Benchmark · Deutsches Retrieval · GermanDPR · Treffer auf Rang 1
Modell Größe Acc@1
Mankei-Embedder 0,33 B 96,4 %
multilingual-e5-large0,56 B 79,2 %
Qwen3-Embedding-0.6B0,60 B 78,8 %
250 zurückgehaltene GermanDPR-Fragen, je 1 relevante + 5 harte Negativ-Passagen. Der spezialisierte deutsche Embedder liegt vor deutlich größeren, generischen Modellen — und generalisiert (GermanQuAD, out-of-domain: 100 %).
Prüfprotokoll · Deutsches Recht · Fortsetzung durch das Basismodell
Eingabe
Nach § 433 BGB ist der Verkäufer verpflichtet,
Beobachtung

Das Basismodell setzt den Satz nahezu im Gesetzeswortlaut fort und führt die Pflichten des Verkäufers korrekt aus.

Unaufgefordert zitiert es § 439 Abs. 1 BGB — und die Kommentarliteratur: Palandt/Weidenkaff.

Juristische und amtliche Texte sind ein gezielter Schwerpunkt des Trainingskorpus — in dieser Textsorte fallen die Ergebnisse am deutlichsten aus.

Mankei redt Dialekt

Ein experimenteller Forschungszweig: hochdeutsche Sätze in bairische oder schweizerdeutsche Mundart übertragen — ungewöhnlich in dieser Größenklasse.

Boarisch

„Servus! Mogst wissn, wia’s Wetter wird? Frog me hoit.“

Schwyzerdütsch

„Grüezi! Wottsch öppis wüsse? Frog mi eifach.“

Ein früher Stand der Dialektfamilie. Direkt im Browser, ohne Anmeldung.

Substanz

Woraus Mankei gemacht ist

Vier Entscheidungen, die das Modell tragen.

Von Grund auf trainiert

Kein fremdes Basismodell, keine geliehene Grundlage: jedes Gewicht ist in Deutschland entstanden — from scratch, auf einer einzelnen GPU. Souveräne Sprachmodelle brauchen kein Rechenzentrum.

Lizenzgeprüfte Daten, Quelle für Quelle

Jede Trainingsquelle einzeln verifiziert und dokumentiert — ausschließlich offen lizenzierte Bestände (ODC-By, CC-BY, CC0, Public Domain). Keine Grauzonen, keine Altlasten. Die Quellenliste wird mit den Gewichten veröffentlicht.

Eigener deutscher Tokenizer

Ein 32k-Vokabular, auf deutschem Text gebaut statt aus dem Englischen geerbt. Deutsche Wörter bleiben ganz — das Modell liest Deutsch, wie es geschrieben wird.

Zweisprachig nach Plan

Deutsch trägt das Modell. Der englische Anteil ist gezielt gewählt — Mathematik-, Wissenschafts- und Bildungstexte, die das Fundament verbreitern.

Fahrplan

Die Modellfamilie

Alles nach denselben Regeln: dokumentierte Daten, offene Lizenz, lokaler Betrieb.

Retrieval für souveränes RAGDer deutsche Embedder für semantische Suche über Ihre Dokumente — benchmark-führend auf GermanDPR, hoher Durchsatz, CPU-fähig. Verfügbar auf Hugging Face.
Chat & AssistentKompaktes deutsches Chat-Modell für den lokalen Betrieb — als GGUF für llama.cpp und Ollama, vom Büro-PC bis zum Einplatinenrechner.
Dialekt & nächste GrößeEine experimentelle Dialektfamilie (Boarisch, Schwyzerdütsch) und ein Modell der Milliarden-Klasse sind in Arbeit — auf demselben geprüften Fundament.
Forschung

Woran wir arbeiten

Sechs Linien, ein Ziel: deutsche Sprachmodelle, die sich überprüfen lassen.

  • Deutsch von Grund aufModelle, die auf deutschen Texten entstehen, statt aus dem Englischen übersetzt zu lernen.
  • Eigener TokenizerEin Vokabular, das deutsche Wörter als Ganzes abbildet — die Grundlage für dichtes, effizientes Deutsch.
  • Lizenzsaubere DatenJede Quelle mit Nachweis und Lizenz, ohne Grauzonen — reproduzierbar dokumentiert.
  • Verifizierte SyntheseErzeugte Trainingsdaten durchlaufen Prüfschleifen, bevor ein Modell sie sieht.
  • Messung statt BehauptungFähigkeiten werden getestet und dokumentiert. Was hier steht, ist geprüft.
  • Dialekte des AlpenraumsEchte Mundart als Forschungsfeld: kleine Modelle, normale Hardware, geprüft von Sprechern.
Zusammenarbeit

Partner werden

Die nächsten Ausbaustufen entstehen mit ausgewählten Partnern — in drei konkreten Formen.

Versand über unseren eigenen Server, ohne Formular-Drittdienst.