Mankei
Souveräne deutsche Sprachmodelle für Retrieval und RAG.
Deutsche Modelle, die deutsche Dokumente verstehen — und auf Ihrer eigenen Hardware laufen. Von Grund auf in Deutschland trainiert, eigener Tokenizer, lizenzgeprüfte Daten, Apache 2.0. Ohne Cloud, ohne Konto, ohne Datenabfluss.
Verfügbar Die Retrieval-Familie ist veröffentlicht — der deutsche Embedder führt auf GermanDPR vor e5-large und Qwen, bei einem Bruchteil der Größe. Offen auf Hugging Face: Gewichte, Tokenizer und Datendokumentation unter Apache 2.0.
Wie die Modelle gebaut sind
Drei Festlegungen, die für jedes Modell der Reihe gelten.
Gemessen, nicht behauptet
Deutsches Retrieval im direkten Vergleich — und ein dokumentierter Befund aus dem juristischen Fachtext.
| Modell | Größe | Acc@1 |
|---|---|---|
| Mankei-Embedder | 0,33 B | 96,4 % |
| multilingual-e5-large | 0,56 B | 79,2 % |
| Qwen3-Embedding-0.6B | 0,60 B | 78,8 % |
Das Basismodell setzt den Satz nahezu im Gesetzeswortlaut fort und führt die Pflichten des Verkäufers korrekt aus.
Unaufgefordert zitiert es § 439 Abs. 1 BGB — und die Kommentarliteratur: Palandt/Weidenkaff.
Mankei redt Dialekt
Ein experimenteller Forschungszweig: hochdeutsche Sätze in bairische oder schweizerdeutsche Mundart übertragen — ungewöhnlich in dieser Größenklasse.
„Servus! Mogst wissn, wia’s Wetter wird? Frog me hoit.“
„Grüezi! Wottsch öppis wüsse? Frog mi eifach.“
Ein früher Stand der Dialektfamilie. Direkt im Browser, ohne Anmeldung.
Woraus Mankei gemacht ist
Vier Entscheidungen, die das Modell tragen.
Kein fremdes Basismodell, keine geliehene Grundlage: jedes Gewicht ist in Deutschland entstanden — from scratch, auf einer einzelnen GPU. Souveräne Sprachmodelle brauchen kein Rechenzentrum.
Jede Trainingsquelle einzeln verifiziert und dokumentiert — ausschließlich offen lizenzierte Bestände (ODC-By, CC-BY, CC0, Public Domain). Keine Grauzonen, keine Altlasten. Die Quellenliste wird mit den Gewichten veröffentlicht.
Ein 32k-Vokabular, auf deutschem Text gebaut statt aus dem Englischen geerbt. Deutsche Wörter bleiben ganz — das Modell liest Deutsch, wie es geschrieben wird.
Deutsch trägt das Modell. Der englische Anteil ist gezielt gewählt — Mathematik-, Wissenschafts- und Bildungstexte, die das Fundament verbreitern.
Die Modellfamilie
Alles nach denselben Regeln: dokumentierte Daten, offene Lizenz, lokaler Betrieb.
Woran wir arbeiten
Sechs Linien, ein Ziel: deutsche Sprachmodelle, die sich überprüfen lassen.
- Deutsch von Grund aufModelle, die auf deutschen Texten entstehen, statt aus dem Englischen übersetzt zu lernen.
- Eigener TokenizerEin Vokabular, das deutsche Wörter als Ganzes abbildet — die Grundlage für dichtes, effizientes Deutsch.
- Lizenzsaubere DatenJede Quelle mit Nachweis und Lizenz, ohne Grauzonen — reproduzierbar dokumentiert.
- Verifizierte SyntheseErzeugte Trainingsdaten durchlaufen Prüfschleifen, bevor ein Modell sie sieht.
- Messung statt BehauptungFähigkeiten werden getestet und dokumentiert. Was hier steht, ist geprüft.
- Dialekte des AlpenraumsEchte Mundart als Forschungsfeld: kleine Modelle, normale Hardware, geprüft von Sprechern.
Partner werden
Die nächsten Ausbaustufen entstehen mit ausgewählten Partnern — in drei konkreten Formen.