Sprachqualität · Language Quality Overview

← Zurück zur Startseite · Back to start

Ehrlicher, automatisch aus dem tatsächlichen Dateibestand generierter Vollständigkeits-Bericht über jede Sprache im HSK-Reader — über alle im Index registrierten Lektionen hinweg: Textabdeckung (Vokabeln/Dialog/Beispielsätze), Vers-Audio, Wort-Lauflicht, UI-/Grammatik-/Lexikon-Pakete und sprachübergreifendes Wort-Alignment. Dieselbe Prüfung gilt unverändert für jede künftig hinzugefügte Sprache — eine Sprache zählt erst als „vollständig ausgebaut“, wenn diese Seite 100% zeigt.
Honest, automatically generated completeness report for every language in the HSK reader — across every indexed lesson: text coverage (vocabulary/dialogue/examples), verse audio, word-highlighting, UI/grammar/lexicon packs, and cross-language word alignment. The same check applies unchanged to every future language — a language only counts as "fully built out" once this page shows 100%.

vollständig · complete begonnen, Lücken · started, gaps nicht begonnen · not started

Sprache · Language Stand · Status HSK 1 (L1–L19) HSK 2 (L20–L34) UI-Paket · UI pack Grammatik · Grammar Konjugation · Conjugation Plural Adjektiv · Adjective Schrift-IPA · Script IPA Lexikon · Lexicon Vokabeln ⌀ · Vocab avg Dialog ⌀ · Dialogue avg Beispiele ⌀ · Examples avg Vers-Audio · Verse audio Lauflicht · Timing Alignment ⌀ Grammatik ⌀ · POS avg Übungen · Exercises Audio-Integrität · Audio integrity Zertifiziert ⌀ · Certified avg

Konjugations-Abdeckung · Conjugation drill coverage (studium/vendor/grammarGenerationRegistry.v1.js)

Zusatz-Übungstyp im Übungs-Hub ("🔄 Konjugation"): wandelt Lexikon-Grundformen in geprüft korrekte Flexionsantworten um. Kein Hart-Kriterium für „vollständig ausgebaut" (informativ, wie Schrift-IPA/ Zertifizierung) — aber diese Liste macht auf einen Blick sichtbar, für welche Sprachen noch kein Generierungsmodul existiert.
Extra exercise type in the exercise hub ("🔄 Conjugation"): turns lexicon citation forms into verified- correct inflected answers. Not a hard criterion for "fully built" (informative, like script IPA/ certification) — but this list makes it immediately visible which languages still lack a generation module.

Sprache · Language Code Stand · Status

Plural-Abdeckung · Plural drill coverage (studium/vendor/pluralGenerationRegistry.v1.js)

Zusatz-Übungstyp im Übungs-Hub ("Plural"): wandelt Lexikon-Grundformen in geprüft korrekte Pluralantworten um. Kein Hart-Kriterium für „vollständig ausgebaut" (informativ, wie Konjugation/Schrift-IPA/Zertifizierung) — aber diese Liste macht auf einen Blick sichtbar, für welche Sprachen noch kein Plural-Generierungsmodul existiert.
Extra exercise type in the exercise hub ("Plural"): turns lexicon citation forms into verified-correct plural answers. Not a hard criterion for "fully built" (informative, like conjugation/script IPA/ certification) — but this list makes it immediately visible which languages still lack a plural generation module.

Sprache · Language Code Stand · Status

Adjektiv-Abdeckung · Adjective drill coverage (studium/vendor/adjectiveGenerationRegistry.v1.js)

Zusatz-Übungstyp im Übungs-Hub ("Adjektiv"): Deklination/Steigerung aus Lexikon-Grundformen. Kein Hart-Kriterium für „vollständig ausgebaut" — macht sichtbar, für welche Sprachen noch kein Adjektiv-Generierungsmodul existiert.
Extra exercise type in the exercise hub ("Adjective"): declension/comparison from lexicon citation forms. Not a hard criterion for "fully built" — makes visible which languages still lack an adjective generation module.

Sprache · Language Code Stand · Status

Noch fehlende Schriften · Scripts not yet built ("beliebiger Donor"-Kandidatenliste, docs/REMAINING_SCRIPTS_POLICY.md)

Skript-Code Sprache/Volk Typ Status

Skript-CodeNameGrund der Zurückstellung

Skript-CodeNameBegründung

Bewusst dauerhaft ausgeschlossen (unabhängig von der Donor-Politik):

Skript-CodeGrund

Lektion × Sprache · Lesson × language matrix

Kombinierte Textabdeckung (Vokabeln+Dialog+Beispiele gemittelt) je Lektion und Sprache — auf einen Blick erkennbar, ob wirklich jede Lektion für jede Sprache gleich weit ausgebaut ist, nicht nur im Sprachdurchschnitt.
Combined text coverage (vocab+dialogue+examples averaged) per lesson and language — shows at a glance whether every lesson is equally built out for every language, not just on average.

Lektion · Lesson

Dialog-Inhaltsqualität HSK1 × HSK2 · Dialogue content authenticity, HSK1 vs. HSK2 (reports/hsk-dialogue-content-quality-report.json)

Die Matrix oben zeigt nur, OB Text vorhanden ist — nicht, ob er echt ist. Diese Prüfung erkennt Dialog-Turn-Text, der (byte-identisch) über mehrere thematisch unterschiedliche Lektionen hinweg wiederverwendet wird — ein sprachunabhängiges Signal für Placeholder-/Copy-Leck-Bugs, unabhängig von Übersetzungsqualität. So wurde am 25.08.2026 der Lektion-20-25-Vorfall gefunden (für ~86% der Sprachen stand dort ein thematisch verwandter, aber falscher Satz statt der Anker-Übersetzung — seither für 133 Sprachen behoben, siehe „behoben"-Spalte) und ein zweiter, größerer Befund: für etliche Sprachen besteht der komplette Dialog — in HSK1 und HSK2 gleichermaßen — nur aus den sechs Lektion-1-Begrüßungssätzen, für jede weitere Lektion unverändert wiederholt.
The matrix above only shows whether text is present — not whether it's genuine. This check detects dialogue-turn text reused byte-identically across topically unrelated lessons — a language-independent signal for placeholder/ copy-leak bugs, independent of translation quality. This is how the 2026-08-25 lesson 20-25 incident was found (for ~86% of languages, a topically related but wrong sentence stood in for the anchor translation — since fixed for 133 languages, see the "fixed" column) and a second, larger finding: for a number of languages, the entire dialogue — in HSK1 and HSK2 alike — is just the six lesson-1 greeting sentences, repeated unchanged for every later lesson.

Code Sprache · Language HSK1 wiederverwendet · reused HSK2 wiederverwendet · reused Lektion 20-25 behoben · fixed Beispiel-Wiederholung · example reuse

Phase D · Priorisierung eigenständiger Sprachen ohne Automatik · Standalone languages needing real translation work, prioritized

Diese Sprachen haben keine Google-Translate-Unterstützung und keine ableitbare Basis — echte, sorgfältige Donor-Sprachen-Übersetzungsarbeit nötig (wie die historischen Piloten-Projekte), kein Skript-Fix. Sortiert nach grob geschätzter Sprecherzahl (Millionen) — ungeprüft, nur zur groben Priorisierung, vor Übersetzungsarbeit gegenzuprüfen. „Donor-Kandidat" markiert Sprachen, die über eine eng verwandte, bereits unterstützte Sprache angenähert werden könnten (klar als Donor-Übersetzung zu kennzeichnen, nicht authentisch).
These languages have no Google Translate support and no derivable base — genuine, careful donor-language translation work needed, not a script fix. Sorted by roughly estimated speaker count (millions) — unverified, rough prioritization only. "Donor candidate" flags languages approximable via a closely related, already-supported language (to be clearly labeled as a donor translation, not authentic).

CodeSprache · Language~Sprecher (Mio.) · speakers (M) HSK1 Fake-Anteil · fake%HSK2 Fake-Anteil · fake%Donor-Kandidat · candidate

Grammatik nach Konzept · Grammar by concept (32 A1-Konzepte × alle Sprachen mit Grammatik-Paket)

„Grammatik · Grammar" oben zeigt je Sprache nur eine Zahl (Konzeptanzahl gegen 32) — das verdeckt, OB es wirklich dieselben 32 Konzepte sind. Diese Tabelle gleicht jedes der 32 kanonischen A1-Konzepte (studium/data/grammar/grammarFunctionMapA1.U32.master.js) gegen die tatsächlich verwendete Konzept-ID jeder Sprache ab: exakt = identische ID, abweichend = gleiches Konzept (gleiches Nummern-Präfix), aber andere ID — Datenpflege-Hinweis, kein Fehler —, kein Treffer = Sprache hat ein Grammatik-Paket, aber nichts mit passendem Präfix. Zeiger auf Zell-Zahlen zeigen die betroffenen Sprachcodes.
"Grammatik · Grammar" above shows only a count per language (against 32) — that hides WHETHER these are really the same 32 concepts. This table cross-checks each of the 32 canonical A1 concepts against the ID each language actually uses: exact = identical ID, drift = same concept (same number prefix) but a different ID — a data-maintenance note, not a bug —, no match = language has a grammar pack but nothing with a matching prefix. Hover a count to see the affected language codes.

Konzept · Concept Exakt · Exact Abweichend · Drift Kein Treffer · No match Abdeckung · Coverage

Vokabeltrainer · Core Vocabulary Trainer (858 A0–A2-Wörter, separates Modul)

Der Kernwortschatz-Trainer (studium/coreVocab.html) ist ein vom 19-Lektionen-Kurs unabhängiges Zusatzmodul mit einem eigenen 858-Wörter-Datensatz je Sprache. Eine Sprache erscheint dort nur, wenn coreLexiconPack in languages.json gesetzt ist und die Datei vorhanden ist — ohne stillen Fallback. Diese Tabelle macht sichtbar, welche Sprachen aus dem Hauptkurs hier (noch) fehlen.
The core-vocabulary trainer is a separate add-on module with its own 858-word dataset per language. A language only appears there once coreLexiconPack is set and the file exists — no silent fallback. This table makes visible which course languages are (still) missing here.

Sprache · Language Vorhanden · Present Einträge · Entries Audio-Sprites · Audio sprites Stichprobe · Sample check

Visuelles Lernen · Visual Learning module (27 eigenständige Übungsseiten, portiert aus Sprechnetz_designer_v6, separates Modul)

Das Visuelles-Lernlabor (studium/visuelles_lernen/, Einstieg über studium/visuelles_lernen/ergebnisse.html) ist ein vom 19-Lektionen-Kurs unabhängiges Zusatzmodul mit 27 eigenständigen Übungsseiten (Bild-Wort-Karten, Minimalpaar-Hörtrainer, Dialog-Trainer, Mundbild-/Visem-Trainer u. v. m.), portiert aus Sprechnetz_designer_v6/visuelles_lernen/. Es zieht seine Daten aus neun Dateien je Sprache (coreVocabulary, minimal_pairs, phonology.core, script.core, learn_dialogues, learn_exercises, learn_vocab_themes, learn_ui, grammar_comparison) plus den eigenen UI-Strings (learn_visual_ui). Vier weitere Dateien (learn_shapes, learn_calendar, learn_dialogue_lines, coreVocabulary.gender) werden nur von einzelnen Übungsseiten gebraucht (Farben/Formen, Kalender, Dialogzeilen, Artikel/Kasus) — ohne sie zeigt nur die jeweilige Seite „nicht verfügbar", der Rest des Moduls bleibt unberührt (Spalte „Einzelseiten-Zusatzdateien" unten). Wort-Audio kommt aus dem bereits vorhandenen coreVocabulary-Sprite (studium/audio_sprites/core/<lang>/, per edge-tts erzeugt in Sprechnetz_designer_v6), verdrahtet über studium/visuelles_lernen/ui/_visualAudioBridge.v1.js — echte Aufnahme bei Textübereinstimmung, sonst automatischer Browser-TTS-Fallback (kein Absturz, kein stummer Fehler). Sprache apc hat kein coreVocabulary und bleibt daher ohne Audiostichprobe.
The visual-learning lab is a separate add-on module with 27 standalone exercise pages, ported from Sprechnetz_designer_v6/visuelles_lernen/. It draws its data from nine files per language plus its own UI strings. Word audio comes from the already-existing coreVocabulary sprite, wired through _visualAudioBridge.v1.js — a real recording on text match, otherwise an automatic browser-TTS fallback.

Sprache · Language Datendateien · Data files UI-Strings · Visual UI Einzelseiten-Zusatzdateien · Per-page extras Wort-Audio-Stichprobe · Word audio sample

Multidomain-Daten · Länder, Sprachen, Schriften, Kultur (Wikidata-Import, separates Modul)

Geografie-/Kultur-/Länderprofil-Erweiterung (studium/data/multidomain/, hinter dem Feature-Flag multidomainContentV10), unabhängig vom 19-Lektionen-Kurs. Länderfakten (Bevölkerung, Hauptstadt, Amtssprachen) stammen live von Wikidata (CC0); Kultur-Aussagen sind belegte Behauptungen mit sichtbarer Konfidenz und Quelle, keine universellen Fakten.
Geography/culture/country-profile extension, independent of the 18-lesson course. Country facts (population, capital, official languages) come live from Wikidata (CC0); culture statements are sourced claims with visible confidence and provenance, never universal facts. Ausführliche Pipeline-Dokumentation: docs/MULTIDOMAIN_PIPELINE.md.

Datei · File Einträge · Entries Provenienz ⌀ · Provenance Konfidenz ⌀ · Confidence

Phonetik-Modul · Pronunciation module (Sagittalschnitt, IPA, Minimalpaare, separates Modul)

Aussprache-Trainer (studium/phonetik.html), unabhängig vom 19-Lektionen-Kurs — animierter Sagittalschnitt je Laut, IPA-Referenzaudio, Minimalpaare und (wo ein Kernwortschatz-Modul existiert) echte Wortaufnahmen. „Darstellung" zählt Laute mit eigener oder abgeleiteter Sagittal-Pose (Diphthong als Gleitbewegung, Sekundärartikulation über den Grundlaut); „davon unterscheidbar" nur die, deren Bild tatsächlich von der Ruhelage abweicht — bei Glottalen wie h/ʔ ist Gleichheit mit der Ruhelage anatomisch korrekt, keine Lücke. Wort-Audio zählt nur textgeprüfte Treffer (derselbe Abgleich wie beim Abspielen: eine Aufnahme zählt nur, wenn ihr eigener aufgenommener Text zum Wort passt) — ohne das wäre die Abdeckung zu hoch ausgewiesen, s. Methodik unten. certified:false gilt für alle Sprachen: die Lautinventare stammen aus belegten phonologischen Quellen (PHOIBLE u. a.), nicht aus muttersprachlicher Prüfung.
Pronunciation trainer, independent of the 18-lesson course — animated sagittal cross-section per phoneme, IPA reference audio, minimal pairs, and (where a core-vocabulary module exists) real word recordings. "Pose coverage" counts phonemes with their own or a derived sagittal pose; "distinct" only those whose drawing actually differs from rest position — glottals like h/ʔ correctly show no difference, that's not a gap. Word audio only counts text-verified matches. Every language is certified:false: inventories come from sourced phonological data, not native-speaker review.

Sprache · Language Stufe · Tier Laute · Phonemes Darstellung · Pose … davon unterscheidbar · … distinct IPA-Referenzaudio · IPA ref. audio Minimalpaare · Minimal pairs Artikulationshinweis · Articulation note Wort-Audio · Word audio

Sprachvergleich-Modul · Contrastive comparison module (Lautinventar- + Grammatikvergleich zweier frei wählbarer Sprachen, separates Modul)

Kontrastiver Aussprache- und Grammatikvergleich (studium/sprachvergleich.html) zwischen zwei frei wählbaren Sprachen — Kollisionswarnung nach dem Perceptual-Assimilation-Modell, Wahrnehmungs-Quiz mit Minimalpaaren, jeder Laut im Beispielwort einzeln anklickbar. Die Zahlen hier sind NICHT der Durchschnitt der einzelnen Sprachprofile (das steht oben beim Phonetik-Modul), sondern die Vereinigungsmenge aller distinkten Laute über alle Sprachen — die Größe, die für „kann ich mir jeden vorkommenden Laut anhören" zählt. „Segment-Audio" zählt nur das vorab aufgelöste Profil-Feld; „Chip-Audio wirksam" zählt zusätzlich, was zur Laufzeit aus Diakritikum-Basisformen (ɐ̯→ɐ) und Diphthong-Zerlegung (aɪ̯→a+ɪ) aus der sprachunabhängigen IPA-Audio-Bibliothek gefunden wird — nie ein anderer, ähnlich klingender Laut als Ersatz. Für den Rest gibt es keinen Fallback: der Laut bleibt stumm, statt eine Näherung als echte Aufnahme auszugeben.
Contrastive pronunciation and grammar comparison between two freely chosen languages — collision warnings based on the Perceptual Assimilation Model, a minimal-pair perception quiz, every phoneme in an example word individually clickable. The figures here are the UNION of distinct phonemes across all languages, not a per-language average (see Phonetics module above) — the number that actually matters for "can I hear every phoneme that occurs". "Segment audio" counts only the profile's pre-resolved field; "chip audio effective" additionally counts what's found at runtime via diacritic base forms and diphthong decomposition from the shared IPA audio library — never a different, similar-sounding phoneme as a substitute. No fallback exists for the remainder: it stays silent rather than presenting an approximation as a real recording.

Schriftzeichen lernen · Script learning module (Alphabet/Zeichen einer Schrift durchsuchen, nachzeichnen, testen — separates Modul von der Phonetik oben)

Alphabet-/Zeichen-Browser mit Nachzeichnen und Testabfrage (studium/scriptLearn.html) — ein Registry-Eintrag pro SCHRIFT (nicht pro Sprache), s. studium/data/scriptLearn/scriptLearnFlows.v1.json. Mehrere Sprachen mit demselben Schriftsystem teilen sich normalerweise denselben Eintrag — das ist kein Fehler. Entscheidend pro Sprache: existiert überhaupt ein Eintrag für ihr Skript ("fehlt komplett" wäre der schlimmste, sonst unsichtbare Fall), ist die Sprache selbst als sourceLanguage eingetragen ("dedicated", eigene Beispiele + Sprech-Knopf), teilt sie sich den Eintrag mit einer anderen Sprache, die eine Stimme hat ("geliehen, Sprech-Knopf funktioniert" — normal bei geteilten Schriften), oder ist der Eintrag der generische, unzertifizierte 173-Schriften-Katalog ganz ohne sourceLanguage ("geliehen, kein Sprech-Knopf" — die View blendet den Knopf dann bewusst aus, kein Bug, aber echte Stummschaltung).
Alphabet/character browser with tracing and quiz mode — one registry entry per SCRIPT, not per language; multiple languages sharing a script normally share one entry, which is expected. What matters per language: does an entry for its script exist at all ("missing" would be the worst, otherwise invisible case), is the language itself registered as sourceLanguage ("dedicated"), does it share the entry with another language that has a voice ("borrowed, speak works" — normal for shared scripts), or is the entry the generic, uncertified 173-script catalog with no sourceLanguage at all ("borrowed, no speak button" — the view deliberately hides the button then, not a bug, but a real silence).

Buchstaben-Aussprache · Letter-name audio (Sprache × Alphabet/Schrift × verwendete TTS-Stimme, studium/letterName/manifest.json)

Kuratierte Aufnahmen der ECHTEN, in der Schule gelehrten Buchstabennamen (nicht der bloße Laut) für jeden Buchstaben/jedes Zeichen einer Schrift — abgespielt beim Antippen einer Karteikarte in „Schriftzeichen lernen" (studium/scriptLearn.html), s. Abschnitt oben. Manche Schriften (v. a. Latein) haben MEHRERE Varianten, je eine eigene Stimme + eigene, landestypisch gelehrte Buchstabennamen (Latn = Deutsch, Latn-en = Englisch, Latn-fr = Französisch, …) — beim Lernen wird zuerst die zur gerade gewählten Lernsprache passende Variante versucht, erst danach die schriftweite Grundvariante als Rückfall. „Modus" unterscheidet zwei Aufnahme-Arten: own = eigener, kuratierter Buchstabenname (z. B. hebräisch א gesprochen als „Alef", nicht als bloßer Laut), bare = das reine Graphem in der nativen Stimme in Schul-Aussprache vorgelesen (typisch bei Silben-/Wortschriften ohne eigene „Buchstabennamen" wie Kantonesisch/Hanzi).
Curated recordings of the REAL, school-taught letter names (not the bare phoneme) for every letter/character of a script — played when tapping a flashcard in "Schriftzeichen lernen". Some scripts (mainly Latin) have MULTIPLE variants, each with its own voice and its own country-specific taught letter names — the variant matching the language currently being learned is tried first, falling back to the script-wide default. "Mode" distinguishes two recording types: own = a dedicated, curated letter name; bare = the bare grapheme read aloud in the native voice's school pronunciation (typical for syllable/word scripts without distinct "letter names", e.g. Cantonese/Hanzi).

Schrift-Code · Script code Sprache · Language TTS-Stimme · TTS voice Modus · Mode Buchstaben · Letters Abdeckung · Coverage

Sprach- und Skript-Genealogie · Language & script genealogy (Sprachfamilien-Baumpfade + Schrift-Paläografie, separates Modul)

Strukturierte Abstammungsdaten für linguistische/graphemische Vergleiche — Sprachfamilie als Baumpfad (Glottolog-belegt, studium/data/multidomain/reference/languageGenealogy.v1.json) und Schrift-Paläografie (einzeln recherchiert, keine Wiederverwendung der sprechnetz_designer_v6-Skriptgenealogie — die zeigte dieselben Warnsignale, die am 26.07.2026 bereits zur Entfernung von 1080 Kultur-Einträgen führten, s. docs/MULTIDOMAIN_PIPELINE.md Abschnitt 8m). „Editorial" = redaktionell verfasstes Profil mit echtem historischen/typologischem Kontext, „templated" = mechanisch aus der reinen Klassifikation erzeugter Kurzsatz (nur bei Sprachen außerhalb des Sprechnetz-Kursangebots). „Ohne Vorläufer" ist bei eigenständig erfundenen/unentzifferten Skripten (Hangul, Cherokee, Adlam, Linear A, Keilschrift …) das erwartete, korrekte Ergebnis, keine Lücke.
Structured ancestry data for linguistic/graphemic comparison — language family as a tree path (Glottolog-sourced) and script paleography (individually researched, deliberately not reusing the sprechnetz_designer_v6 script genealogy, which showed the same red flags that led to removing 1080 culture entries on 2026-07-26). "Editorial" = hand-written profile with real historical/typological context; "templated" = a sentence mechanically generated from the bare classification (only for languages outside the Sprechnetz course offering). "No parent" is the expected, correct result for independently invented/undeciphered scripts (Hangul, Cherokee, Adlam, Linear A, Cuneiform, …), not a gap.
→ Als interaktiver Stammbaum ansehen · view as an interactive family tree
→ Wörter aus der coreVocabulary phonetisch vergleichen · compare coreVocabulary words phonetically
→ Wortstellung, Morphologie & Grammatik vergleichen · compare word order, morphology & grammar
→ Orthographietiefe der Skripte vergleichen · compare orthographic depth of scripts
→ Noto-Schriftnamen per TTS anhören · listen to Noto font names via TTS

Sprachfamilie · Language family

Code Familie · Family Baumpfad · Tree path Konfidenz · Confidence Profil · Profile Kurssprache? · Course lang? Kreuzcheck · Cross-check

Skript-Paläografie · Script paleography

Code Name Typologie · Typology Vorläufer · Parent Konfidenz · Confidence Profil · Profile G2P Katalog · Catalog

Chinesische-Zeichen-Lecks · Han character leaks (reports/han-character-leak-audit.json)

Unabhängig von der Dialog-Inhaltsqualität oben: findet chinesische Schriftzeichen, die in den Text NICHT-chinesischer, nicht-Kanji-nutzender Sprachen durchgesickert sind — meist ein unübersetzter Eigenname oder ein vergessenes Zielwort in einem Lücken-Template. Am 25./26.08.2026 entdeckt: 15 arabische Dialekte hatten „Anna" unübersetzt als „安娜" stehen (behoben); Buginesisch hat 153 Lecks; zusätzlich ein Templating-Bug in allen HSK5/HSK6-Lektionen (~140 Sätze in de/en), bei dem ein Lücken-Platzhalter nie mit dem übersetzten Wort gefüllt wurde.
Independent of the dialogue content check above: finds Chinese characters leaked into the text of non-Chinese, non-kanji languages — usually an untranslated proper name or a forgotten target word in a gap-fill template. Found 2026-08-25/26: 15 Arabic dialects had "Anna" left untranslated as "安娜" (fixed); Buginese has 153 leaks; plus a templating bug across all HSK5/HSK6 lessons (~140 sentences in de/en) where a gap placeholder was never filled with the translated word.

CodeSprache · LanguageLecks · leaksBeispiel · exampleWarteschlange · queue status

Unverdrahtete Übersetzungen · Staged-vs-live translation gap (reports/staged-translations-gap-audit.json)

Prüft alle 110 tools/{code}_translations/-Ordner (kuratierte Übersetzungen aus früheren Sitzungen, nur HSK1) gegen den Live-Stand. So wurde am 26.08.2026 gefunden, dass `apc`/`ary`/`arz` fertige, echte Levantinisch-/ Marokkanisch-/Ägyptisch-Übersetzungen bereithielten, obwohl der Live-Text noch zu 74–76% Hocharabisch-Kopie war — seither behoben (0% Differenz). Wichtig: „differsFromLive" heißt nur, der Text unterscheidet sich — nicht automatisch, dass live falsch ist (oft zwei gültige Formulierungen). Vor jeder Übernahme einzeln prüfen.
Checks all 110 tools/{code}_translations/ folders (curated translations from earlier sessions, HSK1 only) against the live state. This is how `apc`/`ary`/`arz` were found to have finished, genuine dialect translations sitting unused while live text was still 74–76% Standard Arabic — since fixed (0% diff). Note: "differsFromLive" only means the text differs — not automatically that live is wrong (often two valid phrasings). Review individually before applying.

CodeVorbereitete Sätze · stagedWeicht ab · differsBeispiel live → staged

Fabrizierter Text · Shared fabricated text audit (reports/shared-fabricated-text-audit.json)

🚨 Kritischer Fund vom 26.08.2026: Prüft alle Sprachen ohne Google-Translate-Abdeckung (GT249) auf Dialogsätze, die wortidentisch mit ≥5 völlig unverwandten anderen Sprachen sind — bei echter Übersetzung praktisch ausgeschlossen. Zwei Muster: (1) Sprachen, bei denen praktisch jeder Satz mit Dutzenden anderen identisch ist (z. B. „Ushi! Tluna ne Anna." bei 61 verschiedenen, unverwandten Sprachen) — komplett fabrizierter Platzhaltertext, keine echte Übersetzung. (2) Sprachen, bei denen der Großteil echt ist, aber eine wiederkehrende Teilmenge kaputtes Pseudo-Englisch zeigt („you Apfel", „where the Taxi") oder sogar die falsche Sprache („Dhanyavad" = Hindi als Danke-Fallback) — Indiz für einen unerkannten Pipeline-Ausfall.
🚨 Critical finding from 2026-08-26: Checks all languages without Google Translate coverage (GT249) for dialogue sentences that are word-identical across ≥5 completely unrelated languages — practically impossible for genuine translation. Two patterns: (1) languages where almost every sentence matches dozens of others — fully fabricated placeholder text. (2) languages where most content is genuine but a recurring subset shows broken pseudo-English or the wrong language entirely — sign of an unnoticed pipeline failure.
Bislang nur dokumentiert, nichts geändert — Umfang (243 Sprachen) und Sprachrisiko sind zu groß für eine spontane Korrektur.

CodeBetroffene SätzeAnteilMuster

Masterplan HSK1+2 · Master completeness checklist (reports/hsk1_2_master_completeness.json) — Nutzerauftrag 2026-08-27

Ziel: HSK1+HSK2 (Lektion 1-34) für alle Sprachen komplett mit verlässlichen Übersetzungen, IPA und Audio, wo immer es geht. Diese Checkliste wird laufend aktualisiert und im Hintergrund per autonomer Sitzung abgearbeitet (python3 tools/build_hsk1_2_master_completeness_report.py neu erzeugen zur Aktualisierung).

Phasen (Reihenfolge der Abarbeitung)

    CodeTextWort-IPASatz-IPASatz-AudioWort-Audio

    Weitere Qualitätsberichte · Additional audit reports (Release/Contract/Performance/Punctuation/UI)

    Einmalig oder bei Bedarf laufende Audits (nicht Teil der pro-Sprache-Übersicht oben), automatisch aus dem Dateibestand gelesen — jede Sektion erscheint nur, wenn der jeweilige Bericht existiert.
    One-off or on-demand audits (not part of the per-language overview above), read automatically from disk — each section only appears if that report exists.