Ehrlicher, automatisch aus dem tatsächlichen Dateibestand generierter Vollständigkeits-Bericht über jede
Sprache im HSK-Reader — über alle im Index registrierten Lektionen hinweg: Textabdeckung (Vokabeln/Dialog/Beispielsätze),
Vers-Audio, Wort-Lauflicht, UI-/Grammatik-/Lexikon-Pakete und sprachübergreifendes Wort-Alignment.
Dieselbe Prüfung gilt unverändert für jede künftig hinzugefügte Sprache — eine Sprache zählt erst als
„vollständig ausgebaut“, wenn diese Seite 100% zeigt.
Honest, automatically generated completeness report for every language in the HSK reader — across every
indexed lesson: text coverage (vocabulary/dialogue/examples), verse audio, word-highlighting, UI/grammar/lexicon
packs, and cross-language word alignment. The same check applies unchanged to every future language — a
language only counts as "fully built out" once this page shows 100%.
vollständig · completebegonnen, Lücken · started, gapsnicht begonnen · not started
Zusatz-Übungstyp im Übungs-Hub ("🔄 Konjugation"): wandelt Lexikon-Grundformen in geprüft korrekte
Flexionsantworten um. Kein Hart-Kriterium für „vollständig ausgebaut" (informativ, wie Schrift-IPA/
Zertifizierung) — aber diese Liste macht auf einen Blick sichtbar, für welche Sprachen noch kein
Generierungsmodul existiert.
Extra exercise type in the exercise hub ("🔄 Conjugation"): turns lexicon citation forms into verified-
correct inflected answers. Not a hard criterion for "fully built" (informative, like script IPA/
certification) — but this list makes it immediately visible which languages still lack a generation module.
Zusatz-Übungstyp im Übungs-Hub ("Plural"): wandelt Lexikon-Grundformen in geprüft korrekte Pluralantworten
um. Kein Hart-Kriterium für „vollständig ausgebaut" (informativ, wie Konjugation/Schrift-IPA/Zertifizierung)
— aber diese Liste macht auf einen Blick sichtbar, für welche Sprachen noch kein Plural-Generierungsmodul
existiert.
Extra exercise type in the exercise hub ("Plural"): turns lexicon citation forms into verified-correct
plural answers. Not a hard criterion for "fully built" (informative, like conjugation/script IPA/
certification) — but this list makes it immediately visible which languages still lack a plural generation
module.
Zusatz-Übungstyp im Übungs-Hub ("Adjektiv"): Deklination/Steigerung aus Lexikon-Grundformen. Kein
Hart-Kriterium für „vollständig ausgebaut" — macht sichtbar, für welche Sprachen noch kein
Adjektiv-Generierungsmodul existiert.
Extra exercise type in the exercise hub ("Adjective"): declension/comparison from lexicon citation forms.
Not a hard criterion for "fully built" — makes visible which languages still lack an adjective generation
module.
Sprache · Language
Code
Stand · Status
Noch fehlende Schriften · Scripts not yet built ("beliebiger Donor"-Kandidatenliste, docs/REMAINING_SCRIPTS_POLICY.md)
Skript-Code
Sprache/Volk
Typ
Status
Skript-Code
Name
Grund der Zurückstellung
Skript-Code
Name
Begründung
Bewusst dauerhaft ausgeschlossen (unabhängig von der Donor-Politik):
Skript-Code
Grund
Lektion × Sprache · Lesson × language matrix
Kombinierte Textabdeckung (Vokabeln+Dialog+Beispiele gemittelt) je Lektion und Sprache — auf einen Blick
erkennbar, ob wirklich jede Lektion für jede Sprache gleich weit ausgebaut ist, nicht nur im
Sprachdurchschnitt.
Combined text coverage (vocab+dialogue+examples averaged) per lesson and language — shows at a glance whether
every lesson is equally built out for every language, not just on average.
Die Matrix oben zeigt nur, OB Text vorhanden ist — nicht, ob er echt ist. Diese Prüfung erkennt Dialog-Turn-Text,
der (byte-identisch) über mehrere thematisch unterschiedliche Lektionen hinweg wiederverwendet wird — ein
sprachunabhängiges Signal für Placeholder-/Copy-Leck-Bugs, unabhängig von Übersetzungsqualität. So wurde am
25.08.2026 der Lektion-20-25-Vorfall gefunden (für ~86% der Sprachen stand dort ein thematisch verwandter, aber
falscher Satz statt der Anker-Übersetzung — seither für 133 Sprachen behoben, siehe „behoben"-Spalte) und ein
zweiter, größerer Befund: für etliche Sprachen besteht der komplette Dialog — in HSK1 und HSK2 gleichermaßen
— nur aus den sechs Lektion-1-Begrüßungssätzen, für jede weitere Lektion unverändert wiederholt.
The matrix above only shows whether text is present — not whether it's genuine. This check detects dialogue-turn
text reused byte-identically across topically unrelated lessons — a language-independent signal for placeholder/
copy-leak bugs, independent of translation quality. This is how the 2026-08-25 lesson 20-25 incident was found
(for ~86% of languages, a topically related but wrong sentence stood in for the anchor translation — since fixed
for 133 languages, see the "fixed" column) and a second, larger finding: for a number of languages, the entire
dialogue — in HSK1 and HSK2 alike — is just the six lesson-1 greeting sentences, repeated unchanged for
every later lesson.
Code
Sprache · Language
HSK1 wiederverwendet · reused
HSK2 wiederverwendet · reused
Lektion 20-25 behoben · fixed
Beispiel-Wiederholung · example reuse
Phase D · Priorisierung eigenständiger Sprachen ohne Automatik · Standalone languages needing real translation work, prioritized
Diese Sprachen haben keine Google-Translate-Unterstützung und keine ableitbare Basis — echte, sorgfältige
Donor-Sprachen-Übersetzungsarbeit nötig (wie die historischen Piloten-Projekte), kein Skript-Fix. Sortiert nach
grob geschätzter Sprecherzahl (Millionen) — ungeprüft, nur zur groben Priorisierung, vor
Übersetzungsarbeit gegenzuprüfen. „Donor-Kandidat" markiert Sprachen, die über eine eng verwandte, bereits
unterstützte Sprache angenähert werden könnten (klar als Donor-Übersetzung zu kennzeichnen, nicht authentisch).
These languages have no Google Translate support and no derivable base — genuine, careful donor-language
translation work needed, not a script fix. Sorted by roughly estimated speaker count (millions) —
unverified, rough prioritization only. "Donor candidate" flags languages approximable via a
closely related, already-supported language (to be clearly labeled as a donor translation, not authentic).
Code
Sprache · Language
~Sprecher (Mio.) · speakers (M)
HSK1 Fake-Anteil · fake%
HSK2 Fake-Anteil · fake%
Donor-Kandidat · candidate
Grammatik nach Konzept · Grammar by concept (32 A1-Konzepte × alle Sprachen mit Grammatik-Paket)
„Grammatik · Grammar" oben zeigt je Sprache nur eine Zahl (Konzeptanzahl gegen 32) — das verdeckt, OB es
wirklich dieselben 32 Konzepte sind. Diese Tabelle gleicht jedes der 32 kanonischen A1-Konzepte
(studium/data/grammar/grammarFunctionMapA1.U32.master.js) gegen die tatsächlich verwendete
Konzept-ID jeder Sprache ab: exakt = identische ID, abweichend = gleiches
Konzept (gleiches Nummern-Präfix), aber andere ID — Datenpflege-Hinweis, kein Fehler —, kein
Treffer = Sprache hat ein Grammatik-Paket, aber nichts mit passendem Präfix. Zeiger auf Zell-Zahlen
zeigen die betroffenen Sprachcodes.
"Grammatik · Grammar" above shows only a count per language (against 32) — that hides WHETHER these are
really the same 32 concepts. This table cross-checks each of the 32 canonical A1 concepts against the ID
each language actually uses: exact = identical ID, drift = same concept
(same number prefix) but a different ID — a data-maintenance note, not a bug —, no match =
language has a grammar pack but nothing with a matching prefix. Hover a count to see the affected language
codes.
Der Kernwortschatz-Trainer (studium/coreVocab.html) ist ein vom 19-Lektionen-Kurs unabhängiges
Zusatzmodul mit einem eigenen 858-Wörter-Datensatz je Sprache. Eine Sprache erscheint dort nur, wenn
coreLexiconPack in languages.json gesetzt ist und die Datei vorhanden ist — ohne
stillen Fallback. Diese Tabelle macht sichtbar, welche Sprachen aus dem Hauptkurs hier (noch) fehlen.
The core-vocabulary trainer is a separate add-on module with its own 858-word dataset per language. A language
only appears there once coreLexiconPack is set and the file exists — no silent fallback. This
table makes visible which course languages are (still) missing here.
Das Visuelles-Lernlabor (studium/visuelles_lernen/, Einstieg über
studium/visuelles_lernen/ergebnisse.html) ist ein vom 19-Lektionen-Kurs unabhängiges Zusatzmodul mit
27 eigenständigen Übungsseiten (Bild-Wort-Karten, Minimalpaar-Hörtrainer, Dialog-Trainer, Mundbild-/Visem-Trainer
u. v. m.), portiert aus Sprechnetz_designer_v6/visuelles_lernen/. Es zieht seine Daten aus neun
Dateien je Sprache (coreVocabulary, minimal_pairs, phonology.core,
script.core, learn_dialogues, learn_exercises,
learn_vocab_themes, learn_ui, grammar_comparison) plus den eigenen
UI-Strings (learn_visual_ui). Vier weitere Dateien
(learn_shapes, learn_calendar, learn_dialogue_lines,
coreVocabulary.gender) werden nur von einzelnen Übungsseiten gebraucht (Farben/Formen, Kalender,
Dialogzeilen, Artikel/Kasus) — ohne sie zeigt nur die jeweilige Seite „nicht verfügbar", der Rest des Moduls
bleibt unberührt (Spalte „Einzelseiten-Zusatzdateien" unten). Wort-Audio kommt aus dem bereits vorhandenen
coreVocabulary-Sprite
(studium/audio_sprites/core/<lang>/, per edge-tts erzeugt in Sprechnetz_designer_v6), verdrahtet
über studium/visuelles_lernen/ui/_visualAudioBridge.v1.js — echte Aufnahme bei Textübereinstimmung,
sonst automatischer Browser-TTS-Fallback (kein Absturz, kein stummer Fehler). Sprache apc hat kein
coreVocabulary und bleibt daher ohne Audiostichprobe.
The visual-learning lab is a separate add-on module with 27 standalone exercise pages, ported from
Sprechnetz_designer_v6/visuelles_lernen/. It draws its data from nine files per language plus its own
UI strings. Word audio comes from the already-existing coreVocabulary sprite, wired through
_visualAudioBridge.v1.js — a real recording on text match, otherwise an automatic browser-TTS
fallback.
Geografie-/Kultur-/Länderprofil-Erweiterung (studium/data/multidomain/, hinter dem Feature-Flag
multidomainContentV10), unabhängig vom 19-Lektionen-Kurs. Länderfakten (Bevölkerung, Hauptstadt,
Amtssprachen) stammen live von Wikidata (CC0); Kultur-Aussagen sind belegte Behauptungen mit sichtbarer
Konfidenz und Quelle, keine universellen Fakten.
Geography/culture/country-profile extension, independent of the 18-lesson course. Country facts (population,
capital, official languages) come live from Wikidata (CC0); culture statements are sourced claims with visible
confidence and provenance, never universal facts.
Ausführliche Pipeline-Dokumentation: docs/MULTIDOMAIN_PIPELINE.md.
Aussprache-Trainer (studium/phonetik.html), unabhängig vom 19-Lektionen-Kurs — animierter
Sagittalschnitt je Laut, IPA-Referenzaudio, Minimalpaare und (wo ein Kernwortschatz-Modul existiert)
echte Wortaufnahmen. „Darstellung" zählt Laute mit eigener oder abgeleiteter Sagittal-Pose (Diphthong als
Gleitbewegung, Sekundärartikulation über den Grundlaut); „davon unterscheidbar" nur die, deren Bild
tatsächlich von der Ruhelage abweicht — bei Glottalen wie h/ʔ ist Gleichheit mit
der Ruhelage anatomisch korrekt, keine Lücke. Wort-Audio zählt nur textgeprüfte Treffer (derselbe Abgleich
wie beim Abspielen: eine Aufnahme zählt nur, wenn ihr eigener aufgenommener Text zum Wort passt) — ohne das
wäre die Abdeckung zu hoch ausgewiesen, s. Methodik unten. certified:false gilt für alle
Sprachen: die Lautinventare stammen aus belegten phonologischen Quellen (PHOIBLE u. a.), nicht aus
muttersprachlicher Prüfung.
Pronunciation trainer, independent of the 18-lesson course — animated sagittal cross-section per phoneme,
IPA reference audio, minimal pairs, and (where a core-vocabulary module exists) real word recordings.
"Pose coverage" counts phonemes with their own or a derived sagittal pose; "distinct" only those whose
drawing actually differs from rest position — glottals like h/ʔ correctly show no
difference, that's not a gap. Word audio only counts text-verified matches. Every language is
certified:false: inventories come from sourced phonological data, not native-speaker review.
Kontrastiver Aussprache- und Grammatikvergleich (studium/sprachvergleich.html) zwischen zwei
frei wählbaren Sprachen — Kollisionswarnung nach dem Perceptual-Assimilation-Modell, Wahrnehmungs-Quiz mit
Minimalpaaren, jeder Laut im Beispielwort einzeln anklickbar. Die Zahlen hier sind NICHT der Durchschnitt der
einzelnen Sprachprofile (das steht oben beim Phonetik-Modul), sondern die Vereinigungsmenge aller distinkten
Laute über alle Sprachen — die Größe, die für „kann ich mir jeden vorkommenden Laut anhören" zählt.
„Segment-Audio" zählt nur das vorab aufgelöste Profil-Feld; „Chip-Audio wirksam" zählt zusätzlich, was zur
Laufzeit aus Diakritikum-Basisformen (ɐ̯→ɐ) und Diphthong-Zerlegung
(aɪ̯→a+ɪ) aus der sprachunabhängigen IPA-Audio-Bibliothek gefunden wird — nie ein
anderer, ähnlich klingender Laut als Ersatz. Für den Rest gibt es keinen Fallback: der Laut bleibt stumm,
statt eine Näherung als echte Aufnahme auszugeben.
Contrastive pronunciation and grammar comparison between two freely chosen languages — collision warnings
based on the Perceptual Assimilation Model, a minimal-pair perception quiz, every phoneme in an example word
individually clickable. The figures here are the UNION of distinct phonemes across all languages, not a
per-language average (see Phonetics module above) — the number that actually matters for "can I hear every
phoneme that occurs". "Segment audio" counts only the profile's pre-resolved field; "chip audio effective"
additionally counts what's found at runtime via diacritic base forms and diphthong decomposition from the
shared IPA audio library — never a different, similar-sounding phoneme as a substitute. No fallback exists
for the remainder: it stays silent rather than presenting an approximation as a real recording.
Schriftzeichen lernen · Script learning module (Alphabet/Zeichen einer Schrift durchsuchen, nachzeichnen, testen — separates Modul von der Phonetik oben)
Alphabet-/Zeichen-Browser mit Nachzeichnen und Testabfrage (studium/scriptLearn.html) — ein
Registry-Eintrag pro SCHRIFT (nicht pro Sprache), s. studium/data/scriptLearn/scriptLearnFlows.v1.json.
Mehrere Sprachen mit demselben Schriftsystem teilen sich normalerweise denselben Eintrag — das ist kein
Fehler. Entscheidend pro Sprache: existiert überhaupt ein Eintrag für ihr Skript ("fehlt komplett" wäre der
schlimmste, sonst unsichtbare Fall), ist die Sprache selbst als sourceLanguage eingetragen
("dedicated", eigene Beispiele + Sprech-Knopf), teilt sie sich den Eintrag mit einer anderen Sprache, die eine
Stimme hat ("geliehen, Sprech-Knopf funktioniert" — normal bei geteilten Schriften), oder ist der Eintrag der
generische, unzertifizierte 173-Schriften-Katalog ganz ohne sourceLanguage ("geliehen, kein
Sprech-Knopf" — die View blendet den Knopf dann bewusst aus, kein Bug, aber echte Stummschaltung).
Alphabet/character browser with tracing and quiz mode — one registry entry per SCRIPT, not per language;
multiple languages sharing a script normally share one entry, which is expected. What matters per language:
does an entry for its script exist at all ("missing" would be the worst, otherwise invisible case), is the
language itself registered as sourceLanguage ("dedicated"), does it share the entry with another
language that has a voice ("borrowed, speak works" — normal for shared scripts), or is the entry the generic,
uncertified 173-script catalog with no sourceLanguage at all ("borrowed, no speak button" — the
view deliberately hides the button then, not a bug, but a real silence).
Kuratierte Aufnahmen der ECHTEN, in der Schule gelehrten Buchstabennamen (nicht der bloße Laut) für jeden
Buchstaben/jedes Zeichen einer Schrift — abgespielt beim Antippen einer Karteikarte in „Schriftzeichen lernen"
(studium/scriptLearn.html), s. Abschnitt oben. Manche Schriften (v. a. Latein) haben MEHRERE
Varianten, je eine eigene Stimme + eigene, landestypisch gelehrte Buchstabennamen (Latn = Deutsch,
Latn-en = Englisch, Latn-fr = Französisch, …) — beim Lernen wird zuerst die zur
gerade gewählten Lernsprache passende Variante versucht, erst danach die schriftweite Grundvariante als
Rückfall. „Modus" unterscheidet zwei Aufnahme-Arten: own = eigener, kuratierter Buchstabenname
(z. B. hebräisch א gesprochen als „Alef", nicht als bloßer Laut), bare = das reine Graphem in der
nativen Stimme in Schul-Aussprache vorgelesen (typisch bei Silben-/Wortschriften ohne eigene „Buchstabennamen"
wie Kantonesisch/Hanzi).
Curated recordings of the REAL, school-taught letter names (not the bare phoneme) for every letter/character
of a script — played when tapping a flashcard in "Schriftzeichen lernen". Some scripts (mainly Latin) have
MULTIPLE variants, each with its own voice and its own country-specific taught letter names — the variant
matching the language currently being learned is tried first, falling back to the script-wide default. "Mode"
distinguishes two recording types: own = a dedicated, curated letter name; bare =
the bare grapheme read aloud in the native voice's school pronunciation (typical for syllable/word scripts
without distinct "letter names", e.g. Cantonese/Hanzi).
Schrift-Code · Script code
Sprache · Language
TTS-Stimme · TTS voice
Modus · Mode
Buchstaben · Letters
Abdeckung · Coverage
Sprach- und Skript-Genealogie · Language & script genealogy (Sprachfamilien-Baumpfade + Schrift-Paläografie, separates Modul)
Strukturierte Abstammungsdaten für linguistische/graphemische Vergleiche — Sprachfamilie als Baumpfad
(Glottolog-belegt, studium/data/multidomain/reference/languageGenealogy.v1.json) und
Schrift-Paläografie (einzeln recherchiert, keine Wiederverwendung der
sprechnetz_designer_v6-Skriptgenealogie — die zeigte dieselben Warnsignale, die am 26.07.2026
bereits zur Entfernung von 1080 Kultur-Einträgen führten, s. docs/MULTIDOMAIN_PIPELINE.md
Abschnitt 8m). „Editorial" = redaktionell verfasstes Profil mit echtem historischen/typologischem Kontext,
„templated" = mechanisch aus der reinen Klassifikation erzeugter Kurzsatz (nur bei Sprachen außerhalb des
Sprechnetz-Kursangebots). „Ohne Vorläufer" ist bei eigenständig erfundenen/unentzifferten Skripten (Hangul,
Cherokee, Adlam, Linear A, Keilschrift …) das erwartete, korrekte Ergebnis, keine Lücke.
Structured ancestry data for linguistic/graphemic comparison — language family as a tree path
(Glottolog-sourced) and script paleography (individually researched, deliberately not
reusing the sprechnetz_designer_v6 script genealogy, which showed the same red flags that led to removing
1080 culture entries on 2026-07-26). "Editorial" = hand-written profile with real historical/typological
context; "templated" = a sentence mechanically generated from the bare classification (only for languages
outside the Sprechnetz course offering). "No parent" is the expected, correct result for independently
invented/undeciphered scripts (Hangul, Cherokee, Adlam, Linear A, Cuneiform, …), not a gap. → Als interaktiver Stammbaum ansehen · view as an interactive family tree → Wörter aus der coreVocabulary phonetisch vergleichen · compare coreVocabulary words phonetically → Wortstellung, Morphologie & Grammatik vergleichen · compare word order, morphology & grammar → Orthographietiefe der Skripte vergleichen · compare orthographic depth of scripts → Noto-Schriftnamen per TTS anhören · listen to Noto font names via TTS
Sprachfamilie · Language family
Code
Familie · Family
Baumpfad · Tree path
Konfidenz · Confidence
Profil · Profile
Kurssprache? · Course lang?
Kreuzcheck · Cross-check
Skript-Paläografie · Script paleography
Code
Name
Typologie · Typology
Vorläufer · Parent
Konfidenz · Confidence
Profil · Profile
G2P
Katalog · Catalog
Chinesische-Zeichen-Lecks · Han character leaks (reports/han-character-leak-audit.json)
Unabhängig von der Dialog-Inhaltsqualität oben: findet chinesische Schriftzeichen, die in den Text
NICHT-chinesischer, nicht-Kanji-nutzender Sprachen durchgesickert sind — meist ein unübersetzter Eigenname
oder ein vergessenes Zielwort in einem Lücken-Template. Am 25./26.08.2026 entdeckt: 15 arabische Dialekte
hatten „Anna" unübersetzt als „安娜" stehen (behoben); Buginesisch hat 153 Lecks; zusätzlich ein Templating-Bug
in allen HSK5/HSK6-Lektionen (~140 Sätze in de/en), bei dem ein Lücken-Platzhalter nie mit dem übersetzten Wort
gefüllt wurde.
Independent of the dialogue content check above: finds Chinese characters leaked into the text of non-Chinese,
non-kanji languages — usually an untranslated proper name or a forgotten target word in a gap-fill template.
Found 2026-08-25/26: 15 Arabic dialects had "Anna" left untranslated as "安娜" (fixed); Buginese has 153 leaks;
plus a templating bug across all HSK5/HSK6 lessons (~140 sentences in de/en) where a gap placeholder was never
filled with the translated word.
Code
Sprache · Language
Lecks · leaks
Beispiel · example
Warteschlange · queue status
Unverdrahtete Übersetzungen · Staged-vs-live translation gap (reports/staged-translations-gap-audit.json)
Prüft alle 110 tools/{code}_translations/-Ordner (kuratierte Übersetzungen aus früheren Sitzungen,
nur HSK1) gegen den Live-Stand. So wurde am 26.08.2026 gefunden, dass `apc`/`ary`/`arz` fertige, echte Levantinisch-/
Marokkanisch-/Ägyptisch-Übersetzungen bereithielten, obwohl der Live-Text noch zu 74–76% Hocharabisch-Kopie war —
seither behoben (0% Differenz). Wichtig: „differsFromLive" heißt nur, der Text unterscheidet sich —
nicht automatisch, dass live falsch ist (oft zwei gültige Formulierungen). Vor jeder Übernahme einzeln prüfen.
Checks all 110 tools/{code}_translations/ folders (curated translations from earlier sessions, HSK1
only) against the live state. This is how `apc`/`ary`/`arz` were found to have finished, genuine dialect
translations sitting unused while live text was still 74–76% Standard Arabic — since fixed (0% diff).
Note: "differsFromLive" only means the text differs — not automatically that live is wrong (often
two valid phrasings). Review individually before applying.
Code
Vorbereitete Sätze · staged
Weicht ab · differs
Beispiel live → staged
Fabrizierter Text · Shared fabricated text audit (reports/shared-fabricated-text-audit.json)
🚨 Kritischer Fund vom 26.08.2026: Prüft alle Sprachen ohne Google-Translate-Abdeckung (GT249) auf
Dialogsätze, die wortidentisch mit ≥5 völlig unverwandten anderen Sprachen sind — bei echter Übersetzung praktisch
ausgeschlossen. Zwei Muster: (1) Sprachen, bei denen praktisch jeder Satz mit Dutzenden anderen identisch
ist (z. B. „Ushi! Tluna ne Anna." bei 61 verschiedenen, unverwandten Sprachen) — komplett fabrizierter
Platzhaltertext, keine echte Übersetzung. (2) Sprachen, bei denen der Großteil echt ist, aber eine wiederkehrende
Teilmenge kaputtes Pseudo-Englisch zeigt („you Apfel", „where the Taxi") oder sogar die falsche Sprache
(„Dhanyavad" = Hindi als Danke-Fallback) — Indiz für einen unerkannten Pipeline-Ausfall.
🚨 Critical finding from 2026-08-26: Checks all languages without Google Translate coverage
(GT249) for dialogue sentences that are word-identical across ≥5 completely unrelated languages — practically
impossible for genuine translation. Two patterns: (1) languages where almost every sentence matches dozens of
others — fully fabricated placeholder text. (2) languages where most content is genuine but a recurring subset
shows broken pseudo-English or the wrong language entirely — sign of an unnoticed pipeline failure. Bislang nur dokumentiert, nichts geändert — Umfang (243 Sprachen) und Sprachrisiko sind zu groß
für eine spontane Korrektur.
Ziel: HSK1+HSK2 (Lektion 1-34) für alle Sprachen komplett mit verlässlichen Übersetzungen,
IPA und Audio, wo immer es geht. Diese Checkliste wird laufend aktualisiert und im Hintergrund per
autonomer Sitzung abgearbeitet (python3 tools/build_hsk1_2_master_completeness_report.py neu
erzeugen zur Aktualisierung).
Phasen (Reihenfolge der Abarbeitung)
Code
Text
Wort-IPA
Satz-IPA
Satz-Audio
Wort-Audio
Weitere Qualitätsberichte · Additional audit reports (Release/Contract/Performance/Punctuation/UI)
Einmalig oder bei Bedarf laufende Audits (nicht Teil der pro-Sprache-Übersicht oben), automatisch aus dem
Dateibestand gelesen — jede Sektion erscheint nur, wenn der jeweilige Bericht existiert.
One-off or on-demand audits (not part of the per-language overview above), read automatically from disk —
each section only appears if that report exists.