Validation
Backtest · CUT test · Edge check · Gibberish test · Word length · Entropy · Open problems
Eight independent falsification protocols check the decipherment system against the manuscript, a control corpus, and its own grammar. Each runs client-side and is reproducible with a fixed seed — see the check itself for method and parameters.
Status legend
| PASS | Result within the defined tolerance. |
| WARN | Below the target threshold but not critical — worth watching. |
| FAIL | Threshold exceeded — finding needs review. |
| — | Reference data or a candidate count, no pass/fail criterion. |
Rückwärtstest-Statistik
47 hebräische/aramäische Wörter wurden nach dem Mapping in EVA kodiert und im Korpus gesucht. Typ I sind echte Vorhersagen (vor jeder Folioanalyse eingefroren), Typ II post-hoc-Entdeckungen, die interne Konsistenz belegen. Kein einziger Treffer steht in einem semantisch inkohärenten Kontext.
Typ I — Echte Vorhersagen 10 / 10 · 100%
Diese 10 Wörter wurden als semantische Priors vor jeder Folioanalyse definiert (eingefroren v7.4: dam, or, daiin, sheol, shol, dal, sar, chaiin, kaiim, chalal). Sie können nicht rückwirkend erweitert werden. Ihre Bestätigung ist die valide Kernaussage der Rückwärtsteststärke.
| Vorhersage | Hebräisch | Befund | Kontext |
|---|---|---|---|
| damB | דָּם | ✓ 2× Zeilenende in f57r (suffix) | qokedam, cheeodam, okoldm, yodam |
| sarB | שַׂר | ✓ 1× Beleg in f57r✓ 2× Beleg in f103r | immer Zeilenmitte; nach daiin oder shedy |
| sheolB | שְׁאוֹל | ✓ 4× Beleg in f103r✓ 1× Kolophon in f103r | P.23,35,40(×2),42,45 |
| daiinB | דִּין | ✓ 3× Zeilenanfang in f103r✓ 2× Beleg in f57r | f57r P.5: qokcho·daiin·cheeodam |
| chalalA | חָלָל | ✓ 1× exakt nach sheol P.42Snapshot v7.4 | tshey·sheol·cheolshy·chalal |
| dalB | דַּל | ✓ 3× Beleg in f103r | pchedal, yshdal, dal (standalone) |
| shol · dy · … · sholA | R24-Struktur | ✓ f13r P.1 (Dopplungsformel)Snapshot v7.4 | einmaliges Emphase-Muster mit Genitiv-Brücke dy |
| orB | אוֹר | ✓ 2× Beleg in f103r | Anker: or = Licht/Heilung; f103r P.17 endet or·aiin; vgl. lor ★★★★★; R6 bestätigt (v7.4-Anker) |
| chaiinA | חַיִּין | ✓ 1× Beleg in f2r✓ 4× Beleg in f4r✓ 2× Beleg in f8v | Anker: chaiin = Leben; R18 Diagnosepaar shol·chaiin (abwägende Prognose); R43 erfüllt (f2r + f4r ≥2 Folios); ★★★★ |
| kaiimA | קַיָּם | ✓ 1× Kolophon in f6r | Anker: kaiim = gültig/beständig; R11-Schlussformel ★★★★★; f57r cphedom= (Parallelform) |
Typ II — Interne Kohärenz 34 / 37 · 92%
Diese 37 Wörter wurden während der Folioanalyse erstmals identifiziert. Sie belegen interne Systemkonsistenz, aber keine externe Vorhersagekraft. 29 bestätigt, 3 historische Fehlschläge (nicht im Datensatz).
| Vorhersage | Hebräisch | Befund | Kontext |
|---|---|---|---|
| chedyB | כְּדֵי | ✓ 12× ≥10× Beleg in f103r | nie mit -ody kombiniert (R5) |
| shedyB | שֶׁ+דִּי | ✓ 18× ≥18× Beleg in f103r | immer von Konnektoren gefolgt |
| ckhyB | כְּהִי | ✓ 2× Beleg in f57r | 4 unabhängige Belege + f44v P.9 (R43 3/3; Segmentierungsvarianz zwischen Transkriptoren an dieser Position) |
| taiirB | תָּאִיר | ✓ 1× Zeilenanfang in f57r (prefix) | taiir·sheedy·lchedy·ckheedy |
| sheoldamA | שְׁאוֹל+דָּם | ✓ 1× Paragr. P.9 in f3r | botanische Kohärenz; beide ★★★★★-Anker fusioniert; f3r P.9 auf Blutpflanze |
| daiidy / daiindyAB | דִּין+דִּי | ✓ 1× Beleg in f57r✓ 1× Beleg in f3v | drei Folios, identische Funktion |
| tsheoaromA | תְּ+שְׁאוֹ+רוֹם | ✓ 1× Paragr. P.15 in f3r | nach 7 Blut-Paragraphen: kohärenter Positionswechsel |
| dsholdyA | דְּ+שׁוֹל+דִּי | ✓ 1× Beleg in f9r | Genitiv-Kompositum parallel zu daiindy |
| shoiinA | שׁוֹ+עַיִן | ✓ 1× Paragr. P.4 in f10v✓ 1× Paragr. P.6 in f10v | Doppelbeleg auf demselben Folio |
| torshorA | תֹּר+שׁוֹר | ✓ 1× Zeilenanfang in f13r | Jahreszeit-Zeichen; erster Beleg dieser Form im Korpus |
| pchyA | פְּחִי | ✓ 5× ≥3× Beleg in f13r (suffix) | opchy, qopchy, pchy; bestätigt Alant-Identifikation |
| ykaiin (y+k+aiin)A | יְ+כְּ+עַיִן | ✓ 1× Paragr. P.8 in f14r | ykchaiin→ycheor→ykchor→ykchy→ykaiin: 5 positive Ankerpunkte (ykshol = 6. Glied negativ, f15r P.12) |
| chckhy= (Diagnosekolophon)A | כְּ+כְּ+הִי | ✓ 1× Kolophon in f14r✓ 1× Kolophon in f14v (suffix) | Konzentration in Bifolio bB3; auch medial belegt (f14v P.6) |
| ykshol (y+k+shol)A | יְ+כְּ+שׁוֹל | ✓ 1× Paragr. P.12 in f15r | ykchaiin→ycheor→ykchor→ykchy→ykaiin→ykshol: komplettes Paradigma, positiv + negativ belegt |
| qotchor (Pupillenzeichen)A | קוֹ+תְּ+כֹּר | ✓ 1× Paragr. P.14 in f15r | qotchor·chaiin·chy·kol·daky= — positives Pupillen-Urteil; ophthalmologische Abschlussformel bB2 |
| soloiinA | שׁוֹ+לְ+עַיִן | ✓ 1× Paragr. P.11 in f15v | „Arznei für das Auge“ — höchste Heilarznei-Präzision im Gesamtkorpus; Gegenstück zu shoiin (f10v) |
| cthor (vollständige Heilung)A | כְּ+תֹּר | ✓ 2× Beleg in f15v | daiin·cthor·chol·chor= — cthor+chor = Heilung der Pupillenpathologie; positiver Abschluss Bifolio bB2 |
| chaiin · ckhy · or · aiin (Prognose-Tetrade)A | Prognose-Tetrade | ✓ 1× Paragr. P.4 in f10r✓ 1× Paragr. P.4 in f10r✓ 1× Paragr. P.4 in f10r✓ 1× Paragr. P.4 in f10r | vollständiges hippokratisches Schema; kombinierter Test post-v7.4 → Typ II (v8.8), Einzelanker or/chaiin bleiben Typ I |
| dam (Quire B)A | דָּם | ✓ 1× Paragr. P.8 in f14v | dol · dair · dam — Erstbeleg Blutpathologie in bB3; verbindet f14v mit f3r; post-v7.4 → Typ II (v8.8) |
| shol medial · sheol final (R17 Zodiak)B | שׁוֹל / שְׁאוֹל | ✗ 1× in f72r1 — unter Schwelle 2✓ 2× Beleg in f72r1 (prefix) | identische Verteilung wie botanische Folios; Zodiak-Register post-v7.4 → Typ II (v8.8) |
| f69r Stresstest — kosmologisches Rad-Diagramm, Currier-Sprache unklassifiziert (Quire J/X)B | Mapping v8.0 | ✓ 1× Kolophon in f69r✓ 3× Beleg in f69r | Foliotyp: kosmologisches Rad-Diagramm — keine Botanik, kein {plant}-System, keine Currier-Sprachzuordnung; Mapping ohne Anpassung; f69r post-v7.4 → Typ II (v8.8) |
| otam · otam · chotam (R19/R35)B | אוֹת+אָם · אוֹת+אָם · כֹּ+אוֹת+אָם | ✗ 0× Dopplung in f72r1 — nicht belegt✓ 1× Beleg in f72r1 | einfach → ×2 → Komparativ ko+X; exaktes R35-Schema; semantisch kohärent: Zeichen der Mutter im Stier-dunkel-Kontext |
| okaly= / okal= Minimalpaar (R52a)B | עַ+כָּל+יְ / עַ+כָּל | ✓ 3× Beleg in f72r2✓ 3× Beleg in f72r2 | identischer Stamm okal mit und ohne -y-Suffix auf demselben Ring; beweist R52a: -y ist Status-Emphaticus-Marker, kein festes Wortbildungselement |
| alef / otalef — Stier-ExklusivmarkerB | אָלֶף / אוֹת+אָלֶף | ✓ 1× Beleg in f72r1 (suffix)✓ 1× Beleg in f72r1 | alef = Ochsenkopf-Piktogramm (Aleph-Ursprung); fehlt in f71r, f71v, f72r2; erste ikonographisch verankerte Buchstabenreferenz im Zodiak-Corpus |
| dar·dar-Dopplung (R36) in kosmologischem RegisterAB | דַּר·דַּר | ✓ 1× Dopplung in f18r✓ 1× Paragr. R.17 in f69r✓ 1× Paragr. R.22 in f69r | R43 erfüllt: f18r + f69r = 2 Folios, 3 Gesamtbelege → R36 ★★★ validiert; Typ A (direkt adjacent) erstmals in kosmologischem Register belegt |
| oldam (f34r P.7) → sofortiger Folgebeleg auf f34v P.2 | עַל+דָּם | ✓ 1× Paragr. P.7 in f34r✓ 1× Paragr. P.2 in f34v | ol+dam Erstbeleg f34r P.7 → unmittelbarer Folgebeleg auf dem Verso desselben Bifolios; R43-Frist binnen einer Sitzung erfüllt; post-v7.4 → Typ II (v8.8) |
| Tanacetum f31r: dam im Schlusskolophon — Tanacetum = Blutfluss-Kraut (Macer floridus)A | דָּם | ✓ 1× Kolophon in f31r (suffix) | Tanacetum parthenium ist im mittelalterlichen Kräuterbuch (Macer floridus) als Mittel gegen Menstruationsblutungen gelistet; botanische und textuelle Ebene konvergieren |
| Gentiana f32v endet ol.sho.chy= — Gentiana als bitteres Diagnostikum (Scheol-Blässe-Formel)A | עַל+שׁוֹ+כְּהִי | ✓ 1× Kolophon in f32v✓ 1× Paragr. P.11 in f32v | Enzian (Gentiana) gilt in der mittelalterlichen Pharmakologie als schweres Diagnostikum für lebensbedrohliche Zustände; Schlusskolophon spiegelt negative Prognose |
| Seseli libanotis f34v P.4: oldar.qoldar = intensivierte Wurzelformeln (dreistufiges Präfix) | עַל+דְּ+אַר / וְ+עַל+דְּ+אַר | ✓ 1× Paragr. P.4 in f34v✓ 1× Paragr. P.4 in f34v | f34v (Seseli libanotis, Umbellifere): fibrös-knollige Wurzel ohne zoomorphe Ausformung; oldar/qoldar in P.4 belegt maximale Wurzel-Textintensivierung (qoldar = dreistufig) unabhängig von Zoomorphie; Bryonia-Deutung widerlegt (f34r-Audit) |
| chotchyA | כְּאוֹתכְּהִי | ✓ 1× Paragr. P.7 in f7r✓ 1× Beleg in f21v✓ 1× Beleg in f25r | Scheol-Block-Abschluss; Blässe-Termin bei Kältepflanze semantisch kohärent |
| tcheeyA | תְּחֵיי | ✓ 1× Kolophon in f7v | t-Präfix + cheey-Stamm |
| lokaiinAB | לְ+עֹק+עַיִן | ✓ 1× Beleg in f8v✗ 0× Beleg in f103r — nicht belegt | Direktional "zum Auge"; f103r zwischen checkhy und shedy — therapeutischer Direktional-Kontext |
| oram | עַרָם | ✓ 1× Kolophon in f33v✓ 1× Paragraphenende in f33v | Kolophon-terminal; finales Token vor =-Marker; C/H/U 3/4 |
| ytamB | יְ+תָּם | ✓ 1× Zeilenende in f43r | Abschlussform des Paragraphenblocks, korpusweit 7 von 13 H-Belegen an Phrasen- oder Paragraphengrenze |
| odainB | עַ+דָּן | ✓ 1× Kolophon in f43r | Parallelbildung zu chodain, dort mit derselben Stammbasis dain |
| chedalB | כְּדַּל | ✓ 1× Beleg in f43v | präfixlose Basisform der bereits gelisteten Erweiterung pchedal (p- + k- + dal); korpusweit 24 H-Layer-Belege über 19 Folios |
| otytamB | אוֹת+תָּם | ✓ 1× Zeilenende in f45v✓ 1× Beleg in f86v6 | Vollständigkeitsterm tam im ot-Kompositum; auf f45v phrasenfinal (Grenztyp -) |
CUT-Test — Exklusivitätsmessung
Candidate Uniqueness Test: Misst, ob das Regelwerk pro EVA-Token eine dominante Lesart erzwingt oder mehrere gleichwertige zulässt. Phase 1 bewertet Kandidaten gegen das Lexikon (großer TopGap = eindeutig), Phase 2 erzeugt Lesarten generativ aus den formalisierten Regeln.
Morphem-Segmentierung — statistischer Gegencheck
Lernt rein aus der Vorkommenshäufigkeit im Korpus, an welchen Stellen Wörter am ehesten in Bausteine zerfallen: Zeichen werden iterativ zu den jeweils häufigsten benachbarten Paaren verschmolzen (Byte-Pair-Encoding), anschließend wird an jeder möglichen Wortgrenze gemessen, wie viele unterschiedliche Fortsetzungen im Korpus auftreten (Verzweigungsgrad). Ein hoher Verzweigungsgrad markiert eine wahrscheinliche Morphemgrenze. Die so — ganz ohne Hebräisch-Hypothese — gefundenen Kandidaten werden anschließend gegen die von Hand erschlossene Präfix-/Suffix-Tabelle abgeglichen: Bestätigt reine Statistik unabhängig dieselben Grenzen?
Heuristische Näherung über eine Verzweigungsgrad-Schwelle, kein vollständiges informationstheoretisches Kostenmodell.
Randartefakt-Prüfung — Positions-Konfinierung (OP-A)
Misst pro Lexikoneintrag, wie stark seine Vorkommen an den Zeilenrand (initial/final) gebunden sind. Extreme Randbindung bei randneutralem Stamm deutet auf einen Randallographen statt auf ein eigenständiges Lexem — solche Formen werden mit ihrem Stamm zusammengeführt, nicht gestrichen.
Basis: Mehrheits-Konsens-Tokens über alle Transkriptoren.
| Form | n | initial | final | Konfinierung | Urteil | Begründung |
|---|---|---|---|---|---|---|
| sshey | 5 | 5 (100%) | 0 (0%) | 100% | Merge/Umwidmen | Präfix 's-' auf randneutralem Stamm 'shey' (Stamm-Rand=17%) — Randallograph-Verdacht, keine Streichung |
| ycheol | 12 | 12 (100%) | 0 (0%) | 100% | Merge/Umwidmen | Präfix 'y-' auf randneutralem Stamm 'cheol' (Stamm-Rand=13%) — Randallograph-Verdacht, keine Streichung |
| ychor | 16 | 16 (100%) | 0 (0%) | 100% | Merge/Umwidmen | Präfix 'y-' auf randneutralem Stamm 'chor' (Stamm-Rand=17%) — Randallograph-Verdacht, keine Streichung |
| ycheey | 22 | 20 (91%) | 0 (0%) | 91% | Merge/Umwidmen | Präfix 'y-' auf randneutralem Stamm 'cheey' (Stamm-Rand=12%) — Randallograph-Verdacht, keine Streichung |
| ychol | 11 | 10 (91%) | 0 (0%) | 91% | Merge/Umwidmen | Präfix 'y-' auf randneutralem Stamm 'chol' (Stamm-Rand=12%) — Randallograph-Verdacht, keine Streichung |
| dshedy | 33 | 29 (88%) | 0 (0%) | 88% | Merge/Umwidmen | Präfix 'd-' auf randneutralem Stamm 'shedy' (Stamm-Rand=13%) — Randallograph-Verdacht, keine Streichung |
| paiin | 8 | 7 (88%) | 0 (0%) | 88% | Merge/Umwidmen | Präfix 'p-' auf randneutralem Stamm 'aiin' (Stamm-Rand=12%) — Randallograph-Verdacht, keine Streichung |
| ychey | 16 | 14 (88%) | 0 (0%) | 88% | Merge/Umwidmen | Präfix 'y-' auf randneutralem Stamm 'chey' (Stamm-Rand=15%) — Randallograph-Verdacht, keine Streichung |
| qotchor | 13 | 11 (85%) | 0 (0%) | 85% | Merge/Umwidmen | Präfix 'qot-' auf randneutralem Stamm 'chor' (Stamm-Rand=17%) — Randallograph-Verdacht, keine Streichung |
| tshol | 6 | 5 (83%) | 0 (0%) | 83% | Merge/Umwidmen | Präfix 't-' auf randneutralem Stamm 'shol' (Stamm-Rand=22%) — Randallograph-Verdacht, keine Streichung |
| dshol | 5 | 4 (80%) | 0 (0%) | 80% | Merge/Umwidmen | Präfix 'd-' auf randneutralem Stamm 'shol' (Stamm-Rand=22%) — Randallograph-Verdacht, keine Streichung |
| dshor | 14 | 11 (79%) | 0 (0%) | 79% | Merge/Umwidmen | Präfix 'dsh-' auf randneutralem Stamm 'or' (Stamm-Rand=20%) — Randallograph-Verdacht, keine Streichung |
| sor | 46 | 34 (74%) | 1 (2%) | 74% | Merge/Umwidmen | Präfix 's-' auf randneutralem Stamm 'or' (Stamm-Rand=20%) — Randallograph-Verdacht, keine Streichung |
| pol | 13 | 9 (69%) | 1 (8%) | 69% | Merge/Umwidmen | Präfix 'p-' auf randneutralem Stamm 'ol' (Stamm-Rand=22%) — Randallograph-Verdacht, keine Streichung |
| ochor | 6 | 4 (67%) | 0 (0%) | 67% | Merge/Umwidmen | Präfix 'o-' auf randneutralem Stamm 'chor' (Stamm-Rand=17%) — Randallograph-Verdacht, keine Streichung |
| shoiin | 6 | 4 (67%) | 0 (0%) | 67% | Merge/Umwidmen | Präfix 'sh-' auf randneutralem Stamm 'oiin' (Stamm-Rand=3%) — Randallograph-Verdacht, keine Streichung |
| ytchor | 11 | 7 (64%) | 0 (0%) | 64% | Merge/Umwidmen | Präfix 'yt-' auf randneutralem Stamm 'chor' (Stamm-Rand=17%) — Randallograph-Verdacht, keine Streichung |
| sol | 64 | 39 (61%) | 5 (8%) | 61% | Merge/Umwidmen | Präfix 's-' auf randneutralem Stamm 'ol' (Stamm-Rand=22%) — Randallograph-Verdacht, keine Streichung |
| Form | n | initial | final | Konfinierung | Urteil | Begründung |
|---|---|---|---|---|---|---|
| dom | 8 | 0 (0%) | 8 (100%) | 0% | Kandidat | |
| ram | 13 | 0 (0%) | 13 (100%) | 0% | Kandidat | |
| oram | 8 | 0 (0%) | 8 (100%) | 0% | Kandidat | |
| oldam | 5 | 0 (0%) | 5 (100%) | 0% | Kandidat | |
| ry | 15 | 1 (7%) | 14 (93%) | 7% | Kandidat | |
| sam | 13 | 1 (8%) | 12 (92%) | 8% | Kandidat | |
| sy | 30 | 2 (7%) | 26 (87%) | 7% | Kandidat | |
| koldy | 6 | 0 (0%) | 5 (83%) | 0% | Kandidat | |
| chary | 6 | 0 (0%) | 5 (83%) | 0% | Kandidat | |
| dan | 15 | 0 (0%) | 12 (80%) | 0% | Kandidat | |
| dary | 17 | 0 (0%) | 13 (76%) | 0% | Kandidat | |
| okam | 23 | 0 (0%) | 17 (74%) | 0% | Kandidat | |
| dam | 95 | 1 (1%) | 68 (72%) | 1% | Review (geschützt) | hochfrequentes Content-Lemma (n=95) — kein Streichungsurteil |
| chory | 12 | 0 (0%) | 8 (67%) | 0% | Kandidat | |
| otam | 45 | 0 (0%) | 29 (64%) | 0% | Kandidat | |
| cham | 22 | 0 (0%) | 14 (64%) | 0% | Kandidat | |
| ory | 16 | 0 (0%) | 10 (63%) | 0% | Kandidat | |
| daly | 29 | 0 (0%) | 18 (62%) | 0% | Kandidat |
Gibberish test
Falsification tool: randomly generated pseudowords with Voynich-like character statistics are checked against the grammar rules. If too many of them passed, the rule system would be arbitrary. Target corridor: ≤ 10 % structural false positives · current test value: 8.6 % (seed 42, reproducible).
Zur Entropie-Messung siehe OP3-Audit.
Wortlängenverteilung (OP1-Audit)
OP1 behauptete eine rigide, zu schmale Wortlängenverteilung für freie semitische Morphologie. Skaleninvariant gegen echte semitische Referenzen gemessen (Mischna, Westminster Leningrad Codex) trifft das nicht zu: das Voynich-Korpus ist gleich weit oder weiter gestreut als die Referenzen, nicht enger. Der Befund entlastet OP1 — Details siehe Offene Probleme.
226 lokale Stolfi-Transkriptionen (224 Folios), H-/C-/F-Layer, gegen 62 Traktate der Kern-Mischna (Sefaria-Export), WLC (hebräisch/aramäisch getrennt), italienische (Dante, Boccaccio) und lateinische Kontrolltexte (Vergil, Caesar).
Kennzahlen (Token-Ebene)
| Verteilung | n | Mittel | sd | CV | QCD | Schiefe | ExKurt | H (bit) |
|---|---|---|---|---|---|---|---|---|
| Voynich H-Layer — EVA-Glyphen | 37.049 | 5,05 | 1,75 | 0,347 | 0,200 | +0,088 | +0,245 | 2,836 |
| Voynich C-Layer — EVA-Glyphen | 17.617 | 5,01 | 1,75 | 0,349 | – | +0,212 | +0,521 | 2,836 |
| Voynich F-Layer — EVA-Glyphen | 32.353 | 5,08 | 1,63 | 0,320 | – | +0,058 | +0,121 | 2,738 |
| Voynich H-Layer — hebr. Buchstaben | 37.049 | 3,48 | 1,24 | 0,356 | – | +0,297 | +0,078 | 2,336 |
| WLC Hebräisch — Token, Buchstaben | 284.635 | 3,92 | 1,28 | 0,326 | 0,250 | +0,393 | −0,094 | 2,345 |
| WLC Hebräisch — Stamm ohne Proklitika | 284.635 | 3,45 | 1,22 | 0,353 | 0,143 | +0,334 | −0,065 | 2,308 |
| WLC Hebräisch — Proklitika je Wort | 284.635 | 0,43 | 0,54 | 1,248 | 1,000 | +0,700 | −0,643 | 1,094 |
| WLC Aramäisch — Token, Buchstaben | 4.948 | 4,07 | 1,48 | 0,363 | 0,250 | +0,548 | +0,168 | 2,519 |
| Mischna (Sefaria) — Token, Buchstaben | 187.055 | 4,02 | 1,33 | 0,331 | 0,250 | +0,409 | −0,080 | 2,409 |
| Kontrolle Italienisch — Dante, Commedia (Vers, ca. 1321) | 97.187 | 4,14 | 2,25 | 0,544 | 0,500 | +0,702 | +0,101 | 3,059 |
| Kontrolle Italienisch — Boccaccio, Decameron (Prosa, ca. 1350) | 258.763 | 4,56 | 2,60 | 0,571 | 0,500 | +0,799 | +0,338 | 3,246 |
| Kontrolle Latein — Caesar, De bello Gallico | 51.316 | 6,18 | 2,92 | 0,473 | 0,333 | +0,367 | −0,427 | 3,477 |
| Kontrolle Latein — Vergil, Aeneis | 63.795 | 5,76 | 2,21 | 0,384 | 0,273 | +0,225 | −0,232 | 3,144 |
Der Variationskoeffizient (CV) des Voynich-Korpus liegt oberhalb des mischnischen und biblisch-hebräischen, unterhalb des aramäischen und klar unterhalb der italienischen und lateinischen Kontrollwerte — die Kennzahl trennt also erkennbar zwischen Sprachen, ohne das Voynich-Korpus als Ausreißer auszuweisen. Der Quartilsdispersionskoeffizient (QCD) ist bei den kurzen, ganzzahligen Wortlängen zu grob, um zwischen den Verteilungen zu trennen (Voynich EVA 0,200 gegen WLC-Token 0,250, bei identischer absoluter IQR-Breite von 2), und wird deshalb nicht als tragende Kennzahl geführt.
Konzentration bei gleicher Fensterbreite
| Verteilung | bestes 3er-Fenster | bestes 5er-Fenster |
|---|---|---|
| Voynich H-Layer — EVA-Glyphen | 4–6: 63,19 % | 3–7: 84,43 % |
| Voynich H-Layer — hebr. Buchstaben | 2–4: 76,68 % | 2–6: 95,22 % |
| WLC Hebräisch — Token, Buchstaben | 3–5: 74,27 % | 2–6: 97,32 % |
| WLC Hebräisch — Stamm ohne Proklitika | 2–4: 77,72 % | 2–6: 96,08 % |
| WLC Hebräisch — Proklitika je Wort | 0–2: 99,98 % | 0–4: 100,00 % |
| WLC Aramäisch — Token, Buchstaben | 3–5: 67,56 % | 2–6: 94,24 % |
| Mischna — Token, Buchstaben | 3–5: 72,81 % | 2–6: 96,38 % |
| Kontrolle Italienisch — Dante, Commedia | 2–4: 49,22 % | 2–6: 75,86 % |
| Kontrolle Italienisch — Boccaccio, Decameron | 2–4: 44,32 % | 2–6: 70,30 % |
| Kontrolle Latein — Caesar | 5–7: 36,49 % | 4–8: 56,03 % |
| Kontrolle Latein — Vergil | 5–7: 50,13 % | 4–8: 72,25 % |
Das in OP1 genannte Fenster 4–8 EVA-Glyphen fasst 79,69 % der Tokens — weniger als jedes gleich breite Fenster in allen drei semitischen Referenzen.
Längenhistogramm (Anteil der Tokens in %)
| Länge | Voynich EVA | Voynich hebr. | Mischna | WLC Hebr. |
|---|---|---|---|---|
| 1 | 2,11 | 3,64 | 0,05 | 0,00 |
| 2 | 6,23 | 19,26 | 13,26 | 14,73 |
| 3 | 9,47 | 28,52 | 23,47 | 23,79 |
| 4 | 18,04 | 28,91 | 29,37 | 30,81 |
| 5 | 25,27 | 14,82 | 19,98 | 19,67 |
| 6 | 19,88 | 3,72 | 10,31 | 8,32 |
| 7 | 11,77 | 0,90 | 2,81 | 2,21 |
| 8 | 4,73 | 0,15 | 0,63 | 0,37 |
| ≥ 9 | 2,50 | 0,05 | 0,13 | 0,09 |
Im Konsonantenskelett liegt der Modus beider Verteilungen bei 4 Buchstaben (Voynich 28,91 % · Mischna 29,37 %).
Verschobener Binomialfit (Totalvariationsabstand)
| Verteilung | Fit | TVD |
|---|---|---|
| Voynich — EVA-Glyphen | Binomial(11; 0,459) | 0,0509 |
| Voynich — hebr. Buchstaben | Binomial(6; 0,579) | 0,0460 |
| Mischna | Binomial(8; 0,378) + 1 | 0,0396 |
| WLC Hebräisch | Binomial(7; 0,417) + 1 | 0,0505 |
Die oft zitierte Binomialnähe der Voynich-Wortlängen ist kein Unterscheidungsmerkmal: die semitischen Referenzen lassen sich ebenso gut oder besser durch eine Binomialverteilung beschreiben.
Affigierungstiefe (Proklitika je Wort)
| Voynich (R41-Kette, Obergrenze) | WLC Hebräisch (Proklitika) | |
|---|---|---|
| Mittel je Wort | 0,81 | 0,43 |
| sd | 0,89 | 0,54 |
| Maximaltiefe | 5 | 4 |
| Verteilung 0/1/2/3/4/5 | 18.010 / 8.840 / 9.542 / 606 / 49 / 2 | 168.457 / 110.388 / 5.732 / 57 / 1 / – |
Voynich-Werte sind eine Obergrenze (maximal gegriffene R41-Kette, Rest muss korpusbelegtes Token sein); für die Mischna liegt keine morphologische Annotation vor.
Verbleibende Restbefunde (nicht Teil von OP1)
- Im Konsonantenskelett sind Voynich-Wörter im Mittel 0,54 Buchstaben (≈13 %) kürzer als mischnische.
- 3,64 % der Tokens sind einbuchstabig, gegen 0,05 % (Mischna) und 0,00 % (WLC) — eine Frage der Wortabtrennung, nicht der Längenverteilung; ohne Klärung der Spatienfrage nicht entscheidbar.
Methode: EVA-Tokens über stolfi.tokenize() (99,73 % der H-Layer-Tokens, Klammerartefakte/Unsicherheitsmarker ausgeschlossen), Umrechnung ins Konsonantenskelett über das projekteigene Mapping und Positionsregel R2. Mischna bereinigt um HTML-Seitenmarker, lateinschriftliche Zeilen, Bibelstellen-Klammerverweise und Geresch/Gerschajim-Abkürzungen. WLC über OSIS-XML je `<w>`-Element, Niqqud/Teamim entfernt, Proklitikazahl aus dem morph-Attribut.
Reproduktion & Quellen
Toolkit herunterladen (.zip)Enthält die Download- und Analyseskripte (op1_length_test.py, stolfi.py, fetch_*.py), README und Lizenzhinweise. Kein Python-Paket außer der Standardbibliothek nötig; die Referenzkorpora selbst sind nicht enthalten (Download per Skript, siehe README).
Referenzkorpora- Westminster Leningrad Codex (WLC) — Text: Public Domain · Annotation: CC BY 4.0
- Mischna, Ausgabe Vilna 1913 (Sefaria) — Public Domain
- Vergil, Aeneis / Caesar, De bello Gallico (Perseus Digital Library) — CC BY-SA 4.0
- Dante, Divina Commedia (Wikisource) — CC BY-SA 4.0
- Boccaccio, Decameron, Ausgabe Vittore Branca (Biblioteca-italiana, Sapienza Roma) — Public Domain
Slot-Grammatik-Positionsbindung (OP2-Audit)
OP2 fragt, ob bestimmte EVA-Glyphen statistisch an feste Wortpositionen gebunden sind (Tiltman/Stolfi-Slot-Grammatik) und ob das durch die dokumentierte Präfix-/Suffix-Morphologie (R41) hinreichend erklärt wird. Auf Glyphebene sind 49 % der Positionsentropie aus der Glyph-Identität vorhersagbar; auf Wortebene liegt die Bindung 2,4- bis 2,5-fach über zwei unabhängigen hebräischen Referenzen — Mischna-Hebräisch (die Zielsprache der Grundhypothese) und Biblisches Hebräisch (WLC). Nach lexikalisch konditioniertem Strip der bestätigten Affixe bleibt auf Wortebene nur rund 13 % der Bindung erklärt. Auf Wurzelebene ist der Befund nicht entschieden: die beiden Maße widersprechen sich. Details siehe Offene Probleme.
Glyphebene — Positionsbindung
| Glyph | Gruppe | N | INI % | MED % | FIN % | KL (bit) |
|---|---|---|---|---|---|---|
qINI | cons | 5025 | 99,4 | 0,6 | 0,0 | 2,074 |
aiinFIN | compound | 1859 | 0,1 | 0,8 | 99,1 | 2,044 |
n | cons | 1922 | 0,0 | 1,5 | 98,5 | 2,006 |
m | cons | 848 | 0,2 | 4,2 | 95,5 | 1,804 |
y | cons | 14184 | 10,4 | 2,6 | 87,0 | 1,451 |
r | cons | 5338 | 4,8 | 18,5 | 76,7 | 0,949 |
sh | digraph | 3631 | 69,6 | 30,2 | 0,2 | 0,852 |
eMED | vowel | 8893 | 0,5 | 99,1 | 0,3 | 0,806 |
iiMED | vowel | 376 | 0,8 | 98,9 | 0,3 | 0,797 |
ee | vowel | 4056 | 1,1 | 98,7 | 0,2 | 0,786 |
I(Glyph;Position) = 0,713 bit bei H(Pos) = 1,450 bit (H-Layer, 27.493 Token mit ≥ 3 Glyphen, Mapping v9.9.7, longest-match-first, 99,9 % der Token segmentierbar). Vier Glyphen sind auf einen einzigen Slot festgelegt: q (INI), aiin (FIN), e (MED), ii (MED) — hier fett markiert. Ausgewählt sind die zehn Glyphen mit der stärksten KL-Divergenz vom Positions-Marginal des Korpus; vollständige Tabelle im Toolkit (op2_step1.json).
Wortebene — MI längen-stratifiziert
| Länge | Voyn. voll | Voyn. Wz. | Misch. voll | Misch. Wz. | WLC voll | WLC Wz. |
|---|---|---|---|---|---|---|
| 3 | 0,871 | 0,833 | 0,313 | 0,397 | 0,326 | 0,318 |
| 4 | 0,767 | 0,632 | 0,280 | 0,365 | 0,235 | 0,281 |
| 5 | 0,717 | 0,580 | 0,307 | 0,285 | 0,294 | 0,250 |
| 6+ | 0,658 | 0,476 | 0,415 | 0,381 | 0,390 | 0,291 |
| gepoolt | 0,785 | 0,685 | 0,323 | 0,368 | 0,312 | 0,294 |
I(Glyph;Position) in bit, konditionierter Strip (ein Präfix/Suffix wird nur abgetrennt, wenn der Rest eigenständig als Korpustyp belegt ist — dieselbe Bedingung auf allen drei Seiten). Faktor Voynich/Mischna: Vollwort 2,43× · Wurzel 1,86×. Faktor Voynich/WLC: Vollwort 2,51× · Wurzel 2,33×. Mischna-Hebräisch verhält sich auf Wortebene praktisch wie Biblisches Hebräisch (0,323 gegen 0,312 bit) — die Erwartung, die eigentliche Zielsprache zeige eine höhere Eigenbindung und der Abstand schrumpfe, bestätigt sich nicht.
Formales Slot-Modell — Restriktivität
| Ebene | n | Cov % | Restr % | Cov/Restr |
|---|---|---|---|---|
| Voynich Volltoken | 27 493 | 98,9 | 41,7 | 2,37 |
| Voynich Wurzeln (kond.) | 10 167 | 99,5 | 76,0 | 1,31 |
| Mischna Vollwörter | 162 094 | 100,0 | 68,6 | 1,46 |
| Mischna Wurzeln (kond.) | 121 832 | 100,0 | 73,5 | 1,36 |
Restriktivität = Durchlassquote zufälliger Umstellungen desselben Glyph-Multisets im gelernten Modell SLOT(g) ⊆ {INI, MED, FIN} (Lizenzschwelle 1 % der Vorkommen); niedrig = die Grammatik verbietet viel. Auf Wortebene bestätigt dieses zweite, unabhängige Maß den MI-Befund (41,7 % gegen 68,6 % Mischna, dazu 70,3 % WLC). Auf Wurzelebene tut es das nicht mehr: 76,0 % gegen 73,5 % — praktisch gleich, Mischna sogar minimal restriktiver. Bei kurzen Strings verbietet der Constraint-Satz kaum noch etwas; das Maß trennt dort nicht mehr.
Methode: Glyph = Einheit der projekteigenen Mapping-Tabelle (longest-match-first). Positionsklassen INI/MED/FIN nur für Token mit ≥ 3 Glyphen. Wurzelgewinnung durch lexikalisch konditionierten Strip, symmetrisch auf Voynich, WLC und Mischna angewendet (Mischna trägt keine morphologische Annotation, daher auf beiden Seiten derselbe Algorithmus statt Lexikon vs. Algorithmus wie beim ursprünglichen WLC-Vergleich). Am WLC ist der Algorithmus gegen die echte morphologische Annotation validiert: Wurzel-MI 0,294 bit konditioniert gegen 0,346 bit annotiert — ein brauchbarer, leicht konservativer Stellvertreter.
Reproduktion & Quellen
Toolkit herunterladen (.zip)Enthält alle Analyseskripte (op2_slots.py, op2_strip.py, op2_hebrew.py/op2_hebrew2.py, op2_fix.py, op2_mishnah.py, op2_model.py, op2_ch.py), Fetch-Skripte für beide Referenzkorpora, projekteigenen Korpuszugriff (stolfi.py, cut.py), README und Lizenzhinweise. Kein Python-Paket außer der Standardbibliothek nötig; die Referenzkorpora selbst sind nicht enthalten (Download per Skript, siehe README).
Referenzkorpora- Westminster Leningrad Codex (WLC) — Text: Public Domain · Annotation: CC BY 4.0
- Mischna, Vilna-Ausgabe 1913 (Sefaria-Export) — Text: Public Domain
Konditionalentropie H2 (OP3-Audit)
OP3 prüft, ob die niedrige Konditionalentropie zweiter Ordnung (H2) des Voynich-Textes durch Niqqud-Vokalisierung allein erklärbar ist. Gegen den echten WLC-Referenztext gemessen (25 Bücher, Hebräisch + Aramäisch getrennt) zeigt sich: Vokalisierung senkt H2 spürbar, aber nicht so weit wie im Manuskript — ein Abstand von rund 1,2 bit bleibt bestehen. Der projekteigene, grammatikinformierte Generator (/api/gibberish/protocol) trifft die Unigrammentropie (H1) gut, verfehlt die Konditionalentropie (H2) aber stabil um rund 0,33 bit. Details siehe Offene Probleme.
Kennzahlen
| Korpus | H1 (bit) | H2 (bit) |
|---|---|---|
| Voynich H-Layer — EVA (wortintern) | 3,860 | 2,122 |
| WLC Hebräisch — vokalisiert (Niqqud, ohne Kantillation) | 4,833 | 3,338 |
| WLC Hebräisch — unvokalisiert | 4,232 | 3,896 |
| WLC Aramäisch — vokalisiert (Niqqud) | 4,757 | 3,150 |
| WLC Aramäisch — unvokalisiert | 4,242 | 3,647 |
| Generator /api/gibberish/protocol (Ø 3 Seeds) | 3,811 | 2,451 |
Niqqud-Vokalisierung senkt H2 im Referenzkorpus um 0,56 bit (3,896 → 3,338). Voynichese liegt mit 2,122 bit auch unterhalb des vokalisierten Referenzwerts (Abstand 1,22 bit) — Vokalmarkierung erklärt die niedrige H2-Entropie des Voynich-Textes damit nicht hinreichend. Der Generator, der die Grammatikregeln R1–R59 (aktuell ~15 % maschinenlesbar abgebildet, siehe OP5) informell nachbildet, reproduziert diesen Abstand nicht: seine H2 liegt stabil (3 Seeds, Spread 0,007 bit) rund 0,33 bit über der Manuskript-H2.
Methode: Konditionalentropie H(cᵢ|cᵢ₋₁), ausschließlich wortintern (Bigramme kreuzen keine Wortgrenze). WLC über OSIS-XML je <w>-Element, Sprache über das morph-Attribut getrennt. „Vokalisiert" bezeichnet hier Konsonanten + echte Vokalpunkte (Niqqud), Kantillationsakzente (Teamim) sind ausgeschlossen — die volle Variante (inkl. Kantillation) liefert einen sichtbar kleineren Vokalisierungseffekt (0,21 statt 0,56 bit, Details im Toolkit-README).
Reproduktion & Quellen
Toolkit herunterladen (.zip)Enthält Download- und Analyseskript (op3_entropy_test.py, fetch_wlc.py, stolfi.py), README und Lizenzhinweise. Kein Python-Paket außer der Standardbibliothek nötig; das WLC-Referenzkorpus selbst ist nicht enthalten (Download per Skript, siehe README).
Referenzkorpus- Westminster Leningrad Codex (WLC) — Text: Public Domain · Annotation: CC BY 4.0
Open problems and unresolved contradictions
Honest documentation of the statistical anomalies and methodological limits that the system does not explain. Introduced in v7.5.
Methodological caveat
The decipherment system is a strong reading hypothesis, not a proven decipherment. The following problems do not necessarily contradict the hypothesis, but they must remain visible. Internal coherence does not prove external validity.
Ursprüngliche These: Die Wortlängenverteilung sei zu schmal für freie semitische Morphologie (rigide Konzentration auf 4–8 EVA-Zeichen). Skaleninvariant gegen echte semitische Referenzen (Mischna, WLC) geprüft: Der Voynich-Variationskoeffizient (0,347) liegt im Bereich der Referenzen (0,326–0,363) und darunter — nicht enger. Das genannte 4–8-Fenster fasst weniger Tokens (79,69 %) als jedes gleich breite Fenster in den semitischen Referenzen. Details, Kennzahlen und Methode: siehe Wortlängen-Validierung.
Key figures, tables and method: Word-length validation.
Bestimmte EVA-Glyphen kommen statistisch nur in bestimmten Wortpositionen vor (Slot-Grammatik nach Tiltman/Stolfi). Die Bindung ist in v9.9.7 erstmals quantifiziert, formal modelliert und gegen zwei hebräische Referenzkorpora kalibriert (Mischna, WLC). Auf Glyphebene sind 49 % der Positionsentropie aus der Glyph-Identität vorhersagbar; auf Wortebene liegt die Bindung beim 2,4- bis 2,5-Fachen beider Referenzen, bestätigt durch ein zweites, unabhängiges Maß (Restriktivität eines formalen Slot-Modells). Die von OP2 geforderte formale Modellierung liegt damit vor; der Befund auf Wortebene ist robust und doppelt abgesichert. Kennzahlen, Tabellen und Methode: siehe Slot-Grammatik-Audit.
Key figures, tables and method: Slot-grammar audit.
Die Konditionalentropie zweiter Ordnung wurde einheitengematcht gegen den WLC-Referenztext neu gemessen (Voynich H-Layer, 32.646 Tokens aus 202 Folios; WLC 301.837 hebräische Tokens aus 39 Büchern). Leitvergleich ist das Konsonantenskelett, auf beiden Seiten identisch definiert als Zeichenfolge nach Entfernen aller Vokalzeichen, auf der Voynich-Seite nach Anwendung der Mappingtabelle. Voynichese liegt bei 2,276 bit (95-Prozent-Intervall 2,240 bis 2,310), das hebräische Referenzkorpus bei 3,739 bit (3,701 bis 3,766); der Abstand beträgt 1,46 bit bei vergleichbarer mittlerer Wortlänge (3,86 gegenüber 3,92 Konsonanten). Der Abstand ist gegenüber der Wahl der Analyseeinheit stabil und liegt in jeder gematchten Konvention zwischen 1,3 und 1,6 bit. Inventargröße, Typenwiederholung, unmittelbare Wortwiederholung und die Compound-Einheiten der Mappingtabelle erklären zusammen rund 0,2 bit.
Working hypothesis:
Die Zurückführung auf die positionelle Vorhersagbarkeit des Slot-Systems wird durch die direkte Messung nicht getragen. Die Kompression ist sequentiell, nicht positional Positionskenntnis senkt die Entropie im Manuskript um 0,32 bit (H1 3,307 auf H_pos 2,983), Kenntnis des Vorgängerzeichens um 1,03 bit; im hebräischen Referenzkorpus betragen dieselben Werte 0,12 und 0,32 bit. Das Entfernen der über die Segmentierung bestätigten Präfixe und Suffixe senkt die Wurzel-H2 auf 2,000 bit und vergrößert den Abstand auf 1,64 bit, statt ihn zu verkleinern die morphologische Affixschicht trägt die Kompression nicht, sie liegt im Wurzelmaterial selbst. Eine Rückkodierung hebräischen Referenztextes über die Mappingtabelle nach EVA erreicht 3,239 bit und reproduziert die Manuskriptwerte ebenfalls nicht, bei einer Abdeckung von 59,7 Prozent der Zeichen. Der Befund ist über Sprache-A-Ankerfolios und übrige Folios homogen (2,303 gegenüber 2,227 bit). Als Erklärungsraum bleiben Mechanismen, die wortinterne Zeichenfolgen unabhängig von Morphologie und Vokalisierung einschränken.Key figures, table and method: Entropy audit.
Das System wurde noch nicht durch einen unabhängigen Hebraisten blind getestet — d.h. ein Fachmann, der das Entzifferungssystem nicht kennt, hat noch nicht versucht, Voynich-Text damit zu lesen. Dies ist die stärkste Form der externen Validierung und fehlt vollständig.
For Hebraists and Aramaists who wish to carry out an independent check: the complete character mapping and the 10 frozen type-I anchors are ready.
The decipherment-system document is available as a Markdown export.
Die Exklusivitätsmessung ist definiert und deterministisch reproduzierbar, aber noch nicht abschlussfähig. Nach Lesarten-Kollaps (`cut.py --collapse`, N=1000, Seed 42) liegt der TopGap-Median über analysierbaren Tokens bei 31, die Exklusivitätsquote bei 73 %. Offen bleiben zwei Punkte unabhängig voneinander — die Regelabdeckung von Phase 2 ({{CUT_RULE_COVERAGE}}, coverageRatio 0,25) und die Abdeckungsquote des Lesartengenerators (69 %).
Working hypothesis:
Die verbleibende Mehrdeutigkeit ist keine breite Streuung, sondern eine einzige Klasse — Präfix gegen Wurzelkonsonant (72 % der echten Fälle), konzentriert auf wenige hochfrequente Funktionsstämme (ol/al, ar/or, aiin, ky, ot). Diese Klasse ist am isolierten Token prinzipiell nicht auflösbar; sie erfordert einen kontextuellen CUT (Phase 3) auf geordneten Absatzsequenzen analog Phase 2b. Abschlussbedingung, dreiteilig — (a) Exklusivitätsquote über analysierbaren Tokens mindestens 80 % bei TopGap-Median über 20, gemessen nach Morphemketten-Kollaps und mit festem Seed, N mindestens 1000; (b) vollständige Regelabdeckung Phase 2 für die als per-Token-tauglich klassifizierten Regeln; (c) Abdeckungsquote separat ausgewiesen, nicht in die Exklusivitätskennzahl verrechnet. Von 60 Regeln sind 15 per-Token-tauglich (token-morphologisch, nicht Diskurs/Register/Struktur/Meta) und alle 15 im Generator formalisiert — R1, R2, R3, R4, R8, R28, R40, R41, R45, R50, R59, R61, R65, R66, D1-D2; (b) ist damit erfüllt. R17 (shol medial vs. sheol zeilenfinal) und R30 (sho- + Nomen) sind nicht per-Token-formalisierbar: R17 hängt von Zeilenposition und Sprache-A/B-Kontext ab, den der isolierte-Token-Generator architektonisch nicht hat — dieselbe Kategorie von Lücke, die R44 aus Phase 2b heraushält; R30s einziger im Lexikon getaggter Beleg (shodaiin = shod + daiin) ist ein Kompositum zweier eigenständiger Lexikonwörter statt einer Präfix+Wurzel-Struktur, und ein mechanisches sho-Strippen würde zudem die weit häufigeren shol/sheol-Wörter falsch zerlegen. R44, R46, R52a bleiben ungeprüfte Grenzfälle. Die Abdeckungslücke von 31 % ist ein Lexikon- und Generatorproblem und wird nicht als Mehrdeutigkeit gewertet.25/25 Folios zeigen FOLIUM-Textfreiheit (R60 Korollar 3, v8.7: ★★★★★). Die 25-Folio-Schwelle wurde mit f32r, f32v, f33v, f34r, f34v überschritten. Offene Grundsatzfrage bleibt: bewusste pharmakologische Kodierung oder rein layoutbedingtes Phänomen?
Quire E eröffnet mit f33r (Mandragora officinarum, humanoid) als zoomorpher Wurzel-Darstellung. f34v wurde zunächst als zoomorphe Bryonia gedeutet (Bryonia-Paar-Hypothese); der f34r-Audit zeigt jedoch eine fibrös-knollige Wurzel ohne zoomorphe Ausformung und eine Umbellifere (Seseli libanotis). Frage: Bleibt f33r ein isolierter Zoomorphie-Beleg in Quire E, oder setzt sich das Muster in f35r/f35v und weiteren Folios fort?
Drei Stellen definierten unterschiedliche Präfix-Inventare: R41 nannte vier Slotklassen (d-; o-/qo-; l-/k- gemeinsam; op-/of-), die GRAMMAR_PREFIX-Tabelle zehn Einträge (davon einige mechanical:false), und die mechanische Segmentierung eine eigene Neun-Einträge-Liste. Folgen (App-Seite, seit v9.9.3 behoben): k- wurde nie als Präfix gelesen, obwohl R41-Slot und Tabelleneintrag vorhanden (1.145–1.352 wortinitiale k-Belege, transkriptorabhängig); op-/of- wurde nie als Einheit erkannt, sondern zu o- + p- zerlegt bzw. bei f- gar nicht; p-, y-, t- wurden als R41-Schalen mitgezählt, obwohl sie in R41 keinen Slot haben; qok-/qod- waren nur im Segmentierer definiert; zwei unabhängige Prüfpfade innerhalb der App (die automatisch erzeugte Regel-Beleglage vs. der /api/gibberish/analyze-Endpunkt) konnten für dasselbe Wort gegenteilige Urteile liefern (ytoldy, otochor, oqotar). Zusätzlich zeigte ein Korpus-Nachaudit: l- und k- sind strikt sequentielle, keine gemeinsame Slots (l- vor k- 127:2, qo- vor k- 310:0, k-/t- komplementär: 0 gestapelte Belege), und op-/of- ist der äußerste Wrapper, nicht die innerste Schale (Positionsbindung 11,4 % gegen blankes p- 70,9 % — op-/of- ist damit kein Randallograph).
Working hypothesis:
Umgesetzt (v9.9.3): GRAMMAR_PREFIXES (grammar.data.js) ist die alleinige, handgepflegte App-Quelle mit Klassenzuordnung und R41-Hierarchieposition (r41Slot) — mechanische Stripliste, R41-Prüfung (checkR41) und Grammatik-Anzeigetabelle leiten sich vollständig daraus ab, keine Parallelliste mehr. k- und op-/of- sind jetzt mechanisch aktiv (k- guarded: nur bei etabliertem Rest oder folgendem Currier-Galgen, da k-/ch- vor Vokal oft Stamm-Allograph ist — lkeedy 39× vs. leedy 0× vs. lcheedy 9×); qok-/qod- sind als Einträge entfallen und lösen sich als qo-+k-/qo-+d- auf. Die drei ursprünglichen Teilfragen sind empirisch beantwortet: (1) p- bleibt eigenständige OP-A-Frage, klar von op-/of- getrennt; (2) k- ist eigenständig segmentierbar, aber lexikalisch guarded, nicht bedingungslos frei; (3) op-/of- ist korpusweit verteilt (343 Belege / 125 Folios, Schwerpunkt Rezeptteil f103–f116) statt auf Quire H beschränkt. Die unabhängige Skript-Reimplementierung außerhalb der App wurde ebenfalls auf das Fünf-Slot-Modell umgestellt und um gemischte R41-/Verbalpräfix-Ketten erweitert (otochor → o-t-ochor wird jetzt auf beiden Seiten gefunden) — die zuvor beobachtete Restdivergenz ist damit behoben. Ein Konsistenzcheck vergleicht seither beide Seiten und meldet AGREE/BENIGN/DIVERGENCE statt stiller Abweichung; ein Lauf gegen die gezielte Divergenz-Wortliste ergab 0 DIVERGENCE. BENIGN-Fälle (App gültig, aber Wurzel nicht lexikalisch scorebar — oder App ungültig und vom Skript korrekt ebenfalls nicht gefunden) sind eine verstandene, akzeptierte Differenz aus dem grundsätzlichen Unterschied zwischen der binären Gültigkeitsprüfung der App und dem lexikalischen Scoring-Ansatz des Skripts, kein Fehler. Vorbehalt: Der bislang gefahrene Konsistenzlauf deckt die gezielte Wortliste plus eine Stichprobe der häufigsten Korpus-Typen ab, nicht die vollständige Typenliste (~7.994 Types) — ein Lauf über die komplette Liste steht für abschließende Sicherheit noch aus.Bestimmte Glyphen zeigen eine starke Bindung an die Zeilenposition statt an lexikalischen Gehalt: 70,5 % aller `-m`-Token stehen zeilenfinal, 71,0 % aller `p-`-Token zeileninitial. `y-` als Erstglyph ist eine reine Positions-1-Stufe (Pos. 1 = 0,141 → Pos. 2 = 0,030 → Mitte = 0,038). Der lexikonbezogene Randartefakt-Check bestätigt das Muster auf Wortebene: bei mehreren Präfixformen ist der bloße Stamm randneutral, während dieselbe Form mit vorangestelltem Präfix randextrem und fast ausschließlich zeileninitial ist — `chor` 8 % Rand vs. `ychor` 100 %, `qotchor` 86 %, `pchor` 67 %, `tchor` 61 %, `ochor` 67 %; `shol` 10 % vs. `dshol` 80 %, `pshol` 86 %, `tshol` 83 %; `shor` 20 % vs. `dshor` 67 %; `cheol` 9 % vs. `ycheol` 93 %, `pcheol` 67 %; `chol`/`or` 14 % vs. `ychol` 92 %. Spiegelbildlich beim Final-`m`-Allograph: `ram`/`sam`/`oram` 100 % final, `dam` 66 % final (59 von 89 Belegen) — bei `dam` als hochfrequentem Content-Lemma ohne Streichungsurteil. Zusätzlicher quantitativer Nachweis aus dem R41-Regel-Audit (v9.9.2): Der Zeileninitial-Anteil je Initialglyph trennt Randallographen und echte Präfixe sauber — p 71,0 % (Faktor 4,8), t 41,7 % (2,8), y 38,7 % (2,6), f 31,0 % (2,1) gegen o 15,1 % (1,0) und l 6,7 % (0,5) bei einer Baseline von 14,8 % (H-Layer, 37.097 Tokens, 5.489 Zeilen). Über alle p-/f-initialen R41-Verletzungstypen mit Korpusbeleg stehen 116 von 135 Vorkommen zeileninitial (85,9 %; Label-/Marginalien-Loci ausgeschlossen), und 58 von 104 p-initialen Typen haben ein korpusbelegtes p-loses Gegenstück, meist um Größenordnungen häufiger (pokeey/okeey 168x, pokain/okain 139x, pokar/okar 127x, potol/otol 87x). Die OP-A-Normalisierung ist damit nicht nur lexikonrelevant, sondern zwingende Vorstufe jeder Präfixsegmentierung.
Working hypothesis:
Randallographen (Currier-Galgen initial, Final-`m`, `y-`-Prothese) bilden eine orthographische Schicht über der Linguistik, kein eigenständiges lexikalisches Signal. Als Normalisierungsschritt vor der morphologischen Lesung modellieren; kein Token aus Randposition erhält allein deswegen einen Lexikoneintrag. Entscheidendes Abschlusskriterium ist die Positions-Konfinierung (Anteil der Vorkommen einer Form, die zeileninitial stehen): `ychor` 16/16, `qotchor` 12/14 — nahezu ausschließlich zeileninitial. Ein echtes, frei kombinierendes Proklitikon müsste regelmäßig auch zeilenmedial auftreten; die Konfinierung ist die Signatur eines Randallographen. Remediationspolitik: eine randextreme Präfixform mit randneutralem Stamm wird nicht gestrichen, sondern mit ihrem Stamm zusammengeführt/umgewidmet (merge/umwidmen). Eine Streichung kommt nur infrage, wenn kein Stammbezug besteht und die Belegzahl gering bleibt; hochfrequente Content-Lemmata (z. B. `dam` n=89) erhalten nie ein Streichungsurteil. Das Label-/Marginalienregister (`L.`/`M.`-Loci) sowie Einzeltoken-Zeilen sind aus dem Check ausgeschlossen, da sie trivial randständig sind und für sich kein Allographen-Signal tragen. Live-Nachweis: siehe Randartefakt-Check-Sektion — aktuell 18 Merge/Umwidmen-Kandidaten auf Basis der aktuellen Lexikon-/Korpusdaten. Die betroffenen Lexikoneinträge sind im Lexikon selbst als OP-A-Kandidat markiert (nicht-destruktiv — bestehende Übersetzungen bleiben erhalten, bis OP-A entschieden ist).Content×Content-1-Edit-Nachbarn liegen mit 1,86 % 3,20× über der Content-Baseline (0,58 %; 597 betroffene Paare, nach Ausschluss der Top-20-Formeltoken), z. B. `kshy/kchy`, `okay/oky`, `choty/chotey`, `chody/schody`, `chor/cthor`, `dol/dolo`. Falsifikationstest (M1): Lexikon-Klassifikation der 597 Paare (a_DISTINCT 17,8 %, a_DERIVED 8,2 %, b_VARIANT 1,3 %, b_UNLEX 72,7 %) plus Satelliten-Test auf Positionsbindung.
Working hypothesis:
Satelliten-Test widerlegt die Selbstzitat-Hypothese: seltene Beinahe-Zwillinge sind nicht an ihren Hub gebunden (Adjazenz-Bindung seltener Tokens 1,1 % vs. häufiger 5,9 %; nur 3 % der seltenen Mehrfach-Tokens ≥ 50 %-gebunden gegen 1 % Shuffle-Baseline, 0 % vollständig gebunden — keine Satellitenpopulation). Die Nachbar-Ähnlichkeit ist morphologische Adjazenz (Proklitika-Ketten wie `shol`→`dshol`, `chor`→`ychor`, `chy`→`kchy`, sowie Wurzelecho), kein generatives Selbstzitat-Artefakt. Einschränkung nach Abgleich mit OP-A: Für die initial-konfinierten Proklitikon-Formen (`ychor`, `dshol`, `qotchor`, `tchor`, `dshor` u. a.) gilt dies NICHT — die Positions-Konfinierung (siehe OP-A) weist sie als Randallograph-Kandidaten für merge/umwidmen aus, nicht als lexikalisch frei kombinierende Morpheme, und damit als OP-A-Fall statt als Substratbeleg. Für nicht-konfinierte Wurzelecho-/Adjazenzpaare bleibt die Aussage bestehen: sprachtypisch, stützt das Substrat eher als es zu widerlegen. Realer Rest (nur 26 % der Paare lösen sich in zwei distinkte Lesarten auf, darunter Ein-Galgen-Tausch-Paare wie `kshy`/`kchy`, `chor`/`cthor`) verschiebt sich zu OP5 (Exklusivität) als Kontrollmetrik.Sheol distribution statistics (formalized in v7.5)
| Structural position | sheol/shol occurrences | Other lexemes |
|---|---|---|
| Line end / colophon-final | >85 % of all attestations | or, dom, kaiim |
| Line middle (medial) | <15 % — always in compound | — |
| Line beginning | 0 % | — |
This distribution is not that of a randomly placed term. It follows precisely R6 (line-end sheol = death prognosis) and R17 (shol apocop. medial / sheol full form final).