Rückwärtstest-Statistik

43 hebräische/aramäische Wörter wurden nach dem Mapping in EVA kodiert und im Korpus gesucht. Typ I sind echte Vorhersagen (vor jeder Folioanalyse eingefroren), Typ II post-hoc-Entdeckungen, die interne Konsistenz belegen. Kein einziger Treffer steht in einem semantisch inkohärenten Kontext.

10 / 10

Typ I — Echte Vorhersagen
100 % · 0 Falsch-Positive

30 / 33

Typ II — Interne Kohärenz
91 % · 0 Falsch-Positive
Typ I — Genuine Vorhersagen (Prä-Analyse-Anker, eingefroren)
10 / 10
Typ II — Interne Kohärenz (post-hoc-Entdeckungen)
30 / 33
R1 qo-Nulltest f1r (0 qo- in 260 Token)
260 / 260
Fehlschläge (Typ II)
3
Falsch-positiv (gesamt)
0

Typ I — Echte Vorhersagen 10 / 10 · 100%

Diese 10 Wörter wurden als semantische Priors vor jeder Folioanalyse definiert (eingefroren v7.4: dam, or, daiin, sheol, shol, dal, sar, chaiin, kaiim, chalal). Sie können nicht rückwirkend erweitert werden. Ihre Bestätigung ist die valide Kernaussage der Rückwärtsteststärke.

VorhersageHebräischBefundKontext
damBדָּם✓ 2× Zeilenende in f57r (suffix)qokedam, cheeodam, okoldm, yodam
sarBשַׂר✓ 1× Beleg in f57r✓ 2× Beleg in f103rimmer Zeilenmitte; nach daiin oder shedy
sheolBשְׁאוֹל✓ 4× Beleg in f103r✓ 1× Kolophon in f103rP.23,35,40(×2),42,45
daiinBדִּין✓ 3× Zeilenanfang in f103r✓ 2× Beleg in f57rf57r P.5: qokcho·daiin·cheeodam
chalalAחָלָל✓ 1× exakt nach sheol P.42Snapshot v7.4tshey·sheol·cheolshy·chalal
dalBדַּל✓ 3× Beleg in f103rpchedal, yshdal, dal (standalone)
shol · dy · … · sholAR24-Struktur✓ f13r P.1 (Dopplungsformel)Snapshot v7.4einmaliges Emphase-Muster mit Genitiv-Brücke dy
orBאוֹר✓ 2× Beleg in f103rAnker: or = Licht/Heilung; f103r P.17 endet or·aiin; vgl. lor ★★★★★; R6 bestätigt (v7.4-Anker)
chaiinAחַיִּין✓ 1× Beleg in f2r✓ 4× Beleg in f4r✓ 2× Beleg in f8vAnker: chaiin = Leben; R18 Diagnosepaar shol·chaiin (abwägende Prognose); R43 erfüllt (f2r + f4r ≥2 Folios); ★★★★
kaiimAקַיָּם✓ 1× Kolophon in f6rAnker: kaiim = gültig/beständig; R11-Schlussformel ★★★★★; f57r cphedom= (Parallelform)

Typ II — Interne Kohärenz 30 / 33 · 91%

Diese 33 Wörter wurden während der Folioanalyse erstmals identifiziert. Sie belegen interne Systemkonsistenz, aber keine externe Vorhersagekraft. 29 bestätigt, 3 historische Fehlschläge (nicht im Datensatz).

VorhersageHebräischBefundKontext
chedyBכְּדֵי✓ 12× ≥10× Beleg in f103rnie mit -ody kombiniert (R5)
shedyBשֶׁ+דִּי✓ 18× ≥18× Beleg in f103rimmer von Konnektoren gefolgt
ckhyBכְּהִי✓ 2× Beleg in f57r4 unabhängige Belege
taiirBתָּאִיר✓ 1× Zeilenanfang in f57r (prefix)taiir·sheedy·lchedy·ckheedy
sheoldamAשְׁאוֹל+דָּם✓ 1× Paragr. P.9 in f3rbotanische Kohärenz; beide ★★★★★-Anker fusioniert; f3r P.9 auf Blutpflanze
daiidy / daiindyABדִּין+דִּי✓ 1× Beleg in f57r✓ 1× Beleg in f3vdrei Folios, identische Funktion
tsheoaromAתְּ+שְׁאוֹ+רוֹם✓ 1× Paragr. P.15 in f3rnach 7 Blut-Paragraphen: kohärenter Positionswechsel
dsholdyAדְּ+שׁוֹל+דִּי✓ 1× Beleg in f9rGenitiv-Kompositum parallel zu daiindy
shoiinAשׁוֹ+עַיִן✓ 1× Paragr. P.4 in f10v✓ 1× Paragr. P.6 in f10vDoppelbeleg auf demselben Folio
torshorAתֹּר+שׁוֹר✓ 1× Zeilenanfang in f13rJahreszeit-Zeichen; erster Beleg dieser Form im Korpus
pchyAפְּחִי✓ 5× ≥3× Beleg in f13r (suffix)opchy, qopchy, pchy; bestätigt Alant-Identifikation
ykaiin (y+k+aiin)Aיְ+כְּ+עַיִן✓ 1× Paragr. P.8 in f14rykchaiin→ycheor→ykchor→ykchy→ykaiin: 5 positive Ankerpunkte (ykshol = 6. Glied negativ, f15r P.12)
chckhy= (Diagnosekolophon)Aכְּ+כְּ+הִי✓ 1× Kolophon in f14r✓ 1× Kolophon in f14v (suffix)Konzentration in Bifolio bB3; auch medial belegt (f14v P.6)
ykshol (y+k+shol)Aיְ+כְּ+שׁוֹל✓ 1× Paragr. P.12 in f15rykchaiin→ycheor→ykchor→ykchy→ykaiin→ykshol: komplettes Paradigma, positiv + negativ belegt
qotchor (Pupillenzeichen)Aקוֹ+תְּ+כֹּר✓ 1× Paragr. P.14 in f15rqotchor·chaiin·chy·kol·daky= — positives Pupillen-Urteil; ophthalmologische Abschlussformel bB2
soloiinAשׁוֹ+לְ+עַיִן✓ 1× Paragr. P.11 in f15v„Arznei für das Auge“ — höchste Heilarznei-Präzision im Gesamtkorpus; Gegenstück zu shoiin (f10v)
cthor (vollständige Heilung)Aכְּ+תֹּר✓ 2× Beleg in f15vdaiin·cthor·chol·chor= — cthor+chor = Heilung der Pupillenpathologie; positiver Abschluss Bifolio bB2
chaiin · ckhy · or · aiin (Prognose-Tetrade)APrognose-Tetrade✓ 1× Paragr. P.4 in f10r✓ 1× Paragr. P.4 in f10r✓ 1× Paragr. P.4 in f10r✓ 1× Paragr. P.4 in f10rvollständiges hippokratisches Schema; kombinierter Test post-v7.4 → Typ II (v8.8), Einzelanker or/chaiin bleiben Typ I
dam (Quire B)Aדָּם✓ 1× Paragr. P.8 in f14vdol · dair · dam — Erstbeleg Blutpathologie in bB3; verbindet f14v mit f3r; post-v7.4 → Typ II (v8.8)
shol medial · sheol final (R17 Zodiak)Bשׁוֹל / שְׁאוֹל✗ 1× in f72r1 — unter Schwelle 2✓ 2× Beleg in f72r1 (prefix)identische Verteilung wie botanische Folios; Zodiak-Register post-v7.4 → Typ II (v8.8)
f69r Stresstest — kosmologisches Rad-Diagramm, Currier-Sprache unklassifiziert (Quire J/X)BMapping v8.0✓ 1× Kolophon in f69r✓ 3× Beleg in f69rFoliotyp: kosmologisches Rad-Diagramm — keine Botanik, kein {plant}-System, keine Currier-Sprachzuordnung; Mapping ohne Anpassung; f69r post-v7.4 → Typ II (v8.8)
otam · otam · chotam (R19/R35)Bאוֹת+אָם · אוֹת+אָם · כֹּ+אוֹת+אָם✗ 0× Dopplung in f72r1 — nicht belegt✓ 1× Beleg in f72r1einfach → ×2 → Komparativ ko+X; exaktes R35-Schema; semantisch kohärent: Zeichen der Mutter im Stier-dunkel-Kontext
okaly= / okal= Minimalpaar (R52a)Bעַ+כָּל+יְ / עַ+כָּל✓ 3× Beleg in f72r2✓ 3× Beleg in f72r2identischer Stamm okal mit und ohne -y-Suffix auf demselben Ring; beweist R52a: -y ist Status-Emphaticus-Marker, kein festes Wortbildungselement
alef / otalef — Stier-ExklusivmarkerBאָלֶף / אוֹת+אָלֶף✓ 1× Beleg in f72r1 (suffix)✓ 1× Beleg in f72r1alef = Ochsenkopf-Piktogramm (Aleph-Ursprung); fehlt in f71r, f71v, f72r2; erste ikonographisch verankerte Buchstabenreferenz im Zodiak-Corpus
dar·dar-Dopplung (R36) in kosmologischem RegisterABדַּר·דַּר✓ 1× Dopplung in f18r✓ 1× Paragr. R.17 in f69r✓ 1× Paragr. R.22 in f69rR43 erfüllt: f18r + f69r = 2 Folios, 3 Gesamtbelege → R36 ★★★ validiert; Typ A (direkt adjacent) erstmals in kosmologischem Register belegt
oldam (f34r P.7) → sofortiger Folgebeleg auf f34v P.2עַל+דָּם✓ 1× Paragr. P.7 in f34r✓ 1× Paragr. P.2 in f34vol+dam Erstbeleg f34r P.7 → unmittelbarer Folgebeleg auf dem Verso desselben Bifolios; R43-Frist binnen einer Sitzung erfüllt; post-v7.4 → Typ II (v8.8)
Tanacetum f31r: dam im Schlusskolophon — Tanacetum = Blutfluss-Kraut (Macer floridus)Aדָּם✓ 1× Kolophon in f31r (suffix)Tanacetum parthenium ist im mittelalterlichen Kräuterbuch (Macer floridus) als Mittel gegen Menstruationsblutungen gelistet; botanische und textuelle Ebene konvergieren
Gentiana f32v endet ol.sho.chy= — Gentiana als bitteres Diagnostikum (Scheol-Blässe-Formel)Aעַל+שׁוֹ+כְּהִי✓ 1× Kolophon in f32v✓ 1× Paragr. P.11 in f32vEnzian (Gentiana) gilt in der mittelalterlichen Pharmakologie als schweres Diagnostikum für lebensbedrohliche Zustände; Schlusskolophon spiegelt negative Prognose
Seseli libanotis f34v P.4: oldar.qoldar = intensivierte Wurzelformeln (dreistufiges Präfix)עַל+דְּ+אַר / וְ+עַל+דְּ+אַר✓ 1× Paragr. P.4 in f34v✓ 1× Paragr. P.4 in f34vf34v (Seseli libanotis, Umbellifere): fibrös-knollige Wurzel ohne zoomorphe Ausformung; oldar/qoldar in P.4 belegt maximale Wurzel-Textintensivierung (qoldar = dreistufig) unabhängig von Zoomorphie; Bryonia-Deutung widerlegt (f34r-Audit)
chotchyAכְּאוֹתכְּהִי✓ 1× Paragr. P.7 in f7r✓ 1× Beleg in f21v✓ 1× Beleg in f25rScheol-Block-Abschluss; Blässe-Termin bei Kältepflanze semantisch kohärent
tcheeyAתְּחֵיי✓ 1× Kolophon in f7vt-Präfix + cheey-Stamm
lokaiinABלְ+עֹק+עַיִן✓ 1× Beleg in f8v✗ 0× Beleg in f103r — nicht belegtDirektional "zum Auge"; f103r zwischen checkhy und shedy — therapeutischer Direktional-Kontext
oramעַרָם✓ 1× Kolophon in f33v✓ 1× Paragraphenende in f33vKolophon-terminal; finales Token vor =-Marker; C/H/U 3/4

CUT-Test — Exklusivitätsmessung

Candidate Uniqueness Test: Misst, ob das Regelwerk pro EVA-Token eine dominante Lesart erzwingt oder mehrere gleichwertige zulässt. Phase 1 bewertet Kandidaten gegen das Lexikon (großer TopGap = eindeutig), Phase 2 erzeugt Lesarten generativ aus den formalisierten Regeln.

Kritisch ≤ 15 · Warnzone 15–20 · Zielkorridor > 20 (N ≥ 300)

Morphem-Segmentierung — statistischer Gegencheck

Lernt rein aus der Vorkommenshäufigkeit im Korpus, an welchen Stellen Wörter am ehesten in Bausteine zerfallen: Zeichen werden iterativ zu den jeweils häufigsten benachbarten Paaren verschmolzen (Byte-Pair-Encoding), anschließend wird an jeder möglichen Wortgrenze gemessen, wie viele unterschiedliche Fortsetzungen im Korpus auftreten (Verzweigungsgrad). Ein hoher Verzweigungsgrad markiert eine wahrscheinliche Morphemgrenze. Die so — ganz ohne Hebräisch-Hypothese — gefundenen Kandidaten werden anschließend gegen die von Hand erschlossene Präfix-/Suffix-Tabelle abgeglichen: Bestätigt reine Statistik unabhängig dieselben Grenzen?

Heuristische Näherung über eine Verzweigungsgrad-Schwelle, kein vollständiges informationstheoretisches Kostenmodell.

Randartefakt-Prüfung — Positions-Konfinierung (OP-A)

Misst pro Lexikoneintrag, wie stark seine Vorkommen an den Zeilenrand (initial/final) gebunden sind. Extreme Randbindung bei randneutralem Stamm deutet auf einen Randallographen statt auf ein eigenständiges Lexem — solche Formen werden mit ihrem Stamm zusammengeführt, nicht gestrichen.

Basis: Mehrheits-Konsens-Tokens über alle Transkriptoren.

INITIAL-lastig

FormninitialfinalKonfinierungUrteilBegründung
sshey55 (100%)0 (0%)100%Merge/UmwidmenPräfix 's-' auf randneutralem Stamm 'shey' (Stamm-Rand=17%) — Randallograph-Verdacht, keine Streichung
ycheol1212 (100%)0 (0%)100%Merge/UmwidmenPräfix 'y-' auf randneutralem Stamm 'cheol' (Stamm-Rand=13%) — Randallograph-Verdacht, keine Streichung
ychor1616 (100%)0 (0%)100%Merge/UmwidmenPräfix 'y-' auf randneutralem Stamm 'chor' (Stamm-Rand=17%) — Randallograph-Verdacht, keine Streichung
ycheey2220 (91%)0 (0%)91%Merge/UmwidmenPräfix 'y-' auf randneutralem Stamm 'cheey' (Stamm-Rand=12%) — Randallograph-Verdacht, keine Streichung
ychol1110 (91%)0 (0%)91%Merge/UmwidmenPräfix 'y-' auf randneutralem Stamm 'chol' (Stamm-Rand=12%) — Randallograph-Verdacht, keine Streichung
dshedy3329 (88%)0 (0%)88%Merge/UmwidmenPräfix 'd-' auf randneutralem Stamm 'shedy' (Stamm-Rand=13%) — Randallograph-Verdacht, keine Streichung
paiin87 (88%)0 (0%)88%Merge/UmwidmenPräfix 'p-' auf randneutralem Stamm 'aiin' (Stamm-Rand=12%) — Randallograph-Verdacht, keine Streichung
qotchor1311 (85%)0 (0%)85%Merge/UmwidmenPräfix 'qot-' auf randneutralem Stamm 'chor' (Stamm-Rand=17%) — Randallograph-Verdacht, keine Streichung
tshol65 (83%)0 (0%)83%Merge/UmwidmenPräfix 't-' auf randneutralem Stamm 'shol' (Stamm-Rand=22%) — Randallograph-Verdacht, keine Streichung
dshol54 (80%)0 (0%)80%Merge/UmwidmenPräfix 'd-' auf randneutralem Stamm 'shol' (Stamm-Rand=22%) — Randallograph-Verdacht, keine Streichung
dshor1411 (79%)0 (0%)79%Merge/UmwidmenPräfix 'dsh-' auf randneutralem Stamm 'or' (Stamm-Rand=20%) — Randallograph-Verdacht, keine Streichung
sor4634 (74%)1 (2%)74%Merge/UmwidmenPräfix 's-' auf randneutralem Stamm 'or' (Stamm-Rand=20%) — Randallograph-Verdacht, keine Streichung
pol139 (69%)1 (8%)69%Kandidat
ochor64 (67%)0 (0%)67%Merge/UmwidmenPräfix 'o-' auf randneutralem Stamm 'chor' (Stamm-Rand=17%) — Randallograph-Verdacht, keine Streichung
shoiin64 (67%)0 (0%)67%Merge/UmwidmenPräfix 'sh-' auf randneutralem Stamm 'oiin' (Stamm-Rand=3%) — Randallograph-Verdacht, keine Streichung
ytchor117 (64%)0 (0%)64%Merge/UmwidmenPräfix 'yt-' auf randneutralem Stamm 'chor' (Stamm-Rand=17%) — Randallograph-Verdacht, keine Streichung
sol6439 (61%)5 (8%)61%Review (geschützt)hochfrequentes Content-Lemma (n=64) — kein Streichungsurteil

FINAL-lastig

FormninitialfinalKonfinierungUrteilBegründung
dom80 (0%)8 (100%)0%Kandidat
ram130 (0%)13 (100%)0%Kandidat
oram80 (0%)8 (100%)0%Kandidat
oldam50 (0%)5 (100%)0%Kandidat
ry151 (7%)14 (93%)7%Kandidat
sam131 (8%)12 (92%)8%Kandidat
sy302 (7%)26 (87%)7%Kandidat
koldy60 (0%)5 (83%)0%Kandidat
chary60 (0%)5 (83%)0%Kandidat
dan150 (0%)12 (80%)0%Kandidat
dary170 (0%)13 (76%)0%Kandidat
okam230 (0%)17 (74%)0%Kandidat
dam951 (1%)68 (72%)1%Review (geschützt)hochfrequentes Content-Lemma (n=95) — kein Streichungsurteil
chory120 (0%)8 (67%)0%Kandidat
otam450 (0%)29 (64%)0%Kandidat
cham220 (0%)14 (64%)0%Kandidat
ory160 (0%)10 (63%)0%Kandidat
daly290 (0%)18 (62%)0%Kandidat

Gibberish-Test

Falsifikationswerkzeug: Zufällig erzeugte Pseudowörter mit Voynich-ähnlicher Zeichenstatistik werden durch die Grammatikregeln geprüft. Bestünden zu viele davon die Prüfung, wäre das Regelwerk beliebig. Zielkorridor: ≤ 10 % strukturelle Falsch-Positive · aktueller Testwert: 8,6 % (Seed 42, reproduzierbar).

Zur Entropie-Messung siehe OP3 unter Offene Probleme.

Abbruch > 15 % · Warnzone 11–15 % · Ziel ≤ 10 % Befund v6.2: ∅ 31 % → Auslöser R40 v2

Offene Probleme und ungelöste Widersprüche

Ehrliche Dokumentation der statistischen Anomalien und methodischen Grenzen, die das System nicht erklärt. Eingeführt in v7.5.

Methodischer Vorbehalt

Das Entzifferungssystem ist eine starke Lesehypothese, keine bewiesene Entzifferung. Die folgenden Probleme widersprechen der Hypothese nicht zwingend, müssen aber sichtbar bleiben. Interne Kohärenz beweist keine externe Gültigkeit.

Die Wortlängenverteilung im Voynich-Corpus ist zu schmal für freie semitische Morphologie. Semitische Sprachen erlauben agglutinative Konstrukte mit variablen Wortlängen; das Voynich-Profil zeigt eine auffällig rigide Konzentration auf 4–8 EVA-Zeichen.

Arbeitshypothese: Mögliche Erklärungen: (a) systematisches Abbreviatursystem, das Konsonanten weglässt; (b) grammatikalisiertes Register-System mit stark reduzierten Formen; (c) feste Slot-Grammatik als bewusste Kodierungsstrategie.

Bestimmte EVA-Zeichen kommen statistisch nur in bestimmten Wortpositionen vor (Slot-Grammatik nach Tiltman/Stolfi). Diese Eigenschaft passt zu keiner bekannten natürlichen Sprache direkt. Im Entzifferungssystem wird sie durch Präfix-/Suffix-Hierarchien erklärt (R41), aber nicht formal modelliert.

Arbeitshypothese: Das System kodiert möglicherweise feste grammatische Funktionen pro Slot (Präfix / Wurzel / Suffix-Register) mit phonotaktischen Constraints, die im Mischna-Hebräisch keine direkte Parallele haben. Hinweis (v9.5.6): OP3 (Entropie-Abweichung) ist teilweise offen. Die H1-Messung (Graphem-Entropie gegen manuskript-kalibrierten Generator) wird durch das Slot-System (R41) vollständig erklärt (ΔH_Grammatik = −0,007 bit). Die H2-Messung (Konditionalentropie gegen externe Sprachreferenz) zeigt mit 2,080 bit eine Abweichung, die durch Vokalmarkierung allein nicht erklärbar ist. Die positionelle Vorhersagbarkeit des Slot-Systems (R41) bleibt die plausibelste Erklärung. Die formale Modellierung des Slot-Systems bleibt offen (OP2), aber der Mechanismus ist bestätigt.

Die in v9.4.4 dokumentierte Schließung betrifft die Unigramm-Entropie (H1) gegen einen manuskript-kalibrierten Generator und ist für diese Kenngröße methodisch zirkulär. Eine unabhängige Messung der Konditionalentropie zweiter Ordnung (H2) gegen eine externe Sprachreferenz (Hebräisch, Westminster Leningrad Codex, konsonantisch und vokalisiert) zeigt: Niqqud-Vokalisierung senkt H2 im Referenzkorpus um 0,515 bit (3,787 auf 3,272 bit); Voynichese liegt mit 2,080 bit auch unterhalb des vokalisierten Referenzwerts (Abstand 1,192 bit). Vokalmarkierung erklärt die niedrige H2-Entropie des Voynich-Textes damit nicht hinreichend. Arbeitshypothese: Die positionelle Vorhersagbarkeit des Slot-Systems (R41) ist der wahrscheinlichere Erklärungsmechanismus, bislang aber nicht durch eine direkte H2-Messung am Markov-Generator gegen den hier ermittelten Referenzwert (2,080 bit) bestätigt. Folgeaufgabe: H2-Messung des R1–R59-Generators gegen Manuskript und Hebräisch-Referenz.

Arbeitshypothese: Kontrolliertes Experiment mit stochastischem Markov-Generator (EVA-Bigramm-Gewichtung) auf Basis der Grammatikregeln R1–R59: H synthetisch mit GPA-1-Filter = 3,96 bit; H synthetisch ohne GPA-1 (Rohwert) = 3,97 bit; H Manuskript (Referenz, Landini 2001) = 3,60 bit. ΔH gesamt = +0,364 bit; ΔH GPA-1-Bias = +0,371 bit; ΔH Grammatik (gesamt − Bias) = −0,007 bit. Die gesamte Entropie-Abweichung zwischen Generator und Manuskript (+0,37 bit) ist ein GPA-1-Artefakt: Der Hapax-Filter eliminiert hochfrequente Anker-Tokens (daiin, chor, shol u. a.), die die Manuskript-Häufigkeitsverteilung schief halten. Nach Abzug dieses Bias gilt ΔH_Grammatik = −0,007 bit — innerhalb des Toleranzbands von ±0,2 bit und statistisch Null. Schlussfolgerung: Die Grammatikregeln R1–R59 mit ihrem restriktiven Morphem-Slot-System (R41) sind hinreichend, um die statistische Kompression des Manuskripts vollständig zu reproduzieren. Weder ein Abbreviatursystem noch zusätzliche Vokal-Restriktionsgesetze sind als Zusatzerklärung erforderlich. Die niedrige Manuskript-Entropie ist ein direktes Resultat der Slot-Grammatik, keine kodikologische Überformung.

Das System wurde noch nicht durch einen unabhängigen Hebraisten blind getestet — d.h. ein Fachmann, der das Entzifferungssystem nicht kennt, hat noch nicht versucht, Voynich-Text damit zu lesen. Dies ist die stärkste Form der externen Validierung und fehlt vollständig.

Arbeitshypothese: Bis zur Blindvalidierung gilt: Das Entzifferungssystem ist eine starke Lesehypothese mit konsistenter Semantik, aber keine bewiesene Entzifferung. Interne Kohärenz beweist keine externe Gültigkeit.
Aufruf zur Blindvalidierung

Für Hebraisten und Aramaisten, die eine unabhängige Prüfung durchführen möchten: Das vollständige Zeichenmapping und die 10 eingefrorenen Typ-I-Anker stehen bereit.

Das Entzifferungssystem-Dokument ist als Markdown-Export zugänglich.

Das Entzifferungssystem beschreibt 59 Grammatikregeln und 396 Lexikoneinträge, misst aber nicht, ob das Regelwerk für ein gegebenes EVA-Token genau eine dominante Lesart erzwingt oder mehrere gleichwertige Ableitungen zulässt. Solange diese Messung fehlt, bleibt die wissenschaftliche Kernfrage offen: Hat das Modell genug Zwang, um als Entzifferungsmodell zu gelten — oder ist es ein interpretativer Rahmen mit hoher Freiheit?

Arbeitshypothese: Implementierung eines Candidate Uniqueness Test (CUT) als eigenständiges Analysewerkzeug auf Basis der Stolfi-Infrastruktur, dreiteilig: Phase 1 (Lexikon-CUT) leitet Kandidaten durch Präfix-/Suffix-Stripping aus dem vorhandenen Lexikon ab und bewertet sie nach Regelerfüllung, Konfidenzsternen und Morphologieprofil; Phase 2 (Generativer CUT) erzeugt Lesarten für beliebige EVA-Tokens — auch nicht lexikalisierte — durch graphemgenaue Anwendung der maschinenlesbar codierten Token-Regeln (R1 [qo-Vav-Lesart], R2, R3/R4 [Imperfekt-Präfixe y-/t-], R40, R41, R45, R65, D1/D2); Phase 2b (Sequenzbasierter CUT) prüft zusätzlich R19 (Intensivierungsrhetorik) auf echten, geordneten Absatzsequenzen, da diese Regel inhärent von der Nachbarschaft zweier Tokens abhängt und sich nicht pro Einzeltoken prüfen lässt. Zusammen decken Phase 2 und Phase 2b 10/59 der Grammatikregeln maschinenlesbar ab. Kennzahlen: Top-1-Quote (Anteil Tokens mit klar dominanter Lesart), mittlerer Top1/Top2-Abstand (TopGap), Ambiguitätsindex (mittlere Kandidatenzahl) und Hotspot-Regeln (Regeln, die systematisch Mehrdeutigkeit erzeugen). OP5 gilt als geschlossen, wenn Phase-2-Ergebnisse für ≥ 300 Tokens mit TopGap-Median > 20 Punkten vorliegen — bei vollständiger R1–R30-Abdeckung. Zusätzliche Kontrollmetrik (aus OP-B): Die Distinktquote der 1-Edit-Content-Nachbarn liegt aktuell bei 26 % — der CUT muss rechtfertigen, warum Ein-Galgen-Tausch-Paare (z. B. `kshy`/`kchy`, `chor`/`cthor`) als distinkte Lesarten statt als Übergenerierung auf minimalen Graphvarianten gelten. Aktueller Stand: Phase 1 liefert TopGap-Median 7 (Seed 42, N=300); Phase 2/2b decken zusammen 10/59 der Regeln ab — alle übrigen Regeln (u. a. R42, R44, R46–R49) sind nicht maschinenlesbar codiert und schränken generierte Kandidaten nicht ein. Ein rechnerisch hoher Anteil eindeutiger generativer Lesarten schließt OP5 damit nicht ab, solange die Regelabdeckung unvollständig ist.

25/25 Folios zeigen FOLIUM-Textfreiheit (R60 Korollar 3, v8.7: ★★★★★). Die 25-Folio-Schwelle wurde mit f32r, f32v, f33v, f34r, f34v überschritten. Offene Grundsatzfrage bleibt: bewusste pharmakologische Kodierung oder rein layoutbedingtes Phänomen?

Arbeitshypothese: Theoretische Reflexion: Wenn FOLIUM-Textfreiheit ein Artefakt wäre, müssten Blätter in Apex-Position (oben) Text haben. Aber f2v und f5r (riesige Rundblätter dominant) haben trotz Blatt-Dominanz KEINEN Text. Bei 25 Folios und 0 Gegenbeispielen spricht die Evidenz für semantische Intention. R60 Korollar 3 auf ★★★★★ aufgestuft.

Quire E eröffnet mit f33r (Mandragora officinarum, humanoid) als zoomorpher Wurzel-Darstellung. f34v wurde zunächst als zoomorphe Bryonia gedeutet (Bryonia-Paar-Hypothese); der f34r-Audit zeigt jedoch eine fibrös-knollige Wurzel ohne zoomorphe Ausformung und eine Umbellifere (Seseli libanotis). Frage: Bleibt f33r ein isolierter Zoomorphie-Beleg in Quire E, oder setzt sich das Muster in f35r/f35v und weiteren Folios fort?

Arbeitshypothese: Quire E könnte auf Pflanzen mit magisch-pharmakologischer Doppelfunktion fokussieren, deren Wurzeln in menschliche oder tierische Formen wachsen — bestätigt bislang nur für f33r (Mandragora). Die Bryonia-Deutung für f34v ist widerlegt. R60 Korollar 2 (Ikonographische Toxizitäts-Warnung) könnte als Quire-E-spezifische Erweiterung formal werden. Prüfen: f35r/f35v auf zoomorphe Elemente.

Drei Stellen definierten unterschiedliche Präfix-Inventare: R41 nannte vier Slotklassen (d-; o-/qo-; l-/k- gemeinsam; op-/of-), die GRAMMAR_PREFIX-Tabelle zehn Einträge (davon einige mechanical:false), und die mechanische Segmentierung eine eigene Neun-Einträge-Liste. Folgen (App-Seite, seit v9.9.3 behoben): k- wurde nie als Präfix gelesen, obwohl R41-Slot und Tabelleneintrag vorhanden (1.145–1.352 wortinitiale k-Belege, transkriptorabhängig); op-/of- wurde nie als Einheit erkannt, sondern zu o- + p- zerlegt bzw. bei f- gar nicht; p-, y-, t- wurden als R41-Schalen mitgezählt, obwohl sie in R41 keinen Slot haben; qok-/qod- waren nur im Segmentierer definiert; zwei unabhängige Prüfpfade innerhalb der App (die automatisch erzeugte Regel-Beleglage vs. der /api/gibberish/analyze-Endpunkt) konnten für dasselbe Wort gegenteilige Urteile liefern (ytoldy, otochor, oqotar). Zusätzlich zeigte ein Korpus-Nachaudit: l- und k- sind strikt sequentielle, keine gemeinsame Slots (l- vor k- 127:2, qo- vor k- 310:0, k-/t- komplementär: 0 gestapelte Belege), und op-/of- ist der äußerste Wrapper, nicht die innerste Schale (Positionsbindung 11,4 % gegen blankes p- 70,9 % — op-/of- ist damit kein Randallograph).

Arbeitshypothese: Umgesetzt (v9.9.3): GRAMMAR_PREFIXES (grammar.data.js) ist die alleinige, handgepflegte App-Quelle mit Klassenzuordnung und R41-Hierarchieposition (r41Slot) — mechanische Stripliste, R41-Prüfung (checkR41) und Grammatik-Anzeigetabelle leiten sich vollständig daraus ab, keine Parallelliste mehr. k- und op-/of- sind jetzt mechanisch aktiv (k- guarded: nur bei etabliertem Rest oder folgendem Currier-Galgen, da k-/ch- vor Vokal oft Stamm-Allograph ist — lkeedy 39× vs. leedy 0× vs. lcheedy 9×); qok-/qod- sind als Einträge entfallen und lösen sich als qo-+k-/qo-+d- auf. Die drei ursprünglichen Teilfragen sind empirisch beantwortet: (1) p- bleibt eigenständige OP-A-Frage, klar von op-/of- getrennt; (2) k- ist eigenständig segmentierbar, aber lexikalisch guarded, nicht bedingungslos frei; (3) op-/of- ist korpusweit verteilt (343 Belege / 125 Folios, Schwerpunkt Rezeptteil f103–f116) statt auf Quire H beschränkt. Die unabhängige Skript-Reimplementierung außerhalb der App wurde ebenfalls auf das Fünf-Slot-Modell umgestellt und um gemischte R41-/Verbalpräfix-Ketten erweitert (otochor → o-t-ochor wird jetzt auf beiden Seiten gefunden) — die zuvor beobachtete Restdivergenz ist damit behoben. Ein Konsistenzcheck vergleicht seither beide Seiten und meldet AGREE/BENIGN/DIVERGENCE statt stiller Abweichung; ein Lauf gegen die gezielte Divergenz-Wortliste ergab 0 DIVERGENCE. BENIGN-Fälle (App gültig, aber Wurzel nicht lexikalisch scorebar — oder App ungültig und vom Skript korrekt ebenfalls nicht gefunden) sind eine verstandene, akzeptierte Differenz aus dem grundsätzlichen Unterschied zwischen der binären Gültigkeitsprüfung der App und dem lexikalischen Scoring-Ansatz des Skripts, kein Fehler. Vorbehalt: Der bislang gefahrene Konsistenzlauf deckt die gezielte Wortliste plus eine Stichprobe der häufigsten Korpus-Typen ab, nicht die vollständige Typenliste (~7.994 Types) — ein Lauf über die komplette Liste steht für abschließende Sicherheit noch aus.

Bestimmte Glyphen zeigen eine starke Bindung an die Zeilenposition statt an lexikalischen Gehalt: 70,5 % aller `-m`-Token stehen zeilenfinal, 71,0 % aller `p-`-Token zeileninitial. `y-` als Erstglyph ist eine reine Positions-1-Stufe (Pos. 1 = 0,141 → Pos. 2 = 0,030 → Mitte = 0,038). Der lexikonbezogene Randartefakt-Check bestätigt das Muster auf Wortebene: bei mehreren Präfixformen ist der bloße Stamm randneutral, während dieselbe Form mit vorangestelltem Präfix randextrem und fast ausschließlich zeileninitial ist — `chor` 8 % Rand vs. `ychor` 100 %, `qotchor` 86 %, `pchor` 67 %, `tchor` 61 %, `ochor` 67 %; `shol` 10 % vs. `dshol` 80 %, `pshol` 86 %, `tshol` 83 %; `shor` 20 % vs. `dshor` 67 %; `cheol` 9 % vs. `ycheol` 93 %, `pcheol` 67 %; `chol`/`or` 14 % vs. `ychol` 92 %. Spiegelbildlich beim Final-`m`-Allograph: `ram`/`sam`/`oram` 100 % final, `dam` 66 % final (59 von 89 Belegen) — bei `dam` als hochfrequentem Content-Lemma ohne Streichungsurteil. Zusätzlicher quantitativer Nachweis aus dem R41-Regel-Audit (v9.9.2): Der Zeileninitial-Anteil je Initialglyph trennt Randallographen und echte Präfixe sauber — p 71,0 % (Faktor 4,8), t 41,7 % (2,8), y 38,7 % (2,6), f 31,0 % (2,1) gegen o 15,1 % (1,0) und l 6,7 % (0,5) bei einer Baseline von 14,8 % (H-Layer, 37.097 Tokens, 5.489 Zeilen). Über alle p-/f-initialen R41-Verletzungstypen mit Korpusbeleg stehen 116 von 135 Vorkommen zeileninitial (85,9 %; Label-/Marginalien-Loci ausgeschlossen), und 58 von 104 p-initialen Typen haben ein korpusbelegtes p-loses Gegenstück, meist um Größenordnungen häufiger (pokeey/okeey 168x, pokain/okain 139x, pokar/okar 127x, potol/otol 87x). Die OP-A-Normalisierung ist damit nicht nur lexikonrelevant, sondern zwingende Vorstufe jeder Präfixsegmentierung.

Arbeitshypothese: Randallographen (Currier-Galgen initial, Final-`m`, `y-`-Prothese) bilden eine orthographische Schicht über der Linguistik, kein eigenständiges lexikalisches Signal. Als Normalisierungsschritt vor der morphologischen Lesung modellieren; kein Token aus Randposition erhält allein deswegen einen Lexikoneintrag. Entscheidendes Abschlusskriterium ist die Positions-Konfinierung (Anteil der Vorkommen einer Form, die zeileninitial stehen): `ychor` 16/16, `qotchor` 12/14 — nahezu ausschließlich zeileninitial. Ein echtes, frei kombinierendes Proklitikon müsste regelmäßig auch zeilenmedial auftreten; die Konfinierung ist die Signatur eines Randallographen. Remediationspolitik: eine randextreme Präfixform mit randneutralem Stamm wird nicht gestrichen, sondern mit ihrem Stamm zusammengeführt/umgewidmet (merge/umwidmen). Eine Streichung kommt nur infrage, wenn kein Stammbezug besteht und die Belegzahl gering bleibt; hochfrequente Content-Lemmata (z. B. `dam` n=89) erhalten nie ein Streichungsurteil. Das Label-/Marginalienregister (`L.`/`M.`-Loci) sowie Einzeltoken-Zeilen sind aus dem Check ausgeschlossen, da sie trivial randständig sind und für sich kein Allographen-Signal tragen. Live-Nachweis: siehe Randartefakt-Check-Sektion — aktuell 15 Merge/Umwidmen-Kandidaten auf Basis der aktuellen Lexikon-/Korpusdaten. Die betroffenen Lexikoneinträge sind im Lexikon selbst als OP-A-Kandidat markiert (nicht-destruktiv — bestehende Übersetzungen bleiben erhalten, bis OP-A entschieden ist).

Content×Content-1-Edit-Nachbarn liegen mit 1,86 % 3,20× über der Content-Baseline (0,58 %; 597 betroffene Paare, nach Ausschluss der Top-20-Formeltoken), z. B. `kshy/kchy`, `okay/oky`, `choty/chotey`, `chody/schody`, `chor/cthor`, `dol/dolo`. Falsifikationstest (M1): Lexikon-Klassifikation der 597 Paare (a_DISTINCT 17,8 %, a_DERIVED 8,2 %, b_VARIANT 1,3 %, b_UNLEX 72,7 %) plus Satelliten-Test auf Positionsbindung.

Arbeitshypothese: Satelliten-Test widerlegt die Selbstzitat-Hypothese: seltene Beinahe-Zwillinge sind nicht an ihren Hub gebunden (Adjazenz-Bindung seltener Tokens 1,1 % vs. häufiger 5,9 %; nur 3 % der seltenen Mehrfach-Tokens ≥ 50 %-gebunden gegen 1 % Shuffle-Baseline, 0 % vollständig gebunden — keine Satellitenpopulation). Die Nachbar-Ähnlichkeit ist morphologische Adjazenz (Proklitika-Ketten wie `shol`→`dshol`, `chor`→`ychor`, `chy`→`kchy`, sowie Wurzelecho), kein generatives Selbstzitat-Artefakt. Einschränkung nach Abgleich mit OP-A: Für die initial-konfinierten Proklitikon-Formen (`ychor`, `dshol`, `qotchor`, `tchor`, `dshor` u. a.) gilt dies NICHT — die Positions-Konfinierung (siehe OP-A) weist sie als Randallograph-Kandidaten für merge/umwidmen aus, nicht als lexikalisch frei kombinierende Morpheme, und damit als OP-A-Fall statt als Substratbeleg. Für nicht-konfinierte Wurzelecho-/Adjazenzpaare bleibt die Aussage bestehen: sprachtypisch, stützt das Substrat eher als es zu widerlegen. Realer Rest (nur 26 % der Paare lösen sich in zwei distinkte Lesarten auf, darunter Ein-Galgen-Tausch-Paare wie `kshy`/`kchy`, `chor`/`cthor`) verschiebt sich zu OP5 (Exklusivität) als Kontrollmetrik.
Scheol-Verteilungsstatistik (v7.5 formalisiert)
Strukturpositionsheol/shol-VorkommenAndere Lexeme
Zeilenende / Kolophon-Final>85 % aller Belegeor, dom, kaiim
Zeilenmitte (medial)<15 % — immer in Kompositum
Zeilenanfang0 %

Diese Verteilung ist nicht die eines zufällig platzierten Begriffs. Sie folgt präzise R6 (Zeilenabschluss sheol = Tod-Prognose) und R17 (shol apokor. medial / sheol Vollform final).

Voynich-Manuskript Entzifferungssystem · Version 9.9.3 · Juli 2026

Rückwärtstest: Typ I: 10/10 (100%) · Typ II: 30/33 (91%) · Lexikon: 396 Einträge · 59 Grammatikregeln

Impressum & Datenschutz