Signal Faible
← Registre

CRY-012 · Cryptographie

Mesurer le Voynich sans le lire

Dix-huit hypothèses préenregistrées, six textes de contrôle et 598 chiffres inventés, sur un manuscrit que personne ne sait lire. Aucune traduction ici : seulement ce que les chiffres autorisent à dire, et ce qu'ils interdisent.

Planche CRY-012 — grille de signes, quelques cases retenues. Le manuscrit compte environ 38 000 mots pour un inventaire de signes très restreint.

Le manuscrit tient dans deux mains : deux cent quarante pages de parchemin, des plantes qui ne correspondent à aucune espèce connue, des femmes dans des bassins reliés par des tuyaux, des roues d'étoiles. Et du texte, beaucoup de texte, dans une écriture qu'on ne retrouve nulle part ailleurs. Le parchemin est daté au carbone entre 1404 et 1438. Depuis un siècle, des cryptographes professionnels, des linguistes et des amateurs s'y cassent les dents, et chaque déchiffrement annoncé s'est effondré au premier examen.

Ce qui suit n'apporte aucune traduction, et n'en cherche aucune. Le travail présenté ici pose une autre question : sans savoir ce que le texte dit, que peut-on mesurer de ce qu'il fait ? Un ordinateur à qui l'on demande de deviner produit du latin fluide et faux ; un ordinateur à qui l'on demande de compter produit des chiffres qu'on peut contester.

Écrire les règles avant de jouer

Le dispositif est emprunté à la médecine clinique plutôt qu'à la cryptanalyse. Pour chaque hypothèse, un fichier daté fixe à l'avance quel résultat chiffré vaudra rejet. Ce fichier ne se modifie jamais après coup : si l'on change d'avis, l'amendement s'ajoute en dessous, daté lui aussi. Dix-huit hypothèses ont été traitées ainsi, en dix entrées successives.

Un chiffre isolé ne dit rien. Chaque mesure du manuscrit est donc comparée à six textes de contrôle — du latin médiéval, de l'italien du Quattrocento, de l'hébreu, de l'arabe translittéré — mais aussi à des sosies : du charabia fabriqué et du latin chiffré, produits par des mécanismes qu'on maîtrise entièrement. Si le manuscrit ressemble à l'un d'eux, c'est un indice. S'il ne ressemble à rien, c'en est un autre.

Tout se rejoue depuis les fichiers d'origine, avec les mêmes graines aléatoires. Et un journal liste les essais ratés — la partie la plus utile pour qui voudrait continuer.

Ce que les mesures établissent

Dans les cinq figures qui suivent, chaque règle graduée compare une mesure : le manuscrit, les langues réelles, le charabia fabriqué, les textes chiffrés. La bande claire est l'écart entre les différentes parties du manuscrit lui-même — un sosie crédible doit y tomber.

Un texte anormalement prévisible

Connaissant un signe, deviner le suivant est bien plus facile dans le Voynich que dans une langue : 2,1 bits d'incertitude contre 3,1 à 3,5 pour le latin, l'italien, l'hébreu et l'arabe. Le résultat tient sous trois alphabets de translittération différents, donc il ne vient pas d'un artefact de lecture des signes.

Jeu de la lettre suivante (h2, bits) — plus bas = plus prévisible bande grise = variabilité interne du Voynich 1.62 2.04 2.46 2.87 3.29 3.7 Voynich (tout) Voynich (tout) : 2.116 Voynich langue A Voynich langue A : 2.163 Voynich langue B Voynich langue B : 1.994 arabe translittéré (Coran) arabe translittéré (Coran) : 3.113 hébreu (Torah) hébreu (Torah) : 3.555 italien 1478 (Morgante) italien 1478 (Morgante) : 3.142 latin 1418 (Imitatio) latin 1418 (Imitatio) : 3.32 latin 1260 (Legenda) latin 1260 (Legenda) : 3.357 latin (Pline) latin (Pline) : 3.371 charabia Markov 1 charabia Markov 1 : 2.125 charabia Markov 2 charabia Markov 2 : 2.124 charabia auto-citation (meilleur réglage) charabia auto-citation (meilleur réglage) : 2.692 copiste à longue mémoire (meilleur) copiste à longue mémoire (meilleur) : 2.92 charabia auto-citation verticale (meilleur) charabia auto-citation verticale (meilleur) : 2.825 charabia tables Naibbe charabia tables Naibbe : 2.215 charabia tables aléatoires charabia tables aléatoires : 2.973 Naibbe 52 cartes, italien Naibbe 52 cartes, italien : 2.106 Naibbe 52 cartes, latin Naibbe 52 cartes, latin : 2.088 Naibbe tables aléatoires, italien Naibbe tables aléatoires, italien : 2.906 Naibbe tables aléatoires, latin Naibbe tables aléatoires, latin : 2.937 Naibbe 78 cartes, italien Naibbe 78 cartes, italien : 2.114 Naibbe 78 cartes, latin Naibbe 78 cartes, latin : 2.105 Naibbe à habitudes (meilleur réglage) Naibbe à habitudes (meilleur réglage) : 2.118 Naibbe à habitudes + règle de ligne (meilleur) Naibbe à habitudes + règle de ligne (meilleur) : 2.118 nomenclateur (meilleur, latin) nomenclateur (meilleur, latin) : 2.179
Jeu de la lettre suivante. Deux sosies seulement s'approchent du manuscrit : la machine à bégayer, qui a appris sur lui, et le chiffre Naibbe, qui a été construit pour ça. Le chiffre à tables aléatoires reste haut : l'imprévisibilité ne vient pas automatiquement avec le chiffrement.

La ligne est une unité de composition

C'est la mesure la plus tranchée. Le premier mot d'une ligne a des formes qui lui sont propres — l'écart vaut 0,18 contre au plus 0,004 pour n'importe quel texte naturel redécoupé en lignes de même longueur. Le dernier mot aussi. Et un mot ne se répète presque jamais à cheval sur deux lignes : sept fois moins souvent qu'à l'intérieur d'une même ligne.

Le premier mot de la ligne est-il spécial ? (P1) bande grise = variabilité interne du Voynich -0.0281 0.0542 0.137 0.219 0.301 0.383 Voynich (tout) Voynich (tout) : 0.1787 Voynich langue A Voynich langue A : 0.1418 Voynich langue B Voynich langue B : 0.2238 arabe translittéré (Coran) arabe translittéré (Coran) : 0.000503 hébreu (Torah) hébreu (Torah) : 0.0005797 italien 1478 (Morgante) italien 1478 (Morgante) : 0.0007638 latin 1418 (Imitatio) latin 1418 (Imitatio) : 0.001154 latin 1260 (Legenda) latin 1260 (Legenda) : 0.0009286 latin (Pline) latin (Pline) : 0.002521 charabia Markov 1 charabia Markov 1 : 0.001156 charabia Markov 2 charabia Markov 2 : 0.0007439 charabia auto-citation (meilleur réglage) charabia auto-citation (meilleur réglage) : 0.001201 copiste à longue mémoire (meilleur) copiste à longue mémoire (meilleur) : 0.0006729 charabia auto-citation verticale (meilleur) charabia auto-citation verticale (meilleur) : 0.001207 charabia tables Naibbe charabia tables Naibbe : 0.0007492 charabia tables aléatoires charabia tables aléatoires : 0.0003438 Naibbe 52 cartes, italien Naibbe 52 cartes, italien : 0.0008419 Naibbe 52 cartes, latin Naibbe 52 cartes, latin : 0.000312 Naibbe tables aléatoires, italien Naibbe tables aléatoires, italien : 0.0004984 Naibbe tables aléatoires, latin Naibbe tables aléatoires, latin : 0.0009406 Naibbe 78 cartes, italien Naibbe 78 cartes, italien : 0.0005388 Naibbe 78 cartes, latin Naibbe 78 cartes, latin : 0.0009536 Naibbe à habitudes (meilleur réglage) Naibbe à habitudes (meilleur réglage) : 0.04315 Naibbe à habitudes + règle de ligne (meilleur) Naibbe à habitudes + règle de ligne (meilleur) : 0.04373 nomenclateur (meilleur, latin) nomenclateur (meilleur, latin) : 0.0005367
Le premier mot de la ligne. Tous les sosies sont collés à zéro : chez eux, la ligne n'est qu'une coupure arbitraire. Dans le Voynich, le premier mot sait qu'il est premier.

Autrement dit : celui qui écrivait ne remplissait pas un flux de texte qu'on aurait ensuite découpé. Il composait ligne par ligne.

Le texte bégaie

Un mot sur cent est identique à celui qui le précède immédiatement. Les six textes de contrôle ne dépassent pas un sur mille.

Bégaiement : part des mots répétés immédiatement bande grise = variabilité interne du Voynich -0.00118 0.00225 0.00568 0.0091 0.0125 0.016 Voynich (tout) Voynich (tout) : 0.009239 Voynich langue A Voynich langue A : 0.009751 Voynich langue B Voynich langue B : 0.009056 arabe translittéré (Coran) arabe translittéré (Coran) : 0.000154 hébreu (Torah) hébreu (Torah) : 0.001139 italien 1478 (Morgante) italien 1478 (Morgante) : 0.0001164 latin 1418 (Imitatio) latin 1418 (Imitatio) : 0.0001665 latin 1260 (Legenda) latin 1260 (Legenda) : 4.284e-05 latin (Pline) latin (Pline) : 0.0002275 charabia Markov 1 charabia Markov 1 : 0.008105 charabia Markov 2 charabia Markov 2 : 0.003726 charabia auto-citation (meilleur réglage) charabia auto-citation (meilleur réglage) : 0.009111 copiste à longue mémoire (meilleur) copiste à longue mémoire (meilleur) : 0.003502 charabia auto-citation verticale (meilleur) charabia auto-citation verticale (meilleur) : 0.008333 charabia tables Naibbe charabia tables Naibbe : 0.002237 charabia tables aléatoires charabia tables aléatoires : 0.002205 Naibbe 52 cartes, italien Naibbe 52 cartes, italien : 0.002325 Naibbe 52 cartes, latin Naibbe 52 cartes, latin : 0.0009731 Naibbe tables aléatoires, italien Naibbe tables aléatoires, italien : 0.002135 Naibbe tables aléatoires, latin Naibbe tables aléatoires, latin : 0.0009731 Naibbe 78 cartes, italien Naibbe 78 cartes, italien : 0.002216 Naibbe 78 cartes, latin Naibbe 78 cartes, latin : 0.001379 Naibbe à habitudes (meilleur réglage) Naibbe à habitudes (meilleur réglage) : 0.00814 Naibbe à habitudes + règle de ligne (meilleur) Naibbe à habitudes + règle de ligne (meilleur) : 0.01298 nomenclateur (meilleur, latin) nomenclateur (meilleur, latin) : 0.0009403
Le bégaiement. Les langues de contrôle sont dix fois plus bas, le chiffre Naibbe cinq fois plus bas. Seul le charabia entraîné sur le manuscrit s'en approche.

Ce verdict est le plus fragile des cinq, et il faut le dire : il dépend du corpus auquel on compare. Une étude de 2021 portant sur 250 langues trouvait ce taux de répétition dans la norme. « Hors norme par rapport à six textes » n'est pas « hors norme tout court ».

Les mots longs vont par paquets

Les longueurs de mots ne se distribuent pas au hasard le long du texte : un mot long appelle un mot long. L'indice de Moran vaut 0,14, quand les langues de contrôle sont à zéro ou négatives, et les chiffres à zéro.

Mots longs par paquets (Moran I) — > 0 = par paquets bande grise = variabilité interne du Voynich -0.231 -0.142 -0.053 0.0361 0.125 0.214 Voynich (tout) Voynich (tout) : 0.1423 Voynich langue A Voynich langue A : 0.1059 Voynich langue B Voynich langue B : 0.1536 arabe translittéré (Coran) arabe translittéré (Coran) : 0.06232 hébreu (Torah) hébreu (Torah) : 0.003382 italien 1478 (Morgante) italien 1478 (Morgante) : -0.2005 latin 1418 (Imitatio) latin 1418 (Imitatio) : -0.08592 latin 1260 (Legenda) latin 1260 (Legenda) : -0.01894 latin (Pline) latin (Pline) : -0.03097 charabia Markov 1 charabia Markov 1 : 0.005487 charabia Markov 2 charabia Markov 2 : 0.01793 charabia auto-citation (meilleur réglage) charabia auto-citation (meilleur réglage) : 0.09012 copiste à longue mémoire (meilleur) copiste à longue mémoire (meilleur) : 0.05017 charabia auto-citation verticale (meilleur) charabia auto-citation verticale (meilleur) : 0.09706 charabia tables Naibbe charabia tables Naibbe : -0.000756 charabia tables aléatoires charabia tables aléatoires : -0.004094 Naibbe 52 cartes, italien Naibbe 52 cartes, italien : -0.04969 Naibbe 52 cartes, latin Naibbe 52 cartes, latin : -0.02722 Naibbe tables aléatoires, italien Naibbe tables aléatoires, italien : 0.002575 Naibbe tables aléatoires, latin Naibbe tables aléatoires, latin : 0.002929 Naibbe 78 cartes, italien Naibbe 78 cartes, italien : -0.04274 Naibbe 78 cartes, latin Naibbe 78 cartes, latin : -0.01828 Naibbe à habitudes (meilleur réglage) Naibbe à habitudes (meilleur réglage) : 0.007023 Naibbe à habitudes + règle de ligne (meilleur) Naibbe à habitudes + règle de ligne (meilleur) : 0.08599 nomenclateur (meilleur, latin) nomenclateur (meilleur, latin) : -0.01354
Le regroupement des mots longs. Aucun sosie testé ne le reproduit — ni les charabias, ni les chiffres.

La place des signes dans le mot

Certains signes n'apparaissent qu'en début de mot, d'autres qu'en fin. C'est la mesure sur laquelle le chiffre Naibbe est le plus convaincant, et les langues réelles les plus éloignées.

Chaque signe a-t-il sa place dans le mot ? (G1) bande grise = variabilité interne du Voynich 0.336 0.519 0.703 0.887 1.07 1.25 Voynich (tout) Voynich (tout) : 1.032 Voynich langue A Voynich langue A : 0.9964 Voynich langue B Voynich langue B : 1.087 arabe translittéré (Coran) arabe translittéré (Coran) : 0.4802 hébreu (Torah) hébreu (Torah) : 0.6395 italien 1478 (Morgante) italien 1478 (Morgante) : 0.5912 latin 1418 (Imitatio) latin 1418 (Imitatio) : 0.4175 latin 1260 (Legenda) latin 1260 (Legenda) : 0.4292 latin (Pline) latin (Pline) : 0.4062 charabia Markov 1 charabia Markov 1 : 0.8776 charabia Markov 2 charabia Markov 2 : 1.005 charabia auto-citation (meilleur réglage) charabia auto-citation (meilleur réglage) : 0.9781 copiste à longue mémoire (meilleur) copiste à longue mémoire (meilleur) : 0.9556 charabia auto-citation verticale (meilleur) charabia auto-citation verticale (meilleur) : 0.9672 charabia tables Naibbe charabia tables Naibbe : 1.041 charabia tables aléatoires charabia tables aléatoires : 0.7211 Naibbe 52 cartes, italien Naibbe 52 cartes, italien : 1.067 Naibbe 52 cartes, latin Naibbe 52 cartes, latin : 1.086 Naibbe tables aléatoires, italien Naibbe tables aléatoires, italien : 0.7581 Naibbe tables aléatoires, latin Naibbe tables aléatoires, latin : 0.7474 Naibbe 78 cartes, italien Naibbe 78 cartes, italien : 1.063 Naibbe 78 cartes, latin Naibbe 78 cartes, latin : 1.075 Naibbe à habitudes (meilleur réglage) Naibbe à habitudes (meilleur réglage) : 1.062 Naibbe à habitudes + règle de ligne (meilleur) Naibbe à habitudes + règle de ligne (meilleur) : 1.06 nomenclateur (meilleur, latin) nomenclateur (meilleur, latin) : 1.104
La place des signes dans le mot. Le seul terrain où un chiffre publié tombe dans la bande.

Deux régimes, confirmés

En 1976, Prescott Currier remarquait que le manuscrit se partage en deux « langues », A et B, aux statistiques distinctes. Sur 105 pages, la séparation est ici quasi parfaite — et elle est absente d'un contrôle fabriqué en mêlant deux auteurs latins. Sur la seule section de l'herbier, un des trois critères manque son seuil de peu ; les deux résultats sont rapportés, sans déplacer le seuil après coup.

Les sosies : ce que chaque mécanisme explique, et ce qu'il rate

Un sosie qui entre dans la bande prouve qu'un mécanisme peut produire ces statistiques — jamais que le manuscrit a été fabriqué ainsi. Voici où chacun s'arrête.

Mécanisme testéReproduitNe reproduit pasVerdict
Substitution lettre à lettrerien d'utilelongueurs, prévisibilité, toutexclu
Charabia de Markov entraîné sur le manuscritprévisibilité, richesse lexicale, bégaiementdispersion des longueurs, effets de ligne, structure longueexclu au-delà du mot
Copiste qui se recopiepaquets de mots longs, bégaiement, mémoire longueprévisibilité, effets de ligne, localitérejeté
Chiffre Naibbe publiéprévisibilité, longueurs, place des signeseffets de ligne, bégaiement, paquetsrejeté
Naibbe augmenté d'habitudes de scribe11 à 12 mesures sur 13fin de ligne, rafales, localitérejeté de peu — sosie le plus proche
598 chiffres inventés, tables non ajustéesau plus 4 mesures sur 13prévisibilité, place des signes, fin de lignerejeté
Nomenclateur sur clair thématiquerafales et localité d'une sectionprévisibilité, effets de lignenon rejeté

Deux enseignements sortent de ce tableau, chacun avec sa réserve.

Les mécanismes qui imitent le niveau du signe ont besoin de tables qui ressemblent déjà au Voynich. Aucun des 598 chiffres construits sans regarder le manuscrit n'approche sa prévisibilité. Le chiffre Naibbe y parvient parce que ses tables ont été ajustées sur lui. D'où viendraient de telles tables au XVe siècle, sans le manuscrit sous les yeux ? Question ouverte.

Les mécanismes qui imitent la structure longue opèrent sur des mots, pas sur des lettres. Toute substitution lettre à lettre détruit les rafales et la localité, parce qu'un même mot du texte clair devient un mot chiffré différent à chaque occurrence. Un chiffre de mots les conserve, mais n'explique alors rien du niveau des signes.

Aucun sosie testé ne fait les deux.

Regarder le texte de loin

Les mesures précédentes portent sur des signes et des mots. Trois autres regardent le texte à l'échelle du livre : les mots reviennent-ils par rafales ? Un bloc de mille mots ressemble-t-il plus à son voisin qu'à un bloc tiré au hasard ? La suite des longueurs a-t-elle une mémoire longue ?

CorpusMémoire longueRafalesLocalité
Voynich, tout le corpus0,6742,2430,187
Textes naturels (étendue)0,514 – 0,6881,246 – 3,7560,010 – 0,148
Machines sans mémoire0,468 – 0,5170,939 – 1,016−0,004 – 0,005
Chiffres0,454 – 0,6390,938 – 1,125−0,002 – 0,007

Le manuscrit se comporte comme un texte naturel là où toutes les machines sont à zéro. C'est le résultat qui départage le mieux : quelle que soit la question du sens, ce texte n'a pas été produit par un procédé sans mémoire.

Une correction s'impose ici, et elle a été faite après coup. La localité mesurée sur l'ensemble du livre — nettement au-dessus des textes naturels — vient surtout de ce que les sections du manuscrit n'emploient pas le même vocabulaire. À l'intérieur d'une seule section, la localité du Voynich redevient celle d'un texte réel, dans la partie haute de la fourchette, pas au-dessus. Résultat moins spectaculaire, plus solide, et qui tient toujours contre les sosies.

Ce que ce travail ne dit pas

Rien sur le sens, rien sur la langue sous-jacente, rien sur l'intention. Ni « c'est un canular », ni « c'est un chiffre ». Qu'aucun sosie ne convienne peut vouloir dire que la bonne recette n'est pas dans la famille testée — pas qu'elle n'existe pas.

Et tous les verdicts dépendent de six textes de contrôle et d'une translittération. Changez-en, certains basculeront.

Les erreurs, datées

Un comptage initial faux de 2 %. Un rééchantillonnage par lignes, invalide pour des statistiques qui portent justement sur ce qui se passe entre les lignes. Une vérification du chiffre Naibbe menée avec une définition de l'entropie différente de celle de son auteur. Une surinterprétation de la localité, corrigée par le contrôle par section décrit plus haut. Un générateur qui bouclait pendant trois minutes, et quatre processus orphelins laissés en mémoire.

Toutes ces erreurs sont dans le journal, avec leur date. C'est la moitié du travail.

La prochaine question

Aucun mécanisme testé ne réussit à la fois le niveau du signe et la structure longue. Un dispositif à deux étages — des mots convertis en codes, puis ces codes écrits avec un système de signes fortement contraint — n'a pas encore été essayé. C'est l'hypothèse suivante, et elle est déjà écrite.

Reste une question plus modeste, à laquelle le sosie le plus proche a buté : comment un scribe du XVe siècle marque-t-il la fin d'une ligne ?

  1. Translittération ZL3b-n (EVA étendu) du corpus de René Zandbergen, voynich.nu, récupérée le 09.09.2026 ; empreintes SHA-256 conservées avec les données brutes, jamais modifiées.
  2. Datation radiocarbone du parchemin : intervalle 1404–1438. Elle date le support, pas l'écriture.
  3. P. H. Currier, « Some Important New Statistical Findings », 1976 — l'observation d'origine des deux régimes A et B.
  4. C. Bowern et E. Lindemann, « The Linguistics of the Voynich Manuscript », Annual Review of Linguistics, 2021 — c'est de là que vient l'échantillon de 250 langues qui relativise le verdict sur le bégaiement.
  5. M. A. Greshko, « The Naibbe cipher », Cryptologia, mis en ligne le 26.11.2025, DOI 10.1080/01611194.2025.2566408 — le chiffre publié qui sert ici de sosie de référence.
  6. Les cinq figures sont celles produites par le pipeline d'analyse, réintégrées telles quelles et recolorées aux teintes du carnet.