There is a newer version of the record available.

Published June 11, 2026 | Version 2.0

Computational Analysis of Maria Valtorta's Poem of the Man-God: Textual Similarity, Anachronisms, and Astronomical Constraints

Authors/Creators

  • 1. Independent researcher

Description

This record contains the preprint (PDF) and the generated figures (ZIP) for a computational study of Maria Valtorta’s Poem of the Man-God. The analysis combines text similarity measures, rare n-gram diagnostics, a structured anachronism inventory, and basic astronomical consistency checks. No copyrighted corpora are redistributed. The code-only analysis pipeline is archived separately on Zenodo: https://doi.org/10.5281/zenodo.18285716.

Un audit de reproductibilité complet du pipeline a identifié quatre problèmes dans la version v1, corrigés dans la présente version. Les conclusions de l'étude sont inchangées ; plusieurs quantifications sont corrigées et l'axe astronomique est remplacé par une version plus robuste.

1. Contamination de corpus (stylométrie). Les scripts de similarité chargeaient le corpus Valtorta via un motif de fichiers ambigu (`valtorta*clean*.txt`) avec sélection non déterministe, qui a chargé un fichier fusionné contenant l'œuvre dupliquée environ dix fois. Effet : les nombres de blocs rapportés au §3.1 étaient gonflés d'un facteur dix (36 383 / 18 191 / 9 095 ; valeurs correctes : 3 625 / 1 812 / 906). Les statistiques de similarité sont robustes à la duplication : sur corpus propre, toutes les valeurs SBERT publiées (moyennes, écarts-types, d de Cohen, deux baselines séculières complètes) se reproduisent à ±0,02 près (ex. Papini : µ = 0,4387 vs 0,438 publié ; d vs Valtorta-séculier = 1,33 vs 1,35). Les scripts chargent désormais le fichier canonique par son nom exact, signalent tout fichier surnuméraire et refusent un corpus anormalement volumineux. Le corpus canonique est épinglé par empreinte SHA-256 (f3385b95f752ada3ed1c25d61c881138b46f844c220a7e002c5e1ba5be852d6b ; 10 337 196 octets, soit 10 189 809 caractères Unicode).

2. Comptage « 153 paires > 0,85 ». Ce chiffre, issu du corpus dupliqué et non reproductible par les scripts du dépôt, est retiré. Mesure sur corpus propre (script `05_high_similarity_pairs.py`, ajouté au dépôt) : une seule paire de blocs Valtorta x Papini dépasse 0,85 (maximum 0,861) sur plus d'un million de paires possibles ; pour Ricciotti, aucune paire ne dépasse 0,85 (maximum 0,843), ce qui confirme empiriquement le contraste décrit au §9.3. Le texte est reformulé en conséquence : la proximité avec Papini est un déplacement d'ensemble de la distribution des similarités (d ≈ 1,24 à 1,33 selon la baseline), sans quasi-doublons, ce qui correspond au mécanisme d'amplification paraphrastique défendu par l'étude, et non à un copier-coller.

3. Figure 7 (n-grammes). Les recouvrements rapportés en v1 (23 % / 8 % / 5 % et « contrôle médiéval » à 2 %) provenaient du mode de démonstration du script d'analyse (valeurs d'exemple codées en dur) et non d'une mesure ; aucun corpus médiéval n'était chargé. Le script est corrigé (direction du taux conforme au §3.2, suppression de l'interprétation codée en dur, mode démonstration explicitement signalé) et la section 5 est réécrite sur les taux mesurés : part des n-grammes distincts de l'auteur retrouvés verbatim dans Valtorta, pour n = 3/4/5 : Papini 6,06 / 0,83 / 0,21 % ; Ricciotti 2,73 / 0,31 / 0,07 % ; Serao 3,99 / 0,25 / 0,02 %. Le pouvoir discriminant croît avec n (à n = 5, Papini ≈ 3x Ricciotti et ≈ 13x Serao), signature d'une dépendance phraséologique plutôt que thématique ; la conclusion qualitative est maintenue, la quantification est corrigée.

4. Axe astronomique (section 8) remplacé. L'argument des « intervalles lunaires impossibles » entre dates de rédaction des manuscrits est abandonné : l'ordre de dictée ne suit pas l'ordre narratif, ces intervalles ne portent donc aucune information astronomique. La section révisée repose sur des éléments indépendants de toute datation : quantification de l'inflation par essais multiples et du taux de base, contrôle négatif Monte Carlo (paramètres de type Sarashina Diary), tautologie calendaire des pleines lunes liturgiques, critique méthodologique d'Aulagnier et de Van Zandt, et incohérences géométriques internes du texte italien (croissant à l'est au coucher du soleil ; pleine lune autocontradictoire). Les scripts correspondants (`02b_sarashina_control.py`, `02c_elongation_crescent.py`) remplacent l'ancien `02_astronomical_analysis.py`, déprécié.

Effet secondaire corrigé (TF-IDF). Le vocabulaire et les poids IDF étant ajustés globalement, la duplication du corpus les distordait ; sur corpus propre, les valeurs TF-IDF changent (le classement devient pleinement cohérent avec SBERT : Papini > Serao > Ricciotti) et les figures concernées sont régénérées. TF-IDF demeure, comme en v1, un test de robustesse directionnelle, non une mesure d'amplitude.

Bilan. Trois des quatre axes (similarité en valeurs, anachronismes, empreinte socio-culturelle) sont confirmés tels quels ; l'axe n-grammes est requantifié avec un signal différentiel maintenu ; l'axe astronomique est remplacé par une version plus solide. Le pipeline v2 est intégralement reproductible sur un corpus local vérifié par empreinte.

Files

article_valtorta_complet.pdf

Files (2.5 MB)

Name Size Download all
md5:428ee54419f9967061939027f2b024f4
2.5 MB Preview Download

Additional details

Related works

Is supplemented by
Software: 10.5281/zenodo.18285716 (DOI)

References

  • 10.5281/zenodo.18285716