Devenir membre

Histoire · Dossier 68982

Journaux anciens : une IA doit surtout retrouver les bonnes preuves

Corriger une transcription et retrouver le document décisif sont deux tâches différentes. Une étude sur des journaux suisses montre pourquoi cette distinction compte pour interroger les archives avec une IA.

Ma liste

Rubrique
Histoire
Lecture
4 min
Chapitres
4
Sources
1 citées

En bref

Dans un journal ancien numérisé, l’article recherché peut être présent sans apparaître dans les résultats : une lettre mal reconnue ou un vocabulaire différent de celui de la question suffisent à compliquer sa découverte. Pour une IA qui répond à partir de ces archives, deux problèmes se distinguent donc : lire correctement les textes et choisir les bonnes pièces justificatives. Une étude sur des journaux suisses suggère que, dans les essais réalisés, mieux classer les documents apporte davantage à la recherche que la seule correction des transcriptions.[1]

Le travail, déposé sur arXiv le 3 juillet 2026, porte sur un fonds fourni par la Bibliothèque cantonale et universitaire de Lausanne via Scriptorium. Les chercheurs ont constitué un index de 500 000 segments issus de neuf périodiques, couvrant les années 1762 à 2001, puis testé la recherche avec 384 questions formulées manuellement. Il faut lire ses résultats comme une expérience sur ce fonds, et non comme une mesure de toutes les archives historiques.[1]

Réparer une lecture n’est pas sélectionner une preuve

La première tâche concerne l’OCR, la reconnaissance optique des caractères qui transforme une page scannée en texte exploitable. Ici, le modèle de langage intervient après cette reconnaissance : il corrige sa sortie textuelle, pas le scan lui-même. L’objectif annoncé est de réparer la transcription tout en conservant sa structure et sa fidélité au contenu. Cela répond à une question précise : les mots enregistrés correspondent-ils mieux à ceux du journal ?[1]

La sélection des preuves intervient ensuite. Le système recherche des candidats, en combinant correspondance lexicale et recherche sémantique, puis un « reclasseur » réévalue les couples question-document pour faire remonter les passages les plus pertinents. Le modèle générateur ne reçoit finalement que le contexte retenu. Pour le lecteur, la distinction est essentielle : une transcription plus propre ne garantit pas que le document utile sera placé devant l’IA au moment de répondre.[1]

Ce que les dix premiers résultats révèlent

La comparaison la plus parlante ne consiste pas seulement à opposer le système complet au moteur par mots-clés. À dix résultats, la recherche hybride sans correction ni reclassement obtient un score NDCG de 74,35 %. Avec reclassement, mais toujours sans correction OCR, elle atteint 84,94 %. Le système qui ajoute aussi la correction arrive à 87,05 %. Dans cette comparaison, le changement majeur vient donc de l’ordre donné aux documents ; le nettoyage apporte un complément, plutôt qu’une solution à lui seul.[1]

Ces 87,05 % ne signifient pas que l’IA donne une réponse historiquement exacte dans 87,05 % des cas. Le NDCG mesure la qualité du classement, en tenant compte de la pertinence des documents et de leur position par rapport à un ordre idéal. La justesse des réponses fait l’objet d’une autre mesure : à dix résultats, le système complet obtient 65,92 % dans le tableau des auteurs. Cette évaluation s’appuie notamment sur un modèle juge, GPT-4o-mini ; elle ne constitue pas une vérification indépendante par des historiens.[1]

La correction automatique doit elle aussi être jugée sur la fidélité, pas sur l’élégance du texte obtenu. Son évaluation repose ici sur 94 extraits transcrits manuellement, et non sur l’ensemble du corpus. Certains modèles améliorent la reconnaissance, mais Qwen3 32B dégrade en moyenne le taux d’erreur de caractères. Les auteurs expliquent que ce modèle peut ajouter du texte au lieu de se limiter à réparer les erreurs. Une sortie plus développée n’est donc pas nécessairement une meilleure transcription.[1]

Le bon réflexe : revenir à la pièce d’archive

Pour exploiter une réponse, le critère pratique reste la possibilité de remonter aux documents utilisés. Le prototype décrit dans l’étude les expose et permet de poursuivre la navigation dans le matériau original. C’est là que les deux questions se rejoignent : le passage a-t-il été correctement transcrit, et soutient-il réellement la réponse ? Le classement aide à trouver une pièce pertinente ; son inspection permet au lecteur d’en apprécier la portée.[1]

Cette expérience dessine ainsi un usage de l’IA comme outil d’accès, sans faire de sa réponse le dernier mot sur le passé. Sa reproductibilité demeure toutefois limitée par l’accès aux données : les auteurs indiquent que le corpus complet ne peut pas être redistribué publiquement en raison des droits et des restrictions du propriétaire. Les performances annoncées ouvrent une piste pour explorer ce fonds ; elles ne garantissent ni les mêmes résultats ailleurs, ni une lecture sans erreur des journaux retrouvés.[1]

Sources

  1. Improving Access to Historical Archives with Real-time RAG-based Systems

Ce dossier vous a…

0 réactions

Réagir demande un compte gratuit. Se connecter

Obscura sépare ce qui est établi de ce qui reste discuté, et cite ses sources. Une erreur ? Signalez-la · Notre méthode

Carte de membre Obscura, formule Mécène

Abonnement sans publicité

Lisez Obscura sans publicité, carte à votre nom.

Périodicité
Formule
  • Aucune publicité (toutes les formules)
  • Votre carte de membre numérotée (toutes les formules)
  • Un sceau de fidélité qui évolue (toutes les formules)
  • Historique et factures (toutes les formules)
  • Formule libre (toutes les formules)
  • Vos réglages de lecture partout (toutes les formules)
  • Finition or (formule Mécène)
  • Le tirage PDF des dossiers (formules Mécène et Bienfaiteur)
  • Finition platine (formule Bienfaiteur)

Tout sur l’abonnement

Résiliable à tout moment · paiement sécurisé par Stripe · soit 2,49 € par mois, 5,98 € de moins que douze mensualités · soit 4,99 € par mois, 11,98 € de moins que douze mensualités · soit 9,99 € par mois, 23,98 € de moins que douze mensualités

La discussion 0

Connectez-vous pour participer à la discussion, voter et répondre. Le compte est gratuit.

Se connecterCréer un compte

    Aucun commentaire pour l’instant. Une précision ou une question aidera les prochains lecteurs.