L'ère moderne de l'IA (2000-2026) pour le généalogiste.
PARTIE 1 - FONDEMENTS THÉORIQUES (20%)
1.1 Chronologie de l'évolution (2000-2026)
L'intelligence artificielle a connu une accélération fulgurante depuis le début du siècle, transformant radicalement nos capacités de traitement de l'information historique et généalogique.
Les grandes étapes technologiques :
-
2000-2011 : L'ère pré-Deep Learning
- Domination des méthodes statistiques et règles expertes
- OCR basique avec taux d'erreur élevé sur documents anciens
- Traduction automatique peu fiable (approche statistique)
-
2012 : La révolution Deep Learning
- AlexNet remporte ImageNet avec des réseaux de neurones profonds
- Début de l'amélioration massive de la reconnaissance d'images
- Impact immédiat sur l'analyse de photos anciennes
-
2014-2016 : L'émergence du NLP moderne
- Word2Vec (2013) et GloVe : première représentation sémantique des mots
- Réseaux récurrents (LSTM) pour la traduction
- Amélioration significative de la traduction automatique
-
2017 : Le tournant Transformer
- Publication "Attention is All You Need" par Google
- Architecture révolutionnaire abandonnant la récurrence
- Fondation de tous les LLM modernes
-
2018-2019 : Naissance des LLM
- GPT-1 et GPT-2 d'OpenAI : génération de texte cohérent
- BERT de Google : compréhension contextuelle du langage
- Applications prometteuses pour l'analyse de corpus historiques
-
2020-2022 : L'explosion des capacités
- GPT-3 (175 milliards de paramètres) : capacités émergentes
- DALL-E : génération d'images par l'IA
- Applications généalogiques : colorisation, restauration, transcription
-
2023-2026 : L'ère multimodale et accessible
- GPT-4, Claude 3, Gemini : compréhension texte + images + documents
- Démocratisation via interfaces conversationnelles
- Intégration native dans les outils généalogiques (MyHeritage, Geneanet)
⚙️ Point technique : Le passage de l'IA symbolique (règles expertes programmées manuellement) à l'IA connexionniste (apprentissage à partir de données) explique l'explosion des performances. Au lieu de programmer "un acte de naissance contient...", on entraîne un modèle sur des millions d'exemples.
1.2 Technologies fondamentales
Deep Learning : l'apprentissage profond par l'exemple
Imaginez que vous enseigniez la paléographie à un assistant. Plutôt que de lui donner des règles ("le 's' long ressemble à un 'f'"), vous lui montrez 10 000 exemples de documents manuscrits avec leur transcription. Le Deep Learning fonctionne ainsi : des réseaux de neurones artificiels apprennent à reconnaître des motifs en ajustant des millions de paramètres.
Analogie généalogique : C'est comme construire un arbre généalogique où chaque génération affine la compréhension. Les premières couches détectent des traits simples (lignes, courbes), les couches intermédiaires reconnaissent des lettres, les couches finales comprennent des mots et leur contexte historique.
NLP (Natural Language Processing) : comprendre le langage humain
Le NLP moderne ne se contente plus de repérer des mots-clés, il comprend le sens contextuel. Exemple :
- "Pierre Dupont, cultivateur à Lyon en 1750"
- "Pierre Dupont, laboureur au terroir de Lyon, 1750"
Un système NLP moderne comprend que "cultivateur" et "laboureur" sont équivalents dans ce contexte, et que "au terroir de" signifie la même localisation que "à".
⚙️ Point technique : Les embeddings (représentations vectorielles) transforment les mots en points dans un espace mathématique où les termes similaires sont proches. "laboureur", "cultivateur", "agriculteur" forment un cluster, tandis que "notaire" en est éloigné.
Architecture Transformer : le mécanisme d'attention
L'innovation clé de 2017 : le mécanisme d'attention permet au modèle de pondérer l'importance de chaque mot en fonction du contexte.
📌 Exemple : Dans "Marie Dupont, née Martin, épouse de Jean Moreau", un Transformer comprend que "née Martin" se rapporte à "Marie Dupont" (attention forte) et non à "Jean Moreau" (attention faible), permettant d'extraire correctement le nom de jeune fille.
LLM (Large Language Models) : les géants du langage
Les LLM sont des modèles Transformer entraînés sur des milliards de mots pour prédire le mot suivant dans une phrase. Cette simple tâche développe des capacités émergentes : raisonnement, traduction, synthèse.
Différences majeures pour le généalogiste :
| Modèle | Points forts généalogiques | Limites |
|---|---|---|
| GPT-4 (OpenAI) | Raisonnement complexe, génération de récits | Données jusqu'à avril 2023, hallucinations |
| Claude 3.5 (Anthropic) | Analyse de documents (200K tokens), précision factuelle | Moins créatif que GPT-4 |
| Gemini (Google) | Intégration Google, multilinguisme, Gems personnalisables | Parfois verbeux |
| Mistral (français) | Souveraineté européenne, open source | Performances légèrement inférieures |
SLM (Small Language Models) : spécialisation efficace
Les SLM (7-13 milliards de paramètres vs 175+ pour les LLM) sont des modèles plus petits, spécialisés sur des tâches précises.
💡 Conseil pratique : Pour l'OCR de documents français du XVIIIe-XIXe siècle, un SLM fine-tuné sur ce corpus spécifique surpassera souvent un LLM généraliste. Transkribus utilise cette approche.
1.3 Rôle des GAFAM+N
Les piliers de l'infrastructure IA
- Google : TensorFlow (framework), TPU (processeurs spécialisés), Gemini, BERT
- Microsoft : Azure AI, partenariat OpenAI, GitHub Copilot
- Meta (Facebook) : PyTorch (framework dominant), LLaMA (open source)
- Amazon : AWS infrastructure, modèles Bedrock
- Apple : Intelligence on-device (confidentialité)
- Nvidia : GPU indispensables, domination du hardware IA
Impact sur la généalogie :
✅ Positif : Démocratisation (APIs accessibles), investissements massifs en R&D, outils gratuits (Google Translate, Vision AI)
⚠️ Limites :
- Dépendance aux écosystèmes propriétaires
- Centralisation des données généalogiques
- Coûts croissants pour les fonctionnalités avancées
- Disparition potentielle de services (Google Reader, etc.)
Open source vs Propriétaire
Le mouvement open source (LLaMA, Mistral, BLOOM) offre une alternative :
- Avantages : Souveraineté des données, personnalisation, pas de coût d'API
- Inconvénients : Nécessite infrastructure technique, performances variables
💡 Conseil pratique : Pour débuter, utilisez les versions gratuites des GAFAM (ChatGPT Free, Gemini, Claude gratuit). Pour des projets avancés avec données sensibles, explorez les solutions open source hébergées localement.
PARTIE 2 - APPLICATIONS PRATIQUES EN GÉNÉALOGIE (60%)
2.1 Transcription et OCR de documents anciens
Technologies utilisées
L'OCR (Optical Character Recognition) moderne repose sur :
- Vision Transformers (ViT) : analyse de l'image du document
- Modèles de langage : correction contextuelle des erreurs
- HTR (Handwritten Text Recognition) : spécialisation pour l'écriture manuscrite
Évolution technologique :
- OCR traditionnel (Tesseract, ABBYY) : règles de reconnaissance de formes → 80-90% sur texte imprimé net, 40-60% sur manuscrit ancien
- ViT + LLM (Transkribus, Claude Vision) : apprentissage sur corpus historique → 90-95% sur manuscrit ancien après entraînement
Outils disponibles
| Outil | Type | Prix | Performance manuscrits anciens |
|---|---|---|---|
| Transkribus | HTR spécialisé | Gratuit (500 crédits/mois) puis payant | ⭐⭐⭐⭐⭐ (95%+) |
| Google Vision AI | OCR généraliste | Gratuit (1000 pages/mois) | ⭐⭐⭐ (70-80%) |
| Azure Computer Vision | OCR généraliste | Payant après essai | ⭐⭐⭐⭐ (80-85%) |
| Claude Vision | Multimodal LLM | 20$/mois (Pro) | ⭐⭐⭐⭐ (85-90%) avec prompt |
| GPT-4 Vision | Multimodal LLM | 20$/mois | ⭐⭐⭐⭐ (85-90%) avec prompt |
📌 Exemple concret : Transcription d'un acte de mariage du XVIIIe siècle
Document : Acte de mariage manuscrit, paroisse de La Turbie, 1711
Workflow recommandé :
Étape 1 : Numérisation optimisée
- Scan 300 DPI minimum en niveaux de gris
- Ajustement contraste/luminosité (pas de filtres agressifs)
- Format JPEG ou PNG
Étape 2 : Transcription avec Transkribus
- Upload du document
- Sélection du modèle "French 18th century parish records" (si disponible) ou modèle générique
- Lancement de la reconnaissance
- Résultat brut avec confiance par mot
Étape 3 : Correction assistée par LLM (Claude)
Prompt optimisé :
<document>
[Transcription brute Transkribus]
Le sixième jour de septembre mil sept cent onze, après la publication
des bans faite en cette église par trois fois sans aucun empêchement,
ont été mariés par moi soussigné Antoine Giraudi fils de Gio Antonio
Giraudi et de Gioanna son épouse de cette paroisse et Lucretia Rossetta
fille de [mot illisible] Rossetta et de [mot illisible] aussi de cette
paroisse...
</document>
Tu es un expert en paléographie française du XVIIIe siècle. Corrige cette
transcription d'acte de mariage en :
1. Normalisant l'orthographe (conserve les noms propres originaux)
2. Ajoutant la ponctuation moderne
3. Signalant les passages incertains par [?]
4. Proposant des interprétations pour les mots illisibles en contexte
Réponds au format :
- Transcription corrigée
- Liste des corrections effectuées
- Mots incertains avec propositions
Étape 4 : Validation humaine
- Vérification des noms propres (Giraudi, Rossetta, La Turbie)
- Contrôle de cohérence (dates, lieux, témoins)
- Consultation d'actes connexes pour valider les patronymes
⚙️ Point technique : La correction contextuelle par LLM exploite la connaissance de formules types ("ont été mariés par moi soussigné", "après publication des bans") pour déduire des mots mal reconnus.
Gestion des variantes orthographiques
Les documents anciens présentent des orthographes fluctuantes :
- "baptesme" / "baptême" / "batême"
- "Dupont" / "Du Pont" / "Dupond"
💡 Conseil pratique : Créez un glossaire de normalisation dans un document partagé avec l'IA :
Terme original → Forme normalisée
- baptesme → baptême
- laboureur → cultivateur
- mesnager → ménager
Incluez ce glossaire dans vos prompts pour maintenir la cohérence.
⚠️ Limites actuelles :
- Taux d'erreur résiduel : 5-10% même avec meilleurs outils (noms rares, abréviations)
- Documents très dégradés : taches, déchirures → transcription partielle
- Écritures atypiques : cursives très serrées, notaires négligents
- Coût : Transkribus devient onéreux au-delà de 500 pages/mois
2.2 Analyse de photos familiales
Technologies utilisées
- Computer Vision : détection d'objets, scènes, texte dans images
- Face Recognition : identification et clustering de visages
- Object Detection : YOLO, Faster R-CNN pour éléments datables (vêtements, voitures, architecture)
- GANs (Generative Adversarial Networks) : colorisation, restauration, super-résolution
Outils disponibles
| Outil | Fonctionnalités | Prix | Qualité |
|---|---|---|---|
| MyHeritage Photo Enhancer | Restauration, colorisation, animation | Gratuit limité, puis 129€/an | ⭐⭐⭐⭐⭐ |
| Remini | Super-résolution, netteté | Freemium, 5€/mois | ⭐⭐⭐⭐ |
| Google Photos | Recherche sémantique, clustering visages | Gratuit | ⭐⭐⭐⭐ |
| DALL-E / Midjourney | Restauration créative (délicat) | 10-30$/mois | ⭐⭐⭐ (précaution) |
| DeOldify | Colorisation (open source) | Gratuit (nécessite Colab) | ⭐⭐⭐⭐ |
📌 Exemple concret : Datation et analyse d'une photo familiale floue
Photo : Portrait de groupe, noir & blanc, floue, sans annotation, années présumées 1920-1950
Workflow d'analyse :
Étape 1 : Amélioration de l'image (Remini)
- Upload photo
- Application "HD enhancement"
- Téléchargement version haute résolution
- ⚠️ Ne pas utiliser pour preuve officielle (algorithme ajoute des détails)
Étape 2 : Analyse contextuelle avec GPT-4 Vision
Prompt optimisé :
<image>
[Photo améliorée]
</image>
Analyse cette photo familiale pour aider à la dater. Examine :
1. **Vêtements** : coupes, tissus, accessoires (chapeaux, cravates, robes)
2. **Coiffures** : styles masculins et féminins typiques de certaines décennies
3. **Contexte** : meubles, décor, architecture visible
4. **Technique photographique** : format, grain, contraste (si déductible)
Fournis :
- Estimation de période (fourchette de 10 ans)
- Éléments clés ayant permis la datation
- Degré de confiance (faible/moyen/élevé)
- Suggestions pour affiner (recherche de cartes postales de l'époque, consultation archives municipales pour l'architecture visible)
Réponse type :
Estimation : 1935-1945 (confiance moyenne-élevée)
Éléments clés :
- Coupes de robes : épaules marquées typiques milieu années 30-début 40
- Costume masculin : revers larges caractéristiques années 30
- Coiffures féminines : ondulations Marcel, populaires 1930-1940
- Pas d'éléments visuels après-guerre (pas de New Look)
Degré de confiance : Moyen-élevé (75%)
Les styles vestimentaires sont cohérents avec 1935-1945, mais absence
d'éléments datables précis (journaux, calendriers).
Suggestions :
- Comparer avec photos connues de la famille 1930-1950
- Si architecture visible, rechercher cartes postales du lieu
- Examiner albums familiaux pour photos similaires datées
Étape 3 : Identification de lieu (si architecture/paysage visible)
Utiliser Google Lens ou Claude :
- Upload photo
- "Identifie le lieu ou le type d'architecture visible"
- Croisement avec lieux de vie connus des ancêtres
Étape 4 : Colorisation (optionnelle)
Utiliser MyHeritage ou DeOldify :
- ✅ Avantage : rend la photo plus "vivante", améliore connexion émotionnelle
- ⚠️ Limite éthique : couleurs inférées, pas réelles. Toujours conserver original et mentionner "colorisation par IA"
💡 Conseil pratique : Créez un dossier d'analyse par photo :
Photo_1935_GroupeFamilial/
├── original.jpg (original non modifié)
├── enhanced.jpg (version améliorée)
├── colorized.jpg (version colorisée)
├── analyse_IA.txt (transcription analyse GPT-4)
└── hypotheses.md (vos déductions + sources)
Enjeux éthiques de la reconnaissance faciale
⚠️ Problème majeur : Les outils de reconnaissance faciale (FaceFirst, PimEyes) permettent d'identifier des personnes vivantes sans consentement.
Principes éthiques pour la généalogie :
- Consentement : Ne pas utiliser reconnaissance faciale sur photos de personnes vivantes sans autorisation
- Limitation temporelle : Réserver aux photos >70 ans (personnes décédées)
- Usage privé : Ne pas publier résultats d'identification par IA sans vérification humaine
- Transparence : Signaler l'usage d'IA dans publications généalogiques
✅ Bonne pratique : Utiliser la reconnaissance faciale pour clustering (regrouper photos d'une même personne) plutôt qu'identification publique.
2.3 Traduction de documents étrangers
Technologies utilisées
- NMT (Neural Machine Translation) : modèles Transformer pour traduction
- Modèles multilingues : mBERT, XLM-RoBERTa comprenant 100+ langues
- LLM avec spécialisation historique : GPT-4, Claude pour contexte ancien
Outils disponibles
| Outil | Langues modernes | Langues anciennes | Contexte historique |
|---|---|---|---|
| DeepL | ⭐⭐⭐⭐⭐ | ⭐⭐ | ⭐⭐ |
| Google Translate | ⭐⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐ |
| GPT-4 | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ |
| Claude 3.5 | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ |
📌 Exemple concret : Traduction d'acte en latin avec contexte XVIIe siècle
Document : Acte de baptême, registre paroissial latin, 1688
Texte original :
Anno Domini millesimo sexcentesimo octogesimo octavo, die decima
mensis maii, ego infrascriptus baptizavi infantem nomine Antonium,
filium legitimum Joannis Antonii Giraudi et Joannae conjugum...
Mauvaise approche : Google Translate direct
In the year of the Lord one thousand six hundred and eighty-eight,
on the tenth day of the month of May, I the undersigned baptized
an infant named Anthony, legitimate son of John Anthony Giraudi
and Joanna spouses...
→ Traduction littérale, perd les formules, pas d'adaptation française
Bonne approche : Claude avec contexte historique
Prompt optimisé :
<document type="acte_bapteme" langue="latin" epoque="XVIIe_siecle">
Anno Domini millesimo sexcentesimo octogesimo octavo, die decima
mensis maii, ego infrascriptus baptizavi infantem nomine Antonium,
filium legitimum Joannis Antonii Giraudi et Joannae conjugum,
huius parochiae incolarum. Patrini fuerunt...
</document>
Tu es un expert en paléographie et traduction de documents religieux
anciens. Traduis cet acte de baptême du latin en français moderne
en respectant :
1. Les formules canoniques de l'époque
2. L'adaptation des prénoms latins en français (Joannis → Jean,
Antonius → Antoine)
3. Les titres et qualités (incolarum → habitants de cette paroisse)
4. La structure typique d'un acte de baptême français
Fournis :
- Traduction complète
- Tableau prénoms latins → français
- Notes sur termes spécifiques ou ambigus
Réponse attendue :
TRADUCTION :
L'an du Seigneur mil six cent quatre-vingt-huit, le dixième jour du
mois de mai, moi soussigné ai baptisé un enfant nommé Antoine, fils
légitime de Jean Antoine Giraudi et de Jeanne son épouse, habitants
de cette paroisse. Les parrains furent...
CORRESPONDANCES PRÉNOMS :
| Latin | Français |
|-------|----------|
| Antonius | Antoine |
| Joannis Antonii | Jean Antoine |
| Joannae | Jeanne |
NOTES :
- "infrascriptus" : formule juridique = "soussigné" (le curé)
- "conjugum" : génitif pluriel de "conjux" = "époux/épouse"
- "incolarum" : habitants, résidents (implique domicile stable)
- "patrini" : parrains (institution importante, liens spirituels)
⚙️ Point technique : Les LLM modernes ont été entraînés sur des corpus incluant du latin classique et médiéval, leur permettant de comprendre les formules juridiques et religieuses standardisées.
Gestion des termes spécialisés et archaïsmes
Les documents anciens contiennent :
- Titres professionnels : "mesnager" (ménager = petit propriétaire agricole), "laboureur" (cultivateur), "maréchal" (maréchal-ferrant)
- Mesures anciennes : "arpent", "setier", "livre tournois"
- Formules juridiques : "de son vivant", "en son vivant", "defunct"
💡 Conseil pratique : Créez une base de connaissances terminologique dans votre Drive Google :
# Glossaire Généalogique - Ancien Français / Latin
## Professions
- laboureur → cultivateur (possède instruments aratoires)
- mesnager → ménager (petit exploitant agricole)
- manouvrier → journalier agricole (sans terre)
## Mesures
- arpent → ~0,5 hectare (variable selon région)
- setier → ~150-250L (mesure de grain, variable)
## Formules
- "de son vivant" → du vivant de (personne encore vivante)
- "defunct" / "deffunct" → décédé(e)
Ensuite, uploadez ce glossaire dans vos conversations Claude/GPT pour maintenir cohérence.
Workflow multi-langues (document en plusieurs langues)
Pour documents mélangeant français, latin, italien (fréquent frontière alpine) :
Prompt :
Ce document mélange français du XVIIIe, latin et dialecte piémontais.
Traduis en français moderne en :
1. Identifiant la langue de chaque segment [FR], [LAT], [ITA]
2. Traduisant chaque segment
3. Signalant les ambiguïtés dialectales
Segmentation attendue :
[FR] "Le sixième septembre..."
[LAT] "coram testibus..." (en présence de témoins)
[ITA/dialecte] "della villa di..." (du village de...)
⚠️ Limites actuelles :
- Dialectes régionaux : occitan, breton, alsacien ancien → faible performance
- Abréviations médiévales : "X̃ps" (Christus), "dñs" (dominus) → nécessite expertise
- Paléographie combinée : si texte manuscrit illisible + langue ancienne → double difficulté
2.4 Génération de récits biographiques
Technologies utilisées
- LLM avec prompting structuré : transformation données → narration
- Few-shot learning : fourniture d'exemples de style narratif
- Fine-tuning (avancé) : entraînement sur corpus biographique XIXe-XXe
Outils disponibles
| Outil | Créativité | Précision factuelle | Longueur max |
|---|---|---|---|
| GPT-4 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | 4 000 mots |
| Claude 3.5 Sonnet | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | 10 000+ mots |
| Gemini Advanced | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ | 8 000 mots |
| Gem personnalisé | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | Variable |
📌 Exemple concret : Transformer chronologie Geneanet en récit littéraire
Données sources : Fiche chronologique Antoine Augustin François Marie Giraudi (1817-1886)
CHRONOLOGIE BRUTE :
- 07/09/1817 : Naissance à La Turbie
- 1847-1858 : Gendarme du Royaume de Piémont-Sardaigne, Lantosque
- 1861 : Mariage avec Marguerite Scovazzo, Villars-sur-Var
- 1858-1864 : Gendarme armée Napoléon III, Nice
- 1864-1886 : Cabaretier, Nice
- 1864 : Naissance fils Auguste Alfred Paul, Lantosque
- 07/03/1886 : Décès Nice, 69 ans
Prompt optimisé pour récit biographique :
<donnees_genealogiques>
Nom : Antoine Augustin François Marie Giraudi (puis Giraudy)
Naissance : 7 septembre 1817, La Turbie, Comté de Nice (Royaume de Piémont-Sardaigne)
Profession 1 : Gendarme du Royaume de Piémont-Sardaigne (1847-1858), poste de Lantosque (vallée de la Vésubie)
Mariage : 1861, Marguerite Scovazzo, Villars-sur-Var
Profession 2 : Gendarme de l'armée de Napoléon III (1858-1864), Nice
Profession 3 : Cabaretier (1864-1886), Nice
Enfant : Auguste Alfred Paul Giraudy, né 1864 Lantosque
Décès : 7 mars 1886, Nice, 69 ans
CONTEXTE HISTORIQUE MAJEUR :
- 1860 : Rattachement du Comté de Nice à la France (Traité de Turin)
- Antoine change de nationalité : de sarde à français
- Passage service gendarmerie sarde → française
</donnees_genealogiques>
Tu es un biographe spécialisé en histoires familiales du XIXe siècle.
Rédige un récit biographique de 800-1200 mots sur Antoine Augustin
François Marie Giraudi en respectant :
IMPÉRATIFS DE PRÉCISION :
1. Aucune invention de faits (dates, lieux, événements)
2. Tous les éléments factuels proviennent des données fournies
3. Le contexte historique enrichit mais ne crée pas de fiction
STYLE NARRATIF :
1. Ton littéraire, engageant, style XIXe siècle léger
2. Contextualisation historique (Risorgimento, rattachement de Nice)
3. Descriptions sensorielles basées sur documentation historique vérifiable
(vallée Vésubie, Nice 1860)
4. Évocation des défis sans inventer : passage frontière sarde/française
STRUCTURE :
1. Ouverture : naissance à La Turbie, contexte famille
2. Carrière gendarmerie sarde (1847-1858) : vallée Vésubie, Lantosque
3. Tournant 1860 : annexion, changement nationalité, implications
4. Transition gendarmerie française (1858-1864)
5. Reconversion cabaretier (1864-1886) : pourquoi ? contexte Nice
6. Famille : mariage, fils
7. Clôture : décès 1886, héritage
EXIGENCES :
- Indiquer explicitement les passages contextuels historiques [contexte : ...]
- Formuler les hypothèses au conditionnel ("Antoine aurait pu...", "il est
probable que...")
- Citer sources quand mentionner événements historiques (Traité de Turin 1860)
Extrait de réponse attendue :
Antoine Augustin François Marie Giraudi vit le jour le 7 septembre 1817
à La Turbie, ce village perché sur les hauteurs dominant la Méditerranée,
alors territoire du Royaume de Piémont-Sardaigne. [contexte : La Turbie,
située sur la via Julia Augusta romaine, était au XIXe siècle un bourg
d'environ 800 habitants, vivant principalement de l'agriculture en terrasses
et du commerce avec Monaco et Nice].
En 1847, Antoine, alors âgé de trente ans, revêtit l'uniforme de gendarme
du royaume sarde et fut affecté à la brigade de Lantosque, dans la vallée
de la Vésubie. [contexte : La gendarmerie sarde, créée sur le modèle
français, constituait la principale force de maintien de l'ordre dans les
vallées reculées des Alpes-Maritimes. Lantosque, bourg de 1 200 habitants,
servait de poste avancé surveillant les routes vers le col de Turini].
Il est probable qu'Antoine patrouillait les chemins muletiers reliant les
hameaux isolés, veillait aux marchés locaux et intervenait lors des
conflits entre bergers pour les droits de pâturage — litiges fréquents
dans ces vallées où chaque arpent de terre comptait.
Le tournant de sa vie survint en 1860. Par le Traité de Turin signé
le 24 mars 1860, le Comté de Nice fut cédé à la France par le Royaume
de Piémont-Sardaigne en remerciement du soutien français lors de la
deuxième guerre d'indépendance italienne [source : Traité de Turin, 1860].
Du jour au lendemain, Antoine Giraudi, sujet sarde depuis sa naissance,
devint citoyen français.
Cette transition impliqua des choix déchirants pour les gendarmes sardes :
demeurer au service de l'administration française ou suivre leur royaume
au-delà des nouvelles frontières. Antoine choisit de rester et intégra
la gendarmerie de Napoléon III, servant à Nice de 1858 à 1864 [note :
la date 1858-1864 suggère qu'il anticipait peut-être le rattachement,
ou qu'il y eut une période de transition administrative]...
[... suite du récit sur reconversion cabaretier, vie familiale, décès]
⚙️ Point technique : L'usage de balises sémantiques [contexte : ...] permet de distinguer faits vérifiés (issus des données) et enrichissement historique (déductible mais non certifié pour cet individu spécifique).
Prompt engineering pour maintenir exactitude factuelle
Stratégies anti-hallucination :
-
Contraintes explicites : "Aucune invention de faits. Indiquer [hypothèse] pour toute déduction."
-
Fourniture de contexte exhaustif : Plus le prompt contient de données vérifiées, moins l'IA invente.
-
Few-shot prompting : Fournir 1-2 exemples de récits avec niveau de fidélité attendu :
EXEMPLE DE BON RÉCIT :
"Marie Dupont naquit en 1823 à Lyon. [contexte : Lyon comptait alors
150 000 habitants et était le centre de l'industrie de la soie]. Elle
épousa en 1845 Pierre Martin, tisseur. Il est probable qu'ils se
rencontrèrent dans les ateliers de la Croix-Rousse où travaillaient
des milliers de canuts [hypothèse basée sur profession et lieu]."
EXEMPLE DE MAUVAIS RÉCIT (trop inventif) :
"Marie Dupont, aux yeux noisette et à la chevelure châtaine, aimait
se promener sur les quais du Rhône où elle rencontra Pierre Martin
lors d'un bal populaire en juin 1844."
→ Problème : couleur yeux/cheveux, circonstances rencontre = pure invention
- Validation par étapes :
- Générer récit
- Demander à l'IA : "Liste tous les faits mentionnés et indique leur source (données fournies / contexte historique / déduction)"
- Vérifier cohérence
Utilisation des Gems (Gemini) et GPTs personnalisés
💡 Conseil pratique : Créer un Gem "Biographe Généalogique" avec instructions permanentes :
NOM DU GEM : Biographe Généalogique Précis
INSTRUCTIONS :
Tu es un biographe spécialisé en récits familiaux XIXe-XXe siècles.
Tes principes absolus :
1. Zéro invention factuelle (dates, lieux, événements personnels)
2. Contextualisation historique vérifiable uniquement
3. Distinction claire faits/hypothèses : [fait], [contexte], [hypothèse]
4. Style narratif XIXe léger mais moderne
5. Longueur : 800-1500 mots selon richesse données
WORKFLOW :
1. Analyser données généalogiques fournies
2. Identifier lacunes et périodes à contextualiser
3. Rédiger récit en 5 parties : naissance-famille, vie active, événements
majeurs, famille propre, décès-héritage
4. Conclure par : "Éléments à vérifier : [liste points incertains]"
EXEMPLE DE TON :
"Pierre Dubois naquit le 12 mars 1834 à Nantes, port atlantique alors
en pleine expansion commerciale [contexte]. Il épousa en 1860 Marie
Le Goff. Il est probable qu'il exerça le métier de tonnelier comme
son père, bien que nous n'ayons pas de confirmation documentaire
[hypothèse - à vérifier aux archives municipales]."
Une fois ce Gem créé, chaque nouvelle biographie se génère en fournissant simplement les données brutes.
⚠️ Limites actuelles :
- Tentation de la fiction : LLM créatifs (GPT-4) peuvent embellir malgré consignes
- Longueur vs détail : récits >2000 mots perdent en précision
- Événements dramatiques manquants : l'IA ne devine pas les non-dits (enfant décédé jeune, divorce)
2.5 Recherche sémantique dans les archives
Technologies utilisées
- Embeddings : transformation texte en vecteurs mathématiques
- Vector Databases : Pinecone, Weaviate, ChromaDB pour stockage/recherche vectorielle
- RAG (Retrieval Augmented Generation) : LLM + base de connaissances externe
Principe de fonctionnement
Recherche traditionnelle (mots-clés) :
- Requête : "cultivateur Lyon 1750"
- Résultats : documents contenant exactement "cultivateur" ET "Lyon" ET "1750"
- Manque : "laboureur Lyon 1748", "mesnager Lyonnais 1752"
Recherche sémantique (embeddings) :
- Requête : "cultivateur Lyon 1750" → transformée en vecteur [0.23, -0.45, 0.87, ...]
- Documents indexés aussi en vecteurs
- Recherche par proximité vectorielle (similarité cosinus)
- Résultats : tous documents sémantiquement proches, incluant synonymes, variantes temporelles
📌 Exemple : Requête "gendarme sarde vallée Vésubie XIXe siècle"
Résultats recherche sémantique :
- "carabinier royal Lantosque 1847" (terme équivalent, lieu proche)
- "forces de l'ordre Tende époque sarde" (concept proche, contexte géo-temporel)
- "brigade Nice annexion 1860" (événement lié, contexte historique)
→ Aucun document ne contient exactement les termes recherchés, mais tous sont pertinents.
Outils disponibles
| Outil | Approche | Prix | Facilité |
|---|---|---|---|
| Claude avec citations | RAG intégré sur documents uploadés | 20$/mois | ⭐⭐⭐⭐⭐ (facile) |
| Perplexity Pro | Recherche web + RAG | 20$/mois | ⭐⭐⭐⭐⭐ |
| NotebookLM (Google) | RAG sur documents uploadés | Gratuit | ⭐⭐⭐⭐ |
| Pinecone + LangChain | Solution custom | Variable | ⭐⭐ (technique) |
📌 Exemple concret : Recherche dans corpus de 500 actes d'état civil
Problématique : Vous avez numérisé et transcrit 500 actes (naissances, mariages, décès) d'une paroisse 1700-1800. Vous cherchez tous les cas de remariages de veuves avec beaux-frères (pratique courante pour préserver patrimoine).
Approche traditionnelle (Ctrl+F) :
- Rechercher "veuve" → 127 occurrences
- Lire manuellement chaque acte pour identifier remariage avec beau-frère
- Temps : 3-4 heures
Approche RAG avec Claude :
Étape 1 : Préparer le corpus
- Créer un projet Claude
- Uploader les 500 transcriptions (format .txt ou .pdf)
- Claude indexe automatiquement (création d'embeddings en arrière-plan)
Étape 2 : Requête sémantique
Prompt :
Analyse l'ensemble des actes de mariage de cette paroisse et identifie
tous les cas où :
1. L'épouse est veuve
2. L'époux partage le nom de famille du défunt mari (indice : beau-frère)
3. Les témoins mentionnent des liens familiaux
Pour chaque cas identifié, fournis :
- Références actes (dates, noms)
- Citation pertinente [avec citation]
- Lien familial déduit
Format :
| Date | Épouse (veuve de) | Époux | Lien probable | Acte |
Résultat :
J'ai identifié 7 cas de remariages probables entre veuves et beaux-frères :
| Date | Épouse | Époux | Lien | Référence |
|------|--------|-------|------|-----------|
| 03/1723 | Marie Dubois (veuve Pierre Martin) | Jean Martin | Beau-frère | Acte mariage p.47 |
| 11/1735 | Anne Durand (veuve Claude Moreau) | François Moreau | Beau-frère | Acte mariage p.89 |
[...]
Détails :
1. Marie Dubois × Jean Martin (1723) :
[Citation acte : "Marie Dubois, veuve de feu Pierre Martin, avec Jean Martin,
frère du défunt, tous deux de cette paroisse..."]
Lien confirmé explicitement dans l'acte.
2. Anne Durand × François Moreau (1735) :
[Citation acte : "Anne Durand, veuve de défunt Claude Moreau, contracte
mariage avec François Moreau, laboureur, témoins présents Jacques Moreau
et Pierre Moreau..."]
Lien probable : même patronyme, présence de 2 Moreau comme témoins
suggère famille proche.
[...]
Temps : 2-3 minutes.
⚙️ Point technique : Le RAG combine :
- Retrieval (récupération) : embeddings identifient documents pertinents
- Augmentation : contexte pertinent ajouté au prompt
- Generation : LLM synthétise réponse en citant sources
Avantages vs recherche traditionnelle
| Critère | Recherche mots-clés | Recherche sémantique (RAG) |
|---|---|---|
| Synonymes | ❌ Manque "laboureur" si cherche "cultivateur" | ✅ Trouve équivalents |
| Variantes orthographiques | ❌ "baptesme" ≠ "baptême" | ✅ Comprend variations |
| Contexte historique | ❌ Pas de compréhension | ✅ "gendarme sarde" = "carabinier royal" |
| Requêtes complexes | ❌ Nécessite opérateurs booléens | ✅ Langage naturel |
| Synthèse | ❌ Résultats bruts | ✅ Analyse + citations |
| Vitesse | ⭐⭐⭐⭐⭐ Instantané | ⭐⭐⭐⭐ Secondes |
| Coût | ✅ Gratuit (Ctrl+F) | ⚠️ API / abonnements |
💡 Conseil pratique : Pour corpus <100 documents, utilisez NotebookLM (gratuit) :
- Créer un notebook
- Uploader documents sources
- Poser questions en langage naturel
- Bonus : générer un podcast audio sur votre corpus !
Cas d'usage avancé : Analyse de réseau social dans archives
Prompt RAG :
Analyse ces 500 actes et identifie les individus apparaissant le plus
fréquemment comme témoins dans les mariages. Cela révèle les notables
ou personnes centrales du réseau social paroissial.
Fournis :
- Top 10 témoins (nom, nombre d'apparitions)
- Professions mentionnées
- Hypothèses sur leur rôle social (notable, notaire, famille influente ?)
→ Analyse de réseau social impossible manuellement sans des heures de dépouillement.
⚠️ Limites actuelles :
- Coût scaling : RAG efficace jusqu'à ~10 000 pages, au-delà coûts API significatifs
- Qualité transcription : embeddings pertinents seulement si texte correct
- Hallucinations : RAG réduit mais n'élimine pas (toujours vérifier citations)
- Confidentialité : données envoyées à APIs → problème si documents sensibles
✅ Bonne pratique : Pour documents sensibles, privilégier solutions on-premise (LM Studio + modèles open source) ou NotebookLM (Google, mais politique confidentialité plus claire).
2.6 Perspectives futures (2025-2030)
Agents IA autonomes pour recherches généalogiques
Au-delà des assistants conversationnels, les agents IA pourront mener des recherches autonomes multi-étapes.
Exemple de workflow d'agent (2027 ?) :
Utilisateur : "Trouve le lieu de naissance exact de mon ancêtre Jean Martin,
né vers 1823 dans le Var"
Agent IA :
1. Recherche dans Geneanet → 5 Jean Martin nés 1820-1826 dans le Var
2. Croise avec archives départementales en ligne → 3 actes de naissance
3. Analyse contexte familial utilisateur → élimine 2 homonymes
4. Identifie acte probable : Jean Martin, 12/03/1823, Draguignan
5. Vérifie cohérence avec actes ultérieurs (mariage, décès)
6. Propose fiche complète + scan original acte + suggestions recherches connexes
Technologies nécessaires : LLM + navigation web + APIs archives + raisonnement multi-étapes
Maturité : 2026-2027 (AutoGPT, BabyAGI déjà expérimentaux)
Génération de vidéos historiques
Les modèles texte-vers-vidéo (Sora d'OpenAI, Runway, Pika) permettront :
📌 Exemple :
Prompt : "Génère une vidéo de 30 secondes montrant une rue de La Turbie
en 1817, style XIXe siècle, personnages en costumes d'époque, architecture
provençale alpine, ambiance paisible de village"
Applications généalogiques :
- Visualisation de lieux de vie des ancêtres (reconstitutions)
- Animations de photos familiales (MyHeritage Deep Nostalgia++)
- Films biographiques automatisés
⚠️ Enjeu éthique majeur : Risque de confusion réalité/fiction. Une vidéo générée par IA d'un ancêtre doit être clairement signalée comme reconstitution.
IA multimodale (texte + image + audio + vidéo simultanés)
GPT-4 et Gemini sont déjà multimodaux (texte + images). L'avenir : compréhension simultanée de tous médias.
📌 Exemple 2028 :
Upload : photo famille + acte mariage + enregistrement audio témoignage oral
Prompt : "Crée une chronologie familiale interactive combinant ces 3 sources"
Output : Timeline web avec :
- Photos géolocalisées et datées automatiquement
- Actes transcrits et liés aux personnes
- Clips audio synchronisés aux événements mentionnés
- Carte interactive des lieux de vie
Généalogie prédictive et découverte automatique de liens
Les IA pourront suggérer des liens généalogiques probables en analysant :
- Patronymes régionaux + contexte géographique
- Clusters de témoins dans les actes
- Professions transmises (familles de notaires, meuniers, etc.)
- Tests ADN + arbres généalogiques
📌 Exemple :
MyHeritage AI (2026) : "Nous avons détecté une probabilité de 87% que
votre ancêtre Marie Dubois (1823-1891) soit cousine de Pierre Dubois
présent dans l'arbre de Jean D. (correspondance ADN + 3 témoins communs
dans actes de mariage 1845-1850). Souhaitez-vous explorer cette piste ?"
Préservation numérique et restauration avancée
L'IA permettra :
- Super-résolution extrême : transformer photo 200px en 4000px haute qualité
- Reconstruction 3D : à partir de photos 2D, modèles 3D de lieux/personnes
- Restauration prédictive : combler parties manquantes de documents déchirés
⚙️ Point technique : Les modèles de diffusion (Stable Diffusion, DALL-E 3) permettent déjà de "deviner" intelligemment les pixels manquants en comprenant le contexte.
💡 Conseil prospectif : Commencez dès maintenant à numériser et structurer vos données (GEDCOM, transcriptions, métadonnées photos). L'IA future sera d'autant plus puissante que vos données seront propres et organisées.
PARTIE 3 - ENJEUX ÉTHIQUES ET LIMITES (20%)
3.1 Limites techniques actuelles
Hallucinations des LLM : le risque majeur pour la généalogie
Les LLM peuvent inventer des faits plausibles mais faux, phénomène appelé "hallucination".
📌 Exemple réel :
Prompt : "Qui était Pierre Dubois, maire de Lyon en 1847 ?"
GPT-3.5 : "Pierre Dubois fut maire de Lyon de 1845 à 1849, succédant
à Jean Martin. Il supervisa la modernisation des quais du Rhône."
RÉALITÉ : Aucun Pierre Dubois n'a été maire de Lyon en 1847.
Le modèle a inventé ce fait en combinant des noms fréquents et un
contexte historique plausible.
Pourquoi ? Les LLM sont des prédicteurs de texte probable, pas des bases de données factuelles. Ils génèrent ce qui "sonne vrai" statistiquement.
⚠️ Risques généalogiques :
- Invention de dates/lieux de naissance
- Création de liens familiaux inexistants
- Attribution de professions non documentées
- Génération d'anecdotes historiques fictives
✅ Protections :
- Toujours vérifier : confronter sorties IA avec sources primaires
- Prompts contraints : "Réponds uniquement en citant [document fourni]"
- RAG over pure generation : privilégier Claude/NotebookLM avec docs uploadés
- Fact-checking croisé : demander à 2 LLM différents, comparer
Biais dans les données d'entraînement
Les LLM sont entraînés sur le web, qui surreprésente :
- Cultures occidentales (anglais, français, espagnol)
- Histoire européenne et nord-américaine
- Périodes récentes (XIXe-XXIe siècles)
Conséquences :
- Faible performance : langues africaines, asiatiques rares, dialectes
- Contexte manquant : histoire coloniale non-européenne peu couverte
- Stéréotypes : sur professions, rôles de genre au XIXe siècle
📌 Exemple : Recherche généalogique en wolof (Sénégal) ou en quechua (Pérou) → performances très limitées.
💡 Conseil : Pour généalogies non-européennes, privilégier :
- LLM multilingues spécialisés (mT5, BLOOM)
- Services locaux (traducteurs humains, associations culturelles)
- Fine-tuning de modèles open source sur corpus spécifiques
Qualité variable selon langue et époque
Performance par période (ordre décroissant) :
- ⭐⭐⭐⭐⭐ XXe-XXIe siècles : excellente (documents abondants)
- ⭐⭐⭐⭐ XIXe siècle : très bonne (révolution industrielle = archives++)
- ⭐⭐⭐ XVIIIe siècle : bonne (registres paroissiaux systématiques)
- ⭐⭐ XVIIe siècle : moyenne (orthographe instable, lacunes)
- ⭐ Avant XVIe : faible (latin médiéval, peu de corpus numérisés)
Coût computationnel et impact environnemental
⚠️ Réalité peu connue : Entraîner GPT-3 a consommé l'équivalent de 552 tonnes de CO₂ (= 120 voitures pendant 1 an). Chaque requête complexe = ~0,001 kWh.
Pour le généalogiste :
- 1000 requêtes ChatGPT ≈ 1 kWh ≈ 0,15€ électricité + 0,5 kg CO₂
- Restauration 100 photos IA (Remini) ≈ 5 kWh
💡 Bonnes pratiques éco-responsables :
- Regrouper les requêtes (analyser 10 actes simultanément vs 10 fois 1 acte)
- Privilégier SLM locaux (Mistral 7B sur PC) pour tâches simples
- Limiter régénérations : affiner prompts plutôt que relancer
- Préférer recherche sémantique (1 requête) à génération (10 itérations)
3.2 Enjeux éthiques spécifiques
Véracité vs créativité : où placer le curseur ?
Tension fondamentale : LLM créatifs (GPT-4) produisent récits engageants mais risque d'invention. LLM factuels (Claude) sont précis mais parfois secs.
Spectre éthique :
|-----|-----|-----|-----|-----|
Fiction Romancé Contextualisé Factuel strict Données brutes
pure (flou) (standard) (idéal) (sec)
← Zone INTERDITE en généalogie → | ← Zone ACCEPTABLE → |
Zone acceptable :
- ✅ Contextualisé : "Marie Dupont vivait à Lyon, alors centre de l'industrie de la soie [contexte historique vérifiable]"
- ✅ Hypothèses signalées : "Il est probable que Pierre exerçait le métier de tonnelier comme son père [hypothèse - acte professionnel non retrouvé]"
Zone interdite :
- ❌ Romancé : "Marie, aux yeux noisette, aimait se promener sur les quais..." (invention pure)
- ❌ Fiction : Dialogues inventés, pensées attribuées
✅ Principe directeur : Transparency by default. Signaler systématiquement :
[contexte historique]pour faits généraux vérifiables[hypothèse - à vérifier]pour déductions logiques[source : XYZ]pour citations- ❌ Ne jamais présenter une invention comme un fait
Vie privée : données généalogiques sensibles
Les données généalogiques révèlent :
- Filiations (enfants hors mariage, adoptions)
- Santé (maladies héréditaires, décès d'enfants)
- Origines ethniques/géographiques
- Propriété (héritages, biens)
⚠️ Risques :
- Upload vers APIs : ChatGPT, Claude stockent temporairement vos documents
- Entraînement futurs modèles : clause parfois floue (données peuvent servir à améliorer modèles)
- Fuites de données : hacks, erreurs de sécurité
✅ Protections :
- Anonymisation : remplacer noms/lieux par codes avant upload ("Famille A", "Ville X")
- Délai de divulgation : ne publier en ligne que personnes décédées depuis >50 ans
- Solutions locales : LM Studio + Mistral 7B pour analyse hors ligne
- Claude Projects : données isolées par projet, suppression possible
💡 Conseil : Pour documents très sensibles (adoptions, scandales familiaux), privilégier outils locaux sans connexion internet.
Dépendance technologique : perte de compétences traditionnelles ?
Paradoxe : L'IA rend la généalogie accessible (OCR automatique, traductions), mais crée risque de dé-skilling.
📌 Exemple : Un généalogiste formé uniquement sur Transkribus ne saura plus lire manuellement un manuscrit du XVIIIe siècle si l'outil devient payant ou discontinué.
Risques à long terme :
- Perte de maîtrise paléographique
- Dépendance aux traducteurs IA (atrophie apprentissage langues)
- Désapprentissage de la contextualisation historique (délégation à l'IA)
✅ Équilibre recommandé :
- Formation hybride : apprendre bases paléographie + utiliser IA pour accélération
- Vérification systématique : ne jamais accepter sortie IA sans relecture critique
- Apprentissage continu : cours sur langues anciennes, archivistique même avec IA
💡 Analogie : Les calculatrices n'ont pas rendu les maths obsolètes, elles ont déplacé l'effort vers problèmes complexes. L'IA doit être un accélérateur, pas un substitut.
Accès inégal : fracture numérique
Réalité : Les meilleurs outils IA sont payants ou nécessitent infrastructure technique.
| Outil | Coût annuel | Compétences requises |
|---|---|---|
| ChatGPT Free | 0€ | ⭐ Basiques |
| ChatGPT Plus | 240€ | ⭐ Basiques |
| Claude Pro | 240€ | ⭐ Basiques |
| Transkribus | 120€ (usage modéré) | ⭐⭐ Moyennes |
| RAG custom (Pinecone+API) | 500-1000€ | ⭐⭐⭐⭐ Avancées |
Conséquences :
- Généalogistes aisés : accès à OCR professionnel, colorisation, agents IA
- Généalogistes précaires : limités à outils gratuits basiques
⚠️ Problème aggravé : Les versions gratuites ont souvent :
- Limites quotidiennes (ChatGPT : 40 messages/3h)
- Moins de fonctionnalités (pas d'analyse documents)
- Files d'attente (accès ralenti)
✅ Solutions inclusives :
- Bibliothèques/Archives : équiper lieux publics avec abonnements pro
- Associations généalogiques : mutualis er abonnements (1 compte Transkribus partagé)
- Open source : promouvoir alternatives gratuites (NotebookLM, Mistral local)
- Formations gratuites : comme UGAIA, démocratiser la connaissance
Transparence : obligation de signaler l'usage IA
Principe émergent : Comme les photos retouchées, les contenus assistés par IA doivent être signalés.
✅ Bonnes pratiques de publication :
Dans publications généalogiques :
* Transcription assistée par Transkribus (vérifiée manuellement)
* Traduction latin → français par Claude 3.5 (révisée par latiniste)
* Photo restaurée par MyHeritage AI (original conservé en archive)
* Récit biographique co-écrit avec GPT-4 (faits vérifiés sources primaires)
Sur sites/blogs :
<footer>
Ce récit familial a été élaboré avec l'assistance de Claude (Anthropic)
pour la contextualisation historique. Tous les faits (dates, lieux,
filiations) proviennent d'actes d'état civil et ont été vérifiés.
Les descriptions d'ambiance sont déduites de sources secondaires
(ouvrages historiques sur la région).
</footer>
Pourquoi c'est important :
- Crédibilité : lecteurs évaluent fiabilité différemment selon méthode
- Reproductibilité : futurs généalogistes sauront comment vérifier
- Éthique scientifique : standard académique (comme citer sources)
3.3 Bonnes pratiques recommandées
1. Toujours vérifier les informations générées par l'IA
⚠️ Règle d'or : L'IA est un assistant, jamais une source primaire.
Workflow de vérification :
Sortie IA → Confrontation source primaire → Validation → Intégration arbre
↓ ↓ ↓ ↓
Hypothèse Acte d'état civil Confirmé Geneanet
Archives en ligne ou
Témoignage familial Infirmé → Correction
💡 Conseil : Créer un fichier de validation pour chaque recherche IA :
## Recherche : Lieu naissance Jean Martin
### Hypothèse IA (Claude, 12/11/2024)
"Jean Martin né vers 1823 à Draguignan selon contexte familial"
### Vérification
- ✅ Consulté : AD Var, registres Draguignan 1820-1826
- ✅ Trouvé : Acte naissance 12/03/1823, Jean Martin fils Pierre Martin
- ✅ Cohérence : Pierre Martin (père) déjà identifié dans arbre
- ❌ Erreur IA : prénommé "Jean Pierre" et non "Jean" (correction effectuée)
### Statut : VALIDÉ avec correction
2. Documenter l'usage des outils IA
Dans fichiers GEDCOM, utiliser champ NOTE :
1 INDI
2 NAME Antoine /GIRAUDI/
2 BIRT
3 DATE 7 SEP 1817
3 PLAC La Turbie
3 NOTE Acte transcrit avec Transkribus HTR + validation manuelle (12/2024)
2 OCCU Gendarme
3 NOTE Profession déduite contexte historique + acte mariage 1861
[Analyse assistée Claude 3.5, vérifiée Archives Nice]
3. Privilégier outils respectueux de la vie privée
Comparatif politiques confidentialité :
| Outil | Données stockées | Entraînement futurs modèles | Suppression possible |
|---|---|---|---|
| ChatGPT | 30 jours puis supprimées | Opt-out possible | ✅ Oui |
| Claude | Conversations sauvegardées | Non (sauf opt-in) | ✅ Oui (par projet) |
| Gemini | Sauvegarde Google | Utilisé anonymisé | ✅ Oui |
| NotebookLM | Stockage Google | Non précisé | ⚠️ Flou |
| Mistral local | 100% local | N/A | ✅ Total |
💡 Conseil : Pour documents familiaux sensibles (testaments, reconnaissances), utiliser Mistral 7B en local via LM Studio (gratuit, 0 transfert données).
4. Former continuellement aux nouvelles technologies
L'IA évolue très vite (nouveaux modèles tous les 3-6 mois). Une formation datant de 2023 est déjà partiellement obsolète en 2025.
Plan de veille recommandé :
- Mensuel : Newsletter UGAIA, blog Anthropic/OpenAI (annonces majeures)
- Trimestriel : Webinaire UGAIA ou équivalent (nouvelles techniques)
- Annuel : Formation complète (ex : IA·G 2026) pour révision globale
💡 Astuce : Utiliser Claude/ChatGPT pour se former :
Prompt : "Quelles sont les 5 principales évolutions en IA généalogique
entre octobre 2024 et janvier 2025 ? Fournis sources pour chaque."
5. Maintenir un esprit critique
⚠️ Biais de confirmation : Tendance à accepter sorties IA quand elles confirment nos hypothèses.
Exercice de vigilance :
Avant d'accepter un résultat IA, poser 3 questions :
1. "Quelle est ma source primaire pour ce fait ?"
→ Si aucune, c'est une hypothèse, pas un fait.
2. "L'IA pourrait-elle halluciner ce détail ?"
→ Si oui, vérifier obligatoirement.
3. "Suis-je en train d'accepter cela parce que ça confirme mon arbre existant ?"
→ Si oui, doubler la vigilance (biais de confirmation).
💡 Test de fiabilité : Demander à l'IA la même question reformulée 2-3 fois. Si réponses divergentes → hallucination probable.
PARTIE 4 - DÉMONSTRATIONS PRATIQUES (suggestions)
Pour un webinaire de 60 minutes, voici 5 démonstrations concrètes et percutantes :
Démo 1 : OCR manuscrit ancien (8 min)
Matériel :
- Acte de mariage manuscrit XVIIIe siècle (scan)
- Compte Transkribus (ou Claude Pro)
Étapes live :
- Upload document dans Transkribus
- Lancer reconnaissance → montrer résultat brut (avec erreurs)
- Copier transcription brute dans Claude
- Prompt de correction contextuelle
- Montrer amélioration (avant/après)
- Souligner erreurs résiduelles (à vérifier humainement)
Message clé : L'IA accélère (5 min vs 30 min manuel) mais nécessite validation humaine.
Démo 2 : Recherche sémantique dans corpus (7 min)
Matériel :
- 50 actes transcrits uploadés dans NotebookLM (préparé avant)
Étapes live :
- Montrer recherche mot-clé traditionnelle (Ctrl+F) : résultats limités
- Requête sémantique NotebookLM : "Trouve tous les remariages de veuves"
- Montrer résultats avec citations automatiques
- Poser question complexe : "Quelles professions sont surreprésentées chez les témoins de mariage ?"
- Analyser réponse synthétique
Message clé : La recherche sémantique révèle des patterns invisibles autrement.
Démo 3 : Génération récit biographique (10 min)
Matériel :
- Fiche chronologique Geneanet (Antoine Giraudi 1817-1886)
- Gem Gemini "Biographe Généalogique" (pré-configuré)
Étapes live :
- Montrer fiche brute (dates, lieux, professions sèches)
- Copier dans Gem avec prompt structuré
- Générer récit (~1000 mots)
- Analyser ensemble : repérer contexte historique ajouté
- Identifier 1-2 passages à risque (trop créatifs)
- Corriger en direct avec prompt affiné
Message clé : L'IA transforme données en narration, mais nécessite contrôle créatif.
Démo 4 : Traduction document multilingue (6 min)
Matériel :
- Acte bilingue français/latin (zone frontalière)
- Claude ou GPT-4
Étapes live :
- Montrer document original (mélange langues)
- Google Translate direct : montrer confusion
- Claude avec prompt "expert paléographie" : montrer segmentation intelligente
- Afficher traduction annotée (identifie chaque langue, explique termes)
- Comparer qualité
Message clé : LLM contextualise là où traducteurs automatiques basiques échouent.
Démo 5 : Restauration photo + analyse (8 min)
Matériel :
- Photo famille noir & blanc floue, non datée
- Remini (restauration) + GPT-4 Vision (analyse)
Étapes live :
- Montrer photo originale floue
- Remini : amélioration qualité (super-résolution)
- Upload dans GPT-4 Vision avec prompt datation
- Lire analyse : vêtements, coiffures, contexte
- Montrer estimation période + degré confiance
- Twist : révéler date réelle (si connue) pour montrer précision ou erreur
Message clé : L'IA date par indices visuels, mais c'est une hypothèse à croiser avec sources.
CONCLUSION
Synthèse en 3 points :
-
Révolution technologique : De 2000 à 2026, l'IA est passée de l'OCR basique à des systèmes multimodaux capables de lire, traduire, contextualiser et narrer l'histoire familiale. Les technologies clés (Deep Learning, Transformers, LLM, RAG) sont désormais accessibles via des interfaces gratuites ou abordables.
-
Applications transformatives : L'IA démultiplie les capacités du généalogiste dans 5 domaines critiques : transcription manuscrits anciens, analyse de photos, traduction multilingue, génération de récits et recherche sémantique. Ces outils réduisent de heures à minutes des tâches auparavant laborieuses, démocratisant la recherche généalogique avancée.
-
Responsabilité éthique : Cette puissance s'accompagne de risques (hallucinations, biais, atteintes vie privée) qui exigent vigilance constante. Le généalogiste de 2025 doit maîtriser non seulement les outils IA, mais aussi les principes de vérification, documentation et transparence pour maintenir l'intégrité scientifique de ses recherches.
Points de vigilance essentiels :
⚠️ Jamais de confiance aveugle : L'IA hallucine. Chaque fait généalogique généré doit être confronté à une source primaire (acte d'état civil, recensement, testament).
⚠️ Transparence obligatoire : Signaler systématiquement l'usage d'IA dans vos publications. Le lecteur doit savoir ce qui provient de sources vs. ce qui a été enrichi par algorithme.
⚠️ Vie privée non négociable : Ne jamais uploader de documents concernant personnes vivantes ou données sensibles vers APIs commerciales sans anonymisation préalable.
⚠️ Formation continue : L'IA évolue mensuellement. Une compétence acquise en 2024 sera partiellement obsolète en 2026. Planifier une veille technologique régulière.
⚠️ Équilibre compétences : Maintenir capacités traditionnelles (paléographie, latin, archivistique) en parallèle de l'usage IA. L'autonomie intellectuelle protège contre la dépendance technologique.
L'avenir de la généalogie assistée par IA :
D'ici 2030, la généalogie sera profondément hybridée : agents IA autonomes mèneront des recherches multi-sources en quelques minutes, vidéos immersives recréeront les lieux de vie des ancêtres, et l'analyse génétique couplée à l'IA prédictive suggérera automatiquement des liens familiaux probables. Cette évolution promet de rendre accessible au plus grand nombre une recherche aujourd'hui réservée aux initiés.
Mais cette démocratisation ne doit pas se faire au prix de la rigueur scientifique. Le généalogiste reste le gardien de la véracité : l'IA est un scribe prodigieux, un traducteur polyglotte, un archiviste infatigable, mais c'est l'humain qui valide, contextualise et transmet avec intégrité l'histoire de ses ancêtres.
✅ Appel à l'action : Expérimentez dès aujourd'hui avec les outils gratuits (ChatGPT, NotebookLM, Transkribus version limitée), documentez vos usages, partagez vos découvertes avec la communauté UGAIA, et contribuez à l'élaboration collective de bonnes pratiques éthiques pour la généalogie de demain.
Ressources complémentaires :
- UGAIA Blog : https://uga-ia.blogspot.com
- Guide G·IA gratuit (PDF) : https://fr.slideshare.net/slideshow/guide-g-ia
- Formations continues : https://www.ugaia.eu
- Communauté Discord UGAIA : [lien si existant]
Document préparé pour webinaire UGAIA "L'ère moderne de l'IA pour le généalogiste" - Version 1.0 (Décembre 2024)
Aucun commentaire:
Enregistrer un commentaire
Merci, thanks, wait for aprobation by the administrator
Remarque : Seul un membre de ce blog est autorisé à enregistrer un commentaire.