GEO : comment être cité par ChatGPT et Perplexity en 2026 : la méthode qu’on applique sur nos clients (avec checklist 30 actions)

Le GEO (Generative Engine Optimization), c’est l’ensemble des pratiques qui permettent à ton site d’être cité par les LLM comme ChatGPT, Perplexity, Gemini ou Claude. En 2024, environ 54% des requêtes Google ne généraient déjà plus aucun clic vers un site externe. ChatGPT compte 300 millions d’utilisateurs actifs par semaine, Perplexity dépasse les 100 millions de requêtes par mois. La couche des réponses a été capturée par les IA. Et la question n’est plus « suis-je bien classé? » mais « les IA me connaissent-elles, me comprennent-elles, et me citent-elles? »

Dans cet article, je te dévoile la méthode exacte qu’on applique chez EMdigital sur nos clients, avec une checklist de 30 actions classées en 3 sprints de 30 jours. Pas de théorie. Du concret, des chiffres, et des frameworks qui marchent.

Qu’est-ce que le GEO en 2026 : définition et enjeux

Le GEO, ou Generative Engine Optimization, est la discipline qui consiste à optimiser ta présence dans les réponses générées par les LLM. Contrairement au SEO qui optimise pour des pages de résultats Google, le GEO vise la citation directe par des IA conversationnelles comme ChatGPT, Perplexity, Gemini, Claude ou Mistral.

Attention : le GEO ne remplace pas le SEO. Il s’y superpose. Les deux partagent des leviers communs (autorité, contenu de qualité, données structurées), mais leur logique diffère fondamentalement. Google classe des pages. Les LLM citent des entités.

Les volumes parlent d’eux-mêmes : 300 millions d’utilisateurs actifs par semaine sur ChatGPT, 100 millions de requêtes mensuelles sur Perplexity. Adobe a même lancé un produit commercial, l’Adobe LLM Optimizer, pour tracker les citations de marque dans les LLM. Le marché se standardise, et la fenêtre d’early mover se referme.

Comment les LLM choisissent leurs sources : le pipeline RAG expliqué simplement

Pour comprendre comment être cité, il faut d’abord comprendre le pipeline RAG (Retrieval Augmented Generation) que les systèmes comme Perplexity ou ChatGPT avec browsing utilisent en temps réel. Voici les 8 étapes, de ta page web à la réponse IA.

  1. Ingestion et crawl : le système récupère le contenu brut de ta page via des crawlers comme GPTBot, PerplexityBot ou ClaudeBot. Si ton robots.txt les bloque ou que ton contenu est rendu en JavaScript pur, tu es invisible.
  2. Segmentation (chunking) : le document est découpé en segments de 200 à 800 tokens. Un contenu mal structuré produit des chunks incohérents. Le premier chunk est le plus critique.
  3. Vectorisation sémantique : chaque chunk est transformé en vecteur numérique (embedding). La clarté sémantique détermine la qualité de cet embedding.
  4. Indexation vectorielle : les embeddings sont stockés dans une base vectorielle avec leurs métadonnées (URL, titre, date, auteur).
  5. Retrieval (récupération) : la requête de l’utilisateur est vectorisée, et le système cherche les chunks les plus proches par similarité cosinus. Si ton embedding est loin de la requête, tu n’es jamais récupéré.
  6. Reranking : les chunks récupérés sont renotés par un modèle de cross-encoder. L’autorité de la source et la fraîcheur interviennent ici. Seuls les 3 à 5 meilleurs chunks passent à la génération.
  7. Génération de réponse : le LLM reçoit les chunks sélectionnés comme contexte et génère une réponse. Un chunk qui contient une réponse directe est plus utilisé qu’un chunk narratif.
  8. Sélection des citations : le système décide quelles sources citer. La source était-elle dominante dans le contexte ? Est-elle reconnue ? C’est l’étape finale de toute stratégie GEO.

Ce pipeline a une implication directe : si ton introduction fait 300 mots de blabla générique, le premier chunk est embedé comme « contenu vague » et ne sera jamais récupéré. La réponse directe dans les 100 premiers mots fait grimper la probabilité de citation de 47% selon certains benchmarks.

Les 7 signaux que les IA analysent vraiment pour décider de te citer

Certains professionels ont formalisé le Score de Citabilité AEO (SCA), un modèle de scoring sur 100 points avec 7 variables pondérées. Voici comment les LLM évaluent ta probabilité d’être cité.

Variable Poids Ce que ça mesure Délai d’amélioration
V1 – Autorité d’entité (EA) 22% Reconnaissance dans presse, Wikipedia, Wikidata, Knowledge Panel Google 6-12 mois
V2 – Clarté sémantique (CS) 18% Cohérence terminologique, qualité des embeddings, définitions explicites 4-8 semaines
V3 – Densité informationnelle (DI) 16% Ratio information unique / volume textuel, pénalise le padding 4-8 semaines
V4 – Structure extractible (SE) 16% Réponses directes en tête, titres-questions, FAQ schema.org, tableaux 4-8 semaines
V5 – Traçabilité factuelle (TF) 14% Données sourcées, chiffres vérifiables, données originales = coefficient multiplicateur 4-8 semaines
V6 – Reconnaissance externe (RE) 10% Mentions Reddit, Quora, forums, citations dans d’autres contenus 6-12 mois
V7 – Fraîcheur informationnelle (FI) 4% Date de mise à jour, données récentes, modificateur multiplicatif ±5 à 15% Continue

Lecture du score : moins de 40 = non citable, 40-65 = potentiellement citable, 65-80 = bien citable, plus de 80 = source de référence. Les leviers rapides sont SE et DI (4-8 semaines). Les leviers longs sont EA et RE (6-12 mois). Priorise toujours les variables avec note basse ET poids élevé.

Les benchmarks sur 200+ requêtes testées confirment : une étude avec données originales atteint 88% de citation, un article au format RAFT 73%, un article de blog standard avec intro générique seulement 35%.

Sprint 1 – Fondations techniques (J1 à J30)

Le premier sprint pose les bases techniques. Sans ces fondations, aucun contenu, aussi bon soit-il, ne sera récupéré par les LLM. Voici les actions à mener dès aujourd’hui.

  1. Audite ta présence actuelle dans les LLM : fais le test d’entité ChatGPT. Demande-lui « Qu’est-ce que tu sais sur [ta marque/ton nom] ? » Si la réponse est précise, ton entité est forte. Si elle est vague ou inventée, tu dois construire ta présence.
  2. Ouvre ton robots.txt aux crawlers IA : autorise explicitement GPTBot, PerplexityBot, ClaudeBot et OAI-SearchBot. C’est l’erreur technique la plus fréquente et la plus critique.
  3. Crée le fichier /llms.txt (on y revient juste après).
  4. Implémente schema.org Organization + Person avec des liens sameAs vers Wikidata, LinkedIn et autres profils vérifiés.
  5. Calcule ton SCA de base en notant chaque variable sur 100 pour avoir une baseline.
  6. Ajoute FAQPage schema.org sur tes pages clés (nous y reviendrons).

Le fichier llms.txt : pourquoi c’est le premier levier à activer

Le fichier /llms.txt, c’est comme le robots.txt pour Google, mais pour les LLM. Standardisé par llmstxt.org, il permet aux crawlers IA de comprendre instantanément qui tu es, ce que tu fais, et quels sont tes contenus de référence.

Voici un template complet à copier-coller sur ton site, placé à la racine (https://tonsite.fr/llms.txt) :

# Fichier llms.txt - [NOM]
# Résumé de l'entité pour systèmes LLM

## Identité
[NOM] est [description]. Positionnement : "[THÈSE DISTINCTIVE]"

## Expertise principale
- [Domaine 1]
- [Domaine 2]

## Publications de référence
/[url-article-cle] : [description courte]

## Auteur principal
[Nom] — [titre/rôle]

Ce fichier accélère considérablement l’indexation de ton contenu par les LLM. Les crawlers IA lisent ce fichier en priorité pour comprendre la structure de ton site et la hiérarchie de tes contenus.

Les données structurées schema.org prioritaires pour le GEO

Les données structurées schema.org sont un levier technique direct pour le GEO, confirmé par différents travaux. Voici les propriétés à implémenter en priorité, en format JSON-LD.

  • sameAs + Wikidata : ancre l’entité dans le graphe de connaissance. Le LLM sait exactement de qui ou quoi tu parles, sans ambiguïté.
  • about : déclare le sujet principal de la page. Améliore la récupération thématique dans le pipeline RAG.
  • speakable : marque les passages extractibles via sélecteurs CSS. Les LLM peuvent potentiellement exploiter ces passages dans leurs réponses.
  • mentions : connecte ta page à d’autres entités (personnes, marques, concepts). Enrichit le graphe de connaissance.
  • FAQPage : +38% de citation selon Apollo Lab. Les questions-réponses structurées sont directement extraites par les systèmes RAG.

Exemple JSON-LD pour une entité organisation :

{
  "@context": "https://schema.org",
  "@type": "Organization",
  "name": "Ton Site",
  "sameAs": "https://www.wikidata.org/wiki/Q..."
}

Construire une entité auteur solide : signe chaque article avec un bloc Person lié à ses profils (LinkedIn, Twitter, Wikidata). Le LLM associe alors l’auteur à son domaine d’expertise et le cite plus volontiers.

Sprint 2 – Contenu et structure extractible (J31 à J60)

Une fois les fondations techniques en place, il faut attaquer le contenu. Les LLM ne citent pas des pages, ils citent des chunks d’information. Chaque section doit être utile isolément.

  1. Applique le modèle RAFT à chaque section de tes articles. On détaille juste après.
  2. Réponds dans les 100 premiers mots : +47% de citation. Pas d’intro générique.
  3. Structure tes H2/H3 comme des questions conversationnelles : « Comment X? » « Pourquoi Y? » au lieu de « 3.2 – Considérations techniques ».
  4. Ajoute des données originales : +61% de citation. Lance une mini-étude, un sondage client, une analyse de données.
  5. Maximise la densité informationnelle : chaque phrase doit apporter une information nouvelle. Si tu peux la supprimer sans perdre de sens, supprime-la.
  6. Nomme un framework maison : les IA retiennent les méthodes nommées. RAFT, SCA, ta propre méthode.

Le modèle RAFT pas à pas : comment structurer chaque section pour la citation IA

Le modèle RAFT est la structure de base pour maximiser la probabilité de citation par les LLM. Chaque section de ton article doit suivre ce pattern.

  • R – Réponse directe (0-100 mots) : répond immédiatement à la question de la section. Les systèmes RAG extraient souvent le premier paragraphe. Si la réponse est enterrée, elle ne sera pas citée.
  • A – Argument développé (100-400 mots) : explique le pourquoi et le comment. Les IA qui synthétisent cherchent le raisonnement derrière la réponse.
  • F – Faits et données sourcés : statistiques, études, chiffres vérifiables. Les LLM calibrés RLHF favorisent les contenus vérifiables. Une donnée originale bat tout le reste.
  • T – Transfert actionnable (50-100 mots) : conclusion pratique avec « donc, concrètement… ». Facilite l’extraction d’une recommandation par l’IA.

Exemple avant/après. Avant : « Le GEO est une discipline importante pour les entreprises qui souhaitent être visibles dans les réponses des IA. Il convient de comprendre les mécanismes… » Après (modèle RAFT) : « Le GEO est l’optimisation de ta présence dans les réponses des LLM. +47% de citation si tu réponds dans les 100 premiers mots. Voici comment l’appliquer en 3 sprints. »

Pourquoi tu dois créer des données originales : l’étude de cas qui fait la différence

Les LLM privilégient les données que personne d’autre n’a. C’est le constat numéro 1 des benchmarks : une étude avec données originales atteint 88% de citation, contre 35% pour un article standard. C’est un écart de 53 points de pourcentage.

Tu n’as pas besoin d’un gros budget pour créer des données originales. Voici des idées réalisables en quelques jours :

  • Sondage client : interroge 50 clients sur leurs pratiques, publie les résultats bruts.
  • Analyse de données publiques : extrais des tendances depuis Google Trends, la Search Console, ou des API ouvertes.
  • Benchmark concurrentiel : compare 10 sites de ton secteur sur un critère précis (vitesse, structure, mots-clés).
  • Étude de cas client chiffrée : documente précisément les résultats obtenus (trafic, conversions, citations).

Chez EMdigital, on a constaté qu’un client qui a publié une mini-étude de 12 slides avec des données originales est passé de « jamais cité » à « cité dans 3 LLM » sur son sujet principal en 8 semaines. Les données originales créent une dépendance de citation unique : seul ton contenu possède ces chiffres, donc seul ton contenu peut être cité.

Sprint 3 – Autorité et amplification (J61 à J90)

Le troisième sprint est celui de l’autorité. Les signaux les plus lourds du SCA (EA à 22%, RE à 10%) demandent du temps. Lance-toi maintenant.

  1. Construis l’autorité d’entité : démarché la presse spécialisée, accepte des interviews, participe à des podcasts. Chaque mention dans une source tierce renforce ton entité dans le corpus des LLM.
  2. Alimente les sources tierces : Reddit, Quora, forums spécialisés. Ces plateformes représentent une part significative des corpus d’entraînement des LLM. Être recommandé ici = mémoire paramétrique.
  3. Multiplie les signaux E-E-A-T : auteur identifiable avec bio, photo, LinkedIn vérifié. Une source avec un auteur LinkedIn vérifié gagne +28% de probabilité de sélection sur Perplexity.
  4. Démarché 2-3 médias spécialisés : propose des tribunes, des analyses, des données exclusives.
  5. Interviens dans un podcast ou une conférence : le lien entre la parole orale et la citation IA est encore sous-estimé.
  6. Refais le test d’entité ChatGPT et compare avec la baseline du jour 1. C’est ta métrique de validation ultime.

Les Google Leaks (mai 2024) confirment que Google calcule un Site Focus Score sur 1 à 1 500 verticals. Un site qui couvre 50 sujets différents aura un score dilué. La recommandation de se concentrer sur 1-2 domaines d’expertise maximum est fondée sur un vrai signal technique, pas une intuition éditoriale.

Comment mesurer tes progrès GEO : outils et métriques

Le GEO ne peut devenir une discipline sérieuse que s’il est mesurable. Voici les 4 métriques que tu dois suivre mensuellement.

  1. Citation spontanée IA : chaque mois, demande à ChatGPT, Perplexity et Gemini de recommander des experts dans ton domaine. Mesure ton taux d’apparition et ta position dans les listes.
  2. AI Overviews appearances : via Semrush ou SE Ranking, tracke les requêtes sur lesquelles tu apparais dans les AI Overviews de Google.
  3. Trafic branded et direct : une marque forte dans les IA génère une hausse du trafic direct et des recherches de marque. Les utilisateurs entendent parler de toi via une IA et te cherchent ensuite.
  4. SCA trimestriel : recalcule ton Score de Citabilité tous les 3 mois. Les améliorations sur EA et RE sont lentes (6-12 mois), celles sur SE et DI sont rapides (4-8 semaines).

L’outil Adobe LLM Optimizer valide que le marché se standardise : le Share of Voice conversationnel devient une métrique comme les autres. Les grandes marques mesurent déjà leur visibilité dans les LLM.

Les erreurs GEO qui ruinent tes chances d’être cité

La plupart des guides expliquent ce qu’il faut faire. Très peu décrivent ce qui empêche structurellement d’être cité. Voici les 7 erreurs qui annulent tous tes efforts.

  • Bloquer accidentellement les crawlers IA dans robots.txt : c’est l’erreur la plus fréquente et la plus critique. Vérifie que GPTBot, PerplexityBot, ClaudeBot et OAI-SearchBot sont autorisés.
  • Introduction générique de 300 mots : le premier chunk est le plus important pour le retrieval. S’il est embedé comme contenu vague, tu ne seras jamais récupéré. Commence par la réponse.
  • Contenu rendu en JavaScript pur : la plupart des crawlers IA n’exécutent pas JavaScript. Passe en SSR ou SSG pour que le HTML contienne tout le contenu dès la réponse serveur.
  • Dilution thématique : un site qui parle de 10 sujets différents est spécialiste de rien pour un LLM. Concentre-toi sur 1-2 domaines maximum.
  • Contenu non signé par un auteur identifiable : le contenu non attribué ne renforce aucune entité. Signe chaque article avec un auteur identifiable, bio, photo, profils publics.
  • Agrégation sans valeur ajoutée : résumer ce que d’autres sources disent déjà sans perspective propre. Le système RAG ira directement aux sources originales. Ajoute toujours ton analyse, tes données, ton angle.
  • Confondre llms.txt et robots.txt : ce sont deux fichiers complémentaires. Le robots.txt contrôle le crawl, le llms.txt décrit ton entité pour les LLM.

Checklist 30 actions GEO : à imprimer et à suivre

Voici la checklist complète des 30 actions classées par sprint. Imprime-la, colle-la au mur, et coche au fur et à mesure.

Sprint 1 – Fondations (J1 à J30)

  1. Auditer ma présence actuelle dans les LLM (test d’entité ChatGPT)
  2. Ouvrir robots.txt aux crawlers IA (GPTBot, PerplexityBot, ClaudeBot, OAI-SearchBot)
  3. Créer le fichier /llms.txt à la racine du site
  4. Implémenter schema.org Organization avec sameAs vers Wikidata
  5. Implémenter schema.org Person pour l’auteur avec profils vérifiés
  6. Calculer mon SCA de base (7 variables, score sur 100)
  7. Ajouter FAQPage schema.org sur les 3 pages clés
  8. Définir et écrire ma thèse de marque en 1 page
  9. Créer/réécrire la page About en mode GEO
  10. Vérifier que le contenu n’est pas rendu en JavaScript pur

Sprint 2 – Contenu (J31 à J60)

  1. Publier 1 article pilier exhaustif au format RAFT
  2. Lancer une mini-étude avec des données originales
  3. Restructurer les 3 meilleurs articles existants en RAFT
  4. Ajouter FAQPage schema.org sur toutes les pages clés
  5. Nommer un framework maison
  6. Publier 2 prises de position tranchées
  7. Documenter et publier 1 cas client chiffré
  8. Répondre dans les 100 premiers mots sur chaque section
  9. Formuler les H2/H3 comme des questions conversationnelles
  10. Ajouter des données chiffrées sourcées dans chaque article

Sprint 3 – Autorité (J61 à J90)

  1. Démarcher 2-3 médias spécialisés pour des interviews
  2. Intervenir dans 1 podcast ou conférence
  3. Publier 5 réponses de qualité sur Reddit ou Quora
  4. Refaire le test d’entité ChatGPT et comparer avec J1
  5. Tester Perplexity et Gemini sur les mêmes requêtes
  6. Recalculer le SCA et comparer avec la baseline
  7. Vérifier l’apparition dans les AI Overviews via Semrush
  8. Mesurer le trafic branded et direct
  9. Définir le plan GEO du trimestre suivant
  10. Célébrer : tu es cité dans au moins 2 LLM sur ton domaine !

Prêt à passer à l’action ? On audite ta présence GEO gratuitement

Tu as maintenant la checklist complète. Tu sais exactement quelles 30 actions appliquer dans quel ordre, et comment mesurer tes progrès. Le GEO n’est pas une option : c’est la prochaine couche de distribution. Les marques qui le maîtrisent maintenant bâtissent une avance structurelle.

Si tu veux suivre l’aventure, abonne-toi !

Emeline Roblot
Recevez mes conseils exclusifs chaque semaine​

Découvrez en avant-première mes dernières techniques d’automatisation, mes outils coup de cœur et les stratégies que j’applique avec mes clients. Du concret, directement dans votre boîte mail.