Comment fonctionne la recherche
Comment Google et Bing transforment le Web ouvert en réponse — le pipeline exploration → indexation → diffusion sous forme de trois portes, avec une explication du rendu, de la canonicalisation et des systèmes de classement.
1 indice probant sur cette page
- Outil en ligne associéHTTP Status & Redirect Checker
La recherche fonctionne en trois étapes — exploration → indexation → diffusion — qui sont des portes, pas un tapis roulant : « toutes les pages ne franchissent pas nécessairement chaque étape ». Être exploré ne signifie pas être indexé (l’indexation n’est pas garantie), et être indexé ne signifie pas être classé. L’indexation comprend le rendu et la canonicalisation ; le classement repose sur de nombreux systèmes automatisés, pas sur un algorithme unique. Ce hub présente l’ensemble du parcours et vous oriente vers les analyses approfondies, en commençant par le cluster sur l’exploration.
En bref — La recherche fonctionne en trois étapes : un moteur de recherche explore (trouve et télécharge vos pages), indexe (détermine le sujet de chaque page et la classe), puis diffuse les résultats (associe une recherche aux meilleures pages et les ordonne). Le piège : une page doit franchir chaque étape pour atteindre la suivante. Être trouvée ne signifie pas qu’elle est indexée, et être indexée ne signifie pas qu’elle sera classée.
Les trois étapes
Lorsque vous faites une recherche sur Google, vous ne recherchez pas dans le Web en direct, mais dans la copie qu’en possède Google. Pour passer de « une page existe sur Internet » à « une page apparaît dans vos résultats », trois étapes sont nécessaires :
- Exploration — des programmes automatisés (celui de Google est Googlebot, celui de Bing Bingbot) découvrent les URL en suivant les liens et en lisant les sitemaps, puis téléchargent les pages.
- Indexation — le moteur examine ce qu’il a téléchargé, détermine le sujet de la page et la stocke dans une immense base de données appelée index.
- Diffusion (classement) — lorsqu’une personne effectue une recherche, le moteur extrait de l’index les pages qui correspondent le mieux et les ordonne. Preuve à l’appui de cette affirmation Google describes Search as operating through crawling, indexing, and serving search results. Portée : Google's public conceptual model, not an exhaustive implementation description. Niveau de confiance : élevé · Vérifié : Google: How Search works
Ce sont des portes, pas un toboggan
Le point le plus important : il ne s’agit pas d’un tapis roulant qui conduit chaque page jusqu’au bout. Ce sont trois portes, et une page peut être arrêtée à n’importe laquelle. Google le dit clairement : la recherche fonctionne en trois étapes « and not all pages make it through each stage. » (traduction) : « et toutes les pages ne franchissent pas nécessairement chaque étape ». Preuve à l’appui de cette affirmation Google states that not all pages make it through each Search processing stage and that increased crawl rate is not a ranking signal. Portée : Google Search; crawling and indexing do not guarantee ranking. Niveau de confiance : élevé · Vérifié : Google: How Search works Google: Crawling myths
- Une page peut être explorée sans être indexée : Google l’a examinée et a décidé de ne pas la stocker.
- Une page peut être indexée sans jamais être classée : elle se trouve dans la base, mais ne l’emporte pas pour les recherches effectuées.
C’est pourquoi la question « Google peut voir ma page, alors pourquoi n’apparaît-elle pas ? » est si courante. L’exploration n’est que la première porte.
Ce que cela implique pour vous
- Si une page n’apparaît pas du tout dans la recherche, déterminez à quelle porte elle est bloquée avant de modifier quoi que ce soit : cela vous indique ce qu’il faut corriger.
- Vous ne pouvez pas payer Google pour être mieux classé, et « soumettre » une page à Google ne force ni son indexation ni son classement.
- Bing fonctionne de la même façon — exploration, indexation, classement — même s’il nomme certains éléments différemment.
Vous voulez la version précise, appuyée sur les sources des représentants, avec le rendu, la canonicalisation, les raisons pour lesquelles l’indexation n’est pas garantie et celles pour lesquelles le classement repose sur de nombreux systèmes plutôt que sur « l’algorithme » ? Passez à l’onglet Avancé.
En bref — La recherche se déroule en trois étapes — exploration → indexation → diffusion — qui sont des portes : « toutes les pages ne franchissent pas nécessairement chaque étape ». L’exploration découvre et récupère ; le rendu (exécuter JavaScript dans une version récente de Chrome) fait le pont vers l’indexation et peut être différé. Indexer, c’est comprendre + canonicaliser (~40 signaux) + stocker, et ce n’est pas garanti. Diffuser, c’est comprendre la requête, puis classer au moyen de nombreux systèmes de classement automatisés (RankBrain, BERT, correspondance neuronale, systèmes de liens et PageRank…), et non d’un « algorithme » unique, selon des centaines de facteurs contextuels, avec des fonctionnalités de recherche ajoutées par-dessus. Bing suit la même structure. Considérez tout schéma, y compris le mien, comme un modèle et non comme le code source. L’intérêt pratique : lorsqu’une page n’apparaît pas, diagnostiquez à quelle porte elle est bloquée.
Trois étapes, trois portes
Google est direct au sujet du pipeline : « Google Search works in three stages, and not all pages make it through each stage » (traduction) : « La recherche Google fonctionne en trois étapes, et toutes les pages ne franchissent pas nécessairement chaque étape » — exploration, indexation et diffusion. Preuve à l’appui de cette affirmation Google describes Search as operating through crawling, indexing, and serving search results. Portée : Google's public conceptual model, not an exhaustive implementation description. Niveau de confiance : élevé · Vérifié : Google: How Search works La dernière proposition résume tout. Le pipeline n’est pas un tapis roulant qui conduit chaque page à l’arrivée ; ce sont trois portes, chacune avec ses critères de réussite ou d’échec et son propre mode de défaillance.
Le modèle mental à retenir :
Découvrir et récupérer (explorer) → comprendre et stocker (indexer, y compris rendre + canonicaliser) → faire correspondre et ordonner (diffuser, y compris comprendre la requête + systèmes de classement + fonctionnalités de recherche).
Gardez bien exploration ≠ indexation ≠ classement à l’esprit et l’essentiel du SEO technique devient beaucoup moins mystérieux.
Trois étapes se succèdent de gauche à droite. Exploration : un robot découvre une URL et télécharge la page. Indexation : le moteur traite la page et stocke les informations admissibles. Diffusion ou classement : les meilleurs résultats indexés correspondant à une requête sont ordonnés. Une note précise que toutes les pages ne franchissent pas chaque étape.
© Patrick Stox LLC · CC BY 4.0 ·
Étape 1 — Exploration (découvrir et récupérer)
Explorer, c’est découvrir puis télécharger. Google trouve les pages qu’il connaît déjà, suit les liens de ces pages vers de nouvelles et lit les sitemaps que vous soumettez ; Google appelle l’ensemble « URL discovery » (traduction) : « découverte des URL ». Ce qui est exploré, à quelle fréquence et combien de pages sont récupérées par visite est déterminé par algorithme : « Googlebot uses an algorithmic process to determine which sites to crawl, how often, and how many pages to fetch from each site. » (traduction) : « Googlebot utilise un processus algorithmique pour déterminer les sites à explorer, la fréquence de l’exploration et le nombre de pages à récupérer sur chaque site. »
Preuve à l’appui de cette affirmation Google's crawling stage discovers URLs through known pages, links, and submitted sitemaps, then algorithmically decides which discovered URLs to fetch and how often. Portée : web Niveau de confiance : élevé · Vérifié : In-depth guide to how Google Search worksÀ ce niveau, retenez une chose : l’exploration est une condition préalable à l’indexation, pas un signal de classement. Preuve à l’appui de cette affirmation Google states that not all pages make it through each Search processing stage and that increased crawl rate is not a ranking signal. Portée : Google Search; crawling and indexing do not guarantee ranking. Niveau de confiance : élevé · Vérifié : Google: How Search works Google: Crawling myths Une cadence d’exploration plus élevée ne fait pas monter vos positions. Je ne vais pas redécrire ici tout le pipeline d’exploration : la découverte, le planificateur, le budget d’exploration, les journaux et le reste sont traités dans le cluster sur l’exploration (lié en bas). Le vrai rôle de l’exploration consiste à transmettre une page récupérée à l’étape suivante.
Une nuance avant de poursuivre : c’est par l’exploration que les pages Web entrent dans ce pipeline, mais ce n’est pas la seule source d’informations de Google. Comme expliqué plus bas, l’index s’appuie aussi sur des partenariats, des flux de données et le Knowledge Graph de Google. « Ne pas être dans l’index » et « ne pas être sur le Web exploré » ne sont donc pas exactement la même question.
Le pont — le rendu
Voici l’étape que la plupart des vues d’ensemble présentent mal ou omettent. Entre l’exploration et l’indexation, Google effectue le rendu de la page. « During the crawl, Google renders the page and runs any JavaScript it finds using a recent version of Chrome. » (traduction) : « Pendant l’exploration, Google effectue le rendu de la page et exécute tout JavaScript trouvé à l’aide d’une version récente de Chrome. » Selon la formulation destinée au grand public : « When crawlers find a webpage, our systems render the content of the page, just as a browser does. » (traduction) : « Lorsque les robots trouvent une page Web, nos systèmes en effectuent le rendu, comme le ferait un navigateur. »
Le rendu relève de l’indexation, pas de l’exploration. Il s’exécute dans le Web Rendering Service (un Chromium headless evergreen) et peut être décalé par rapport à la récupération initiale. Si votre contenu n’apparaît qu’après exécution de JavaScript, Google comprend la version rendue, qui peut arriver plus tard que le HTML brut. C’est pourquoi les sites très dépendants de JavaScript doivent traiter le rendu comme une préoccupation distincte. (J’approfondis le sujet dans mon article sur le SEO JavaScript.)
Étape 2 — Indexation (comprendre et stocker)
Après l’exploration et le rendu, l’indexation tente de comprendre la page. Google :
« After a page is crawled, Google tries to understand what the page is about. This
stage is called indexing and it includes processing and analyzing the textual
content and key content tags and attributes, such as <title> elements and alt
attributes, images, videos, and more. » (traduction) : « Une fois la page
explorée, Google tente de comprendre son sujet. Cette étape s’appelle l’indexation
et comprend le traitement et l’analyse du contenu textuel, des balises et attributs
essentiels, comme les éléments <title> et les attributs alt, ainsi que des images,
vidéos et autres éléments. »
Trois opérations s’y déroulent, souvent absentes des présentations générales :
Comprendre. Google traite le texte, les balises et les médias pour identifier le sujet. Dans ma présentation How Search Works, je décris un analyseur de contenu qui normalise le HTML, le segmente en tokens et le vectorise (transforme les mots en nombres) afin d’en analyser le sens ; il extrait au passage des signaux de langue, de localisation, de schéma et de sémantique. (C’est ma reformulation du fonctionnement du traitement, pas une citation de Google.)
Canonicaliser. L’indexation décide également quelle URL représente un groupe
de doublons. « During the indexing process, Google determines if a page is a
duplicate of another page on the internet or canonical. The canonical is the page
that may be shown in search results. » (traduction) : « Pendant l’indexation,
Google détermine si une page est un doublon d’une autre page sur Internet ou si
elle est canonique. La page canonique est celle qui peut être affichée dans les
résultats de recherche. » Google regroupe les doublons et choisit une page
canonique pour représenter l’ensemble. Ce choix n’est pas aléatoire : il est
pondéré par des signaux. Comme je l’explique dans Google Uses ~40 Canonicalization
Signals, « canonicalization is the
process that search engines use to determine the main version of the URL that will
be indexed and shown to users when there are duplicate URLs » (traduction) :
« la canonicalisation est le processus utilisé par les moteurs de recherche pour
déterminer la version principale de l’URL qui sera indexée et présentée aux
utilisateurs lorsqu’il existe des URL en double ». Selon Allan Scott de Google, la
sélection canonique repose sur environ 40 signaux différents (redirections,
rel=canonical, URL des sitemaps, liens internes et externes, hreflang, PageRank,
HTTPS plutôt que HTTP, URL plus courtes plutôt que longues, etc.).
Stocker. « The collected information about the canonical page and its cluster may be stored in the Google index, a large database hosted on thousands of computers. » (traduction) : « Les informations recueillies sur la page canonique et son cluster peuvent être stockées dans l’index Google, une vaste base de données hébergée sur des milliers d’ordinateurs. » Cet index est gigantesque : « hundreds of billions of webpages… well over 100,000,000 gigabytes in size » (traduction) : « des centaines de milliards de pages Web… pour une taille largement supérieure à 100 000 000 de gigaoctets ». Il ne contient pas uniquement du HTML exploré : « we have multiple indexes of different types of information, which is gathered through crawling, through partnerships, through data feeds being sent to us and through our own encyclopedia of facts, the Knowledge Graph. » (traduction) : « nous avons plusieurs index de différents types d’informations, recueillies par l’exploration, des partenariats, des flux de données qui nous sont envoyés et notre propre encyclopédie de faits, le Knowledge Graph ».
L’indexation n’est pas garantie
Le mythe essentiel à déconstruire : une page explorée n’est pas automatiquement
indexée. Google : « Indexing isn’t guaranteed; not every page that Google
processes will be indexed. » (traduction) : « L’indexation n’est pas garantie ;
toutes les pages traitées par Google ne seront pas indexées. » Parmi les causes
courantes figurent un contenu de faible qualité, une directive robots noindex et
une conception de page qui rend l’indexation difficile.
John Mueller l’a formulé concrètement. À propos de la durée possible du statut « discovered/crawled — currently not indexed » : « That can be forever. It’s something where we just don’t crawl and index all pages. » (traduction) : « Cela peut durer indéfiniment. Nous n’explorons et n’indexons tout simplement pas toutes les pages. » La solution n’est pas une astuce, mais le fond : « continue working on the website and making sure that our systems recognize that there’s value in crawling and indexing more and then over time we will crawl and index more. » (traduction) : « continuez à travailler sur le site et assurez-vous que nos systèmes reconnaissent l’intérêt d’explorer et d’indexer davantage ; avec le temps, nous explorerons et indexerons plus de pages. »
J’ai également démontré exploration ≠ indexation dans l’autre sens. Dans
Indexed, though blocked by robots.txt, l’idée est simple : « crawling and indexing are two different things. »
(traduction) : « l’exploration et l’indexation sont deux choses différentes ».
Une page dont vous bloquez l’exploration peut tout de même être indexée si d’autres
pages pointent vers elle ; Google ne peut simplement pas voir son contenu (ni la
directive noindex que vous y auriez placée).
Étape 3 — Diffusion des résultats (faire correspondre et ordonner)
La diffusion commence dès qu’une personne lance une recherche. « When a user enters a query, our machines search the index for matching pages and return the results we believe are the highest quality and most relevant to the user’s query. » (traduction) : « Lorsqu’un utilisateur saisit une requête, nos machines cherchent dans l’index les pages correspondantes et renvoient les résultats que nous estimons les plus qualitatifs et les plus pertinents pour sa requête. » Mais cette étape contient deux mouvements distincts.
D’abord, comprendre la requête
Avant tout classement, Google doit comprendre ce qui est demandé. Cela comprend la correction orthographique, les synonymes et l’expansion de requête, ainsi que l’identification de l’intention. Dans ma présentation How Search Works, je décris une correction orthographique par réseau neuronal profond, une expansion couvrant synonymes, acronymes et racinisation, puis une correspondance neuronale qui relie des termes conceptuellement proches, alors qu’une part notable des requêtes quotidiennes n’a jamais été vue auparavant par Google. (Reformulation issue de la présentation.) La compréhension de la requête est une étape à part entière ; elle ne se confond pas avec le classement.
Puis classer — avec de nombreux systèmes, pas « l’algorithme »
C’est la correction majeure. Le classement ne repose pas sur une formule unique. « Google uses automated ranking systems that look at many factors and signals about hundreds of billions of web pages and other content in our Search index to present the most relevant, useful results, all in a fraction of a second. » (traduction) : « Google utilise des systèmes de classement automatisés qui examinent de nombreux facteurs et signaux portant sur des centaines de milliards de pages Web et d’autres contenus de notre index afin de présenter les résultats les plus pertinents et utiles, le tout en une fraction de seconde. » Notez le pluriel : des systèmes de classement. Google en cite plusieurs : RankBrain (« an AI system that helps us understand how words are related to concepts » — (traduction) : « un système d’IA qui nous aide à comprendre la relation entre les mots et les concepts »), BERT, la correspondance neuronale (« an AI system that Google uses to understand representations of concepts in queries and pages and match them to one another » — (traduction) : « un système d’IA utilisé par Google pour comprendre les représentations de concepts dans les requêtes et les pages et les faire correspondre »), ainsi que les systèmes d’analyse des liens et PageRank (« we have various systems that understand how pages link to each other… » — (traduction) : « nous disposons de différents systèmes qui comprennent comment les pages sont liées entre elles… »). Le helpful content system est désormais décrit au passé : il a été intégré au classement principal lors de la mise à jour de mars 2024 et n’est donc plus un système autonome actif.
Deux distinctions méritent d’être enseignées :
- Systèmes ≠ mises à jour. Les systèmes de classement sont les mécanismes permanents ; les mises à jour de classement sont les modifications que Google leur apporte. Ils sont suivis séparément.
- Il n’existe pas de « trois principaux facteurs » fixes. Gary Illyes a contesté l’idée que les liens figureraient parmi les trois premiers : « I think they are important, but I think people overestimate the importance of links. I don’t agree it’s in the top three. It hasn’t been for some time. » (traduction) : « Je pense qu’ils sont importants, mais que les gens surestiment leur importance. Je ne suis pas d’accord pour dire qu’ils figurent parmi les trois premiers. Ce n’est plus le cas depuis un certain temps. » Il a aussi déclaré : « it is possible to rank without links. » (traduction) : « il est possible d’être classé sans liens ». Et selon Illyes, il n’existe même pas de trio universel, car les signaux principaux varient d’un site à l’autre (cette formulation est celle de Search Engine Land, et non une citation littérale).
Les cinq facteurs nommés par Google
Pour une carte accessible aux débutants, le site grand public de Google répartit le classement en cinq catégories :
- Signification de votre requête — « To return relevant results, we first need to establish what you’re looking for - the intent behind your query. » (traduction) : « Pour renvoyer des résultats pertinents, nous devons d’abord déterminer ce que vous recherchez, c’est-à-dire l’intention derrière votre requête. »
- Pertinence du contenu — « The most basic signal that information is relevant is when content contains the same keywords as your search query. » (traduction) : « Le signal le plus élémentaire de pertinence d’une information est la présence, dans le contenu, des mêmes mots clés que dans votre requête. »
- Qualité du contenu — « they identify signals that can help determine which content demonstrates expertise, authoritativeness, and trustworthiness. » (traduction) : « ils identifient des signaux pouvant aider à déterminer quels contenus démontrent expertise, autorité et fiabilité ». (Les propres termes de Google sont ici E-A-T — expertise, autorité, fiabilité ; le premier E d’« expérience » dans E-E-A-T est mon ajout, pas le leur dans cette citation.)
- Facilité d’utilisation du contenu — considérations liées à l’expérience de page et à l’accessibilité.
- Contexte et paramètres — « we use information such as your location, past Search history, and Search settings to determine what is most relevant for you. » (traduction) : « nous utilisons des informations comme votre localisation, votre historique de recherche et vos paramètres de recherche pour déterminer ce qui vous est le plus pertinent. »
La pertinence dépend du contexte : « Relevancy is determined by hundreds of factors, which could include information such as the user’s location, language, and device (desktop or phone). » (traduction) : « La pertinence est déterminée par des centaines de facteurs, qui peuvent inclure la localisation, la langue et l’appareil de l’utilisateur (ordinateur ou téléphone). » La pondération varie selon la requête : « when searching for current news topics, content freshness plays a bigger role than dictionary definitions. » (traduction) : « pour une recherche sur l’actualité, la fraîcheur du contenu joue un rôle plus important que pour des définitions de dictionnaire ». Il n’existe pas un « meilleur » résultat identique pour tout le monde.
La diffusion ne se résume pas à dix liens bleus
La diffusion détermine aussi l’apparence de la page. « Based on the user’s query the search features that appear on the search results page also change. » (traduction) : « Les fonctionnalités affichées sur la page de résultats changent aussi selon la requête de l’utilisateur. » Panneaux de connaissances, résultats enrichis, images, vidéos, packs locaux : ils font partie de la diffusion et ne constituent pas un système séparé ajouté après coup. Pour éliminer deux mythes persistants : « we never provide special treatment to advertisers in how our search algorithms rank their websites, and nobody can pay us to do so. » (traduction) : « nous n’accordons jamais de traitement de faveur aux annonceurs dans la manière dont nos algorithmes classent leurs sites, et personne ne peut nous payer pour cela ». On ne peut pas acheter une position organique et soumettre une URL ne fait qu’envoyer un signal : cela ne garantit ni l’indexation ni le classement.
Bing suit la même structure
Bing suit lui aussi le pipeline exploration → indexation → classement, avec ses propres termes. Microsoft : « Crawling is how Bingbot discovers new and updated pages and content to add to our search index. » (traduction) : « L’exploration est la manière dont Bingbot découvre les pages et contenus nouveaux ou mis à jour à ajouter à notre index de recherche. » Puis « as Bingbot crawls the web, it sends information to Bing about what it finds. These pages are then added to the Bing index. » (traduction) : « lorsque Bingbot explore le Web, il envoie à Bing des informations sur ce qu’il trouve. Ces pages sont ensuite ajoutées à l’index Bing. » Enfin, « complex algorithms generate Microsoft Bing search results using the user’s search query matching it with third-party webpages in our index. » (traduction) : « des algorithmes complexes génèrent les résultats Microsoft Bing en faisant correspondre la requête de l’utilisateur aux pages tierces présentes dans notre index ». Bing publie ses propres facteurs : pertinence, qualité et crédibilité, engagement des utilisateurs, fraîcheur, localisation et temps de chargement de la page — un parallèle net avec les cinq facteurs de Google.
C’est un modèle, pas le code source
Une réserve honnête avant de prendre tout cela pour parole d’évangile. Les moteurs nous disent beaucoup de choses, mais pas tout, et leur fonctionnement interne évolue. Tout schéma de pipeline, y compris le mien, est une approximation utile, pas le véritable code. J’affiche cette réserve dès la diapositive 3 de ma présentation How Search Works et la répète ici : « This is my understanding of systems and is based on a lot of public statements from Google and my own knowledge. Warning: It’s not going to be 100% complete or accurate. » (traduction) : « Voici ma compréhension des systèmes, fondée sur de nombreuses déclarations publiques de Google et sur mes propres connaissances. Attention : elle ne sera pas complète ou exacte à 100 %. » Gardez ce modèle souple ; utilisez-le pour raisonner, pas pour plaider.
À quelle étape êtes-vous bloqué ?
C’est ici que le modèle des trois portes devient utile. Lorsqu’une page ne donne pas les résultats attendus, ne devinez pas : repérez la porte qui a échoué, puis corrigez cette étape :
| Symptôme | Étape probable | Premiers éléments à vérifier |
|---|---|---|
| La page n’est pas du tout explorée | Exploration | Page orpheline (aucun lien vers elle), blocage dans robots.txt, erreurs serveur, absence du sitemap |
| Explorée mais non indexée | Indexation | Qualité du contenu, noindex, canonicalisation vers une autre URL, contenu JS jamais rendu |
| Indexée mais non classée | Diffusion / classement | Pertinence par rapport à la requête, qualité du contenu, concurrence, décalage d’intention |
| Mauvaise URL classée | Indexation (canonicalisation) | Le cluster de doublons a choisi une autre canonique — vérifiez les ~40 signaux |
| Contenu JS absent de l’index | Rendu (dans l’indexation) | Vrais liens <a href>, délai de rendu, limites du WRS |
Le diagnostic indique l’analyse approfondie à consulter ensuite.
Où aller ensuite
Cette page est la carte. Chaque étape a son propre niveau de détail :
Exploration — la seule étape entièrement développée à ce jour sous la forme d’un cluster. Commencez par le hub crawling, puis approfondissez le budget d’exploration (capacité + demande, et qui doit vraiment s’en préoccuper), la cadence d’exploration (vitesse de récupération des robots et moyens de l’accélérer ou de la ralentir), la fréquence d’exploration (ce qui pousse Google à revenir plus tôt) et la profondeur d’exploration (pourquoi les pages importantes doivent rester proches de l’accueil). Pour diagnostiquer les problèmes, consultez l’analyse des fichiers journaux (la réalité de ce que les robots ont fait) et les pièges à robots (espaces d’URL infinis qui consomment le budget). Pour accélérer la découverte, voyez IndexNow (le protocole push utilisé par Bing et d’autres) et l’API d’indexation Google (ainsi que le mythe selon lequel elle indexerait n’importe quoi).
Rendu — le pont entre exploration et indexation dispose maintenant de deux
analyses approfondies. Rendering explique comment Google exécute JavaScript
dans le Web Rendering Service ainsi que les options de rendu (CSR, SSR, SSG,
hydratation, ISR, edge, dynamique) et leurs compromis SEO. JavaScript SEO couvre
les problèmes pratiques et leurs correctifs : vrais liens <a href>, parité du DOM,
contenu différé, soft 404 et raison pour laquelle le défilement infini peut faire
indexer deux pages comme une seule.
Indexation — la canonicalisation et l’indexabilité ont désormais leur propre cluster ; commencez par le hub indexing.
Classement — les systèmes de classement, les signaux qui les alimentent et la place de l’E-E-A-T constituent un sujet à part entière, à venir.
Pour retrouver tout le cluster au même endroit, consultez le cluster How Search Works.
Résumé par IA
Une version condensée de l’onglet Avancé :
- Recherche = trois étapes, trois portes (exploration → indexation → diffusion). Google : « not all pages make it through each stage » (traduction) : « toutes les pages ne franchissent pas chaque étape ». Explorer ≠ indexer ≠ classer.
- Exploration = découvrir + récupérer (« URL discovery », planification algorithmique). C’est une condition préalable à l’indexation, pas un signal de classement. Les détails se trouvent dans le cluster sur l’exploration.
- Le rendu fait le pont : Google exécute JavaScript dans une version récente de Chrome (le Web Rendering Service) pendant l’indexation ; il peut être décalé par rapport à l’exploration initiale.
- Indexation = comprendre + canonicaliser + stocker. Google choisit une URL canonique parmi les doublons à l’aide d’environ 40 signaux (Allan Scott). L’index dépasse « 100 000 000 de gigaoctets » et comprend plusieurs index ainsi que le Knowledge Graph.
- L’indexation n’est pas garantie : « not every page that Google processes will be indexed » (traduction) : « toutes les pages traitées par Google ne seront pas indexées ». Selon Mueller, « currently not indexed » peut durer « forever » : c’est généralement une décision liée à la qualité.
- Diffuser = comprendre la requête, puis classer. La compréhension de la requête (orthographe, synonymes, intention) vient en premier.
- Le classement repose sur de nombreux systèmes automatisés, pas sur « l’algorithme » (RankBrain, BERT, correspondance neuronale, systèmes de liens et PageRank). Systèmes ≠ mises à jour. Pas de « top 3 » fixe ; Illyes affirme que les liens n’en font pas partie.
- La pertinence est contextuelle (localisation, langue, appareil, historique ; importance de la fraîcheur selon la requête). Les cinq facteurs de Google : signification, pertinence, qualité, facilité d’utilisation et contexte. On ne peut pas payer pour un classement organique.
- Diffusion ≠ dix liens bleus : les fonctionnalités varient selon la requête.
- Bing suit la même structure avec ses six facteurs nommés.
- C’est un modèle, pas le code source (réserve de Patrick). L’intérêt : diagnostiquer à quelle porte une page est bloquée.
Documentation officielle
Documentation de première main fournie par les moteurs de recherche.
- In-Depth Guide to How Google Search Works — présentation exploration → indexation → diffusion, découverte des URL, rendu, indexation et diffusion.
- How Search organizes information — explication grand public de l’exploration, du rendu et de l’index (taille + index multiples + Knowledge Graph).
- How Search ranking results — les cinq « key factors » : signification, pertinence, qualité, facilité d’utilisation, contexte.
- A guide to Google Search ranking systems — les systèmes de classement (RankBrain, BERT, correspondance neuronale, systèmes de liens…), distincts des mises à jour de classement.
- JavaScript SEO basics — le rendu dans l’indexation et les moyens de garder le contenu JS indexable.
Bing / Microsoft
- How Bing delivers search results — pipeline exploration → indexation → classement de Bing et ses facteurs de classement.
- bingbot Series: Maximizing Crawl Efficiency — définition de l’exploration par Bing et son objectif de « crawl efficiency ».
Citations des sources
Déclarations publiques de Google et de Bing. Chaque lien profond mène au passage cité sur la page source.
Google — les trois étapes
- « Google Search works in three stages, and not all pages make it through each stage. » (traduction) : « La recherche Google fonctionne en trois étapes, et toutes les pages ne franchissent pas nécessairement chaque étape. » — documentation Google Search Central. Accéder à la citation
- « Googlebot uses an algorithmic process to determine which sites to crawl, how often, and how many pages to fetch from each site. » (traduction) : « Googlebot utilise un processus algorithmique pour déterminer les sites à explorer, à quelle fréquence et combien de pages récupérer sur chacun. » Accéder à la citation
- « During the crawl, Google renders the page and runs any JavaScript it finds using a recent version of Chrome. » (traduction) : « Pendant l’exploration, Google effectue le rendu de la page et exécute tout JavaScript trouvé avec une version récente de Chrome. » Accéder à la citation
Google — l’indexation
- « After a page is crawled, Google tries to understand what the page is about. This stage is called indexing… » (traduction) : « Une fois une page explorée, Google tente de comprendre son sujet. Cette étape s’appelle l’indexation… » Accéder à la citation
- « During the indexing process, Google determines if a page is a duplicate of another page on the internet or canonical. » (traduction) : « Pendant l’indexation, Google détermine si une page est un doublon d’une autre page sur Internet ou si elle est canonique. » Accéder à la citation
- « Indexing isn’t guaranteed; not every page that Google processes will be indexed. » (traduction) : « L’indexation n’est pas garantie ; toutes les pages traitées par Google ne seront pas indexées. » Accéder à la citation
- « When crawlers find a webpage, our systems render the content of the page, just as a browser does. » (traduction) : « Lorsque les robots trouvent une page Web, nos systèmes en effectuent le rendu, comme le ferait un navigateur. » — Google, How Search organizes information. Accéder à la citation
- « The Google Search index covers hundreds of billions of webpages and is well over 100,000,000 gigabytes in size. » (traduction) : « L’index de la recherche Google couvre des centaines de milliards de pages Web et dépasse largement 100 000 000 de gigaoctets. » Accéder à la citation
Google — diffusion et classement
- « When a user enters a query, our machines search the index for matching pages and return the results we believe are the highest quality and most relevant to the user’s query. » (traduction) : « Lorsqu’un utilisateur saisit une requête, nos machines recherchent dans l’index les pages correspondantes et renvoient les résultats que nous estimons les plus qualitatifs et pertinents. » Accéder à la citation
- « Relevancy is determined by hundreds of factors, which could include information such as the user’s location, language, and device (desktop or phone). » (traduction) : « La pertinence est déterminée par des centaines de facteurs, parmi lesquels peuvent figurer la localisation, la langue et l’appareil de l’utilisateur. » Accéder à la citation
- « Google uses automated ranking systems that look at many factors and signals about hundreds of billions of web pages and other content in our Search index to present the most relevant, useful results, all in a fraction of a second. » (traduction) : « Google utilise des systèmes de classement automatisés qui examinent de nombreux facteurs et signaux concernant des centaines de milliards de pages Web et d’autres contenus pour présenter les résultats les plus pertinents et utiles en une fraction de seconde. » — Google, A guide to Google Search ranking systems. Accéder à la citation
- « RankBrain is an AI system that helps us understand how words are related to concepts. » (traduction) : « RankBrain est un système d’IA qui nous aide à comprendre la relation entre les mots et les concepts. » Accéder à la citation
- « Neural matching is an AI system that Google uses to understand representations of concepts in queries and pages and match them to one another. » (traduction) : « La correspondance neuronale est un système d’IA utilisé par Google pour comprendre les représentations de concepts dans les requêtes et les pages et les faire correspondre. » Accéder à la citation
- « To return relevant results, we first need to establish what you’re looking for - the intent behind your query. » (traduction) : « Pour renvoyer des résultats pertinents, nous devons d’abord déterminer ce que vous recherchez, c’est-à-dire l’intention derrière votre requête. » — Google, How Search ranking results. Accéder à la citation
- « …they identify signals that can help determine which content demonstrates expertise, authoritativeness, and trustworthiness. » (traduction) : « …ils identifient des signaux pouvant aider à déterminer quels contenus démontrent expertise, autorité et fiabilité. » Accéder à la citation
- « We never provide special treatment to advertisers in how our search algorithms rank their websites, and nobody can pay us to do so. » (traduction) : « Nous n’accordons jamais de traitement de faveur aux annonceurs dans la manière dont nos algorithmes classent leurs sites, et personne ne peut nous payer pour cela. » Accéder à la citation
John Mueller, Google (selon Search Engine Journal)
- « That can be forever. It’s something where we just don’t crawl and index all pages. » (traduction) : « Cela peut durer indéfiniment. Nous n’explorons et n’indexons tout simplement pas toutes les pages. » Lire l’article
- « …continue working on the website and making sure that our systems recognize that there’s value in crawling and indexing more and then over time we will crawl and index more. » (traduction) : « …continuez à travailler sur le site et assurez-vous que nos systèmes reconnaissent l’intérêt d’explorer et d’indexer davantage ; avec le temps, nous explorerons et indexerons plus. » Lire l’article
Gary Illyes, Google (selon Search Engine Land)
- « I don’t agree it’s in the top three. It hasn’t been for some time. » (traduction) : « Je ne suis pas d’accord pour dire que cela figure parmi les trois premiers. Ce n’est plus le cas depuis un certain temps. » — à propos des liens comme facteur de classement. Lire l’article
- « It is possible to rank without links. » (traduction) : « Il est possible d’être classé sans liens. » Lire l’article
Microsoft Bing
- « Crawling is how Bingbot discovers new and updated pages and content to add to our search index. » (traduction) : « L’exploration est la manière dont Bingbot découvre les pages et contenus nouveaux ou mis à jour à ajouter à notre index. » Accéder à la citation
- « Complex algorithms generate Microsoft Bing search results using the user’s search query matching it with third-party webpages in our index. » (traduction) : « Des algorithmes complexes génèrent les résultats Microsoft Bing en faisant correspondre la requête de l’utilisateur aux pages tierces de notre index. » Accéder à la citation
Patrick Stox (mes propres travaux)
- « Canonicalization is the process that search engines use to determine the main version of the URL that will be indexed and shown to users when there are duplicate URLs. » (traduction) : « La canonicalisation est le processus utilisé par les moteurs de recherche pour déterminer la version principale de l’URL qui sera indexée et affichée lorsqu’il existe des URL en double. » Selon Allan Scott de Google, il existe environ 40 signaux de sélection canonique. Lire l’article
- « This is my understanding of systems and is based on a lot of public statements from Google and my own knowledge. Warning: It’s not going to be 100% complete or accurate. » (traduction) : « Voici ma compréhension des systèmes, fondée sur de nombreuses déclarations publiques de Google et sur mes propres connaissances. Attention : elle ne sera pas complète ou exacte à 100 %. » — diapositive 3 de ma présentation How Search Works. Voir la diapositive
Les modèles mentaux
1. Trois portes, pas un tapis roulant. Exploration → indexation → diffusion. Chaque étape est un filtre et « toutes les pages ne franchissent pas chaque étape ». Lorsqu’une page sous-performe, repérez l’étape où elle a échoué avant de modifier quoi que ce soit.
2. Les trois « différents de ».
- Exploration ≠ indexation (une page bloquée peut être indexée grâce aux liens ; l’indexation n’est pas garantie même après une exploration réussie).
- Exploration ≠ classement (la cadence d’exploration n’est pas un signal de classement).
- Exploration ≠ rendu (JavaScript s’exécute dans une étape séparée qui peut être différée).
3. Indexation = comprendre + canonicaliser + stocker. Google traite le texte, les balises et les médias, choisit une page canonique parmi les doublons (au moyen d’environ 40 signaux), puis stocke le résultat. Deux pages peuvent être explorées toutes les deux et se réduire à une seule URL indexée.
4. Diffusion = comprendre la requête, puis classer. La compréhension de la requête (orthographe, synonymes, intention) forme une étape distincte avant le classement. Ne les confondez pas.
5. Classement = de nombreux systèmes, pas un algorithme unique. RankBrain, BERT, correspondance neuronale, systèmes de liens et PageRank : des « systèmes de classement » au pluriel. Et systèmes de classement ≠ mises à jour de classement. Il n’existe pas de trio fixe de facteurs principaux.
6. La pertinence dépend du contexte. Localisation, langue, appareil, historique, fraîcheur : il n’existe pas un seul « meilleur » résultat pour tous. La bonne réponse dépend de la personne qui demande.
7. C’est un modèle, pas le code source. Utilisez le pipeline pour raisonner sur les problèmes, pas pour affirmer exactement comment Google fonctionne en interne. Gardez-le souple.
À quelle étape êtes-vous bloqué ? — aide-mémoire de diagnostic
Associez le symptôme à la porte défaillante, puis consultez l’analyse appropriée.
| Symptôme | Étape probable | Où chercher d’abord |
|---|---|---|
| Page jamais explorée | Exploration | Page orpheline, blocage robots.txt, erreur serveur 5xx, absence du sitemap |
| Explorée, « currently not indexed » (traduction) : « actuellement non indexée » | Indexation | Qualité du contenu, noindex, canonicalisation ailleurs, échec de rendu |
| La mauvaise URL est indexée | Indexation (canonicalisation) | Cluster de doublons + environ 40 signaux canoniques |
| Contenu JS absent de l’index | Rendu (dans l’indexation) | Vrais liens <a href>, délai de rendu, limites du WRS |
| Indexée mais non classée | Diffusion / classement | Pertinence, qualité, adéquation à l’intention, concurrence |
| Résultats différents selon la personne ou le lieu | Diffusion (fonctionnement normal) | Contexte : localisation, langue, appareil, historique |
Exploration ≠ indexation ≠ classement — ce que chaque notion signifie vraiment
| Affirmation | Vraie ? | Pourquoi |
|---|---|---|
| « Crawled, so I’m indexed » (traduction) : « Explorée, donc indexée » | Non | « Indexing isn’t guaranteed » (traduction) : « L’indexation n’est pas garantie » |
| « Indexed, so I’ll rank » (traduction) : « Indexée, donc classée » | Non | Le classement est une compétition distincte |
| « I can submit a page to force ranking » (traduction) : « Je peux soumettre une page pour forcer son classement » | Non | La soumission ne fait qu’envoyer un signal |
| « I can pay for organic rank » (traduction) : « Je peux payer pour un classement organique » | Non | « Nobody can pay us to do so » (traduction) : « Personne ne peut nous payer pour cela » |
| « Ranking is one algorithm » (traduction) : « Le classement repose sur un algorithme unique » | Non | Il existe de nombreux systèmes de classement automatisés |
| « Blocking in robots.txt removes a page » (traduction) : « Bloquer une page dans robots.txt la supprime » | Non | Utilisez plutôt noindex (en autorisant l’exploration) |
Ressources utiles
Mes articles connexes
- The Beginner’s Guide to Technical SEO — où se situent exploration, indexation et classement : « optimizing your website to help search engines find, crawl, understand, and index your pages » (traduction) : « optimiser votre site pour aider les moteurs à trouver, explorer, comprendre et indexer vos pages ».
- Google Uses ~40 Canonicalization Signals — comment l’indexation choisit une URL parmi les doublons (environ 40 signaux selon Allan Scott).
- JavaScript SEO Issues & Best Practices — le rendu dans l’indexation et les raisons de son décalage possible.
- Indexed, though blocked by robots.txt — preuve que « crawling and indexing are two different things » (traduction) : « l’exploration et l’indexation sont deux choses différentes ».
- The Story of Blocking 2 High-Ranking Pages With Robots.txt — mon expérience de première main sur exploration et classement.
Mes conférences
- How Search Works (SlideShare) — présentation complète de l’exploration, du rendu, de l’indexation, de la compréhension des requêtes et du classement. (Ma réserve habituelle s’applique : « This is my understanding of systems… not going to be 100% complete or accurate » (traduction) : « Voici ma compréhension des systèmes… elle ne sera pas complète ou exacte à 100 % ».)
Ailleurs dans le secteur
- r/TechSEO — communauté consacrée au diagnostic exploration/indexation/classement.
- Google Says ‘Discovered - Currently Not Indexed’ Status Can Last Forever (Search Engine Journal) — citations exactes de John Mueller sur les raisons pour lesquelles « currently not indexed » peut persister indéfiniment.
- Links are not a top 3 Google Search ranking factor, says Gary Illyes (Search Engine Land) — Illyes explique pourquoi le classement repose sur de nombreux signaux et pourquoi les liens ne figurent pas parmi les trois principaux.
- Bing’s search ranking factors (Search Engine Land) — les six facteurs nommés de Bing (pertinence, qualité/crédibilité, engagement, fraîcheur, localisation, temps de chargement).
- Google’s Gary Illyes Explains What Caffeine Does (Search Engine Roundtable) — Illyes sur les six fonctions du système d’indexation Caffeine de Google.
- JavaScript SEO basics (Google Search Central) — place du rendu dans l’indexation et indexabilité du contenu produit par JavaScript.
- A guide to Google Search ranking systems (Google Search Central) — liste officielle des systèmes de classement et distinction avec les mises à jour.
- Search Off the Record podcast (Google Search Relations) — Gary Illyes, Martin Splitt et John Mueller parlent de l’exploration, de l’indexation et du classement depuis l’intérieur de Google.
Podcasts
- Search Off the Record (Google Search Relations) — l’équipe Google (Gary Illyes, Martin Splitt, John Mueller) explique de l’intérieur l’exploration, l’indexation et le classement. C’est ce qui vous rapproche le plus des personnes qui construisent réellement le pipeline. Écouter
À quelle étape êtes-vous bloqué ? — outils pour vérifier chaque porte
Utilisez le même modèle des trois portes, avec les outils du site associés à chaque symptôme. Exécutez celui qui correspond à votre problème avant toute modification.
Exploration — la page n’est pas du tout explorée
- Vérifiez d’abord la réponse du serveur : HTTP Status Checker — confirme que l’URL ne renvoie pas un
4xxou5xxqui bloque la découverte. - Vérifiez les règles
robots.txt: Robots.txt Tester — teste si une URL donnée est interdite à Googlebot/Bingbot. Pour corriger le fichier lui-même, utilisez Robots.txt Generator. - Vérifiez la couverture du sitemap : Sitemap Validator — confirme que l’URL y figure et que le sitemap est bien formé. Créez-en un avec XML Sitemap Generator s’il manque entièrement.
- Cherchez les problèmes de redirection qui absorbent l’exploration : Redirect Checker pour un saut, Redirect Chain Mapper pour les chaînes et boucles.
- La réalité de l’activité des robots : Log File Analyzer — confirme si Googlebot/Bingbot a demandé l’URL et à quelle fréquence.
Indexation — explorée mais « currently not indexed », ou mauvaise URL affichée
- Confirmez l’URL retenue dans le cluster de doublons : Canonical Checker — compare la canonique déclarée à ce qui est réellement indexé.
- Vérifiez si Google voit la version rendue : Render Gap — compare le HTML brut au DOM rendu pour détecter le contenu qui ne franchit jamais le Web Rendering Service.
- Recoupez le statut d’indexation et les problèmes de couverture directement dans Google Search Console (outil tiers) : l’analyseur de journaux ci-dessus vous dit si la page a été explorée ; Search Console indique si elle a été indexée et pourquoi.
Diffusion / classement — indexée mais non classée, ou fonctionnalités absentes
- Confirmez que la page est éligible au résultat enrichi attendu : Rich Result Eligibility Checker et Schema Validator — un schéma cassé ou absent n’empêche pas l’indexation, mais bloque la fonctionnalité de recherche.
- Écartez un problème d’utilisabilité : Mobile-Friendly Tester, CWV Checker et Core Web Vitals History & Competitor Comparison pour les données terrain Core Web Vitals ; l’utilisabilité est l’un des cinq facteurs nommés de Google.
- Vérifiez les signaux de pertinence sur la page : On-Page SEO Checker — compare le contenu aux bases citées par Google pour le facteur « pertinence ».
- Lancez une analyse plus large d’un site ou d’une section : Scout Site Audit Free — utile lorsque vous ignorez quelle porte échoue et voulez une première passe sur plusieurs URL.
- Pour une analyse Search Console plus poussée (performances par requête, couverture, filtres) : Google Search Console CSV Analyzer.
Outils tiers utiles pour ce diagnostic (non créés sur ce site) : Google Search Console (statut d’indexation, rapports de couverture, inspection d’URL), Bing Webmaster Tools (équivalent Bing) et Screaming Frog (simulation d’exploration et audit en masse des canoniques et codes d’état).
Testez vos connaissances : fonctionnement de la recherche
Cinq questions rapides sur la manière dont Google explore, rend, indexe et diffuse. Choisissez une réponse à chaque question, puis vérifiez.
Journal des modifications
Mis à jour le 2 août 2026.
Résumé éditorial et détails enregistrés des changements.Détails des changements
-
Les notes détaillées des changements sont actuellement disponibles en anglais.
Comparaison complète indisponible — aucun instantané antérieur n’a été archivé pour cette révision.
Mis à jour le 25 juil. 2026.
Résumé éditorial et détails enregistrés des changements.Détails des changements
-
Les notes détaillées des changements sont actuellement disponibles en anglais.
Comparaison complète indisponible — aucun instantané antérieur n’a été archivé pour cette révision.
Mis à jour le 18 juil. 2026.
Résumé éditorial et détails enregistrés des changements.Détails des changements
-
Les notes détaillées des changements sont actuellement disponibles en anglais.
Comparaison complète indisponible — aucun instantané antérieur n’a été archivé pour cette révision.