Actualité : Le 20 août 2026, le Pew Research Center a publié une analyse de 490 000 pages web anglophones prélevées dans l'archive Common Crawl entre janvier 2021 et juillet 2026 : 10 % des pages de l'échantillon de juillet 2026 présentent des signes marqués de rédaction ou d'édition par une IA, contre environ 1 % en janvier 2021 (Pew Research Center, 20 août 2026).

Analyste de données devant un écran affichant une courbe croissante, dans un bureau sombre en fin de journée

Ce n'est pas la proportion qui surprend, c'est la vitesse à laquelle elle a été atteinte. En janvier 2021, environ une page sur cent portait les marqueurs statistiques d'une rédaction assistée par machine. En janvier 2026, c'est près d'une page sur dix pour les domaines en .com. Pew a mis un chiffre sur une impression que tous les éditeurs partageaient sans pouvoir la mesurer, et la méthode compte autant que le résultat.

Ce que Pew a mesuré, et comment

L'équipe Data Labs du Pew Research Center a collecté près d'un demi-million de pages anglophones dans Common Crawl, l'archive publique du web, sur cinq ans. Chaque texte a été passé dans un détecteur nommé Open Pangram, un modèle qui repère les régularités de vocabulaire et de construction plus fréquentes chez les modèles de langage que chez les auteurs humains.

Le chiffre de tête vient d'un échantillon aléatoire de 10 000 pages prélevées en juillet 2026 : 10 % montrent des signes significatifs de rédaction par IA. Pew ajoute immédiatement la nuance qui compte. Ce panier mélange des pages anciennes et récentes, dont beaucoup sont antérieures à ChatGPT et ne pouvaient donc pas être concernées. En ne conservant que les pages publiées après la sortie de ChatGPT, fin novembre 2022, la proportion dépasse un tiers.

C'est le second chiffre qui décrit la production éditoriale d'aujourd'hui. Sur le web anglophone récent, plus d'une page sur trois porte les traces d'un modèle de langage.

Tous les domaines ne sont pas logés à la même enseigne

La répartition est très inégale, et elle suit assez fidèlement la pression commerciale qui s'exerce sur chaque type de site. Voici les moyennes semestrielles publiées par Pew pour le point de janvier 2026.

DomaineJanvier 2021Janvier 2024Janvier 2026
.com1,09 %3,76 %9,35 %
.org0,83 %2,00 %4,59 %
.edu0,57 %1,70 %1,03 %
.gov0,41 %1,42 %0,76 %

Le commercial concentre le phénomène. Un site en .com a environ deux fois plus de chances de porter ces marqueurs qu'un site associatif, et dix fois plus qu'un site universitaire ou gouvernemental. Au départ du relevé, en 2021, les quatre familles se tenaient dans un mouchoir de poche, autour de 1 %. L'écart s'est creusé à mesure que la production de contenu est devenue un poste de coût à optimiser.

Les tics d'écriture des modèles sont devenus mesurables

La partie la plus utile de l'étude pour un éditeur n'est pas le pourcentage global, c'est le relevé des marqueurs. Pew a compté la fréquence des traits d'écriture sur les pages publiées après novembre 2022, en occurrences pour 10 000 mots.

Marqueur (pour 10 000 mots)Janvier 2023Janvier 2026Évolution
Tiret cadratin5,7911,19environ x2
Virgule d'Oxford34,0455,51+63 %
Vocabulaire typique des modèles11,9426,02plus du double
Parallélisme négatif0,872,36presque le triple

Le « parallélisme négatif » désigne la tournure « ce n'est pas X, c'est Y », devenue une signature reconnaissable. Le vocabulaire relevé par Pew comprend une liste explicite de termes surreprésentés : delve, tapestry, testament, underscore, pivotal, showcase, meticulous, intricate, landscape. Leurs équivalents français circulent tout autant dans les textes produits en série.

Pew pose lui-même la limite, et elle est importante : pris isolément, aucun de ces signes ne prouve quoi que ce soit. Les auteurs humains emploient des tirets cadratins et des virgules d'Oxford. Ces marqueurs ne deviennent lisibles qu'à l'échelle de très grands corpus, jamais sur un document unique.

Vos contenus ressemblent-ils à tous les autres ?

On analyse gratuitement votre visibilité réelle sur Google, ChatGPT et Perplexity, et on repère les pages qui n'apportent rien qu'un modèle n'aurait pu écrire à votre place.

Ce que ça change pour votre visibilité

Le mode de production n'est pas le problème. Il faut le redire, parce que l'étude va être lue de travers. Google ne sanctionne pas l'usage d'une IA. Ses règles anti-spam visent le scaled content abuse, qu'elles définissent comme le fait de générer de nombreuses pages « dans le but principal de manipuler le classement et non d'aider les utilisateurs ». Le texte mentionne bien l'emploi d'outils d'IA générative, mais toujours assorti de la même condition : sans apporter de valeur aux utilisateurs. Nous avions détaillé cette distinction dans Google ne pénalise pas le contenu IA, mais le mauvais contenu.

Le vrai risque est la banalisation. Si plus d'un tiers des pages récentes portent la même signature stylistique, alors ressembler à la moyenne devient un handicap concurrentiel. Un article correct et parfaitement interchangeable ne donne à personne de raison de le classer devant un autre. C'est le mécanisme que nous avions observé sur un corpus de sites publiant à la chaîne, décrit dans notre analyse de la production de contenu à l'échelle, et dans les vagues de désindexation qui ont suivi.

Pour la citation par les IA, l'enjeu est encore plus direct. Un moteur de réponse choisit quelques sources parmi des milliers de pages qui disent la même chose. Ce qui départage, c'est ce que votre page contient et que les autres n'ont pas : un chiffre que vous avez mesuré, un cas client, une méthode, un désaccord argumenté. Une page qui ne fait que reformuler le consensus n'offre aucune prise. Nous avions montré, à partir d'une autre enquête Pew sur les résumés générés, à quel point l'espace de citation se resserre.

Ce qu'il faut faire maintenant

1. Reprenez vos pages publiées depuis 2023. Pas pour traquer l'IA, l'exercice serait vain. Pour vérifier, page par page, qu'elle affirme au moins une chose que vous êtes seul à pouvoir écrire. Si la réponse est non, la page est un doublon supplémentaire.

2. Faites relire par quelqu'un qui exerce le métier. C'est le seul filtre qui attrape ce qu'un détecteur ne voit pas : l'exemple qui sonne faux, la nuance absente, l'objection que tout praticien aurait soulevée.

3. Passez vos textes au crible des marqueurs. Nous faisons tourner un contrôle automatique sur chaque article avant publication, y compris pour celui-ci. Il bloque le départ en production si la densité de tournures typiques dépasse un seuil. Les marqueurs relevés par Pew recoupent presque exactement notre propre liste, ce qui est plutôt rassurant sur la méthode et assez inconfortable sur la banalité du procédé.

4. Sourcez nommément. « Des études montrent que » est la formule la plus produite par les modèles et la moins vérifiable. Citer Pew, avec sa date et ses limites, coûte trois minutes et change la nature du texte.

5. Ne confondez pas détection et sanction. Aucun détecteur n'est branché sur le classement de Google. Ce qui se dégrade en cas de production en série, c'est l'utilité perçue, pas un score de machine.

Les limites de cette étude

Il faut la lire pour ce qu'elle est. Pew reconnaît que « les modèles de détection ne sont pas parfaits » et qu'ils classent parfois à tort un texte humain comme marqué par l'IA, et inversement. Les résultats valent au niveau agrégé, pas au niveau d'un document.

L'échantillon est exclusivement anglophone. Aucune donnée n'est publiée ici pour le web francophone, et rien ne garantit que les ordres de grandeur soient transposables. Common Crawl échantillonne le web sans le couvrir intégralement, avec ses propres biais de collecte. Enfin, l'étude mesure la présence de marqueurs stylistiques, pas la qualité des contenus, et encore moins leur performance dans les résultats de recherche. Elle ne dit rien du classement.

Questions fréquentes

Google pénalise-t-il le contenu écrit par une IA ?

Non, pas sur le critère du mode de production. Les règles anti-spam de Google visent le « scaled content abuse », défini comme le fait de générer de nombreuses pages dans le but principal de manipuler le classement plutôt que d'aider les utilisateurs. Le texte cite explicitement l'usage d'outils d'IA générative pour produire beaucoup de pages sans apporter de valeur. Le critère est l'intention et la valeur, pas l'outil.

10 % ou un tiers : quel chiffre faut-il retenir ?

Les deux mesurent des choses différentes. 10 % est la part de l'échantillon global de juillet 2026, qui mélange des pages anciennes et récentes. Plus d'un tiers est la part obtenue en ne gardant que les pages publiées après la sortie de ChatGPT, fin novembre 2022. Pour juger de la production éditoriale actuelle, c'est le second chiffre qui est pertinent.

L'étude couvre-t-elle le web francophone ?

Non. Pew précise que l'échantillon porte sur 490 000 pages en langue anglaise issues de Common Crawl. Aucune donnée équivalente n'est publiée pour le français dans cette étude. Les ordres de grandeur ne sont donc pas transposables tels quels au web francophone.

Un tiret cadratin signifie-t-il que mon texte sera détecté comme IA ?

Non. Pew le dit explicitement : pris isolément, un tiret cadratin ou une virgule d'Oxford ne prouvent rien, puisque les auteurs humains les utilisent aussi. Ces marqueurs ne deviennent significatifs qu'à l'échelle statistique, sur de très grands corpus. Un détecteur appliqué à un seul document se trompe dans les deux sens, ce que Pew reconnaît pour son propre outil.

L'analyse Cicéro

L'information n'est pas que le web se remplit de textes produits par des machines, tout le monde s'en doutait. C'est qu'il existe désormais une mesure publique, datée et méthodologiquement lisible de ce phénomène, et que cette mesure décrit une signature stylistique commune. Quand un tiers de la production récente partage les mêmes tournures, la ressemblance devient le problème.

Notre lecture est simple. La question à se poser avant de publier n'est plus « est-ce que ce texte a été écrit par une IA », qui n'intéresse ni Google ni vos lecteurs. C'est « est-ce que cette page contient quelque chose que personne d'autre ne pouvait écrire ». Sur ce critère, la plupart des calendriers éditoriaux ne survivent pas à un audit honnête.

Sources

Alexis Dollé, fondateur de Cicéro
Alexis Dollé
CEO & Fondateur

Spécialiste du growth et de la stratégie de contenu SEO & GEO, j'ai lancé Cicéro pour aider les entreprises à capter une visibilité organique durable : sur Google comme dans les réponses des IA. Chaque contenu qu'on produit est pensé pour convertir, pas juste pour exister.

LinkedIn