Bienvenue sur le nouveau site d’Elev8 Lab : des guides SEO, GEO et acquisition, testés et sourcés. Découvrir les guides

EN, English version
Accueil / Blog / SEO / Contenu dupliqué : le repérer, le corriger

Contenu dupliqué : le repérer, le corriger

Le contenu dupliqué inquiète souvent plus qu’il ne devrait. Google ne sanctionne pas les doublons ordinaires : il en choisit un et laisse les autres de côté. Le vrai coût est plus discret, avec une mauvaise URL dans les résultats, des liens dispersés et un robot qui explore des copies. Ce guide explique ce que dit Google du contenu dupliqué, d’où il vient sur un site, comment le repérer avec la Search Console et un crawler, et quelle solution retenir entre redirection 301, balise canonique, noindex et hreflang. Il traite aussi le cas d’un site qui copie vos textes.

L’essentiel

Le contenu dupliqué désigne un même texte accessible à plusieurs URL, sur un site ou entre plusieurs sites. Google ne le sanctionne pas en soi : il regroupe les doublons et n’en affiche qu’un. Le risque est ailleurs : mauvaise URL affichée, signaux dispersés, exploration gaspillée. La copie à des fins de manipulation relève, elle, du spam.

  • Une page = une URL : redirection 301 ou balise canonique pour les variantes.
  • La Search Console montre quelle version Google a retenue.
  • La copie de contenus tiers pour manipuler le classement est du spam.

Qu’est-ce que le contenu dupliqué ?

Le terme anglais « duplicate content » signifie contenu en double. On parle de contenu dupliqué quand un contenu identique ou très proche est accessible à plusieurs adresses.

Définition

Le contenu dupliqué est un contenu identique ou quasi identique disponible à plus d’une URL. Il est interne sur un même site, externe entre sites différents.

Deux cas se distinguent. Le doublon exact : même HTML, par exemple une page accessible avec et sans paramètre de suivi. Le quasi-doublon : même texte principal avec de petites variations. C’est le cas de deux fiches produits qui ne diffèrent que par la couleur.

Le plus souvent, la duplication est technique et involontaire. Le CMS, les filtres, les paramètres d’URL ou les versions régionales multiplient les adresses d’une même page. Personne ne l’a décidé.

Le contenu dupliqué entraîne-t-il une pénalité Google ?

Non, tant qu’il n’y a pas d’intention de manipulation. Google l’écrit dans sa page sur la canonicalisation (mise à jour le 20/08/2026). Une part de contenu en double sur un site est normale et n’enfreint pas ses règles relatives au spam.

Son guide du fonctionnement de la recherche décrit ce qui se passe. Pendant l’indexation, Google regroupe les pages similaires et choisit une URL canonique, la plus représentative du groupe. C’est elle qui apparaît dans les résultats. Les autres restent connues mais peu affichées.

Le contenu dupliqué coûte donc sans pénalité :

  • La mauvaise URL affichée : Google peut retenir une version avec paramètres ou une page de tri.
  • Des signaux dispersés : les liens reçus se répartissent entre plusieurs adresses au lieu de se cumuler.
  • Une exploration gaspillée : le robot passe du temps sur des copies au lieu des pages nouvelles.
  • Un suivi faussé : trafic et positions éclatés entre plusieurs URL dans vos rapports.

La limite est nette. Les règles anti-spam de Google (mises à jour le 28/08/2026) visent le « scraping ». Il consiste à reprendre le contenu d’autres sites, souvent de façon automatisée, pour manipuler le classement. Là, le risque de sanction est réel.

D’où vient le contenu dupliqué sur un site ?

Google cite cinq familles de causes : variantes régionales, d’appareil, de protocole, fonctions du site et variantes accidentelles. Sur le terrain, elles prennent ces formes :

CauseExempleTraitement habituel
Protocole et hôtehttp:// et https://, avec et sans wwwRedirection 301 vers une seule version
Slash final, majuscules/page et /page/, /Page/Redirection 301 et liens internes cohérents
Paramètres d’URL?utm_source=, ?tri=prix, ?session=Balise canonique vers l’URL sans paramètre
Filtres et trisCatégorie filtrée par couleur ou prixCanonique ou noindex selon la demande de recherche
Taxonomies du CMSÉtiquettes, archives par date ou par auteurNoindex si aucune valeur propre
Versions régionalesfr-FR et fr-BE au texte identiquehreflang entre les versions
Textes reprisDescriptions fournisseur, articles republiésRéécriture ou canonique vers l’original
Environnements de testPréproduction accessible et indexéeProtection par mot de passe
Causes courantes de contenu dupliqué et traitements usuels.

Pour les versions régionales, Google apporte une précision dans sa documentation sur les versions localisées (mise à jour le 21/09/2026). Elles ne comptent comme doublons que si le contenu principal n’est pas traduit. Des pages dans la même langue pour deux pays doivent donc être reliées par des annotations hreflang.

Comment détecter le contenu dupliqué ?

  1. Lire la Search Console : dans l’inspection d’URL, comparez « URL canonique déclarée par l’utilisateur » et « URL canonique sélectionnée par Google ». Le rapport d’indexation liste aussi les pages « En double ». Voir notre article sur l’indexation Google.
  2. Crawler le site avec un outil comme Screaming Frog. Selon son tutoriel sur les doublons, il repère les doublons exacts par empreinte MD5 du HTML. Les quasi-doublons passent par l’algorithme minhash, avec un seuil de similarité réglé à 90 % par défaut.
  3. Comparer les balises : titles, meta descriptions et H1 identiques sur plusieurs URL signalent souvent des pages trop proches.
  4. Chercher une phrase exacte entre guillemets dans Google pour repérer les copies externes de vos textes.

Conseil

Le seuil de 90 % est un réglage d’outil, pas une règle Google. Aucun taux de similarité « acceptable » n’est publié. Jugez au cas par cas. Deux pages qui répondent à la même intention gagnent souvent à être fusionnées, même si leurs textes diffèrent.

Quelle solution choisir contre le contenu dupliqué ?

Google classe les signaux de canonicalisation par force dans sa page Spécifier une URL canonique (mise à jour le 10/07/2026). Redirection permanente et balise rel="canonical" sont des signaux forts. La présence dans le sitemap est un signal faible.

SolutionQuand l’utiliserEffet
Redirection 301La variante n’a pas besoin de rester accessibleSignal fort, l’utilisateur arrive sur la bonne page
Balise canoniqueLa variante doit rester visible (tri, suivi, impression)Signal fort, indicatif et non impératif
SitemapLister uniquement les URL canoniquesSignal faible, en complément
NoindexPage utile aux visiteurs mais sans valeur de rechercheRetire la page de l’index
HreflangVersions linguistiques ou régionalesAssocie les variantes au lieu de les opposer
Fusion ou réécritureDeux pages sur la même intentionSupprime la cause
Solutions contre le contenu dupliqué (Google Search Central, 10/07/2026).

La balise canonique est définie par la RFC 6596 de l’IETF (avril 2012). Elle se place dans le head de chaque variante :

<link rel="canonical" href="https://www.exemple.fr/chaussures-running/">

Chaque page indexable porte aussi une canonique vers elle-même. Elle neutralise les paramètres ajoutés par des liens externes. Les règles de mise en œuvre sont détaillées dans notre guide de l’URL canonique.

Attention : robots.txt et suppression d’URL

Google déconseille d’utiliser le robots.txt ou l’outil de suppression d’URL pour traiter les doublons. Une URL bloquée ne peut pas transmettre ses signaux à la version canonique.

Que faire si un autre site copie votre contenu ?

Commencez par vérifier que votre page est bien indexée et qu’elle apparaît avant la copie sur une phrase exacte. Si c’est le cas, l’impact est souvent faible.

  • Partenaire de syndication : demandez une balise canonique vers votre article original, ou un noindex sur la copie.
  • Copie sans autorisation : contactez l’éditeur, puis l’hébergeur. En dernier recours, déposez auprès de Google une demande de retrait pour atteinte aux droits d’auteur.
  • Copie massive et automatisée : elle relève du scraping au sens des règles anti-spam de Google. Vous pouvez la signaler.

Traiter le contenu dupliqué relève du SEO technique, un chantier présenté dans notre guide du SEO. La meilleure prévention reste éditoriale : une page par intention et des textes propres à chaque page.

Questions fréquentes

Que signifie « duplicate content » ?

C’est l’expression anglaise pour contenu dupliqué : un contenu identique ou très proche accessible à plusieurs URL. Elle recouvre la duplication interne, sur un même site, et externe, entre sites différents.

Le contenu dupliqué est-il pénalisé par Google ?

Non. Google indique qu’une part de contenu en double est normale et n’enfreint pas ses règles. Il choisit une URL canonique et affiche celle-ci. Seule la reprise de contenus d’autres sites dans le but de manipuler le classement est traitée comme du spam.

Quel taux de similarité est acceptable entre deux pages ?

Google ne publie aucun seuil. Les 90 % souvent cités correspondent au réglage par défaut de Screaming Frog pour détecter les quasi-doublons. Le bon critère est l’intention : deux pages qui répondent à la même question gagnent à être fusionnées.

Faut-il une balise canonique ou une redirection 301 ?

La redirection 301 si l’ancienne URL n’a plus de raison d’être accessible. La balise canonique si la variante doit rester consultable, par exemple une page triée ou une URL avec paramètre de suivi. Google traite les deux comme des signaux forts.

Les descriptions de produits du fabricant posent-elles problème ?

Elles créent une duplication externe avec tous les revendeurs qui les reprennent. Google n’applique pas de sanction, mais il n’a aucune raison de préférer votre page. Réécrivez en priorité les fiches des produits qui comptent pour votre chiffre d’affaires.

Sources

  1. Google Search Central, Qu’est-ce que la canonicalisation ?, mis à jour le 20/08/2026. Consulté le 24/09/2026.
  2. Google Search Central, Spécifier une URL canonique avec rel=canonical et d’autres méthodes, mis à jour le 10/07/2026. Consulté le 24/09/2026.
  3. Google Search Central, Guide sur le fonctionnement de la recherche Google, mis à jour le 18/12/2025. Consulté le 24/09/2026.
  4. Google Search Central, Règles relatives au spam pour la recherche Google, mis à jour le 28/08/2026. Consulté le 24/09/2026.
  5. Google Search Central, Indiquer à Google les versions localisées de votre page, mis à jour le 21/09/2026. Consulté le 24/09/2026.
  6. Screaming Frog, How To Check For Duplicate Content, publié le 07/07/2020, mis à jour le 07/10/2025. Consulté le 24/09/2026.
  7. IETF, RFC 6596 : The Canonical Link Relation, avril 2012. Consulté le 24/09/2026.
Avatar de Baptiste Clair

Consultant marketing digital, SEO et GEO

En savoir plus sur l'auteur

Article vérifié et mis à jour par l'auteur. Sources consultées à la date indiquée.

Citer cet article

Clair, B. (2026, 24 septembre). Contenu dupliqué : le repérer, le corriger. Elev8 Lab. https://elev8-lab.fr/seo/contenu-duplique/