Glosario

Explore Meshline

Products Pricing Blog Support Log In

Ready to map the first workflow?

Book a Demo
Operaciones autónomas

Cómo encontrar contenido duplicado y decidir: corregir, canonicalizar o diferenciar

Encuentra páginas duplicadas con un rastreo y usa el marco de corregir, canonicalizar o diferenciar para resolver cada clúster y alinear la canónica elegida por Google con la tuya.

Una ilustración editorial plana sobre un fondo neutro con textura que muestra dos formas rectangulares superpuestas que representan ventanas de navegador, una en turquesa y otra en un tono más claro.

El contenido duplicado suena alarmante, pero el propio Google señala que cierta duplicación es normal y no constituye una violación de sus políticas de spam.

El costo real es más sutil.

El mismo contenido distribuido en muchas URLs puede confundir a los visitantes y dividir tus datos de rendimiento.

También puede hacer que Google apunte a los buscadores hacia una página que no pretendías promocionar.

Esta guía explica cómo encontrar páginas duplicadas en tu sitio y cómo identificar cuáles realmente importan.

Así podrás elegir entre tres respuestas: corregir los duplicados, canonicalizarlos o diferenciar el contenido para que cada página gane su lugar.

Por qué aparece contenido duplicado en sitios saludables

La duplicación rara vez es señal de descuido.

Google enumera causas comunes que afectan a casi todos los sitios.

Las variantes regionales incluyen URLs separadas para EE.

UU. y Reino Unido con el mismo contenido en el mismo idioma.

Las variantes de dispositivo incluyen versiones móviles y de escritorio separadas.

Las variantes de protocolo incluyen HTTP y HTTPS.

Las funciones del sitio incluyen el ordenamiento y filtrado en páginas de categoría.

Las variantes accidentales incluyen un sitio de demostración o de staging dejado accesible a los rastreadores.

El contenido traducido es un caso especial.

Google considera que las versiones en distintos idiomas son duplicados solo si el contenido principal está en el mismo idioma.

Si solo el encabezado, el pie de página y la navegación están traducidos, pero el cuerpo del texto sigue igual, esas páginas siguen siendo duplicados a ojos de Google.

Conocer la causa importa porque define la solución.

Un entorno de staging abierto a los rastreadores necesita controles de acceso, no etiquetas canónicas.

Las variantes regionales necesitan hreflang junto con la canonicalización.

Un filtro que genera permutaciones infinitas de URLs requiere un tratamiento distinto.

Cómo maneja Google los duplicados

Cuando Google indexa una página, identifica el contenido principal.

Si encuentra varias páginas iguales o muy similares, las agrupa en un clúster.

De ellas elige una página canónica: la versión más completa y útil para los usuarios de búsqueda.

La página canónica se rastrea con más regularidad; los duplicados se rastrean con menos frecuencia para reducir la carga en tu servidor.

De esto se desprenden dos consecuencias.

Primera: Google usa la página canónica como fuente principal para evaluar el contenido y la calidad, así que la versión que elige es la que sostiene tu rendimiento en búsqueda.

Segunda: tu preferencia canónica es una sugerencia, no una regla.

Google puede elegir una página distinta a la que indicaste, según la calidad del contenido y las señales técnicas.

Paso uno: rastrea tu sitio en busca de duplicados exactos y casi duplicados

La forma más práctica de encontrar duplicados a escala es un rastreador como el SEO Spider de Screaming Frog.

Su flujo de trabajo documentado te ofrece dos filtros útiles:

  • Duplicados exactos. La herramienta calcula un hash del HTML completo de cada página y marca las páginas con valores de hash idénticos. Son copias byte a byte, causadas a menudo por variantes con o sin barra final, discrepancias de protocolo o la misma página publicada en dos rutas.
  • Casi duplicados. Tras el rastreo, ejecuta el análisis de rastreo para poblar el filtro de casi duplicados. Usa un umbral de similitud, configurado en 90% por defecto, y compara el texto de la página en lugar del HTML completo. La columna 'Closest Similarity Match' muestra qué tan similar es cada página respecto a su coincidencia más cercana.

Antes de rastrear, conviene refinar el área de contenido que la herramienta analiza.

Elementos repetitivos como la navegación, los pies de página y los menús móviles pueden inflar las puntuaciones de similitud.

Screaming Frog permite incluir o excluir etiquetas, clases e IDs de HTML específicos para que el análisis se concentre en el contenido principal del cuerpo.

Los duplicados exactos suelen ser inequívocos: elige una versión canónica, redirige las demás hacia ella y deja de enlazar internamente a los duplicados.

Los casi duplicados requieren criterio, y ese es el siguiente paso.

Paso dos: revisa los casi duplicados con la intención en mente

La guía de Screaming Frog es directa: las páginas casi duplicadas deben revisarse manualmente.

Existen muchas razones legítimas para que dos páginas sean muy similares.

Dos páginas de producto para variantes que la gente busca por atributos específicos pueden merecer existir por separado.

Dos artículos de blog que cubren la misma pregunta desde ángulos ligeramente distintos probablemente no.

Una pregunta de revisión útil para cada par marcado: si un buscador llegara a cualquiera de las dos páginas, ¿obtendría una respuesta significativamente diferente?

Si no, las páginas compiten entre sí y una de ellas debería desaparecer, o ambas deberían fusionarse en algo más completo.

Esta revisión también es donde detectas duplicación que un rastreador no ve: el mismo artículo sindicado en sitios de socios, o un sitio copia que republica tu contenido.

La documentación de solución de problemas de Google cubre ambos casos.

Señala que el elemento canónico no se recomienda para manejar socios de sindicación, porque las páginas suelen ser muy diferentes.

La vía más eficaz es que los socios bloqueen la indexación de tu contenido.

Paso tres: verifica qué canónica eligió Google realmente

Cuando ya sabes qué páginas están agrupadas, comprueba si la canónica elegida por Google coincide con la tuya.

La herramienta de inspección de URLs de Google muestra qué página considera canónica para una URL determinada.

Si difiere de tu preferencia, pregúntate si la elección de Google en realidad tiene más sentido para los usuarios que llegan desde la búsqueda antes de combatirla.

Si el desajuste proviene de un problema técnico, los culpables comunes están documentados.

Incluyen elementos canónicos incorrectos inyectados por un CMS o un plugin.

Otras causas son servidores mal configurados que devuelven contenido del dominio equivocado.

También los ataques maliciosos que insertan canónicas entre dominios o redirigen a URLs de spam.

Revisa tu HTML renderizado en las herramientas de desarrollador de tu navegador y escala al proveedor de tu CMS o de hosting cuando el problema esté fuera de tu control.

Corregir, canonicalizar o diferenciar: elegir la respuesta

Cada duplicado que encuentres corresponde a una de tres respuestas.

La elección depende de por qué existe la página y de si cumple un propósito distinto.

Corrige la duplicación en el origen

Usa esto cuando los duplicados son accidentes: un sitio de staging rastreable o una discrepancia de protocolo.

También un filtro que genera variantes de URL o un plugin del CMS con canónicas erróneas.

La solución es técnica, no editorial.

Elimina el acceso a la versión accidental o corrige la configuración, y el clúster puede resolverse una vez que la versión accidental desaparezca.

Canonicalizar

Usa esto cuando varias URLs deben existir por razones funcionales, pero solo una debería ser la versión representativa.

Los parámetros de ordenamiento y filtrado, las versiones para imprimir y las variantes regionales en el mismo idioma encajan aquí.

Conservas las URLs pero señalas cuál cuenta, mediante anotaciones canónicas, redirecciones y, para variantes regionales, hreflang.

Acepta que Google lo trata como una sugerencia y puede seguir en desacuerdo.

Diferenciar el contenido

Usa esto cuando ambas páginas tienen una razón genuina para existir, pero han derivado hacia la similitud.

Dos páginas de servicio dirigidas a audiencias contiguas deben reescribirse.

Lo mismo aplica a dos guías que responden preguntas relacionadas pero distintas.

Cada una debe tener contenido principal claramente único.

El consejo de Google hace explícito el objetivo: resolver la canonicalización consiste en garantizar que las páginas agrupadas sean suficientemente diferentes.

Hay una cuarta opción que vale la pena nombrar: la consolidación.

Cuando dos páginas casi duplicadas tienen bajo rendimiento y ninguna tiene una audiencia distinta, fusionarlas suele ser el resultado más limpio.

Creas una página más fuerte y rediriges la URL más débil.

Es el mismo juicio que decidir si las páginas huérfanas deben fusionarse o eliminarse, y el proceso de revisión se parece.

Qué esperar después de hacer cambios

Fija expectativas antes de empezar.

Según Google, incluso tras corregir el contenido, las páginas pueden permanecer en un clúster de duplicados hasta dos semanas mientras las reevalúa.

Las páginas salen del clúster más rápido cuando la diferencia con las demás es clara y significativa.

Una reescritura sustancial supera a una edición superficial.

Puedes pedir a Google que reevalúe URLs importantes mediante la función Solicitar indexación de la herramienta de inspección de URLs.

Como la función está sujeta a cuotas, Google aconseja reservarla para tus URLs más importantes en lugar de enviar cada cambio.

Espera también un cambio en el patrón de rastreo.

Como las páginas canónicas se rastrean con más regularidad que los duplicados, resolver un clúster concentra la atención de rastreo en la página que sobrevive.

Eso suele ser lo que quieres, pero conviene saberlo para no malinterpretar los datos de rastreo posteriores a la corrección como un problema.

Una secuencia práctica de auditoría

  1. Rastrea el sitio y registra los duplicados exactos y casi duplicados, anotando las puntuaciones de similitud y la causa probable de cada clúster.
  2. Consulta la herramienta de inspección de URLs para los clústeres más importantes y registra qué canónica eligió Google realmente.
  3. Clasifica cada clúster: duplicación accidental, duplicación funcional o páginas que deberían diferenciarse o fusionarse.
  4. Aplica la corrección correspondiente: ajuste técnico, canonicalización con hreflang cuando aplique, o una reescritura de contenido que haga la diferencia inconfundible.
  5. Solicita reindexación solo para tus URLs prioritarias y dale tiempo a Google para reevaluar antes de juzgar el resultado.

Para los equipos que ejecutan programas de contenido continuos, la solución más profunda es preventiva.

Una regla clara de clasificación en la recepción de contenido evita que la mayoría de los casi duplicados se creen desde el principio.

Decide si una nueva idea es una página nueva o una actualización de una existente.

La misma disciplina que mantiene limpia la arquitectura de tu sitio también mantiene honesto tu flujo de publicación sobre para qué sirve cada página.

Dónde encaja la duplicación en tus operaciones de contenido más amplias

El contenido duplicado rara vez aparece solo.

Suele presentarse junto con páginas huérfanas y temas cubiertos dos veces por escritores distintos.

Los tres apuntan a la misma causa raíz: decisiones de contenido tomadas sin un mapa de lo que ya existe.

Si estás auditando la estructura del sitio, combina la revisión de contenido duplicado con una revisión de páginas huérfanas.

Los operadores que coordinan contenido entre equipos y herramientas pueden reducir esta deriva haciendo visible el inventario de páginas existente en la etapa de planificación.

Los escritores y los flujos de automatización entonces verifican antes de crear.

Esa es una respuesta operativa a lo que parece un problema de SEO, y suele ser la más duradera.

El contenido duplicado es un diagnóstico, no una sentencia.

Encuentra los clústeres, entiende por qué existe cada uno y elige la respuesta que corresponda a la causa.

La mayoría de los sitios necesita una mezcla de correcciones, canónicas y algunas reescrituras honestas.

La recompensa es un sitio donde cada URL tiene una función clara.

Referencias de fuente: developers.google.com; developers.google.com; www.screamingfrog.co.uk.

Cómo puede ayudarte Meshline.

Conecta la automatización, el Marketing Orgánico (generación de demanda) y la gestión del ciclo de vida del cliente (Revenue Intelligence).

Integra la planificación de temas, la publicación de contenido y la retroalimentación de rendimiento en la conversación sobre tu flujo de trabajo. Agenda una demo de Meshline.

Revenue Intel

Consúltanos sobre este flujo de trabajo.

Cuéntanos qué quieres mejorar o automatizar. Te responderemos con el siguiente paso más útil.

Agenda una demo

Decisiones de implementación

Lleva esta idea a tu operación

Antes de invertir en Cómo encontrar contenido duplicado y decidir: corregir, canonicalizar o diferenciar, define el problema, los datos disponibles y quién revisará el resultado.