La importancia del Content Effort para Google y cómo medirlo

Para los SEOs en la actualidad, publicar más contenido no es el problema, es saber si aquello que publicamos merece existir. Y tanto en las Directrices para Evaluadores (QualityRaters Guidelines) de Google, como en las filtraciones de la Google API documentation encontramos pistas de como medirlo. En esa documentación vimos  "contentEffort": (LLM-based effort estimation) y "ugcDiscussionEffortScore": UGC (user-generated content) page quality signals.

Durante años hemos medido la producción editorial con indicadores fáciles de contar: número de artículos, palabras publicadas, frecuencia, posiciones o tráfico. Son métricas útiles, pero no responden a una pregunta bastante más incómoda: ¿cuánto trabajo intelectual y editorial aporta realmente esta página?

Dos textos pueden tener la misma extensión, una estructura SEO correcta y una redacción impecable. Sin embargo, uno puede limitarse a reorganizar lo que ya aparece en diez resultados de Google, mientras que el otro incorpora pruebas propias, cálculos, una comparación útil o una perspectiva basada en experiencia real. Desde fuera parecen similares, pero para el lector no lo son.

Hace unos dias leía un post de Cyrus Shepard sobre este tema, y se me ocurrió la idea de construir algo para intentar evaluar o medir el "Content Effort" tal como podría estar haciéndolo Google.

Ese es el problema que he intentado resolver con este proyecto: convertir el Content Effort en algo observable, discutible y medible, obviando si existe o no, una fórmula perfecta ni una puntuación secreta de Google. Así que creé un harness con un sistema de tres jueces, un contrato de medición versionado (Rúbrica 2.0.0), análisis de aporte semántico mediante embeddings y scripts determinísticos.

Google no tiene una métrica pública llamada Content Effort

Conviene empezar por aquí porque en SEO tenemos demasiada facilidad para transformar una recomendación en un supuesto factor de posicionamiento.

Google no ha publicado una métrica llamada Content Effort. Tampoco existe una documentación que diga que una página con una puntuación determinada vaya a posicionar mejor. Lo que sí existe es una dirección bastante clara.

En su documentación sobre contenido útil, fiable y creado para personas, Google propone revisar si una página ofrece información, investigación o análisis originales. Si aporta algo más que una reescritura de otras fuentes, si demuestra experiencia directa, y si proporciona un valor sustancial frente a otros resultados de búsqueda.

Las directrices sobre contenido generado con IA son todavía más explícitas: generar muchas páginas sin añadir valor puede vulnerar las políticas contra el abuso de contenido escalado. La propia documentación remite a las directrices de los evaluadores para identificar contenido principal creado con poco esfuerzo, poca originalidad y poco valor añadido.

Esto NO significa que los evaluadores humanos decidan qué página posiciona. Google aclara que sus valoraciones sirven para comprobar el funcionamiento de los sistemas y no influyen directamente en el ranking. Tampoco significa que nuestra rúbrica reproduzca un algoritmo interno de Google.

Lo que significa es algo más útil: originalidad, trabajo editorial, experiencia y valor incremental son conceptos suficientemente importantes como para que necesitemos una forma seria de auditarlos.

Qué entiendo por Content Effort

Para mí, el Content Effort es el trabajo verificable que convierte información disponible en una pieza que aporta utilidad real al usuario.

Un artículo de 3.000 palabras puede ser una parrafada inflada de cinco fuentes. Tampoco es medir cuánto tardó el autor, alguien puede dedicar dos días a escribir un texto desordenado que no aporta absolutamente nada. Y no es premiar automáticamente lo que está escrito por una persona frente a lo generado con IA.

Lo que intento observar es el resultado del trabajo:

  • qué se seleccionó y qué se eliminó
  • qué datos se calcularon o compararon
  • qué hechos o perspectivas son propios
  • qué recursos hubo que construir
  • si la respuesta importante aparece a tiempo
  • si se explican límites y alternativas
  • si el contenido conecta hechos que normalmente aparecen separados
  • si existe evidencia de experiencia directa

La IA puede participar en el proceso. El criterio sigue siendo el mismo: ¿el resultado añade conocimiento, reduce incertidumbre o ayuda a tomar una decisión? Automatizar la escritura no exime de realizar ese trabajo.

Cómo construimos la rúbrica 2.0.0

No quería montar otro semáforo SEO que devolviera un 82 sobre 100 basado en un cheklist sin explicar de dónde sale. Por eso la "rúbrica 2.0.0" funciona como un contrato de medición versionado. Seleccionado a partir de entrenamiento con un set de URLs (alta calidad, baja calidad y neutros) seleccionado por humanos (lo cual es subjetivo, pero es lo que intentamos medir probablemente).

Cada dimensión tiene una definición, una escala de 0 a 4 y anclajes que describen qué debe observarse para conceder cada puntuación. El juez no puede limitarse a decir que un contenido “parece profundo”. Tiene que citar fragmentos literales y explicar por qué esos fragmentos cumplen el criterio.

Las ocho dimensiones intrínsecas son estas:

Dimensión Qué mide
1. Curación y edición Selección, orden, estructura, eliminación de redundancias y claridad editorial.
2. Contenido derivado y computado Comparaciones, cálculos, clasificaciones o conclusiones construidas a partir de datos.
3. Hechos y perspectivas originales Hallazgos propios, observaciones verificables y una perspectiva sostenida que no se limita a repetir consensos.
4. Recursos de alto esfuerzo Gráficos, tablas derivadas, diagramas, imágenes anotadas o elementos interactivos creados para explicar.
5. Contenido útil prominente Rapidez con la que el lector encuentra el problema, la respuesta y la información accionable.
6. Calidad de la discusión Tratamiento de matices, objeciones, límites, riesgos y alternativas antes de concluir.
7. Profundidad más allá de hechos comunes Conexiones no obvias y explicaciones que producen una comprensión nueva.
8. Autoría y experiencia Pruebas de uso, comprobaciones, procedimientos, resultados y aprendizaje de primera mano.

Cada una aporta entre 0 y 4 puntos. El resultado intrínseco se expresa sobre 32 puntos.

Esta separación importa porque un artículo puede tener una edición excelente y ninguna investigación propia. Otro puede aportar una prueba muy valiosa, pero esconderla detrás de una introducción interminable. Un único número permite comparar; las dimensiones permiten mejorar.


Como ejemplo, para la dimensión la dimensión “3. Hechos y perspectivas originales” busca señales de que la página aporta algo más que información genérica o una reformulación de una única fuente. Pasándo este análisis a un artículo reciente de mi blog la evaluación sería algo así:

Sus anclas son:

PuntosQué exige
0Solo hay hechos genéricos, conocimiento común o reproducción evidente de una fuente.
1Aparece algún dato específico, pero no se explica su origen o método.
2Existen datos con contexto ligero de procedencia, pero sin interpretación propia.
3Hay al menos una afirmación, comparación, síntesis o interpretación claramente propia, apoyada con evidencia específica.
4Hay tres o más aportaciones originales distintas, o una perspectiva original sostenida, respaldada por evidencia verificable.

Ejemplo simplificado

Nivel 0

“El SEO ayuda a mejorar la visibilidad.”

Es una afirmación genérica.

Nivel 1

“El tráfico aumentó un 37 %.”

Es específica, pero no sabemos de dónde salió el dato.

Nivel 2

“Según el informe de 2025, el tráfico aumentó un 37 %.”

Tiene procedencia, pero simplemente reproduce la fuente.

Nivel 3

“Al comparar el crecimiento del 37 % con la caída de conversiones, observamos que el nuevo tráfico tenía menor intención comercial.”

Existe una interpretación propia apoyada en datos.

Nivel 4

El artículo desarrolla varias conclusiones distintas (por ejemplo, sobre tráfico, conversión y retención) o mantiene una tesis original durante todo el texto, conectando evidencias concretas.

Cómo funciona un análisis

El proceso empieza antes de llamar a ningún modelo. Primero descargamos la página y extraemos su contenido principal. Guardamos la instantánea, el texto extraído y sus hashes. Así sabemos exactamente qué versión se evaluó y podemos repetir el análisis sin depender de que la URL cambie al día siguiente.

Después se prepara una solicitud que contiene la versión exacta de la rúbrica, el texto de la página, el esquema de respuesta y los identificadores que vinculan la evaluación con esa instantánea.

Esa misma solicitud se entrega a tres jueces aislados. En la configuración que hemos utilizado, los tres trabajan con gpt-5.6-sol y esfuerzo de razonamiento high. No ven las respuestas de los demás y no negocian una puntuación conjunta.

Cada juez devuelve JSON estricto con:

  1. Una puntuación de 0 a 4 para cada dimensión
  2. Las citas literales que respaldan esa puntuación
  3. Una justificación vinculada a los anclajes de la rúbrica
  4. El total de su evaluación
  5. La procedencia del modelo, protocolo y nivel de razonamiento

La respuesta pasa después por validadores deterministas para descartar alucinaciones y errores. El esquema debe ser correcto, las ocho dimensiones deben aparecer en el orden esperado y cada cita debe existir realmente en el texto extraído. Si la evidencia de una dimensión no se puede verificar, esa puntuación se anula. No damos por buena una explicación convincente si no está respaldada por el contenido de la página.

Finalmente calculamos la mediana de los tres jueces para cada dimensión y registramos mínimo, máximo y rango. También conservamos la mediana de los totales individuales. Si los jueces discrepan, el informe la convierte en una señal que puede revisarse.

Por qué usamos tres jueces y no uno

Un modelo de lenguaje no es una función matemática. Puede interpretar de forma distinta un ejemplo, dar más peso a una evidencia o trazar de otro modo la frontera entre un 2 y un 3.

Usar tres jueces no elimina esa variabilidad, pero evita depender de una única lectura. La mediana reduce el efecto de una valoración extrema y el rango muestra cuándo el contrato todavía deja margen para interpretaciones distintas.

La clave no está solo en el número de jueces. Está en la combinación de controles:

  • Aislamiento entre evaluaciones
  • Mismo contrato para todos
  • Salida estructurada
  • Evidencias literales
  • Validación automática
  • Agregación explícita
  • Calibración con contenidos de referencia.

El modelo aporta capacidad de juicio semántico. La rúbrica, los validadores y la calibración evitan que ese juicio se convierta en una opinión imposible de auditar.

La dimensión 9: medir la ganancia de información

Las primeras ocho dimensiones analizan el contenido en sí mismo, pero faltaba una pregunta decisiva para Google: ¿qué aporta esta página que no esté ya cubierto por los resultados que compiten para la misma consulta?

Esa es la función de la dimensión 9. La ganancia de información no es una propiedad absoluta del texto. Depende de una consulta, un país, un idioma, un dispositivo y un momento. Una explicación puede ser novedosa para una SERP y completamente redundante para otra. El proceso parte de esos parámetros explícitos. 

Solicitamos a DataForSEO el top-10 orgánico de Google y guardamos la respuesta como una instantánea inmutable. Después descargamos y extraemos el contenido principal de los competidores. La página candidata y las páginas del top-10 se dividen en fragmentos semánticos. Generamos sus embeddings con BGE-M3 ejecutado localmente mediante LM Studio. Para cada fragmento relevante respecto de la consulta buscamos el contenido competidor semánticamente más próximo.

En términos prácticos, medimos dos cosas: si el fragmento ayuda a responder la consulta y cuánto se diferencia de la mejor cobertura ya disponible en la SERP. Los resultados se agregan con umbrales calibrados para producir una puntuación de 0 a 4.

Un párrafo distinto pero irrelevante no cuenta como novedad. Tampoco basta con cambiar palabras manteniendo la misma idea. Lo que buscamos es información relevante que amplíe, corrija, conecte o concrete aquello que el resto de resultados ya ofrece.

La dimensión 9 se presenta separada del total intrínseco. No convertimos 32 puntos en 36 porque estaríamos mezclando dos contratos diferentes, la calidad observable de la pieza de contenido, y su novedad respecto de una SERP concreta. Una página puede estar muy bien construida y aportar poca información nueva, o ser novedosa pero estar mal editada. Necesitamos ver ambas cosas.

Cuánto costaría cada análisis mediante API

Empecé a construir este harness con Claude, pero acabé terminándolo con ChatGPT, el de Anthropic vagueaba sobre ciertos temas, y tenía "demasiado interés" en que montara los jueces usando su API (con el coste extra que conlleva). Para calcular los precios, he utilizado los artefactos de un análisis real del proyecto. Entre los tres jueces se enviaron aproximadamente 29.826 tokens de entrada y se recibieron 5.579 tokens visibles de salida.

La tarifa oficial de GPT-5.6 Sol, consultada el 25 de agosto de 2026, es de 4 dólares por millón de tokens de entrada y 20 dólares por millón de tokens de salida. Con esas cifras:

Componente Cálculo Coste aproximado
Entrada de los tres jueces 29.826 × $4 / 1M $0,119
Salida visible 5.579 × $20 / 1M $0,112
Mínimo observable Entrada + salida visible $0,231
DataForSEO, top-10 live 1 SERP $0,002

El mínimo completo sería, por tanto, unos $0,233 por página. Sin embargo, con razonamiento high también existen tokens internos de razonamiento facturados como salida y esos tokens no quedaron registrados en los artefactos manuales de aquel análisis.

Como puede variar, muestro los 3 posibles escenarios y sus costes:

Escenario Tokens adicionales de razonamiento Coste total con SERP
Mínimo verificable 0 registrados $0,233
Razonamiento medio 2.000 por juez $0,353
Razonamiento alto 5.000 por juez $0,533

DataForSEO publica un precio de $0,002 por una SERP orgánica live de diez resultados. Los embeddings de BGE-M3 se ejecutan en local, por lo que no añaden una factura por token. No he incluido electricidad, proxies, almacenamiento ni mantenimiento porque el coste es casi despreciable.

Con lo que el rango de los costes sería aproximadamente entre 0,20 y 0,46 euros por análisis.

API frente a ChatGPT Plus o Pro

Los planes de los proveedores de IA permiten ejecutar análisis supervisados con Codex dentro de sus límites de uso, evitando la factura marginal de API mientras quede capacidad incluida. Según la documentación oficial de precios, ChatGPT Plus parte de 20 dólares mensuales y Pro de 100 dólares, con límites superiores para Pro y posibilidad de comprar créditos adicionales.

Si utilizamos los presupuestos de referencia de 20 y 100 euros mensuales y los comparamos con el rango anterior, obtenemos esta equivalencia directa (aunque los planes son bastante mas generosos, así que probablemente puedas hacer entre 5 y 10 veces mas volumen de análisis):

Presupuesto mensual Análisis equivalentes mediante API
Plus: €20 44–100 análisis
Pro: €100 219–500 análisis

No significa que Plus garantice cien análisis ni que Pro garantice quinientos. Cada evaluación necesita al menos tres ejecuciones de juez, los límites se comparten con otros usos y el consumo depende del modelo, la longitud del contenido y el razonamiento. 

Si desarrollase un sistema similar para una empresa, o lanzado como herramienta profesional, mi criterio sería sencillo:

  • ChatGPT Plus o Pro para análisis supervisados, investigación editorial y volúmenes moderados dentro de la capacidad incluida.
  • API para automatización, procesamiento por lotes, integración con un CMS, telemetría exacta y costes predecibles por ejecución.

El plan reduce el coste marginal cuando ya forma parte de nuestro flujo de trabajo. La API además te ofrece control operativo.

Case Study: analizando el Content Effort mi post sobre el cambio a Oauth2 de Sistrix que publiqué hace unos dias:

Cómo se obtiene el resultado

  1. Tres jueces independientes reciben la misma página y la rúbrica 2.0.0.
  2. No pueden consultar las respuestas de los otros jueces.
  3. Cada puntuación positiva debe incluir citas literales de la página.
  4. El sistema verifica que esas citas existan realmente; una evidencia no verificable anula la puntuación correspondiente.
  5. Se calcula la mediana de los tres jueces por dimensión.

En este análisis hubo acuerdo absoluto:

  • Totales: 26, 26 y 26
  • Rango: 0
  • Evidencias verificadas: 101/101
  • Resultado: 26/32

Explicación por dimensión

Dimensión

Motivo de la puntuación

Curación y edición — 2/4

La página tiene títulos, pasos ordenados, solución de problemas y checklist. Sin embargo, conserva tanto la migración a OAuth como las instrucciones antiguas de API key, generando duplicación. Para llegar a 3 tendría que eliminar o separar mejor ese contenido redundante.

Contenido derivado/computado — 3/4

Compara API key y OAuth en seguridad, automatización y facilidad de uso, y explica qué implica la comparación. No obtiene 4 porque no calcula ninguna cifra nueva —diferencia, ratio, ranking, total o tendencia— a partir de los datos.

Hechos y perspectivas originales — 4/4

Mantiene una perspectiva propia y sostenida: separar datos de interpretación, no confundir falta de datos con cero búsquedas, considerar la automatización subordinada al criterio SEO y diagnosticar errores según el contexto.

Media de alto esfuerzo — 1/4

El texto extraído contiene listas y bloques de configuración relevantes, pero fácilmente reproducibles. No evidencia gráficos, diagramas, capturas anotadas o tablas elaboradas. Esta dimensión evalúa únicamente lo visible en la extracción, por lo que una imagen sin información textual detectable puede no contar.

Contenido útil prominente — 4/4

La introducción presenta inmediatamente el problema, el beneficio del MCP y la actualización crítica sobre OAuth. El lector encuentra el valor principal antes de las instrucciones detalladas.

Calidad de la discusión — 4/4

No se limita a recomendar OAuth: contrapone ventajas y riesgos de ambas opciones, reconoce las dificultades en servidores desatendidos y el riesgo residual de los tokens, y concluye cuándo conviene cada alternativa.

Profundidad más allá de hechos comunes — 4/4

Conecta detalles poco obvios: sintaxis específica de OpenCode, variables que no se recargan en caliente, diferencias entre 401 y 403, restricciones del plan, códigos de país y la diferencia entre “sin datos” y “cero búsquedas”. Además, convierte esos detalles en acciones de diagnóstico.

Evidencia de autoría y experiencia — 4/4

Describe una comprobación reproducible: inicialización con HTTP 200, respuesta text/event-stream y confirmación mediante opencode mcp list. Esa experiencia determina la recomendación de empezar con una prueba pequeña y verificable.

Las evidencias que más influyeron

Los jueces destacaron especialmente frases del post como:

  • “En mi comprobación, el endpoint respondió a la inicialización con HTTP 200 y text/event-stream.”
  • “Una caída de visibilidad indica que algo ha cambiado. No explica por sí sola la causa.”
  • “La ausencia de resultados tampoco equivale automáticamente a cero búsquedas.”
  • “OAuth no elimina todos los riesgos.”
  • “Ese control es más importante que automatizarlo todo.”

No son simples instrucciones: muestran comprobación directa, interpretación, límites y razonamiento, que es precisamente lo que premian las dimensiones 3, 6, 7 y 8.

Aprendizajes Clave:

  1. La pérdida principal de puntos no está en la profundidad, sino en la duplicación editorial y la ausencia de media elaborada.
  2. Para superar 26/32 habría que podar o separar el contenido legacy y añadir recursos informativos no triviales, como un diagrama del flujo de autenticación o una tabla comparativa estructurada.

Medir no es optimizar para una puntuación

La tentación evidente sería convertir la rúbrica en otra lista de requisitos, añadir una tabla para subir D4, insertar una opinión para mejorar D3 o alargar una discusión para aparentar profundidad.

Eso sería repetir el mismo error que cometimos con tantas métricas SEO. La finalidad no es decorar el contenido para el evaluador, sino localizar el trabajo que falta.

Si D2 es bajo, quizá no necesitamos más texto, sino trabajar con los datos, hacer algunos análisis y cálculos que el lector pueda utilizar. Si D3 es bajo, puede faltar una prueba propia. Si D6 es bajo, probablemente estamos presentando una conclusión sin reconocer límites. Y si D9 es bajo, debemos preguntarnos si la página aporta algo nuevo o solo compite con otra redacción de la misma información.

La herramienta tampoco predice posiciones, ya que el posicionamiento web de una página depende de relevancia, autoridad, enlaces, contexto, experiencia de usuario y muchos otros factores. Lo que sí hace es separar contenido que parece completo de contenido donde existe esfuerzo demostrable.

Ese es el valor real de este sistema, automatizar una parte de la evaluación para dedicar el criterio humano a lo que importa. No publicar más rápido, sino entender qué merece ser publicado y qué debemos mejorar antes de pedirle tiempo al lector.