
Cómo medir si tu web aparece en las respuestas de la IA (y por qué una sola consulta no alcanza)
Ver contenido
Una pregunta que cada vez les importa más a las empresas es "¿aparezco cuando alguien le pregunta a ChatGPT o a Perplexity por lo que yo ofrezco?". Según el informe de OpenAI sobre el uso de ChatGPT en el primer trimestre de 2026, varios países de América Latina (entre ellos República Dominicana, México, Brasil y Costa Rica) están entre los diez que más escalaron en mensajes por habitante, con República Dominicana subiendo nueve posiciones en el ranking global. Y un informe de McKinsey y el Foro Económico Mundial de enero de 2026 estima que la IA podría sumar entre 1.9% y 2.3% anual de productividad a la región. No es que estos números digan que tu marca necesita aparecer en la IA (son cosas distintas), pero sí describen el terreno: cada vez más gente consulta a un asistente antes que a un buscador, y de ahí nace la pregunta de si uno está o no en esa conversación.
El problema aparece cuando quieres medirlo. Hoy hay al menos tres formas de acercarse a esto, y conviene no confundirlas porque miden cosas distintas.
- Tu analítica (por ejemplo GA4) te muestra los clics que llegaron desde un asistente: de qué modelo vienen y a qué página caen, siempre que la tengas configurada.
- Search Console, con su reporte de rendimiento de IA generativa anunciado el 3 de junio de 2026, te muestra cómo aparece tu contenido en las funciones de IA generativa del propio Google (Vistas creadas con IA y Modo IA) y en Discover; conviene saber que Google lo está implementando de forma gradual, por ahora en un grupo reducido de sitios, así que puede que aún no lo tengas disponible en tu cuenta.
- Y preguntarle directamente al modelo te dice si tu marca aparece en la respuesta generada, haya clic o no, en cualquier asistente. Son como un test de usabilidad y una entrevista: pueden servir al mismo objetivo, pero no son lo mismo, y cada uno ve una parte distinta. La analítica solo registra los clics que ocurrieron; el reporte de Google mide impresiones en las funciones de IA de la Búsqueda de Google, no en las respuestas conversacionales de ChatGPT, Claude o Perplexity; y el muestreo directo es el único que mide si apareces en la respuesta de esos asistentes, que la mayoría de las veces ocurre sin que nadie haga clic. Ninguno solo te da la foto completa.
Y a veces ni siquiera tienes esas vías: en el proyecto que menciono más abajo el equipo no tenía Search Console configurado, así que preguntar directamente a los modelos fue la única entrada. En mi experiencia, esa es de las primeras frustraciones con las que se topa cualquiera que quiera revisar los datos de sus usuarios y entender de dónde llegan.
De hecho en UXR ya incorporamos una sección de visibilidad en IA en el dashboard de clientes, para hacerle seguimiento a este tema de forma específica, y me pareció útil ordenar lo que la literatura y otros colegas en el mundo vienen diciendo sobre cómo hacerlo bien. Esto en ninguna medida pretende ser exhaustivo, para nada. Es un tema que me parece muy interesante y espero seguir aprendiendo y escribiendo mucho más sobre él, pero sí les comparto uno de mis aprendizajes más recientes.
Por qué una sola respuesta no sirve
La tentación es abrir ChatGPT, escribir la pregunta, ver si tu marca aparece, y sacar una conclusión. El problema es que esa única respuesta no significa casi nada :(
Los modelos de lenguaje generan texto muestreando de una distribución de probabilidad: en cada paso no eligen "la" palabra correcta, sino que sortean entre las posibles según su probabilidad. Por eso la misma pregunta, hecha dos veces, incluso por la misma persona puede devolver tu marca una vez y omitirla la siguiente. No es que el modelo se contradiga: es su forma de funcionar. Hay un detalle que a mí me sorprendió: esta variación no desaparece del todo ni poniendo la "temperatura" del modelo en cero. Investigaciones sobre reproducibilidad de LLMs (varios papers disponibles en arXiv, los dejo en las referencias) muestran que la aritmética de punto flotante y el orden de las operaciones en el hardware pueden alterar el resultado incluso en configuraciones teóricamente deterministas. Anthropic, de hecho, recomienda muestrear varias veces para verificar la consistencia de las salidas.
La consecuencia: sacar una conclusión de una sola respuesta es como estimar una encuesta preguntándole a una sola persona. Poco te sirve conocer una respuesta, en un amplio número de posibilidades, por eso tomamos muestras.
Qué hacer, según lo que hay hasta ahora
La buena noticia es que no hace falta una muestra gigante ni herramientas caras. Con un poco de método y estadística, un número pequeño de ejecuciones alcanza para estimar de forma razonable. Esto es lo que vengo aplicando, apoyada sobre todo en el trabajo de Graphite ("Demystifying Randomness in AI", 2026) y en estadística clásica de proporciones.
Repetir cada consulta al menos 10 veces. Es el umbral donde el error se vuelve manejable. Según los datos de Graphite, con 10 respuestas por consulta el error absoluto medio en la estimación de visibilidad queda alrededor de 5.6%, y más del 98% de las consultas quedan con un error de 10 puntos o menos. Se puede ir a más, pero hay rendimientos decrecientes: las estimaciones con 10 respuestas no son muy distintas de las que se obtienen con 200. Un detalle operativo que ayuda: usar un chat nuevo para cada ejecución y desactivar la memoria, para que una respuesta no arrastre a la siguiente.
Medir primero visibilidad, después posición. Conviene separar dos preguntas. La primera es binaria: ¿aparece tu marca o no? La segunda, más fina, es en qué lugar aparece respecto de otras. La posición recién tiene sentido cuando la visibilidad ya es alta: si tu marca aparece en 2 de 30 respuestas, su "posición promedio" se calcula sobre tan pocos casos que es casi ruido. Si estás empezando y todavía no apareces de forma consistente, la visibilidad es la métrica que importa.
Usar el intervalo de Wilson para el margen de error. Como la visibilidad es una proporción (apariciones sobre total de ejecuciones), tiene una incertidumbre asociada que conviene declarar. El intervalo de confianza de Wilson (propuesto por Edwin B. Wilson en 1927 y todavía recomendado como opción por defecto para proporciones) funciona bien justamente cuando la muestra es chica o la proporción está cerca de 0% o 100%, que es donde la aproximación normal clásica falla. Un ejemplo para que se entienda: si tu marca aparece en 5 de 10 respuestas, el intervalo de Wilson al 95% va aproximadamente de 24% a 76%. Es decir, con 10 ejecuciones puedes afirmar "aparece / casi no aparece", pero no distinguir con confianza un 50% de un 60%. Para eso hace falta más muestra.
Medir con cadencia, semanal o quincenal. Como hay ruido de base, mirar una sola medición o medir demasiado seguido lleva a confundir variación normal con tendencia. Una cadencia regular, leída junto con los intervalos de confianza, permite separar la señal del ruido y ver si un cambio en el contenido movió de verdad la aguja.
Un caso: la visibilidad puede ser cero
Un resultado que aparece más seguido de lo que uno esperaría es el cero absoluto. En un diagnóstico reciente para un proyecto en Estados Unidos, donde el equipo aún no tenía analítica ni Search Console configurados, el muestreo directo fue la única vía para estimar visibilidad. Medimos la presencia de la marca en tres modelos de lenguaje (LLMs), con diez consultas cada uno, derivadas del análisis de su competencia: cero menciones en las treinta. El resto de los competidores directos, además, estaba igual de ausente: aparecían algunas plataformas grandes, pero ningún actor comparable al del proyecto.
Un cero limpio como ese es más informativo de lo que parece. Existe una cota (la "regla de tres") que dice que, al observar cero apariciones en n intentos, el límite superior del intervalo de confianza al 95% ronda 3/n. Con 30 ejecuciones, eso ubica la visibilidad real por debajo de un 10% aproximado. Dicho de otro modo: si la marca tuviera presencia relevante, con alta probabilidad habríamos visto al menos una aparición. No la vimos en ninguna. Y hay una ventaja escondida: un cero es una línea base excelente. Cualquier aparición futura, después de una intervención de contenido, se vuelve una señal clara y fácil de defender.
Sobre este caso y el diagnóstico completo del que salió pienso escribir aparte, porque la visibilidad en IA fue solo una de varias partes del análisis, y ni siquiera la principal.
Hay mucho más sobre esto, y sobre buena parte seguimos aprendiendo en la práctica y leyendo a otros. Quedan preguntas abiertas: cómo elegir bien el conjunto de consultas para que represente cómo la gente realmente busca, cómo tratar las respuestas con búsqueda web activada, cómo comparar entre modelos. Cada una da para su propia entrada. Si mides visibilidad en IA de otra forma, o si ves algo que se me escapa aquí, me encantaría leerte.
Referencias
- Druck, G. & Smith, E. (2026). Demystifying Randomness in AI. Graphite.io. [Informe de agencia; base metodológica principal sobre tamaño de muestra y seguimiento de visibilidad]. https://graphite.io/five-percent/demystifying-randomness-in-ai
- Wilson, E. B. (1927). Probable inference, the law of succession, and statistical inference. Journal of the American Statistical Association, 22(158), 209–212. [Fuente primaria del intervalo de confianza de Wilson].
- OpenAI (2026). Informe sobre el uso de ChatGPT, primer trimestre de 2026. [Datos de adopción en América Latina; citado vía El Cronista, 1 de julio de 2026].
- McKinsey & World Economic Forum (2026). From Potential to Productivity: Latin America in the Intelligent Age. [Estimación de impacto de la IA en la productividad regional].
- Google Search Central (2026). Optimización para la búsqueda con IA generativa. Documentación oficial de Google. [Postura de Google: optimizar para IA generativa sigue siendo SEO; buenas prácticas y aclaración de qué tácticas no son necesarias]. https://developers.google.com/search/docs/fundamentals/ai-optimization-guide
- Google Search Central (3 de junio de 2026). Presentamos los informes de rendimiento de la IA generativa en la Búsqueda en Search Console. Por Hillel Maoz y Moshe Samet. [Anuncio oficial del reporte que mide impresiones en las funciones de IA generativa de Google Search y Discover; en implementación gradual]. https://developers.google.com/search/blog/2026/06/gen-ai-performance-reports
- Sobre no-determinación de LLMs (reproducibilidad, muestreo y temperatura): conjunto de trabajos disponibles en arXiv, entre ellos "Non-Determinism of Deterministic LLM Settings" (arXiv:2408.04667) y "Defeating Nondeterminism in LLM Inference" (Thinking Machines Lab, 2025). [Fundamento técnico de por qué las respuestas varían].
Nota sobre las fuentes: el trabajo de Graphite es un informe de agencia, no un paper con revisión por pares; lo uso por su metodología transparente y sus autores con trayectoria en investigación. La estadística de Wilson y los trabajos sobre no-determinación sí son fuentes primarias y académicas.


