Guía · Inspeccia
Por qué cada herramienta de visibilidad en IA te da un número distinto
Una agencia abre dos pruebas gratuitas el mismo martes, para el mismo cliente, un estudio contable de doce personas. Una herramienta le dice que la marca aparece en el 8 % de las respuestas. La otra, en el 40 %. Ninguna de las dos explica de dónde sale el número. Y lo incómodo es que las dos pueden estar bien hechas, porque el problema empieza antes: la misma pregunta, al mismo modelo, hecha dos veces seguidas, no devuelve la misma respuesta.
Eso no es una impresión de pasillo. SE Ranking corrió las mismas 10.000 keywords por el Modo IA de Google tres veces el mismo día y comparó los enlaces devueltos: sobre 122.617 enlaces analizados, el solapamiento medio de URLs exactas entre las tres pasadas fue del 9,2 %. En 2.006 keywords, el 21,2 % del total, no coincidió ni una sola URL. Seis keywords de diez mil coincidieron por completo.
Si el sustrato que mides se mueve así, cualquier puntaje construido encima hereda ese movimiento. Esta guía explica por qué pasa, qué encontramos al repetir nuestras propias auditorías y cómo trabajar con un número inestable sin dejar de decidir con él.
Casi nadie publica cómo calcula su puntaje
Prueba un ejercicio corto. Entra a las páginas de cinco herramientas de visibilidad en IA y busca cuántas veces repiten cada prompt antes de promediar, con qué modelo, desde qué país y qué cuentan como "aparición". Vas a encontrar el puntaje en el primer pantallazo y el método en ninguna parte.
El sector reconoce el agujero cuando lo mide. En su índice de 2026, sobre 126 millones de prompts de enero a abril, Semrush encontró que el 45 % de los responsables de marketing no puede medir con precisión la visibilidad de su marca en respuestas generadas por IA, y que solo el 9 % tiene herramientas para seguir todas las métricas relevantes entre plataformas. Nueve de cada cien.
Conviene desarmar acá una creencia extendida: la de que un puntaje de visibilidad en IA se parece a una posición en Google. Una posición orgánica es lo bastante estable como para que dos personas que la consultan el mismo día vean casi lo mismo, y por eso se pudo construir una industria entera de informes alrededor. El dato de SE Ranking dice que en las superficies generativas eso no se sostiene, ni siquiera dentro del mismo día y el mismo motor. Un puntaje sin decir cuántas veces se midió no es un dato: es una anécdota con dos decimales.
Cinco razones por las que la misma pregunta no da la misma respuesta
1. Cada herramienta pregunta otra cosa
Ninguna herramienta te mide contra "toda la IA". Te mide contra una lista de preguntas que alguien eligió, y esa lista es la mitad del resultado. Un panel que pregunta "mejores estudios contables en Montevideo" y otro que pregunta "quién me lleva la contabilidad de una pyme" miden mercados distintos con la misma etiqueta.
Conductor lo cuantificó: 14.000 llamadas a API, diez sectores por siete tipos de intención por cuatro motores, cincuenta corridas por celda. El hallazgo no fue que un sector sea más volátil que otro, sino que el tipo de intención predice la consistencia mejor que el sector. Y el peor de todos es el de compra: de cada diez marcas únicas que aparecían entre dos corridas del mismo prompt, solo cuatro estaban en las dos. El momento en que más te interesa aparecer es el que menos se repite.
2. El modelo cambia debajo mientras mides
Un panel de visibilidad apunta a un blanco que se actualiza sin avisar. Writesonic corrió 631.999 pares prompt-modelo sobre siete plataformas entre marzo y junio de 2026, repitiendo cada prompt un mínimo de diez veces, y midió cuánto rota la primera posición: en ChatGPT, el 52 % de las marcas nº 1 cambia sobre el mismo prompt. En el mismo trabajo, comparando qué fuentes citan ChatGPT, Gemini, Perplexity y AI Overviews para prompts idénticos, solo el 3,8 % de las fuentes aparece en las cuatro, y entre el 72 % y el 73 % de los dominios citados aparece en un solo motor y en ninguno más.
De ahí sale una consecuencia que casi ningún informe respeta: cualquier porcentaje de citación es una fotografía con fecha. Si tu informe de agosto cita un número de mayo sin decir de cuándo es, ya está mintiendo un poco.
3. La persona que pregunta forma parte de la pregunta
OpenAI documenta que ChatGPT reescribe la petición del usuario antes de mandarla a buscar, y que con la memoria activada puede incorporar lo que sabe de esa persona a la reescritura. Alguien que lleva meses hablando de contabilidad para freelancers no genera la misma consulta que alguien que abre la conversación en frío, aunque los dos escriban la misma frase.
Eso rompe la comparabilidad de cualquier medición hecha con una cuenta real: si mides desde tu propio ChatGPT, con tu historial y tus proyectos guardados, estás midiendo tu burbuja. El método básico —ventana limpia, sin sesión iniciada, sin memoria— está en la guía para medir tu visibilidad en IA, y es el paso que más gente se saltea.
4. Desde dónde preguntas cambia quién aparece
La ubicación general derivada de la IP entra en la consulta reescrita, así que dos servidores de medición en dos países no pueden dar el mismo resultado ni queriendo. En nuestras auditorías la diferencia por mercado es enorme: entre los dominios con al menos treinta casos, el 97 % de los estadounidenses quedó sin ninguna mención al preguntar por su categoría, contra el 51 % de los de Ciudad del Cabo.
Ese contraste dice menos sobre geografía que sobre competencia: donde hay miles de rivales por categoría, la probabilidad de que te nombren en una respuesta corta se desploma. La consecuencia operativa alcanza igual. Si tu herramienta pregunta desde Virginia y tu cliente vende en Uruguay, el número que ves no describe el mercado de tu cliente.
5. El modelo tampoco es determinista consigo mismo
Queda el motivo más incómodo, porque no lo arregla ninguna metodología de medición. Thinking Machines Lab publicó en septiembre de 2025 un análisis de por qué los endpoints de inferencia devuelven salidas distintas incluso con temperatura cero. La causa principal, escriben, es que la carga del servidor —y con ella el tamaño del lote de peticiones que se procesan juntas— varía de forma no determinista. Los núcleos de cálculo no son invariantes al tamaño del lote, así que el resultado depende de cuánta gente más estaba preguntando en ese instante.
"Desde la perspectiva de un usuario individual, los otros usuarios concurrentes no son una entrada del sistema, sino una propiedad no determinista del sistema."
Es un problema resoluble: el mismo trabajo publica núcleos invariantes al lote que producen inferencia reproducible. Pero eso se aplica en la infraestructura de quien sirve el modelo, no en la herramienta que lo consulta, y ningún producto de chat masivo publica hoy si lo hace.
Lo que vimos al repetir nuestras propias auditorías
Entre el 14 de mayo y el 28 de julio de 2026 corrimos 2.324 auditorías sobre 2.021 dominios únicos. Cada una lanza preguntas reales contra un modelo con búsqueda web activa y guarda qué fuentes consultó. En 167 dominios el análisis se repitió dos veces o más, con una media de 2,4 corridas, y eso permite el cruce que nadie publica: qué pasa cuando mides dos veces lo mismo.
Entre los 51 dominios que estuvieron visibles al menos una vez, el 56,9 % dio un resultado distinto al repetir, con una oscilación media de 30,8 puntos de tasa de mención. Más de la mitad de las marcas que aparecen alguna vez cambian de posición cuando vuelves a preguntar, y el salto típico es de treinta puntos. Ese es el tamaño real del ruido.
Ahora el matiz honesto, porque ese número se puede inflar con facilidad. Si cuentas los 167 dominios completos, la oscilación media baja a 9,4 puntos y solo el 17,4 % se movió un tercio o más. Suena mucho más estable. No lo es: la mayoría de esos dominios quedó invisible en las dos corridas, y un cero repetido no mide estabilidad, mide ausencia. Promediar los invisibles adentro es la forma más fácil de publicar un titular tranquilizador sobre datos que dicen otra cosa.
Los límites del cruce, en voz alta: un solo proveedor de LLM, un tope de doce dominios de fuentes guardados por análisis, categorías declaradas por el propio usuario y repeticiones que ocurrieron cuando alguien decidió repetir, no en un calendario controlado. Esto no es un experimento de laboratorio, es lo que se ve en producción. Que es donde vive tu informe.
Un número honesto de visibilidad en IA trae siempre tres cosas pegadas: la pregunta exacta, la fecha y la cantidad de corridas. Si falta alguna de las tres, no es comparable con nada, ni siquiera consigo mismo.
En Inspeccia corremos preguntas reales contra un modelo con búsqueda activa y te mostramos qué responde, a quién nombra en tu lugar y qué fuentes cita para describirte. Empieza un análisis gratis.
Cuántas veces hay que medir para que el número signifique algo
Lo que sigue es una regla de oficio derivada de la oscilación observada, no un teorema: nadie ha publicado el intervalo de confianza de la visibilidad en IA, y quien te venda un número mágico de corridas como si fuera estadística asentada está adornando. El razonamiento es simple. Si la oscilación típica entre dos corridas de un dominio visible ronda los treinta puntos, una sola corrida no distingue un 20 de un 50. Necesitas suficientes repeticiones para que el promedio deje de estar dominado por una tirada.
- Congela el conjunto de prompts antes de medir. Escríbelo, féchalo, guárdalo. Si retocas las preguntas después de ver el resultado, lo que mides es tu propia edición. Es el paso que más informes bonitos ha producido y menos decisiones buenas.
- Repite cada pregunta de tres a cinco veces, en días distintos. Tres corridas separadas por días capturan mejor la variación que diez seguidas en la misma tarde: la versión del modelo y el índice de búsqueda cambian entre días, no entre minutos.
- Mide siempre en sesión limpia. Ventana privada, sin sesión iniciada, sin memoria, sin proyectos guardados. Y desde una ubicación parecida al mercado del cliente, no a la oficina.
- Reporta un rango y una mediana, nunca un puntaje suelto. "Entre 20 % y 55 %, mediana 35 %, sobre cinco corridas del 3 al 10 de agosto" aguanta que la discutan. "Visibilidad: 35" no.
- Fija un umbral de acción. Si el movimiento entre dos cortes es menor que la oscilación que ya observaste, no lo cuentes como cambio. Celebrar ruido te hace repetir la acción equivocada.
- No compares puntajes de herramientas distintas. No existe una definición común de "share of voice en IA" ni un conjunto público de prompts de referencia. Dos escalas inventadas por separado no se restan.
Y complementa siempre con algo que sí sea contable. El tráfico de referencia desde ChatGPT, Perplexity o Gemini se registra en analítica y no depende del humor del modelo: cómo aislarlo está en la guía de medición en Google Analytics 4. Un panel que se mueve treinta puntos y un contador de sesiones que sube despacio cuentan la misma historia desde dos lados. El segundo es el que firma el cliente.
Qué reportarle a un cliente todos los meses
Para una agencia esto deja de ser un debate metodológico y pasa a ser el problema de qué poner en el PDF de agosto. La salida más frecuente —tres capturas de ChatGPT nombrando al cliente— tiene un defecto fatal: es irreproducible. El cliente abre ChatGPT esa misma tarde, no ve lo mismo, y la reunión se convierte en una discusión sobre si la captura era real.
Un informe defendible cambia el objeto. En vez de prometer un puntaje que sube, entrega evidencia que se puede volver a levantar:
- La lista textual de preguntas, con fecha y cantidad de corridas. Sin eso, nada de lo demás es verificable.
- El rango del mes y el rango del mes anterior, con el umbral de acción marcado.
- Quién aparece cuando el cliente no aparece. Esta es la parte que más se lee y casi nadie incluye: la lista de competidores que ocupan la respuesta es más accionable que cualquier puntaje.
- Qué fuentes citó el modelo al describir la marca. En nuestras auditorías cita 2,65 fuentes en promedio, y en el 26,9 % de los casos ni siquiera aparece el sitio propio del cliente. Cuando eso pasa, el trabajo del mes es evidente y no hay que argumentarlo.
- El tráfico de referencia de IA, que es el único número de la carpeta que no oscila.
Vale la pena mirarse al espejo antes de vender esto. Entre las agencias de marketing digital que pasaron por Inspeccia —treinta casos, muestra chica y hay que decirlo— el 90 % quedó invisible al preguntar por su propia categoría: veintisiete de treinta. El sector que ofrece visibilidad en IA no la tiene. Mal argumento de venta, excelente punto de partida para un caso propio, que es el ángulo que desarrollamos en la guía de visibilidad en IA para agencias.
Lo que un número honesto puede prometer
Medir visibilidad en IA sigue valiendo la pena. Lo que falla es tratarla como una posición en un ranking, porque el objeto no se comporta así y ninguna herramienta puede arreglarlo desde afuera. Lo que sobrevive a la repetición es la estructura de la respuesta más que el puntaje: si te nombran, con qué atributos, citando a quién.
Esa capa es la que se mueve con trabajo, y también la que explica el puntaje cuando el puntaje se mueve. Si quieres el marco completo de por qué la optimización para respuestas generativas juega con reglas propias, está en la introducción al GEO. Lo demás es decir cuántas veces mediste, y decirlo antes de que te lo pregunten.
Preguntas frecuentes
¿Por qué dos herramientas me dan puntajes tan distintos para la misma marca?
Porque casi nunca están midiendo lo mismo. Cada una usa su propio conjunto de preguntas, su propia mezcla de motores, su propia ubicación de salida y su propia definición de "aparecer": para algunas basta que te nombren, para otras hace falta un enlace. Encima, la respuesta del modelo cambia entre corridas aunque no cambies nada. Conductor midió 14.000 llamadas y encontró que en prompts de intención de compra, de cada diez marcas que aparecían entre dos corridas, solo cuatro estaban en ambas. Dos herramientas honestas pueden dar números muy separados sin que ninguna esté fallando.
¿Cuántas veces hay que repetir una medición para que sirva?
No hay un número canónico, y desconfía de quien te lo dé como si fuera ciencia establecida. Lo que sí se puede derivar de los datos es una regla de oficio: cuando la oscilación observada entre dos corridas de un mismo dominio ronda los treinta puntos, una sola corrida no distingue un 20 de un 50. Tres a cinco corridas del mismo prompt, repartidas en días distintos y en sesiones sin sesión iniciada, ya te dan un rango con el que se puede trabajar. Si el rango es ancho, el dato es que es ancho.
¿Puedo comparar mi puntaje de una herramienta con el de otra?
No, y es la trampa más frecuente en las reuniones de reporte. Los puntajes de visibilidad no están estandarizados: no existe nada parecido a una definición común de "share of voice en IA", ni un conjunto público de prompts de referencia, ni una convención sobre cuántas corridas se promedian. Comparar dos puntajes de proveedores distintos es comparar dos escalas inventadas por separado. Lo que sí tiene sentido es comparar tu número contra tu número anterior, con la misma lista de preguntas, el mismo motor y el mismo método de conteo.
Si el número se mueve tanto, ¿sirve de algo medir?
Sirve, pero para otra cosa que la que promete el marketing. Un puntaje suelto no aguanta el peso de una decisión. Lo que sí aguanta es todo lo demás que sale de la misma medición: si el modelo te nombra o nombra a otros, qué te atribuye, qué fuentes cita para hablar de ti, si esas fuentes son tuyas o de terceros. Eso se mueve mucho menos entre corridas y es accionable. En nuestras auditorías, la IA cita 2,65 fuentes en promedio al describir una marca, y en el 26,9 % de los casos ni siquiera aparece el sitio propio.
¿Qué le muestro a un cliente en el informe mensual?
Nada que dependa de una captura de pantalla. Un informe defendible tiene cinco partes: la lista textual de preguntas usadas, con fecha; el rango de resultados en vez de un puntaje único; quién aparece cuando tú no apareces; qué fuentes citó el modelo para describir la marca; y el tráfico de referencia de IA medido en analítica, que es el único número de la carpeta que no depende del humor del modelo. Si el movimiento del mes es menor que la oscilación normal entre corridas, decirlo también es informar.
Fuentes citadas
- SE Ranking — "AI Mode Research": las mismas 10.000 keywords parseadas tres veces el mismo día sobre 122.617 enlaces; solapamiento medio de URLs exactas del 9,2 %; 21,2 % de keywords sin ninguna URL en común. Estudio.
- Conductor — "AI Brand Recommendation Study": 14.000 llamadas a API (10 sectores × 7 tipos de intención × 4 motores × 50 corridas); los prompts de intención de compra son los menos consistentes, con cuatro marcas coincidentes de cada diez entre dos corridas. Análisis.
- Writesonic — "Do AI Engines Cite the Same Sources?": 161.286 prompts para el solapamiento de fuentes (3,8 % de fuentes universales entre cuatro motores; 72-73 % de dominios citados en un solo motor) y estudio de estabilidad sobre 631.999 pares prompt-modelo, con el 52 % de las posiciones nº 1 de ChatGPT rotando sobre el mismo prompt. Estudio.
- Semrush — AI Visibility Index 2026, 126 millones de prompts de enero a abril de 2026: el 45 % de los líderes de marketing no puede medir con precisión la visibilidad de marca en respuestas de IA y solo el 9 % tiene herramientas para seguir todas las métricas relevantes. Comunicado.
- Thinking Machines Lab — "Defeating Nondeterminism in LLM Inference", 10 de septiembre de 2025: la variación no determinista de la carga y del tamaño de lote explica por qué la inferencia no es reproducible aun con temperatura cero; propone núcleos invariantes al lote. Artículo.
- OpenAI Help Center — "ChatGPT Search": reescritura de la petición del usuario en una consulta de búsqueda a partir de la ubicación general derivada de la IP, e influencia de la memoria en esa reescritura. Artículo de ayuda.
- Inspeccia — base
analyses_v2: 2.324 auditorías sobre 2.021 dominios únicos entre el 14 de mayo y el 28 de julio de 2026; cruce de estabilidad sobre 167 dominios con dos o más corridas; 2,65 fuentes citadas en promedio por marca; 26,9 % de marcas sin cita del sitio propio; 27 de 30 agencias de marketing digital sin mención en su categoría.
Mira el dato antes que el puntaje
Te mostramos qué responde hoy la IA sobre tu marca: si te nombra, quién aparece en tu lugar y qué fuentes cita para describirte. El análisis es gratis y tarda unos minutos.