Le preguntamos lo mismo a 4 IA 1.200 veces y coinciden en menos del 10%

1
CacheBot0visualizaciones

Hace un tiempo venía leyendo estudios sobre visibilidad en IA y algo empezó a incomodarme. Están todos hechos en inglés, sobre marcas de Estados Unidos, y después los citamos como si sirvieran para un negocio en Bogotá o Valencia. Busqué el equivalente en español y no encontré nada, así que decidimos hacerlo nosotros.

Elegimos un mercado con muchos competidores reales, agencias de marketing en Argentina, y armamos 100 búsquedas escritas como las escribiría cualquier persona. Las lanzamos en cuatro motores, ChatGPT, Gemini, Google AI Overview y Perplexity. Y aquí está la parte que casi nadie hace, repetimos las mismas 100 búsquedas tres veces, el mismo día, sin cambiar una sola palabra. Fueron 1.200 consultas en total.

Lo primero que apareció ya me pareció fuerte. Dos IA coinciden en promedio en apenas el 9,6% de las marcas que recomiendan. O sea, de cada diez marcas que aparecen, nueve no se repiten en el otro modelo. Y cuando junté todo quedaron 932 agencias distintas, de las cuales el 81% apareció en un solo motor y en ninguno de los otros tres.

Pero esperá, porque eso todavía no fue lo que más me sorprendió.

Antes de comparar los modelos entre sí me hice la pregunta obvia. Si le hago la misma búsqueda a ChatGPT tres veces seguidas, el mismo día, ¿me devuelve las mismas marcas?

Y la respuesta es que no. ChatGPT coincide consigo mismo apenas el 26% de las veces. El más estable, AI Overview, llega al 39% y ni así pasa la mitad. Es decir, tres de cada cuatro marcas que menciona cambian de una respuesta a la siguiente.

Y ese dato rompe medio estudio, incluido el mío. Porque dos modelos no pueden coincidir entre sí más de lo que cada uno coincide consigo mismo. Ese 9,6% no significa que las IA piensen distinto, significa que buena parte de lo que parece desacuerdo en realidad es ruido.

Una última cosa que no esperaba. Perplexity juega otro juego, recomienda redes globales como VML, Ogilvy o Dentsu, mientras los otros tres premian a las agencias locales. Un ejemplo claro, la misma agencia que para Gemini aparece en 70 de las 100 búsquedas, para Perplexity aparece en 9.

Lo que me llevo es simple. Hay que medir los cuatro motores por separado, porque uno no predice a los otros. Nunca hay que fiarse de una sola consulta. Y si tu marca es local, conviene empezar por Google, que AI Overview y Gemini son los que más se parecen entre sí.

Aclaración necesaria, trabajo en CreceRank y todo esto lo hicimos con nuestra propia herramienta, así que puede haber sesgo. Y lo peor es que no tengo con qué compararlo, porque no existe nada parecido hecho para el mercado hispanohablante. Si alguien tiene datos que me contradigan o quiere revisar a fondo la metodología, adelante, es justo lo que más me sirve.

Visto en r/InteligenciArtificial

0 comentarios