La publicación científica Latitude: Multidisciplinary Research Journal, dirigida por Quality Leadership University (QLU) en Ciudad de Panamá, dio a conocer en su volumen 2, número 24 (2026), el estudio titulado «Medición de la presencia de marca en la optimización para motores generativos: una revisión de alcance sobre métricas y validez», el cual cuenta con las firmas de Néstor Romero-Ramos, Yulianna Lobach, David Abreu-Abreu, Isaac Castillo-Hernández, Juan Carlos García-Cordero y Daniel García-Cordero. Dicha investigación, accesible libremente en la web, constituye el pionero de los frutos difundidos dentro de la línea de estudio centrada en Generative Engine Optimization (GEO) que Centria Group impulsa de la mano de diversas entidades universitarias y académicas de cuatro naciones.
El artículo aborda una incógnita que el marketing digital aún no ha logrado resolver con precisión: al sugerir un hotel, una aseguradora o una entidad bancaria, ¿de qué manera se evalúa la aparición de una firma en dicha contestación, qué nivel de protagonismo ostenta y cuán confiable resulta? Con el fin de esclarecerlo, el grupo llevó a cabo una revisión de alcance o scoping review, apegándose a la metodología del Joanna Briggs Institute (JBI) y documentada conforme a la directriz PRISMA-ScR, la cual traza sistemáticamente el modo en que las publicaciones recientes evalúan la visibilidad, el posicionamiento y la mención de marcas y referencias dentro de los motores de respuesta generativa.
«Por espacio de cerca de veinte años, la presencia en la red se evaluaba mediante una destreza muy específica: salir en un índice de opciones y recibir clics. Actualmente, las personas ya no se encuentran con diez vínculos azules; ahora obtienen una contestación condensada que agrupa y reelabora múltiples procedencias, mencionándolas de manera fragmentaria o desequilibrada. El cuestionamiento fundamental ya no se centra en si mi dirección web figura y es seleccionada, sino en si mis materiales forman parte de la contestación que el consumidor verdaderamente visualiza», señala Néstor Romero, investigador firmante de la investigación y COO de Centria Group.
Del clic a la respuesta: por qué las métricas del SEO dejan de servir
El texto arranca a partir de una premisa que la propia muestra analizada corrobora mediante datos empíricos: las referencias empleadas por una herramienta conversacional coinciden escasamente con los resultados orgánicos del buscador convencional, al tiempo que los criterios de elección difieren entre plataformas. En otras palabras, aparecer en los primeros puestos de Google no garantiza la presencia en un agente conversacional, circunstancia que anula la extrapolación de métricas y exige replantizar las estrategias de medición. A este escenario se une la tendencia de las búsquedas sin clics, impulsada por las síntesis automáticas dentro de los navegadores: gran parte de las dudas de los internautas se satisfacen actualmente sin que accedan a ninguna página web.
«La tasa de citación figura como el indicador principal en el ejercicio profesional, mientras que los textos académicos la reducen a una sola investigación. Dicha distancia entre la teoría y el sector laboral constituye un descubrimiento por derecho propio», afirmó Néstor Romero.
Las cinco preguntas de investigación junto con sus respuestas
|
RQ |
Pregunta |
Respuesta del estudio |
|
RQ1 |
¿Qué familias de métricas se emplean? |
Se utilizan siete conjuntos parcialmente coincidentes —menciones o citas, relevancia o ubicación, impacto o alcance, posición en listados, consistencia, tono o enfoque, y porcentaje de citación— carentes de un esquema unificador común. |
|
RQ2 |
¿Sobre qué unidad de análisis se operacionalizan? |
Falta unanimidad: el objeto de estudio transita desde la dirección o fuente web —heredada directamente del SEO— hasta la firma o entidad, el archivo, el artículo y, en las investigaciones más actuales, el recorrido de navegación de los agentes. Aquellas investigaciones con objetos diferentes carecen de comparabilidad directa. |
|
RQ3 |
¿Cómo se controla la variabilidad estocástica de los motores? |
Únicamente una fracción menor implementa réplicas o cálculos formales del azar. La gran mayoría recurre a una única consulta o limita un periodo de tiempo, omitiendo la medición de la incertidumbre. |
|
RQ4 |
¿Qué evidencia de fiabilidad y validez se reporta? |
Ninguna investigación del conjunto somete su herramienta a comprobación psicométrica. Se observan supervisiones periféricas y fragmentarias (constancia, precisión en la fuente, contraste metodológico, solidez ante alteraciones). La consistencia entre evaluadores rara vez se documenta. |
|
RQ5 |
¿Existe un instrumento integrado y validado de presencia generativa? |
Negativo. Las pruebas estándar miden el rendimiento de estrategias o variaciones de posición, mas no la consistencia teórica de un indicador; las investigaciones iniciales desarrollan mediciones prácticas pero fragmentadas y carentes de fiabilidad comprobada. |
Metodología: cuatro vías de búsqueda junto con una política clara de preprints
La pesquisa integró cuatro vías complementarias, concebidas para subsanar las deficiencias de cada método: un motor de búsqueda guiado por inteligencia artificial, búsquedas multilingües y replicables en OpenAlex, seguimiento de referencias a partir de nodos clave y validación en un repertorio indexado (Web of Science; Scopus no estuvo disponible). Una vez eliminados los duplicados mediante el DOI —presindiendo del título debido a la frecuente coincidencia de denominaciones genéricas en esta disciplina—, dos evaluadores examinaron los resúmenes de manera autónoma, resolviendo los desacuerdos mediante acuerdo mutuo. Se analizaron 36 documentos íntegros y se seleccionaron 23 investigaciones originales, además de dos revisiones catalogadas de manera independiente a modo de marco teórico.
«Buena parte del conocimiento generado en español sobre esta materia no llega a los circuitos internacionales. Recuperarlo no es una cuestión de exhaustividad: revela un sesgo lingüístico latente en el campo», recalcó Néstor Romero.
Siete familias de métricas y ningún marco que las integre
Siete familias de métricas parcialmente solapadas —aparición/citación, prominencia/posición, absorción/influencia, ranking en listas, estabilidad, sentimiento/encuadre y cuota de citación— quedan mapeadas en la investigación, conviviendo sin un marco integrador compartido. Asimismo, el análisis subraya que la división conceptual más fecunda dentro de este ámbito radica en diferenciar la citación (la simple selección de una fuente) de la absorción (la asimilación efectiva de sus contenidos en la respuesta), fragmentando de este modo en dos capas lo que previamente se cuantificaba mediante una lógica binaria.
El foco analítico se desplaza: de la URL hacia la marca y el recorrido de los agentes
No existe acuerdo universal acerca de lo que se mide con precisión. El corpus muestra una evolución constante que parte de la fuente o la URL —como legado tradicional del SEO— y avanza hacia la marca o entidad, el documento, el artículo y, en las investigaciones más recientes, alcanza unidades de categoría superior como el recorrido de navegación de los agentes. Dicho cambio pone de manifiesto la transformación de la cuestión analítica, aunque esto conlleva un precio: las investigaciones basadas en unidades diversas no resultan directamente equiparables, lo cual imposibilita la ejecución de un metaanálisis.
Tipología de la evidencia disponible
| Grado de evidencia | Casos prácticos | Proporción en el corpus |
| Benchmark de evaluación | GEO-Bench (Nimase et al., 2026); SAGEO Arena (Kim et al., 2026); E-GEO (Bagga et al., 2025); C-SEO Bench (Puerto et al., 2025) | Predominante |
| Medición primaria (motores reales) | How to Dominate (Chen et al., 2025); Strategic GEO (Khedekar y Bansal, 2026); Quintana-Gómez (2026) | Escasa |
| Estudio aplicado / comercial | GEO at Scale (Kumar, 2026); Brand Notability UK (Oruesagasti, 2026) | Restringida |
Fuente: Romero-Ramos et al. (2026), Tabla 3 del manuscrito original. Versión propia.
La inteligencia artificial no siempre contesta igual, y prácticamente nadie lo evalúa
Los motores generativos poseen un carácter estocástico, lo que significa que arrojan resultados diferentes frente a una misma consulta. Por consiguiente, una evaluación fidedigna requiere replicar las pruebas o representar formalmente la incertidumbre; no obstante, una escasa proporción de las investigaciones adopta este enfoque de manera metódica. Entre los pocos casos que lo implementan sobresalen iniciativas que realizan cinco corridas por pregunta, 200 valoraciones acompañadas de permutaciones secuenciales, pruebas de sensibilidad lingüística y de reformulación, o bien enfoques donde la visibilidad se concibe como un espectro probabilístico en vez de una cifra aislada. En contraste, el grueso de los análisis restantes se conforma con una sola ejecución.
«Dentro de este ámbito, registrar una única ejecución carece de solidez epistemológica. Todo instrumento fiable necesita integrar la repetición y el análisis de la incertidumbre como una exigencia fundamental, más allá de considerarlo un simple detalle opcional», puntualiza Romero.
El descubrimiento principal: un campo que abarca demasiado pero certifica muy poco
El hallazgo fundamental de la investigación revela que ningún análisis del conjunto somete su herramienta de medición a un proceso de validación psicométrica riguroso. En su lugar, se implementan supervisiones periféricas y fragmentadas (como índices de estabilidad, certeza en la asignación, contrastación metodológica o solidez ante secuencias), mientras que la concordancia entre evaluadores —un estándar elemental para cualquier dispositivo— rara vez se documenta. Por su parte, la validez, al momento de defenderse, se sustenta en la armonía interna de referencias diseñadas específicamente para la ocasión en lugar de apoyarse en atributos métricos. De este modo se desprende la premisa principal del análisis: aún no se cuenta con un mecanismo consolidado y verificado para cuantificar el impacto generativo de marca.
Criterios de elegibilidad
|
Criterio |
Inclusión |
Exclusión |
|
Foco |
Medición u operacionalización de presencia, visibilidad, citación o influencia en motores generativos |
SEO clásico, diseño generativo (CAD), GAN, sistemas de recomendación u otros usos ajenos al dominio |
|
Ventana temporal |
2023-2026 (campo born-digital) |
Anterior a 2023 |
|
Idioma |
Español e inglés |
Otros idiomas sin traducción disponible |
|
Tipo |
Estudio primario de medición, benchmark de evaluación o estudio aplicado con métricas |
Editoriales, artículos de opinión, contenido promocional |
|
Estatus |
Preprints admitidos bajo política de sensibilidad |
Literatura gris autopublicada sin control editorial |
Fuente: Romero-Ramos et al. (2026), Tabla 1 del artículo original. Traducción propia.
«Hallamos un terreno que cuantifica en exceso pero acredita de manera escasa. No escasean las propuestas de medición —de hecho, sobran—; lo que escasea es la validez de constructo junto a una fiabilidad debidamente acreditada. Cabe precisarlo con rigor, puesto que equiparar un parámetro de referencia con una herramienta contrastada eleva artificialmente la supuesta madurez metodológica de la disciplina. Precisamente ese hueco constituye la gran ocasión científica», sostiene Néstor Romero.
Una distancia considerable entre la praxis profesional y la academia
El artículo documenta una discrepancia notable entre aquello que la industria prioriza y lo que la investigación científica ha consolidado. La cuota de citación (citation share) —un indicador al que el sector otorga un valor determinante y presupone como una opción idónea para la validez convergente— se reduce, en la práctica, a un único estudio formalizado. Por otra parte, las categorías de sentimiento y encuadre muestran una escasez similar, a pesar de que el análisis de mayor envergadura dentro del corpus, el cual evalúa más de cien marcas, las señala como los indicios más volátiles de todo el conjunto.
«La visibilidad en Google no predice la visibilidad en un asistente generativo. Eso invalida la transferencia directa de indicadores y obliga a repensar qué medimos y cómo».
«La visibilidad generativa resulta manipulable, lo cual impone a la medición una exigencia que usualmente no se le demanda: la solidez ante la manipulación en calidad de atributo del instrumento».
La ciencia en español, invisible: una lección metodológica
Adicionalmente, este análisis arroja una valiosa aportación metodológica que interpela directamente a los investigadores hispanohablantes. Cierta producción científica en castellano, difundida en publicaciones de Biblioteconomía y Documentación, examina la visibilidad ante la inteligencia artificial generativa desde perspectivas complementarias, tales como la inestabilidad de las marcas en sugerencias turísticas automatizadas o el acondicionamiento de repositorios universitarios para facilitar su indexación por motores conversacionales, aspectos que los estudios anglosajones hegemónicos suelen soslayar. Dicho corpus solo afloró gracias a consultas multilingües, lo que pone de manifiesto un sesgo idiomático subyacente en esta disciplina.
A ello se suma una segunda lección del propio proceso: la verificación en una base indexada aportó 360 registros brutos, de los que se revisaron los 136 en acceso abierto, en su mayoría ruido temático por colisión de términos, y no incorporó ningún estudio de medición elegible nuevo. El campo es, en definitiva, preprint-first y está infracubierto por la indexación tradicional: el 64 % del corpus candidato se difunde a través de arXiv o SSRN y el 98 % carece de cuartil indexado.
«Este resultado lo reportamos como hallazgo metodológico y no como una limitación escondida. En un campo born-digital, la revista no funciona como indicador de calidad, y las herramientas de descubrimiento asistidas por IA tienden a infracubrir precisamente la evidencia revisada por pares y los benchmarks más relevantes. Hay que complementarlas con rastreo de citas y fuentes reproducibles», explica el investigador.
Flujo de selección de estudios (PRISMA-ScR, dos ramas)
|
Fase |
Desenlace |
|
Rama de descubrimiento (Consensus) |
Se detectaron 70 registros; 23 fueron descartados previamente al filtrado (por duplicidad de DOI, depuración y falsos positivos derivados de colisiones en siglas); 47 se sometieron a cribado por resumen; 26 se desecharon; 21 avanzaron hacia la revisión de texto completo |
|
Rama de otros métodos |
Aparecieron 18 registros suplementarios (mediante seguimiento de referencias, OpenAlex y comprobación en bases indizadas); 15 quedaron catalogados como aptos para lectura íntegra |
|
Verificación en Web of Science |
Arrojó 360 registros iniciales; 136 examinados (en modalidad de acceso abierto); no se halló ningún trabajo de medición válido adicional |
|
Evaluación a texto completo |
Se analizaron 36 documentos; 13 fueron descartados por quedar fuera del objeto de estudio o carecer de estimaciones directas sobre la presencia |
|
Inclusión final |
Se incorporaron 23 investigaciones principales al análisis conjunto, sumadas a 2 revisiones catalogadas bajo el apartado de marco conceptual |
Fuente: elaboración propia a partir de la Figura 1 y del apartado «Selection process» de Romero-Ramos et al. (2026). Las cifras de identificación y cribado son firmes; las de evaluación a texto completo e inclusión, provisionales, según declaran los autores.
La visibilidad generativa se puede manipular
Un subconjunto de los trabajos revisados demuestra que la visibilidad en motores generativos es manipulable de forma adversarial, mediante técnicas de manipulación del ranking en buscadores conversacionales o mediante optimización sigilosa de prompts. El estudio traslada esa evidencia al terreno de la medición: la robustez frente a la manipulación debería formar parte de las propiedades exigibles a cualquier instrumento de presencia.
«Una prueba de rendimiento comprueba si una estrategia resulta eficaz o si un elemento varía de posición, pero no determina si un indicador mide adecuadamente un constructo. Mezclar ambos planos magnifica el grado de desarrollo ficticio de la disciplina».
«En este ámbito, evaluar un único intento resulta epistemológicamente endeble; los sistemas generativos son capaces de ofrecer respuestas diferentes ante idéntica consulta».
Próximos pasos: del diagnóstico a la herramienta
Los autores concluyen que el vacío detectado —en validez de constructo y en fiabilidad documentada— constituye la apertura que justifica desarrollar y validar formalmente un índice específico de presencia generativa, y sitúan esa tarea como la continuación natural del trabajo publicado, y no como una afirmación ya demostrada. Es precisamente la línea en la que el equipo trabaja en la fase siguiente.
«Nuestro propósito consiste en transitar desde el diagnóstico hasta la utilidad práctica: diseñar y contrastar un indicador que cualquier entidad, independientemente de su dimensión, logre emplear para medir con rigor científico el posicionamiento de su marca cada vez que la inteligencia artificial emita una respuesta al respecto», señala Néstor Romero.
Limitaciones declaradas por los autores
El texto deja claros sus propios confines: la fragilidad de los datos en una disciplina tan novísima y dominada por preprints, lo cual vuelve provisorias las deducciones; la imposibilidad de replicar el trayecto de hallazgo originario —contrarrestada, si bien no suprimida, mediante OpenAlex, el seguimiento de citas y el cotejo indexado—; el acotado radio idiomático al inglés y al castellano junto con la carencia de validación en Scopus debido a la ausencia de convenios universitarios; un etiquetado efectuado en parte sobre los resúmenes, con métricas de admisión sujetas a revisión; el riesgo de incurrir en circularidad, puesto que múltiples investigaciones utilizan inteligencias artificiales evaluadoras de su propia evaluación; y la caducidad temporal que afecta a cualquier radiografía de un ámbito sustentado en herramientas propietarias en mutación permanente.
Estas limitaciones son fundamentales para interpretar adecuadamente los resultados y comprender el alcance de la evidencia disponible. Para consultar en profundidad la metodología, los datos analizados y las conclusiones de la investigación, descarga el informe completo «La banca panameña ante la inteligencia artificial».
