Nuestro sitio web utiliza cookies para mejorar y personalizar su experiencia y para mostrar anuncios (si los hay). Nuestro sitio web también puede incluir cookies de terceros como Google Adsense, Google Analytics, Youtube. Al utilizar el sitio web, usted acepta el uso de cookies. Hemos actualizado nuestra Política de Privacidad. Haga clic en el botón para consultar nuestra Política de privacidad.

Un estudio panameño identifica un vacío en la investigación en español sobre inteligencia artificial generativa

Un estudio panameño identifica un vacío en la investigación en español sobre inteligencia artificial generativa

La revista científica Latitude: Multidisciplinary Research Journal, editada por Quality Leadership University (QLU) en Ciudad de Panamá, ha publicado en su volumen 2, número 24 (2026), el estudio «Medición de la presencia de marca en la optimización para motores generativos: una revisión de alcance sobre métricas y validez», firmado por Néstor Romero-Ramos, Yulianna Lobach, David Abreu-Abreu, Isaac Castillo-Hernández, Juan Carlos García-Cordero y Daniel García-Cordero. El trabajo, disponible en acceso abierto, es el primer resultado publicado de la línea de investigación sobre Generative Engine Optimization (GEO) que Centria Group desarrolla junto a instituciones académicas y universitarias de cuatro países.

El artículo responde a una pregunta que el marketing digital todavía no sabe contestar con rigor: cuando un asistente de inteligencia artificial recomienda un banco, un seguro o un hotel, ¿cómo se mide si una marca está presente en esa respuesta, con qué prominencia y con qué fiabilidad? Para responderla, el equipo realizó una revisión de alcance (scoping review) siguiendo la metodología del Joanna Briggs Institute (JBI) y reportada conforme a la extensión PRISMA-ScR, que mapea de forma sistemática cómo la literatura emergente mide la presencia, la visibilidad y la citación de fuentes y marcas en los motores generativos.

«Durante casi dos décadas, la visibilidad digital se midió por una capacidad muy concreta: aparecer (y ser pulsado) en una lista de resultados. Hoy el usuario ya no recibe diez enlaces azules: recibe una respuesta sintetizada que integra y reformula varias fuentes, y que las cita de forma parcial o desigual. La pregunta relevante ha dejado de ser si mi enlace aparece y se pulsa, y ha pasado a ser si mi contenido está presente dentro de la respuesta que el usuario realmente lee», explica Néstor Romero, autor corresponsal del estudio y COO de Centria Group.

Del clic a la respuesta: por qué las métricas del SEO dejan de servir

El texto arranca a partir de una premisa que la propia muestra analizada corrobora mediante datos empíricos: las referencias empleadas por una herramienta conversacional coinciden escasamente con los resultados orgánicos del buscador convencional, al tiempo que los criterios de elección difieren entre plataformas. En otras palabras, aparecer en los primeros puestos de Google no garantiza la presencia en un agente conversacional, circunstancia que anula la extrapolación de métricas y exige replantizar las estrategias de medición. A este escenario se une la tendencia de las búsquedas sin clics, impulsada por las síntesis automáticas dentro de los navegadores: gran parte de las dudas de los internautas se satisfacen actualmente sin que accedan a ninguna página web.

«La proporción de citas constituye el indicador fundamental para el ejercicio profesional, mientras que el ámbito académico lo reduce a una sola investigación. Dicho abismo entre el sector y la academia representa un descubrimiento en sí mismo», expresó Néstor Romero.

 Las cinco preguntas de investigación junto con sus respuestas

RQ

Pregunta

Respuesta del estudio

RQ1

¿Qué familias de métricas se emplean?

Se utilizan siete conjuntos de indicadores que se superponen parcialmente —aparición/citación, relevancia/ubicación, absorción/impacto, posición en clasificaciones, consistencia, tono/encuadre y proporción de citas—, careciendo de un marco unificador común.

RQ2

¿Sobre qué unidad de análisis se operacionalizan?

Falta unanimidad: el objeto de estudio se desplaza desde el origen o URL —herencia clásica del SEO— hasta la firma o entidad, el archivo, el artículo y, en las investigaciones más recientes, el recorrido de navegación de los agentes. Aquellos análisis con elementos distintos no resultan directamente comparables.

RQ3

¿Cómo se controla la variabilidad estocástica de los motores?

Tan solo una pequeña parte implementa réplicas o un tratamiento formal de la aleatoriedad. La mayor parte recurre a una única consulta o limita un periodo de tiempo, omitiendo la medición del margen de error.

RQ4

¿Qué evidencia de fiabilidad y validez se reporta?

Ninguna investigación de la muestra somete su herramienta a contrastación psicométrica. Se observan supervisiones colaterales y fragmentadas (consistencia, precisión en la autoría, triangulación metodológica, resistencia frente al orden). El grado de acuerdo entre evaluadores rara vez se documenta.

RQ5

¿Existe un instrumento integrado y validado de presencia generativa?

Negativo. Las pruebas estándar miden el rendimiento de estrategias o variaciones de posición, mas no la validez conceptual de un índice; los trabajos originales desarrollan parámetros prácticos pero incompletos y carentes de fiabilidad comprobada.

Cómo se hizo: cuatro rutas de búsqueda y una política explícita de preprints

Para contrarrestar las limitaciones individuales de cada estrategia, la búsqueda integró cuatro vías complementarias: un buscador impulsado por inteligencia artificial, consultas multilingües y replicables en OpenAlex, seguimiento de referencias a partir de nodos clave, y cotejo en un repositorio indexado (Web of Science; Scopus quedó fuera de alcance). Una vez eliminados los duplicados mediante el DOI —evitando el título debido a la elevada coincidencia de denominaciones genéricas en esta disciplina—, dos evaluadores examinaron los resúmenes por separado, zanjando los desacuerdos de común acuerdo. En total, se analizaron 36 documentos íntegros, seleccionándose 23 investigaciones originales junto a un par de revisiones catalogadas de manera independiente a modo de marco teórico.

«Buena parte del conocimiento generado en español sobre esta materia no llega a los circuitos internacionales. Recuperarlo no es una cuestión de exhaustividad: revela un sesgo lingüístico latente en el campo», recalcó Néstor Romero.

Siete grupos de indicadores y ningún modelo que los unifique

En el mapeo se distinguen siete grupos de métricas con ciertos solapamientos —aparición/citación, prominencia/posición, absorción/influencia, ranking en listas, estabilidad, sentimiento/encuadre y cuota de citación— que operan careciendo de un esquema unificador común. Asimismo, la investigación subraya que el límite conceptual más productivo dentro de esta disciplina radica en separar la citación (el hecho de que se elija una fuente) de la absorción (la asimilación real de su contenido en el texto resultante), dividiendo de este modo en dos planos lo que anteriormente se evaluaba como una simple dicotomía.

El foco analítico se desplaza: de la URL hacia la marca y el recorrido de los agentes

Todavía no hay acuerdo acerca de qué se mide con precisión. Los textos muestran una evolución constante que parte de la procedencia o la URL —legado directo del posicionamiento orgánico— para centrarse en la firma o entidad, el archivo, el artículo y, en las investigaciones más recientes, en elementos más amplios como el recorrido de navegación de los usuarios. Dicha transformación evidencia un cambio en el enfoque de la disciplina, aunque esto conlleva un precio: al emplear parámetros diferentes, las investigaciones pierden comparabilidad directa, lo cual imposibilita la elaboración de metaanálisis.

Clasificación de los datos probatorios accesibles

Nivel de evidencia

Ejemplos

Peso en el corpus

Benchmark de evaluación

GEO-Bench (Nimase et al., 2026); SAGEO Arena (Kim et al., 2026); E-GEO (Bagga et al., 2025); C-SEO Bench (Puerto et al., 2025)

Dominante

Medición primaria (motores reales)

How to Dominate (Chen et al., 2025); Strategic GEO (Khedekar y Bansal, 2026); Quintana-Gómez (2026)

Minoritaria

Estudio aplicado / comercial

GEO at Scale (Kumar, 2026); Brand Notability UK (Oruesagasti, 2026)

Limitada

Fuente: Romero-Ramos et al. (2026), Tabla 3 del artículo original. Traducción propia.

La IA no responde siempre lo mismo, y casi nadie lo mide

Debido a que los motores generativos funcionan de manera estocástica, son capaces de arrojar contestaciones diferentes frente a una idónea consulta idéntica. Por consiguiente, lograr una evaluación confiable demanda replicar las mediciones o representar formalmente la incertidumbre. Pese a ello, tan solo una minoría de las investigaciones adopta este enfoque de modo metódico. Entre los pocos que lo implementan sobresalen proyectos que realizan cinco corridas por cada consulta, que efectúan doscientos exámenes junto con permutaciones de orden, que llevan a cabo análisis de sensibilidad orientados al idioma y a las paráfrasis, o bien aquellos que abordan la visibilidad en calidad de distribución en vez de un número estático. El resto de los trabajos, en su mayor parte, confía en una sola ejecución.

«Una medición de una sola ejecución es, en este dominio, epistemológicamente frágil. Cualquier instrumento robusto tiene que incorporar la repetición y la modelización de la incertidumbre como requisito, no como un refinamiento opcional», señala Romero.

El hallazgo central: un campo que mide mucho y valida poco

El hallazgo fundamental de la investigación revela que ningún análisis del conjunto somete su herramienta de medición a un proceso riguroso de validación psicométrica. En su lugar, se implementan revisiones periféricas y fragmentadas (indicadores de estabilidad, consistencia en la asignación, contrastación metodológica o resistencia a alteraciones secuenciales), mientras que la concordancia entre evaluadores —un estándar elemental para cualquier recurso de este tipo— rara vez se documenta. Por otro lado, cuando se justifica la validez, esta se apoya en la consistencia interna de referencias diseñadas específicamente para la ocasión en lugar de basarse en atributos métricos formales. De este modo, la deducción principal del mapeo es contundente: todavía no se cuenta con un instrumento consolidado y contrastado que permita evaluar la huella generativa de marca.

Criterios de elegibilidad

Parámetro

Adisión

Descarte

Enfoque

Cuantificación u operacionalización del impacto, la presencia, la visibilidad o las menciones dentro de plataformas generativas

Posicionamiento web tradicional, diseño asistido por ordenador (CAD), redes generativas antagónicas (GAN), motores recomendadores y demás aplicaciones ajenas a este ámbito

Periodo

2023-2026 (ámbito nativo digital)

Previo a 2023

Idioma

Castellano e inglés

Idiomas restantes que carezcan de traducción accesible

Clasificación

Investigaciones originales de medición, pruebas comparativas de desempeño o análisis prácticos provistos de métricas

Artículos de opinión, editoriales y material de índole comercial

Condición

Se aceptan preprints conforme a los criterios de sensibilidad establecidos

Documentación informal difundida sin supervisión editorial

Fuente: Romero-Ramos et al. (2026), Tabla 1 del artículo original. Traducción propia.

«Hallamos un terreno sumamente amplio pero escasamente contrastado. A las propuestas métricas, lejos de escasear, les sobra presencia; lo que escasea en realidad es consistencia conceptual y rigor contrastable. Conviene precisarlo sin rodeos, ya que equiparar un indicador estándar con una herramienta contrastada sobreestima el supuesto desarrollo metodológico de la disciplina. Precisamente ahí radica el nicho científico», sostiene Néstor Romero.

Una brecha entre la práctica profesional y la academia

El texto expone una discrepancia notable entre aquello que el sector valora como prioritario y lo que la investigación académica ha consolidado. La participación en citas (citation share) —un indicador al que la actividad laboral otorga un carácter determinante y ve como un candidato ideal para lograr validez convergente— se sustenta fundamentalmente en una única investigación. Del mismo modo, el conjunto vinculado al sentimiento y al encuadre cuenta con un respaldo igual de limitado, a pesar de que la investigación más amplia del conjunto, la cual examina más de un centenar de marcas, la señala como el indicador más volátil de todos.

«La visibilidad en Google no garantiza la presencia en un asistente generativo, lo que invalida la transferencia directa de métricas y exige replantear tanto qué evaluamos como la manera de hacerlo».

«La visibilidad generativa es manipulable, y eso traslada a la medición un requisito que normalmente no se le exige: la robustez frente a la manipulación como propiedad del instrumento».

La ciencia en español, invisible: una lección metodológica

Adicionalmente, este análisis arroja una valiosa aportación metodológica que interpela directamente a los investigadores hispanohablantes. Cierta producción científica en castellano, difundida en publicaciones de Biblioteconomía y Documentación, examina la visibilidad ante la inteligencia artificial generativa desde perspectivas complementarias, tales como la inestabilidad de las marcas en sugerencias turísticas automatizadas o el acondicionamiento de repositorios universitarios para facilitar su indexación por motores conversacionales, aspectos que los estudios anglosajones hegemónicos suelen soslayar. Dicho corpus solo afloró gracias a consultas multilingües, lo que pone de manifiesto un sesgo idiomático subyacente en esta disciplina.

A ello se suma una segunda lección del propio proceso: la verificación en una base indexada aportó 360 registros brutos, de los que se revisaron los 136 en acceso abierto, en su mayoría ruido temático por colisión de términos, y no incorporó ningún estudio de medición elegible nuevo. El campo es, en definitiva, preprint-first y está infracubierto por la indexación tradicional: el 64 % del corpus candidato se difunde a través de arXiv o SSRN y el 98 % carece de cuartil indexado.

«Este resultado lo reportamos como hallazgo metodológico y no como una limitación escondida. En un campo born-digital, la revista no funciona como indicador de calidad, y las herramientas de descubrimiento asistidas por IA tienden a infracubrir precisamente la evidencia revisada por pares y los benchmarks más relevantes. Hay que complementarlas con rastreo de citas y fuentes reproducibles», explica el investigador.

Flujo de selección de estudios (PRISMA-ScR, dos ramas)

Fase Hallazgo
Fase de búsqueda (Consensus) Se identificaron 70 registros; 23 descartados de forma previa al filtrado (duplicados por DOI, depuración y falsos positivos debidos a colisión de siglas); 47 sometidos a revisión por resumen; 26 descartados; 21 evaluados a texto completo
Fase de métodos complementarios 18 referencias adicionales (búsqueda de citas, OpenAlex y comprobación en bases indexadas); 15 elegibles para texto completo
Comprobación en Web of Science 360 registros iniciales; 136 analizados (de acceso abierto); ningún nuevo trabajo de medición apto
Revisión del texto completo Se examinaron 36 informes; 13 descartados (por no ajustarse al alcance o carecer de medición directa de presencia)
Selección definitiva Se incorporaron 23 investigaciones primarias a la síntesis, además de 2 revisiones documentadas como marco teórico

Fuente: elaboración propia a partir de la Figura 1 y del apartado «Selection process» de Romero-Ramos et al. (2026). Las cifras de identificación y cribado se muestran definitivas, mientras que los datos de evaluación a texto completo e inclusión resultan provisionales, de acuerdo con la declaración de los autores.

Se puede manipular la visibilidad generativa

Un conjunto de los análisis examinados evidencia que la visibilidad dentro de los motores generativos resulta alterable de manera adversarial, ya sea recurriendo a procedimientos de manipulación de posiciones en buscadores conversacionales o a través de una optimización encubierta de prompts. Dicha investigación traslada semejantes datos al ámbito de la medición, concluyendo que la solidez ante cualquier intento de alteración tendría que integrarse entre las características indispensables de toda herramienta de visibilidad.

«Un benchmark evalúa si una táctica funciona o si un ítem cambia de rango; no si una métrica mide válidamente un constructo. Confundir los dos niveles infla la madurez aparente del campo».

«Una medición de una sola ejecución es, en este dominio, epistemológicamente frágil: los motores generativos pueden responder distinto a la misma pregunta».

Qué viene ahora: del diagnóstico al instrumento

Los autores concluyen que el vacío detectado —en validez de constructo y en fiabilidad documentada— constituye la apertura que justifica desarrollar y validar formalmente un índice específico de presencia generativa, y sitúan esa tarea como la continuación natural del trabajo publicado, y no como una afirmación ya demostrada. Es precisamente la línea en la que el equipo trabaja en la fase siguiente.

«El propósito que perseguimos consiste en transitar desde el diagnóstico hasta la herramienta práctica: diseñar y contrastar un indicador accesible para cualquier tipo de empresa, sin importar su dimensión, permitiéndole medir con rigor científico el impacto de su marca en las respuestas generadas por la inteligencia artificial», señala Néstor Romero.

Limitaciones expresadas por los creadores

El texto deja claros sus propios confines: la fragilidad de los datos en una disciplina tan novísima y dominada por preprints, lo cual vuelve provisorias las deducciones; la imposibilidad de replicar el trayecto de hallazgo originario —contrarrestada, si bien no suprimida, mediante OpenAlex, el seguimiento de citas y el cotejo indexado—; el acotado radio idiomático al inglés y al castellano junto con la carencia de validación en Scopus debido a la ausencia de convenios universitarios; un etiquetado efectuado en parte sobre los resúmenes, con métricas de admisión sujetas a revisión; el riesgo de incurrir en circularidad, puesto que múltiples investigaciones utilizan inteligencias artificiales evaluadoras de su propia evaluación; y la caducidad temporal que afecta a cualquier radiografía de un ámbito sustentado en herramientas propietarias en mutación permanente.

Resulta indispensable considerar estas restricciones con el fin de evaluar correctamente los hallazgos y dimensionar el alcance de las pruebas existentes. Si deseas profundizar en la metodología, las cifras examinadas y las conclusiones del estudio, descarga el informe completo «La banca panameña ante la inteligencia artificial».

Por Wilton Centeno Almaraz