Ideas clave
- Un modelo de IA sin tus datos solo puede responder desde el retail en general. Incluso conectados directamente a la base de datos de una empresa, los modelos siguen fallando la mayoría de las preguntas reales de negocio.
- La precisión viene de un modelo de datos definido: qué significan en tu cadena una venta, una tienda y un margen, escrito una sola vez, con la IA leyendo a través de él.
- A un copiloto hay que permitirle decir que no lo sabe. Un número erróneo dicho con seguridad cuesta más que un hueco reconocido.
- Cada sugerencia debería mostrar sus pruebas y dejar la decisión a una persona, y vale la pena registrar cuándo se rechaza.
- Mide una acción aceptada frente a tiendas comparables que no actuaron. Comparar solo el antes y el después mezcla la acción con todo lo demás que cambió.
Pregúntale a un chatbot generalista por qué cayó el margen de tu quinta tienda la semana pasada y te dirá lo que suele bajar el margen en el retail: los precios de los proveedores, las promociones, las mermas. Todo cierto, y nada de ello sobre tu quinta tienda. Un copiloto de IA para operaciones retail solo merece la pena cuando responde con las cifras de tus propias tiendas, dice cuándo no lo sabe y convierte lo que encuentra en una sugerencia que alguien puede comprobar, aplicar y medir.
Esta guía repasa esos requisitos uno a uno, empezando por los datos.
Un chatbot generalista
Un copiloto sobre tus datos
¿Por qué cayó el margen de la tienda 5 la semana pasada?
Por qué un modelo generalista no puede responder por tus tiendas
Un modelo de lenguaje sabe muchísimo sobre retail y nada sobre tu cadena. No ha visto los tickets de ayer, las entregas de esta semana ni el precio de coste de nada de lo que vendes, así que su respuesta a una pregunta sobre tus tiendas es una descripción de las tiendas en general.
Conectar el modelo a tu base de datos no basta por sí solo. Spider 2.0, un banco de pruebas construido con datos reales de empresas y las preguntas que les hacen sus analistas, dio a uno de los modelos más potentes un agente capaz de explorar la base de datos y escribir consultas; resolvió el 21,3 % de las tareas1. Entre los principales obstáculos, los autores señalan encontrar las tablas y columnas correctas en bases de datos muy grandes. Un modelo que no sabe qué columna contiene las ventas netas devolverá con total seguridad un número sacado de la columna equivocada.
Dale a la IA un modelo de datos, no solo una base de datos
Lo que corrige la mayor parte de esto es el significado, puesto por escrito antes de que llegue la IA. En una prueba sobre la base de datos de una aseguradora, GPT-4 respondió bien al 16,7 % de las preguntas de negocio cuando trabajaba con las tablas en bruto, y al 54,2 % cuando esa misma base de datos se le describía mediante un modelo de lo que significa cada tabla y cada relación2. Los autores se dedican a construir ese tipo de modelos, así que conviene leerlo como una prueba cuidadosa y no como una ley; la dirección coincide con lo que esperaría cualquiera que haya limpiado datos de retail.
Para una cadena de tiendas, el modelo de datos es el trabajo aburrido: una sola definición de venta, una sola jornada comercial, una sola lista de tiendas y un solo árbol de categorías, para que cada pregunta se responda en los mismos términos. La guía para consolidar los datos del TPV de todas las tiendas lo explica paso a paso. Un copiloto que se apoya en ese trabajo puede responder «por qué cayó el margen» leyendo el margen tal como lo define la cadena, para la tienda y la semana por las que se pregunta.
Un copiloto que dice «no lo sé» vale más
Los modelos de lenguaje se entrenan y se evalúan de formas que hacen rentable adivinar. Investigadores de OpenAI sostienen que los modelos alucinan porque el entrenamiento y la evaluación premian adivinar por encima de reconocer la incertidumbre: en un examen que no puntúa una respuesta en blanco, adivinar siempre saca mejor nota3. En una herramienta de negocio la puntuación funciona al revés. Una respuesta que dice que no han llegado los datos del martes pasado de una tienda cuesta un minuto; una cifra inventada para esa tienda puede costar una mala decisión.
Por eso las reglas de las respuestas del copiloto deben ser explícitas y comprobarse en cada respuesta:
Cada número sale de una consulta sobre los datos de la propia cadena
Cada número de la respuesta coincide con lo que devolvió la consulta
La respuesta indica el periodo y las tiendas que abarca
Los datos que faltan se nombran, no se rellenan
Enviar la respuesta
Falla un paso: decir qué falta o qué es incierto en lugar de adivinar
De un hallazgo a una sugerencia que una persona puede comprobar
Un hallazgo es «el margen de la tienda 5 ha caído». Una sugerencia es «traslada estas unidades de una referencia de baja rotación de la tienda 5 a la tienda 2, donde se vende», con las pruebas al lado: qué vio el copiloto, frente a qué línea base y qué debería cambiar el traslado. Las pruebas son lo que permite a un encargado decidir rápido, y cambian lo bien que decide. En dos experimentos prerregistrados, uno de inspección de calidad en fábrica y otro de radiología, las personas que trabajaban con una IA que mostraba por qué llegaba a una predicción detectaron el 96,9 % de sus predicciones erróneas, y las que trabajaban con una IA sin explicaciones tenían 3,6 veces más probabilidades de rechazar una predicción que era correcta4.
Las pruebas solo ayudan si alguien las lee. Una revisión de 35 estudios sobre el sesgo de automatización, la costumbre de aceptar lo que recomienda un sistema, concluyó que las explicaciones a menudo hacen un sistema más aceptable sin hacer más acertadas las decisiones, y que pedir a las personas que verifiquen reduce la complacencia5. Así que la comprobación tiene que formar parte del proceso y no quedar a la buena voluntad: quien acepta una sugerencia confirma las pruebas antes de que siga adelante.
Deja decidir al encargado y registra cuándo se aparta del sistema
Los encargados de tienda saben cosas que no recoge ningún conjunto de datos: una obra que empieza al lado, un proveedor que está a punto de retrasarse. En una cadena de tiendas de conveniencia que introdujo recomendaciones de reposición en algunas tiendas y dejó las demás sin cambios, las tiendas con el sistema alcanzaron un nivel de servicio un 2,9 % más alto sin tener más stock, y los encargados dedicaron un 36,5 % menos de tiempo a los pedidos diarios. Cuando los encargados se apartaban del sistema, las entrevistas mostraron que normalmente se estaban anticipando a una demanda que el sistema aún no había visto6.
Aun así, apartarse del sistema no siempre es acertado. Un estudio de la reposición automática de una cadena de supermercados encontró que, después de una rotura de stock, los encargados tendían a pedir menos de lo que proponía el sistema, lo que provocaba roturas de stock causadas por ellos mismos7. Registra cada vez que alguien se aparta del sistema, con su motivo, y revísalas todas juntas una vez al mes. El patrón te dice si lo que hay que corregir es el sistema o la costumbre.
Mide el efecto frente a tiendas que no hicieron nada
Cuando una sugerencia se acepta y se lleva a cabo, las ventas de antes y de después serán distintas, pero también lo habrían sido sin ella: un festivo, el tiempo, una promoción de la competencia. El método habitual compara las tiendas que actuaron con tiendas parecidas que no lo hicieron, durante las mismas semanas. Se basa en un supuesto, que los dos grupos habrían evolucionado en paralelo sin la acción8, así que comprueba que antes sí se movían juntos.
Semana 1Semana 10
- Tiendas que llevaron a cabo la acción
- Tiendas comparables que no lo hicieron
Lo mismo vale para el propio copiloto. Si vale lo que cuesta, las tiendas que siguen sus sugerencias deberían adelantarse a tiendas comparables, y deberías poder ver por cuánto. La guía sobre el stock muerto muestra un tipo de sugerencia, un traspaso entre tiendas, de principio a fin.
Cómo funciona marql AI
marql AI responde con los datos de ventas, stock y costes de la propia cadena. Los datos que necesita una pregunta se obtienen mediante consultas fijas antes de que el modelo escriba nada, y el modelo puede usar otras herramientas que leen las mismas tablas. Desde el chat no puede cambiar nada en los sistemas de la cadena; lo único que puede crear ahí es una tarea. Sus instrucciones le prohíben inventar números y le obligan a decir cuándo un periodo no tiene datos, y después de cada respuesta sus números se comprueban frente a lo que devolvieron las herramientas. Los nombres de las tiendas se sustituyen por códigos antes de que una pregunta llegue al proveedor del modelo, un encargado solo ve sus propias tiendas, y responde en seis idiomas.
Cada mañana a las seis, hora local, envía un breve resumen: las ventas, el margen y los tickets de ayer, la tienda más fuerte y la más floja, el tiempo del día y las anomalías de la última semana, cada una medida frente al patrón normal de la propia tienda. Para cada tienda calcula además cómo se han movido las ventas con el tiempo en los últimos 90 días y lo usa en el resumen y en sus respuestas, para que una bajada en un día de lluvia no se confunda con un problema de la tienda. Cuando una persona acepta una acción propuesta, el Impact Ledger congela la línea base y, al final del periodo, compara las tiendas que actuaron con al menos cuatro tiendas parecidas que no lo hicieron, o con el propio histórico de la tienda cuando no hay suficientes. La página de marql AI muestra las preguntas que responde.
Con tus propios datos
Conecta tu TPV y tu ERP, y pregúntale a marql AI por tus propias tiendas: respuestas desde tus datos, un resumen cada mañana y un resultado medido para cada acción que aceptes.
Pregúntale al copiloto por tus tiendas, y pídele que enseñe sus cálculos.
Fuentes
- Lei, F., Chen, J., Ye, Y. et al. (2025). Spider 2.0: Evaluating Language Models on Real-World Enterprise Text-to-SQL Workflows. ICLR 2025. arXiv:2411.07763. arxiv.org
- Sequeda, J. F., Allemang, D. and Jacob, B. (2024). A Benchmark to Understand the Role of Knowledge Graphs on Large Language Model's Accuracy for Question Answering on Enterprise SQL Databases. Proceedings of GRADES-NDA 2024, ACM. Figures from the preprint, arXiv:2311.07509. doi:10.1145/3661304.3661901
- Kalai, A. T., Nachum, O., Vempala, S. S. and Zhang, E. (2025). Why Language Models Hallucinate. arXiv:2509.04664. arxiv.org
- Senoner, J., Schallmoser, S., Kratzwald, B., Feuerriegel, S. and Netland, T. (2024). Explainable AI improves task performance in human-AI collaboration. Scientific Reports, 14, 31150. doi:10.1038/s41598-024-82501-9
- Romeo, G. and Conti, D. (2026). Exploring automation bias in human-AI collaboration: a review and implications for explainable AI. AI & Society, 41(1), 259-278. doi:10.1007/s00146-025-02422-7
- Li, M., Wang, S. and Xu, L. (2025). Replenishment Recommendation in Convenience Stores. Production and Operations Management, published online 19 August 2025. doi:10.1177/10591478251367129
- Özdemir, B. and Tenhiälä, A. (2026). Discretion in Automated Supermarket Replenishment: Censorship Bias and Self-Inflicted Stockouts. Manufacturing & Service Operations Management, articles in advance, 5 August 2026. doi:10.1287/msom.2023.0426
- Roth, J., Sant'Anna, P. H. C., Bilinski, A. and Poe, J. (2023). What's trending in difference-in-differences? A synthesis of the recent econometrics literature. Journal of Econometrics, 235(2), 2218-2244. doi:10.1016/j.jeconom.2023.03.008
Escrito por
Maxim T.
CMO, marql