Copiloto de IA para operaciones retail: respuestas desde tus datos, decisiones que puedes comprobar

Un chatbot generalista responde desde el retail en general. Un copiloto para una cadena de tiendas se gana su sitio cuando responde con las cifras de tus tiendas, dice cuándo no lo sabe y convierte un hallazgo en una sugerencia que una persona puede comprobar y medir.

Maxim T.CMO, marql
·7 min de lectura

Ideas clave

  • Un modelo de IA sin tus datos solo puede responder desde el retail en general. Incluso conectados directamente a la base de datos de una empresa, los modelos siguen fallando la mayoría de las preguntas reales de negocio.
  • La precisión viene de un modelo de datos definido: qué significan en tu cadena una venta, una tienda y un margen, escrito una sola vez, con la IA leyendo a través de él.
  • A un copiloto hay que permitirle decir que no lo sabe. Un número erróneo dicho con seguridad cuesta más que un hueco reconocido.
  • Cada sugerencia debería mostrar sus pruebas y dejar la decisión a una persona, y vale la pena registrar cuándo se rechaza.
  • Mide una acción aceptada frente a tiendas comparables que no actuaron. Comparar solo el antes y el después mezcla la acción con todo lo demás que cambió.

Pregúntale a un chatbot generalista por qué cayó el margen de tu quinta tienda la semana pasada y te dirá lo que suele bajar el margen en el retail: los precios de los proveedores, las promociones, las mermas. Todo cierto, y nada de ello sobre tu quinta tienda. Un copiloto de IA para operaciones retail solo merece la pena cuando responde con las cifras de tus propias tiendas, dice cuándo no lo sabe y convierte lo que encuentra en una sugerencia que alguien puede comprobar, aplicar y medir.

Esta guía repasa esos requisitos uno a uno, empezando por los datos.

Un chatbot generalista

Un copiloto sobre tus datos

¿Por qué cayó el margen de la tienda 5 la semana pasada?

De dónde sale la respuesta
De lo que suele pasar en el retail
De las ventas, los costes y el stock de la tienda 5
La respuesta
Revisa los precios de los proveedores y las promociones
Qué categorías se movieron, y cuánto, frente a la semana normal de la tienda
Cuando faltan los datos de la semana pasada
Responde igualmente
Dice qué datos faltan
Qué viene después
Consejos generales
Una sugerencia con sus pruebas, para que una persona la acepte o la rechace
Ilustración. La misma pregunta, planteada a dos tipos de asistente.

Por qué un modelo generalista no puede responder por tus tiendas

Un modelo de lenguaje sabe muchísimo sobre retail y nada sobre tu cadena. No ha visto los tickets de ayer, las entregas de esta semana ni el precio de coste de nada de lo que vendes, así que su respuesta a una pregunta sobre tus tiendas es una descripción de las tiendas en general.

Conectar el modelo a tu base de datos no basta por sí solo. Spider 2.0, un banco de pruebas construido con datos reales de empresas y las preguntas que les hacen sus analistas, dio a uno de los modelos más potentes un agente capaz de explorar la base de datos y escribir consultas; resolvió el 21,3 % de las tareas1. Entre los principales obstáculos, los autores señalan encontrar las tablas y columnas correctas en bases de datos muy grandes. Un modelo que no sabe qué columna contiene las ventas netas devolverá con total seguridad un número sacado de la columna equivocada.

Dale a la IA un modelo de datos, no solo una base de datos

Lo que corrige la mayor parte de esto es el significado, puesto por escrito antes de que llegue la IA. En una prueba sobre la base de datos de una aseguradora, GPT-4 respondió bien al 16,7 % de las preguntas de negocio cuando trabajaba con las tablas en bruto, y al 54,2 % cuando esa misma base de datos se le describía mediante un modelo de lo que significa cada tabla y cada relación2. Los autores se dedican a construir ese tipo de modelos, así que conviene leerlo como una prueba cuidadosa y no como una ley; la dirección coincide con lo que esperaría cualquiera que haya limpiado datos de retail.

Para una cadena de tiendas, el modelo de datos es el trabajo aburrido: una sola definición de venta, una sola jornada comercial, una sola lista de tiendas y un solo árbol de categorías, para que cada pregunta se responda en los mismos términos. La guía para consolidar los datos del TPV de todas las tiendas lo explica paso a paso. Un copiloto que se apoya en ese trabajo puede responder «por qué cayó el margen» leyendo el margen tal como lo define la cadena, para la tienda y la semana por las que se pregunta.

Un copiloto que dice «no lo sé» vale más

Los modelos de lenguaje se entrenan y se evalúan de formas que hacen rentable adivinar. Investigadores de OpenAI sostienen que los modelos alucinan porque el entrenamiento y la evaluación premian adivinar por encima de reconocer la incertidumbre: en un examen que no puntúa una respuesta en blanco, adivinar siempre saca mejor nota3. En una herramienta de negocio la puntuación funciona al revés. Una respuesta que dice que no han llegado los datos del martes pasado de una tienda cuesta un minuto; una cifra inventada para esa tienda puede costar una mala decisión.

Por eso las reglas de las respuestas del copiloto deben ser explícitas y comprobarse en cada respuesta:

  1. Cada número sale de una consulta sobre los datos de la propia cadena

  2. Cada número de la respuesta coincide con lo que devolvió la consulta

  3. La respuesta indica el periodo y las tiendas que abarca

  4. Los datos que faltan se nombran, no se rellenan

  5. Enviar la respuesta

    Falla un paso: decir qué falta o qué es incierto en lugar de adivinar

De un hallazgo a una sugerencia que una persona puede comprobar

Un hallazgo es «el margen de la tienda 5 ha caído». Una sugerencia es «traslada estas unidades de una referencia de baja rotación de la tienda 5 a la tienda 2, donde se vende», con las pruebas al lado: qué vio el copiloto, frente a qué línea base y qué debería cambiar el traslado. Las pruebas son lo que permite a un encargado decidir rápido, y cambian lo bien que decide. En dos experimentos prerregistrados, uno de inspección de calidad en fábrica y otro de radiología, las personas que trabajaban con una IA que mostraba por qué llegaba a una predicción detectaron el 96,9 % de sus predicciones erróneas, y las que trabajaban con una IA sin explicaciones tenían 3,6 veces más probabilidades de rechazar una predicción que era correcta4.

Las pruebas solo ayudan si alguien las lee. Una revisión de 35 estudios sobre el sesgo de automatización, la costumbre de aceptar lo que recomienda un sistema, concluyó que las explicaciones a menudo hacen un sistema más aceptable sin hacer más acertadas las decisiones, y que pedir a las personas que verifiquen reduce la complacencia5. Así que la comprobación tiene que formar parte del proceso y no quedar a la buena voluntad: quien acepta una sugerencia confirma las pruebas antes de que siga adelante.

Deja decidir al encargado y registra cuándo se aparta del sistema

Los encargados de tienda saben cosas que no recoge ningún conjunto de datos: una obra que empieza al lado, un proveedor que está a punto de retrasarse. En una cadena de tiendas de conveniencia que introdujo recomendaciones de reposición en algunas tiendas y dejó las demás sin cambios, las tiendas con el sistema alcanzaron un nivel de servicio un 2,9 % más alto sin tener más stock, y los encargados dedicaron un 36,5 % menos de tiempo a los pedidos diarios. Cuando los encargados se apartaban del sistema, las entrevistas mostraron que normalmente se estaban anticipando a una demanda que el sistema aún no había visto6.

Aun así, apartarse del sistema no siempre es acertado. Un estudio de la reposición automática de una cadena de supermercados encontró que, después de una rotura de stock, los encargados tendían a pedir menos de lo que proponía el sistema, lo que provocaba roturas de stock causadas por ellos mismos7. Registra cada vez que alguien se aparta del sistema, con su motivo, y revísalas todas juntas una vez al mes. El patrón te dice si lo que hay que corregir es el sistema o la costumbre.

Mide el efecto frente a tiendas que no hicieron nada

Cuando una sugerencia se acepta y se lleva a cabo, las ventas de antes y de después serán distintas, pero también lo habrían sido sin ella: un festivo, el tiempo, una promoción de la competencia. El método habitual compara las tiendas que actuaron con tiendas parecidas que no lo hicieron, durante las mismas semanas. Se basa en un supuesto, que los dos grupos habrían evolucionado en paralelo sin la acción8, así que comprueba que antes sí se movían juntos.

Empieza la acción

Semana 1Semana 10

Tiendas que llevaron a cabo la acción
Tiendas comparables que no lo hicieron
Ilustración. Ventas semanales como índice, con la media de cada grupo antes del inicio igual a 100.

Lo mismo vale para el propio copiloto. Si vale lo que cuesta, las tiendas que siguen sus sugerencias deberían adelantarse a tiendas comparables, y deberías poder ver por cuánto. La guía sobre el stock muerto muestra un tipo de sugerencia, un traspaso entre tiendas, de principio a fin.

Cómo funciona marql AI

marql AI responde con los datos de ventas, stock y costes de la propia cadena. Los datos que necesita una pregunta se obtienen mediante consultas fijas antes de que el modelo escriba nada, y el modelo puede usar otras herramientas que leen las mismas tablas. Desde el chat no puede cambiar nada en los sistemas de la cadena; lo único que puede crear ahí es una tarea. Sus instrucciones le prohíben inventar números y le obligan a decir cuándo un periodo no tiene datos, y después de cada respuesta sus números se comprueban frente a lo que devolvieron las herramientas. Los nombres de las tiendas se sustituyen por códigos antes de que una pregunta llegue al proveedor del modelo, un encargado solo ve sus propias tiendas, y responde en seis idiomas.

Cada mañana a las seis, hora local, envía un breve resumen: las ventas, el margen y los tickets de ayer, la tienda más fuerte y la más floja, el tiempo del día y las anomalías de la última semana, cada una medida frente al patrón normal de la propia tienda. Para cada tienda calcula además cómo se han movido las ventas con el tiempo en los últimos 90 días y lo usa en el resumen y en sus respuestas, para que una bajada en un día de lluvia no se confunda con un problema de la tienda. Cuando una persona acepta una acción propuesta, el Impact Ledger congela la línea base y, al final del periodo, compara las tiendas que actuaron con al menos cuatro tiendas parecidas que no lo hicieron, o con el propio histórico de la tienda cuando no hay suficientes. La página de marql AI muestra las preguntas que responde.

Con tus propios datos

Conecta tu TPV y tu ERP, y pregúntale a marql AI por tus propias tiendas: respuestas desde tus datos, un resumen cada mañana y un resultado medido para cada acción que aceptes.

marql.one

Pregúntale al copiloto por tus tiendas, y pídele que enseñe sus cálculos.

Fuentes

  1. Lei, F., Chen, J., Ye, Y. et al. (2025). Spider 2.0: Evaluating Language Models on Real-World Enterprise Text-to-SQL Workflows. ICLR 2025. arXiv:2411.07763. arxiv.org
  2. Sequeda, J. F., Allemang, D. and Jacob, B. (2024). A Benchmark to Understand the Role of Knowledge Graphs on Large Language Model's Accuracy for Question Answering on Enterprise SQL Databases. Proceedings of GRADES-NDA 2024, ACM. Figures from the preprint, arXiv:2311.07509. doi:10.1145/3661304.3661901
  3. Kalai, A. T., Nachum, O., Vempala, S. S. and Zhang, E. (2025). Why Language Models Hallucinate. arXiv:2509.04664. arxiv.org
  4. Senoner, J., Schallmoser, S., Kratzwald, B., Feuerriegel, S. and Netland, T. (2024). Explainable AI improves task performance in human-AI collaboration. Scientific Reports, 14, 31150. doi:10.1038/s41598-024-82501-9
  5. Romeo, G. and Conti, D. (2026). Exploring automation bias in human-AI collaboration: a review and implications for explainable AI. AI & Society, 41(1), 259-278. doi:10.1007/s00146-025-02422-7
  6. Li, M., Wang, S. and Xu, L. (2025). Replenishment Recommendation in Convenience Stores. Production and Operations Management, published online 19 August 2025. doi:10.1177/10591478251367129
  7. Özdemir, B. and Tenhiälä, A. (2026). Discretion in Automated Supermarket Replenishment: Censorship Bias and Self-Inflicted Stockouts. Manufacturing & Service Operations Management, articles in advance, 5 August 2026. doi:10.1287/msom.2023.0426
  8. Roth, J., Sant'Anna, P. H. C., Bilinski, A. and Poe, J. (2023). What's trending in difference-in-differences? A synthesis of the recent econometrics literature. Journal of Econometrics, 235(2), 2218-2244. doi:10.1016/j.jeconom.2023.03.008
Copiloto de IAIA para retailOperaciones de tiendaApoyo a la decisión

Escrito por

Maxim T.

CMO, marql

Sigue a marql en LinkedIn

Blog

Preguntas frecuentes

Un asistente que responde preguntas sobre una cadena de tiendas con los datos de ventas, stock y costes de la propia cadena, señala lo que necesita atención y sugiere acciones con las pruebas que las respaldan. Decide una persona; el copiloto no actúa por su cuenta.

Un chatbot generalista no ha visto tus tickets, tus entregas ni tus precios de coste, así que responde desde el retail en general. Incluso cuando un modelo está conectado a la base de datos de una empresa, falla muchas preguntas reales de negocio a menos que los datos se describan mediante un modelo definido de lo que significa cada tabla.

Haz que cada número salga de una consulta sobre tus datos, comprueba los números de cada respuesta frente a lo que devolvieron las consultas y exige que el asistente diga cuándo faltan datos en lugar de rellenar el hueco.

Sí. Los encargados conocen hechos locales que no recoge ningún conjunto de datos, y la investigación sobre reposición en tiendas muestra que, cuando se apartan del sistema, a menudo se anticipan a una demanda que este no ha visto. Registra cada caso con su motivo, porque algunos, como pedir menos después de una rotura de stock, repiten un sesgo en lugar de aportar conocimiento.

Compara las tiendas que la llevaron a cabo con tiendas parecidas que no lo hicieron, durante las mismas semanas, y comprueba que los dos grupos se movían juntos antes de la acción. Una simple comparación de antes y después mezcla la acción con todo lo demás que cambió.

¿Listo para ver
los euros que ha encontrado?

Conecta tus cajas, tu stock y tu contabilidad en un día. Acceso de solo lectura, sin cambiar el TPV, 200 € al mes por local y menos a medida que creces.

0
Sustitución de tus sistemas
1
Un chat. Todo el negocio.