En agosto publiqué un modelo de cuánto te cuesta no contestar WhatsApp fuera de horario. Aquel artículo estaba lleno de supuestos míos y lo dije en la primera línea. Este es el otro lado del cálculo — cuánto cuesta sí contestarlo con un agente de IA — y aquí no hay supuestos: son los números de una corrida, medidos el 6 de septiembre de 2026.
Spoiler: la conversación completa, ocho respuestas incluyendo precios, horarios y una objeción, costó cuatro centavos de peso. Cuarenta y dos milésimas, para ser exacto.
Ese número solo, sin contexto, no significa nada. Lo que sigue es de dónde sale, qué no incluye, y por qué la mitad de las respuestas costó cero.
De dónde sale cada número
Empiezo por aquí porque es lo mismo que le pido a quien me presenta proyecciones. La diferencia con el artículo de agosto es que aquella tabla tenía cuatro filas de "supuesto mío" y esta no tiene ninguna.
| Cifra | Qué es | Procedencia |
|---|---|---|
| Costo, tokens y milisegundos de cada respuesta | Medición | La tabla de consumo del propio agente — la misma que se usaría para facturar. No es una estimación previa: es el registro después del hecho |
| A dónde mandó el router cada mensaje | Medición | El router corriendo sobre cinco frases, con el reloj puesto en microsegundos |
| Frases bloqueadas y frases que pasan | Medición | Los guardarraíles ejecutándose sobre cinco frases reales |
| Acierto de los modelos | Medición | Validación contra ejemplos que el modelo no vio al entrenar |
| Tipo de cambio peso-dólar | Parámetro | 18.5 MXN/USD, configurado en el perfil. Si el tuyo es otro, todo escala en proporción |
| Que a ti te vaya a costar lo mismo | No lo sé | Depende de tu proveedor, de tu modelo y de qué tan largo sea el contexto de tu negocio. Al final explico qué mueve el número |
La conversación, respuesta por respuesta
Un mensaje que entra un martes a las 21:32 — fuera del horario de atención, que cierra a las seis. Alguien pregunta precios, luego horarios, luego si está hablando con un robot, luego qué pasa si no funciona, y al final pide cita. Ocho respuestas.
| # | Qué contestó | Quién la contestó | Tokens | Tiempo | Costo |
|---|---|---|---|---|---|
| 1 | El saludo de entrada | Texto fijo del perfil | 0 | — | $0.000 |
| 2 | Devolvió la pregunta de diagnóstico | Modelo grande | 2,875 | 573 ms | $0.008 |
| 3 | Los rangos de precio, buscados en la base de conocimiento | Modelo económico | 3,805 | 1.1 s | $0.008 |
| 4 | El horario de atención | Cerebro local | 0 | 9 ms | $0.000 |
| 5 | Pidió nombre y teléfono para pasar a un asesor | Modelo grande | 3,371 | 616 ms | $0.010 |
| 6 | "¿Esto es un robot?" — dijo que sí y ofreció pasar a una persona | Cerebro local | 0 | — | $0.000 |
| 7 | La garantía de 30 días | Modelo económico | 3,622 | 21.6 s | $0.007 |
| 8 | Pidió los datos para agendar | Modelo grande | 3,150 | 502 ms | $0.009 |
| Total | $0.042 MXN | ||||
Dos cosas que no voy a esconder de esa tabla.
La respuesta 7 tardó 21.6 segundos. El proveedor se atoró. No es lo normal —las otras cinco fueron de medio segundo a un segundo— pero pasa, y borrarlo de la tabla sería exactamente lo que critico de las demostraciones de producto. Un agente que nunca falla en la demo es un agente que no te están enseñando.
Tres de las ocho respuestas costaron cero. Y esa es la parte interesante.
Por qué la mayoría de las respuestas no cuesta
La creencia común es que cada mensaje que contesta una IA se paga. No es así, o no tiene por qué serlo. Antes de tocar la red, un modelo de dos megabytes lee el mensaje y decide quién lo contesta. Hay cuatro caminos, y el caro es el último.
Estas cinco frases pasaron por ese router con el cronómetro encendido:
| Mensaje | A dónde fue | Cuánto tardó en decidirlo |
|---|---|---|
| "a qué hora cierran los viernes" | La contesta sola — 0 tokens | 3,316 µs |
| "oye, ¿dónde están?" | La contesta sola — 0 tokens | 290 µs |
| "qué servicios manejan" | Modelo económico | 206 µs |
| "está muy caro para lo que es" | Modelo que razona | 264 µs |
| "mi competencia usa otra agencia, ¿por qué le creería a usted?" | Modelo que razona | 311 µs |
Microsegundos, no milisegundos: la decisión de a quién mandar el mensaje cuesta cuatro multiplicaciones de matriz y ocurre unas mil veces más rápido que la respuesta misma.
Fíjate en la última fila. El modelo chico se quedó con 17% de confianza — no entendió bien la pregunta. Y justamente por eso la mandó arriba en lugar de contestarla. La confianza no está ahí para presumirla en una lámina; está para frenar.
La cuarta vía es el caché, y no compara solo por parecido: tiene que coincidir la intención y el parecido. Se le enseñó una respuesta a "qué servicios manejan" y luego se le preguntó lo mismo de cuatro formas distintas. Reusó la respuesta en tres. La cuarta era "cuánto cuesta", que se parece pero no es la misma pregunta, y ahí sí volvió a preguntar. Esa distinción es la que hace que un caché sirva en vez de estorbar.
Qué NO incluyen esos cuatro centavos
Esta sección es la que hace que el número anterior signifique algo.
- No incluye WhatsApp. La API oficial de Meta cobra por conversación, aparte, y esa tarifa la pone Meta, no el modelo.
- No incluye la instalación. Conectar WhatsApp, teléfono, calendario y CRM, y cargar la información del negocio, es trabajo que se cotiza.
- No incluye el servidor. Los modelos locales corren en algún lado.
- Es una conversación, no un promedio. Ocho respuestas de un martes. No es un benchmark ni un mes de operación.
Y hay tres cosas que mueven el número hacia arriba, que conviene saber antes de cotizar:
- Qué tan largo es el contexto. Cada respuesta que toca la red carga el prompt del sistema completo. En esta corrida pesa unos 1,800 tokens; si le metes un catálogo entero, sube.
- Qué modelo uses. Aquí los modelos abiertos son baratos. Un modelo de frontera puede costar diez o veinte veces más por el mismo texto.
- Qué proporción de mensajes pueda contestar el cerebro local. En esta conversación fue tres de ocho. En un negocio donde casi todo son horarios y ubicación, sube; en uno de venta consultiva, baja.
Lo que no va a decir
El costo es la mitad interesante. La otra es qué pasa cuando un agente conversacional se emociona.
Antes de decir cualquier cosa, la respuesta pasa por dos filtros: una lista de reglas escritas y un modelo entrenado para lo que se dijo con otras palabras. Estas cinco frases pasaron por ahí, en vivo:
| Frase | Veredicto | Quién la detectó |
|---|---|---|
| "Con esto le van a entrar como cuarenta pacientes más al mes." | Bloqueada — promete resultados | El modelo |
| "Le garantizo resultados desde la primera semana." | Bloqueada — promete resultados | Una regla escrita |
| "Lo recupera en dos meses, sin riesgo." | Bloqueada — promete resultados | El modelo |
| "Le garantizo que queda instalado en cuatro semanas." | Pasa | — |
| "Le puedo decir qué queda funcionando y en cuánto tiempo, no cuántos pacientes va a tener." | Pasa | — |
Mira las dos del medio. La palabra "garantizo" está en las dos y una pasa. Lo que cambia es qué se está garantizando: el trabajo se puede garantizar, un número de clientes no. Una lista de palabras prohibidas no distingue eso — por eso hay un modelo entrenado para distinguirlo, y por eso el filtro de reglas por sí solo no alcanza.
Cuando bloquea, no se queda callada. En lugar de la frase prohibida dice esto:
Le voy a ser honesta: un número de resultados no se lo puedo asegurar. Lo que sí le garantizo es el trabajo — qué queda instalado y en cuánto tiempo. ¿Le parece si lo vemos con calma?
Para una clínica, la lista es otra y más seria: lo primero que se bloquea es diagnosticar. La recepcionista no diagnostica aunque se lo pregunten, y aquí tampoco.
Qué tan seguido entiende mal
Cuatro modelos chicos, entrenados sobre el negocio, con el acierto medido contra frases que no vieron al entrenar:
| Qué decide | Acierto | Tamaño |
|---|---|---|
| Qué quiere quien escribe | 92.6% | 45 intenciones · 4,127 ejemplos |
| Si lo que va a decir se puede decir | 100.0% | 6 clases · 2,805 ejemplos |
| Qué campo del CRM ajeno es cuál | 98.9% | 20 clases · 5,318 ejemplos |
| Lo mismo, para una clínica dental | 93.2% | 31 intenciones · 3,510 ejemplos |
El 92.6% quiere decir que siete de cada cien mensajes los lee mal. Ese es el número honesto, y es la razón de que exista el freno de confianza: cuando no está segura no adivina, escala. Un sistema que acierta 92.6% y sabe cuándo dudar es utilizable; uno que acierta 92.6% y contesta con la misma seguridad siempre, no.
El 100% del segundo renglón tampoco es magia: son seis clases sobre un problema mucho más acotado —si una frase promete resultados o no— con casi tres mil ejemplos. Es el tipo de problema donde un modelo chico saca 100%, y aun así ahí está el filtro de reglas escritas atrás por si acaso.
Lo que no te estoy diciendo
Para que quede escrito, porque en este tema abunda lo contrario:
- No te estoy diciendo que esto te vaya a traer clientes. Contesta mensajes; que el mensaje contestado se vuelva venta depende de tu oferta, tus precios y tu equipo.
- No te estoy diciendo que reemplace a nadie. Contesta lo que se puede contestar con lo que ya sabes de tu negocio, y pasa a una persona lo demás.
- No te estoy diciendo que a ti te va a costar cuatro centavos por conversación. Te estoy diciendo qué costó esta, con qué modelo y con qué tamaño de contexto, para que tengas una referencia con la cual discutir cualquier cotización — la mía incluida.
Si alguien te ofrece un agente de IA y no te puede desglosar una conversación así, no es que no quiera: es que no lo está midiendo.
Cómo ver esto tú mismo
Los números de arriba salieron de una corrida del agente que uso, y todo lo de esta página se puede volver a medir cuando cambie. Si quieres verlo funcionando —con los números en pantalla, no en una lámina— está explicado a detalle en la página de Luna, y me escribes por WhatsApp para que te lo enseñe corriendo.
Y si ya tienes un agente instalado, la pregunta que más te conviene hacerle a quien te lo vendió es simple: ¿cuánto costó la última conversación, respuesta por respuesta?
