IA Conversacional· 9 min de lectura

Qué cuesta contestar WhatsApp con un agente de IA: los números de una corrida real

La conversación completa costó cuatro centavos. El desglose respuesta por respuesta, por qué tres de ocho salieron gratis y qué NO incluye ese número.

Por Ángel S. Nava · Fundador, navamkt

En agosto publiqué un modelo de cuánto te cuesta no contestar WhatsApp fuera de horario. Aquel artículo estaba lleno de supuestos míos y lo dije en la primera línea. Este es el otro lado del cálculo — cuánto cuesta contestarlo con un agente de IA — y aquí no hay supuestos: son los números de una corrida, medidos el 6 de septiembre de 2026.

Spoiler: la conversación completa, ocho respuestas incluyendo precios, horarios y una objeción, costó cuatro centavos de peso. Cuarenta y dos milésimas, para ser exacto.

Ese número solo, sin contexto, no significa nada. Lo que sigue es de dónde sale, qué no incluye, y por qué la mitad de las respuestas costó cero.


De dónde sale cada número

Empiezo por aquí porque es lo mismo que le pido a quien me presenta proyecciones. La diferencia con el artículo de agosto es que aquella tabla tenía cuatro filas de "supuesto mío" y esta no tiene ninguna.

CifraQué esProcedencia
Costo, tokens y milisegundos de cada respuestaMediciónLa tabla de consumo del propio agente — la misma que se usaría para facturar. No es una estimación previa: es el registro después del hecho
A dónde mandó el router cada mensajeMediciónEl router corriendo sobre cinco frases, con el reloj puesto en microsegundos
Frases bloqueadas y frases que pasanMediciónLos guardarraíles ejecutándose sobre cinco frases reales
Acierto de los modelosMediciónValidación contra ejemplos que el modelo no vio al entrenar
Tipo de cambio peso-dólarParámetro18.5 MXN/USD, configurado en el perfil. Si el tuyo es otro, todo escala en proporción
Que a ti te vaya a costar lo mismoNo lo séDepende de tu proveedor, de tu modelo y de qué tan largo sea el contexto de tu negocio. Al final explico qué mueve el número

La conversación, respuesta por respuesta

Un mensaje que entra un martes a las 21:32 — fuera del horario de atención, que cierra a las seis. Alguien pregunta precios, luego horarios, luego si está hablando con un robot, luego qué pasa si no funciona, y al final pide cita. Ocho respuestas.

#Qué contestóQuién la contestóTokensTiempoCosto
1El saludo de entradaTexto fijo del perfil0$0.000
2Devolvió la pregunta de diagnósticoModelo grande2,875573 ms$0.008
3Los rangos de precio, buscados en la base de conocimientoModelo económico3,8051.1 s$0.008
4El horario de atenciónCerebro local09 ms$0.000
5Pidió nombre y teléfono para pasar a un asesorModelo grande3,371616 ms$0.010
6"¿Esto es un robot?" — dijo que sí y ofreció pasar a una personaCerebro local0$0.000
7La garantía de 30 díasModelo económico3,62221.6 s$0.007
8Pidió los datos para agendarModelo grande3,150502 ms$0.009
Total$0.042 MXN

Dos cosas que no voy a esconder de esa tabla.

La respuesta 7 tardó 21.6 segundos. El proveedor se atoró. No es lo normal —las otras cinco fueron de medio segundo a un segundo— pero pasa, y borrarlo de la tabla sería exactamente lo que critico de las demostraciones de producto. Un agente que nunca falla en la demo es un agente que no te están enseñando.

Tres de las ocho respuestas costaron cero. Y esa es la parte interesante.


Por qué la mayoría de las respuestas no cuesta

La creencia común es que cada mensaje que contesta una IA se paga. No es así, o no tiene por qué serlo. Antes de tocar la red, un modelo de dos megabytes lee el mensaje y decide quién lo contesta. Hay cuatro caminos, y el caro es el último.

Estas cinco frases pasaron por ese router con el cronómetro encendido:

MensajeA dónde fueCuánto tardó en decidirlo
"a qué hora cierran los viernes"La contesta sola — 0 tokens3,316 µs
"oye, ¿dónde están?"La contesta sola — 0 tokens290 µs
"qué servicios manejan"Modelo económico206 µs
"está muy caro para lo que es"Modelo que razona264 µs
"mi competencia usa otra agencia, ¿por qué le creería a usted?"Modelo que razona311 µs

Microsegundos, no milisegundos: la decisión de a quién mandar el mensaje cuesta cuatro multiplicaciones de matriz y ocurre unas mil veces más rápido que la respuesta misma.

Fíjate en la última fila. El modelo chico se quedó con 17% de confianza — no entendió bien la pregunta. Y justamente por eso la mandó arriba en lugar de contestarla. La confianza no está ahí para presumirla en una lámina; está para frenar.

La cuarta vía es el caché, y no compara solo por parecido: tiene que coincidir la intención y el parecido. Se le enseñó una respuesta a "qué servicios manejan" y luego se le preguntó lo mismo de cuatro formas distintas. Reusó la respuesta en tres. La cuarta era "cuánto cuesta", que se parece pero no es la misma pregunta, y ahí sí volvió a preguntar. Esa distinción es la que hace que un caché sirva en vez de estorbar.


Qué NO incluyen esos cuatro centavos

Esta sección es la que hace que el número anterior signifique algo.

  • No incluye WhatsApp. La API oficial de Meta cobra por conversación, aparte, y esa tarifa la pone Meta, no el modelo.
  • No incluye la instalación. Conectar WhatsApp, teléfono, calendario y CRM, y cargar la información del negocio, es trabajo que se cotiza.
  • No incluye el servidor. Los modelos locales corren en algún lado.
  • Es una conversación, no un promedio. Ocho respuestas de un martes. No es un benchmark ni un mes de operación.

Y hay tres cosas que mueven el número hacia arriba, que conviene saber antes de cotizar:

  1. Qué tan largo es el contexto. Cada respuesta que toca la red carga el prompt del sistema completo. En esta corrida pesa unos 1,800 tokens; si le metes un catálogo entero, sube.
  2. Qué modelo uses. Aquí los modelos abiertos son baratos. Un modelo de frontera puede costar diez o veinte veces más por el mismo texto.
  3. Qué proporción de mensajes pueda contestar el cerebro local. En esta conversación fue tres de ocho. En un negocio donde casi todo son horarios y ubicación, sube; en uno de venta consultiva, baja.

Lo que no va a decir

El costo es la mitad interesante. La otra es qué pasa cuando un agente conversacional se emociona.

Antes de decir cualquier cosa, la respuesta pasa por dos filtros: una lista de reglas escritas y un modelo entrenado para lo que se dijo con otras palabras. Estas cinco frases pasaron por ahí, en vivo:

FraseVeredictoQuién la detectó
"Con esto le van a entrar como cuarenta pacientes más al mes."Bloqueada — promete resultadosEl modelo
"Le garantizo resultados desde la primera semana."Bloqueada — promete resultadosUna regla escrita
"Lo recupera en dos meses, sin riesgo."Bloqueada — promete resultadosEl modelo
"Le garantizo que queda instalado en cuatro semanas."Pasa
"Le puedo decir qué queda funcionando y en cuánto tiempo, no cuántos pacientes va a tener."Pasa

Mira las dos del medio. La palabra "garantizo" está en las dos y una pasa. Lo que cambia es qué se está garantizando: el trabajo se puede garantizar, un número de clientes no. Una lista de palabras prohibidas no distingue eso — por eso hay un modelo entrenado para distinguirlo, y por eso el filtro de reglas por sí solo no alcanza.

Cuando bloquea, no se queda callada. En lugar de la frase prohibida dice esto:

Le voy a ser honesta: un número de resultados no se lo puedo asegurar. Lo que sí le garantizo es el trabajo — qué queda instalado y en cuánto tiempo. ¿Le parece si lo vemos con calma?

Para una clínica, la lista es otra y más seria: lo primero que se bloquea es diagnosticar. La recepcionista no diagnostica aunque se lo pregunten, y aquí tampoco.


Qué tan seguido entiende mal

Cuatro modelos chicos, entrenados sobre el negocio, con el acierto medido contra frases que no vieron al entrenar:

Qué decideAciertoTamaño
Qué quiere quien escribe92.6%45 intenciones · 4,127 ejemplos
Si lo que va a decir se puede decir100.0%6 clases · 2,805 ejemplos
Qué campo del CRM ajeno es cuál98.9%20 clases · 5,318 ejemplos
Lo mismo, para una clínica dental93.2%31 intenciones · 3,510 ejemplos

El 92.6% quiere decir que siete de cada cien mensajes los lee mal. Ese es el número honesto, y es la razón de que exista el freno de confianza: cuando no está segura no adivina, escala. Un sistema que acierta 92.6% y sabe cuándo dudar es utilizable; uno que acierta 92.6% y contesta con la misma seguridad siempre, no.

El 100% del segundo renglón tampoco es magia: son seis clases sobre un problema mucho más acotado —si una frase promete resultados o no— con casi tres mil ejemplos. Es el tipo de problema donde un modelo chico saca 100%, y aun así ahí está el filtro de reglas escritas atrás por si acaso.


Lo que no te estoy diciendo

Para que quede escrito, porque en este tema abunda lo contrario:

  • No te estoy diciendo que esto te vaya a traer clientes. Contesta mensajes; que el mensaje contestado se vuelva venta depende de tu oferta, tus precios y tu equipo.
  • No te estoy diciendo que reemplace a nadie. Contesta lo que se puede contestar con lo que ya sabes de tu negocio, y pasa a una persona lo demás.
  • No te estoy diciendo que a ti te va a costar cuatro centavos por conversación. Te estoy diciendo qué costó esta, con qué modelo y con qué tamaño de contexto, para que tengas una referencia con la cual discutir cualquier cotización — la mía incluida.

Si alguien te ofrece un agente de IA y no te puede desglosar una conversación así, no es que no quiera: es que no lo está midiendo.


Cómo ver esto tú mismo

Los números de arriba salieron de una corrida del agente que uso, y todo lo de esta página se puede volver a medir cuando cambie. Si quieres verlo funcionando —con los números en pantalla, no en una lámina— está explicado a detalle en la página de Luna, y me escribes por WhatsApp para que te lo enseñe corriendo.

Y si ya tienes un agente instalado, la pregunta que más te conviene hacerle a quien te lo vendió es simple: ¿cuánto costó la última conversación, respuesta por respuesta?

FAQPreguntas frecuentes

¿Cuánto cuesta que una IA conteste un mensaje de WhatsApp?

En la corrida medida el 6 de septiembre de 2026, una conversación completa de ocho respuestas costó $0.042 MXN en consumo de modelo. Tres de esas ocho respuestas costaron cero porque las resolvió un modelo local sin tocar la red. Ese monto no incluye la tarifa de WhatsApp Business API, que Meta cobra aparte por conversación, ni la instalación.

¿Se paga por cada mensaje que contesta un agente de IA?

No necesariamente. Con un router que decide antes de gastar, las preguntas repetidas —horarios, ubicación— las puede contestar un modelo local con cero tokens y en microsegundos. En la conversación medida, tres de ocho respuestas salieron sin costo, y de cuatro formas distintas de preguntar lo mismo, tres reusaron una respuesta ya dada.

¿Qué hace que el costo suba?

Tres cosas: el tamaño del contexto que se manda en cada respuesta (aquí, unos 1,800 tokens de prompt de sistema), qué modelo se use (uno de frontera puede costar diez o veinte veces más que uno abierto por el mismo texto) y qué proporción de mensajes pueda resolver el modelo local sin salir a la red.

¿Cómo se evita que un agente de IA prometa cosas que no puede cumplir?

Con dos filtros antes de que la respuesta salga: una lista de reglas escritas para lo conocido y un modelo entrenado para lo que se dijo con otras palabras. En la prueba, tres de cinco frases quedaron bloqueadas por prometer resultados, y en su lugar el agente ofrece una versión honesta de lo mismo. La lista de lo prohibido la define el negocio: en una clínica, lo primero que se bloquea es diagnosticar.

¿Qué tan seguido entiende mal un agente así?

El modelo que decide qué quiere quien escribe acierta 92.6% medido contra frases que no vio al entrenar, o sea que lee mal unos siete de cada cien mensajes. Por eso importa más el freno que el acierto: cuando la confianza baja de cierto punto no adivina, escala a una persona.

¿Quieres esto aplicado a tu negocio?

Auditoría gratis de 30 minutos — te quedas con el diagnóstico.