IA y LLM

Por qué no construimos chatbots de propósito general (y qué construimos en su lugar)

Práctica de IA de DigSolutions··3 min de lectura
Primer plano de una mano acercándose a una mano robótica blanca

Puntos clave

  • Un chatbot de propósito general hereda todos los casos límite de su negocio sin ninguna de las barreras de contención que puede tener una función acotada.
  • Las funciones de IA acotadas e integradas son más fáciles de evaluar, más baratas de operar y fallan de formas que realmente se pueden predecir.
  • La pregunta correcta no es "¿deberíamos añadir IA?", sino "¿qué tarea específica dentro de un flujo de trabajo existente vale la pena automatizar?".
  • Esta no es una postura anti-chatbot; es una disciplina de delimitación de alcance que, la mayoría de las veces, resulta en descartar los chatbots.

"¿Pueden añadir un chatbot de IA a nuestro sitio?" es, con diferencia, la petición de IA más común que recibimos, y es la que más rechazamos. No porque los chatbots no funcionen, sino porque "chatbot de propósito general para nuestro negocio" casi nunca es el alcance correcto para la primera función de IA que una empresa debería lanzar, y lanzarla de todos modos suele producir algo que impresiona en una demo y erosiona la confianza en producción.

El problema central es el alcance. Un chatbot de propósito general hereda cualquier pregunta que un cliente pueda hacer, cada caso límite en sus políticas, cada forma en que su producto puede malinterpretarse, sin ninguna de las barreras de contención que puede tener una función más acotada. No se puede construir un conjunto de evaluación significativo para "todo lo que un usuario pueda preguntar", lo que significa que no se puede saber con certeza con qué frecuencia se equivoca antes de que sus clientes se lo hagan saber a usted.

Una función acotada es lo contrario en todas las dimensiones que importan. "Identificar cuáles de los tres clips de esta hora de grabación de un webinar vale la pena publicar" o "señalar qué fichas de producto necesitan atención según los patrones de ventas y stock" son tareas con una entrada delimitada, una salida verificable y una definición clara de qué significa acertar. Se puede construir un conjunto de evaluación real, una cifra de precisión real, y una respuesta real a "¿con qué frecuencia se equivoca esto y qué pasa cuando lo hace?".

El costo y la latencia también son más predecibles. Un chatbot general tiene que estar listo para conversaciones arbitrariamente largas y arbitrariamente complejas, lo que significa aprovisionar para el peor caso en cada solicitud. Una función acotada procesa una entrada definida y produce una salida definida, lo que hace que el uso de tokens, la latencia y, por lo tanto, el costo sean algo que realmente se puede pronosticar y controlar, en lugar de un número que sorprende a fin de mes.

Los modos de falla son la diferencia real, sin embargo. Cuando una función acotada se equivoca, falla de una forma que usted predijo y para la que construyó un respaldo: un clip se marca para revisión humana en lugar de publicarse automáticamente, una recomendación de producto se puntúa como de baja confianza en lugar de mostrarse como certera. Cuando un chatbot general se equivoca, suele ser una respuesta incorrecta expresada con total confianza, en una conversación que su conjunto de evaluación nunca anticipó, delante de un cliente.

Nada de esto es una postura general de "los chatbots son malos", y lo diremos directamente cuando un chatbot realmente sea la herramienta adecuada: un bot de preguntas frecuentes internas bien delimitado, sobre una base de conocimiento fija y curada, con una escalación clara a una persona, es una función acotada legítima, no una de propósito general, aunque desde fuera parezca un chatbot. La distinción que nos importa es el alcance y la evaluabilidad, no la interfaz.

Lo que construimos en su lugar, en la práctica: IA conectada a un punto específico de un flujo de trabajo que ya existe, haciendo un trabajo bien definido de forma fiable, con una persona o una regla simple manejando los casos en los que no tiene confianza. En nuestro pipeline de distribución de webinars, eso es la identificación de clips y citas a partir de la grabación en bruto. En trabajos de ERP, eso es señalar qué fichas y niveles de stock realmente necesitan la atención de una persona en un catálogo demasiado grande para revisar a mano.

La disciplina subyacente es la misma cada vez: encontrar el trabajo más pequeño y específico dentro de un proceso que un equipo ya realiza, uno para el que se pueda construir un conjunto de evaluación real, y automatizar eso primero. Es una propuesta menos emocionante que "añadiremos IA a todo su producto", y también es la versión que realmente entrega algo en lo que su equipo confía y que sigue usando seis meses después.

¿Listo para hablar sobre su proyecto?

Cuéntenos qué está construyendo. Le responderemos en un día hábil con los siguientes pasos, sin rodeos comerciales.