Néstor Martínez
  • RAG
  • WhatsApp
  • Multi-agent
  • n8n

Numen — Asistente RAG de Precisión en WhatsApp (Monetizado, con Autoaprendizaje)

TL;DR: Un producto de IA nativo de WhatsApp sobre la obra completa del Dr. David R. Hawkins (~2.000 páginas). Retrieval híbrido + reranking en dos etapas + un bucle de autoaprendizaje llevaron la precisión de respuesta de ~50% a ~90% en un dominio donde las citas deben ser textuales al 100%. Voz de entrada y salida, planes de suscripción con cuotas de uso, enrutamiento multi-modelo por niveles de coste. ~200 nodos orquestados en 3 workflows, 9+ agentes especializados. Construido y operado de principio a fin.

Contexto

Las comunidades de enseñanza espiritual estudian los libros de Hawkins línea por línea — una cita parafraseada es una cita incorrecta. El RAG estándar (chunk + embed + top-k) falla aquí: la búsqueda semántica devuelve pasajes "suficientemente cercanos", que es exactamente lo que los usuarios no pueden aceptar. Numen se construyó como un producto real: suscripciones por niveles, cuotas y pagos, no una demo.

Arquitectura

Capa de canal (WhatsApp vía Evolution API)

  • Texto y voz en ambos sentidos: transcripción con Whisper de entrada, síntesis con ElevenLabs de salida.
  • Debouncing de mensajes: los mensajes consecutivos rápidos se acumulan en Postgres y se combinan antes de procesarse — el bot responde a la persona, no a cada fragmento.
  • Nodo de guardrails en el camino de respuesta.

Capa de producto

  • Planes de suscripción (free / basic / standard / premium) con cuotas por nivel, reinicios diarios, notificaciones de límite y enlaces de pago dentro del chat.
  • Sub-workflows de asistente por nivel: el plan premium recibe el pipeline más profundo.

Motor de retrieval (el núcleo)

  • Clasificador de consultas que enruta cada pregunta a un handler especializado (simple / compleja / meditación / práctica) con su propio prompt y modelo.
  • Expansión multi-query: un LLM dispatcher divide las preguntas complejas en sub-consultas procesadas en paralelo.
  • Retrieval híbrido: coincidencia exacta de términos en SQL + semántica (pgvector) en una sola consulta — la coincidencia exacta gana donde importa la redacción, la semántica cubre los conceptos.
  • Reranking en dos etapas con una capa de decisión que arbitra entre rankers, produciendo un paquete de evidencia para el agente que responde.
  • Detector de vacíos: identifica cuándo la evidencia recuperada no cubre la pregunta y propone qué falta en lugar de alucinar.

Bucle de autoaprendizaje (el 50% → 90%)

  • Cada consulta respondida pasa por una puerta de "¿debería aprender de esto?"; los patrones aprendidos se convierten en embeddings y se almacenan, y una capa estratégica ajusta el comportamiento de retrieval con el tiempo.
  • Cada interacción se registra para revisión offline — la precisión se midió e iteró, no se asumió.

Capa de conversación

  • 9+ agentes especializados: router de intención, formulador RAG, ejecutor RAG, gestor de citas, gestor de insistencia, gestor de reintroducción, ritmo conversacional, analizador de mensajes, agente de FAQ.
  • Memoria: Redis para el contexto de conversación en vivo, Postgres para el histórico duradero.

Enrutamiento multi-modelo consciente del coste

  • Modelos rápidos y baratos (Gemini flash-lite, niveles GPT mini/nano) para clasificación, enrutamiento y formateo; modelos más potentes solo donde la calidad de la respuesta lo justifica.

Resultados

Métrica Valor
Precisión de respuesta (eval interna) ~50% → ~90%
Corpus 6-7 libros, ~2.000 páginas, enriquecido con metadatos por capítulo/tema
Orquestación ~200 nodos, 3 workflows, 9+ agentes
Modalidades Texto + voz (STT/TTS), niveles monetizados
Volumen ~70 mensajes/mes, grupo privado de usuarios

Stack

n8n · Supabase (Postgres + pgvector) · Redis · Evolution API (WhatsApp) · OpenAI (Whisper, GPT mini/nano) · Gemini (flash-lite) · ElevenLabs · API de reranker