← Volver al portafolio
Caso 08 · Datos y prospección

Deducir lo que ninguna fuente declara

Motor que descubre empresas en fuentes públicas, infiere un atributo que ningún registro contiene, las puntúa por doble criterio y las ordena en un embudo comercial.

El desafío

Un cliente necesitaba llegar a un segmento muy específico de empresas. El problema: ningún registro público declara ese atributo. No hay una casilla que marcar ni un filtro que aplicar. Comprar una base tampoco servía, porque las bases comerciales replican los mismos campos que ya existen.

La alternativa manual era revisar empresa por empresa a criterio de una persona, que no escala y además es inconsistente: dos personas clasifican distinto el mismo caso.

Lo que construimos

Un motor que no busca el dato: lo infiere combinando señales independientes, ninguna concluyente por sí sola.

  • Combinación de señales con noisy-OR: apellidos romanizados, razón social, giro, ubicación y categoría de Google se agregan probabilísticamente en vez de aplicarse como reglas rígidas.
  • Diccionario que pondera la ambigüedad: una señal inequívoca pesa más que una compartida con otros orígenes. La clave es que el sistema sabe cuán segura es cada pista, en vez de tratarlas todas igual.
  • Doble score: probabilidad de pertenecer al segmento × valor del cliente. Un prospecto muy probable pero de bajo valor no debe ir arriba de la lista.
  • Deduplicación por RUT y enriquecimiento cruzado entre fuentes: la misma empresa aparece varias veces con datos parciales distintos y se consolida en un registro completo.
  • Embudo comercial integrado: el motor no entrega un CSV, entrega prospectos gestionables con su estado.
5
Señales independientes combinadas
2
Ejes de scoring
RUT
Clave de deduplicación

Por qué el enfoque probabilístico y no reglas

La tentación en este tipo de problema es escribir reglas: si cumple A y B, entonces es del segmento. Funciona en la demo y se cae en producción, porque los casos reales cumplen A pero no B, o cumplen una versión rara de A.

El enfoque probabilístico entrega en cambio un ranking de confianza. El equipo comercial decide dónde poner el corte según cuánto tiempo tenga disponible, y los casos dudosos quedan abajo en vez de perderse. El sistema no pretende tener razón: pretende ordenar bien la incertidumbre.

Stack

Next.js 16 Supabase Cheerio Scoring probabilístico

Dónde aplica esto

Cualquier operación comercial B2B que necesite priorizar a quién contactar: segmentación de cartera, detección de empresas por características no declaradas, calificación de una base grande antes de gastar horas de vendedor.

Ver agentes de IA para procesos o conversemos sobre tu caso.

¿Cuánto tiempo y dinero estás dejando en la mesa cada mes?

En 30 minutos analizamos tu operación y te mostramos exactamente qué se puede automatizar, cuánto cuesta y qué retorno puedes esperar. Sin costo, sin compromiso.

30 minutos · 100% gratuita · Diagnóstico concreto