← Volver al portafolio
Caso 02 · LegalTech

51.000 sentencias convertidas en una base consultable

Motor de búsqueda y análisis sobre jurisprudencia chilena real: Corte Suprema, Cortes de Apelaciones y Tribunal Constitucional. Pipeline completo de ingesta, clasificación, análisis profundo y embeddings vectoriales.

El desafío

La jurisprudencia chilena está disponible, pero no es utilizable. Está repartida en portales con buscadores pobres, en documentos que no siguen un formato estable y sin ninguna clasificación que permita preguntar algo tan básico como qué ha dicho la Corte sobre esta materia en los últimos cinco años.

El problema no se resuelve tirando un modelo de lenguaje encima. Un modelo sin fuente verificada inventa citas, y en derecho una cita inventada no es un error simpático: destruye la credibilidad de un escrito y expone al abogado que lo firma.

Lo que construimos

Un pipeline de cuatro etapas donde cada una tiene su propio criterio de costo y calidad.

  • Ingesta con trazabilidad: cada sentencia queda con su identificador de origen y control de descargas truncadas. Si un documento llegó incompleto, el sistema lo sabe y no lo da por bueno.
  • Clasificación en taxonomía de 11 materias jurídicas, construida sobre el corpus real y no sobre categorías teóricas.
  • Análisis profundo por línea jurisprudencial, donde el objetivo no es resumir un fallo sino entender cómo se conecta con los anteriores.
  • Embeddings vectoriales sobre PostgreSQL 16 con pgvector, corriendo en Docker, para búsqueda semántica y no solo por palabra clave.

La decisión de arquitectura que más rindió fue la estrategia de costos por capas: un modelo económico hace la clasificación masiva y un modelo potente entra solo en el análisis de línea jurisprudencial. Procesar 51.000 documentos con el modelo caro en todas las etapas es económicamente inviable; hacerlo todo con el barato entrega un corpus que no sirve.

51.000
Sentencias procesadas
11
Materias en la taxonomía
3
Fuentes jurisdiccionales

Pipelines que se pueden interrumpir

Procesar decenas de miles de documentos toma días y algo siempre falla: un rate-limit, un corte, una fuente que cambia el formato. Todo el pipeline es resumible: se interrumpe y se retoma sin perder el trabajo ya hecho ni reprocesar lo que ya está validado.

Parece un detalle de implementación y es en realidad lo que hace la diferencia entre un experimento y un sistema. Un pipeline que hay que reiniciar desde cero cuando falla, en la práctica nunca termina.

Stack

PostgreSQL 16 pgvector Claude API Docker RAG Embeddings

Dónde aplica esto

El mismo pipeline sirve para cualquier corpus documental grande donde la respuesta tiene que ser verificable: normativa interna, contratos, expedientes técnicos, manuales de equipos, documentación de proyectos. La materia cambia; la arquitectura de ingesta, clasificación por capas de costo y búsqueda semántica con fuente trazable es la misma.

Si tienes un archivo documental que nadie logra consultar bien, mira cómo lo abordamos o revisa el caso del verificador de citas.

¿Cuánto tiempo y dinero estás dejando en la mesa cada mes?

En 30 minutos analizamos tu operación y te mostramos exactamente qué se puede automatizar, cuánto cuesta y qué retorno puedes esperar. Sin costo, sin compromiso.

30 minutos · 100% gratuita · Diagnóstico concreto