Un LLM de AI Justicia · Documento técnico-comercial · 2026
Licenciar el modelo
Tlamatini — del náhuatl tlamatini, «el que sabe»: los sabios consejeros del México antiguo — es un modelo de lenguaje fundacional y soberano: más de 10 mil millones de tokens de fuentes primarias oficiales, generación anclada en recuperación con citas verificables, y pesos que se entregan dentro de su infraestructura. Este documento presenta el modelo — y las formas de licenciarlo.
Los LLM jurídicos dominantes se entrenan con corpus angloamericanos, citan artículos que no dicen lo que afirman cuando se les pregunta por México, y solo existen detrás de APIs extranjeras — inaceptables para quien opera bajo secreto profesional. Tlamatini es el modelo que falta: un LLM cuyos pesos aprendieron de un corpus propio de fuentes primarias mexicanas, entrenado para responder en un arnés de generación anclada en recuperación donde cada afirmación se verifica contra el pasaje oficial — con abstención honesta cuando la evidencia no alcanza. Y a diferencia de cualquier modelo de nube, Tlamatini se licencia y se entrega: sus pesos corren en su infraestructura, bajo su control.
1.1 · Alucinación de ley. Evaluamos un modelo legal de clase mundial (entrenado en derecho angloamericano) con 30 preguntas ciudadanas canónicas — laboral, familiar, consumo, vivienda. Respondió 30/30 con fluidez profesional y el 93% citó artículos. La inspección reveló errores sistemáticos: citó el «Art. 139 LFT» para la protección contra despido por embarazo (el correcto es el 164) y atribuyó la fórmula de indemnización «3 meses + 20 días por año» al Art. 48 (es el Art. 50).
Una confesión honesta del propio proyecto: al redactar el documento técnico, un autor citó el «Art. 225 CPF» como base del secreto profesional. Son los arts. 210–211 — el revisor lo detectó y la corrección se verificó contra el corpus de este proyecto. La deriva de citas no es una debilidad de los modelos débiles: es el modo de falla por defecto de cualquier razonamiento jurídico basado en memoria, humano o máquina. Ese es el argumento central de la generación anclada en recuperación.
1.2 · Dependencia de nube vs. secreto profesional. Los despachos mexicanos operan bajo secreto profesional con sanción penal (arts. 210–211 del CPF) y bajo la LFPDPPP para datos personales sensibles. Subir expedientes privilegiados a una API extranjera — que puede retenerlos y entrenar con ellos — es jurídicamente inaceptable. Un modelo soberano y desplegable localmente no es un lujo: es un requisito de cumplimiento.
1.3 · No existía un corpus mexicano. Los modelos legales de referencia se entrenaron con 30 mil millones de tokens de derecho inglés. Para México no existía equivalente — no porque el dato no exista, sino porque está disperso en más de 33 portales judiciales, 32 sistemas de gacetas estatales, una gaceta federal de 107 años y repositorios universitarios, la mayoría detrás de protecciones anti-bot.
«Si te despidieron estando embarazada, el artículo 139 de la Ley Federal del Trabajo te protege…»
✗ Falso. El art. 139 no contiene esa protección; la correcta es el art. 164. Suena perfecto. Es falso — y el ciudadano no puede verificarlo.
«…la trabajadora embarazada goza de estabilidad reforzada (art. 164 LFT) [SJI 2a./J. 42/2016]…»
✓ Verificable. Cada afirmación sale de un pasaje recuperado del corpus, con su fragmento oficial expandible y exportable.
Un corpus de derecho mexicano no es un dataset: es un sistema vivo de registro. Las leyes se reforman, las gacetas publican a diario, los tribunales suben sentencias constantemente. Cada cosechador vive en un registro versionado con su marca de agua y su estrategia incremental — y el estado de cada fuente (documentos, ventana de cobertura, frescura contra su cadencia esperada) se publica en un tablero público de transparencia.
La lección de los modelos de referencia es que la ingeniería de calidad domina al volumen: nosotros documentamos además la parte que nadie publica — cómo se atraviesan portales con reCAPTCHA, cadenas JWT, bloqueos geográficos y aplicaciones ASP.NET heredadas, con técnicas reproducibles para cada fuente.
| Familia de fuente | Contenido | Tokens aprox. |
|---|---|---|
| Semanario Judicial de la Federación | 150,187 tesis (jurisprudencia y aisladas), 1900–2026, cosecha diferencial tras el WAF | ~22M |
| Diario Oficial de la Federación | 1999–2026, texto completo por nota, diferencial diario | ~300M+ |
| Legislación federal y reglamentos | Corpus LeyesBiblio + reglamentos y manuales + lex-mx (317 leyes en Markdown sincronizado a diario) | ~50M |
| Legislación estatal (32 estados) | 24,076 códigos, leyes y reglamentos consolidados vía Orden Jurídico Nacional — cobertura total32/32 | ~85M |
| Gaceta Oficial CDMX | Archivo completo 2014–2026 recuperado vía índice Wayback CDX | 143M |
| Casos estatales — CDMX (SIVEPJ) | 42,947 sentencias — universo completo ingerido | ~52M |
| Casos estatales — Baja California | API pública de 147K registros; cosecha en cursoen curso | ~250M |
| Casos estatales — Edomex | 178,439 sentencias enumeradas vía API Elasticsearch del poder judicial; extracción en progresoen curso | ~3–4B |
| Casos estatales — Jalisco | 84,731 sentencias enumeradas vía API con reCAPTCHA; PDFs por URLs prefirmadas de S3en curso | ~2–3B |
| Querétaro, Nuevo León y más | Cadenas JWT, postbacks ASP.NET WebForms, llaves de API extraídas del frontend | ~1–2B |
| Doctrina — BJV (IIJ-UNAM) | 5,680 libros completos vía OAI-PMH; 445 cuadernillos SCJN rescatados con OCR | ~1B |
| Tesis — Repositorio UNAM | 43,423 tesis (~40% con PDF completo) | ~2–3B |
| Datos instructivos en inglés (solo SFT) | 269K ejemplos de razonamiento — NLI, lógica tipo LSAT, case briefs; cero leyes extranjeras | mezcla SFT |
La receta sintetiza los dos modelos legales de referencia — el plano abierto (CPT de dominio con replay) y la validación industrial (CPT fuerte + fusión lineal anti-olvido sobre la misma familia base) — y los extiende con nuestra aportación central: entrenar el comportamiento del arnés dentro de los pesos. Tlamatini opera en un arnés: recuperar pasajes → inyectarlos como contexto → exigir respuestas ancladas en citas. En nuestras pruebas, todos los fallos de abstención fueron fallos del arnés, no del modelo. La extensión natural es incluir millones de ejemplos en el formato exacto de inferencia durante el propio preentrenamiento:
<pasaje(s) recuperado(s)> + <pregunta ciudadana>
→ <respuesta con anclas [n] por afirmación>
Las tres fuentes de pares ya están en la mano: los considerandos judiciales (afirmación + artículo por naturaleza, minería gratuita sobre 200K+ sentencias), las trazas de producción con consentimiento LFPDPPP explícito y revocable, y la destilación sintética a escala de corpus. Para IA jurídica jurisdiccional, arnés-en-los-pesos más recuperación-en-inferencia supera a cualquiera de los dos por separado.
~10B tokens del corpus mexicano sobre la familia base de 35B — la elección de arquitectura ya validada por el resultado industrial de referencia. Fusión lineal con el modelo base como mecanismo anti-olvido. 4×H200 · ~6 h · ~$70 USD de cómputo rentado por corrida.
Ajuste fino sobre diálogo de entrevista, respuestas ancladas en citas y calibración de abstención — más los 269K ejemplos instructivos en inglés de razonamiento puro (NLI contractual, lógica LSAT, case briefs). Patrones de razonamiento, cero leyes extranjeras.
Adaptadores LoRA entrenados exclusivamente con los documentos consentidos de cada firma, servidos por fusión en tiempo de ejecución. El estilo de la casa, sus estrategias, su memoria institucional — sin que un solo byte salga del perímetro.
Batería propia de 30 preguntas ciudadanas · mismas fuentes · mismo motor de recuperación. El especialista respondió 4× más — y citó mejor.
Tasa de respuesta tras corregir la ingeniería de presupuesto de tokens para modelos razonadores — sin pérdida en integridad de citas.
Latencia del paso de clasificación de aplicabilidad: no requiere un LLM frontera, sino un clasificador calibrado y rápido — con veredictos idénticos en los casos medidos.
De las respuestas del modelo angloamericano citaban artículos — con errores sistemáticos de jurisdicción. La fluidez no es evidencia de corrección.
La conclusión estratégica: no competimos contra la frontera general — competimos donde la frontera no puede llegar: derecho mexicano, anclado en fuentes oficiales, desplegable en su despacho. La brecha entre modelos abiertos y cerrados se cierra a velocidad medible, y en dominios especializados un modelo enfocado no iguala a la frontera: la supera.
El secreto profesional es un deber con sanción penal: los arts. 210–211 del Código Penal Federal castigan con 1 a 5 años de prisión y suspensión de la profesión la revelación de secretos por quien presta servicios profesionales. Subir expedientes de clientes a una API extranjera que puede retenerlos no es una opción para un despacho mexicano.
Tlamatini se entrega como pesos que corren dentro de la infraestructura de la firma: inferencia 100% local, cero llamadas a nubes extranjeras, compatible con la LFPDPPP y el deber de sigilo. En un mercado donde todo LLM jurídico de nube es jurídicamente inutilizable para los despachos, el cumplimiento es el foso defensivo del modelo.
Los datos de la firma nunca entran al adaptador general; el adaptador general nunca ve documentos privilegiados. Es la expresión arquitectónica de los arts. 210–211 CPF y de la LFPDPPP.
Tlamatini no es un servicio de nube del que usted depende: es un modelo que se licencia. Cada nivel entrega una forma distinta del mismo LLM — acceso hospedado, acceso vía API, o los pesos completos dentro de su infraestructura — con el mismo contrato de honestidad: citas verificables o abstención declarada.
Acceso al modelo completo en nuestra infraestructura mexicana, con el arnés de recuperación y citas verificadas incluido. La puerta de entrada al LLM.
El modelo como componente: endpoints de generación anclada y de clasificación de aplicabilidad para construir sus propios productos jurídicos sobre Tlamatini.
Los pesos del modelo entregados dentro de su infraestructura, con un adaptador privado entrenado exclusivamente con los casos consentidos de su firma. El LLM es suyo de operar.
* Precios y empaquetado indicativos — pendientes de definición comercial. Editables antes de publicación. Las licencias inician con la primera versión del modelo base, 2027. El nivel Hospedado convive con la orientación ciudadana gratuita que AI Justicia ya opera como demostración pública del estándar de citas del modelo.
No sustituye la función jurisdiccional ni emite resoluciones. Orienta con la ley en la mano — la decisión pertenece a los órganos jurisdiccionales.
La respuesta formal, la estrategia y la firma de una licenciada o licenciado con cédula siguen siendo insustituibles. Tlamatini es su instrumento, no su relevo.
Cuando las fuentes no sustentan una respuesta, se abstiene y lo dice — en lugar de inventar con confianza. Esa virtud le da nombre.
Miles de millones de tokens cosechados de fuentes oficiales; ingesta diaria diferencial; 421,119 documentos y 10.7M de fragmentos ya consultables; tablero público de transparencia en vivo.
Preentrenamiento continuo sobre derecho mexicano en infraestructura dedicada (Tohil), 4×H200 rentados por corrida; decisión de base informada por la evaluación en curso.
Batería de preguntas ciudadanas con citas verificables y resultados abiertos: tasa de respuesta, precisión de citas, exactitud a nivel de artículo y calibración de abstención.
Primeros pilotos on-premise con adaptadores privados. Lista de espera abierta para firmas fundadoras.
Tlamatini se licencia: hospedado, vía API, o con sus pesos dentro de su infraestructura. Asegure su lugar en los pilotos 2027 — y vea hoy mismo el estándar de citas del modelo en la demostración pública de AI Justicia.