Apoya la infraestructura pública / programa 2026

Ayúdanos a medir los sistemas en los que Latinoamérica debe confiar.

Crafter Research publica evaluaciones independientes de modelos, benchmarks reproducibles de IA legal y corpora públicos con fuentes. Buscamos cómputo, financiamiento y revisión experta atados a hitos abiertos y específicos.

Evidencia publicada

El trabajo propuesto parte de artefactos que ya existen.

Estas son líneas base inspeccionables, no proyecciones. Los programas propuestos aparecen separados más abajo.

Research propuesto

Tres programas esperando cuellos de botella reales, no inventados.

Cada programa tiene un resultado útil a 90 días, un fallback menor y un rastro abierto de evidencia. Son proyectos propuestos y limitados por cómputo. No se presentan como output actual.

Propuesto / compute-gated

Spanish Legal Model Reliability Lab

¿Puede un modelo citar la ley que era válida entonces?

Comparar RAG, long-context y experimentos locales acotados sobre derecho peruano. Medir citas, vigencia temporal, groundedness, abstención y alucinación.

Recurso
$2k–$5k en APIs + revisión experta
Gate a 90 días
Expandir Amicus Eval de N=35 a N≥150 y comparar 4–6 configuraciones fijas.
Retorno público
Evidencia por query, versiones del corpus, taxonomía de fallas y verificación de métricas con un comando.
Límite
El benchmark mide el comportamiento del sistema. No reemplaza el juicio legal calificado.
Propuesto / compute-gated

Public-Service Agent Reliability Benchmark

El gauntlet del trámite.

Repetir workflows realistas de servicios públicos entre modelos y perturbaciones de interfaz. Medir completitud, fidelidad a fuentes, acciones inseguras, recuperación y portal drift.

Recurso
$3k–$8k en créditos multimodales
Gate a 90 días
20–25 workflows no destructivos, cuatro configuraciones y al menos tres repeticiones por tarea.
Retorno público
Trayectorias redactadas, fixtures, scorers, formato de replay y taxonomía de fallas.
Límite
El piloto excluye pagos, identidad, envíos y acciones gubernamentales irreversibles.

Formas de apoyar

Emparejemos el recurso con el trabajo.

La mejor oferta no siempre es la más grande. Es la que desbloquea un release nombrado con suficiente tiempo para usarla responsablemente.

API

Acceso a modelos

$5k–$10k en créditosVálidos por 12 meses

Controles frontier, jueces independientes, eval legal long-context, embeddings, reranking y agentes multimodales.

Fallback: $1,000 para un release acotado.
GPU

Capacidad de aceleradores

1,000 horas equivalentes de A100O $5,000 en cloud credits

Serving controlado de 70B, modelos no disponibles por API, repeticiones y experimentos de retrieval en español.

Primer piloto: 300–600 horas durante 90 días.
REV

Validación humana

Grant de $25,000Research y revisión experta

Adjudicación de hablantes nativos, revisión legal, curación de datasets, mantenimiento y publicación.

Fallback: $5,000 para un hito legal revisado.
HW

Piloto medido de hardware

Préstamo por 90 díasCapacidad dedicada o remota equivalente

Inferencia repetible de alta memoria, reporte de utilización, notas de reproducibilidad y decisión de devolver, extender o convertir.

El hardware sigue a una carga medible. Cloud siempre sirve.

Independencia del research

El apoyo compra un release. Nunca compra el resultado.

Cada recurso recibido se declara. El mismo protocolo aplica a modelos apoyados y no apoyados. Los proveedores no reciben veto editorial, control del ranking ni derecho a ocultar resultados negativos o fallas de infraestructura.

  1. 01Se declara cada recurso y su valor aproximado.
  2. 02La inclusión de modelos sigue el diseño del estudio.
  3. 03Métodos, fallas y limitaciones siguen siendo publicables.
  4. 04Los casos patrocinados se separan de las conclusiones.

Empecemos con un release medible

Cuéntanos qué recurso puedes ofrecer.

Responderemos con el workload, presupuesto, hitos, plan de custodia y entregables públicos correspondientes. Cómputo, créditos, tiempo experto, colaboración institucional y grants son útiles.

Escribirle a Railly railly@crafterstation.com / Crafter Research es un research lab de interés público de Crafter Station.