LatamBench Open Weights Observatory
Los modelos que Latinoamérica realmente puede correr.Evaluar modelos open-weight y regionales bajo serving controlado. Medir accuracy, abstención, alucinación, efectos de cuantización, variación de serving y defectos en referencias.
- Recurso
- 300–600 horas equivalentes de A100
- Gate a 90 días
- 6–8 modelos abiertos sobre dos familias de benchmarks, con repeticiones controladas y validación humana.
- Retorno público
- Respuestas crudas, revisiones exactas, recetas de serving, jueces, exclusiones, costo y utilización medida.
- Límite
- El scope central termina en 70B. Modelos mayores siguen a la utilización medida, no solo a la ambición.