Crafter Research
Observatorio de evals

LatamBench

Evaluación independiente de LLMs en conocimiento cultural latinoamericano: 11 modelos sobre dos benchmarks de CENIA, con un juez anclado a la referencia, transcripts abiertos y las limitaciones declaradas.

2
benchmarks
11
modelos
11K
veredictos
1,000
items por modelo
Leaderboard

Resultados

#
Modelo
1
Claude Fable 5
Anthropic
72.9%
3.4%
7.6%
2
Gemini 3.1 Pro
Google
67.4%
2.2%
8.4%
3
Gemini 3.5 Flash
Google
64.0%
2.0%
10.0%
4
GPT-5.5
OpenAI
63.7%
1.2%
10.8%
5
V4 Pro
DeepSeek
55.2%
2.4%
19.4%
6
Qwen3.7 Max
Alibaba
54.0%
8.6%
14.8%
7
GPT-5.4 Mini
OpenAI
45.8%
4.6%
19.0%
8
Claude Haiku 4.5
Anthropic
33.6%
15.6%
27.0%
9
Llama 4 Maverick
Meta
30.0%
4.6%
30.8%
10
CE
LatamGPT SFT 1.0
CENIA
regional
23.9%
5.0%
42.1%
11
Llama 3.1 70B
Meta
base
20.3%
5.0%
38.8%
Lectura de la tabla

El accuracy crudo colapsa abstención y alucinación en un solo "incorrecto", pero son opuestos. En CHOCLO, Opus 4.8 inventa solo 9.4% mientras LatamGPT inventa 53.2% (casi nunca se abstiene).

columnas
Correcto
expresa los hechos de la referencia
Abstención
se abstiene honestamente
Alucinación
inventa (alucinación)
Rigor

LatamGPT y su modelo base se solapan: el continued-pretraining no muestra una mejora detectable (+3.6 pts, IC95% [-1.6, +8.8]). Con n≈490 el estudio solo detecta diferencias mayores a 7.5 pts, así que descarta mejoras grandes pero no las chicas. Tres jueces de familias distintas concuerdan (Fleiss kappa 0.67, y 0.56 contra los veredictos de la corrida final). Las tasas de abstención están parcialmente influidas por el prompt.

Organizaciones
Anthropic
Google
OpenAI
DeepSeek
Alibaba / Qwen
Meta
CE CENIA
Hallazgos

El techo está en 72.9%

Ningún modelo supera ese valor en Trueque. El conocimiento cultural regional sigue siendo cola débil incluso para los modelos de frontera.

La métrica léxica reordena el ranking

El token-F1 puntúa el solapamiento de palabras, así que castiga respuestas correctas pero verbosas. Con el juez anclado a la referencia, el orden cambia: el modelo que el F1 ponía séptimo queda primero.

El pretraining regional no mueve la aguja de forma detectable

Primer eval independiente de un modelo con continued-pretraining regional: queda +3.6 pts sobre su base (IC95% [-1.6, +8.8]), dentro del ruido a este tamaño de muestra, y con la tasa de alucinación más alta del board.

Metodología
01

Juez anclado a referencia

Un modelo fuera del set comparado decide si la respuesta expresa los hechos de la referencia. Un set sintético reporta TPR 0.99 / TNR 0.97: mide fidelidad a la referencia, no que la referencia sea correcta, y sus 200 items salen de los mismos 500 evaluados.

02

Tres dimensiones

No solo accuracy. Separamos abstención honesta ("no sé") de alucinación ("sabe mal"): para alto riesgo, un modelo que se calla vale más que uno que inventa.

03

Reproducible

Cada corrida guarda respuestas crudas y transcripts del juez. Seed fijo, temperatura 0, todo versionado en git. Los números exactos no son bit-reproducibles (el routing y los alias de modelo derivan); lo reproducible es el pipeline y sus entradas.

04

Auditoría del benchmark

El pipeline detecta no solo errores de los modelos sino issues de referencia en los benchmarks mismos. La muestra adjudicada (n=52) es la cola de desacuerdos, sesgada por construcción: sirve para encontrar defectos, no para estimar una tasa de error. Fixes aditivos, nunca correcciones culturales.

Qué evaluamos
[TRUEQUE] Evaluado

Trueque

500 preguntas curadas de cultura, historia, geografía y gastronomía de 20 países. Referencia abierta.

CENIA · Apache 2.0
[CHOCLO] Preliminar

CHOCLO

105K preguntas de entidades culturales por país, categoría y dificultad. Conocimiento de cola larga.

CENIA · MIT
[LATAM-*] Fase 2

Dataset propio

Conjunto generativo nativo con referencias multi-respuesta, diseñado para cubrir el espacio de respuestas defendibles.

Crafter Research

Todo el harness es público

El harness, las respuestas crudas, los transcripts del juez y la calibración están en GitHub. Cualquiera puede correr un modelo nuevo, auditar un veredicto o reproducir la tabla con el mismo seed.