Evaluación independiente de LLMs en conocimiento cultural latinoamericano: 11 modelos sobre dos benchmarks de CENIA, con un juez anclado a la referencia, transcripts abiertos y las limitaciones declaradas.
El accuracy crudo colapsa abstención y alucinación en un solo "incorrecto", pero son opuestos. En CHOCLO, Opus 4.8 inventa solo 9.4% mientras LatamGPT inventa 53.2% (casi nunca se abstiene).
LatamGPT y su modelo base se solapan: el continued-pretraining no muestra una mejora detectable (+3.6 pts, IC95% [-1.6, +8.8]). Con n≈490 el estudio solo detecta diferencias mayores a 7.5 pts, así que descarta mejoras grandes pero no las chicas. Tres jueces de familias distintas concuerdan (Fleiss kappa 0.67, y 0.56 contra los veredictos de la corrida final). Las tasas de abstención están parcialmente influidas por el prompt.
Ningún modelo supera ese valor en Trueque. El conocimiento cultural regional sigue siendo cola débil incluso para los modelos de frontera.
El token-F1 puntúa el solapamiento de palabras, así que castiga respuestas correctas pero verbosas. Con el juez anclado a la referencia, el orden cambia: el modelo que el F1 ponía séptimo queda primero.
Primer eval independiente de un modelo con continued-pretraining regional: queda +3.6 pts sobre su base (IC95% [-1.6, +8.8]), dentro del ruido a este tamaño de muestra, y con la tasa de alucinación más alta del board.
Un modelo fuera del set comparado decide si la respuesta expresa los hechos de la referencia. Un set sintético reporta TPR 0.99 / TNR 0.97: mide fidelidad a la referencia, no que la referencia sea correcta, y sus 200 items salen de los mismos 500 evaluados.
No solo accuracy. Separamos abstención honesta ("no sé") de alucinación ("sabe mal"): para alto riesgo, un modelo que se calla vale más que uno que inventa.
Cada corrida guarda respuestas crudas y transcripts del juez. Seed fijo, temperatura 0, todo versionado en git. Los números exactos no son bit-reproducibles (el routing y los alias de modelo derivan); lo reproducible es el pipeline y sus entradas.
El pipeline detecta no solo errores de los modelos sino issues de referencia en los benchmarks mismos. La muestra adjudicada (n=52) es la cola de desacuerdos, sesgada por construcción: sirve para encontrar defectos, no para estimar una tasa de error. Fixes aditivos, nunca correcciones culturales.
500 preguntas curadas de cultura, historia, geografía y gastronomía de 20 países. Referencia abierta.
105K preguntas de entidades culturales por país, categoría y dificultad. Conocimiento de cola larga.
Conjunto generativo nativo con referencias multi-respuesta, diseñado para cubrir el espacio de respuestas defendibles.
El harness, las respuestas crudas, los transcripts del juez y la calibración están en GitHub. Cualquiera puede correr un modelo nuevo, auditar un veredicto o reproducir la tabla con el mismo seed.