Ponys.ai Research Evidence Library
Instrumento abierto para comparar sistemas sin ocultar fallos, tamaño de muestra, versión del modelo ni conflictos de interés.
This release contains 140 preregistered cases, including 20 for Español LATAM. Ejecute los casos prerregistrados, conserve el denominador, publique resultados negativos y cite la versión utilizada.
boundary_resetcorrection_updatefact_recallunsupported_memoryScores use a 0-2 evidence rubric. A zero indicates missing, contradicted or unsafe evidence; one indicates partial evidence; two requires complete reproducible evidence.
Download test-cases.csv · CITATION.cff · BibTeX · JSON Schema
This is an official Ponys.ai test instrument, not independent editorial research. Results begin as not_collected; publishers must disclose methods, failures and conflicts before reporting scores.
These indexable product paths are included for reproducible test setup and deep-link attribution.