Ponys.ai Research Evidence Library

재현 가능한 AI 캐릭터 평가 자료

AI Character Identity Consistency Benchmark

실패 사례, 표본 수, 모델 버전과 이해 상충을 숨기지 않고 비교하기 위한 공개 테스트 도구입니다.

Protocol coverage

Test case coverage by locale

This release contains 140 preregistered cases, including 20 for 한국어. 사전 등록된 사례를 실행하고 전체 분모와 부정적 결과를 공개하며 사용한 버전을 인용합니다.

Measured dimensions

Scores use a 0-2 evidence rubric. A zero indicates missing, contradicted or unsafe evidence; one indicates partial evidence; two requires complete reproducible evidence.

Download and cite

Download test-cases.csv · CITATION.cff · BibTeX · JSON Schema

This is an official Ponys.ai test instrument, not independent editorial research. Results begin as not_collected; publishers must disclose methods, failures and conflicts before reporting scores.

Audited research targets

These indexable product paths are included for reproducible test setup and deep-link attribution.