2026-10-11 16:36 UTC

model-regression

band: warmmomentum: stable score: 0.315
temperature history

Episodes (2)

Reddit evaluator s1lverkin reports two replicated 100-slot Terminal-Bench 2.1 runs on public Harbor job data in which GPT-6 Luna substantially underperforms GPT-5.6 Luna on coding tasks; broad replication or OpenAI acknowledgment would establish a real coding regression contradicting GPT-6 Luna's release claims.
corroboratedconvergesscott: high
GitHub user ninjahawk claims his released livenerf suite runs deterministic, independently verifiable tests on Opus 5.5 daily for a month and logs discrepancies publicly, turning community model-nerfing suspicions into checkable regression evidence.
corroboratedknownscott: low