从真实开发任务开始
aicheck 不把厂商宣传参数直接换算成能力分。每次测评都从可复现的开发任务开始,并记录工具、模型、环境、指令、运行过程和验证结果。
让结果可以被检查
能够自动判断的任务优先使用单元测试、类型检查、静态分析和输出比对。需要人工判断的部分会公开判定标准,并与客观指标分开呈现。
样本不足就不排名
单次成功不能代表稳定能力。没有达到方法论规定的样本门槛时,页面只会显示“样本不足”,不会生成看似精确的分数。
保留历史快照
正式发布的评分和榜单属于特定时间、版本与方法论。数据更新时会生成新快照,旧结果不会被悄悄覆盖。