记录任务目录、测评方法、数据质量和公开内容的实际变化。纠错会说明影响范围,不静默覆盖。
公开五项评价维度、缺失数据处理方式和首轮样本门槛。
收录 6 个 AI 编程工具和 10 个原创测试任务;尚未发布任何跑分或价格数据。