REPRODUCIBLE TASKS

真实任务 Bench

每个任务公开目标、难度与验收标准。当前目录不等于跑分结果,任务未执行时会明确标记“尚未采集”。

测评方法

aicheck 编程工具测评方法 v1

数据有效

以可复现的真实开发任务为核心,分别记录任务完成、代码质量、指令遵循、成本效率和速度稳定性。

方法版本
1.0.0
每任务最低运行次数
3
前端调试尚未采集

定位并修复 React 水合不一致

在保留现有交互的前提下,定位服务端与客户端输出不一致的根因并完成修复。

  • 进阶
  • 4 项验收标准
前端实现尚未采集

实现无障碍响应式仪表盘

依据明确规格实现移动端优先的仪表盘,并满足键盘操作和语义化要求。

  • 进阶
  • 4 项验收标准
后端安全尚未采集

补齐 API 输入校验与授权

修复一个信任客户端参数的接口,增加输入校验、身份验证和资源级授权。

  • 高级
  • 4 项验收标准
后端调试尚未采集

修复分页边界回归

定位列表接口在空页、末页与并发更新时出现的分页错误。

  • 入门
  • 4 项验收标准
代码质量尚未采集

重构不安全的 TypeScript 数据边界

将依赖 any 和不安全断言的数据解析逻辑改造成严格类型与运行时收窄。

  • 进阶
  • 4 项验收标准
性能优化尚未采集

消除数据列表的 N+1 查询

在保持结果一致的前提下减少数据库往返,并验证查询数量和响应时间。

  • 进阶
  • 4 项验收标准
测试工程尚未采集

分析并修复测试回归

根据失败日志定位真实回归,修复实现并补充能够防止复发的测试。

  • 进阶
  • 4 项验收标准
代码理解尚未采集

大型代码库快速定位改动点

在陌生多包仓库中梳理依赖关系,找出实现需求所需的最小改动范围。

  • 高级
  • 4 项验收标准
综合开发尚未采集

跨文件实现完整功能

依据验收条件完成涉及数据层、服务逻辑、界面和测试的跨文件功能。

  • 高级
  • 4 项验收标准
工程协作尚未采集

同步实现与技术文档

根据代码中的真实行为修正文档、示例命令和配置说明。

  • 入门
  • 4 项验收标准