模型晴雨表近 24h 中转健康度
Claude+5.9%
98.2%GPT+0.5%
97.4%模型愚蠢指数30D愚蠢指数, 越高越好
Claude+2.5
69.561–76GPT-3.0
74.563–80筛选条件
厂商
支持渠道
测试次数1,383
测试题目16
总计花费$774.61
正在加载 Bench 数据...
测试次数1,383
测试题目16
总计花费$774.61
测试次数1,383
测试题目16
总计花费$774.61
右下角区域为黄金性价比模型。气泡半径越大代表生成速度越快。
| 站点 | 渠道 | 模型 | 通过率 | 平均花费 (USD) | Token TPS | 测试次数 |
|---|---|---|---|---|---|---|
| Packy Code | OFFICIAL | claude-opus-4-8 | 86% | $1.4091 | 41.8 | 50 |
| Cubence | OFFICIAL | gpt-5.6-sol | 86% | $0.1766 | 27.5 | 50 |
| Micu | OFFICIAL | claude-opus-4-8 | 86% | $0.8163 | 44.5 | 50 |
| CCTQ | OFFICIAL | claude-opus-4-8 | 84% | $0.9193 | 43.8 | 50 |
| Micu | OFFICIAL | gpt-5.6-sol | 84% | $0.1087 | 24.4 | 50 |
| SSSAI Code | OFFICIAL | claude-opus-4-8 | 84% | $0.7926 | 40.4 | 50 |
| TimiCC | OFFICIAL | gpt-5.6-sol | 84% | $0.1141 | 28.2 | 50 |
| ByteCat | OFFICIAL | gpt-5.6-sol | 83.3% | $0.1819 | 32.6 | 42 |
| Neko Code | OFFICIAL | gpt-5.6-sol | 82% | $0.1084 | 26.4 | 50 |
| 78 Code | OFFICIAL | claude-opus-4-8 | 80% | $0.8221 | 41.0 | 50 |
| Packy Code | OFFICIAL | gpt-5.6-sol | 80% | $0.1886 | 27.9 | 50 |
| Yunwu | OFFICIAL | claude-opus-4-8 | 80% | $0.8509 | 37.9 | 50 |
| CCTQ | OFFICIAL | gpt-5.6-sol | 80% | $0.1086 | 27.5 | 50 |
| Right Code | OFFICIAL | gpt-5.6-sol | 79.6% | $0.1522 | 35.1 | 49 |
| Duck Code | OFFICIAL | gpt-5.6-sol | 78% | $0.2653 | 25.2 | 50 |
| Right Code | OFFICIAL | claude-opus-4-8 | 78% | $1.0401 | 39.4 | 50 |
| ByteCat | OFFICIAL | claude-opus-4-8 | 76.2% | $0.8943 | 47.5 | 42 |
| Yes Code | OFFICIAL | gpt-5.6-sol | 76% | $0.2370 | 29.6 | 50 |
| Somebody | AWSQ | claude-opus-4-8 | 76% | $0.3248 | 17.0 | 50 |
| 78 Code | OFFICIAL | gpt-5.6-sol | 76% | $0.0736 | 29.5 | 50 |
| Duck Code | OFFICIAL | claude-opus-4-8 | 76% | $0.7107 | 29.2 | 50 |
| Cubence | OFFICIAL | claude-opus-4-8 | 76% | $0.7981 | 36.6 | 50 |
| SSSAI Code | OFFICIAL | gpt-5.6-sol | 74% | $0.1031 | 28.4 | 50 |
| TimiCC | OFFICIAL | claude-opus-4-8 | 74% | $0.7703 | 37.5 | 50 |
| Yes Code | OFFICIAL | claude-opus-4-8 | 74% | $0.8511 | 37.9 | 50 |
| Neko Code | OFFICIAL | claude-opus-4-8 | 72% | $1.2329 | 34.7 | 50 |
| IKun Code | OFFICIAL | gpt-5.6-sol | 72% | $0.2323 | 27.1 | 50 |
| IKun Code | OFFICIAL | claude-opus-4-8 | 72% | $1.3844 | 33.5 | 50 |
按全部历史 trial 聚合的渠道排名,口径见下方评测方法论。
| # | 渠道 | 模型 | 通过率 | 速度 | 成本 |
|---|---|---|---|---|---|
| 1 | Packy Code · OFFICIAL | claude-opus-4-8 | 86.0% | 41.8 | $1.4091 |
| 2 | Cubence · OFFICIAL | gpt-5.6-sol | 86.0% | 27.5 | $0.1766 |
| 3 | Micu · OFFICIAL | claude-opus-4-8 | 86.0% | 44.5 | $0.8163 |
| 4 | CCTQ · OFFICIAL | claude-opus-4-8 | 84.0% | 43.8 | $0.9193 |
| 5 | Micu · OFFICIAL | gpt-5.6-sol | 84.0% | 24.4 | $0.1087 |
| 6 | SSSAI Code · OFFICIAL | claude-opus-4-8 | 84.0% | 40.4 | $0.7926 |
| 7 | TimiCC · OFFICIAL | gpt-5.6-sol | 84.0% | 28.2 | $0.1141 |
| 8 | ByteCat · OFFICIAL | gpt-5.6-sol | 83.3% | 32.6 | $0.1819 |
| 9 | Neko Code · OFFICIAL | gpt-5.6-sol | 82.0% | 26.4 | $0.1084 |
| 10 | 78 Code · OFFICIAL | claude-opus-4-8 | 80.0% | 41.0 | $0.8221 |
| # | 渠道 | 模型 | 通过率 | 速度 | 成本 |
|---|---|---|---|---|---|
| 1 | ByteCat · OFFICIAL | claude-opus-4-8 | 76.2% | 47.5 | $0.8943 |
| 2 | Micu · OFFICIAL | claude-opus-4-8 | 86.0% | 44.5 | $0.8163 |
| 3 | CCTQ · OFFICIAL | claude-opus-4-8 | 84.0% | 43.8 | $0.9193 |
| 4 | Packy Code · OFFICIAL | claude-opus-4-8 | 86.0% | 41.8 | $1.4091 |
| 5 | 78 Code · OFFICIAL | claude-opus-4-8 | 80.0% | 41.0 | $0.8221 |
| 6 | SSSAI Code · OFFICIAL | claude-opus-4-8 | 84.0% | 40.4 | $0.7926 |
| 7 | Right Code · OFFICIAL | claude-opus-4-8 | 78.0% | 39.4 | $1.0401 |
| 8 | Yes Code · OFFICIAL | claude-opus-4-8 | 74.0% | 37.9 | $0.8511 |
| 9 | Yunwu · OFFICIAL | claude-opus-4-8 | 80.0% | 37.9 | $0.8509 |
| 10 | TimiCC · OFFICIAL | claude-opus-4-8 | 74.0% | 37.5 | $0.7703 |
| # | 渠道 | 模型 | 通过率 | 速度 | 成本 |
|---|---|---|---|---|---|
| 1 | 78 Code · OFFICIAL | gpt-5.6-sol | 76.0% | 29.5 | $0.0736 |
| 2 | SSSAI Code · OFFICIAL | gpt-5.6-sol | 74.0% | 28.4 | $0.1031 |
| 3 | Neko Code · OFFICIAL | gpt-5.6-sol | 82.0% | 26.4 | $0.1084 |
| 4 | CCTQ · OFFICIAL | gpt-5.6-sol | 80.0% | 27.5 | $0.1086 |
| 5 | Micu · OFFICIAL | gpt-5.6-sol | 84.0% | 24.4 | $0.1087 |
| 6 | TimiCC · OFFICIAL | gpt-5.6-sol | 84.0% | 28.2 | $0.1141 |
| 7 | Right Code · OFFICIAL | gpt-5.6-sol | 79.6% | 35.1 | $0.1522 |
| 8 | Cubence · OFFICIAL | gpt-5.6-sol | 86.0% | 27.5 | $0.1766 |
| 9 | ByteCat · OFFICIAL | gpt-5.6-sol | 83.3% | 32.6 | $0.1819 |
| 10 | Packy Code · OFFICIAL | gpt-5.6-sol | 80.0% | 27.9 | $0.1886 |
截至 2026年7月12日,本站已对 28 个渠道配置在 16 道真实编程任务上累计执行 1383 次测试,总花费约 $775,全部自费、无中转赞助。
以测试题为主键,展示在 terminal-bench / aider-polyglot 等真实编程任务下的跑分,而非接口连通性检测。
每次 trial 在隔离容器内运行:CLI Agent(codex / claude-code 等)通过被测渠道调用模型完成任务,随后由独立 Verifier 执行任务自带的验收脚本判分,全程记录 Token 消耗、耗时与实际花费。
仅 Verifier 验收通过的 trial 计为通过;模型未完成任务、运行异常或超时一律计为失败,不做人工补测,也不挑选成绩重跑。
历史通过率 = 通过 trial 数 ÷ 总 trial 数 × 100%;水平线 = 所有 config 历史通过率的算术平均。
统计每个渠道(config)的全部历史 trial;卡片明细基于最新一次已上架 run 的切片,历史通过率跨全部已上架 run 累计。同 task/config 历史 trial 数少于 3 次标记「样本不足」,避免小样本误导。指标含通过率、平均 Token、平均花费、Token TPS。