|
|
这是我在真实项目中,使用 gpt 5.6 sol High 作为裁判出题,然后让子模型执行两轮测试,最终裁判给出的排名以及分数;两轮测试分别对应: 第一轮测试代码检索与补丁设计,第二轮测试故障审查、修正能力及完成步数等指标。两轮均只读,最终按第一轮 30%、第二轮 70% 加权记分,结果如下:
| 排名 | 模型 | 第一轮 30% | 第二轮 70% | 最终分 |
|---:|---|---:|---:|---:|
| 1 | **DeepSeek-V4-Flash (Go)** | 81 | 83 | **82.4** |
| 2 | **Qwen3.7-Plus (Go)** | 84 | 77 | **79.1** |
| 3 | **GPT-5.6 Luna (ChatGPT)** | 79 | 79 | **79.0** |
| 4 | **Hy3 (Go)** | 71 | 75 | **73.8** |
| 5 | **MiMo-V2.5-Pro (Go)** | 70 | 69 | **69.3** |
| 6 | **MiniMax-M3 (TokenPlan)** | 84 | 57 | **65.1** | |
|