腾讯 Hy3 到底什么水平?
WorkBuddy 中 Hy3 免费了那么久,实际能力表现怎么样呢?腾讯有在好好做模型吗? 朋友以上,恋人未满。 和豆包坐一桌的水平 路边一条[我没试过,感觉] 聊都没人聊的水平 每次在 codebuddy 用,都要排队,导致从来没用过 这是我在真实项目中,使用 gpt 5.6 sol High 作为裁判出题,然后让子模型执行两轮测试,最终裁判给出的排名以及分数;两轮测试分别对应: 第一轮测试代码检索与补丁设计,第二轮测试故障审查、修正能力及完成步数等指标。两轮均只读,最终按第一轮 30%、第二轮 70% 加权记分,结果如下:| 排名 | 模型 | 第一轮 30% | 第二轮 70% | 最终分 |
|---:|---|---:|---:|---:|
| 1 | **DeepSeek-V4-Flash (Go)** | 81 | 83 | **82.4** |
| 2 | **Qwen3.7-Plus (Go)** | 84 | 77 | **79.1** |
| 3 | **GPT-5.6 Luna (ChatGPT)** | 79 | 79 | **79.0** |
| 4 | **Hy3 (Go)** | 71 | 75 | **73.8** |
| 5 | **MiMo-V2.5-Pro (Go)** | 70 | 69 | **69.3** |
| 6 | **MiniMax-M3 (TokenPlan)** | 84 | 57 | **65.1** | @nonewind 只针对真实项目,代码能力,不包含多模态能力; 我经常用,不太聪明,但是免费呀。 我个人觉得 HY3 还行。做前端没太多问题。后端够用。
但是理解水平有点不行,有时候会误解需求。然后代码能力需要 review ,有时候会设计很蠢的逻辑。
页:
[1]
2