跳到正文
RCreddit.com·

Gave 6 AI models the same bug. Only 3 got it right.

AI 摘要

一位开发者进行了一项测试,他给ChatGPT、Claude、Gemini、Grok、DeepSeek和Qwen这六个AI模型提供了相同的代码错误,并要求它们进行修复。在没有改变提示的情况下,开发者测试了所有六个AI模型生成的修复方案,结果显示只有三个模型提供了正确且有效的解决方案。这项测试引发了关于AI生成代码可靠性的讨论,以及开发者在使用AI生成代码前是否应该进行严格测试的思考。

为什么是这条

该报告首次对比了六个主流AI模型的调试能力,揭示了只有半数模型能正确修复同一代码错误。

时间与来源

时间显示为 UTC

显示时区:UTC

本地时区尚不可用,暂时显示 UTC。

发布当时偏移:UTC+02026年9月8日 17:07 UTC

收录当时偏移:UTC+02026年9月9日 17:00 UTC

发布
2026年9月8日 17:07
收录
2026年9月9日 17:00
来源类型
开发者社区
档位
社区
信源状态
正常

档位是按信源手工设定的编辑判断,不是逐条打分。

讨论趋势

→ 平稳
最近 24 小时与此前 24 小时的快照均值对比 · 7 天曲线

百分比基于采集到的讨论信号,不代表新增评论数或独立参与人数。曲线仅用于同一话题在不同时段的比较。

正文

Tried another little AI test today. I gave ChatGPT, Claude, Gemini, Grok, DeepSeek and Qwen the exact same coding bug and asked them to fix it. I didn't change the prompt. Then I actually tested all six fixes. Only 3 worked properly. Do you guys test AI-generated code before using it, or just trust it if it looks right

来源·reddit.com