AI写的文档连及格线都过不了?这组基准测试给了个残酷答案
原创
你有没有发现一个问题——GPT写出来的文档看着漂亮,用着总差点意思?DoGBench把这件事量化了:这是第一个专门面向终端用户的文档生成基准测试,结果相当扎眼,所有模型得分都不到50%。我翻了一遍测试方法,它测的不是"能不能生成文本",而是"生成的文档对用户到底有没有用"。这两者之间的差距,比很多人想象的大得多。说白了,现在大模型的文档能力还停留在"看起来像文档"的阶段,离真正帮用户解决问题差着一大截。那些还在吹"AI自动生成高质量文档"的团队,该好好看看这个分数了。
原文:DoGBench: The first user-facing docs generation benchmark. No model scores >50% · 来源:Hacker News
版权声明
所有资源都来源于爬虫采集,如有侵权请联系我们,我们将立即删除
itfan123




