把考题埋进故事里,大模型还能蒙对吗
原创
你问一个问题,模型答得漂亮。但把问题埋进三段故事里,它还答得对吗?EnigmaForge干的就是这件事——不再直接出题,而是把考题伪装成叙述文本,让大模型自己从语境里挖出"到底在问什么"。说实话,我觉得这个思路戳中了现有评测的软肋。MMLU、GSM8K太"干净"了,模型背题型、套模板就能刷分,分数高不代表真懂。EnigmaForge逼模型先做阅读理解再作答,这更接近真实场景:用户不会永远把需求写成标准问句。当然,这篇论文刚挂上arxiv,社区还没给出足够反馈,但它提出的方向值得追。
原文:EnigmaForge – an LLM benchmark where the question is hidden in the story · 来源:Hacker News
版权声明
所有资源都来源于爬虫采集,如有侵权请联系我们,我们将立即删除
itfan123





