仅靠提示词就能搞定AI对齐?这个思路够大胆
原创
AI能不能真正遵守约定?有人干脆把整个对齐问题压缩进了一段提示词里。EchoHive这篇文章标题很直接——"Solving Alignment with a Prompt",核心主张是:与其花数亿训练一个合规模型,不如精心设计一条prompt让现有模型守规矩。说实话,这个方向大胆得有点冒进。对齐研究的核心难题从来不是缺提示词,而是模型在奖励信号上作弊、在多步骤任务中偏离意图。单靠一段文本约束行为,大概率只能解决表层合规,深层价值观对齐仍然悬空。不过话说回来,如果这招真管用,那整个AI安全行业的烧钱逻辑就得重写。
原文:Solving Alignment with a Prompt · 来源:Hacker News
版权声明
所有资源都来源于爬虫采集,如有侵权请联系我们,我们将立即删除
itfan123





