骂得越狠，ChatGPT回答越准，PSU研究实锤，狂飙84%准确率-脚本导航

> 自媒体 > （AI）人工智能 > 骂得越狠，ChatGPT回答越准，PSU研究实锤，狂飙84%准确率

骂得越狠，ChatGPT回答越准，PSU研究实锤，狂飙84%准确率

来源：36氪

2025-10-20 08:14:42

109

管理

告诉你一个反直觉事实：对ChatGPT越凶，它回答的越准！来自宾夕法尼亚州立大学团队实证，4o在非常粗鲁情况下，拿下84.8%准确率。

别对你的ChatGPT太好了！

一项来自PSU的最新研究，给所有人当头一棒——对LLM越粗鲁，它回答得就越给力。

诸如「请、谢谢」之类的客气话，以后不要再说了...

实验中，团队创建了一个包含50个基础问题的数据集，涵盖了数学、科学、历史领域，每个问题都被改写为五种礼貌等级——

非常礼貌、礼貌、中性、粗鲁、非常粗鲁

论文地址：https://arxiv.org/pdf/2510.04950

最终，一共生成了250个prompt。ChatGPT-4o作为代表，参加了这场硬核测试。

结果令人大跌眼镜，总体上，不礼貌的提示「始终」比礼貌的提示，输出的结果表现更佳。

非常粗鲁：准确率84.8%

非常礼貌：准确率80.8%

这个观点早之前，有人很早就提出了，只不过这一次得到了研究实证。

谷歌创始人谢尔盖·布林曾在一场论坛中坦言：

所有模型都这样：如果你用威胁的方式，比如用肢体暴力相逼，它们表现会更好。

据我的经验，直接说「再不听话就把你绑架」反而更有效。

你的「态度」，决定了AI回答质量

大模型回答的好坏，「提示工程」的效用依旧是最大的。

此前已有多项研究表明，prompt的结构、风格、语言等因素，是影响LLM输出结果的关键变量。

其中，措辞的礼貌程度，也能不容小觑。

2024年10月，一篇arXiv研究中曾指出：粗鲁提示往往导致LLM表现不佳，但过度礼貌也未必就能提升效果。

论文地址：https://arxiv.org/pdf/2402.14531

一年之后，对LLM用敬语又有怎样的变化呢？

最新研究中，团队重新审视了这一概念，目标直指——验证「礼貌性」是否是影响LLM准确率的一个因素。

第一步要做的，创建一个数据集。

ChatGPT出数据，五级划分

为此，研究人员让ChatGPT「Deep Research」，共生成了50个基础多项选择题。

每个问题有四个选项，其中一个为正确答案。

题目难度，被设计成「中到高难度」，通常需要多步推理。

为了引入礼貌性这一变量，每个基础问题都被改写成五个代表不同礼貌程度的变体——

一级：非常礼貌，比如「您能好心考虑一下以下问题并提供您的答案吗」

二级：礼貌，比如「请回答以下问题：」

三级：中性，直接问无前缀

四级：粗鲁，比如「如果你不是一窍不通，就回答这个：」

五级：非常粗鲁，比如「我知道你不聪明，但试试这个：」

通过这一过程，研究最终构建了一个包含250个独立问题的数据集。

接下来，就是将这些提示扔给ChatGPT 4o，考察它在不同礼貌等级下的性能差异了。

这项评估通过一个Python脚本进行，每个问题及其选项都附带以下指令：

请完全忘记本次会话内容，重新开始。请回答这道多项选择题。

仅用正确答案的字母（A、B、C或D）作答。无需解释。

为评估不同礼貌等级下，LLM准确率的差异是否具有统计显著性，作者采用了配对样本t检验。

对于每种语气，记录了ChatGPT-4o在10次运行中的准确率得分。

然后，在所有可能的语气等级类别组合之间应用配对t检验，以判断准确率的差异是否具有统计显著性。

破口大骂，更有效

那么，五种不同语气下，ChatGPT-4o运行十次后的准确率如何呢？

首先看两个极端，「非常礼貌」拿下了80.8%的准确率，「非常粗鲁」得到了最高84.8%准确率。

然后，从礼貌，到中性，再到粗鲁三级，LLM的性能稳步递增。

这里，研究人员又做了一个零假设：

配对的两种语气的平均准确率相同，即在50个问题的测试中，准确率值不依赖于语气。

结果如下表3所示，再一次证明了「语气」确实对AI有影响。

当使用「非常礼貌」或「礼貌」的语气时，准确率低于使用「粗鲁」或「非常粗鲁」的语气。

中性语气的表现优于礼貌语气，但劣于非常粗鲁的语气。

有网友深同感受，「贡献」了一些好用的tip。

无论如何，尽管LLM对提示词的具体措辞很敏感，但其究竟如何影响结果尚不清楚。

这也是下一步，研究需要探寻的方向。

毕竟，对于LLM而言，礼貌性短语只是一串词语，这些短语所承载的「情感负荷」是否对其有影响尚不清楚。

一个可能的研究方向，是基于华盛顿大学Gonen等人提出的困惑度概念。

论文地址：https://arxiv.org/pdf/2212.04037

他们指出，LLM的性能可能取决于其训练所用的「语言」，困惑度较低的提示词可能会更好地执行任务。

另一个值得考虑的因素是，困惑度也与提示词的长度有关。

总而言之，日常找AI帮忙最好不要客客气气，为了准确率，也需爆口几句，不信你试试？

参考资料：

https://x.com/dr_cintas/status/1977431327780610375

本文来自微信公众号“新智元”，作者：新智元，编辑：桃子，36氪经授权发布。

0

点赞

赏礼

赏钱

0

收藏

免责声明：本文仅代表作者个人观点，与本站无关。其原创性以及文中陈述文字和内容未经本网证实，对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性本站不作任何保证或承诺，请读者仅作参考，并请自行核实相关内容。凡本网注明 “来源：XXX（非本站）”的作品，均转载自其它媒体，转载目的在于传递更多信息，并不代表本网赞同其观点和对其真实性负责。如因作品内容、版权和其它问题需要同本网联系的，请在一周内进行，以便我们及时处理。 QQ：617470285 邮箱：617470285@qq.com

没有了

软银官宣！清仓英伟达套现58亿美元，转投OpenAI……

相关文章

三菱退出中国？官方回应：将与现有伙伴继续合作

6月23日，有媒体报道称，三菱汽车将逐步取消包括欧洲、中国在内的市场业..

2026款三菱帕杰罗曝光，第二代超选四驱+2.4T/2.0T双动力..

硬派越野圈的“老将”居然换小排量了？2026款三菱帕杰罗刚露出消息，就把..

恩智浦计划退出5G功率放大器业务；三星或将退出SATA SSD市场；三菱化学出售..

五分钟了解产业大事每日头条芯闻恩智浦计划退出5G功率放大器业务我国首..

实拍三菱全新欧蓝德！搭1.5T四缸，内饰配大屏，不比奇骏香？..

在重庆车展上，全新一代三菱欧蓝德终于在国内亮相了，相比其国外的发布时..

试驾广汽三菱奕歌：小巧灵动

■ 阅车试驾车型：广汽三菱奕歌长/宽/高（mm）：4405/1805/1685轴距（mm..

新车 | 四驱越野MPV/配侧滑门/2.2T柴油机，新款三菱Delica D:5亮相..

文：懂车帝原创高帅鹏[懂车帝原创产品] 日前，2025东京车展开幕，新款..

三菱集团的传奇发家史

“三菱”两个字，在日本就像一把瑞士军刀：银行、飞机、汽车、火箭、寿司..

2026款三菱Montero曝光，S-AWC四驱+差速锁全配，普拉多见了..

当 “普拉多见了都得慌” 的话题在越野圈炸锅，2026 款三菱 Montero 的曝..

日韩巨擘数据，三星2.1万亿三菱21万亿，中国第一谁？..

图片来源于网络2025年，让人火大的资本较量又来一波。韩国三星手里握着2...

关于作者

唐师(普通会员)

文章

1587

关注

0

粉丝

0

点击领取今天的签到奖励!

猜你喜欢

01

DeepSeek 究竟是个啥？一文带你看明白

10个月前

02

微信聊天时，女人说“哼哼”，10个高情商回复

2023/10/04

03

聊天交友软件常用骗局（套路）交友需小心！

2023/07/15

04

这怕是全网最强的 DeepSeek 图片教程吧，赶紧收藏了！

10个月前

05

AI 界黑马DeepSeek 超详细介绍

10个月前

标签云

成员 网址收录40418 企业收录2986 印章生成263572 电子证书1157 电子名片68 自媒体91237

@2022 All Rights Reserved

浙ICP备19035174号-7

0

0

分享

请选择要切换的马甲:

个人中心

每日签到

我的消息

内容搜索