图灵测试76年后,AI第一次真正"通过"了——但问题比答案更多

图灵测试76年后,AI第一次真正"通过"了——但问题比答案更多

图灵在1950年提出那个著名测试的时候,可能没想到76年后有人真的把它过了。

加州大学圣地亚哥分校的研究给出了一个数字:GPT-4.5在对话中被误认为人类的概率是73%,显著超过真人对照组。

73%。不是碰巧,不是作弊,是正式实验结论。

研究设置了5到15分钟的自由对话,四位裁判分别与人类和AI交谈,然后判断对面是不是人。GPT-4.5拿到了73%的"这是人类"票。相比之下,LLaMa-3.1-405B是56%,跟真人差不多。GPT-4o只有20%——比你家的ELIZA聊天机器人好不了多少。

这里有个关键细节:GPT-4.5之所以能过,是因为它被给了"提示词"。

这个提示词告诉它:模仿人类的语气,带一点幽默感,偶尔犯个小错误,不要太完美。不要像AI那样每句话都滴水不漏。

换句话说,AI能通过图灵测试,不是因为它变得更"像人"了,而是因为它学会了模拟不完美

这其实是个细思极恐的事。

一个东西能完美地假装自己是人,意味着你在网上跟任何人聊天时,对面可能根本不是人。客服、网友、论坛评论、电商评价——你能分清哪个是真人写的,哪个是AI生成的?

图灵测试当年设计的初衷是"机器能思考吗",但现在它变成了"机器能装人吗"。这两个问题已经不是同一个问题了。

研究者自己也承认:这个结果提醒我们,图灵测试的评判标准需要重新设计。当一个AI能通过"装人"测试时,我们需要新的框架来判断它到底有没有"理解"和"意识"。

而对我们普通人来说,这个研究最直接的意义是:别再相信自己能分辨出AI和真人了。你分不出来。

发布于:安徽省