首页 > 自考资讯 > 高考百科

用「图灵测试」检验AI尤其是大语言模型,真的科学吗? 图灵测试可以测试人工智能的什么

小条 2024-10-09

来自ACM通讯

作者:尼尔·萨维奇

机器之心编译

机器之心编辑部

当前的大规模语言模型似乎能够通过多项公开图灵测试。我们如何衡量它们是否像人类一样聪明?

在发布近两年的时间里,ChatGPT 表现出了非常人性化的行为,包括通过了律师资格考试。这让一些人怀疑计算机是否正在接近人类智能。大多数计算机科学家认为,机器在智力方面尚未与人类平等,但对于如何或准确衡量智力仍没有达成共识。

测试机器智能的经典实验是图灵测试,由艾伦·图灵在其1950 年的论文《Computing Machinery and Intelligence》 中提出。图灵认为,如果一台计算机能够说服与之进行打字对话的人相信这是一个人类,那么这可能是智能的标志。 GPT 等大规模语言模型(LLM)擅长像人类一样说话,但它们尚未令人信服地通过图灵测试。

266913843da1436c9cac07b8d40fcc3b~noop.image?_iz=58558&from=article.pc_detail&lk3s=953192f4&x-expires=1729033576&x-signature=u%2FZP8J2OIuSYC0gi4icsWPBeQ%2B0%3D2023 年,加州大学圣地亚哥分校(UCSD) 的研究人员进行了公开图灵测试,比较了现代法学硕士和20 世纪60 年代开发的聊天机器人Eliza 的性能。 GPT-4 在律师考试中表现非常出色,评委们认为它在41% 的游戏中与人类没有区别。上一代的GPT-3.5仅通过了14%的游戏,低于Eliza的27%。人类在63% 的游戏中通过(判定为人类)。

85c529ae7eea4f438df10b57c9be8095~noop.image?_iz=58558&from=article.pc_detail&lk3s=953192f4&x-expires=1729033576&x-signature=vetjeOOduI8mK%2BI6RS4NHkI%2Bs90%3D论文链接:https://arxiv.org/pdf/2310.20216v1

领导这项实验的加州大学圣地亚哥分校认知科学博士生卡梅伦·琼斯表示,人类得分如此之低并不奇怪。这是因为玩家期望模型表现良好,并且可能认为人类只是听起来像人类的模型。琼斯表示,目前尚不清楚聊天机器人需要达到多少分才能赢得比赛。

图灵测试可用于检查客户服务聊天机器人是否以人们感觉舒服的方式与人们互动,展示琼斯所说的灵活的社交智能。然而,很难判断它们是否能够识别更一般的智力。 “我们仍然不真正了解人类智能是什么,”琼斯说,“如果我们能够通过模型更快地弄清楚这一点,我会感到惊讶。”

圣达菲研究所的复杂性专家梅兰妮·米切尔说:“我认为图灵测试的整个概念被过于字面化了。”我相信这是一种思考事物的方式。方法而不是明确定义的测试。 “人们轻率地使用这个术语,就好像大规模语言模型通过了图灵测试,但事实上却没有。”

新测试

尽管如此,问题还是出现了:如果图灵测试不能可靠地评估机器智能,那又如何呢?在2023 年11 月发表在期刊《智能计算》 上的一篇论文中,普林斯顿大学心理学家Philip Johnson-Laird 和德国开姆尼茨理工大学预测分析教授Marco Ragni 建议使用另一种测试方法。它。作为心理学实验的参与者,看看你是否能理解自己的推理。

例如,询问您的模型问题,例如: “如果安妮很聪明,那么她是聪明、富有还是两者兼而有之?”然而,根据逻辑规则,我们可以推断出安妮是聪明、富有或两者兼而有之。然而,背景中并没有任何迹象表明她可能很有钱,所以大多数人会拒绝这个推论。如果模型也拒绝这一推论,则模型的行为就像人类一样,研究人员将采取下一步并要求机器解释其推论。如果提出的原因与人类相似,则第三步是检查模拟人类表现的组件的源代码。

这些组件可能包括一个快速推理系统、另一个更周到的推理系统以及一个根据上下文改变“或”等单词解释的系统。研究人员认为,如果一个模型通过了所有这些测试,就可以被认为是在模拟人类智能。

英国考文垂大学计算机教授兼机械工程学教授约翰逊·莱尔德博士表示,虽然约翰逊·莱尔德和拉格尼的方法肯定会提供一些有趣的见解,但质疑模型的推理能力并不是什么新鲜事。沙阿研究智力并进行了图灵测试。 “图灵测试允许你提出这些逻辑问题,”她说。

沙阿还表示,尝试测试智力的问题在于,这首先取决于你如何定义智力。是模式识别、创新,还是产生音乐和喜剧等创意的能力?“如果我们不能就人工智能中的“我”达成一致,我们如何才能构建通用人工智能(AGI)呢? ”

谷歌软件工程师兼人工智能专家Francois Cholet 并不认为图灵测试特别有用。他说,好的测试需要精确、正式的目标,并衡量系统与实现这些目标的接近程度。 “图灵测试无法做到这一点,”他指出。

Chollet先生表示,法学硕士在图灵测试中的表现仅表明他们擅长使用语言,而这种技能完全是通过记忆大量数据而获得的。他认为,真正的智力不在于掌握特定技能,而在于将学到的知识应用到新的不同情况中。 “法学硕士是100% 的记忆。他们没有智力。他们没有适应能力,”Chollet 说。

在他看来,智能是一个系统有效地获得在训练过程中没有准备好的新技能的能力,以完成与之前经历过的任务有很大不同的任务。人类一生都在与世界互动,本质上是通过实验来建立世界如何运作的模型。这样,孩子们就能学会如何应对新情况。新技能的范围越广,计算机就越接近实现通用人工智能。

Chollet 说:“如果你能在学习过程中像人脑一样高效地处理信息,那么你就拥有了AGI。”例如,计算机需要数百万张图像才能识别猫的照片,而人类只需要一两张图像就能够识别猫。

为了测试他对智力的定义,乔莱开发了抽象推理语料库(ARC)。 ARC 挑战是通过基本构建块、形状和尺寸等简单概念来完成的。这些块用于创建任务,例如按大小对对象进行排序和完成对称图案。向受试者展示三个示例,受试者必须能够识别目标并完成任务。 Chollet 说,最好的人工智能大约有30% 的时间实现目标,而人类则有80% 的时间实现目标。

85fccb922fd84b83a9a447bb733b8cff~noop.image?_iz=58558&from=article.pc_detail&lk3s=953192f4&x-expires=1729033576&x-signature=yQkjzGxEs7qpTbz7hFFcCuyojto%3D 项目链接:https://github.com/fchollet/ARC-AGI

死记硬背并没有什么帮助,因为每项任务都与受试者以前见过的任务不同。 “这是一个你无法练习的游戏,”他说。 “GPT-4之所以能通过律师资格考试,是因为他们对与考试中所问的类似的例子有足够的经验,因此他们无需做任何内在的理解就能得到合理的答案。”

“这不是一个完美的测试。存在许多局限性和缺陷,”乔莱说。例如,任务中有足够的冗余,受试者在获得足够的示例后更有可能对答案做出有根据的猜测。不过,他说基本想法是合理的。

上述圣达菲研究所的复杂性教授Melanie Mitchell 认为,要实现类人的通用智能,我们必须能够完成远远超出我们训练数据的任务。她和她的团队提出了ARC 的修订版,该版本围绕基本概念组织任务,例如将一个东西放在另一个东西上面或将一个东西放在另一个东西里面。

ConceptARC的想法是通过让计算机导出概念规则并将该概念应用于新任务来测试计算机解决方案的稳健性。

cda640e55a3d40d7802ac28b1061e05d~noop.image?_iz=58558&from=article.pc_detail&lk3s=953192f4&x-expires=1729033576&x-signature=09NTu7C3QqB7JLzYfYyB5H1zeQE%3D论文链接:https://arxiv.org/pdf/2305.07141

例如,她可能会向人工智能展示一个网格,其中黄色方块位于蓝色方块之上,蓝色方块又位于黄色方块之上。在这种情况下,您可能会看到一个红色圆圈与绿色圆圈重叠,然后一个绿色圆圈与红色圆圈重叠。人类更容易理解的一个概念是颜色在垂直位置上交换。然后计算机必须将此规则应用于新的形状对。米切尔说,虽然这些任务对人类来说很容易,但对机器来说似乎仍然非常困难。

米切尔说,在某些情况下,计算机最好拥有自己的抽象,例如当试图从大量数据中进行发现时。然而,在我们与人互动的情况下,例如驾驶汽车,从人的角度理解世界非常重要。

“我不认为智能是全部或全部。它是一个范围,计算机所做的一些事情是智能的,”米切尔说。 “如果你想谈论完整的人类水平的智能,我们还有些遥远,因为人类水平的智能有很多方面我们是看不到的。”

原文链接:https://cacm.acm.org/news/beyond-turing-testing-llms-for-intelligence/

版权声明:本文转载于网络,版权归作者所有。如有侵权,请联系本站编辑删除。

猜你喜欢