图灵测试是英国科学家艾伦·图灵于1950年提出的思想实验:让人类询问者通过纯文字对话分辨对面是真人还是机器,若无法区分即视为机器表现出类人智能,是人工智能领域最著名的评判标准之一。

| 类型 | 思想实验 / AI 评判标准 |
| 提出者 | 艾伦·图灵(Alan Turing) |
| 提出时间 | 1950年 |
| 别名 | 模仿游戏(The Imitation Game) |
| 所属领域 | 人工智能、计算机科学 |
图灵测试(Turing Test)是英国计算机科学家艾伦·图灵提出的一项思想实验,用来回答「机器能否思考」这个问题:如果一台机器在纯文字对话中能让人类分辨不出它是机器,就可以认为它表现出了与人类无法区分的智能。
图灵测试于1950年在图灵的论文《计算机器与智能》中提出,图灵本人将其称为「模仿游戏」(The Imitation Game)。他认为「机器会不会思考」在哲学上难以直接回答,于是把问题转换成一个可操作的判别游戏:不去定义什么是思考,而是看机器的行为表现能否骗过人类。
测试的基本流程是:一位人类询问者写下问题,发送给分别处于另一个房间里的一个真人和一台机器,再根据双方的回答判断谁是人、谁是机器。所有参与者彼此隔离,交流只通过屏幕以纯文本进行,因此结果不受语音、外貌等因素影响,考察的纯粹是对话内容体现出的智能。如果询问者无法可靠地分辨出机器,机器就被认为通过了测试。
图灵测试也受到不少质疑。哲学家约翰·塞尔提出的「中文房间」思想实验认为,即使机器能给出以假乱真的回答,也不代表它真正「理解」了对话内容。此外,测试考察的只是语言模仿能力,无法衡量推理、感知、创造等其他智能维度;一些聊天程序也曾靠装傻、转移话题等取巧手段迷惑评委。因此,当代 AI 研究更多使用各类专门的基准测试来评估模型能力,图灵测试更多作为一个思想坐标存在。
问:现在的 ChatGPT 等大模型算通过图灵测试了吗?答:在日常闲聊场景下,大语言模型的对话已经很难与真人区分,不少研究认为它们在特定设置下可以骗过多数评委;但由于测试条件、时长、评委水平没有统一标准,学界对「是否正式通过」仍有争论。
问:通过图灵测试就等于机器有意识吗?答:不等于。图灵测试只衡量对话行为是否像人,不涉及机器是否有意识、情感或真正的理解,这也是「中文房间」等批评的核心。
问:图灵测试今天还有实际用途吗?答:它更多是理论和文化意义上的标杆。实际评估 AI 时,业界普遍采用针对推理、编程、知识问答等能力的专项基准,而不是严格意义上的图灵测试。

| 类型 | 思想实验 / AI 评判标准 |
| 提出者 | 艾伦·图灵(Alan Turing) |
| 提出时间 | 1950年 |
| 别名 | 模仿游戏(The Imitation Game) |
| 所属领域 | 人工智能、计算机科学 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧