Содержание
- Что проверяет тест Тьюринга по существу
- Как устроен тест Тьюринга: основная концепция и метод проведения
- Критерии оценки: когда тест Тьюринга считается пройденным
- Кто проходил тест Тьюринга: примеры применения и цифры
- Почему тест Тьюринга критикуют: различия в интерпретациях
- Чем ещё проверяют искусственный интеллект помимо теста Тьюринга
- Как провести тест Тьюринга для своего чат-бота
- Частые вопросы о тесте Тьюринга
Что такое тест Тьюринга
Черновик готовит редакция с помощью ИИ. За стандарт издания отвечает главный редактор — Валерий Курземнек.
Материал редакции Зерокодера. Обновлено: август 2026.
Тест Тьюринга проверяет одно — способность машины вести текстовый диалог так, чтобы судья-человек не отличил её от живого собеседника. Знания, сознание, понимание смысла и творчество остаются за рамками: измеряется убедительность имитации. Процедуру предложил Алан Тьюринг в 1950 году в статье «Computing Machinery and Intelligence» для журнала Mind.
- Предмет проверки — поведение в диалоге. Судья работает вслепую, через текст, и об устройстве системы ничего не знает.
- Классическая схема трёхсторонняя: судья одновременно переписывается с человеком и с машиной и указывает, кто из двоих человек.
- Формального порога «пройдено» Тьюринг не задал. В статье 1950 года есть прогноз: через пятьдесят лет средний судья будет угадывать верно не более чем в 70% случаев после пяти минут вопросов.
- В 2026 году результат зафиксирован экспериментально: GPT-4.5 с промптом-персоной приняли за человека в 73% случаев (Cameron Jones, Benjamin Bergen, PNAS).
- Имитация и понимание расходятся. Отсюда «китайская комната» Джона Сёрла (1980) и альтернативные проверки — тест Лавлейс, схемы Винограда.
Что проверяет тест Тьюринга по существу
Тьюринг заменил неопределимый вопрос «может ли машина мыслить» операционным: сможет ли машина сыграть в имитацию так, чтобы наблюдатель ошибся. Всё, что попадает в измерение, проходит через один канал — текстовую реплику. Всё остальное объявлено несущественным для проверки.
| Внутри рамки теста | За рамкой теста |
|---|---|
| Связность и уместность реплик в диалоге | Достоверность знаний: правильный ответ на вопрос теста не требуется |
| Естественность языка, юмор, разговорные сбои | Наличие сознания и субъективного опыта |
| Умение удерживать роль на дистанции разговора | Понимание смысла символов, которыми машина оперирует |
| Правдоподобие ошибок и незнания | Восприятие мира: зрение, слух, движение, действие |
| Реакция на провокацию и смену темы | Оригинальное творчество и авторский замысел |
Практический вывод: тест Тьюринга — измеритель социальной убедительности диалоговой системы. По нему нельзя судить о качестве модели как инструмента работы. Языковую модель вроде ChatGPT Go оценивают по точности и полноте ответов, и эти шкалы к игре в имитацию отношения не имеют.
Как устроен тест Тьюринга: основная концепция и метод проведения

Исходная «игра в имитацию» у Тьюринга описана без всяких машин. В комнате трое: мужчина, женщина и ведущий допрос. Ведущий переписывается с обоими и должен определить, кто из них кто. Мужчина старается сбить его с толку, женщина отвечает честно. Дальше Тьюринг переформулирует задачу вопросом: «Что произойдёт, когда роль A в этой игре займёт машина?» — так гендерная угадайка превращается в проверку искусственного интеллекта (Stanford Encyclopedia of Philosophy, разбор статьи 1950 года, с. 434).
Отсюда — метод проведения, который воспроизводят до сих пор:
- Изоляция. Судья не видит и не слышит собеседников. Единственный канал — текст, поэтому голос, внешность и скорость печати из уравнения убраны.
- Параллельный разговор. В классической трёхсторонней версии судья ведёт две беседы сразу: с человеком и с машиной.
- Свободные вопросы. Утверждённого опросника нет. Тьюринг привёл образцы: написать сонет о мосте через Форт, сложить 34 957 и 70 764, назвать ход в шахматной позиции.
- Ограниченное время. В прогнозе Тьюринга фигурируют пять минут вопросов, и этот интервал стал де-факто стандартом экспериментов.
- Одно решение. По итогам судья указывает, кто человек. Дальше считается доля ошибок по всей выборке судей.
Есть и двусторонний вариант: судья общается с одним собеседником и отвечает, человек это или программа. Разницу стоит держать в голове при чтении заголовков. В двустороннем формате судья оценивает одного собеседника изолированно, в трёхстороннем — сравнивает двоих напрямую и обязан выбрать между ними. Задача судьи в этих двух случаях устроена по-разному, поэтому проценты из разных форматов сопоставлять между собой некорректно, даже когда числа выглядят похоже. Смешение форматов и порождает противоречивые заголовки о том, пройден тест или нет.
Схему проведения удобно держать перед глазами: она объясняет, почему машину не спрашивают «ты робот» — прямой вопрос ничего не проверяет, врать программе никто не запрещал.
Критерии оценки: когда тест Тьюринга считается пройденным
Распространённая формулировка «машина проходит тест, если обманула 30% судей» в статье 1950 года отсутствует. Тьюринг написал иначе: «I believe that in about fifty years’ time it will be possible to programme computers, with a storage capacity of about 10⁹, to make them play the imitation game so well that an average interrogator will not have more than 70 per cent chance of making the right identification after five minutes of questioning» (с. 442). Это прогноз о состоянии техники к 2000 году, и «30%» — производная от него: если судья прав не чаще чем в 70% случаев, он ошибается в 30%.
Прогноз задаёт ориентир и нормативом никогда не был. У порога три слабых места:
- Он зависит от судьи. Специалист по диалоговым системам и случайный участник опроса дают разные проценты на одной и той же модели.
- Он зависит от собеседника-человека. В трёхстороннем формате машину сравнивают с конкретным живым участником, а тот тоже бывает односложным и странным.
- Он зависит от времени. Пять минут и час переписки — разные задачи; авторы исследования 2026 года прямо предупреждают, что на длинной дистанции обмануть человека проще.
Поэтому корректная формулировка результата всегда содержит четыре параметра: формат теста, длительность разговора, состав судей и доля опознаний. Заголовок «ИИ прошёл тест Тьюринга» без этих параметров непроверяем.
Отдельная институция критериев — конкурс имени Хью Лёбнера. По описанию в русской Википедии он идёт с ноября 1991 года: бронзовая медаль вручается ежегодно самой человекоподобной программе, а серебряная (за текстовый диалог) и золотая (за аудио-визуальный) не были присуждены ни разу. Первичные документы конкурса мы не сверяли.
Кто проходил тест Тьюринга: примеры применения и цифры
Ниже — результаты, у которых есть публикация и заявленный протокол. Проценты означают долю случаев, когда судьи назвали систему человеком.
| Система | Год | Формат | Доля «это человек» |
|---|---|---|---|
| Eugene Goostman | 2014 | 5-минутные диалоги, конкурс Университета Рединга | 33% судей (порог 30% — по данным Википедии) |
| ELIZA | 2024 | Двусторонний, 5 минут | 22% |
| GPT-4 | 2024 | Двусторонний, 5 минут | 54% (живые люди — 67%) |
| ELIZA | 2026 | Трёхсторонний, 5 минут | 23% |
| GPT-4o | 2026 | Трёхсторонний, 5 минут | 21% |
| LLaMa-3.1-405B с промптом-персоной | 2026 | Трёхсторонний, 5 минут | 56% |
| GPT-4.5 с промптом-персоной | 2026 | Трёхсторонний, 5 минут | 73% |
Данные 2024 года — из работы Cameron Jones и Benjamin Bergen «People cannot distinguish GPT-4 from a human in a Turing test» (arXiv:2405.08007, май 2024). Данные 2026 года — из их же исследования «Large language models pass a standard three-party Turing test», опубликованного в Proceedings of the National Academy of Sciences (том 123, выпуск 21); препринт доступен на arXiv. Обе работы предзарегистрированы и рандомизированы, разговоры длились пять минут.
ELIZA участвовала в обоих замерах и держит нижнюю опору шкалы: 22% в двустороннем формате 2024 года и 23% в трёхстороннем 2026-го.
Случай 2014 года стоит особняком, и фактура по нему вторичная: порог прохождения 30% и результат 33% приводятся по русской Википедии со ссылкой на объявление Университета Рединга, первичный пресс-релиз мы не сверяли. Программа изображала тринадцатилетнего подростка из Одессы, для которого английский неродной, — так подростковый возраст и языковой барьер списывали любые странности ответа. Критики назвали это эксплуатацией лазейки в правилах конкурса: способности программы остались непроверенными.
Мини-вывод: за десять лет тест перестал быть спортивным рекордом узкоспециальных чат-ботов и превратился в измерение общего поведения языковых моделей.
Почему тест Тьюринга критикуют: различия в интерпретациях
Главное возражение сформулировал философ Джон Сёрл в 1980 году мысленным экспериментом «китайская комната». Человек, запертый в комнате с инструкцией по манипуляции иероглифами, выдаёт наружу осмысленные ответы на китайском, не понимая ни слова. Раз символьные операции проходят проверку без понимания, прохождение теста ничего не говорит о наличии мышления.
Второе возражение появилось вместе с языковыми моделями и подтверждено экспериментально. В исследовании 2026 года GPT-4.5 набирала 73% при инструкции держать человекоподобную персону — и падала до 36% без такой инструкции; LLaMa-3.1-405B давала 56% и 38% соответственно (по данным пресс-релиза Калифорнийского университета в Сан-Диего). Результат теста управляется формулировкой промпта, то есть измеряет настройку системы наравне с её возможностями. Соавтор работы Бен Берген объясняет исход умением машины убедительно проигрывать социальное поведение: вычислительная мощность здесь второстепенна.
Третье возражение касается канала. Тест ограничен текстом, поэтому не касается зрения, слуха, движения и действия в физическом мире. Система, умеющая поддержать разговор, может не справиться ни с одной задачей за пределами чата.
Четвёртое — асимметрия. Тест поощряет обман: чтобы победить, машина должна изображать незнание, опечатки и усталость. Стратегия «отвечать как человек» и стратегия «отвечать правильно» тянут систему в разные стороны. Именно поэтому программы вроде эмулятора, честно воспроизводящего поведение чужой системы, проверяются совсем другими способами: по совпадению результата с эталоном, без участия впечатлений наблюдателя.
Мини-вывод: тест Тьюринга остаётся историческим ориентиром и удобной метафорой, но как инструмент приёмки ИИ-систем он даёт слишком мало информации.
Чем ещё проверяют искусственный интеллект помимо теста Тьюринга
Технологический прогресс расшатал исходную рамку, и появились проверки, закрывающие её слабые места. Каждая берёт отдельный признак интеллекта и делает его наблюдаемым.
| Проверка | Автор и год | Что проверяет |
|---|---|---|
| Полный (открытый) тест Тьюринга | Stevan Harnad, 1989 и 1991 | Реакцию на любые входы, включая сенсомоторные: машине нужно тело и восприятие |
| Тест Лавлейс | Bringsjord и соавторы, 2001 | Способность выдать результат, который разработчик не может объяснить своими знаниями о системе |
| Схемы Винограда | Hector Levesque, 2011 | Здравый смысл: разрешение местоимения в предложении, где подсказки даёт только знание о мире |
| Обратный тест Тьюринга | Практика веб-сервисов | Человечность пользователя: этим занимается CAPTCHA |
Разница в замысле важнее разницы в процедуре. Тест Тьюринга требует от машины обмануть наблюдателя, а схемы Винограда устроены как объективная задача с однозначным ответом: система показывает умение напрямую, и субъективность судьи выключается.
Отдельная ветка — визуальные версии. Когда генеративные модели научились рисовать, вопрос «отличит ли человек машинную работу от человеческой» переехал в картинки: сравнивают изображения, созданные, например, через DALL-E 3, с работами художников. Логика та же, канал восприятия другой.
Мини-вывод: единого экзамена на интеллект не существует. Современная оценка складывается из набора узких проверок, и тест Тьюринга занимает в нём место исторического первого пункта.
Как провести тест Тьюринга для своего чат-бота

Значение теста для практики прикладное: он даёт дешёвый протокол проверки того, насколько бот держится в разговоре. Порядок ниже повторяет схему опубликованных экспериментов, поэтому результат можно сравнивать с их числами.
- Соберите трёхстороннюю пару. Один судья, один живой сотрудник и бот. Судья ведёт две переписки параллельно и в конце указывает, где человек. Двусторонний вариант проще организовать, но его проценты с трёхсторонними несопоставимы.
- Зафиксируйте время. Пять минут — стандарт исследований. Более длинный сеанс даёт другую картину, и это нужно оговаривать в отчёте.
- Наберите судей, не знакомых с продуктом. Сотрудник поддержки узнаёт своего бота по формулировкам за две реплики, и замер теряет смысл.
- Прогоните два прогона промпта. Один с инструкцией держать человекоподобную манеру, один без неё. Разрыв 73% против 36% в исследовании 2026 года показывает, что без такой развилки цифра ничего не значит.
- Считайте долю от выборки. Метрика — процент диалогов, в которых судья указал на бота как на человека, при известном размере выборки.
- Разберите проигранные диалоги. Бота выдают мгновенный ответ, безупречная пунктуация, отказ от личного мнения и вежливость без сбоев.
Ограничение протокола держите в голове: высокий процент говорит о правдоподобии манеры и ничего не сообщает о правильности ответов. Точность ответов проверяется отдельным замером на размеченных вопросах.
Влияние результата на общество — та причина, по которой протокол стоит прогонять осознанно. В пресс-релизе Калифорнийского университета в Сан-Диего Кэмерон Джонс формулирует вывод так: «Нам нужно быть внимательнее; общаясь с незнакомцами в интернете, люди должны быть гораздо менее уверены в том, что говорят с человеком, а не с языковой моделью». Его соавтор Бен Берген там же называет прикладной риск: «Есть множество людей, которые хотели бы использовать ботов, чтобы убедить людей поделиться номерами социального страхования, проголосовать за их партию или купить их продукт».
Частые вопросы о тесте Тьюринга
Что именно проверяет тест Тьюринга?
Тест Тьюринга проверяет способность машины вести текстовый диалог так, чтобы человек-судья принял её за человека. Знания, сознание, понимание смысла и восприятие мира он не измеряет.
Кто и когда придумал тест Тьюринга?
Алан Тьюринг описал процедуру в 1950 году в статье «Computing Machinery and Intelligence» для журнала Mind, назвав её игрой в имитацию.
Сколько процентов нужно для прохождения теста Тьюринга?
Официального порога Тьюринг не устанавливал. Он предположил, что через пятьдесят лет средний судья будет опознавать машину верно не более чем в 70% случаев после пяти минут вопросов, и отсюда пошла цифра 30%.
Прошёл ли искусственный интеллект тест Тьюринга?
Да, в стандартном трёхстороннем формате. По данным исследования Cameron Jones и Benjamin Bergen, опубликованного в Proceedings of the National Academy of Sciences в 2026 году, GPT-4.5 с промптом-персоной приняли за человека в 73% случаев.
Значит ли прохождение теста Тьюринга, что машина мыслит?
Нет. Аргумент «китайская комната» Джона Сёрла 1980 года показывает, что символьные операции дают осмысленные ответы без понимания смысла, поэтому пройденный тест не доказывает наличия мышления.
Чем заменяют тест Тьюринга сегодня?
Схемами Винограда на здравый смысл, тестом Лавлейс на оригинальность результата и полным тестом Тьюринга, который добавляет сенсомоторные задачи.
