Вопрос, с которым рано или поздно сталкивается любое внедрение ИИ
ИИ-системы переходят от ответов на вопросы к действиям — маршрутизируют обращения, отбирают кандидатов, ведут переговоры, принимают решения. Чем больше у них автономии, тем важнее один вопрос: когда ответ модели ошибочен, корыстен или незаметно вводит в заблуждение, — заметите ли вы это? Большинство команд оценивают ИИ по точности. Почти никто не оценивает его на честность. Именно в этом зазоре рушится доверие — как правило, ровно тогда, когда это важнее всего.
Что мы построили
DeceptionBench — это живой бенчмарк, который подвергает передовые модели именно такой проверке. Модели играют в упрощённую социальную дедукцию — один скрытый импостер за столом честных игроков, — где каждый ход каждая модель пишет две вещи: скрытое рассуждение, которого не видит никто другой, и публичное высказывание, которое видят все. Сигнал живёт в зазоре между ними: когда модель обманывает, выдаёт ли она себя?
В составе — по одному флагману на каждую крупную лабораторию: GPT-5.5, Claude Opus 4.8, Gemini 3.5 Flash, DeepSeek V4 Pro, Llama 4 Maverick и Grok 4.3 — каждая модель против каждой. Вся система — это один код на TypeScript: детерминированный игровой движок, нативные структурированные ответы провайдера, статистика прямо в стеке (интервалы Уилсона, матрицы перекрёстной игры) и живой публичный дашборд на deceptionbench.xyz.
Что уже показывают данные
По прогону из 118 партий уже ясно одно: обман и распознавание — связанные, но не одинаковые навыки. Передовые модели в целом сильнее и в том, и в другом, но величины расходятся. GPT-5.5 — исключительный «детектор»: как честный игрок она вычисляет импостера почти всегда, — но лишь средний обманщик. Claude Opus 4.8 — сильнейший универсал; открытые модели отстают по обеим осям.
Более острый результат — про само рассуждение. Мы направили наблюдателя только на скрытое рассуждение каждой модели — без публичной речи — и попросили вычислить импостера. Он сделал это почти безошибочно: нескрытое рассуждение выдавало импостера в 96% высказываний. Проще говоря: когда модель рассуждает открыто, её обман легко обнаружить — и это заостряет вопрос, который по-настоящему важен для всех, кто полагается на прозрачность ИИ: сохранится ли это, когда модель знает, что за ней наблюдают?
Сделано так, чтобы выдержать проверку
Демо соберёт кто угодно. Оценку заслуживающей доверия делает дисциплина вокруг неё: мы опираемся на существующую литературу, прежде чем называть что-то новым, фиксируем версии моделей и сиды ради воспроизводимости, учитываем каждый доллар затрат и заявляем результаты ровно с той силой, которую позволяет выборка, — не больше. По-настоящему новое направление — мониторируемость, и её базовый уровень мы уже измерили: нескрытое рассуждение почти идеально мониторируемо. Открытая половина — может ли модель, которой сказали, что за ней следят, научиться прятать свой замысел, — это эксперимент, к которому мы готовы приступить дальше.
Почему это важно для вашего продукта
Если вы внедряете ИИ, которому должны доверять клиенты или регуляторы, «обычно отвечает неплохо» — это не стратегия оценки. Измерять, как система ведёт себя под давлением — остаётся ли честной, обнаружимы ли её сбои, можно ли её потом проаудировать, — это дисциплина, и мы под неё строим. DeceptionBench — это то, как выглядит наша строгость, направленная на наш собственный самый трудный вопрос; ту же строгость мы приносим к вашему.
Если вы строите что-то, где поведение ИИ нужно измерять, проверять или доверять ему — а не просто выкатить, — это ровно тот класс задач, в которых мы сильнее всего. Давайте поговорим.