Уверенность без знания
Главная ловушка в оценке ИИ — путать уверенность с правотой. Языковая модель формулирует ответ ровным, связным, авторитетным тоном независимо от того, права она или заблуждается. Она не хранит факты как база данных и не проверяет их истинность перед выдачей. Она предсказывает правдоподобное продолжение текста на основе закономерностей, которые усвоила. Правдоподобие и правда — разные вещи, и модель оптимизирована именно на первое.
Отсюда явление, которое называют галлюцинациями: модель уверенно сообщает то, чего нет. Вымышленная ссылка, несуществующая цитата, деталь, которой не было. Опасность не в самой ошибке, а в её упаковке. Человек привык считывать неуверенность по форме речи — оговоркам, паузам, осторожным формулировкам. У модели этих сигналов нет: неправильный ответ звучит так же гладко, как правильный. Поэтому первое правило оценки — не доверять тону. Убедительность изложения не несёт никакой информации о верности содержания.
Что значит «хороший» ответ
Если гладкость не критерий, то что критерий. Хороший ответ складывается из нескольких независимых свойств, и все они важнее стиля.
Первое — верность по существу: соответствует ли утверждение действительности или условиям задачи. Второе — уместность: отвечает ли модель на реально заданный вопрос, а не на похожий. Третье — полнота в меру задачи: не упущено ли существенное и не добавлено ли лишнего, создающего ложную картину. Четвёртое, которое чаще всего игнорируют, — честность о границах: признаёт ли модель, что чего-то не знает или что данных недостаточно, вместо того чтобы заполнить пробел вымыслом.
Показательно, что гладкость изложения в этот список не входит. Более того, она способна маскировать отсутствие всего остального. Красиво написанный ответ, который неверен, хуже коряво написанного, который верен и честен о своих ограничениях, — потому что первый труднее поймать.
Проверяемость как критерий
Поскольку по внешнему виду ответ не отличить от галлюцинации, ключевым практическим критерием становится проверяемость. Хороший ИИ-ответ устроен так, что его легко подтвердить или опровергнуть, а не так, что приходится верить на слово.
Проверяемость проявляется по-разному. Ответ может опираться на конкретные источники, которые можно открыть и сверить. Он может разбивать рассуждение на шаги, каждый из которых виден и поддаётся контролю. Он может ограничиваться данными, которые ему явно предоставили, вместо того чтобы дополнять их из памяти модели. Ценность здесь не в самой правильности — её ещё предстоит установить, — а в том, что установить её дёшево. Система, где проверка стоит дорого, вынуждает либо слепо доверять, либо перепроверять всё вручную, и оба варианта плохи. Поэтому проектировать стоит не только модель, но и способ убедиться в её ответе.
Границы применимости
Вопрос «хорош ли этот ИИ» некорректен без указания задачи. Одна и та же модель может быть отличной в одном применении и опасной в другом. Разница — в цене ошибки и в возможности её заметить.
Есть задачи, где приблизительный ответ уже полезен, а ошибку легко поймать и поправить: черновики, наброски, варианты, обобщение текста, который человек всё равно прочтёт. Здесь планка допустимой ошибки высока, и ИИ уместен. И есть задачи, где ошибка дорога, а проверить её тяжело: юридические, медицинские, финансовые выводы, всё, что принимается к исполнению без второго взгляда. Здесь та же модель требует принципиально иной строгости или вообще не должна работать без надзора. Оценивать качество ИИ в вакууме бессмысленно — оценивают связку «модель плюс задача плюс цена ошибки». Честное определение границ применимости — где систему можно использовать, а где нельзя, — часть качества, а не оговорка мелким шрифтом.
Human-in-the-loop
Из неравномерности цены ошибки естественно следует принцип участия человека в контуре. Идея не в том, чтобы человек проверял всё подряд — это свело бы на нет пользу автоматизации. Идея в том, чтобы поставить человека там, где ставка высока, а его проверка дешевле, чем последствия ошибки.
Это меняет роль модели: она становится не автономным оракулом, а помощником, который берёт на себя объём и черновую работу, оставляя человеку решение и ответственность. Хорошо устроенный контур делает точки контроля явными: подсвечивает, где модель не уверена, где данных мало, где вывод стоит перепроверить. Плохо устроенный — прячет неопределённость за гладким тоном и подталкивает принять ответ не глядя. Human-in-the-loop — не признание слабости технологии, а способ управлять риском там, где полная автономия слишком дорого стоит.
Оценка как процесс
Наконец, качество ИИ нельзя измерить один раз и забыть. Модель ведёт себя по-разному на разных входах, её поведение меняется с обновлениями, а реальные пользователи находят сценарии, которых не предвидели разработчики. Поэтому оценка — это не разовая проверка, а постоянный процесс.
Здоровый подход опирается на несколько привычек. Проверять систему на реальных, а не удобных примерах, включая трудные и пограничные случаи. Смотреть не на среднее впечатление, а на характер ошибок: где именно и как модель ломается, насколько эти сбои опасны. Наблюдать за поведением в живом использовании, а не только на этапе разработки. И относиться к любым красивым обобщённым оценкам с осторожностью: цифра без описания задачи, данных и способа измерения почти ничего не значит. Доверие к ИИ не выдаётся авансом за уверенный тон — оно зарабатывается проверяемостью, честностью границ и стабильностью поведения, подтверждённой на практике.