Нейросеть придумывает факты и ссылки: как это заметить и проверить
Уверенный тон ответа ничего не говорит о его точности: выдуманная дата выглядит ровно так же, как настоящая.
Спросите у нейросети год выхода малоизвестной программы или ссылку на исследование — и вполне можете получить правдоподобный ответ, за которым ничего не стоит. Ни ChatGPT, ни Claude при этом не ломаются: так устроена сама модель. Разобраться, где кончается знание и начинается выдумка, можно за пару минут — ниже три приёма, которые для этого хватает. Подписку с доступом к свежим моделям оформляют на странице ChatGPT.
Почему так получается
Модель продолжает текст словом, которое чаще всего встречалось в похожем контексте. У неё нет отдельной ячейки памяти с проверенной датой основания компании — есть распределение вероятностей по всем вариантам, которые она видела.
Представьте миллион текстов с фразой «основана в 1995 году» и сотню с опечаткой «1985». Оба варианта для модели живые. Какой из них всплывёт в конкретном ответе, зависит от формулировки вопроса и от случайности при генерации. Поэтому один и тот же вопрос, заданный дважды, иногда даёт разные даты.
Вторая причина — предел знаний. У каждой модели есть момент, на котором закончились обучающие данные. События после него она знает только через поиск в интернете, если он включён. Молчать модель не умеет: вместо «не знаю» она продолжает текст, и получается уверенный рассказ о том, чего не было. Как работает поиск и когда модель в него идёт, разобрано в статье знает ли ChatGPT свежие новости.
Три приёма проверки
Попросить источник
Прямой вопрос «откуда это, дай ссылку» работает лучше долгих уговоров. Дальше два исхода. Либо модель признаёт, что точных данных у неё нет. Либо выдаёт адрес, и вот с ним нужно быть внимательным.
Выдуманные ссылки редко выглядят подозрительно: домен настоящий и известный, а страница внутри него не существует. Проверяется это одним движением — откройте ссылку. Страница не грузится или её содержимое не совпадает с пересказом? Источника нет.
Переспросить другими словами
Задайте тот же вопрос иначе и желательно в новом диалоге, чтобы модель не опиралась на собственный предыдущий ответ. Совпали ответы — данные в модели, похоже, есть. Разошлись — она их сочиняет каждый раз заново.
Пример: спросите «в каком году вышла эта модель», запомните ответ, потом в отдельном чате — «какая дата выхода у неё была». Расхождение в год означает, что опираться на цифру нельзя.
Проверить цифры в поиске
Любая конкретика — даты, суммы, фамилии, номера версий, названия статей — требует отдельной проверки. Возьмите ключевой факт и поищите его в обычном поисковике. Если первые страницы выдачи ничего похожего не показывают, факт стоит считать выдуманным, пока не нашлось подтверждения.
Где ошибка обходится дороже всего
- Право и налоги. Номера статей и формулировки норм модель путает особенно охотно, а звучат они солидно.
- Здоровье. Дозировки и названия препаратов проверяют только по инструкции и у врача.
- Цитаты и библиография. Модель легко приписывает известному человеку фразу, которой он не говорил, и собирает список литературы из несуществующих работ.
- Цены и курсы. Они меняются, а модель отвечает по тому, что видела при обучении.
- Чужие имена и должности. Здесь ошибка бьёт не только по вам, но и по человеку, о котором речь.
С расчётами история отдельная: там ошибку видно по несходящейся сумме. Как заставить нейросеть пересчитать и показать ход решения, разобрано в статье про проверку расчётов и документов.
Где выдумки почти безопасны
Есть работа, где цена ошибки мала. Код проверяется запуском: выдуманная функция отвалится на первом же прогоне. Черновик письма, план статьи, варианты заголовков, объяснение понятия своими словами — здесь модель сильна, и проверять нужно только конкретные факты, если они всплыли в тексте.
Отдельно стоит длинный диалог: чем дольше переписка, тем больше шансов, что модель потеряет начало разговора и начнёт додумывать детали, которые вы уже сообщали. Почему так происходит, написано в статье про окно контекста.
Что делать с ответом
Рабочее правило простое: всё, что можно перепроверить за минуту, проверяйте за минуту. Факты, даты, имена и числа из ответа не переносите в свой документ, пока не подтвердили их в первоисточнике.
Поиск в интернете помогает, но не решает вопрос целиком: модель может неверно понять найденную страницу или взять устаревшую. Ссылки, которые она приводит после поиска, тоже стоит открывать — это занимает секунды и снимает большую часть риска.
Частые вопросы
Почему нейросеть не говорит «я не знаю»?
Она продолжает текст наиболее вероятным словом, и «не знаю» редко оказывается таким словом. Признание неуверенности приходится запрашивать прямо.
Помогает ли поиск в интернете избавиться от выдумок?
Частично. С поиском модель опирается на найденные страницы, но может неправильно их понять или взять устаревшую. Приведённые ссылки стоит открывать.
Почему один и тот же вопрос даёт разные ответы?
В генерации есть случайность, и формулировка вопроса тоже влияет. Расхождение ответов — хороший признак того, что точных данных у модели нет.
Выдуманные ссылки ведут на несуществующие сайты?
Обычно домен настоящий, а страницы внутри него нет. Поэтому ссылку нужно открыть: по виду адреса её не проверить.