Почему нейросеть говорит «остался предпоследний шаг», когда это не так?

⏱ 5 минут чтения

Есть один особенно забавный и одновременно показательный момент в работе с нейросетями. Вы ставите модели большую задачу: провести исследование, обработать десятки материалов, написать код, проверить результаты, собрать отчёт. Проходит какое-то время, и нейросеть сообщает: «остался предпоследний шаг». Вы уже мысленно готовитесь к финалу. А потом выясняется, что впереди ещё 5  этапов, 3 проверки, 2 исправления и в целом - примерно половина всей работы.

Это не просто смешной сбой счётчика, и даже не галлюцинация. В этом поведении хорошо видна одна из фундаментальных особенностей современных больших языковых моделей: они могут довольно убедительно описывать собственный прогресс, не имея надёжного внешнего механизма измерения этого прогресса. И для GEO это особенно интересная проблема.

Нейросеть не обязана знать, где она находится в процессе

Когда человек выполняет большой проект, у него обычно есть несколько уровней представления о работе. Он может буквально поставить галочки напротив выполненных пунктов: собрать данные, проверить их, провести анализ, сформулировать выводы, написать отчёт, проверить его, внести правки и отправить результат.

У языковой модели всё сложнее. LLM работает прежде всего с контекстом и вероятностным продолжением последовательности. Даже когда современная модель способна строить многошаговые планы и выполнять действия через инструменты, сам факт существования плана ещё не означает, что у модели есть безошибочный внешний счётчик состояния задачи. Проще говоря, она не думает.

Исследования длинных многошаговых задач показывают, что LLM-агенты по-прежнему испытывают сложности с долгосрочным планированием - задачами, в которых правильный результат требует большого количества последовательных действий. Отдельная проблема заключается в том, что планирование и выполнение могут требовать разных представлений задачи. Поэтому фраза про иллюзорный предпоследний шаг может быть не результатом точного вычисления а ля «я выполнил 17 из 18 этапов». Это может быть просто текстовым утверждением, которое выглядит естественным в данном месте диалога.

Модель предсказывает не только ответы, но и подходящий способ разговора

Большая языковая модель обучена на огромном количестве человеческих текстов. В них постоянно встречаются конструкции вроде «остался последний шаг», «теперь осталось совсем немного», «перейдём к финальной части», «мы почти закончили». Это нормальные человеческие речевые конструкции. Когда работа действительно приближается к завершению, человек часто сообщает об этом собеседнику. Поэтому у модели существует очень сильная статистическая связь между определённым контекстом и подобными фразами.

Но здесь возникает принципиальная проблема: речевой сигнал о завершении и фактическое завершение работы - не одно и то же. Модель может сказать «почти закончили», потому что такая фраза хорошо соответствует текущему состоянию текста. Это не обязательно означает, что существует некая надёжная переменная remaining_steps = 2, которая была предварительно вычислена и проверена.

Слово «предпоследний» особенно показательно. Оно содержит скрытое количественное утверждение. Когда модель говорит ту самую фразу про якобы оследний шаг, она фактически утверждает, что после текущего этапа останется ровно один существенный этап. Это уже не просто описание процесса - это прогноз состояния системы. И он может оказаться совершенно неверным. Причём внешне ответ может выглядеть очень уверенно.

В этом заключается важная особенность LLM: уверенность формулировки сама по себе не является доказательством правильности утверждения. Та же проблема возникает, когда модель говорит «я проверил все источники», «я просмотрел весь документ», «я сравнил все варианты», «я учёл все ограничения» или «всё готово». Во всех этих случаях возникает вопрос: что именно является источником истины о состоянии процесса? Если только сама языковая модель, мы получаем замкнутую систему, в которой модель одновременно выполняет работу, описывает работу и оценивает качество собственного выполнения. А это не всегда надёжно.

Длинный контекст не равен идеальной памяти

Можно возразить: современная модель видит весь диалог, почему она просто не посмотрит выше и не пересчитает этапы? Потому что способность принять большой контекст и способность одинаково надёжно использовать всю информацию внутри него - разные вещи.

Исследование Lost in the Middle показало, что качество работы языковых моделей с длинным контекстом может существенно зависеть от положения нужной информации внутри этого контекста: сведения в начале и конце часто используются лучше, чем информация в середине. Условные -Шаг 1-, -Шаг 2-… -Шаг 27- не превращаются автоматически в надёжную таблицу состояния только потому, что модель технически способна увидеть весь этот текст. Особенно если первоначальный план постепенно изменялся.

План тоже может -поплыть-. Предположим, мы поставили задачу из пяти этапов. На втором этапе обнаруживается дополнительная проблема, которая требует ещё четырёх действий. Теперь первоначальные пять этапов фактически превращаются в девять. Затем на шестом этапе появляется ещё одна зависимость. Человек с хорошо организованным проектом обычно меняет план явно. AI-агенту для этого тоже нужна архитектура.

Именно поэтому в современных системах всё чаще разделяют планирование, выполнение, состояние и проверку результата. Исследования агентных систем прямо рассматривают разделение высокоуровнего и низкоуровневого выполнения как способ повысить устойчивость при длинных задачах. Проблема решается не магической командой -будь внимательнее-. Нужна архитектура, в которой состояние задачи существует отдельно от красивого текста о состоянии задачи.

Отсюда важный вывод для AI-агентов

Представим AI-агента, который должен самостоятельно собрать семантику, проанализировать конкурентов, проверить выдачу, найти источники, написать материалы, разместить их, проверить индексацию, собрать метрики и сформировать отчёт. Если агент просто разговаривает с нами и каждый раз сам сообщает «готово», мы не знаем, что именно означает «готово».

В хорошей агентной системе состояние должно быть проверяемым. Например:

collect_keywords = completed
competitor_analysis = completed
serp_check = completed
content_generation = completed
publication = completed
indexation_check = pending
analytics_check = pending
final_report = pending

Теперь фраза может быть вычислена из состояния системы. Это уже совсем другая архитектура. Модель не вспоминает, что ей осталось сделать. Система знает, что осталось сделать. И это различие чрезвычайно важно.

Что это означает для GEO

На первый взгляд может показаться, что всё это не имеет отношения к GEO. На самом деле имеет самое прямое. GEO - это не просто написание текстов -для нейросетей-. Если мы хотим, чтобы генеративные системы правильно представляли компанию, продукт, человека или бренд, нас интересует не только наличие информации в интернете. Нас интересует то, как модель извлекает, связывает и интерпретирует эту информацию. А значит, мы должны учитывать особенности самой системы.

Если LLM может ошибаться даже при оценке собственного состояния, то тем более нельзя считать её внутреннее представление бренда автоматически точной копией объективной реальности. Модель может пропустить источник, неправильно связать две сущности, переоценить значение одного сигнала, недооценить другой, построить неверную причинно-следственную связь и уверенно сообщить результат, который требует дополнительной проверки.

Именно поэтому GEO постепенно выходит за рамки классического подхода -создадим хороший текст и подождём, пока нейросеть его увидит-. Нам приходится думать о наблюдаемости AI-ответов. Нужно не просто оптимизировать присутствие информации. Нужно измерять: что именно модель говорит о бренде, на каких источниках основывается, какие сущности связывает с брендом, какие характеристики ему приписывает и насколько стабильно повторяет эти выводы.

GEO превращается в задачу управления представлением. В классическом SEO мы привыкли работать с достаточно понятной цепочкой: страница - индекс - запрос - позиция - клик. В генеративном поиске цепочка сложнее: источники - retrieval - контекст - интерпретация модели - ответ - рекомендация. И на каждом этапе может появиться ошибка. Причём пользователь видит только последний результат.

Он спрашивает: «какое агентство выбрать для SEO?» и получает три рекомендации. Мы не видим непосредственно всех внутренних вычислений модели. Но можем анализировать результат: кого она назвала, кого не назвала, какие характеристики использовала, какие источники привела, какие факты повторяются, какие оценки меняются от запроса к запросу. Это и есть одна из причин, почему AI Visibility становится самостоятельным направлением цифрового маркетинга.

А теперь вернёмся к -предпоследнему шагу-

На самом деле эта маленькая ошибка очень хорошо показывает, куда движется индустрия. Первое поколение AI-инструментов в маркетинге в основном помогало генерировать контент. Следующий этап - системы, которые умеют выполнять процессы. Но как только мы передаём машине длинную цепочку действий, возникает новый класс задач: контроль состояния.

Нам уже недостаточно спросить: «что ты сделал?». Нужно уметь проверить: что действительно сделано, что ещё не сделано, что было сделано по плану, что появилось в процессе дополнительно, какие результаты подтверждены внешними данными, какие утверждения являются только предположением самой модели. Это уже не столько проблема генерации текста. Это проблема AI operations.

И это касается не только нейросетей. В цифровом маркетинге мы давно научились относиться с осторожностью к метрикам, которые выглядят точными. CTR - не продажи. Позиция - не прибыль. Охват - не влияние. Лайки - не брендовая ценность. И теперь появляется ещё одна важная мысль: уверенный ответ AI - тоже не обязательно факт.

Нейросеть может говорить очень убедительно. Она может прекрасно объяснить, почему что-то произошло. Может последовательно описать выполненную работу. Может даже назвать конкретное количество оставшихся шагов. Но если за этим утверждением нет независимого механизма проверки, перед нами всё ещё предсказание модели, а не показание измерительного прибора.

Что с этим делать на практике

Для простых разговоров ничего особенного делать не нужно. Если вы просите «напиши поздравление коллеге», не имеет большого значения, насколько точно модель отслеживает внутренний план. Но для сложных задач полезно разделять четыре уровня:

  1. План - что вообще необходимо сделать.
  2. Состояние - что уже выполнено.
  3. Доказательство - как мы знаем, что это действительно выполнено.
  4. Результат - что получилось в итоге.

Это гораздо надёжнее, чем фраза «остался предпоследний шаг». Потому что второе - просто текст. А первое - модель состояния процесса.

Парадокс заключается в том, что проблема пресловутого «предпоследнего шага» возникает именно потому, что нейросеть становится всё более похожей на универсального цифрового сотрудника. Пока мы использовали LLM как улучшенный автодополнитель текста, ошибки такого типа были почти безобидными. Но когда AI начинает исследовать рынок, анализировать конкурентов, работать с рекламой, управлять SEO, писать код, запускать инструменты, готовить отчёты и принимать промежуточные решения, контроль состояния становится частью самого продукта.

И здесь проходит одна из границ между обычным AI-ассистентом и полноценным AI-агентом. Ассистент может сказать: «кажется, мы почти закончили». А хорошо спроектированный агент должен уметь показать: -Из 12 задач выполнено 9, две заблокированы внешней зависимостью, одна ещё не запускалась-. И это уже не просто более умная нейросеть. Это другая архитектура взаимодействия человека и AI.

Поэтому в следующий раз, когда нейросеть скажет вам про какой-то там в пятый раз «последний» шаг, не спешите радоваться. Лучше попросите: «а перечисли-ка все оставшиеся задачи и покажи, НА ОСНОВАНИИ ЧЕГО ты считаешь, что их именно столько». Иногда после этого внезапно выясняется, что до конца ещё очень далеко.

И, пожалуй, это один из самых наглядных способов понять современный AI: нейросеть может очень убедительно рассказывать о процессе, не будучи надёжным источником истины о состоянии этого процесса. Для маркетолога это означает простое правило: не измеряйте AI только по тому, насколько уверенно он говорит. Ориентируйтесь на то, насколько проверяемы его действия, источники и результаты.