ИИ-агенты

Как обучить ИИ-агента на своей базе знаний

Обучить ИИ-агента — значит разобрать материалы на отдельные темы «вопрос — полный ответ», убрать смысловые дубли по векторам и дальше пополнять базу вопросами, на которые агент не ответил. Загрузка сайта одним куском обучением не считается: агент отвечает только тем, что в базе знаний уже лежит. Данные агентства ЭТОБОТ на 16 сентября 2026 года.

15 мин чтения Дмитрий Киселев, основатель ЭТОБОТ и ЭТОЧАТБОТ

Вопрос «как обучить ИИ-агента» звучит так, будто есть кнопка «загрузить сайт». Кнопка есть, обучение начинается после неё. Ниже — как материалы превращаются в темы, почему дубли опаснее пробелов, что при разборе теряется и как принимать результат.

Короткий ответ

  1. Обучение — разбор, а не загрузка. Страница или файл делится на части примерно по 9 000 знаков, из каждой части извлекаются темы вида «вопрос — полный ответ». 25 страниц нашего сайта дали 428 тем.
  2. Дубли снимаются дважды: по словам и по смыслу. Сначала сравнение формулировок, потом сравнение векторов. Порог «почти наверняка одно и то же» — 0,91 по косинусу; на тех же 428 темах близких пар осталось две.
  3. Переобучение меняет темы источника, а не всю базу. Страница изменилась — её прежние темы снимаются, новые встают на их место. Темы, написанные руками, остаются.
  4. После запуска работает накопитель неотвеченных вопросов. Туда попадает каждый вопрос, где агент не уверен или зовёт человека. База знаний пополняется из накопителя, а не из головы.
  5. Цена: разработка от 20 000 ₽, поддержка от 5 000 ₽ в месяц. Работа самого агента считается по расходу токенов. Точная смета — после разбора задачи и до начала работ.

Что значит «обучить ИИ-агента»: темы, а не текст

Модель не запоминает ваши материалы. При каждом вопросе в неё уходит системный промпт и подобранные под этот вопрос куски базы: у нас до 12 тем и 8 фрагментов, а база меньше 6 000 знаков уходит целиком. Из этого следует всё остальное.

Первое следствие: тема обязана быть самодостаточной. Она попадает в модель без соседей, поэтому ответ «тут всё как в предыдущем пункте» бесполезен. Мы извлекаем не «фрагменты текста», а пары «вопрос — полный ответ»: вопрос нужен, чтобы тему нашли, ответ — чтобы он работал в одиночку.

Второе следствие: в базе нельзя держать куски, нарезанные по размеру. Условие уезжает в один кусок, цена — в другой, и агент отвечает цену без условия, выглядя при этом уверенно. По размеру материал режется только для того, чтобы отдать его модели на разбор; сами куски в базу не попадают.

Как идёт разбор у нас:

  • страница или файл делится на части, часть — это страница или примерно 9 000 знаков;
  • каждая часть уходит в модель, та возвращает темы с вопросами, синонимами и полными ответами;
  • части считаются параллельно по пять: в замере на 25 страницах 195 секунд вместо 609;
  • темы вливаются в базу после каждой пачки, и следующая пачка видит их при проверке на дубли.

Разбор стоит денег: каждая часть — отдельный запрос к модели. Поэтому обходить весь сайт «на всякий случай» смысла нет.

Пять источников знаний и что из каждого выйдет

Три источника вы отдаёте до запуска, два появляются после. Последние дают самые точные темы: они берутся из живых разговоров.

ИсточникЧто из него выйдетКак обновлять
Страница сайта по ссылкетемы по тексту страницы; обход ограничен 25 страницами и бюджетом временипереобучить источник — его темы заменяются
Файл PDF, DOCX или TXTтемы по тексту файла; таблицы разваливаются, картинки теряютсязагрузить новую версию файла и переобучить его
Текст, написанный рукамиодна-две точные темы с формулировкой, которую агент не меняетправкой темы; при переобучении сайта не стирается
Ответ оператора из диалогаготовая тема из живого ответа человекаотправить в базу кнопкой в диалоге
Накопитель неотвеченныхсписок вопросов без ответов — заготовки для новых темразбирать раз в неделю после запуска

Про третью строку отдельно. Ручные темы помечены как ручные, и переобучение сайта их не трогает. Другого способа держать в базе то, чего на сайте нет, не существует. У нашего агента 662 темы, и рядом с собранными по сайту лежит рассказ владельца текстом — без него агент знал бы ровно то, что на посадочных страницах.

Дедуп по векторам: почему две темы об одном хуже одной

Самая частая порча базы — не пробел, а противоречие. Цена лежит на странице сайта и в PDF-прайсе, а в прайсе она прошлогодняя. Обе темы подберутся под один вопрос и обе уйдут в модель, а выбор между ними от вас уже не зависит. Поэтому дубли снимаются на входе, двумя способами.

По словам. Сравниваются формулировки вопросов со стеммингом; порог сходства — 0,55. Так ловятся темы, собранные с двух почти одинаковых страниц.

По смыслу. Для каждой темы считается вектор, темы сравниваются по косинусу. Порог 0,91 — это «то же самое, объединяем». Есть мягкий порог 0,85, но он срабатывает только вместе с пересечением слов не ниже 0,25 по Жаккару: похожий смысл при полностью разной лексике часто оказывается разными вопросами.

Пороги не выдуманы, а откалиброваны на своей базе: при косинусе от 0,90 это почти всегда один и тот же вопрос, в полосе 0,85–0,90 — как правило один. Проверка на нашем сайте: 428 тем, близких пар с косинусом от 0,91 — две.

Следствие для заказчика: один факт — одно место. Если прайс есть файлом, те же цены со страницы сайта собирать не надо.

Переобучение по сайту: меняются темы источника, а не вся база

На сайте поменялась страница с ценами. Дальше два способа, и разница между ними видна не сразу. Плохой — обучить агента заново целиком: ручные правки и темы из живых диалогов исчезнут, база вернётся к состоянию «что написано на сайте». Хороший — переобучить один источник: прежние темы этой страницы снимаются, новые встают на их место, остальное не трогается.

Поэтому каждая тема помнит свой источник. Без этого «обновить цены» превращается в полную пересборку, а пересборка стирает всё, что добавлено руками.

Переобучение — операция регулярная: поменяли прайс, добавили услугу, закрыли направление — переобучили затронутый источник. В цены на разработку и поддержку оно входит, отдельной строкой «обучение» мы не выставляем.

База знаний по ссылке и из документов: что берётся, что теряется

Сбор по ссылке выглядит просто: даёте адрес, движок ходит по сайту сам. Внутри HTML превращается в текст, меню, подвал и баннеры выбрасываются, страницы-дубли снимаются, ссылки обходятся по весу — сначала «Цены», «Услуги», «Контакты», «Вопросы и ответы». Обход ограничен 25 страницами и бюджетом времени. Большой каталог целиком не попадёт, и это правильно: тысяча карточек товара — задача для запроса в вашу систему.

Что теряется, и здесь важно не обманываться:

  • Картинки. Прайс картинкой текстом не станет, сканированный PDF без текстового слоя даст пустоту.
  • Таблицы. Из HTML и DOCX таблица извлекается текстом и теряет связь строки со столбцом. Сложную таблицу надёжнее переписать руками.
  • Закрытые разделы. Всё, что за авторизацией, движок не видит.
  • Изменчивые данные. Наличие, статус заказа, свободные слоты устареют к вечеру. Это работа инструмента: агент запрашивает систему и отвечает тем, что она вернула.
  • Произвольная ссылка на Instagram*. Спарсить профиль по ссылке нельзя, Instagram* закрывает такое чтение. Берётся только подключённый к боту аккаунт через официальный API.

Накопитель неотвеченных вопросов — главный инструмент после запуска

До запуска вы обучаете агента на том, что считаете важным. После запуска клиенты спрашивают другое. Разница между этими списками и есть настоящая работа по обучению.

Вопрос попадает в накопитель в двух случаях: агент не уверен в ответе или зовёт человека. Раз в неделю список разбирается: часть становится новыми темами, часть — правилом по теме, часть осознанно остаётся человеку.

Как накопитель был сломан у нас. Запись шла двумя ветками: одна срабатывала, когда агент не уверен и человека не зовёт, вторая — когда зовёт и при этом уверен. Сочетание «и не уверен, и зову человека» не покрывала ни одна, а это самый ценный случай: клиент спросил то, чего в базе нет, и разговор ушёл оператору. Такие вопросы не попадали ни в накопитель, ни в уведомление владельцу. Нашли на живом запуске, починили 09.09.2026 одной записью на входе и проверили пятью сочетаниями условий.

Второй вывод оттуда же: запись делается до того, как агент решит промолчать. Если он настроен при неуверенности не отвечать, вопрос вообще не виден в переписке — без накопителя он исчезает бесследно. Поэтому у подрядчика стоит спросить, где лежат вопросы без ответа и кто их разбирает.

Как принимать обучение: 30 живых вопросов и слепое сравнение

«Вроде отвечает нормально» — не приёмка. Ответы ИИ-агента ломаются тихо: текст остаётся гладким, а факт в нём меняется — именно так и выглядит случай, когда ИИ-агент придумывает вместо честного «не знаю». Приёмка и любая последующая правка идут у нас одним порядком.

  1. Собрать корпус из 30 настоящих вопросов из журнала: многоходовые диалоги с историей, короткие продолжения вроде «да» или «второй вариант», случаи, где агент ушёл в «не знаю», и обычные вопросы. Половина — с историей: работа с контекстом ломается первой.
  2. Прогнать корпус без записи в диалоги, чтобы клиенты ничего не получили.
  3. Сравнить ответы до и после правки слепо, порядок случайный.

Почему так строго. Один раз мы сократили системный промпт «по здравому смыслу» — слепое сравнение дало 12:5 в пользу старой версии. В промпт попало жёсткое «не переспрашивай», и модель начала додумывать характеристики товара. После оговорки, что запрет переспрашивать не разрешает додумывать, счёт стал 14:6 и 11:8 в пользу новой. Правило отсюда: правка промпта или базы без замера не считается сделанной.

И отдельно про «не знаю». Честный отказ — хороший результат приёмки, а не брак. В нашей проверке агент ответил «не знаю» на вопрос про интеграцию с amoCRM — в базе про amoCRM не было ничего, и любой другой ответ был бы выдумкой.

Чего делать не надо

  • Не считать обучение разовой работой. Залить сайт и забыть — способ получить агента, который уверенно рассказывает прошлогодние цены.
  • Не класть в базу изменчивые данные. Наличие, сроки доставки, статус заказа, свободное время — только запросом в систему.
  • Не отдавать агенту формулировки, которые нельзя перефразировать. Юридические тексты, дозировки, условия возврата выдаёт сценарий готовым текстом.
  • Не обучать по чужому сайту. Чужие условия в своей базе — прямой путь к обещанию, которого вы не выполните.
  • Не запускать агента без правила «зову человека». Иначе клиент быстрее доходит до места, где ему никто не отвечает, а заметная часть обращений приходит вне рабочего дня, когда оператора рядом нет.
  • Не начинать с ИИ-агента, если материалов нет. Если условия существуют только в голове владельца, сначала их надо записать текстом.
  • Не заказывать агента при единицах обращений в неделю. Меню из пяти кнопок или простой автоответчик в Telegram закроют задачу, а разбор материалов и наблюдение не окупятся. Разница между конструктором и разработкой разобрана в статье про то, сколько стоит разработка чат-бота.

Ограничения каналов, которые база знаний не отменяет

Обученный агент не меняет правил мессенджеров: знания влияют на то, что он скажет, а не на то, кому и когда разрешено написать.

КаналКто делает первый шагЧто это значит для обученного агента
Telegramчеловек нажимает «Запустить»без точки входа базе знаний не с кем разговаривать; рассылки по базе телефонов нет
ВКонтактесообщество пишет подписчику первым, бессрочноможно вернуться к старому диалогу, никакого окна 24 часа у ВК нет
МАКСчеловек сам начинает диалогнужна верификация профиля и доверенный российский корневой сертификат
Instagram*комментарий, реакция на сторис или кодовое слово в личных сообщенияхпервый директ уходит как Private Reply, попытка одна

Деталь про Instagram*, важная для обучения: попытка отправить первый директ после комментария ровно одна. Отказ сжигает слот, повтор не спасает, спасает публичная подсказка в комментариях. Поэтому темы для этого канала пишутся короче и однозначнее — второго шанса не будет. Разбор по всем четырём каналам есть в статье про то, кто может написать клиенту первым. WhatsApp в России мы не продаём.

В МАКС своё: бота заводит организация, ИП или самозанятый — резидент РФ, профиль проходит верификацию, она занимает несколько рабочих дней. Это единственный срок, который мы называем, и он от нас не зависит.

Сколько стоит обучение ИИ-агента

Отдельной цены за обучение у нас нет — оно часть работы, а цена ИИ-агента складывается из разработки, поддержки и расхода токенов.

  • Разработка — от 20 000 ₽. Разбор материалов, сборка базы знаний, промпт, подключение канала, правило передачи разговора человеку. Точная цифра называется после разбора задачи и до начала работ.
  • Поддержка — от 5 000 ₽ в месяц. Разбор накопителя, переобучение изменившихся источников, правки промпта с замером — что ещё входит в поддержку бота, разобрано построчно.
  • Работа агента — по расходу токенов. Сколько агент потратил на ответы, столько его работа и стоила; фиксированной ставки за месяц нет. База влияет на расход напрямую: чем больше кусков подмешано к вопросу, тем дороже ответ. В нашем замере из 8 202 входных токенов 8 064 пришли из кэша — 98 %, и только потому, что начало запроса не меняется.
  • Оплата зарубежных ИИ-сервисов. Часть моделей российской картой не оплачивается; помогаем провести оплату иностранными картами. В разработку и поддержку эти деньги не входят.

Сроков мы не обещаем: они зависят от скорости, с которой приходят материалы и доступы.

Откуда цифры в этой статье

Числа про обучение — замеры нашего движка: 25 страниц и 428 тем получены на своём сайте, пороги дедупа откалиброваны на этой же базе, 98 % кэша и счёт 12:5 взяты из журналов замеров.

Снимок базы на 16 сентября 2026 года: 325 ботов в Instagram* (176 активных), 70 в Telegram (54), 16 в вебчате (все активны), 11 в МАКС (8), 4 во ВКонтакте (все активны). Всего 323 кабинета, 366 сценариев, 85 905 диалогов и 445 524 сообщения с апреля 2026 года. Оговорка обязательна: это боты пользователей сервиса ЭТОЧАТБОТ, созданные ими на нашем движке, а не заказные проекты агентства.

Что запомнить

  1. Обучение — разбор материалов на самодостаточные темы «вопрос — полный ответ»; часть разбора равна странице или примерно 9 000 знаков.
  2. В модель уходит не вся база, а до 12 тем и 8 фрагментов — либо база целиком, если она меньше 6 000 знаков.
  3. Дубли снимаются дважды: по словам с порогом 0,55 и по векторам с порогом 0,91 — иначе две темы об одном факте противоречат друг другу в одном ответе.
  4. Переобучение заменяет темы одного источника, полная пересборка стирает ручные правки и темы из живых диалогов.
  5. Накопитель неотвеченных — главный инструмент после запуска; приёмка — 30 живых вопросов и слепое сравнение; цены: от 20 000 ₽ за разработку и от 5 000 ₽ в месяц за поддержку.

Нужен разбор конкретной базы знаний — напишите в нашем боте в Telegram: посмотрим сайт и документы и скажем, чего в базе знаний не хватит. Другие разборы собраны в разделе ИИ-агенты и нейросети в ботах.

Частые вопросы

Как обучить ИИ-агента на своих данных?

Дать три вида материалов: страницы сайта по ссылке, файлы PDF, DOCX или TXT и темы, написанные руками. Движок делит материал на части по странице или примерно 9 000 знаков и извлекает из каждой темы «вопрос — полный ответ», снимая дубли. 25 страниц нашего сайта дали 428 тем. Дальше база пополняется из накопителя неотвеченных вопросов.

Что такое база знаний для чат-бота?

База знаний — набор тем, из которых бот собирает ответ: у каждой темы есть вопрос, синонимы и полный ответ. При обращении в модель уходит не вся база, а подобранные под вопрос куски: у нас до 12 тем и 8 фрагментов, а база меньше 6 000 знаков уходит целиком. Изменчивые данные вроде наличия в базу не кладут — их берут запросом в систему.

Как создать чат-бота с нейросетью?

Понадобятся четыре вещи: материалы для базы знаний, системный промпт с правилами общения, подключённый канал и правило передачи разговора человеку. Разработка у нас стоит от 20 000 ₽, поддержка — от 5 000 ₽ в месяц, работа агента считается по расходу токенов. Сроков не обещаем: они зависят от скорости, с которой приходят материалы и доступы.

Нужно ли переобучать ИИ-агента после изменений на сайте?

Да, но только изменившийся источник. Переобучение страницы снимает её прежние темы и ставит новые, остальная база не трогается; темы, добавленные руками, остаются. Полная пересборка базы стирает ручные правки и темы из живых диалогов, поэтому «обучить заново» — плохой способ обновить цены. В поддержку от 5 000 ₽ в месяц переобучение входит.

Что делать, если ИИ-агент отвечает неправильно?

Найти причину в базе, а не в модели. Чаще всего в базе лежат две противоречивые темы об одном факте — например, цена со страницы сайта и прошлогодняя цена из PDF. Лишнюю тему убирают, верную правят руками. Правка промпта — последний шаг и только с замером: слепое сравнение на 30 живых вопросах однажды дало 12:5 не в пользу новой версии.

Можно ли обучить ИИ-агента по ссылке на Instagram*?

Нет. Произвольную ссылку на профиль спарсить нельзя — Instagram* закрывает такое чтение. Работать можно только с аккаунтом, подключённым к боту через официальный API. Там же действуют ограничения канала: написать человеку первым нельзя, легальные входы — ответ на комментарий, реакция на сторис и кодовое слово в личных сообщениях.

Сколько стоит обучение ИИ-агента?

Отдельной цены за обучение нет: разбор материалов и сборка базы знаний входят в разработку от 20 000 ₽, а разбор неотвеченных вопросов и переобучение источников — в поддержку от 5 000 ₽ в месяц. Работа самого агента считается по расходу токенов, и объём базы на него влияет напрямую. Точная смета — после разбора задачи.

Нужен бот, который делает это у вас?

Читать дальше