RAG чат-бот — как обучить AI-бота на ваших документах (knowledge base гид 2026)

13 мая 2026 · 8 мин чтения

RAG расшифровывается Retrieval-Augmented Generation. Это способ обучить AI чат-бота на ваших собственных документах без переподготовки модели. Вместо этого вы создаёте knowledge base, а при каждом запросе систему извлекает релевантные документы и подаёт их в контекст LLM.

Сколько это стоит и из чего складывается сумма, разобрано отдельно: разработка чат-бота от 250 000 ₸, этапы и сроки. Если бот нужен именно в мессенджере, есть страница телеграм-бот на заказ.

Если проверять комплекты нужно потоком, у нас есть готовый сервис: DocVision Ai сверяет документы комплекта между собой, ведёт историю дел и подключается к вашей системе по токену. Первые 50 дел в месяц бесплатно. Один комплект можно проверить без регистрации в бесплатном инструменте.

Результат: бот отвечает на основе ваших данных (не интернета) с точностью 90-95%.

Что такое RAG архитектура

Классический pipeline RAG состоит из 4 шагов:

  1. Загрузка документов: PDF, DOCX, TXT, CSV, сайты → парсят в текст
  2. Chunking: большой документ разбивают на куски 500-1000 слов
  3. Embedding: каждый кусок конвертят в vector (768 или 1536 dimensions)
  4. Storage в vector DB: сохраняют в Pinecone, Weaviate, PostgreSQL pgvector
  5. Query time: запрос клиента → embedding запроса → поиск k-nearest соседей → подача в LLM context
RAG концепция: Вместо fine-tuning модели (дорого, долго), вы индексируете свои документы в vector base. При запросе бот извлекает релевантные куски и вставляет в промпт как контекст. Модель отвечает на основе этого контекста, не интернета.

Tools для RAG (выбор 2026)

Vector DB

Рекомендация для МСБ Казахстана: Pinecone (просто, без ops) или PostgreSQL pgvector (если уже есть инфра).

Embedding модели

Совет: для русского и казахского используйте multilingual-e5-large (free, работает).

Практический пример: RAG для юридической консультации

Клиент:법律 консультация в Алматы, 5000 документов (законы, судебные решения). Нужен бот, который отвечает на вопросы о казахстанском праве.

Архитектура

  1. Загружаем 5000 PDF в папку
  2. Парсим с помощью PyPDF2 / Llama Index → 50k chunks
  3. Embedding с multilingual-e5-large → 50k vectors × 1024 dimensions
  4. Сохраняем в PostgreSQL pgvector (уже есть сервер)
  5. При запросе: embedding запроса → search top-5 chunks → в Claude 5 контекст
  6. Claude отвечает на основе retrieved documents

Результат

Без RAG пришлось бы fine-tune модель на 5000 документов = $10k + месячное обслуживание. RAG сэкономил $9900.

Экономика RAG: Fine-tuning LLM на 5000 документов = $10k. RAG (vector DB + retrieval) = $500 setup + $40/месяц. Экономия 95% при такой же или лучшей точности.

Python код: быстрый старт RAG

from langchain.document_loaders import PyPDFLoader
from langchain.embeddings import HuggingFaceEmbeddings
from langchain.vectorstores import PineconeStore
from langchain.chat_models import ChatAnthropic
from langchain.chains import RetrievalQA

# 1. Загрузка документов
docs = []
for pdf in glob.glob("documents/*.pdf"):
    loader = PyPDFLoader(pdf)
    docs.extend(loader.load())

# 2. Embedding
embeddings = HuggingFaceEmbeddings(
    model_name="intfloat/multilingual-e5-large"
)

# 3. Vector store
vectorstore = PineconeStore.from_documents(
    docs, embeddings, index_name="kz-law"
)

# 4. RAG chain
llm = ChatAnthropic(model="claude-3-5-sonnet")
qa_chain = RetrievalQA.from_chain_type(
    llm=llm,
    chain_type="stuff",
    retriever=vectorstore.as_retriever(k=5)
)

# 5. Query
result = qa_chain.run("Какая зарплата минимум в РК?")
print(result)

Когда RAG выигрывает

Когда RAG НЕ нужен

Стоимость RAG в Казахстане (2026)

Компонент Стоимость Примечание
Vector DB (Pinecone) $0-96/месяц По объёму vectors
Embedding (multilingual-e5) Бесплатно Self-hosted
LLM (Claude 5) $300-1000/месяц По трафику
Разработка (А-LUX) 400-700k ₸ 2-3 недели

Примеры RAG ботов в КЗ

Из блога А-LUX

Чат-боты в Алматы
13.05.2026
Telegram vs WhatsApp
13.05.2026
Чат-бот для магазина
13.05.2026
Стоимость чат-бота
13.05.2026