Когда AI нельзя выпускать вслепую

AI-функция,
которая не подводит
в проде

Если LLM-фича должна помогать продукту, а не создавать новые риски, ей недостаточно хорошего prompt. Нужны маршрутизация, tools, память, проверка поведения и контроль стоимости — с моделью только там, где действительно нужен reasoning.

Что держать под контролем production · 2026
  1. Routing ×80 Быстрый и одинаковый ответ известный триггер выполняется до модели
  2. Agents Агенты с понятной зоной ответственности узкий набор tools, function calling
  3. Memory 24 → 15 Память без устаревших и дублирующихся фактов working TTL ↔ long-term recall, дедупликация
  4. Evals 2454 Проверка целого сценария до релиза диалог · routing · tool call · запись в БД
  5. Prompts −22% Стоимость без потери критичных правил стабильный prefix, сжатие после проверки правил
Проверено на реальном сценарии Production Telegram · с весны 2026 Открыть кейс Jarwis
Слой системы Метрика из production Все станции — из кейса Jarwis

Карта рисков

У LLM-фичи ломается не только ответ модели

Ниже — контуры, которые закрывают разные классы отказов: от неверного маршрута и устаревшей истории до цены каждого input-токена.

Контуры надёжности

Как снижаю главные риски AI-фичи

  1. 01
    Сначала риск для продукта, потом модель. Галлюцинация tool call, устаревшая история или деградация cache формируют архитектуру, а не становятся сюрпризом после релиза.
  2. 02
    Детерминированно там, где цена ошибки высока. Код до модели даёт быстрый, одинаковый и проверяемый результат там, где он нужен пользователю.
  3. 03
    Стоимость и задержка видны до масштабирования. Latency, стоимость input-токенов и качество сценариев — метрики первого класса, а не догадки «на глаз».
  4. 04
    Пользовательский сценарий — тестируемый контракт. Сценарий, воспроизводящий реальную ошибку, ценнее unit-теста на отдельную функцию.
Проверенный сценарий · Jarwis Engineering case study

Не демо: кейс с ценой, скоростью и качеством

Jarwis — production AI-ассистент в Telegram. В кейсе разобраны четыре риска, инженерные решения и их последствия: latency, стоимость, качество и границы каждого компромисса.

×80

ускорение fast-path: ~31 мс вместо ~2575 мс

36 → 50%

cache hit — около −22% input cost

2454

автоматических теста в 277 suites · 2 бага до релиза

Telegram · текст · голос · PDF TypeScript / Node.js PostgreSQL + pgvector Multi-provider LLM API

Инженерная база

AI не становится надёжнее без инженерной базы

Angular 8 → 21, четыре приложения и shared UI-библиотека сформировали привычки, которые нужны AI-системе: контракты, проверяемость и эксплуатация.

Frontend-основание

Следующий шаг

Хотите понять, где LLM действительно принесёт пользу?

Проектная / частичная занятость, удалённо. Резюме — по запросу.