Собрали AI-фичу за неделю без лишних интеграций

Используем только открытые модели и edge-функции. Что с latency и стоимостью.

Мы начали не с выбора модели, а с одного короткого пользовательского сценария. Это сразу убрало половину архитектурных вопросов.

Запросы идут через одну edge-функцию, а ответы кэшируются по смысловому ключу. Средняя стоимость операции получилась меньше одного цента.

Если сценарий приживётся, добавим резервного провайдера. До этого момента сложная оркестрация только мешает.