Собрали AI-фичу за неделю без лишних интеграций
Используем только открытые модели и edge-функции. Что с latency и стоимостью.
Мы начали не с выбора модели, а с одного короткого пользовательского сценария. Это сразу убрало половину архитектурных вопросов.
Запросы идут через одну edge-функцию, а ответы кэшируются по смысловому ключу. Средняя стоимость операции получилась меньше одного цента.
Если сценарий приживётся, добавим резервного провайдера. До этого момента сложная оркестрация только мешает.