инференс
инференс — это момент, когда модель обрабатывает запрос и выдаёт ответ. обучение было один раз где-то у разработчиков, а инференс — это каждый ваш запрос, и платите вы именно за него.
что это
у модели две жизни. первая — обучение: месяцы, дата-центры, миллиарды — это забота разработчиков модели, не ваша. вторая — инференс: обученная модель принимает запросы и выдаёт ответы. аналогия: врач. образование он получил один раз, а приём ведёт каждый день — и платите вы за приём, а не за его институт. каждый вопрос вашему боту, каждый обработанный документ — один акт инференса.
зачем это бизнесу
инференс — это ваша операционная стоимость ии, и она навсегда. проект «внедрили и забыли» не существует: пока система работает, идут запросы, и каждый стоит денег — обычно долей рубля или рублей, в зависимости от модели и объёма текста. отсюда два практических следствия. первое: экономика считается на запрос — «обработка одной заявки стоит 3 рубля, менеджер тратил 15 минут» — и умножается на ваш поток. второе: стоимость инференса можно осознанно снижать — модель попроще на простые задачи, кэширование повторяющихся кусков — иногда в разы без потери качества. оценки тут всегда примерные, но порядок цифр подрядчик обязан назвать до старта.
о чём спросить подрядчика
- «сколько стоит инференс на один типовой запрос и сколько это в месяц на нашем объёме?» — если в смете только разработка, а операционных расходов нет, счёт придёт сюрпризом.
- «что вы сделали, чтобы инференс стоил дешевле?» — выбор модели под задачу, кэширование, короткие промпты. ответ «взяли самую мощную модель на всё» означает, что вы переплачиваете.
термины — это карта. дорогу строим на разборе
словарь помогает не потеряться в разговоре с подрядчиком. а какие процессы в вашей компании автоматизировать первыми и что это даст в деньгах — это разбор за 25 000 ₽: смотрю процессы, считаю эффект, отдаю карту внедрения. фикс-цена, без «менеджер свяжется».