Ошибка в выборе инфраструктуры для LLM на старте обходится бизнесу в 30-50% переплаты по OPEX в первый год или в полной остановке проекта из-за дефицита H100. Сегодня борьба идет не за алгоритмы, а за доступ к VRAM и минимизацию задержек (latency) при выводе токенов.
On-premise: капитализация через железо и суверенитет
Собственный кластер оправдан при нагрузке более 100 млн токенов в сутки и жестких требованиях безопасности. Стоимость одного узла на базе NVIDIA H100 (8 GPU) стартует от $300,000 до $450,000 без учета систем охлаждения и питания. Срок окупаемости по сравнению с облаком при полной загрузке составляет 14-18 месяцев, но риск морального устаревания железа через 2-3 года делает этот актив высокорисковым.
Кейс: Финтех-компания развернула Llama-3-70B на собственных A100. Результат: снижение стоимости одного запроса с $0.02 (API) до $0.004 (On-prem), но затраты на штат из 3 ML-инженеров ($15k-25k/мес) «съели» часть экономии. Главный подводный камень — энергопотребление: один сервер может требовать до 10 кВт, что часто требует модернизации серверной.
Экспертный вывод: On-premise — это стратегия для компаний с оборотом от 1 млрд руб., где утечка данных стоит дороже, чем простой в $500k на закупку оборудования.
Cloud: гибкость против «налога на масштабирование»
Облачные GPU-инстансы (AWS, Azure, GCP или локальные провайдеры) идеальны для этапа R&D; и MVP. Стоимость аренды A100 в среднем варьируется от $2 до $4 за час за одну карту. Однако при масштабировании на тысячи одновременных пользователей стоимость инференса растет линейно, создавая «потолок рентабельности» продукта. Доля рынка облачного ИИ растет, но бизнес сталкивается с проблемой Vendor Lock-in, когда миграция весов модели и данных между облаками занимает недели.
Пример: Стартап использовал Serverless GPU для обработки документов. При росте трафика с 100 до 10 000 запросов в час ежемесячный счет вырос с $500 до $12,000. Переход на зарезервированные инстансы снизил затраты на 30%, но лишил гибкости в выборе версий библиотек CUDA.
Экспертный вывод: Облака — это инструмент для проверки гипотез. Оставаться в них при стабильном трафике — значит отдавать до 40% маржинальности провайдеру.
Hybrid: баланс между безопасностью и пиковыми нагрузками
Гибридная схема предполагает хранение «ядра» (чувствительных данных и базовой модели) On-premise и расширение мощностей в облако (Cloud Bursting) во время пиков. Это требует сложной архитектуры, где комплексная экосистема нейросетей для бизнеса синхронизируется через единый оркестратор (например, Kubernetes с KubeFlow). Затраты на настройку такой среды выше на 20-25%, но она нивелирует риск простоя при скачках трафика.
Кейс: Ритейлер использует локальный сервер для анализа лояльности клиентов (безопасность), но в период «Черной пятницы» перенаправляет 60% запросов к LLM-консультанту в облако. Это позволило избежать падения системы при 10-кратном росте нагрузки, сохранив среднее время ответа (TTFT) в пределах 200-400 мс.
Экспертный вывод: Гибрид — единственный зрелый подход для крупного бизнеса. Он позволяет управлять рисками и оптимизировать TCO (Total Cost of Ownership).
Технико-экономическая матрица выбора
Ключевой метрикой выбора становится стоимость одного миллиона токенов при заданной задержке. В On-premise основные затраты — CAPEX (железо + электричество), в Cloud — OPEX (почасовая аренда). Важно учитывать стоимость вывода нейросетей: использование квантования (INT8/FP8) позволяет сократить требования к VRAM в 2 раза, что в гибридной модели дает экономию до 30% бюджета на GPU.
- До 1 млн токенов/день → Cloud API (GPT-4, Claude).
- 1-50 млн токенов/день → Cloud GPU (аренда инстансов) или Hybrid.
- От 50 млн токенов/день → On-premise (кластер H100/A100).
Экспертный вывод: Ошибка многих CEO — попытка купить «железо» до того, как подтвержден объем трафика. Сначала Cloud → затем Hybrid → только потом On-premise.
Вывод
Мой вердикт: забудьте о бинарном выборе. Для современного бизнеса оптимален путь «Cloud → Hybrid». Начинайте с API, переходите на аренду GPU для тюнинга моделей, а когда стоимость аренды превысит $10,000/мес стабильно в течение квартала — закупайте собственные узлы для базовой нагрузки. Избегайте полной зависимости от одного облачного провайдера и не инвестируйте в On-premise без расчета стоимости электроэнергии и охлаждения, так как эти скрытые расходы могут составить до 15% от стоимости сервера ежегодно.
