Принципы построения продукта на основе генеративных нейросетевых моделей
(Стр. 142-153)
Подробнее об авторах
Романов Михаил Владиславович
Московский физико-технический институт (национальный исследовательский университет)
г. Долгопрудный, Российская Федерация Лопатин Владимир Андреевич
Московский физико-технический институт (национальный исследовательский университет), г. Долгопрудный, Российская Федерация Кривцов Валерий Евгеньевич кандидат физико-математических наук, доцент; Московский физико-технический институт (национальный исследовательский университет); г. Долгопрудный, Российская Федерация
Московский физико-технический институт (национальный исследовательский университет)
г. Долгопрудный, Российская Федерация Лопатин Владимир Андреевич
Московский физико-технический институт (национальный исследовательский университет), г. Долгопрудный, Российская Федерация Кривцов Валерий Евгеньевич кандидат физико-математических наук, доцент; Московский физико-технический институт (национальный исследовательский университет); г. Долгопрудный, Российская Федерация
Аннотация:
Доступность генеративных моделей через облачные API снизила порог входа в разработку продуктов на их основе, однако не сняла инженерной проблемы: сама по себе возможность подключить генеративную модель не гарантирует, что вокруг нее удастся построить работоспособный, масштабируемый и устойчивый к деградации продукт. В статье систематизированы принципы построения такого продукта – от выбора и комбинирования генеративных моделей и архитектуры многоплатформенной доставки до методологии проверки технических гипотез и метрик качества генерации. На кейсе мультиплатформенного сервиса генерации персонализированного визуального контента показано, как последовательная проверка технологических гипотез – переход от точечной подмены изображения к управляемой генерации на основе дообученной диффузионной модели, автоматическое обогащение пользовательских запросов, реализация функции генерации по визуальному образцу, оптимизация вычислений и кроссплатформенная архитектура – обеспечивает переход от прототипа к продукту, устойчиво работающему при кратном росте нагрузки. Отдельно рассмотрены принципы обеспечения качества генеративного вывода, масштабирования технической инфраструктуры и снижения рисков, специфичных для продуктов на основе генеративного ИИ: зависимости от поставщика модели, деградации качества при росте нагрузки и уязвимости фиксированной модели ценообразования к колебаниям стоимости инференса.
Образец цитирования:
ОБРАЗЕЦ ЦИТИРОВАНИЯ: Романов М.В., Лопатин В.А., Кривцов В.Е. Принципы построения продукта на основе генеративных нейросетевых моделей // Computational Nanotechnology. 2026. Т. 13. № 2. С. 142-153. DOI: 10.33693/2313-223X-2026-13-2-142-153. EDN: XZRAUU
Список литературы:
Романов М.В., Лопатин В.А. Дешевое производство, дорогое внимание: экономика инноваций и диффузия генеративного искусственного интеллекта на рынке персонализированного визуального контента // Креативная экономика. 2026. Т. 20. № 7. С. 1523–1540.
Bai J., Bai S., Chu Y. et al. Qwen technical report // arXiv. 2023. DOI: 10.48550/arXiv.2309.16609
Hessel J., Holtzman A., Forbes M. et al. CLIPScore: A reference-free metric for image captioning evaluation // Proceedings of the Conference on Empirical Methods in Natural Language Processing (EMNLP). 2021. Pp. 7514–7528. DOI: 10.18653/v1/2021.emnlp-main.595.
Ho J., Jain A., Abbeel P. Denoising diffusion probabilistic models // Advances in Neural Information Processing Systems 33 (NeurIPS 2020). DOI: 10.48550/arXiv.2006.11239.
Hu E.J., Shen Y., Wallis P. et al. LoRA: Low-rank adaptation of large language models // Proceedings of the International Conference on Learning Representations (ICLR). 2022. DOI: 10.48550/arXiv.2106.09685.
Radford A., Kim J.W., Hallacy C. et al. Learning transferable visual models from natural language supervision // Proceedings of the International Conference on Machine Learning (ICML). 2021. Vol. 139. Pp. 8748–8763. DOI: 10.48550/arXiv.2103.00020.
Sculley D., Holt G., Golovin D. et al. Hidden technical debt in machine learning systems // Advances in Neural Information Processing Systems (NeurIPS). 2015. Vol. 28. Pp. 2503–2511. DOI: 10.48550/arXiv.1512.04155.
Wang L., Xing X., Cheng Y. et al. PromptEnhancer: A simple approach to enhance text-to-image models via chain-of-thought prompt rewriting // arXiv preprint. 2025. DOI: 10.48550/arXiv.2509.04545.
Bai J., Bai S., Chu Y. et al. Qwen technical report // arXiv. 2023. DOI: 10.48550/arXiv.2309.16609
Hessel J., Holtzman A., Forbes M. et al. CLIPScore: A reference-free metric for image captioning evaluation // Proceedings of the Conference on Empirical Methods in Natural Language Processing (EMNLP). 2021. Pp. 7514–7528. DOI: 10.18653/v1/2021.emnlp-main.595.
Ho J., Jain A., Abbeel P. Denoising diffusion probabilistic models // Advances in Neural Information Processing Systems 33 (NeurIPS 2020). DOI: 10.48550/arXiv.2006.11239.
Hu E.J., Shen Y., Wallis P. et al. LoRA: Low-rank adaptation of large language models // Proceedings of the International Conference on Learning Representations (ICLR). 2022. DOI: 10.48550/arXiv.2106.09685.
Radford A., Kim J.W., Hallacy C. et al. Learning transferable visual models from natural language supervision // Proceedings of the International Conference on Machine Learning (ICML). 2021. Vol. 139. Pp. 8748–8763. DOI: 10.48550/arXiv.2103.00020.
Sculley D., Holt G., Golovin D. et al. Hidden technical debt in machine learning systems // Advances in Neural Information Processing Systems (NeurIPS). 2015. Vol. 28. Pp. 2503–2511. DOI: 10.48550/arXiv.1512.04155.
Wang L., Xing X., Cheng Y. et al. PromptEnhancer: A simple approach to enhance text-to-image models via chain-of-thought prompt rewriting // arXiv preprint. 2025. DOI: 10.48550/arXiv.2509.04545.
Ключевые слова:
генеративный искусственный интеллект, диффузионные модели, программная инженерия, LoRA, MLOps, промпт-инжиниринг, генерация изображений, масштабирование программных систем, оценка качества генерации.