Опытами и тестированием генеративных моделей занимаются и российские компании. Свой вариант такой нейросети представил «Сбербанк». Нейросеть Kandinsky 2.1 генерирует изображения по описанию на русском и других языках. С 4 апреля модель доступна для ознакомления на специальном демонстрационном сайте.
Kandinsky 2.1 является отечественным аналогом популярного алгоритма Midjourney. Генеративная модель может использоваться для создания высококачественных изображений на основе текстового описания, дорисовки картинок и др.
Новый алгоритм оснащён самой современной моделью автоэнкодера, используемой помимо прочего в качестве декодера векторных представлений изображений. За счёт этого удалось кардинально улучшить генерацию изображений в высоком разрешении. Модель Kandinsky 2.1 содержит 3,3 млрд параметров, что значительно больше по сравнению с 2 млрд параметров модели Kandinsky 2.0. Алгоритм использует закодированное текстовое описание и специальное представление изображения моделью CLIP. Он способен визуализировать любой контент и может применяться в разных отраслях.
Модель Kandinsky 2.1 является усовершенствованной версией предыдущей версии алгоритма. Она была дополнительно обучена на 170 млн пар «текст — изображение» высокого разрешения. В дополнение к этому алгоритм дополнительно обучался на отдельном датасете из двух миллионов пар качественных изображений. Этот датасет состоял из изображений с описаниями в сложных для нейросетей областях, таких как тексты и лица людей.
Разработкой и обучением алгоритма занимались специалисты Sber AI совместно с учёными из Института искусственного интеллекта AIRI, задействовав для этого объединённый датасет Sber AI и SberDevices.
«Новая генеративная модель "Сбера" — Kandinsky 2.1 — способна всего за несколько секунд создавать высококачественные изображения по текстовому описанию на естественном языке. Она также может смешивать несколько рисунков, изменять их по текстовому описанию, генерировать изображения, похожие на заданное, дорисовывать недостающие части картинки и формировать изображения в режиме бесконечного полотна (inpainting/outpainting). Модель понимает запросы на 101 языке (включая русский и английский) и умеет рисовать в различных стилях», — заявили представители «Сбербанка».
Пользователи могут оценить возможности Kandinsky 2.1 на промо-странице, а также воспользовавшись командой «Запусти художника» на устройствах Sber, в мобильном приложении «Салют» и на платформе ML Space. Ещё нейросеть доступна через бота в Telegram.