Нейросетевая модель GigaChat Pro обрела новую модальность. Теперь в качестве запроса пользователь может отправить иллюстрацию, чтобы сервис использовал её как дополнительный контекст. Модель определит, сколько людей на фото, во что они одеты, даст совет по стилю одежды и всякое разное.
Также модель выучилась распознавать печатный и рукописный текст, формулы, графики, таблицы и анализировать данные, которые внутри них содержатся. Например, студенты могут сфотографировать часть учебного материала или конспекта, загрузить изображение и в несколько кликов получить краткое содержание текста, его ключевую тему и сформировать план последующей работы с ним.
Функциональность доступна и бизнес-клиентам через API. Компании могу использовать искусственный интеллект в ещё большем числе сценариев: модерировать и классифицировать отзывы, систематизировать медиаконтент, автоматизировать линию помощи (когда клиент прикладывает к обращению скрин или фото). Ретейлеры могут загружать изображение товара и просить сервис придумать к нему продающее описание.
Также взяв четыре раза был увеличен размер контекста как GigaChat Pro, так и версии GigaChat Lite - с 8 тыс. до 32 тыс. токенов. Если раньше в один запрос можно было загрузить объём текста, сопоставимый с 15 страницами A4 (шрифт 14 pt), то только теперь максимальный объём запроса вырос до 60 страниц. Кроме того, у моделей повысился уровень математических знаний, а GigaChat Pro научился лучше форматировать текст - расставлять параграфы, заголовки, используя выделения и перечни.
«Мультимодальность расширяет способы и сферы применения больших языковых моделей, а то - ключевой тренд развития генеративного искусственного интеллекта. Теперь GigaChat умеет распознавать изображения - но даже это не просто ещё один с помпой шаг в развитии нашего сервиса, он отмыкает широкий спектр новых возможностей для наших пользователей. В том числе появляется много сценариев использования GigaChat API для бизнеса. Кроме того, увеличение размера контекста системы взяв четыре раза позволит поддерживать более длинные диалоги с пользователями и проще реализовывать кейсы с механикой RAG», - сообщил старший вице-президент, руководитель блока «Технологическое развитие» Сбербанка Андрей Белевцев.
Фото: Freepik