USD
Доллар США
80,93
-0.25 %
EUR
Евро
93,19
-0.42 %
CNY
Китайский Юань
11,97
0.01 %
GBP
Фунт стерлингов
108,83
-0.17 %

ИИ-помощник ГигаЧат распознает эмоции и находит ключевые моменты в аудио

Общество

Новая модель GigaChat Audio доступна в ИИ-помощнике ГигаЧат и в Open Source для свободного использования разработчиками по всему миру. Об этом сообщает пресс-служба Сбера.

Пользователям ИИ-помощника ГигаЧат стала доступна обновленная нейросеть GigaChat Audio — большая языковая модель, которая способна обрабатывать аудиофайлы и голосовые сообщения без предварительного преобразования речи в текст. Искусственный интеллект научился понимать интонацию пользователя и получил расширенные возможности по обработке звуковой информации.

Старший вице-президент, руководитель блока «Развитие генеративного ИИ» Сбербанка Антон Фролов отметил, что голос остается самым естественным каналом взаимодействия с технологией, но при этом и самым сложным: даже малейшая погрешность в распознавании или неверно интерпретированная эмоция моментально подрывают доверие к ассистенту.

«Поэтому мы считаем аудио точкой роста для рынка ИИ-помощников. Запуская эти модели в открытый доступ, мы даем мощный инструмент разработчикам и ученым. От синхронного голосового перевода до сервисов для людей с нарушениями речи — спектр применений у голосовых технологий очень широкий. А мультиязычность и возможность легкого обучения другим языкам открывает для них и международные перспективы», — подчеркнул Фролов.