Новости
Бизнес Технологии Искусственный интеллект

В Японии разработали ИИ-систему J-Moshi для передачи особенностей разговорной речи

Разработка принадлежит сотрудникам Университета Нагоя, одного из ведущих национальных вузов Японии.
По словам специалистов Университета Нагоя, которые являются разработчиками системы, J-Moshi стала первой ИИ-моделью, которая создавалась для отображения специфики японской разговорной речи. ИИ-система распознает такие элементы как «айзути», небольшие фразы по типу «Sou desu ne» (верно), «Naruhodo» (понятно). С их помощью местные жители или иностранцы, которые говорят на уровне носителей языка, демонстрируют, что им интересна беседа. Реплики обозначают, что собеседника внимательно слушают и понимают то, о чем он/она говорит.
Стандартные ИИ-системы, которые работают в стране восходящего солнца, не способны понять разговорную речь, потому что они просто не запрограммированы на выполнение задачи. J-Moshi на этом фоне выделяется среди конкурентов, ведь пользователи могут разговаривать с ней как с живым человеком.
В качестве основы для проекта выступила англоязычная модель Moshi, разработанная в Kyutai. Разработчики уточнили, для адаптации к японскому разговорному языку понадобилось 4 месяца работы. Кодовая база, которую использовали при обучении J-Moshi, доступна на GitHub.
Разработчики считают, что их разработка представляет интерес не только для энтузиастов и лингвистов, но и тех, кто изучает японский язык: J-Moshi можно установить в колл-центры, медучреждения и другие организации, где ведется диалог с большим количеством людей.
Исследование J-Moshi будет представлено на конференции Interspeech, которая пройдет в августе в Роттердаме.
Авторы исследования планируют усовершенствовать модель. Цель заключается в том, чтобы J-Moshi не отличалась от реальных собеседников – пока еще заметно, что это модель искусственного интеллекта, а не живой человек.
Виджет комментариев ВК