class=”ArticleImagestyles__ImageWrapper-sc-lvd8v9-0 cWMVnY”>

OpenAI та Alibaba представили нові AI-моделі для розпізнавання мовленняOpenAI анонсувала дві нові версії для перетворення мови на текст — GPT-Live-Transcribe та GPT-Transcribe. Перша розроблена для функціонування в режимі реального часу з мінімальною затримкою, тоді як друга оптимізована для обробки записаних аудіоматеріалів та пакетної транскрипції. Обидва рішення отримали покращене розуміння контексту, що забезпечує точніше розпізнавання специфічної термінології, імен власних та різноманітних мов.Про це повідомляє neowin.net.
OpenAI оновила моделі для транскрипції
Згідно з даними OpenAI, використання контексту істотно підвищує якість транскрипції. Компанія також заявляє про нижчий відсоток помилок порівняно з попередніми версіями Whisper. Незалежне тестування від Artificial Analysis підтвердило високу точність GPT-Transcribe, а вартість використання цієї моделі становить 4,5 долара за 1000 хвилин аудіо.
Alibaba представила нові голосові моделі
Паралельно Alibaba продемонструвала нові версії Qwen-Audio-3.0-Realtime Plus та Flash, які функціонують у форматі «мова — мова». Вони підтримують природний діалог у реальному часі, дозволяють користувачеві перебивати штучний інтелект під час його відповіді, а також забезпечують виклик функцій та створення персоналізованих копій голосу.Згідно з рейтингом Artificial Analysis, модель Qwen-Audio-3.0-Realtime Plus наразі перевершує рішення OpenAI за якістю взаємодії «мова — мова», отримавши 84,1% порівняно з 79,1% у GPT-Realtime-2.1 High. Однак модель Alibaba поступається за швидкістю: її відповідь починається приблизно через чотири секунди, тоді як рішення OpenAI реагує трохи більше ніж за одну секунду.За матеріалами: iTechua# Чат бот# OpenAI# ChatGPTМісце для вашої реклами
