Стартап Voice AI Modulate привлек $25M для расширения доступа к аудио-ориентированным моделям

Компания Modulate Inc., специализирующаяся на голосовом искусственном интеллекте, объявила о привлечении $25 миллионов нового финансирования для расширения доступа к своим аудио-ориентированным моделям среди разработчиков.

Особенности аудио-ориентированных моделей

Модели Modulate работают с исходным аудиопотоком в реальном времени, анализируя эмоции, тон, намерения, а также выявляя признаки глубоких фейков (deepfake). Эти данные помогают распознавать попытки мошенничества, а также понимать, когда собеседник теряет терпение во взаимодействии с голосовым агентом. Многие виды анализа выполняются во время разговора, что обеспечивает оперативное реагирование.

Области применения технологий Modulate

  • Модерация голосового чата в онлайн-играх, что помогает бороться с домогательствами и защитой детей;
  • Защита социальных и игровых платформ от посягательств;
  • Использование в здравоохранении для выявления звонков с поддельным голосом сотрудников учреждений;
  • Контроль и анализ эффективности голосовых AI-агентов у новых клиентов.

Технологическая платформа Velma и архитектура Ensemble Listening Model

Все решения компании интегрированы в флагманскую платформу Velma. В основе лежит архитектура Ensemble Listening Model, которая объединяет результаты работы более 100 специализированных маленьких аудиомоделей для выполнения конкретных задач. Такой подход позволяет добиться эффективности, превышающей в 1000 раз работу одной большой модели, что значительно ускоряет обработку аудио.

Масштаб и достижения

Ежемесячно через модели Modulate обрабатывается более 10 миллионов часов аудиозаписей, а суммарный объем уже превысил 600 миллионов часов. В 2026 году два продукта компании заняли первые места на рейтингах Hugging Face:

  • Транскрипционная модель возглавила Open ASR Leaderboard в июле;
  • Velma Deepfake Detect, запущенная в марте, лидирует в Speech Deepfake Arena, достигая точности 98,9% по публичным тестовым данным.

Цитаты от руководства

«Голос становится основным интерфейсом для ИИ, и это порождает новые задачи, которые не решить, опираясь только на транскрипты», — отметил соучредитель и генеральный директор компании Картер Хаффман.

По его словам, разработчики не должны создавать слой аудиоинтеллекта с нуля при разработке каждого нового голосового сервиса. Часть привлеченного финансирования направлена именно на расширение доступа к технологиям Modulate через новые SDK и API, а также созданию моделей для специфичных отраслей.

Планы на будущее

  • Увеличение найма специалистов в области исследований, разработки и работы с разработчиками;
  • Расширение партнерских интеграций и способов внедрения моделей;
  • Продолжение поддержки API, который уже позволяет покупать пакетную транскрипцию по цене 3 цента за час.

Инвесторы и перспективы

Раунд финансирования возглавила компания Future Ventures, а также в нем приняли участие бывшие инвесторы Hyperplane и Lakestar. Ранее Hyperplane вложила $2 миллиона на стадии посева, а Lakestar возглавила раунд серии A на $30 миллионов в 2022 году. Соучредитель Future Ventures Стив Джурветсон отметил, что Modulate обладает значительным техническим превосходством в области аудио-ориентированного ИИ и что спрос на эту технологию растет далеко за пределами изначальной сферы применения, включая AI-агентов и системы безопасности.

История компании

Modulate была основана в 2017 году двумя выпускниками Массачусетского технологического института — Картером Хаффманом и Майком Паппасом. С учетом последнего раунда компания привлекла в общей сложности $60 миллионов инвестиций.

Заключение

Modulate представляет собой значимый пример того, как специализированные аудио-ориентированные модели искусственного интеллекта могут повысить безопасность и качество взаимодействия в самых разных областях — от онлайн-игр и социальных платформ до здравоохранения и голосовых ассистентов. Благодаря вложениям, технология будет доступна большему числу разработчиков, что позволит создавать более интеллектуальные и надежные голосовые интерфейсы, способные эффективно анализировать не только слова, но и эмоциональные и поведенческие особенности собеседников.




Прокомментировать в Телеграм: https://t.me/n8nhow

Подписаться на канал обучения n8n: https://t.me/n8ncoaching

Советы, обучающие курсы, компьютерная грамотность
Обзор конфиденциальности

На этом сайте используются файлы cookie, что позволяет нам обеспечить наилучшее качество обслуживания пользователей. Информация о файлах cookie хранится в вашем браузере и выполняет такие функции, как распознавание вас при возвращении на наш сайт и помощь нашей команде в понимании того, какие разделы сайта вы считаете наиболее интересными и полезными.