Чтение ответов помощника вслух через бесплатный Edge TTS или ваши собственные модели голоса RVC: кнопки чтения вслух + автоматическое чтение, адаптивное фрагментированное прогрессивное воспроизведение (длинное чтение без пауз), установка голосового пакета одним щелчком мыши из реестра и портативная среда выполнения RVC.
Голос и аудио
Синтез и распознавание речи, голосовое управление агентом и аудио-инструменты.
Плагин голосового ввода для DeepSeek Harness (dsh): кнопка микрофона в композиторе превращает речь в черновой вариант стенограммы с возможностью выбора серверной части распознавания речи, дополнительной доработкой с помощью собственных маршрутов LLM dsh и собственной страницей настроек.
Голосовое объявление окончательного ответа в Windows (естественный голос SAPI5) и macOS (системный голос); пропускает рассуждения и вызовы инструментов, установка npm в одну строку.
Микрофон Composer для веб-интерфейса: транскрипция в реальном времени и удержание для разговора с помощью касания, считывание ответа TTS хоста Edge, который передается в потоковом режиме во время генерации модели, эхо-пауза во время чтения и остановка касанием.
Голосовой ввод для DeepSeek Harness: говорите в микрофон, и распознанный текст отправляется как обычное сообщение чата с помощью локального распознавания речи или браузера.
Звонит на ваш телефон через CallKit: инструменты `call_me` и `text_me`, а также дополнительные звонки для завершения и подтверждения, устный ответ на которые записывается обратно в сеанс.
Кнопка микрофона в строке инструментов композитора: преобразование речи в текст Web Speech API (Chrome/Edge), переключение языка и дополнительная автоматическая отправка, нулевые зависимости.
Многоуровневые звуковые уведомления в стиле Perlica (Arknights: Endfield): сигналы готовности плана, выполнения задачи, сигнала необходимости ввода и сигнала ошибки; бесшумный режим для обычного чата, воспроизведение на уровне системы (работает в фоновом режиме), кроссплатформенность (Windows/macOS/Linux), пользовательские звуки TTS.
Уведомляет вас об окончании разговора: воспроизводит звук и показывает уведомление Windows, когда агент бездействует (настраиваемый звуковой файл, громкость, подавление дребезга/регулирование).
Полнодуплексный голосовой режим для веб-интерфейса: диктовка при нажатии для переключения или удержании для разговора (клавиша отправки или `Ctrl`) с живыми субтитрами, SenseVoice ASR на стороне хоста через sherpa-onnx, голосовые ответы по предложению, а также произнесение прерываний воспроизведения и текущего поворота (настоящее вмешательство). Нет ключа API.
Звуковые уведомления о каждом событии: завершение хода, одобрение, вопрос, обзор плана, блокировка цели и провал задачи — каждое имеет свой собственный звук и громкость, настраиваемые в веб-интерфейсе (встроенный синтезатор, отключение звука или локальный аудиофайл).
Исходящие уведомления: агент заранее уведомляет с помощью тоста / китайского голоса TTS / звуковых эффектов (взрыв, победа, сигнал тревоги), голосового перезвона в окне подтверждения в течение 60 секунд, увеличения громкости, панели настроек.
Голосовые заметки, голосовые ответы: диктуйте аудио, которое становится пользовательским сообщением (расшифровка), попросите агента читать ответы вслух (проговаривайте), сначала локально, в ~/.dsh/voice.
Мелодии завершения для каждого рабочего пространства, а также звуки внимания для событий одобрения, вопроса, проверки плана, блокировки цели и неудачи задачи, со встроенным синтезатором, голосом (TTS) и настраиваемым звуком.
Голосовой ввод с микрофона для композитора: живая транскрипция API веб-речи браузера, дедупликация/автопродолжение, интеллектуальная пунктуация, язык и настройки автоматической отправки.
Звуковые эффекты семантического пользовательского интерфейса на базе uisfx: запуск/успех/неудача задачи и сигналы для каждой кнопки, пользовательский интерфейс настроек с мгновенным предварительным просмотром, 12 звуковых пакетов, настройки, сохраняемые хостом, и сервис `ctx.uisfx` для других плагинов.
Голосовой ввод речи в текст для веб-интерфейса: кнопка микрофона в композиторе транскрибирует речь в черновик через браузер Web Speech API (нулевая конфигурация) или OpenAI-совместимый Whisper API (OpenAI/Groq) с возможностью выбора модели и языка в настройках.
Голосовой AI-подруга для веб-интерфейса: микрофонный ввод FunASR, голосовые ответы Qwen3-TTS, окно сопутствующей анимации и двусторонний чат QQ (текст/голос/изображение) через NapCat.
Бесплатный голосовой замкнутый контур для веб-интерфейса: вход микрофона для распознавания речи в браузере с промежуточными результатами в реальном времени, а также кнопки громкоговорителя и автоматическое считывание ответов помощника, нулевая настройка и ключ API.
Чтение ответов помощника вслух только через Fish Audio API (принесите свой собственный ключ): чтение вслух каждого сообщения, переключение автоматического чтения и страница настроек для модели, голосового reference_id, зашифрованного ключа API и прокси.
Голосовой ввод для веб-интерфейса: кнопка микрофона, которая управляет локальным автономным распознаванием речи VocoType и автоматически вставляет распознанный текст в композитор (автоматическое развертывание, дедупликация, непрерывная диктовка).
Голосовые вызовы, инициированные агентом: `offer_call` звонит человеку (接听/拒接/稍后再说); принятые вызовы синтезируются и воспроизводятся локально через CrispASR + Qwen3-TTS (9 динамиков, 2 китайских диалекта), отклоненные вызовы возвращают решение агенту.
Добавляет элементы управления преобразованием текста в речь Xiaomi MiMo для окончательных сообщений помощника с предустановленными голосами и индивидуальным голосовым оформлением.
Голосовые инструменты: бесплатный нейронный синтез речи Edge-TTS, транскрипция ASR, совместимая с OpenAI, список голосов, пакетный предварительный просмотр голоса и самопроверка состояния.
Голосовой ввод через API веб-речи браузера: отсутствие сервера, отсутствие ключей, отсутствие загрузки моделей (Edge = Azure, Chrome = речь Google).
Полнодуплексный голосовой режим для веб-интерфейса DeepSeek Harness: переключение (автоматическая отправка с паузой в 2 секунды) или диктовка с удержанием в режиме разговора в редактируемый черновик с потоковой передачей ASR zipformer2, дополнительным словом пробуждения; Edge TTS читает предложение за предложением вслух с живыми субтитрами, а разговор прерывает воспроизведение и текущий поворот (настоящее вмешательство). ASR на устройстве, без ключа API.
Звуковые напоминания с переходом одним щелчком мыши для одновременных сеансов: текущий сеанс получает четкие звуки «дань/дань-динь», другие сеансы – тихий «динь/динь-динь», а также карточка в правом верхнем углу, которая сразу переходит к отвечающему разговору.
Голосовой ввод для веб-интерфейса: кнопка микрофона в композиторе, которая транскрибирует речь в черновик через API веб-речи с дополнительным переключателем автоматической отправки.
Голосовой ввод композитора, готовый к использованию в Китае. Требуется локальный мост Python (pip install Dashscope Websockets, запустить Bridge/voice-bridge.py) — плагин сам по себе не работает. Микрофон браузера передает поток PCM с частотой 16 кГц на мост, на котором работает Alibaba Cloud DashScope ASR (paraformer-realtime-v2); промежуточный текст заполняет черновик рядом с курсором, автоматическая остановка без звука, дополнительная автоматическая отправка.
Дуплексная передача голоса в реальном времени через потоковую передачу Volcengine ASR/TTS: повествование в ответе агента, вторжение, слово для пробуждения, живые субтитры, 30 китайских голосов и подтверждение ответа в первую очередь; строится в монорепозитории DSH.
Голосовой ввод для веб-интерфейса: диктовка, разбитая на паузы и голосовые сообщения, каждое из которых имеет собственную резервную цепочку поставщика (Deepgram, Groq, HuggingFace, локальный шепот.cpp или конечную точку, совместимую с OpenAI).
Слушайте подкасты и аудиокниги Ximalaya через веб-интерфейс DSH: ищите альбомы, просматривайте треки с разбивкой по страницам и воспроизводите их с помощью панели текущего воспроизведения (предыдущий/воспроизведение/следующий, поиск, громкость, скорость). После входа в систему с помощью QR на странице «Моя» отображаются ваши понравившиеся треки (нажмите, чтобы воспроизвести), альбомы, на которые вы подписались, с подсказками по последним выпускам, а также следящие за ними якоря с их общедоступными альбомами; хост ретранслирует аудиопотоки с поддержкой Range и регистрирует инструмент ximalaya_play, чтобы агент мог осуществлять поиск и воспроизведение по запросу.
Голосовой ввод для веб-интерфейса: нажмите Alt (или Alt+Пробел), чтобы запустить/остановить диктовку, веб-речь браузера (нулевая конфигурация) или облачное ASR, совместимое с OpenAI, дополнительная полировка через LLM, настроенный DSH, пользовательский интерфейс настроек.
Агент голосового интерфейса для dsh: говорите естественно через ByteDance Duplex, делегируйте запросы фоновым задачам и слушайте их асинхронные результаты, сообщаемые голосом.
Транскрипция видео с субтитрами с экспортом SRT, возможностью отмены элементов управления заданиями и резервным вариантом big-v3 с более быстрым шепотом, когда субтитры недоступны.