Все ноды/AI/Media (Speech / Image / Video)

Текст → Речь

Синтезирует речь (аудиофайл) из текста (TTS). Голос/формат — параметры выбранной модели из медиа-каталога.

Текст → РечьT
TextAudio
As Tool

Тип в графе: text_to_speech

ToolExec

Можно включить ветку ошибки (expose_error_output) и обработать сбой отдельным путём.

Порты можно разделить на исполнение и данные (split ports).

Как попробовать

Минимальный рабочий воркфлоу

Вход
Текст → РечьT
Выход
  • Исполнение + данные
Нажмите «Скопировать ноды», откройте редактор и нажмите Ctrl+V на холсте.

Перед запуском выберите своё подключение или базу знаний — в графе стоит REPLACE_ME.

Как применять

Нода озвучивает текст и отдаёт аудиофайл. Обратная задача — у Речь → Текст. Как и Генерация изображения, она работает в двух ролях: ребро из порта Audio делает её обычным шагом графа, ребро из порта tool_out в порт Extensions ИИ-агента — инструментом, который модель зовёт сама, когда решит ответить голосом.

Как это работает

Голос, формат и скорость — это параметры выбранной модели, а не поля ноды: они приходят из медиа-каталога и появляются в форме после выбора модели. Голос у большинства вендоров обязателен, поэтому каталог заранее подставляет первый доступный.

Формат бывает pcm и mp3, и часть моделей принимает только mp3 — для них правильное значение уже проставлено. Сырой PCM приходит без контейнера, поэтому платформа определяет настоящий формат по самим байтам и при необходимости заворачивает звук в WAV: файл, который доедет до чата, открывается плеером.

Текстового поля у ноды нет. На пути графа текст приходит только с порта Text; в роли инструмента — из аргументов модели. Выход Audio — ровно один файл, сохранённый в хранилище воркспейса.

Ход работы инструмента можно показать в чате: переключатель «Показывать ход работы в Catch» шлёт строки «загружаю / готово» в подключённую ноду Перехват вызова инструмента.

Частые ошибки

  • Ищут в форме поле «Текст». Его нет: пустой вход — это ошибка ноды, а не тихий пропуск.
  • Ребро AudioFiles у Выхода. Порт Files принимает только чистые данные. Включите «Разделить выходные порты» и ведите ребро из audio_data.
  • Меняют модель и ждут, что голос переедет. Имена голосов у вендоров разные, значение от прежней модели не отправляется — и вы услышите голос по умолчанию либо получите отказ провайдера.
  • Переключают формат ради проигрывания. Контейнер определяется по ответу провайдера; pcm и mp3 — это то, что просят у него, а не то, что получит слушатель.
  • Гонят в озвучку весь ответ модели целиком. Плата берётся за вызов, но время синтеза и размер файла растут вместе с текстом — режьте длинные ответы до ноды.

Входы

ПортПроводДанныеПримечания
TexttextИсполнение + данныеexecute_datastring

показывается, когда operation_mode ≠ "as_tool"

Выходы

ПортПроводДанныеПримечания
AudioaudioИсполнение + данныеexecute_datafile

показывается, когда operation_mode ≠ "as_tool"

As Tooltool_outРасширениеlink_extension

показывается, когда operation_mode ≠ "executable"

Настройки

ПолеТипПо умолчаниюОписание
Режим нодыoperation_modestringexecutable

«Шаг графа» — обычный узел с портами Run/Success. «Инструмент» — расширение, которое AI Agent вызывает сам: виден только порт tool_out, и решает, когда запускать, модель.

Варианты: executable — Шаг графа, as_tool — Инструмент

Модельmodelstringopenrouter/google/gemini-3.1-flash-tts-preview

Модель синтеза речи из медиа-каталога (например, 'openrouter/openai/gpt-4o-mini-tts-2025-12-15'). Её собственные параметры (голос, формат аудио, скорость) появляются ниже после выбора модели.

Варианты: openrouter/google/gemini-3.1-flash-tts-preview — OpenRouter / Google: Gemini 3.1 Flash TTS Preview, openrouter/fish-audio/s1 — OpenRouter / Fish Audio: S1, openrouter/fish-audio/s2-pro — OpenRouter / Fish Audio: S2 Pro, openrouter/fish-audio/s2.1-pro-free:free — OpenRouter / Fish Audio: S2.1 Pro Free (free), openrouter/fish-audio/s2.1-pro — OpenRouter / Fish Audio: S2.1 Pro, openrouter/microsoft/mai-voice-2-flash — OpenRouter / Microsoft: MAI-Voice-2-Flash, openrouter/qwen/qwen-audio-3.0-tts-flash — OpenRouter / Qwen: Qwen-Audio-3.0-TTS Flash, openrouter/qwen/qwen-audio-3.0-tts-plus — OpenRouter / Qwen: Qwen-Audio-3.0-TTS Plus, openrouter/deepgram/aura-2 — OpenRouter / Deepgram: Aura-2, openrouter/minimax/speech-2.8-hd — OpenRouter / MiniMax: Speech 2.8 HD, openrouter/minimax/speech-2.8-turbo — OpenRouter / MiniMax: Speech 2.8 Turbo, openrouter/microsoft/mai-voice-2 — OpenRouter / Microsoft: MAI-Voice-2, openrouter/x-ai/grok-voice-tts-1.0 — OpenRouter / xAI: Grok Voice TTS 1.0, openrouter/zyphra/zonos-v0.1-hybrid — OpenRouter / Zyphra: Zonos v0.1 Hybrid, openrouter/canopylabs/orpheus-3b-0.1-ft — OpenRouter / Canopy Labs: Orpheus 3B, openrouter/sesame/csm-1b — OpenRouter / Sesame: CSM 1B, openrouter/hexgrad/kokoro-82m — OpenRouter / hexgrad: Kokoro 82M, openrouter/mistralai/voxtral-mini-tts-2603 — OpenRouter / Mistral: Voxtral Mini TTS

Дополнительно
Показывать результат моделиshow_result_to_modelbooleanfalse

Вставить сгенерированный файл в диалог сразу после результата инструмента, чтобы модель услышала, что получилось, и могла доработать это следующим кругом. По умолчанию выключено: вставленный файл стоит входных токенов при каждой генерации.

показывается при operation_mode = as_tool

Показывать ход работы в Catchstream_progress_in_catchbooleantrue

Отправлять строки загрузки/успеха этого инструмента в подключённую ноду catch_tool_call.

показывается при operation_mode = as_tool

ID подключенияconnection_idstring""

Необязательный коннект воркспейса со своим ключом провайдера (BYO). Пусто = ключ платформы из окружения.

подключение: openrouter

Общие поля

Эти три поля есть у каждой ноды: платформа добавляет их сама, а не автор ноды.

  • expose_error_output — Если включено, показывает выход выполнения для подключения нод, которые запускаются при сбое этого шага.
  • split_ports_in — Показывать отдельные порты входа для выполнения и данных вместо одного объединённого.
  • split_ports_out — Показывать отдельные порты выхода для выполнения и данных вместо одного объединённого.