Skip to main content
POST
Fish Audio TTS S2.1 Pro

Authorizations

Authorization
string
header
required

API key issued by SLNG. Pass as Authorization: Bearer <token>.

Headers

X-World-Part-Override
enum<string>

Target world part override. Auto-selected if not provided.

Available options:
eu

Body

Fish Audio TTS request. Shared by one-shot and streaming synthesis.

text
string
required

Text to synthesize. S2-family variants support multi-speaker dialogue markers.

Minimum string length: 1
reference_id
string

Fish Audio voice-model ID. For multi-speaker synthesis, provide one ID per speaker as an array.

references
object[]

Inline reference audio for voice cloning. MessagePack-only, as the entries carry binary audio.

prosody
object

Prosody controls.

temperature
number
default:0.7

Sampling temperature.

Required range: 0 <= x <= 1
top_p
number
default:0.7

Nucleus sampling probability mass.

Required range: 0 <= x <= 1
chunk_length
integer
default:300

Target chunk length for synthesis.

Required range: 100 <= x <= 300
normalize
boolean
default:true

Whether to normalize input text before synthesis.

format
enum<string>
default:mp3

Output audio format.

Available options:
wav,
pcm,
mp3,
opus
sample_rate
enum<integer> | null

Output sample rate in Hz. Defaults to the provider default for the chosen format when omitted.

Available options:
8000,
16000,
24000,
32000,
44100,
48000
mp3_bitrate
enum<integer>
default:128

MP3 bitrate in kbps (used when format is mp3).

Available options:
64,
128,
192
opus_bitrate
enum<integer>
default:-1000

Opus bitrate in bps (used when format is opus). -1000 selects the provider default.

Available options:
-1000,
24000,
32000,
48000,
64000
latency
enum<string>
default:normal

Latency/quality trade-off.

Available options:
low,
normal,
balanced
max_new_tokens
integer
default:1024

Maximum number of new tokens to generate.

repetition_penalty
number
default:1.2

Penalty applied to repeated tokens.

min_chunk_length
integer
default:50

Minimum chunk length for synthesis.

Required range: 0 <= x <= 100
condition_on_previous_chunks
boolean
default:true

Whether generation is conditioned on previously generated chunks.

early_stop_threshold
number
default:1

Early-stop threshold for generation.

Required range: 0 <= x <= 1
features
string[]

Optional feature flags.

Response

Synthesis successful. Returns binary audio in the format requested via format.

Binary audio data.