1 · Reference Voice (the voice to clone)

Tip: Use 5-15s clean audio. Transcript must be verbatim. Noisy/long clips reduce quality.

2 · Text to Speak

0 / 800

0.1 1.5
0.5 1
1 100
128 1024

3 · Result

Ready. Upload reference audio + transcript to start.

  • Model: Audio8/Audio8-TTS-Preview-0.1b - 170M Falcon H1 Slow+Fast AR + 120M codec (44.1kHz, 10 codebooks). Uses trust_remote_code=True.
  • Free hardware: ZeroGPU (shared A100, ~6s) is free but requires Public Space. If denied, switch frontmatter to cpu-basic (free, ~60s) — both $0.
  • Limits (free): 800 chars / request, 10MB audio, <20s ref. 1 job at a time (queue). Wavs are ephemeral in /tmp.
  • API: GET /api/health and POST /api/generate (multipart) are free — call from Vercel/other frontends.
  • License: Audio8 Community License v1.0 — free for <$2M revenue, needs separate license if ≥$2M. Get consent before cloning.
  • Deploy: Push this folder to huggingface.co/spaces/<you>/<name> — live in 2 mins on hf.space subdomain (free SSL).
Built for free deployment • API healthModel card