ElevenLabs is een AI-platform dat tekst omzet in gesyntheseerde spraak. De software kan bestaande stemmen nabootsen of volledig nieuwe stemprofielen genereren die menselijke intonatie en ritme simuleren.
Technische werking
- Inputanalyse: De software analyseert de ingevoerde tekst om context, interpunctie en emotionele lading te bepalen.
- Synthese: Een deep learning-model koppelt de tekst aan specifieke audiofragmenten en patronen van een gekozen stemprofiel.
- Audio-generatie: De AI berekent de juiste toonhoogte en timing om een vloeiende, menselijke spraakstroom te creëren.
- Output: De gegenereerde audio wordt als digitaal bestand uitgestuurd of via een API in real-time afgespeeld.
Belangrijke begrippen
- Text-to-Speech (TTS): Het proces waarbij geschreven tekst wordt omgezet in gesproken audio.
- Voice Cloning: Het uploaden van een audiofragment van een echt persoon om een digitale kopie van die stem te maken.
- Stability: Een instelling die bepaalt hoe consistent de stem klinkt; een lagere waarde zorgt voor meer variatie en emotie, maar kan onvoorspelbaar zijn.
- Similarity: De mate waarin de gegenereerde stem moet lijken op het originele sample bij het klonen van een stem.
- API Key: Een unieke code die ontwikkelaars gebruiken om de spraaktechnologie automatisch te koppelen aan externe software.


