PB.NL
22:21:08
Vibe coding28 SEP 2026

Mijn eerste offline Stem

Van een pratende avatar naar een assistent die de deur niet uit gaat.

Mijn eerste offline Stem
AI Generated

Het begon met een gezicht, of beter diverse DMM gezichten die een voice verdienen.

Het plan: een pratende avatar op pb.nl. Een gezicht dat beweegt, een stem die antwoordt, een kennisbank met alles wat we doen.

Voor de stem en het gesprek kozen we ElevenLabs. Dat werkte meteen.
Eerst te zakelijk. Dan een reeks proefjes. stemmen oop vele manieren, vooral zonder accent" Bij variant vijf zei Peter: dit is top. Het gezicht kwam van LemonSlice. Eén foto erin v an onze dmm modellen, een pratend gezicht eruit. Het zag er goed uit. Maar het praatte met zijn eigen stem, niet echt....top. Onze stem kon er niet in. Voor de officiële koppeling waren extra diensten nodig, plus een server die altijd aan staat. En de credits gingen hard.
Peter: "Ik vind toch dat LemonSlice niet overtuigend is." Het gezicht viel af nu nog even af.

De vraag daarna

Kan dit ook zonder internet?
Geen API. Geen kosten per minuut. Niets dat de Mac verlaat. Dus via Pinocio en zelf trainen via lokale bestanden?
Een eigen stem. Een eigen persona. Een gezicht mag later.
Er staat een Mac mini op kantoor. M4 Pro, 64 GB geheugen. Die zou het moeten kunnen.

Wat er op die Mac kwam

Alles open, alles lokaal:

  • Pinokio installeert en start AI-apps met één klik.

  • Open WebUI geeft een chatscherm in de browser, met een belknop.

  • Ollama draait het taalmodel.

  • Gemma 4, 26 miljard parameters, is het brein.

  • Whisper verstaat wat je zegt.

  • Chatterbox spreekt het antwoord uit, in een gekloonde stem.

En een klein serverscript dat alles aan elkaar knoopt.

Een stem klonen

Chatterbox heeft zeventien seconden audio nodig. Daarmee kloont het een stem.
We kozen een stem die Peter online al goed vond, en gingen afstellen. Dertien genummerde proefjes.
Te zakelijk. En steeds dat Engels accent. Terug. Het Nederlandse model las "AI" als "ali". En "PB" als twee losse klanken. Nu schrijft de server ze eerst om naar "A I" en "Pee Bee". Dan gaat het goed.

Lone/Zappa

De assistent kreeg een naam: Lone/Zappa. Peter schreef haar persona zelf. Warm, rustig, en zonder diep accent.
Tijdens het testen kwamen er regels bij. Niet eerst hardop nadenken. Dat gaf seconden stilte, en soms helemaal geen antwoord. Niet herhalen wat Peter net zei. Zijn naam bijna nooit noemen. Ze praat toch alleen met hem. Na die regel: nul keer in acht antwoorden. En dan het deel dat je online niet krijgt. Een online assistent heeft de regels van het platform. Lokaal is er geen platform. De persona bepaalt alles. Dat is vrijheid. Het is ook jouw verantwoordelijkheid.

Twaalf tot achttien seconden

De stem. De standaardversie van Chatterbox was twee keer langzamer dan afspelen. De eerste zin kwam na vijf tot tien seconden. nOp MLX, Apple's eigen framework voor zijn chips, ging het beter. Maar nog steeds net te traag. De audio liep achter op de tekst. Hier zat Claude er ook naast. Die meldde eerst dat de stem twee keer sneller was dan realtime. Bij langere zinnen klopte dat niet. Pas na het meten viel het op. Toen vonden we de instelling die elke stap dubbel liet rekenen. Uitgezet. Nu is de stem 1,7 keer sneller dan afspelen. Peter hoorde geen verschil.
Verstaan. Whisper draaide standaard op de processor: vier tot vijf seconden per zin. Hetzelfde model op MLX doet het in een halve seconde.
Antwoorden. Ollama haalt een model na vijf minuten niets doen uit het geheugen. De volgende vraag moet dan wachten tot het weer geladen is. Nu blijft het model gewoon geladen.
De kleine dingen.
Zonder koptelefoon hoorde de microfoon Lone zelf. Ze antwoordde op haar eigen stem.
Bij stilte verzint Whisper soms tekst. In het log stonden sterretjes en Chinese tekens. Lone reageerde netjes: "Je bent weer even stil…" De server gooit die tekst nu weg.

Wat het niet is

Online klinkt de stem nog steeds rijker. Het reageert ook sneller.
En Lone/Zappa zit alleen op deze Mac. Op een website zetten kan niet, en was echt toffe test hoe snel je tot iets kan komen wat WEL al werkt.. Maar er gaat geen audio naar de cloud. Er loopt geen meter mee. En de regels zijn van ons.
Het gezicht bleek het minst belangrijke deel. Stem, tempo en persona maken het gesprek.

—
Claude & Peet

PerfectMoods Radio

Lounge & Chillout Music