Gids

Gemini 3.8 Live: goedkoop praten, duur doen

Even horen hoe je script klinkt?

Plak je tekst in de stemgenerator. Je ziet eerst welke cijfers, bedragen en afkortingen fout zouden gaan, daarna hoor je het resultaat.

Stem maken
Een ontwikkelaar aan een keukentafel praat in een headset en kijkt naar een laptop, naast hem luistert een collega met een notitieblok

Je belt je energieleverancier. “Zeg in een paar woorden waarom u belt.” Je zegt het. “Ik heb u niet goed verstaan.” Bij de derde poging druk je op nul en wacht je zeven minuten op een mens. Dat menu is precies het product dat Google vanavond wil vervangen, en voor het eerst hangt er een prijs aan die een klein bedrijf kan betalen.

Google zette op 15 september twee nieuwe spraakmodellen in de Gemini API: Gemini 3.8 Live en Gemini 3.8 Live Extended Thinking. Het zijn speech-to-speech-modellen. Ze luisteren naar audio en praten terug, zonder dat er eerst een tekstmodel en daarna een aparte stem tussen zit. Logan Kilpatrick van Google noemde ze op X “onze nieuwe SOTA live-audiomodellen”, met 97 talen, wisselen midden in een gesprek, en toolaanroepen die op de achtergrond doorlopen terwijl het model blijft praten.

Drie tiende dollar per uur luisteren

De prijspagina van Google rekent 0,005 dollar per minuut binnenkomende audio en 0,018 dollar per minuut uitgaande audio. Dat is 30 dollarcent per uur luisteren en 1,08 dollar per uur praten. Beide modellen kosten hetzelfde per minuut. Het verschil zit in wat ze in die minuut doen: Extended Thinking denkt langer na en verbruikt daardoor meer, wat je terugziet in de meting hieronder.

Een rekenvoorbeeld. Een telefoongesprek van tien minuten waarin de beller en het model elk ongeveer de helft van de tijd aan het woord zijn, kost dan grofweg 2,5 cent voor het luisteren en 9 cent voor het praten. Ruim 11 dollarcent per gesprek, zonder de tekstprompt en zonder wat je systeem er verder omheen draait. Dat is een schatting op de tarieven van vandaag, geen factuur.

Staafdiagram van Artificial Analysis: kosten per uur invoeraudio, Gemini 3.8 Live 0,84 dollar, Gemini 3.8 Live Extended Thinking 3,50 dollar, Grok Voice 4,80 dollar, GPT-Live-1 5,83 dollar
Kosten per uur invoeraudio op een vaste testset, gemeten door Artificial Analysis. Google deelde deze grafiek bij de aankondiging.

Onafhankelijk meetbureau Artificial Analysis draaide een vaste testset door alle modellen en telde wat dat kostte. Gemini 3.8 Live kwam uit op 0,84 dollar per uur invoeraudio, de goedkoopste van alle gemeten modellen. GPT-Live-1 van OpenAI kostte 5,83 dollar, Grok Voice van xAI 4,80 dollar. Let op wat dat getal niet zegt: het gaat om een specifieke werklast met veel redeneervragen, niet om een gewoon gesprek. Jouw rekening hangt af van hoeveel het model praat.

De goedkope variant praat beter en werkt slechter dan zijn voorganger

Hier zit de adder. Op de Speech to Speech Index van Artificial Analysis, die kwaliteit van begrip en antwoord meet, scoort Gemini 3.8 Live Extended Thinking 82,6 procent en staat het bovenaan. GPT-Live-1 volgt met 81,5 en Grok Voice Think Fast 2.0 met 81,3. Dat is een voorsprong van iets meer dan één punt, geen gapend gat. Het gewone 3.8 Live haalt 76,0, tegenover 71,5 voor het vorige model Gemini 3.1 Flash Live.

Maar kijk naar τ-Voice, de test waarin het model tijdens het gesprek echt iets moet regelen: een boeking wijzigen, een bestelling opzoeken, de juiste vervolgstap kiezen. Daar haalt Extended Thinking 68,6 procent. Het gewone 3.8 Live haalt 30,1 procent. Dat is lager dan de 37,7 procent van de voorganger 3.1 Flash Live. Het goedkope nieuwe model is dus beter in praten en slechter in doen. Wie een spraakbot bouwt die alleen antwoordt op vragen, kan met het goedkope model uit de voeten. Wie iets wil laten uitvoeren, heeft de dure variant nodig, en die kost in de meting van Artificial Analysis ruim vier keer zoveel per uur.

Google zet in de aankondiging de vier grafieken naast elkaar waarop het wint. Wat er niet in staat: op de reactiesnelheid, de tijd tot het eerste geluid, meet Artificial Analysis 1,18 seconden voor 3.8 Live en 1,35 seconden voor Extended Thinking. Grok Voice doet het in 0,70 seconden. In een telefoongesprek merk je een halve seconde stilte.

Zoeken terwijl het praat, en wisselen midden in een zin

Twee dingen vallen op. Ten eerste de asynchrone toolaanroep. Vraagt de beller om zijn bestelling op te zoeken, dan doet het model die zoekopdracht op de achtergrond en blijft het ondertussen praten. Geen wachtmuziek, geen “een ogenblik”. Bij Extended Thinking is dit zelfs de enige modus; het model kan daar niet meer stil vallen om een tool af te wachten. OpenAI kan dit sinds vorige week ook met GPT-Live-1, maar lost het anders op: dat model geeft het denkwerk door aan een apart model op de achtergrond, dat je apart betaalt. Google doet het in één model en op één rekening.

Ten tweede de 97 talen met wisselen midden in een zin. Voor Nederland is dat relevanter dan het klinkt: veel bellers schakelen tussen Nederlands en Engels, of spreken Nederlands met een accent dat oudere spraakherkenning niet aankon. Google belooft daarnaast “alfanumerieke precisie”, dus postcodes, ordernummers en bevestigingscodes goed verstaan. Dat is precies waar het huidige telefoonmenu de mist ingaat. Of het klopt voor Nederlandse postcodes met letters erin, hebben we nog niet kunnen testen.

Wie al op Gemini 3.1 Flash Live bouwde, moet de modeldocumentatie lezen voor hij overstapt. De instelling voor emotionele dialoog is verwijderd en geeft nu een foutmelding, proactieve audio staat altijd aan, en videobeelden tellen standaard mee in de context en dus in de kosten. Het is geen drop-in vervanging.

OpenAI rekent 5 cent per minuut, Google minder dan 2

OpenAI bracht GPT-Live-1 op 10 september in de API voor 0,05 dollar per minuut, plus een aparte rekening voor het achterliggende model dat het denkwerk doet. Grok Voice Think Fast 2.0 van xAI kost 0,08 dollar per minuut. Gemini 3.8 Live zit met 0,005 dollar voor luisteren en 0,018 dollar voor praten daar onder: per minuut luisteren tien keer zo goedkoop als OpenAI, per minuut praten bijna drie keer. Let wel, OpenAI rekent één tarief voor beide richtingen, dus de verhouding hangt af van wie het meest aan het woord is. De kwaliteit ligt dicht bij elkaar. Onze conclusie: voor wie vandaag begint met een spraakbot is Google op prijs de logische eerste test, en op kwaliteit geen concessie, zolang je de dure variant pakt als er iets geregeld moet worden.

Eén kanttekening bij ons eigen enthousiasme over die prijs. Onder de aankondiging op X staat een ontwikkelaar die Gemini in zijn eigen systeem probeert in te bouwen en alleen foutmelding 503 terugkrijgt, met de vraag aan Google om “eerst het product te fixen”. Hij verwijst naar een bericht van Google-medewerker Evan Otero van 1 september, die toen bevestigde dat nieuwe accounts met weinig bestedingshistorie op drukke momenten 503-fouten kregen bij Gemini 3.7 Flash. Dat gaat over een tekstmodel, niet over deze live-modellen. Maar het is dezelfde API en dezelfde accountlaag, en een spraakbot die tijdens het spitsuur wegvalt is erger dan een chatbot die dat doet. Test dus niet alleen om drie uur ’s nachts.

Lees je eigen postcode voor, met een letter erin

Beide modellen staan in Google AI Studio met een gratis testlaag. Kies Gemini 3.8 Live, spreek in het Nederlands, en lees midden in een zin je postcode en een verzonnen ordernummer voor. Vraag het model daarna om beide te herhalen. Wissel dan halverwege een zin naar het Engels. Dat zijn de drie dingen die het huidige telefoonmenu niet kan, en waar Google nu precies op claimt te winnen. Kost je vijf minuten en geen cent.

Wil je alleen een stem voor een voicemail of keuzemenu, dan heb je geen live-model nodig. Daarvoor is een tekst-naar-spraakstem goedkoper en voorspelbaarder; zie voicemail en telefoonmenu inspreken of probeer het direct in de studio. Hoe Anthropic dezelfde stap zette met Claude voice mode op Sonnet en Opus schreven we in juli.

Blijft 3.8 Live onder de 40 procent, dan blijft het een praatmodel

Het volgende meetmoment is de eerste update van de Artificial Analysis-index met onafhankelijke Nederlandse testers erbij, en de vraag of Google het goedkope model op τ-Voice boven de 37,7 procent van zijn voorganger krijgt. Blijft het daaronder, dan is 3.8 Live een uitstekende praatpaal voor 30 cent per uur en niets meer. Komt het erboven zonder prijsverhoging, dan wordt het telefoonmenu van je energieleverancier een keuze in plaats van een noodzaak.

Stem maken