Dicteernauwkeurigheid testen zonder misleidende percentages
Een nauwkeurigheidsclaim is pas nuttig als dezelfde audio, referentietekst en telmethode zijn gebruikt. Voor dagelijks dicteren telt bovendien niet alleen het woordfoutpercentage, maar ook correctietijd, wachttijd en fouten die de betekenis veranderen.
Laatst gecontroleerd: 2026-07-31. Deze methode is gepubliceerd door Voicetypr. Er zijn voor deze editie geen concurrerende producten getest en er wordt geen winnaar genoemd. Het protocol is geïnspireerd op gangbare ASR-evaluatie met woordfouten, aangevuld met praktische correctiemetingen.
Kort oordeel
Neem één representatieve audioreeks op, maak handmatig een referentietekst en voer exact dezelfde bestanden door elke oplossing. Bereken woordfoutpercentage, maar registreer ook correctieminuten, eerste-resultaattijd en betekenisfouten. Test minimaal rustige spraak, ruis, namen, cijfers en gemengde technische termen.
Advies per gebruiker
Individuele koper
Test tien echte fragmenten
Een kleine persoonlijke dataset voorspelt jouw werk beter dan een algemene vendorclaim.
Teambeheerder
Gebruik meerdere sprekers en blinde correctie
Accenten, microfoons en domeintaal verschillen; één stem is geen teambenchmark.
Contentmaker
Meet correctietijd naast WER
Een fout op een naam of bedrag kan meer werk en risico geven dan meerdere kleine lidwoordfouten.
Waar u op moet letten
Representatieve corpus
Gebruik teksten die lijken op je dagelijkse prompts, mails, notities of vakdocumenten en bewaar dezelfde audiobestanden.
Vaste normalisatie
Beslis vooraf hoe hoofdletters, leestekens, getallen en samenstellingen worden geteld. Verander de regels niet na het zien van resultaten.
Totale gebruikslast
Meet tijd tot eerste transcript, totale correctietijd, mislukte invoegingen en betekenisveranderende fouten.
| Meting | Vraag | Rapportage |
|---|---|---|
| WER | Hoeveel invoegingen, weglatingen en vervangingen? | (S+D+I)/N |
| Correctietijd | Hoe lang tot verzendklare tekst? | minuten per 100 woorden |
| Latency | Hoe lang tot resultaat? | mediaan en p95 |
| Kritieke fouten | Verandert naam, bedrag, ontkenning of opdracht? | aantal + voorbeelden |
Bouw eerst de testset
Neem 10 tot 20 fragmenten op met dezelfde microfoonafstand. Verdeel ze over korte opdrachten, lange alinea’s, cijfers, eigennamen, Engelse producttermen en achtergrondgeluid.
Maak de referentietekst handmatig en laat twijfelgevallen controleren voordat je producten test. Bewaar audio, referentie, apparaat, OS, model en versie.
Bereken WER consequent
Word Error Rate telt vervangingen, weglatingen en invoegingen ten opzichte van het aantal woorden in de referentie. Een lagere score is beter, maar de uitkomst verandert door tokenisatie en normalisatie.
Publiceer daarom je regels en voorbeeldparen. Geef geen nauwkeurigheidspercentage door simpelweg 100 min WER te noemen zonder context.
Voeg een workflowmeting toe
Start de klok bij het activeren en stop pas wanneer de tekst verzendklaar is. Noteer correcties, focusschade, netwerkfouten en herstarts.
Voer elke route meerdere keren uit en rapporteer spreiding. Een snel model met enkele kostbare betekenisfouten kan minder bruikbaar zijn dan een iets trager model met voorspelbare correcties.
Beperkingen en controlepunten
- Een kleine eigen dataset is praktisch maar niet statistisch representatief voor alle gebruikers.
- WER waardeert niet elke fout naar risico of correctiekosten.
- Cloudresultaten en modellen kunnen zonder lokale versiecontrole veranderen.
Zo hebben we beoordeeld
- Gangbare ASR-termen uit primair Whisper-onderzoek gebruikt.
- Protocol scheidt transcriptiefouten van workflowfrictie.
- Geen productscore gepubliceerd zonder gedeelde audio en ruwe resultaten.
Bronnen
- OpenAI: Whisper-paper
- OpenAI: Whisper-repository en evaluatie
- NIST: Speech Recognition Scoring Toolkit
- Voicetypr: lokale modellen
Controleer prijzen, systeemeisen en privacyvoorwaarden voor aankoop opnieuw bij de aanbieder.
Veelgestelde vragen
Wat is een goed woordfoutpercentage?
Er is geen universele grens. Vergelijk binnen dezelfde taal, audio, normalisatie en taak.
Kan ik live dictatie eerlijk vergelijken?
Bewaar bij voorkeur audio en voer die identiek door alle systemen; live herhalen verandert de invoer.
Waarom correctietijd meten?
Omdat dagelijkse productiviteit afhangt van de tijd tot bruikbare tekst, niet alleen van een laboratoriumscore.
Gebruik je eigen stem als benchmark
Download Voicetypr en voer dezelfde Nederlandse testset lokaal uit voordat je koopt.