Come testare l’accuratezza della dettatura senza falsare il confronto
Il miglior test non cerca una percentuale universale: misura quanto lavoro serve per ottenere un testo corretto con la tua voce, il tuo microfono e il tuo lessico.
Ultima verifica: 2026-07-31. Voicetypr pubblica il protocollo ma non presenta risultati. Non abbiamo svolto uno studio comparativo; il metodo va adattato e documentato prima di citare conclusioni.
Verdetto rapido
Prepara un testo di riferimento rappresentativo, registra una sola lettura, usa lo stesso audio per ogni motore e misura WER, errori che cambiano significato e tempo di correzione. Aggiungi una prova dal vivo per catturare latenza e flusso.
Verdetto per profilo
Acquirente individuale
Misura il tempo di correzione
È più vicino al costo reale di una bozza rispetto a una percentuale astratta.
Team tecnico
Conserva corpus e configurazione
Modello, versione, hardware, lingua e pre-processing rendono il risultato riproducibile.
Utente multilingue
Separa le lingue e il code-switching
Una media unica può nascondere errori importanti in nomi o passaggi tra italiano e inglese.
Criteri di scelta
Campione rappresentativo
Includi prosa naturale, nomi propri, numeri, punteggiatura, sigle e termini del tuo lavoro senza costruire un testo artificiosamente facile.
Metriche utili
Calcola sostituzioni, cancellazioni e inserzioni per WER, ma annota anche errori critici e minuti di correzione.
Condizioni controllate
Stesso file audio, livello, stanza e impostazioni. Per il live, ripeti più volte e randomizza l’ordine per ridurre l’effetto apprendimento.
Crea il riferimento
Scrivi 150–300 parole che rappresentino davvero email, prompt o documentazione. Leggile a velocità naturale e conserva il testo esatto.
Non correggere il riferimento dopo aver visto gli output: introdurresti un vantaggio a un sistema.
Misura più della WER
La word error rate conta sostituzioni, inserzioni e omissioni rispetto al riferimento. È utile, ma tratta in modo simile errori con impatto molto diverso.
Aggiungi una categoria per negazioni, quantità, nomi e comandi; cronometra il tempo fino alla bozza pronta.
Pubblica i limiti
Dichiara microfono, hardware, sistema, modello, lingua, data e numero di prove. Non generalizzare da una voce a tutta la popolazione.
Per app live misura anche avvio, inserimento nel campo e correzione. Un file batch non rappresenta interamente la dettatura quotidiana.
Limiti e aspetti da verificare
- Un singolo parlante non rappresenta tutti gli accenti.
- La WER non misura bene punteggiatura e gravità.
- Il file registrato non cattura tutta la UX live.
- Nessun risultato comparativo incluso.
Metodo di valutazione
- Corpus congelato prima del confronto.
- Stesso audio per i motori.
- WER più errori critici e correzione.
- Configurazione e limiti visibili.
Fonti
- NIST: Speech Recognition Scoring Toolkit
- OpenAI: paper Whisper
- OpenAI: modelli e variabilità
- Voicetypr: modelli
Prima dell’acquisto, ricontrolla prezzi, requisiti e condizioni sulla privacy presso ogni fornitore.
Domande frequenti
Che cos’è la WER?
È il rapporto tra sostituzioni, cancellazioni e inserzioni e il numero di parole del riferimento. Va accompagnata da altre metriche.
Posso usare ogni volta una lettura nuova?
Per confrontare i motori è meglio riutilizzare lo stesso audio; aggiungi poi prove live separate.
Quale punteggio rende una dettatura buona?
Non esiste una soglia universale. Conta se gli errori e il tempo di correzione sono accettabili nel tuo lavoro.
Confronta una bozza reale
Registra una volta, conserva il riferimento e conta le correzioni che incidono sul tuo lavoro.