Come testare l’accuratezza della dettatura senza falsare il confronto

Il miglior test non cerca una percentuale universale: misura quanto lavoro serve per ottenere un testo corretto con la tua voce, il tuo microfono e il tuo lessico.

Verdetto rapido

Prepara un testo di riferimento rappresentativo, registra una sola lettura, usa lo stesso audio per ogni motore e misura WER, errori che cambiano significato e tempo di correzione. Aggiungi una prova dal vivo per catturare latenza e flusso.

Verdetto per profilo

Acquirente individuale

Misura il tempo di correzione

È più vicino al costo reale di una bozza rispetto a una percentuale astratta.

Team tecnico

Conserva corpus e configurazione

Modello, versione, hardware, lingua e pre-processing rendono il risultato riproducibile.

Utente multilingue

Separa le lingue e il code-switching

Una media unica può nascondere errori importanti in nomi o passaggi tra italiano e inglese.

Criteri di scelta

Campione rappresentativo

Includi prosa naturale, nomi propri, numeri, punteggiatura, sigle e termini del tuo lavoro senza costruire un testo artificiosamente facile.

Metriche utili

Calcola sostituzioni, cancellazioni e inserzioni per WER, ma annota anche errori critici e minuti di correzione.

Condizioni controllate

Stesso file audio, livello, stanza e impostazioni. Per il live, ripeti più volte e randomizza l’ordine per ridurre l’effetto apprendimento.

Crea il riferimento

Scrivi 150–300 parole che rappresentino davvero email, prompt o documentazione. Leggile a velocità naturale e conserva il testo esatto.

Non correggere il riferimento dopo aver visto gli output: introdurresti un vantaggio a un sistema.

Misura più della WER

La word error rate conta sostituzioni, inserzioni e omissioni rispetto al riferimento. È utile, ma tratta in modo simile errori con impatto molto diverso.

Aggiungi una categoria per negazioni, quantità, nomi e comandi; cronometra il tempo fino alla bozza pronta.

Pubblica i limiti

Dichiara microfono, hardware, sistema, modello, lingua, data e numero di prove. Non generalizzare da una voce a tutta la popolazione.

Per app live misura anche avvio, inserimento nel campo e correzione. Un file batch non rappresenta interamente la dettatura quotidiana.

Limiti e aspetti da verificare

  • Un singolo parlante non rappresenta tutti gli accenti.
  • La WER non misura bene punteggiatura e gravità.
  • Il file registrato non cattura tutta la UX live.
  • Nessun risultato comparativo incluso.

Metodo di valutazione

  1. Corpus congelato prima del confronto.
  2. Stesso audio per i motori.
  3. WER più errori critici e correzione.
  4. Configurazione e limiti visibili.

Fonti

Prima dell’acquisto, ricontrolla prezzi, requisiti e condizioni sulla privacy presso ogni fornitore.

Domande frequenti

Che cos’è la WER?

È il rapporto tra sostituzioni, cancellazioni e inserzioni e il numero di parole del riferimento. Va accompagnata da altre metriche.

Posso usare ogni volta una lettura nuova?

Per confrontare i motori è meglio riutilizzare lo stesso audio; aggiungi poi prove live separate.

Quale punteggio rende una dettatura buona?

Non esiste una soglia universale. Conta se gli errori e il tempo di correzione sono accettabili nel tuo lavoro.

Congrats! 🎉

Your purchase was successful.

You will receive an email with your purchase details.