1 of 28

Il riconoscimento vocale nella lingua più bella del mondo

Contribuisci anche tu a Mozilla �

26/10/2019

2 of 28

Riconoscimento vocale

Common Voice

Contribuisci

Altro da mozilla

Cos’è mozilla?

3 of 28

Cos’è mozilla?

4 of 28

Manifesto Mozilla

https://www.mozilla.org/it/about/manifesto

  • Internet è una risorsa pubblica globale che deve rimanere aperta e accessibile.
  • Internet deve arricchire la vita di ogni essere umano.
  • L’efficacia di Internet come risorsa pubblica dipende dal suo carattere di interoperabilità (relativamente a protocolli, formati di dati, contenuto), dal suo grado di innovazione e dalla partecipazione decentralizzata a livello mondiale.
  • La partecipazione commerciale allo sviluppo di Internet è in grado di apportare numerosi benefici, ma è fondamentale un equilibrio tra profitto commerciale e benefici pubblici.
  • La valorizzazione degli aspetti di pubblica utilità di Internet rappresenta un obiettivo importante, che merita tempo, attenzione e impegno.

5 of 28

Che cos'è mozilla?

È una fondazione non-profit, della quale Mozilla Italia ne è la comunità italiana.

Nella prossima foto di gruppo potresti esserci anche tu!

Mozilla Confidential

6 of 28

Riconoscimento vocale

7 of 28

Riconoscimento vocale

Assistenti vocali negli Stati Uniti

Si stima una

crescita del.

dal 2016 a 2024

34,9%

8 of 28

Riconoscimento vocale

La guerra tra i big

9 of 28

Riconoscimento vocale

Differenze tra Common Voice e DeepSpeech

10 of 28

Common Voice

Common Voice

11 of 28

Common Voice

https://voice.mozilla.org

Progetto di Mozilla incentrato sul raccoglimento di registrazioni vocali, per poter creare un riconoscitore vocale basato su un dataset e su un modello di pubblico dominio per tutte le lingue che partecipano al progetto.

Il modello di deep learning, basato su un paper di Baidu, è implementato dal progetto DeepSpeech di Mozilla.

https://github.com/mozilla/voice-web

12 of 28

Perché è nato il progetto?

  • Contrastare la centralizzazione dei motori Speech-To-Text proprietari
  • Contrastarli perché funzionano solo online con problemi legati alla privacy degli utenti
  • Rendere il riconoscimento vocale disponibile per tutte le lingue in maniera open source
  • Anche per le lingue con meno interesse commerciale
  • Per non avere limitazioni sull’utilizzo di questi servizi

13 of 28

Stato del progetto per la lingua inglese

Dati al 21/02/2020

  • 54.109 partecipanti
  • 38 GB di dataset
  • WER versione 0.2.0: 11%

https://hacks.mozilla.org/2017/11/a-journey-to-10-word-error-rate/

https://hacks.mozilla.org/2018/09/speech-recognition-deepspeech/

14 of 28

Stato del progetto

per la lingua italiana

Dati al 21/02/2020

  • Avviato il 3 Luglio 2019
  • Raccoglimento automatico delle frasi da Wikipedia
  • 5.162 partecipanti
  • 146 ore registrate
  • 108 ore convalidate

15 of 28

Dati al 21/02/2020

16 of 28

Contribuisci

17 of 28

Come contribuire a Common Voice?

Revisiona le registrazioni

Registra la tua voce

  • Leggi la frase che compare
  • Scandisci tutte le parole, anche le finali!
  • Leggi anche i numeri, per esteso
  • Non preoccuparti del tuo accento!
  • Accertati che le registrazioni siano corrette:
    • Frasi lette per intero e correttamente
    • Deve essere comprensibile/udibile, quindi assenza di rumore (o basso) in sottofondo!

Locandina a IHC 2018

18 of 28

Dati al 21/02/2020

Come contribuire a Common Voice?

Vai su: https://voice.mozilla.org/it e inizia da subito.

QUALUNQUE DISPOSITIVO TU ABBIA

19 of 28

20 of 28

Obiettivi per il futuro di Common Voice

  • Aggiungere il supporto per altre lingue
  • Migliorare le performance in caso di rumore di fondo
  • Proposta per API web speech
  • Continuare a migliorare l’interfaccia
  • Aggiungere piú funzionalità per tracciare lo stato di raccolta dei dati vocali

21 of 28

Cos’è il Machine Learning?

È quel processo che riguarda lo studio, la costruzione e l'implementazione di algoritmi che permettono ad un calcolatore di imparare a fare previsioni o decisioni in modo automatico a seguito di una fase di “training” su un insieme di dati in ingresso (files di testo, musicali, immagini, etc…).

22 of 28

Come funziona il Machine Learning?

  1. Raccolta dei dati
  2. Preparazione dei dati
  3. Scelta dell’algoritmo / ANN
  4. Fase di Training
  5. Valutazione dei risultati
  6. Predizione

23 of 28

Progetto DeepSpeech

  • Motore di riconoscimento vocale, open source e sviluppato da Mozilla
  • Utilizza un modello TensorFlow, basandosi sul paper di Baidu: “Deep Speech: Scaling up end-to-end speech recognition
  • Versione 0.3: migliorie e aggiunta di GUI

https://github.com/mozilla/DeepSpeech

24 of 28

Progetto DeepSpeech

Sviluppo

Si tratta di un modello TensorFlow realizzato in Python, con “semplici” API che permettono di svolgere il riconoscimento vocale

  • Utilizzo delle BRNN (bidirectional recurrent neural network) nella versione 0.1.1, e della RNN nella versione 0.2.0
  • Ottimizzazione degli iperparametri
  • Creazione di un dataset per il training/testing

Mozilla Confidential

25 of 28

Progetto DeepSpeech

Bindings nativi

  • Node.js https://github.com/mozilla/DeepSpeech#using-the-nodejs-package
  • Python https://github.com/mozilla/DeepSpeech#using-the-python-package
  • Rust https://github.com/RustAudio/deepspeech-rs
  • Go https://github.com/asticode/go-astideepspeech
  • GStreamer https://github.com/Elleo/gst-deepspeech

Mozilla Confidential

26 of 28

Progetto DeepSpeech

Modello

  • Già disponibile per il download (versione 0.5.1)
  • Disponibile il pre-trained in inglese
  • Affidabilità maggiore del 94% (Novembre 2017)

https://github.com/mozilla/DeepSpeech/releases/tag/v0.5.1

Mozilla Confidential

27 of 28

Progetto DeepSpeech

Modello italiano (0.1a)

Dati al 24/10/2019

  • Immagine Docker per generare modello
  • Training con dataset Common Voice e Open-Corpora (~170 ore)
  • Versione 0.1a del modello pubblicata: pronta per essere provata!

https://github.com/MozillaItalia/DeepSpeech-Italian-Model

Mozilla Confidential

28 of 28

Common Voice e DeepSpeech

Utilizzi

  • Mozilla IoT:�assistente sperimentale per il Web of Things Gateway
  • Mycroft AI:�uso del dataset di Common Voice per lo sviluppo di un assistente vocale completamente Open Source