La trascrizione vocale tramite Intelligenza Artificiale non richiede necessariamente infrastrutture cloud o hardware potente.
Cactus Compute presenta Whistle, un modello open source progettato per convertire la voce in testo direttamente sul dispositivo, con particolare attenzione a smartphone, dispositivi indossabili, robot e sistemi embedded.
Il progetto punta a ridurre le risorse necessarie per il riconoscimento vocale, mantenendo la possibilità di integrare la tecnologia in applicazioni che devono funzionare localmente. Il modello si affianca a Needle, il motore dell’azienda dedicato all’esecuzione di modelli AI su hardware con risorse limitate. La documentazione tecnica illustra architettura, prestazioni e modalità d’integrazione.
Come funziona Whistle e quali funzioni offre
Il modello occupa 16,9 MB e utilizza la CPU, senza richiedere una GPU o dipendenze aggiuntive per il funzionamento di base. Secondo Cactus Compute, il riconoscimento vocale supporta inglese, tedesco, francese, spagnolo, italiano, olandese e polacco. La lingua può essere identificata automaticamente oppure impostata dall’applicazione che utilizza il sistema.
Whistle non si limita a generare una trascrizione. Può associare a ogni parola i relativi tempi di inizio e fine, insieme a un valore di probabilità, una funzione utile per sottotitoli, ricerca nei contenuti audio e strumenti di editing.
Offre inoltre la possibilità di estrarre rappresentazioni numeriche del segnale vocale, chiamate speech embedding, impiegabili in attività di confronto e recupero di contenuti senza dover necessariamente produrre testo. Un’altra caratteristica è il supporto al condizionamento tramite parole chiave. Nomi propri, termini tecnici e denominazioni specifiche possono essere forniti al modello per favorirne il riconoscimento. Questo aspetto può essere particolarmente utile nelle applicazioni professionali, dove un errore su un nome o un comando può compromettere l’esperienza dell’utente.
L’architettura riutilizza componenti del motore Needle, compreso il formato dei modelli e le ottimizzazioni per l’esecuzione locale. Gli sviluppatori possono integrare la trascrizione in programmi Python oppure utilizzare le interfacce C disponibili per diverse piattaforme. Il progetto è distribuito con licenza Apache 2.0, che ne consente l’impiego e la modifica secondo le condizioni previste.
Prestazioni, privacy e limiti da considerare
Nei test pubblicati dall’azienda, Whistle mostra risultati competitivi rispetto a Whisper base e Moonshine tiny v2, ma non prevale in ogni scenario. I confronti riportano vantaggi in alcuni dataset di riconoscimento vocale e risultati inferiori in altri. Le misurazioni sono state effettuate su un Apple M4 Pro e dipendono dalle configurazioni dei modelli e dalle condizioni di prova: non costituiscono quindi una garanzia delle prestazioni su qualsiasi dispositivo.
La ridotta occupazione in memoria e la possibilità di elaborare l’audio localmente rendono il progetto interessante per prodotti che devono limitare il traffico di rete. L’elaborazione sul dispositivo può anche ridurre l’esposizione delle registrazioni a servizi esterni, un vantaggio per applicazioni personali o aziendali che trattano conversazioni riservate.
Esistono comunque vincoli pratici. Il modello elabora registrazioni mono a 16 kHz e accetta segmenti di durata limitata per ciascuna operazione; le registrazioni più lunghe richiedono una gestione a blocchi o un’interfaccia di streaming. Inoltre, la precisione effettiva dipende dalla qualità del microfono, dal rumore ambientale, dagli accenti e dal lessico utilizzato.
Whistle rappresenta quindi un’opzione da valutare per chi sviluppa assistenti vocali, strumenti di accessibilità e applicazioni senza connessione continua. Il suo contributo più significativo è rendere più accessibile il riconoscimento vocale integrato nei prodotti, lasciando agli sviluppatori il controllo sull’elaborazione e sull’esperienza finale.