Mitsubishi Electric Corporation ha annunciato che l’azienda ha sviluppato una tecnologia che, per la prima volta nel mondo, è in grado di creare un’interazione intuitiva ed estremamente naturale con gli esseri umani basandosi sulla capacità di analizzare le scene e di tradurre i dati di rilevamento multimodale in un linguaggio naturale. Nella nuova tecnologia, Scene-Aware Interaction, è integrata la tecnologia compatta di intelligenza artificiale (IA) proprietaria di Mitsubishi Electric, denominata Maisart che consente di analizzare i dati di rilevamento multimodale per creare un’interazione estremamente naturale e intuitiva con gli esseri umani mediante la generazione di un linguaggio naturale basato sul contesto.
La tecnologia riconosce gli oggetti e gli eventi contestuali basandosi su dati di rilevamento multimodale, ad esempio immagini e video acquisiti per mezzo di telecamere, informazioni audio registrate con microfoni e informazioni di localizzazione misurate tramite LiDAR. Per dare priorità alle diverse categorie di dati, l’azienda ha sviluppato la tecnologia di fusione multimodale attenzionale (Attentional Multimodal Fusion), che è in grado di ponderare automaticamente i dati unimodali salienti per supportare la scelta delle parole appropriate per descrivere le scene con precisione. Per eseguire i test di benchmark basati su un set di test comune, la tecnologia di fusione multimodale attenzionale ha utilizzato dati audio e video e ha ottenuto un punteggio di valutazione della descrizione delle immagini basata sul consenso (CIDEr, Consensus-Based Image Description Evaluation) di 29 punti percentuali superiore rispetto a quello ottenuto con il solo utilizzo di informazioni visive. La combinazione realizzata da Mitsubishi Electric di fusione multimodale attenzionale e tecnologia di rilevamento delle scene con la generazione di un linguaggio naturale basato sul contesto, ha creato un potente sistema di interazione end-to-end di riconoscimento delle scene che permette un’interazione estremamente intuitiva con gli utenti nelle diverse situazioni.
La tecnologia Scene-Aware Interaction per il sistema di navigazione delle
I recenti progressi nel riconoscimento degli oggetti, nella descrizione dei video, nella generazione di linguaggio naturale e nelle tecnologie di dialogo vocale che si avvalgono delle reti neurali profonde, stanno permettendo alle macchine di comprendere meglio l’ambiente circostante e di interagire con gli esseri umani in modo più naturale e intuitivo. Si prevede che la tecnologia di interazione basata sul riconoscimento delle scene (Scene-Aware Interaction) sarà diffusamente applicata, ad esempio per le interfacce uomo-macchina, i sistemi di informazione e intrattenimento a bordo dei veicoli, l’interazione con i robot nei sistemi di costruzione e di automazione industriale, i sistemi di monitoraggio della salute e del benessere delle persone, i sistemi di sorveglianza che interpretano scene complesse per gli esseri umani e incoraggiano il distanziamento sociale, il supporto per funzionamento “touchless” delle attrezzature presenti nelle aree pubbliche, e molto altro ancora.