Entriamo in una stanza vuota, chiudiamo gli occhi e battiamo una volta le mani.
Dopo il suono iniziale arrivano le riflessioni. Alcune quasi immediatamente, altre con un piccolo ritardo. Il suono ha raggiunto pareti, pavimento e soffitto ed è tornato verso di noi seguendo percorsi differenti.
Senza rendercene conto abbiamo appena interrogato geometricamente l’ambiente.
La domanda è: un computer potrebbe utilizzare quelle stesse riflessioni per ricostruire la forma della stanza?
La risposta, almeno entro determinate condizioni, è sì.
Non si tratta di un’ipotesi futuristica. Da anni diversi gruppi di ricerca studiano come estrarre informazioni geometriche dagli echi e, più recentemente, come utilizzare il suono anche nei sistemi SLAM — Simultaneous Localization and Mapping — per determinare contemporaneamente la posizione di un sensore e informazioni sull’ambiente nel quale si muove.
È un approccio molto diverso da quelli ai quali siamo abituati in geomatica. Non vengono necessariamente acquisite immagini e non viene necessariamente misurata una nuvola di milioni di punti.
In questo caso è il tempo impiegato dal suono per propagarsi e tornare al sensore a contenere parte dell’informazione geometrica.
Ascoltare la forma di una stanza
Nel 2013 Ivan Dokmanić, Reza Parhizkar, Andreas Walther, Yue M. Lu e Martin Vetterli pubblicarono sulla rivista Proceedings of the National Academy of Sciences un lavoro dal titolo particolarmente evocativo: “Acoustic echoes reveal room shape”.
La domanda iniziale degli autori era molto simile al nostro esperimento.
Immaginiamo di trovarci bendati all’interno di una stanza sconosciuta. Produciamo un suono e ascoltiamo gli echi. È possibile determinare la forma della stanza?
Gli autori dimostrarono un metodo per ricostruire la geometria tridimensionale di una stanza poliedrica convessa utilizzando la risposta dell’ambiente a un suono noto registrato da alcuni microfoni. Il metodo sfrutta le relazioni geometriche contenute nei tempi di arrivo degli echi. In determinate condizioni, gli autori dimostrarono inoltre che gli echi di primo ordine possono identificare univocamente una stanza poliedrica convessa.
È un risultato importante perché introduce un concetto apparentemente controintuitivo, un’eco può essere trasformata in informazione geometrica.
Ma per capire come sia possibile dobbiamo seguire per un momento il viaggio compiuto dal suono.
Dal tempo alla distanza
Supponiamo di avere un altoparlante che emette un segnale e un microfono che lo registra.
Il microfono riceverà innanzitutto il suono che arriva direttamente dalla sorgente. Successivamente registrerà le copie dello stesso segnale riflesse dalle superfici dell’ambiente.
Ogni percorso è più lungo del precedente e produce quindi un differente tempo di arrivo.
Conoscendo la velocità di propagazione del suono e misurando questi tempi è possibile ottenere informazioni sulle lunghezze dei percorsi acustici.
La situazione, tuttavia, è più complicata del semplice principio utilizzato da un distanziometro.
Una riflessione può essere descritta attraverso il cosiddetto image-source model. Invece di considerare il percorso reale sorgente-parete-microfono, matematicamente si può immaginare una sorgente virtuale posta dietro la superficie riflettente. La distanza fra questa sorgente virtuale e il microfono corrisponde alla lunghezza del percorso seguito dal suono riflesso.
Individuando correttamente queste sorgenti virtuali diventa quindi possibile ricavare informazioni sulla posizione delle superfici che hanno generato le riflessioni. È proprio questa relazione fra echi, distanze e geometria a essere sfruttata dal metodo pubblicato su PNAS.
Ed è qui che compare uno dei problemi fondamentali. Il microfono riceve una sequenza di riflessioni, ma nessuna di esse porta scritto sopra:“parete nord”.
Il sistema deve capire quale eco appartiene a quale superficie.
Gli autori chiamano questo problema echo sorting: l’algoritmo parte dalle risposte impulsive registrate e deve determinare la corretta associazione fra gli echi e le pareti.
È uno dei motivi per cui ricostruire uno spazio attraverso il suono è molto meno immediato di quanto potrebbe sembrare.
Dal rilievo della stanza allo SLAM
Il problema diventa ancora più interessante quando il sensore non rimane fermo.
Nel mondo della robotica e della geomatica conosciamo bene il concetto di SLAM: un sistema si muove in un ambiente sconosciuto e cerca contemporaneamente di stimare la propria traiettoria e costruire una rappresentazione dello spazio circostante.
Normalmente pensiamo a telecamere, laser scanner, LiDAR e unità inerziali. Ma anche gli echi possono fornire informazioni sulla posizione.
Se un dispositivo si sposta all’interno di un edificio, infatti, cambia anche il modo in cui il suono emesso dal dispositivo raggiunge le superfici e ritorna ai microfoni. Posizioni differenti producono quindi differenti risposte acustiche.
Da questa osservazione nasce una linea di ricerca che mette insieme acustica e SLAM.
E uno degli esperimenti più interessanti non richiede necessariamente un sofisticato robot da laboratorio. Può essere realizzato utilizzando l’hardware presente in uno smartphone.
Uno smartphone che ascolta dove si trova
Nel 2024 IEEE Transactions on Mobile Computing ha pubblicato lo studio “Indoor Smartphone SLAM With Acoustic Echoes”, realizzato da Wenjie Luo, Qun Song, Zhenyu Yan, Rui Tan e Guosheng Lin.
Il sistema utilizza l’hardware audio integrato nello smartphone insieme alla sua IMU. Il principio è particolare. L’altoparlante del telefono emette dei chirp quasi non udibili. Il microfono registra gli echi prodotti dall’ambiente e il sistema estrae da queste registrazioni caratteristiche associate alle differenti posizioni attraversate dal dispositivo.
Gli echi vengono utilizzati soprattutto per affrontare uno dei problemi classici dello SLAM: riconoscere quando il dispositivo ritorna in un luogo nel quale è già passato. È la cosiddetta loop closure.
Il riconoscimento di questi punti consente di correggere il progressivo errore della traiettoria stimata attraverso i sensori inerziali.
Nel sistema descritto dagli autori viene utilizzato il contrastive learning per costruire una rappresentazione delle caratteristiche acustiche delle diverse posizioni. Le loop closure individuate attraverso gli echi vengono quindi utilizzate per regolare la ricostruzione della traiettoria basata sulla IMU. Le traiettorie così ottenute vengono infine impiegate anche per la ricostruzione della geometria degli ambienti.
Negli esperimenti descritti dagli autori, il sistema ha ottenuto errori mediani di localizzazione pari a 0,10 metri in un soggiorno, 0,53 metri in un ufficio e 0,40 metri in un centro commerciale. Gli autori riportano inoltre che la ricostruzione della geometria della stanza ha ottenuto errori fino a quattro volte inferiori rispetto agli approcci basati sugli echi utilizzati come confronto nello studio.
Questi numeri non rappresentano una precisione generale dell’“Acoustic SLAM” e non significano che uno smartphone possa essere considerato un nuovo strumento topografico con precisione di dieci centimetri. Sono soloi risultati ottenuti da quello specifico sistema nelle condizioni sperimentali descritte dagli autori.
Cosa vede un sistema acustico?
Un laser scanner misura un’enorme quantità di distanze e restituisce una rappresentazione estremamente densa delle superfici.
Una fotocamera registra invece la radiazione luminosa e, attraverso la fotogrammetria o altri algoritmi di computer vision, permette di ricostruire geometria e caratteristiche visive dell’ambiente.
L’approccio acustico parte da un’informazione differente: la propagazione del suono e le sue riflessioni. Di conseguenza, il risultato non deve essere immaginato automaticamente come una nuvola di punti paragonabile a quella di un laser scanner.
Nel lavoro di Dokmanić e colleghi, per esempio, l’obiettivo era ricostruire la geometria delle pareti di ambienti poliedrici convessi attraverso gli echi.
Nel sistema smartphone pubblicato su IEEE, invece, l’informazione acustica viene combinata con quella inerziale per stimare la traiettoria, individuare le loop closure e contribuire alla ricostruzione della geometria degli ambienti.
Sono quindi approcci differenti che condividono lo stesso principio fondamentale ossia la risposta acustica di un ambiente contiene informazione sulla sua struttura spaziale.
E se la stanza non fosse fatta di semplici pareti piane?
Qui la ricerca si sta spostando verso problemi ancora più complessi.
Un esempio è EchoScan, un modello basato su reti neurali sviluppato per inferire geometrie di ambienti utilizzando gli echi.
A differenza di approcci che cercano direttamente parametri come posizione delle pareti e dimensioni della stanza, EchoScan produce rappresentazioni sotto forma di floorplan map e height map. Gli autori hanno studiato anche geometrie più complesse, comprese pareti curve, utilizzando riflessioni di ordine superiore oltre a quelle di primo ordine.
Il lavoro descrive addestramento e valutazione attraverso room impulse responses sintetizzate da ambienti complessi. Non costituisce quindi la dimostrazione che oggi esista uno scanner acustico commerciale capace di entrare in qualunque edificio e restituirne automaticamente un modello metrico tridimensionale.
È ricerca. Ed è proprio questo a renderla interessante.
Quando vedere diventa difficile
Perché utilizzare il suono se disponiamo già di camere e LiDAR?
Una risposta emerge osservando le condizioni nelle quali l’informazione visiva può degradarsi.
Nel 2025 IEEE Robotics and Automation Letters ha pubblicato ALCDNet, un sistema per la loop closure detection basato sugli echi.
Il sistema utilizza un altoparlante per emettere segnali progettati appositamente e un array di microfoni per registrarne le riflessioni. Una rete basata sul contrastive learning estrae dagli echi caratteristiche spaziali che permettono di confrontare posizioni differenti.
Gli autori hanno sperimentato il metodo anche in presenza di fumo.
Secondo i risultati pubblicati, il sistema acustico è riuscito a effettuare la loop closure detection anche nell’ambiente fumoso utilizzato negli esperimenti, dove i metodi LiDAR e vision-based considerati nello studio fallivano. Gli autori propongono infatti l’approccio come soluzione complementare per condizioni caratterizzate da fumo, illuminazione instabile o scarsità di caratteristiche visive.
I risultati disponibili non giustificano l’idea di sostituire universalmente camere e laser scanner con microfoni e altoparlanti.
Mostrano invece che il suono costituisce un’ulteriore sorgente di informazione spaziale e che, in determinate condizioni, questa informazione può continuare a essere disponibile quando altri sensori incontrano difficoltà.
Dal punto di vista della geomatica professionale è probabilmente questa la distinzione più importante.
Gli studi citati dimostrano che gli echi possono essere utilizzati per ricavare informazioni geometriche, contribuire alla localizzazione di un dispositivo, riconoscere luoghi precedentemente attraversati e, in determinate configurazioni, ricostruire la geometria di un ambiente.
Non dimostrano invece che l’Acoustic SLAM possa oggi sostituire un rilievo metrico eseguito con laser scanner o fotogrammetria.
Le pubblicazioni utilizzano hardware, algoritmi, configurazioni sperimentali e obiettivi differenti. Anche le grandezze valutate non sono necessariamente quelle alle quali è abituato chi opera nel rilievo topografico.
Il confronto diretto con precisione, accuratezza, risoluzione e densità tipiche di una nuvola di punti richiede quindi cautela.
Un altro modo di osservare lo spazio
La geomatica ha imparato a misurare lo spazio osservando segnali molto diversi.
Misuriamo distanze attraverso onde elettromagnetiche. Ricostruiamo geometrie dalle immagini. Determiniamo posizioni attraverso segnali provenienti da satelliti. Combiniamo accelerometri e giroscopi per stimare il movimento.
Gli esperimenti sull’Acoustic SLAM aggiungono a questo panorama un’altra possibilità che è quella di estrarre informazione spaziale dalle onde sonore riflesse dall’ambiente.
Torniamo allora nella stanza dalla quale siamo partiti. Battiamo nuovamente le mani. Per noi quello che ritorna è semplicemente un’eco.
Per un algoritmo opportunamente progettato, quella successione di riflessioni potrà contenere in futuro distanze, superfici, informazioni sulla posizione e indizi sulla forma dello spazio?
