跳到主要內容區

[110-2 訪談] AI與聽覺

陳嘉平

受訪人:資訊工程學系 陳嘉平教授
最高學歷:美國華盛頓大學電機工程系博士
經歷:國立中山大學資訊工程學系教授
專長:
機器學習、多媒體資訊技術
 
訪問組別:第 14 組
訪問組員:
    洪唯瑄    B094020027
    謝伊庭    B085040020
    鄭璟翰    B093040003
    廖子儀    B083021018

   訪談內容   

1. 從資工系網站上老師的專訪中提到老師在碩士是研究通訊網路領域,那為什麼老師最後會改以訊號處理領域取得博士呢?  

  人生總是充滿需多變數,我的研究瑣事就讀美國的華盛頓大學電機系,一開始進去是主要是研究通訊工程領域,通訊工程到現在還是非常熱門的領域,但是在當時是更加熱門的領域,因為現在有一些慢慢轉到人工智慧,在先前通訊和IC設計都是比較熱門的領域。我一開始讀研究所時是想走通訊工程這個領域,我遇到的第一個指導教授就是專門研究通訊工程,但是在我進去後第二年,在波士頓的新創公司來挖腳他,他又剛好可以請休假研究,而且他又是麻省理工畢業的,他就決定要說把重心搬回波士頓去,慢慢結束掉在華盛頓這邊的研究。在美國,學界和業界的交流非常明顯,經常會互相挖腳,而業界挖腳學界又更常見,主要是因為那時候新創公司的生態,通訊工程變的非常熱門,通訊的速度從幾K到幾M到幾G、有線發展成無線等等,剛好就是在那個時代,整體的報酬是很高的。所以只到教授就被挖腳到波士頓的公司,如果挖角他的公司是在西雅圖,那他或許還有辦法兼顧在華盛頓大學的實驗室。因為我是剛進入的第一年,而他把他的博士生分成兩種,一種是一兩年內就可以畢業者,另一種可能就要比較幾的時間,前者他就帶到畢業,後者他就徵詢我們的意見,看是要另外找其他老師還是要如何處理,雖然我還是維持名義上的指導關係,但是我也修不到他的課,我就開始修其他老師的課,這學期我就修比較多堂課,大概修了三四門專業的課就在那時候修一堂資訊理論(information theorem)、另一堂叫做計算電磁學,兩堂課的老師都是通訊的老師,前者主要是訊號處理,後者則是和無線通訊相關,因為電磁波也和通訊有關,同時這兩堂課的老師都來問我要不要加入他們的團隊,我稍微思考一下,以及和我的指導老師說明這個情況後,我就選擇加入訊號做訊號處理的團隊。但那時候的訊號處理已經開始從傳統的訊號處理,到開始演變成機器學習的訊號處理,因此那個老師做比較多機器學習的研究,特別語音聲學相關的訊號處理,那我也因為加入他的團隊,就從通訊轉到語音訊號處理,再轉到語音辨識那這時候就是大概以機器學習跟語音這兩項變成是我主要的研究領域。

 

2. 聽說老師您大學時期為了強化研究能力,曾修習過數學、統計學、資訊科學等系所的專業課程,另外老師在大學部所開的課,如線性代數、機率學等,都是基礎的專業數學學科,可以請老師分享這些基礎學科經常被應用在研究上以及如何使用呢?

  這個應用其實非常廣,因為她是基礎的數學,在資工領域裡面幾乎每個領域或多或少都會用到機率學或線性代數。以訊好處理來講,用何種資料結構去表示一個訊號,在數學上其實就是向量矩陣張量這些符號。通訊理論上面有很多訊號,因此他也是用向量或是矩陣來表示,所以線性代數在這兩個領域的應用就非常多。 那機率有有用在不少地方機率,比如說人工智慧機器學習之中,以辨識為例,當不知道真正的類別是什麼,現在手上只有部分的證據,要從手上的證據去推出他實際上他是那個類別,這個就是機率上所謂的貝氏定理。首先要建立一個事前的模型,另外還要一個一個模型是從假說到證據,有了這兩個模型後就可以反過來,從證據回推到假說,這整個原理就是所謂的貝氏定理。那和在人工智慧的問題相通,在通訊的問題也是類似;如同傳送器跟接收器,傳送器傳送的訊號會有許多不同的可能性,當接收到訊號後要反推了什麼訊號,因為中間的訊號可能有雜訊 隨機的因素。甚至於晶圓、晶片設計等等都會用到良率的分析,因為東西設計出來後要做錯誤分析,測試的瓶頸在哪裡或是問題在哪裡。那中間關卡可能出錯可能不會出錯這些都是機率在描述的行為。透過資料進行機率的描速,將來擬作整個製程的分析時也是需要機率的工具。資訊安全也是一樣,要把資料變成可以快速處理的狀況,也是線性代數向量矩陣張量這種東西,不論是攻擊或是異常或是機器學習裡面攻擊的部分,同樣也要機率作為基礎。那我們學習的,當然不是直接去學習各種模型,但各種機率模型的基礎就是我們現在所學的,有了這些基礎後再去接觸這些模型,對這些模型的了解就會比較深。

 

3. 對於想要了解初學者想要了解語音辨識這個技術的學生,有什麼可以快速入門的方式嗎?在這個時代中,必須要具備的相關知識有什麼呢?平常可以從那些地方(報章雜誌、書籍、網路平台等),獲取相關的知識呢? 

  關於語音辨識的學習,其實不管是什麼,都可以從wiki開始(網路上的百科全書)先看wiki大概就可以先有一個簡單的。那稍微分析一下一個語音辨識系統,主要可以分成前端和後端兩個部分。前端就是從聲音的訊號裡面去擷取一些資訊, 資訊在到後端會進入一個模型來做語音內容的辨識。前端擷取語音裡面的資訊 這個其實就是所謂訊號處理的部分,至於要如何處理這個訊號,這個禮拜我會稍微講解--這個禮拜五我的上課方式是一系列的問答題,從提出問題以及答案選項,大家就可以去思考那些答案選項是跟問題是否相關,當大家回答完之後,我會去分析每個選項如何相關、如何無關,那透過這些說明就可以讓前端的訊號處理有一些概念,如訊號模型、聲音數位化後要先取樣、再擷取他的頻率方面的資訊。實際上到底要怎麼做,我們就透過一問一答的方式來引導各位去了解;後端同樣會有一些辨識的模型,介紹一些傳統的模型以及深度學習等主要的模型。主要是這樣,這個很難三言兩語就把他介紹完整,如果快速簡介的話,那就是一個前端訊號處理和後端的模型,至於裡面那些細部的內容就可以從wiki認識,因為 wiki整個看下來不用花太久,五分鐘十分鐘,如果是看一本說可能就要很久了,所以我想那是一個很好的起點。

 

4. 請問老師認為現在的AI在聽覺上還有什麼部分是有潛力去應用的?

  聽覺其實也不光是只有語音,這一兩年有一個領域叫做聲音事件偵測,他所處理的是不光是處理人類的說話,還包括周圍有哪些聲音,比如說處在校園當中,校園裡面有一些聲音,可能需要去偵測,如果說有人求救、或是有車禍(汽車撞擊的聲音);如果是居家照護,可能需要偵測有人跌倒了的聲音、煮開水鳴聲,這些都是智慧家庭所需要注意的;包括工廠的異常情況,比如設備的異常也可以從聲音做先行的偵測。以前要人到處巡邏。如果可以先佈點,就可以二十四小時去偵測他們,當然還是需要人還是要定期的巡邏,但人沒有巡的時候就可以持續的偵測。有一些機器設備剛開始的時候會磨損,有損害時就有一些聲音,這個聲音如果早一點聽到偵測,就可以做提早設備更換,必免整個工廠壞掉,停工就是很嚴重的損失。剛剛提到的聲音偵測事件,都是目前很熱門的研究領域,後續會不會有其他領域研究出來我覺得也有不少,不過是一些東西是很難預測,突然就熱門起來。

瀏覽數: