[110-2 訪談] 機器學習概論
|
|
受訪人:應用數學系 鍾思齊教授
最高學歷:交通大學電子所博士
專長:
機器學習、分群與降維分析、Cryo-EM 與醫學影像分析、資安系統設計、旁通道分析
訪問組別:第 1 組
訪問組員:
吳芃儀 B094020041
洪辰維 B072020018
何武璇 B095040009
黃子芯 B093040046
|
1. 老師以前的求學過程,以及當初進入 AI 領域的契機?
最初是在交大電子所做資料安全,但其實也偏向在做資料分析。因為 那時研究的是硬體安全,它會需要量一些像是功耗、power trace、或是電 磁波的 trace 出來。如果要找到它晶片所使用的密碼學的演算法,或密碼 學對應的金鑰,都是需要透過這些收集來的資料去做分析。所以雖然做的 是資料安全,但其實也是在做分析資料的工作。
後來會往醫療影像和低溫電子顯微鏡影像是在博班的最後一年,經過 一個我們指導老師與史丹佛的教授的合作,過去那邊開始接觸大數據的影像處理,而他們的實驗室主要就是做 DNA 的定序,和相關醫療影像處理。回來台灣後,那邊的教授推薦我到中研院繼續做醫療影像、低溫電子顯微鏡影像的分析,接著便一直做到現在。原因最主要還是對這塊領域有 很大興趣,因為低溫電子顯微鏡或醫療分析,在最近對於蛋白質的了解(如 Covid-19 本質即是蛋白質),透過分析低溫電子顯微鏡拍出來的影像,還原出它的3D 結構,或三維工作週期是如何運動,對於疫苗或是藥物的開發,我相信都是蠻有幫助的。
1. 請問老師這次將會在機器學習概論中帶來什麼樣的內容呢?
我曾教過統計學習與資料探勘,那門課其實跟機器學習還蠻相關的, 應該說使用的方法是很接近的,但目的卻不一樣,因此我會從此角度出 發,並分成以下幾點:
a. 探討機器學習的方法
b. 說明機器學習本身適合哪方面的問題
c. 如何進行機器學習的步驟
d. 遇到的困難:資料缺陷、演算法不適合
e. 為什麼在這幾年他越來越受到大家的重視
f. 舉相關新聞的例子
g. 資料科學人工智慧統計學習傳統統計之間的關聯性差異:機器學習 裡核心的方法分類監督式、非監督式、半監督式學習、強化學習; 計算上的分類 : 批次學習、線上學習
2. 老師的專業領域為醫學影像分析及低溫電顯分析,請問其中主要是在進行什麼樣的研究呢?
醫學影像分析主要是核磁共振所拍出來的影像進行統計的分析,或者是監測細胞活動時所拍下的照片,又或是觀察身體器官時所拍的照片,都可以歸類為醫學影像。低溫電顯分析主要是拍蛋白質,因為蛋白質本身很脆落,如果用電子束去打會很容易造成蛋白質破裂,只能夠讓電子束打一次,再加上穿透式電子顯微鏡的雜訊較高,因此會有一些資料遺失的狀況,所以才需要利用統計或是演算法的方法去做研究。
3. 機器學習跟資料探勘以及數據分析都是有相關的,但往往都會被搞混。老師是否能說說他們之中的差異?如何利用數學統計去實現機器學習?
資料探勘主要在於資料的「前處理」,先利用降維分析、群集分析,以及視覺化使得資料在格式上比較標準。我們可以利用資料探勘找出方法裡 是否有一定的模式,再找出是否有對應的演算法可以去作出 module。而機器學習主要功能在於 module 的「建模」,如何針對不同的問題去選擇恰當 的模型就是機器學習要了解的部分。 那機器學習本身需要非常多數學和統計的知識,因為製造模組需要很多的假設,才能模組變好,也就是「優化」,訓練 module 要運用到線性代數、微積分。我們有可以利用高斯分布、常態分布去評估module 的資料,最後才會去開發機器學習的演算法。以上我們可以發現機器學習和數學統 計是密不可分的,一個 module 的製作,包括評估、分析、測試、應用皆需要有數學統計的背景。
1. 如果學生希望往機器學習或者 AI 的領域發展,會建議學生修習哪些課 程或是具備哪些能力?
機器學習會用到最多的數學就是線性代數和微積分,那如果說是要往整個 AI 或資料科學領域的話,會用到的東西更多,像是統計學各方面,如視覺化、統計推論等。以及假如要得到一個更好的機器學習系統,那不只是建模,你可能還需要了解一些資料庫,或如何去做平行計算,達到更好的效率能用大量 data 建出一個更好的 module。
因此你可能需要去接觸以及修一些相關課程:如果是專注於資料科學方面,資管、資工都有開資料庫的課,應數、資管、資工有平行計算、高速計算,和大數據分析等等;那如果是想走機器人或機器學習這方面的話,你可能還需要具備強化學習相關的知識。
AI 時事
1. 老師對於未來 AI 技術發展的期許?會不會擔心 AI 的過度發展?
從過去一些 QA 競賽、AlphaGo 的比賽,到最近幾年 OpenAI、DeepMind,這些公司所發展出的軟體在各種遊戲中打敗人類的職業選手,可以看出 AI成長的幅度非常快,甚至在某些領域超過人類所能達到的一個精準度,但反之,AI 在過去十年其實也幫助人類完成非常多事情,像是各式各樣常見的雲端服務和推薦系統,舉個例子, Netflix 和 YouTube 推薦給觀眾影片、Google 幫用戶分類圖片、自駕車,甚至是去年推出的 GitHub Copilot,能夠幫助我們快速的寫出程式,讓我們更專注於演算法本身,而不是去 coding每一個內部的 function,換句話說,相比需要勞力或手動去做的事,未來人類能夠更專於在想要解決的問題上。
對於擔心 AI 的過度發展,我認為技術本身一定有好壞兩面,當研究者或者是公司在發展的同時,一定要有能力去引導或教育大家產品的優勢以及潛在威脅,至於如何去應用好的面向,則需要大家一起努力,如果大眾都知道有這項技術,或者了解基本的運作方式,人工智慧在可見的未來一定能夠帶我們走向更好,更不用擔心 AI 擁有意識甚至統治人類的問題發生。
2. 對於全自動駕駛的看法?
我相信技術一定是做得到的,但法規存在很大的問題,如果允許全自動駕駛行駛在道路上,一旦系統犯錯或者程式有 bug 的情況發生,會影響到責任歸屬的問題,所以可解釋性很重要,如果 module 本身是可解釋性的,後續的責任歸咎會需要一些 rule 能說明原因,並且能合理解釋 bug 的來由,透過讓 module 本身透明化這種方式來說服大眾、說服法規,告訴大家目前全自動駕駛是很成熟的系統,且責任歸屬在法規上也很明確,我相信未來是有機會上路的。
3. 對於目前很多社交媒體利用機器學習打擊有害言論或者是阻擋陰謀論 的影片或文字,請問教授認為這個應用會遇到什麼樣的挑戰嗎?
舉 Deepfake 的例子來說,在發展出來後就有研究團隊或競賽仰賴 AI 的 module 偵測影片是不是 Deepfake 所製作的,亦或者辨認與一般影片的差別,但同樣這些新技術也有可能被用來散佈腥羶色的文字,透過仰賴背後 AI 的 module 來避過法規或特定規則,我認為這有點像是矛跟盾,像在資安的領域中,如果比較強大的防毒軟體推出後,病毒會跟著演化,病毒演化之後,防毒軟體也需要相對應的做出改變來偵測新的病毒,兩者形成矛與盾的關係,在未來有可能也會遇到類似的情景。
其他問題
1. AI 與化學的應用?
如果要利用 AI 的相關技術來合成蛋白質的話,技術上方面或許是可行的,但是要有足夠龐大的 database,如此一來,就算不能給出單一個結果,也能幫助化學家縮小可行的合成路徑。
2. 老師身為中研院研究員,想請問當中研院的經歷?
我那時在中研院當博後並沒有遇到太大的困難,指導老師和團隊也都很不錯。而我覺得在中研院當博士後研究員,與在中山大學當助理教授最大的不同在於,中研院研究員單純就只專注於研究,而在大學你會需要教書、做研究,以及一般系上的行政事務,會有較多面向需要去接觸。我認為其中各有利弊,當老師的好處在於,如果有機會教一門課,同時你本身對那門課會有更深刻的瞭解,此外也會從學生那邊得到很不錯的問題與反饋,那這些對於你研究上都會有加分的效果。如果是做博後的話就能完全專注於研究,但也會少了增進其他能力的機會,因此是各有優缺。目前我會比較喜歡在學校當教授,可以做一些教學課程,以及接觸到年輕學生們的想法。
與教授合影

