跳到主要內容區

[訪談] 機器學習概論

郭美惠教授

   受訪人:應用數學系 郭美惠教授   
   組別:第 1 組   

   訪問組員:   
       B061010037 吳昀庭   
       B063100016 陳昱辰   
       B064020036 金妍彣
       B064030033 古耕榕   

   訪談提問   

1. 老師會在這次機器學習概論的主題中提到什麼概念? 

機器學習裡面,主要會從 data science 談起,因為機器學習與 data science有強的關連性,data science 因大數據而興起,過程中需要許多工具,其中機器學習就是一個重要的工具之一。再來會介紹機器學習有分成哪些種類,像是監督式學習、非監督式學習,而這兩類的意義為何,以及他們常用的方法與應用的例子。最後會統整機器學習基本的概念與例子,並試著與 AI 做結合。

2. 根據網路搜尋資料,老師所帶的學生大概從 105 年左右開始有機器學習相關的碩士論文,老師也開始參與許多大數據的計畫,想請問老師為什麼會開始接觸機器學習以及大數據這塊領域?   

因為大數據興起,學統計的老師進入門檻很低,藉由這樣的優勢自然就會想往大家關心的題目去做研究。雖然數據的型態隨著工具的發展而變得很多元,例如影像、聲音、文字的數據在手機、社群媒體、網際網路等科技發展後而開始出現,這些數據以傳統統計可能沒辦法處理,可是當把這些資料轉換成數值型的資料,統計方法很自然地就可以使用,當然也是要自己覺得有趣,而現在統計需要與更多的實務面、新型態的資料分析結合在一起,希望學生在這方面能有比較多的訓練,未來找工作比較方便,所以開始往這領域研究。

3. 老師所指導的論文中,跟機器學習的論文,如:應用機器學習配對交易、最佳訂單執行問題的強化學習演算法、利用數據流預測潛在顧客等,皆和商業比較有關,是否反映了機器學習目前的趨勢? 

並不是這麼說的,因為老師本身是做時間序列,這個在財務方面的應用比較多,所以自然就把學生帶往那方面。所以各行各業只要數據的收集是 OK 的,再來就是分析技術的問題了,所以涉及的層面很廣,看你是要扮演什麼角色而去做研究分析。

4. 機器學習跟統計學習有很多相似處,例如兩者都是藉由大量的數據分析,建構模型並給出預測,因此很多人無法區分兩者的差異,認為機器學習是統計學的加強版。請問老師認為統計和大數據的差別?分別的盲點?   

機器學習是 computer science 的人會使用的語言,用的人很多,所以大家都說「機器學習」;而統計學習是統計相關的人在用的。二者無太大的差別,只是強調的重點有一點點不一樣,如:統計學習必較注重在模型的解釋、用這個方法背後的統計意義是甚麼,這對我們而言,能夠去解釋是很重要的一塊,因為還是要幫助人類學習,它的解釋力是我們很看重的;機器學習比較注重在模型的預測能力和表現,會比較忽略統計這一方面。雖然強調的面向不同,但是兩方要互相學習,共同創造更多的方法來做問題。至於要如何稱呼,不同領域的人會用喜歡的方式稱呼它。二者雖然有一點點的不一樣,但本質上都是來解決數據的問題。

  • 小結:

統計學習:著重在後面建立完模型的「解釋」,重視預測結果的背後原因。

機器學習:強調應用結果,用過往的數據統計、「預測」結果,重視預測的好與不好。

5.  老師會建議哪個領域或是學院的學生應該要接觸這塊領域呢?

現在接觸到很多不同背景的都想走這一塊,像是:物理、政治財經和理學院都有接觸到。感覺各個領域都有 data science 的需求,可是要釐清自己在團隊中扮演的腳色是甚麼?像是有位專長為劇場藝術的老師,他想要做一位模仿鄧麗君的人放在劇場上,那也算是 AI 的應用,但是那位老師不需要「研發」,他在「應用」這些技術。所以,要想清楚自己在團隊中扮演哪一個角色,然後把你這方面所要負責的東西學好,當有需求的時候去找可以幫忙的人。

6. 老師認為最後可以把深度學習加入到統計的領域中嗎?

深度學習是 computer science 發展出來的東西,講的是類神經網絡,layer 變得更深一點;統計的人也試著要幫它做一些解釋,在深度學習上嘗試著用簡單的模型幫助黑盒子做解釋力。
所以可以說深度學習是機器學習的一部分,統計的人也想幫深度學習找到解釋的可能性,而不是只是一個黑盒子,探討模型出來後,為甚麼可以找到/不能找到它的優點的原因。

瀏覽數: