跳到主要內容區

[訪談] AI 與視覺

楊惠芳教授
   受訪人:資訊管理學系 楊惠芳教授   
   組別:第 5 組   

   訪問組員:   
       
B055090043 張政彥   
       
B062040046 潘玠霖    
       
B064012011 陳品程  
       
B083011032 何彥霆   

 
 
   關於教授及當天演講:  

1. 請問老師的主要研究領域是什麼呢?(目前有什麼研究):

我主要在做的是image searching,類似google 圖像檢索的功能,輸入一張圖片後在資料庫裡檢索,然後回傳相似的照片(以圖搜圖)。

2. 像google 這樣以圖搜圖的功能通常需要在很龐大的資料庫中檢索,請問老師的研究是以什麼方式克服的呢?

關於這方面涉及到我們以前在做的研究,簡單來說我們想要像binary features 那樣,想辦法用一個比較短的、低維的方式來儲存資訊,比如用較短的vector(陣列)來表示image(圖像),而我們在辨識兩張圖是否不同的時候,就可以直接比較vector 的距離。
這樣當我們在比較一個200*200*3 這樣比較高維的圖像時,就可以劃成更緊湊的200 個*200 個*3 個短維度,就好像是一張圖切成許多塊,每塊都以數字來表示,這稱為features。接下來就是去計算兩個features 像不像,但之前vector 是以floating point(浮點值,可理解為電腦儲存的小數)來儲存,電腦計算floating point 時是比較慢的,所以我們就試著以binary value,就是0101 這樣的數字來表示,加快電腦的計算速度。說這麼多有點扯遠了(笑),總之我們就是想以比較簡單的方式來表示資料,並以電腦能快速比較的方式儲存,這樣就能加快image searching 的速度了。

3. 再來請老師介紹下當天演講的大綱吧!

其實這門課上次也有開,不過這次我想在後面講點不一樣的東西。前面我還是會著重在電腦視覺為何,大概講下什麼是電腦視覺、常應用的問題領域、基礎介紹、可以做什麼等等。
而後半部我想說的是,現在computer vision 這塊領域在fashion 上有怎麼樣的應用,比如:在網站上看流行衣服的圖片時,電腦可以幫你判斷尋找出類似風格的衣服。現在不是有很多人會在網上po 出穿搭嗎?電腦也可以透過這些圖片來分析出流行趨勢,甚至你給出一個上半身的穿著後,就可以給你一個下半身的穿搭。我會想說這樣的內容。

   關於主題----AI 與視覺:  

1. 關於演講主題----AI 與視覺,在探討AI 以前想先請問教授,所謂的「電腦視覺」是個怎樣的領域呢?

所謂的電腦視覺,簡單來說就是讓電腦可以「理解圖片」。對我們(人類)而言,在看圖片時可以很直覺的理解圖片(圖片的時間地點、景象及事物等等),我們希望可以發掘一些演算法,讓電腦也可以理解這些圖片資訊。比方說(圖中的)人在哪裡、有幾個人這樣比較基本的問題,而比較高階的,也是目前比較多研究的目標,像是能判斷圖中這個人有怎樣的意圖。總而言之,想辦法讓電腦像人一樣理解圖片,就是這樣的領域。

2. 現在Ai 與視覺最主要、最普遍的產品是什麼呢?

Face(臉部辨識)啊!我認為這應該算是現在應用最好的領域了,現在這方面的科技也發展得很成熟,可以做出相當精準的辨識。

3. 請老師介紹下目前這個領域有怎樣的特定領域的應用呢?

比如說製造業,不是難免會有不良品嗎?就可以用AI 與vision 來判斷你這是好的,還是不好的。還有像是化妝品公司,像試擦,或試穿、試戴這樣,不是真的試用,而是以影像的方式即時合成在人身上,讓人更方便比對好不好看。而如果是跟醫院合作,則可以分析醫院影像,比如有些影像細節比較微小,就可以幫醫生初步判別腫瘤等等的位置。不然就是機器人、機器手臂的移動,也可以透過影像來分析他要怎麼動,比如看護機器人,他需要透過自己的視覺影像來判斷老人等看護者現在的狀態,像他有沒有跌倒、有沒有不舒服這樣的判斷都是這方面的應用。最後,就是很多業界都在做的自動駕駛了,總之,只要是有input camera 的,基本上都相關於vision 這塊領域的應用。

4. 您認為vision 這塊領域可以朝哪些方向開發呢?

其實(方向)蠻多的喔!主要看每個人的興趣,確定興趣後再對那的方向去做開發,通常我們都是這樣研究的。像有的人對Video 有興趣,就會去分析video;而有的人對「產生圖」很有興趣,他就會去做generative model。比如說現在不是有很多deepfake 嗎?註1 就是說他會產生假的圖,但跟真的又很像,這部分也是vision。我覺得就是這幾年deep learning 快速發展後,vision 這塊領域才能做到現在這樣好,因為這領域需要很多的training data。總之就是看需求吧!每個公司的需求和定位都不同, 像amazon 最近的辨識應用、oppo 的照人像、facebook 也可以做相關的搜尋引擎後再開發商業模式,我覺得這就是看每個公司的著眼點為何,而很多方面都可以結合vision 的開發。

5. 最後問個題外話,身為研究者,老師對學習上有怎麼樣的建議呢?

怎麼問這麼難的問題(笑)!其實這部分我認為,興趣的驅動很重要,你要對這一件事產生喜愛,這樣才比較有辦法驅使你前進,以及邁過學習上的障礙。這個其實很難回答,但答案我想大家都知道(苦笑),總之就是要有自己的動力來自動自發,教授出再多作業都比不上這點重要。

註1:deep learning 深度學習和fake 偽造的混成詞,專指基於人工智慧的人體圖像合成技術的應用。

瀏覽數: