第四集:電腦視覺基礎任務(L2102 電腦視覺技術與應用)

 

第四集:電腦視覺基礎任務(L2102 電腦視覺技術與應用)

今天我們的任務目標非常明確,就是要幫各位建立起電腦視覺最核心的基本概念。我們會一次搞懂它的常見任務,還有整個技術演進的脈絡,把這些基礎打好,你在考場上絕對能無往不利。好,我們直接進入課程重點吧。

那麼讓我們馬上切入正題。你想想看喔,當我們人類睜開眼睛,看懂眼前的世界是再自然不過的事了,對吧?但是,當一台冷冰冰的機器接收到一張圖片,其實對它來說,就只是一大堆密密麻麻的數字而已。那麼機器看到這張圖片,它到底要回答什麼問題?這就是整個電腦視覺要解決的核心挑戰:要讓程式碼真正看懂圖片,我們得先告訴它,你要解開的任務究竟是什麼。

首先呢,我們來給電腦視覺下一個最白話的定義。說穿了,電腦視覺就是讓機器能夠理解影像或是影片裡面的內容。這感覺就像是我們幫機器裝上了一雙敏銳的眼睛,同時還配備了一個會思考的視覺大腦,讓它可以去辨識物體、理解這是一個什麼樣的場景,甚至去分析畫面裡面的人物動作。這是一切高階應用的最底層基礎。

接下來我們進入 iPAS 考試裡面最常出現的五大任務。

第一關,也就是任務一,叫做影像分類。考試如果看到這種關鍵字,你要往哪個方向判斷呢?請各位牢記,影像分類的重點就在於「整張圖」,它回答的核心問題是:這整張影像的主要類別是什麼?比方說,這是一張貓的照片,還是一張狗的照片。它只管整張圖的大方向,並不需要去細究那隻貓或那隻狗具體在畫面的哪個角落,就是這麼直觀。

接著我們看任務二,物件偵測。這跟剛剛講的分類到底有什麼決定性的不同呢?大家想一下,物件偵測不但要知道圖裡面有什麼,更關鍵的是,它必須找出影像中物件的位置還有類別。在實務操作上,我們通常會在畫面上畫出一個又一個的邊界框,明確的標示出貓在這裡,或者是狗在那裡。所以只要考題裡面提到了「位置」還有「框出物件」,不要懷疑,那就是物件偵測。

好,接著我們來到稍微進階一點的任務三,影像分割。這個詞聽起來好像有點學術,對吧?其實一點都不難。用一句話說清楚,它就是把影像切成不同的區域或者是像素類別。你可以想像一下,你手上現在拿著一把極度精準的數位剪刀,沿著畫面裡面物體的輪廓,把像素一個一個完美的剪下來。這可比剛剛畫方塊還要細緻太多了,因為它已經深入到了像素等級的分類。

至於任務四和任務五,則是視覺定位以及行為分析。這些技術聽起來好像科幻電影才會出現,但其實早就已經深入你我的生活了。舉個例子,現在很紅的自動駕駛汽車,它需要非常精準的定位自己在車道三維空間中的位置;那智慧城市的監控系統,它需要去分析異常的交通或是人群行為。這兩個任務本質上,其實就是把我們前面學到的分類、偵測還有分割技術,極致的應用到真實世界的空間跟時間序列裡面。

好的,講了這麼多觀念,我們馬上來實戰演練一下。現在看到的是 iPAS 模擬測驗題的第一題,來檢測一下觀念,請仔細聽題目喔。

當系統需要在畫面中標示出所有行人的具體位置,並用方框將其框出時,這是屬於哪一種電腦視覺任務?來,給你三秒鐘的時間在心裡作答。3、2、1,時間到!正確答案是物件偵測,你答對了嗎?

這裡我要特別提醒大家一個考試非常常見的陷阱:很多人在考場上一緊張,就會把分類還有偵測給搞混了。記住 Stan 的陪跑心法:如果題目今天只問你這張圖裡面有沒有行人,那單純是分類;但我們剛剛這一題,題幹非常強調「具體位置」,而且還要用方框框出來。所以只要看到「尋找具體位置」,毫不猶豫選物件偵測就對了,千萬別踩進這個陷阱裡。

搞通了前面這些任務目標之後,我們來看看這些機器的視覺大腦到底是怎麼一步步變聰明的,回顧一下整個技術演進的脈絡。在早期的電腦視覺,科學家們必須自己辛苦的手動設計公式來找出特徵,這叫做手工特徵。接著到了中期,傳統機器學習出現了,機器開始能夠自己從數據裡面找出規律。到了現代,就是大家常常聽到的 CNN,還有深度學習大爆發的時代,這大大突破了以前的效能瓶頸。而現在一直到未來,我們正大步邁向擁有龐大知識的大型視覺基礎模型時代。

在這裡我們要特別聚焦一下那個真正改變遊戲規則的關鍵技術,也就是 CNN。什麼是 CNN 卷積神經網路呢?我用一句話簡單解釋:它其實就是一種深度學習的架構,特別擅長模仿我們人類的視覺,由淺入深,非常有效率的去辨識影像裡面的邊緣、形狀這些特徵。

CNN 跟深度學習,不僅大幅提升了最基本的影像分類準確率,它更是讓後續難度極高的物件偵測,甚至到超級複雜的語意分割跟實例分割,都變得高度精準,而且真正能夠落地應用。

趁著大家現在記憶猶新,讓我們再透過一道題目來鞏固一下,因為這可是考場上失分率極高的地方哦。來看 iPAS 模擬測驗題的第二題,關鍵字配對。題目是:哪一項技術的目標,是將影像切分至像素層級,以判斷每一個像素屬於哪一個具體類別?一樣給你三秒鐘鎖定你的答案。3、2、1,時間到!

所以最關鍵的一點是,只要你在考題裡面看到「像素」,或是它的英文 pixel,還有「區域層級」這幾個字,請立刻在你的腦海中連線到影像分割。你甚至完全不需要去猶豫其他的選項,這就是 iPAS 考試裡面最直接的關鍵字對應法則。在考場上只要抓對這種關鍵字,你的分數就能輕輕鬆鬆放進口袋裡。

好的,我們今天的單元也差不多進入尾聲了,為了確保大家都能把今天的心法完好無缺的帶上考場,我們來做個最強總結。畫面上的這三個必備關鍵字,請大家一定要牢牢刻在腦海裡喔:第一,問你「整張圖是什麼」,對應的就是影像分類;第二,要找出「位置在哪裡」,對應的就是物件偵測;第三,非常精細的切到「像素等級」,對應的就是影像分割。

只要掌握了這個核心邏輯,在電腦視覺基礎任務這一塊,你已經做好了萬全的準備,是不是覺得其實也沒那麼難?

恭喜你,今天又穩穩地拿下了 iPAS 考試裡一塊非常重要的拼圖。如果你覺得今天這種結構化、幫你抓重點的考點陪讀對你很有幫助的話,請務必訂閱、按讚,並分享我們的 iPAS 陪跑師頻道,讓更多戰友能夠跟你一起順利通關。

在我們下一個單元,我們將會更深入實戰的細節,為大家帶來 L2102 電腦視覺技術與應用:從影像前處理到 CNN 偵測與分割。不過在離開之前,我想留一個有趣的問題給你思考一下:機器在進行剛才說的這一切高深運算之前,究竟是要怎麼把我們手機拍出來的彩色照片,轉換成它看得懂的數字呢?保持你的學習熱情,我們下一個單元為你揭曉。大家繼續加油囉!

留言

這個網誌中的熱門文章

WhisperDesktop可以用MP4格式檔案轉文字

G5K-11 打破高牆的兩片玻璃:它如何把我們腦中的幻象,碾成真正的科學?