第五集:影像標註、前處理、CNN 與電腦視覺風險(L2102 電腦視覺技術與應用)

 

第五集:影像標註、前處理、CNN 與電腦視覺風險(L2102 電腦視覺技術與應用)

進入課程重點,幫各位建立理解影像標註、前處理、CNN、物件偵測、影像分割與電腦視覺風險。準備好跟我一起破關了嗎?我們開始吧!

在我們被一堆專有名詞淹沒之前,你想過一個真實世界的問題嗎?同一個物件,在不同光線下模型還認得出來嗎?比如說大晴天、大陰天,甚至是嚴重背光的時候,AI 真的有辦法精準認出它嗎?

第一部分,我們就先來拆解影像管線,看看什麼是前處理與 CNN。

你知道嗎?其實任何一個電腦視覺專案,絕對不是直接把照片丟給 AI 讓它自己去瞎猜。最關鍵的第一步叫做資料標註。簡單來說,就是我們必須先用人工的方式,在影像上畫個框或是塗色,清清楚楚的告訴模型畫面裡究竟有什麼,這樣模型在開始運算前才會知道目標在哪裡。如果沒有高品質的標註,後面演算法寫得再神也是白搭。

標註好之後,影像在正式餵給模型吃之前,還得先做一系列的清理與標準化,這就是所謂的影像前處理。它包含了把圖片縮放成統一的大小、裁切掉沒用的邊緣、去除模糊雜訊來去噪、讓數值分布一致的標準化,最後還有一個超級重要的步驟,也就是資料增強。

那麼問題來了,到底什麼是資料增強?一句話說清楚:它就是刻意去修改、翻轉,或者調整影像的亮暗度,來提升模型面對環境差異時的適應能力,也就是泛化能力。

沒錯,這就完美回到了我們一開始說的那個「不同光線」的問題。透過資料增強,我們主動餵給模型各種光線變化的圖,它以後就不會被光影給騙倒了。

好,當影像洗得乾乾淨淨之後,終於要進入 CNN,也就是卷積神經網路了。CNN 聽起來很玄對吧?一句話解釋:CNN 就是透過一層一層的卷積層,像是一台超級掃描機一樣劃過圖片,把影像裡的邊緣、紋理、形狀這些局部特徵通通萃取出來。這是現代電腦視覺最核心的引擎喔。

接著進入第二部分,模型抓到特徵後的下游任務,我們來比較物件偵測與影像分割。這兩個概念最容易搞混了。當 CNN 抓出特徵後,物件偵測做的事情,是畫一個邊界框把目標物體框起來,然後告訴你框框裡是什麼。但是影像分割就更細緻了,它是直接沿著物件的真實輪廓,進行像素層級的上色與分類。一個是畫方形框框,另一個是逐像素塗滿顏色,這樣對比是不是就很清楚了。

這邊大家精神來一下,針對 iPAS 考試,考試看到這種關鍵字就往哪個方向判斷?只要在題幹看到「邊界框」,想都不用想,答案就是物件偵測;如果題目特別強調「像素」或是「精確區域」,那絕對是影像分割。把這個直覺的反射動作記下來,這題我就拿分。

第三部分,我們來聊聊實際應用,還有大家最怕遇到的導入風險。

電腦視覺的威力真的是無所不在,從工廠產線上的品質檢測、醫院裡幫醫生判讀的醫療影像、到路口的智慧監控、路上的自動駕駛汽車,甚至是無人機導航,這些超強的應用,全部都是靠剛剛說的 CNN 影像管線撐起來的。

但先別急著覺得 AI 萬能,實作上可是有極大風險的。如果在導入時沒有做好嚴謹的場域測試,遇到拍攝條件不一樣,或是訓練的資料有嚴重的偏差,系統絕對會發生大誤判。另外,因為攝影機隨時都在拍,隱私問題也是我們導入電腦視覺時必須嚴肅面對與治理的課題。

好,第四部分,直接進入 iPAS 壓力測試,幫大家釐清觀念。來看隨堂測驗第一題:實務上為了提升模型對光線差異等拍攝條件的泛化能力,我們應該要使用影像前處理的哪一種技術呢?給你幾秒鐘想一下。

啊哈,你答對了嗎?答案就是資料增強。為什麼呢?題目裡說要提升模型對光線差異的泛化能力,只要看到「泛化能力」跟「環境差異」,對應的絕招絕對就是資料增強。

再來第二題:哪一項電腦視覺任務,會輸出像素層級的分類結果,藉此來標示出精確的影像區域?運用一下剛剛教的關鍵字直覺,回憶一下,沒錯,就是影像分割。大家還記得嗎?考試看到這種關鍵字就往這個方向判斷,只要看到「像素層級」或是「精確區域」,指的絕對是影像分割;看到「邊界框」才是物件偵測。把這兩個對比抓穩就對了。

最後第五部分,我們來到考前必備總結。上考場前這三個關鍵字請深深印在腦海裡:第一,要解決拍攝差異、提升模型泛化能力,找資料增強;第二,看到邊界框選物件偵測,看到像素選影像分割;第三,CV 導入的最大風險,通常來自未經測試的資料偏差以及隱私問題。這三點顧好,你的底子就非常紮實了。

希望今天這一集重點複習,有幫大家省下很多啃磚頭書的時間。如果你覺得有收穫,記得訂閱、按讚並分享 iPAS 陪跑師頻道喔。

下一集我們將帶大家拆解 L2103 生成式AI技術與應用:文本、圖像、語音生成怎麼考。我是 Stan,我們下次見。



留言

這個網誌中的熱門文章

WhisperDesktop可以用MP4格式檔案轉文字

G5K-11 打破高牆的兩片玻璃:它如何把我們腦中的幻象,碾成真正的科學?