第十三集:資料準備、特徵工程與模型選擇(L21301)

 

第十三集:資料準備、特徵工程與模型選擇(L21301)

歡迎來到今天的考前衝刺解析。今天我們的任務目標非常明確,廢話不多說,我們直接進入課程重點。這一集就是要幫各位建立,並且徹底理解幾個絕對必考的核心觀念,包含資料準備、資料清理、品質檢核、特徵工程,還有 AutoML 跟模型選擇。準備好了嗎?我們直接開始囉。

首先請大家務必記住這個在 AI 領域裡超級重要的「啊哈」時刻。你看喔,很多時候當你的 AI 模型預測不準,你可能以為是演算法寫錯了,但其實可能根本不是模型本身的問題,而是你的資料出了狀況。沒錯,資料才是決定 AI 成敗最真正的關鍵,它絕對是這一切的幕後英雄。我們常說,輸入的是垃圾,輸出的當然也是垃圾,對吧?所以說,資料的品質其實就直接決定了你的 AI 到底能跑多遠。

為了確保大家在考場上萬無一失,接下來這段時間我們規劃了五個結構化的學習步驟:我們從資料準備的基礎流程開始看,接著進入能讓模型效能大躍進的特徵工程,然後會教大家面對眾多模型跟 AutoML 的時候到底該怎麼選,最後呢,當然就是大家最期待的實戰考題測驗,以及考前必備關鍵字總整理。

好,我們馬上進入第一部分,資料準備與清理流程。

大家其實可以把建立 AI 模型想像成是在蓋一棟房子,而資料準備就是在幫這棟房子打地基。你想想,地基如果打得不穩,上面房子蓋得再漂亮,遇到地震還是會垮的,對吧?那這個打地基的流程,它可是有嚴格順序的。

第一步是收集,我們要先把各方的數據通通匯集起來。接著第二步是清理,把那些明顯錯誤或者不合理的雜訊給挑掉。再來第三步,我們要進行品質檢核,確認這批資料的一致性跟可用性到底夠不夠。最後也是超級關鍵的第四步,叫做標註。這四個步驟真的是環環相扣,缺一不可。

那大家可能會問,到底什麼是資料標註?來,用白話文一句話來說:資料標註就是給每一筆資料貼上正確答案,這樣模型才會知道它到底要學什麼嘛。

這邊 Stan 要直接送大家一個考前黃金法則,拜託一定要記下來:在 iPAS 考試裡面,只要你的眼睛看到「監督式學習」這幾個字,請你毫不猶豫的聯想到「它絕對需要標籤」。沒有標註好的標籤,監督式學習是完全跑不動的喔。

當然啦,現實世界裡的資料往往都不太完美,常常會有那種缺失值,也就是資料欄位空了一塊的情況。這就像是我們剛打好的地基上面破了幾個洞,我們總得把它補起來吧。常見的補破洞插補法主要有四種:你可以用整體的平均數來填,或是用排在最中間的中位數,也可以用出現最多次的眾數,甚至你還可以動用另一個模型預測,來推算這個洞到底該填什麼數字。這四種方法大家考前一定要有印象喔。

好,地基穩了,接下來我們進入第二部分,特徵工程與標準化。

如果說前面資料準備是打地基,那特徵工程就是幫你的車子提煉頂級燃料,這是讓你的模型跑出極限效能的秘密武器喔。

來來來,這邊出現了一個考試超級無敵愛考的重點。這張圖非常清楚的點出了一個核心觀念,就是:有些演算法,像是 SVM 也就是支持向量機,或者是 KNN,K 近鄰演算法,它們對資料的數字大小跟尺度是非常非常敏感的。你想想看,如果你的資料裡面一個欄位是身高 170 公分,另一個欄位是存款 100 萬元,這個數字落差太大了,模型看了會完全眼花繚亂。所以針對這種尺度敏感的演算法,我們就必須進行標準化,把所有數字縮放到同一個標準範圍裡面,這樣才能真正有效提升模型的表現。

掌握了資料到底該怎麼處理之後,我們進入第三部分。現在我們要稍微轉換一下視角,從「如何整理資料」變成「如何挑選工具」,也就是模型選擇跟 AutoML。

其實挑選模型就像是我們在用導航一樣。你選路線不能只看哪條路最快,選擇模型也絕對不能只看它的準確率。在真實的商業實戰或者我們的考題裡面,我們必須綜合考量五大面向:第一,你的資料特性是什麼?第二,任務類型是分類還是回歸?第三,團隊的開發時間到底夠不夠?第四,運算起來的計算成本會不會太貴?最後第五點,未來的後續維運跟可解釋性難不難?如果一個模型準確率超高,可是成本直接破表,那它絕對不會是一個好選擇。

那為了解決,或者說加速這個超級複雜的評估過程,技術界就誕生了 AutoML 這個好東西。可能有些人是第一次聽到這個專有名詞,別擔心,我們一樣用一句話來搞定它:AutoML 就是自動化機器學習,它可以幫我們自動找出最適合的模型、自動做特徵工程,甚至幫你調好超參數。這真的能大幅縮短我們開發的時間。

不過呢,這裡有一個大家超級容易失分的迷思陷阱,千萬千萬要避開。很多人以為有了 AutoML,那我們工程師是不是就可以去旁邊喝下午茶了?錯,大錯特錯!AutoML 充其量只是你的加速引擎,它絕對不代表完全不需要人工判斷。最後的驗證、風險評估、還要不要部署的決策,仍然必須依靠人類的專業來把關。這個觀念在考題裡面出現的機率極高,一定要記住。

好的,經過前面這麼紮實的吸收,大家準備好進入實戰的試煉場了嗎?馬上用兩道擬真考題,來幫大家模擬一下實際的 iPAS 考試情境,測一測你剛剛到底吸收了多少。

大家仔細聽好第一題喔:若某專案使用了 SVM 等對尺度敏感的演算法,但模型表現卻不佳,請問可能在資料準備階段遺漏了哪個關鍵步驟?大家可以在心底默念一下答案,給你三秒鐘。3、2、1,好,時間到。這題的答案就是標準化。大家都有答對嗎?

這邊 Stan 直接教你一個秒殺考題的判斷訣竅:在考場上,只要你的眼睛掃到題幹出現「尺度敏感」或者是「距離計算」這類的字眼,像剛剛講的 SVM 或者是 KNN,你的大腦就要立刻連線,馬上在選項裡面找「標準化」這三個字。這絕對是讓你穩穩得分的捷徑。

接著我們來看第二題,這題我們特別聚焦在今天最容易混淆的觀念喔,這是一題是非題:導入 AutoML 技術後,因為系統會自動選擇最佳模型與特徵,因此可以完全省略人工驗證與部署前的風險檢查。請問這句話是圈還是叉?一樣給大家三秒鐘想一下。3、2、1,答案揭曉:這句話是叉,完全錯誤。

我們剛剛才嚴肅地提醒過大家對吧?這就是非常典型的陷阱題。AutoML 幫你做的,只是那些繁瑣的運算跟初步篩選,它的確能幫你加速,但是在真實商業環境下的成本考量、資安風險,還有最終的業務邏輯確認,這些是絕對、絕對不能省略人工判斷的。所以只要在考卷上看到「完全省略人工」這種極端字眼,99% 就是錯誤選項。

太棒了,恭喜各位順利挺過實戰測驗。在我們結束今天的解析之前,讓我們進行最後的考前衝刺,把短期記憶牢牢鎖進你的大腦裡。這邊幫大家整理了考前衝刺你一定要印在腦海裡的三個黃金關鍵字句:

第一,看到「監督式學習」,就必須想到要有標籤,同時要記得模型表現好壞,最先看的就是資料品質。第二,看到「尺度敏感演算法」,像是 SVM、KNN 這些,就一定要注意必須做標準化。第三,請牢記,AutoML 確實可以加速開發,但不代表完全不需要人工判斷。只要把這三句話記到滾瓜爛熟,L21301 這個單元的考分你就穩穩拿下啦。

覺得今天的內容對你有幫助嗎?如果你想在考試中輕鬆過關,誠摯邀請你立刻訂閱、按讚,並且分享我們的 iPAS 陪跑師頻道,讓 Stan 繼續陪著你高效學習。

在下一集的解析中,我們就要邁入 L21302 AI 技術系統集成與部署啦,我們到時候會來探討:千辛萬苦在實驗室訓練好的模型,到底該怎麼順利進到真實的系統中運作。不過在把你的 AI 推向現實世界之前,不妨先問問自己:你的資料地基真的打穩了嗎?敬請期待,我們下次見囉,拜拜。

留言

這個網誌中的熱門文章

WhisperDesktop可以用MP4格式檔案轉文字

G5K-11 打破高牆的兩片玻璃:它如何把我們腦中的幻象,碾成真正的科學?