資料清洗:先處理缺失值與重複列
這一格只做「資料到底乾不乾淨」:缺失值、重複資料、格式錯誤。先選策略,再看 Python 怎麼寫。 顧北辰在這裡學到的第一件事是:空白不是安靜,空白是模型看不見。
{{ missingPython }}
第三集回到 EP01/EP02 的三幕劇場:第一幕只處理髒資料與異常值,再推進 資料前處理。 顧北辰這次不是在找真愛,他是在一座破碎資料池裡,承認模型第一步不是預測,而是清洗。
這一格只做「資料到底乾不乾淨」:缺失值、重複資料、格式錯誤。先選策略,再看 Python 怎麼寫。 顧北辰在這裡學到的第一件事是:空白不是安靜,空白是模型看不見。
{{ missingPython }}
這一格只處理「太遠的點」。異常值不是一律刪掉,它可能是錯誤、詐騙、也可能是真正重要的稀有事件。 所以先用 Z-score 標出可疑樣本,再按下隔離。
{{ outlierPython }}
第二幕只做兩件事: 標準化 與 特徵工程。 不再用下一步硬推,而是讓你自己選 Python 寫法與欄位策略。
金額、距離、次數不能直接丟給模型比較。這一格只做標準化:選一種縮放方法,看 Python 寫法, 再讓 3D 資料池從失控散點壓回可比較的矩陣。
{{ scalePython }}
這一格只處理欄位:刪掉噪音、關掉資料洩漏、保留目標訊號。特徵工程不是把資料弄漂亮, 是讓模型不要偷看答案,也不要被熱鬧欄位牽走。
{{ featurePython }}
完整跑完 pipeline 後,EP03 的重點會回收成一句話: 特徵選擇 不是把資料變少,而是讓模型終於聽得見真正的聲音。
{{ finaleVerdict }}
等你跑到 Done,STATS 會滿格;LOVE 不會。因為前處理只能讓模型變準,不能讓人變值得被愛。
清洗後的資料只留下三個欄位:城市、時間、發生率。顧北辰盯著那串 PARIS_LEFT_BANK
看了十七分鐘,終於下了一道新的命令:不要再問她在哪,開始計算她下一次出現的機率。
於是資料前處理結束,機率分佈開始。下一集,他會把柳如煙的每一次沉默、每一通未接來電、 每一個罕見回覆,都塞進常態、二項與泊松分佈裡,試圖用數學追回一個早就不想被追回的人。
{{ line }}