← 霸總系列目錄
STATS
{{ statsXP }}
LOVE
{{ loveIndex }}
Data Point {{ hoveredData?.id }}
LOC{{ hoveredData?.location }}
AMT{{ hoveredData?.amount }}
{{ hoveredData.anomalyType }}
Act Ⅰ · Cleaning

先把會撒謊的資料洗乾淨

第三集回到 EP01/EP02 的三幕劇場:第一幕只處理髒資料與異常值,再推進 資料前處理。 顧北辰這次不是在找真愛,他是在一座破碎資料池裡,承認模型第一步不是預測,而是清洗。

Missing Values Rows: {{ totalNodes }} Null: {{ naCount }}

資料清洗:先處理缺失值與重複列

這一格只做「資料到底乾不乾淨」:缺失值、重複資料、格式錯誤。先選策略,再看 Python 怎麼寫。 顧北辰在這裡學到的第一件事是:空白不是安靜,空白是模型看不見。

{{ missingPython }}
{{ missingResult.title }} {{ missingResult.text }}
Outliers Z <= {{ zScoreThreshold.toFixed(1) }} Flagged: {{ outlierCount }}

異常值審訊:先標記,再決定要不要隔離

這一格只處理「太遠的點」。異常值不是一律刪掉,它可能是錯誤、詐騙、也可能是真正重要的稀有事件。 所以先用 Z-score 標出可疑樣本,再按下隔離。

{{ outlierPython }}
{{ outlierResult.title }} {{ outlierResult.text }}
Act Ⅱ · Feature Engineering

把乾淨資料變成模型能吃的欄位

第二幕只做兩件事: 標準化特徵工程。 不再用下一步硬推,而是讓你自己選 Python 寫法與欄位策略。

Scaling {{ currentScaleMethod.title }} {{ normalizeProgress }}%

標準化:讓所有欄位用同一種語言說話

金額、距離、次數不能直接丟給模型比較。這一格只做標準化:選一種縮放方法,看 Python 寫法, 再讓 3D 資料池從失控散點壓回可比較的矩陣。

{{ scalePython }}
{{ scaleResult.title }} {{ scaleResult.text }}
Feature Engineering Noise: {{ features.noise ? 'ON' : 'OFF' }} Leakage: {{ features.leakage ? 'ON' : 'OFF' }}

特徵工程:留下可泛化的訊號

這一格只處理欄位:刪掉噪音、關掉資料洩漏、保留目標訊號。特徵工程不是把資料弄漂亮, 是讓模型不要偷看答案,也不要被熱鬧欄位牽走。

{{ featurePython }}
{{ featureResult.title }} {{ featureResult.text }}
Act Ⅲ · Report

清洗報告送進董事會

完整跑完 pipeline 後,EP03 的重點會回收成一句話: 特徵選擇 不是把資料變少,而是讓模型終於聽得見真正的聲音。

這一集的統計直覺

  • {{ item }}

清洗審訊紀錄

{{ finaleVerdict }}

等你跑到 Done,STATS 會滿格;LOVE 不會。因為前處理只能讓模型變準,不能讓人變值得被愛。

Next Episode Signal

巴黎座標浮出水面

清洗後的資料只留下三個欄位:城市、時間、發生率。顧北辰盯著那串 PARIS_LEFT_BANK 看了十七分鐘,終於下了一道新的命令:不要再問她在哪,開始計算她下一次出現的機率。

於是資料前處理結束,機率分佈開始。下一集,他會把柳如煙的每一次沉默、每一通未接來電、 每一個罕見回覆,都塞進常態、二項與泊松分佈裡,試圖用數學追回一個早就不想被追回的人。

{{ easterMessage.tag }}

{{ easterMessage.title }}

{{ line }}