| 課程名稱 | 資料科學實務 | 英文名稱 | Data Science Practice |
|---|---|---|---|
| 選課代碼 | 1409 | 開課年級 | 大學三年級 |
| 學分/類別 | 3 學分/選修 | 授課教師 | 郭士煒 |
| 上課時間 | 星期二 06–08 | 上課教室 | 資電 234(電腦教室) |
| 電子郵件 | swguo@o365.fcu.edu.tw | 分機 | 3756 |
| 請益時間 | 週一第 8–9 節、週三第 6–7 節/資電 218/分機 3756 | ||
本課程以 Python 為主要工具,帶領學生完成問題定義、資料取得、清理與整併、探索式資料分析、統計推論、視覺化、模型建立、模型評估及成果溝通等資料科學工作流程。
課程採理論講授、引導式實作與專題導向學習,強調可重現分析、資料倫理,以及對分析結果的正確解釋。一般授課週以「短講+示範+至少 4 個漸進式 Lab+回顧」進行。
授課時數:面授 48 小時+非同步學習 6 小時,合計 54 小時。
| 評分項目 | 比重 | 說明 |
|---|---|---|
| 出席 | 10% | 出席、提問與課堂參與 |
| 作業 | 20% | 課堂 Lab 與指定作業;作業 2、5、9 同時列入非同步學習時數認定 |
| 期中 | 30% | 概念筆試與資料分析實作 |
| 期末 | 40% | 期末專題:問題定義、資料處理、分析、驗證、可重現性、簡報與答辯 |
| 合計 | 100% |
| 週次 | 日期 | 主題與理論重點 | 課堂實作/評量 | 非同步 |
|---|---|---|---|---|
| 1 | 09/08 | 資料科學導論與運算環境建置 | Colab、Python 基礎、讀取資料與初探 | |
| 2 | 09/15 | 科學運算與結構化資料處理 | NumPy、pandas、篩選排序與描述統計;專題 P0 啟動 | |
| 3 | 09/22 | 資料品質管理與前處理方法 | 型別、缺值、重複值、異常值與清理管線 | 2 小時 |
| 4 | 09/29 | 機率理論基礎與機率分布 | 隨機模擬與分布;專題 M1 題目與資料鎖定(Gate 1) | |
| 5 | 10/06 | 抽樣理論與統計估計 | 大數法則、中央極限定理、Bootstrap 與信賴區間 | |
| 6 | 10/13 | 探索式資料分析與資訊視覺化 | 圖表選擇、分布、比較、關係、圖表改善與情境判讀 | 2 小時 |
| 7 | 10/20 | 多來源資料整合與資料重塑 | 合併、分組彙總與重塑;專題 M2 可重現資料管線 | |
| 8 | 10/27 | 網路資料擷取與應用程式介面 | HTTP、HTML、分頁擷取、API、資料授權與倫理 | |
| 9 | 11/03 | 期中學習成效評量 | 概念筆試、資料分析實作與錯誤分析 | |
| 10 | 11/10 | 統計推論與假設檢定 | 檢定與效果量;專題 M3 EDA 與視覺化故事 | 2 小時 |
| 11 | 11/17 | 迴歸分析與廣義線性模型 | 多元迴歸、殘差診斷、正則化與邏輯斯迴歸 | |
| 12 | 11/24 | 監督式分類方法與決策樹模型 | 資料分割與分類指標;專題 M4 基準模型與首輪錯誤分析 | |
| 13 | 12/01 | 非監督式學習與維度縮減 | 標準化、K-means、分群評估與 PCA | |
| 14 | 12/08 | 集成學習與模型驗證 | 交叉驗證與模型解釋;專題 M5 模型比較與錯誤分析 | |
| 15 | 12/15 | 資料科學專題整合與成果溝通 | 專題 M6 成果稽核、交換組重現檢查、簡報彩排與個別口試 | |
| 16 | 12/22 | 資料科學專題成果發表與綜合評量 | 專題簡報、Notebook 展示、答辯與同儕評量 | |
| 面授/非同步時數 | 48+6 | |||
| 總時數 | 54 小時 | |||
授課日期與內容得依學校行事曆、停課安排及實際學習進度調整。
| 作業 | 週次 | 主題 | 主要成果 |
|---|---|---|---|
| 1 | 1 | Netflix 電影評分資料探索 | 資料檢查、分組統計、3 張圖表與資料發現 |
| 2 | 3 | Python 資料處理與清理實作 | 清理函式、品質摘要及清理後 CSV;非同步 2 小時 |
| 3 | 4 | 隨機模擬、檔案與日期時間分析 | 10,000 次模擬、檔案整理及日期運算 |
| 4 | 5 | 抽樣分布與中央極限定理 | 抽樣模擬、Bootstrap 信賴區間與解釋 |
| 5 | 6 | NumPy 學生成績統計分析 | 統計表、視覺化與文字結論;非同步 2 小時 |
| 6 | 7 | pandas 多表資料整合與彙整 | merge、groupby、pivot_table 與比較圖 |
| 7 | 8 | Titanic 資料清理與探索式分析 | 特徵轉換、4 張圖表及建模假設 |
| 8 | 8 | 公開 API 與網頁資料擷取 | DataFrame、CSV、資料授權與欄位說明 |
| 9 | 10 | Pearson 相關分析與統計推論 | 相關係數、p 值、圖表與正確解釋;非同步 2 小時 |
| 10 | 11–14 | 迴歸、分類與主成分分析 | 模型評估、基準比較、誤差與模型限制 |
除另有說明外,作業須提交可由上而下執行的 Notebook,保留執行結果,並以 Markdown 說明分析發現。
專題自第 2 週啟動,第 4 週完成問題與資料來源鎖定;其後依里程碑完成資料清理、EDA 與視覺化、基準模型、模型比較、限制說明及成果發表。重點是端到端實作、工具選擇、結果判讀與可交付成果,不以艱深演算法取勝。
| 週次 | 里程碑 | 主要繳交/檢核 |
|---|---|---|
| 2 | P0 啟動 | 候選問題、候選資料、組隊與初步分工 |
| 4 | M1 題目與資料鎖定 | 問題與成功判準、來源/授權、可讀取樣本、資料字典初版與備案 |
| 7 | M2 資料管線 | 可重現清理流程、清理後資料、品質摘要與資料字典 |
| 10 | M3 EDA 與視覺化 | 問題導向 EDA、核心圖表、每圖結論與限制 |
| 12 | M4 基準模型 | 固定切分/比較設計、主要指標、基準結果與首輪錯誤 |
| 14 | M5 模型比較 | 公平比較、穩定性檢查、錯誤分析與模型選擇理由 |
| 15 | M6 成果稽核 | 完整候選版、交換組重現、限制/倫理審查與簡報彩排 |
| 16 | M7 發表與封存 | 簡報、答辯、成果包、書面摘要、分工與 AI 使用揭露 |
| 面向 | 配分 | 判定重點 |
|---|---|---|
| 問題定義與資料可行性 | 5 | 問題可驗證、範圍可行、資料與成功判準對應、來源/授權清楚 |
| 資料處理與可重現性 | 7 | 清理決策有依據,流程可重跑,資料字典與環境完整,無資料洩漏 |
| EDA 與視覺化 | 7 | 問題導向、選圖與視覺編碼合適,結論及限制有證據 |
| 基準模型、比較與評估 | 8 | 基準清楚、比較公平、指標合適,含穩定性與錯誤分析 |
| 結果判讀、限制與倫理 | 5 | 不誇大結論,說明適用範圍、偏誤、失敗案例、隱私與倫理 |
| 成果交付、溝通與答辯 | 5 | 成果包完整易用,敘事與圖表清楚,展示穩定且答辯精確 |
| 個人掌握與可驗證貢獻 | 3 | 版本/日誌/產出相符,能解釋本人工作與團隊流程 |
| 合計 | 40 |