資料科學實務

115 學年度第 1 學期課程大綱(16 週制)

課程說明

課程名稱資料科學實務英文名稱Data Science Practice
選課代碼1409開課年級大學三年級
學分/類別3 學分/選修授課教師郭士煒
上課時間星期二 06–08上課教室資電 234(電腦教室)
電子郵件swguo@o365.fcu.edu.tw分機3756
請益時間週一第 8–9 節、週三第 6–7 節/資電 218/分機 3756

本課程以 Python 為主要工具,帶領學生完成問題定義、資料取得、清理與整併、探索式資料分析、統計推論、視覺化、模型建立、模型評估及成果溝通等資料科學工作流程。

課程採理論講授、引導式實作與專題導向學習,強調可重現分析、資料倫理,以及對分析結果的正確解釋。一般授課週以「短講+示範+至少 4 個漸進式 Lab+回顧」進行。

授課時數:面授 48 小時+非同步學習 6 小時,合計 54 小時。

課程目標

  1. 理解資料科學流程、機率統計基礎及常用機器學習方法。
  2. 能使用 Python、NumPy、pandas、Matplotlib、Seaborn 與 scikit-learn 處理真實資料。
  3. 能進行資料清理、整併、視覺化、統計檢定、預測與分群分析。
  4. 能選用合適的評估指標,辨識資料洩漏、過度配適及模型限制。
  5. 能以可重現的 Notebook、圖表、口頭簡報及書面報告呈現分析成果。
  6. 能遵守資料隱私、著作權、研究倫理與生成式 AI 使用規範。

先備能力與學習環境

  • 建議具備基礎程式設計概念;未修習 Python 者須完成第 1 週基礎練習。
  • 實作環境以 Google Colab/Jupyter Notebook 為主。
  • 主要套件:NumPy、pandas、Matplotlib、Seaborn、SciPy、scikit-learn、Requests、BeautifulSoup。
  • 主要參考書:Wes McKinney, Python for Data Analysis, 3rd Edition。
  • 補充教材:教師自編投影片、Notebook、公開資料集及指定閱讀。

評分方式

評分項目比重說明
出席10%出席、提問與課堂參與
作業20%課堂 Lab 與指定作業;作業 2、5、9 同時列入非同步學習時數認定
期中30%概念筆試與資料分析實作
期末40%期末專題:問題定義、資料處理、分析、驗證、可重現性、簡報與答辯
合計100%

16 週授課進度

週次日期主題與理論重點課堂實作/評量非同步
109/08資料科學導論與運算環境建置Colab、Python 基礎、讀取資料與初探
209/15科學運算與結構化資料處理NumPy、pandas、篩選排序與描述統計;專題 P0 啟動
309/22資料品質管理與前處理方法型別、缺值、重複值、異常值與清理管線2 小時
409/29機率理論基礎與機率分布隨機模擬與分布;專題 M1 題目與資料鎖定(Gate 1)
510/06抽樣理論與統計估計大數法則、中央極限定理、Bootstrap 與信賴區間
610/13探索式資料分析與資訊視覺化圖表選擇、分布、比較、關係、圖表改善與情境判讀2 小時
710/20多來源資料整合與資料重塑合併、分組彙總與重塑;專題 M2 可重現資料管線
810/27網路資料擷取與應用程式介面HTTP、HTML、分頁擷取、API、資料授權與倫理
911/03期中學習成效評量概念筆試、資料分析實作與錯誤分析
1011/10統計推論與假設檢定檢定與效果量;專題 M3 EDA 與視覺化故事2 小時
1111/17迴歸分析與廣義線性模型多元迴歸、殘差診斷、正則化與邏輯斯迴歸
1211/24監督式分類方法與決策樹模型資料分割與分類指標;專題 M4 基準模型與首輪錯誤分析
1312/01非監督式學習與維度縮減標準化、K-means、分群評估與 PCA
1412/08集成學習與模型驗證交叉驗證與模型解釋;專題 M5 模型比較與錯誤分析
1512/15資料科學專題整合與成果溝通專題 M6 成果稽核、交換組重現檢查、簡報彩排與個別口試
1612/22資料科學專題成果發表與綜合評量專題簡報、Notebook 展示、答辯與同儕評量
面授/非同步時數48+6
總時數54 小時

授課日期與內容得依學校行事曆、停課安排及實際學習進度調整。

作業規劃

作業週次主題主要成果
11Netflix 電影評分資料探索資料檢查、分組統計、3 張圖表與資料發現
23Python 資料處理與清理實作清理函式、品質摘要及清理後 CSV;非同步 2 小時
34隨機模擬、檔案與日期時間分析10,000 次模擬、檔案整理及日期運算
45抽樣分布與中央極限定理抽樣模擬、Bootstrap 信賴區間與解釋
56NumPy 學生成績統計分析統計表、視覺化與文字結論;非同步 2 小時
67pandas 多表資料整合與彙整merge、groupby、pivot_table 與比較圖
78Titanic 資料清理與探索式分析特徵轉換、4 張圖表及建模假設
88公開 API 與網頁資料擷取DataFrame、CSV、資料授權與欄位說明
910Pearson 相關分析與統計推論相關係數、p 值、圖表與正確解釋;非同步 2 小時
1011–14迴歸、分類與主成分分析模型評估、基準比較、誤差與模型限制

除另有說明外,作業須提交可由上而下執行的 Notebook,保留執行結果,並以 Markdown 說明分析發現。

期末專題(學期成績 40%)

專題自第 2 週啟動,第 4 週完成問題與資料來源鎖定;其後依里程碑完成資料清理、EDA 與視覺化、基準模型、模型比較、限制說明及成果發表。重點是端到端實作、工具選擇、結果判讀與可交付成果,不以艱深演算法取勝。

週次里程碑主要繳交/檢核
2P0 啟動候選問題、候選資料、組隊與初步分工
4M1 題目與資料鎖定問題與成功判準、來源/授權、可讀取樣本、資料字典初版與備案
7M2 資料管線可重現清理流程、清理後資料、品質摘要與資料字典
10M3 EDA 與視覺化問題導向 EDA、核心圖表、每圖結論與限制
12M4 基準模型固定切分/比較設計、主要指標、基準結果與首輪錯誤
14M5 模型比較公平比較、穩定性檢查、錯誤分析與模型選擇理由
15M6 成果稽核完整候選版、交換組重現、限制/倫理審查與簡報彩排
16M7 發表與封存簡報、答辯、成果包、書面摘要、分工與 AI 使用揭露
  1. 以真實或公開資料回答明確且可驗證的問題。
  2. 第 4 週須出示可讀取資料樣本、合法來源與備案;其後換題或更換主要資料須經教師核可。
  3. 至少包含資料清理、探索式分析、具目的的視覺化、簡單基準模型及一個公平的比較模型。
  4. 說明評估方法、限制、偏誤、隱私與倫理風險。
  5. 提交資料/授權說明、資料字典、可執行 Notebook/程式碼、環境說明、簡報、書面摘要、分工/版本紀錄及 AI 使用揭露。
  6. 團隊成果以 37 分為主,個人掌握與可驗證貢獻 3 分;個人成績依版本、日誌、署名產出、口試及互評等證據判定。

專題評分規準(40 分)

面向配分判定重點
問題定義與資料可行性5問題可驗證、範圍可行、資料與成功判準對應、來源/授權清楚
資料處理與可重現性7清理決策有依據,流程可重跑,資料字典與環境完整,無資料洩漏
EDA 與視覺化7問題導向、選圖與視覺編碼合適,結論及限制有證據
基準模型、比較與評估8基準清楚、比較公平、指標合適,含穩定性與錯誤分析
結果判讀、限制與倫理5不誇大結論,說明適用範圍、偏誤、失敗案例、隱私與倫理
成果交付、溝通與答辯5成果包完整易用,敘事與圖表清楚,展示穩定且答辯精確
個人掌握與可驗證貢獻3版本/日誌/產出相符,能解釋本人工作與團隊流程
合計40

課堂規則與學術誠信

  1. 作業截止與補交方式依課程平台公告;請假依校規辦理,並由學生自行補齊教材與 Lab。
  2. 程式實作應保留執行結果及必要說明,不接受僅繳交無法執行的程式片段。
  3. 可依教師規定使用生成式 AI 協助構想、除錯或解釋,但須揭露工具、用途及關鍵提示。
  4. 學生須能解釋並驗證提交的程式碼、分析結果與文字;無法說明者視同未完成相應部分。
  5. 不得上傳個資、機密資料或未獲授權資料至第三方 AI 服務。
  6. 引用資料、程式碼、圖表及文字須標示來源;抄襲、代作、偽造資料或考試作弊依校規處理。