← warin.me · รายวิชาEnglish

DATA SCIENCE × DATA ENGINEERING

เรียนให้เห็นทั้งข้อมูล ระบบ และผลที่นำไปใช้ได้

หน้านี้เรียงบทเรียนจากระบบข้อมูลพื้นฐาน ไปสู่ feature, machine learning และ production ไม่จำเป็นต้องเปิดทุกหน้า แต่ควรรู้ว่าบทที่เลือกยืนอยู่ตรงไหนของระบบทั้งหมด

LEARNING PATHS01—0530+ lessons · 4 slide collections · live laboratories

DATA FOUNDATION · PATH 01

เริ่มจากระบบงานและความหมายของข้อมูล

เข้าใจว่า transaction ถูกบันทึกอย่างไร ทีมต่าง ๆ ใช้ data contract ร่วมกันอย่างไร และเหตุใด logical VIEW จึงเป็นจุดเริ่มที่ดีแต่ไม่ใช่คำตอบสุดท้าย

PIPELINES & ANALYTICAL STORAGE · PATH 02

ทำให้ข้อมูลเคลื่อนที่และคำนวณซ้ำได้อย่างเชื่อถือ

จาก workflow orchestration ไปสู่ OLAP และ feature storage โดยแยก freshness, physical work และต้นทุนการดูแลออกจากกัน

FEATURE ENGINEERING · PATH 03

Feature ไม่ใช่แค่สูตร แต่คือหลักฐานที่มีต้นทุนและบริบท

เรียนการใช้ computation ร่วมกัน representation และความหมายเฉพาะสาขา ก่อนส่ง feature ให้โมเดล

SQL & MACHINE LEARNING · PATH 04

เริ่มจากสูตร แล้วค่อยเลือก abstraction ที่เหมาะ

สร้างโมเดลด้วย relational operation ก่อนขยับสู่ declarative interface, library และ recommendation system

PRODUCTION & ONLINE ML · PATH 05

ปิดวงจรจาก feature ไปสู่ prediction, drift และการเรียนรู้ต่อเนื่อง

แยก online inference, online feature computation และ true online learning แล้วเก็บหลักฐานที่เชื่อม delayed label กลับมาได้

ดาวน์โหลดเอกสารประกอบการสอน

สี่ชุดสไลด์สำหรับอ่านต่อเนื่อง

PowerPoint ต้นฉบับช่วยให้เห็นภาพ แผนผัง และลำดับการบรรยาย ส่วนแล็ปด้านบนใช้สำหรับลงมือทดลอง

01

พื้นฐานวิศวกรรมข้อมูล

Data Engineering Foundations

134 สไลด์PowerPoint · 5.18 MB
ดาวน์โหลด ↓
02

การจัดเก็บข้อมูลและระบบข้อมูล

Data Storage and Data Systems

85 สไลด์PowerPoint · 1.83 MB
ดาวน์โหลด ↓
03

การเคลื่อนย้ายและประมวลผลข้อมูลขนาดใหญ่

Moving and Processing Data at Scale

19 สไลด์PowerPoint · 0.38 MB
ดาวน์โหลด ↓
04

ต่อยอดจากวิศวกรรมข้อมูล

Beyond Data Engineering

20 สไลด์PowerPoint · 0.35 MB
ดาวน์โหลด ↓

หลักคิดของรายวิชา

Data Science ถามว่าข้อมูลหมายถึงอะไร ส่วน Data Engineering ทำให้คำตอบนั้นสร้างซ้ำได้

Model ที่ดีไม่สามารถชดเชยข้อมูลที่ผิดเวลา feature ที่รั่ว หรือ pipeline ที่อธิบายไม่ได้ เป้าหมายจึงไม่ใช่เพียงทำนายได้ แต่ต้องรู้ว่าคำตอบเกิดจากระบบใดและเชื่อถือได้เพียงใด