พื้นฐานวิศวกรรมข้อมูล
DATA SCIENCE × DATA ENGINEERING
เรียนให้เห็นทั้งข้อมูล ระบบ และผลที่นำไปใช้ได้
หน้านี้เรียงบทเรียนจากระบบข้อมูลพื้นฐาน ไปสู่ feature, machine learning และ production ไม่จำเป็นต้องเปิดทุกหน้า แต่ควรรู้ว่าบทที่เลือกยืนอยู่ตรงไหนของระบบทั้งหมด
DATA FOUNDATION · PATH 01
เริ่มจากระบบงานและความหมายของข้อมูล
เข้าใจว่า transaction ถูกบันทึกอย่างไร ทีมต่าง ๆ ใช้ data contract ร่วมกันอย่างไร และเหตุใด logical VIEW จึงเป็นจุดเริ่มที่ดีแต่ไม่ใช่คำตอบสุดท้าย
สร้าง interface ข้อมูลที่มั่นคง ใช้ซ้ำ และตรวจสอบได้
เปิดบทเรียน →เข้าใจว่าเมื่อใด UPDATE จำนวนมากแพงกว่า read–transform–new table
เปิดบทเรียน →ตามข้อมูลจาก transaction, CDC และประวัติศาสตร์ ไปสู่ point-in-time feature
เปิดบทเรียน →เปรียบเทียบ PostgreSQL, DuckDB, ClickHouse, materialization และ IVM
เปิดบทเรียน →PIPELINES & ANALYTICAL STORAGE · PATH 02
ทำให้ข้อมูลเคลื่อนที่และคำนวณซ้ำได้อย่างเชื่อถือ
จาก workflow orchestration ไปสู่ OLAP และ feature storage โดยแยก freshness, physical work และต้นทุนการดูแลออกจากกัน
FEATURE ENGINEERING · PATH 03
Feature ไม่ใช่แค่สูตร แต่คือหลักฐานที่มีต้นทุนและบริบท
เรียนการใช้ computation ร่วมกัน representation และความหมายเฉพาะสาขา ก่อนส่ง feature ให้โมเดล
ค้นหา shared structure และหลีกเลี่ยงการคำนวณซ้ำ
เปิดบทเรียน →เลือกลูกค้า คำนวณ RFM และอ่าน slope เป็น churn signal
เปิดบทเรียน →PCA, SVD, projection, embedding และ model-derived score พร้อม leakage control
เปิดบทเรียน →เห็น complexity ตั้งแต่ sequence scan ถึง structure และ embedding
เปิดบทเรียน →ตีความ trend, momentum, volatility, liquidity และ risk อย่างมีขอบเขต
เปิดบทเรียน →เปรียบเทียบข้อมูล สูตร เวลา และการตีความในสิบสองสาขา
เปิดบทเรียน →เข้าใจสิ่งที่ representation learning ทำแทนได้และสิ่งที่สร้างคืนไม่ได้
เปิดบทเรียน →SQL & MACHINE LEARNING · PATH 04
เริ่มจากสูตร แล้วค่อยเลือก abstraction ที่เหมาะ
สร้างโมเดลด้วย relational operation ก่อนขยับสู่ declarative interface, library และ recommendation system
ไล่สูตร kNN, Naive Bayes, regression, k-means และ Z-score
เปิดบทเรียน →เปิดกล่องดำของ ML หกตระกูลโดยไม่ใช้ Python
เปิดบทเรียน →สร้าง candidate, similarity และ ranking ด้วย SQL
เปิดบทเรียน →แยก SQL-native, SQL-callable และ commercial platform
เปิดบทเรียน →ใช้ In-database ML library หลังเข้าใจสิ่งที่มันซ่อน
เปิดบทเรียน →PRODUCTION & ONLINE ML · PATH 05
ปิดวงจรจาก feature ไปสู่ prediction, drift และการเรียนรู้ต่อเนื่อง
แยก online inference, online feature computation และ true online learning แล้วเก็บหลักฐานที่เชื่อม delayed label กลับมาได้
ดาวน์โหลดเอกสารประกอบการสอน
สี่ชุดสไลด์สำหรับอ่านต่อเนื่อง
PowerPoint ต้นฉบับช่วยให้เห็นภาพ แผนผัง และลำดับการบรรยาย ส่วนแล็ปด้านบนใช้สำหรับลงมือทดลอง
การจัดเก็บข้อมูลและระบบข้อมูล
Data Storage and Data Systems
การเคลื่อนย้ายและประมวลผลข้อมูลขนาดใหญ่
Moving and Processing Data at Scale
ต่อยอดจากวิศวกรรมข้อมูล
Beyond Data Engineering
หลักคิดของรายวิชา
Data Science ถามว่าข้อมูลหมายถึงอะไร ส่วน Data Engineering ทำให้คำตอบนั้นสร้างซ้ำได้
Model ที่ดีไม่สามารถชดเชยข้อมูลที่ผิดเวลา feature ที่รั่ว หรือ pipeline ที่อธิบายไม่ได้ เป้าหมายจึงไม่ใช่เพียงทำนายได้ แต่ต้องรู้ว่าคำตอบเกิดจากระบบใดและเชื่อถือได้เพียงใด