Raw Input → Neural Network
ยืดหยุ่น แต่ต้องประมาณ division และ invariance จาก data
—REPRESENTATION · INFORMATION · INDUCTIVE BIAS
ถ้า Z ไม่ได้อยู่ใน X — network จะเรียน Z จากไหน?
Deep Learning เรียน Representation จาก Information ที่ได้รับได้ทรงพลังมาก แต่ไม่ใช่ Information Generator หน้านี้ไม่ได้ถามว่า Feature Engineering หรือ Deep Learning “ใครดีกว่า” เราจะถามว่า ข้อมูลอยู่ที่ไหน ความสัมพันธ์ถูก Represent อย่างไร และต้องใช้ข้อมูลเท่าใดเพื่อเรียนสิ่งที่เรารู้อยู่แล้ว
FEATURE LEARNABILITY SPECTRUM
เลือกแต่ละประเภทเพื่อดูว่า Information อยู่ใน Input หรือไม่ และ Architecture ต้องมี Inductive Bias แบบใด
Spectrum นี้เป็นกรอบคิด ไม่ใช่กฎตายตัว ผลขึ้นกับ Input Representation, Architecture, Training Objective และ Distribution ของข้อมูล
INFORMATION THAT DOES NOT EXIST
เมื่อ Hidden Variable มีอิทธิพลต่อ Y มากขึ้น Model ที่เห็นเฉพาะ X จะเป็นอย่างไร?
INTERACTNo architecture can recover information that is absent from its input. Simulation นี้เป็น deterministic conceptual model ไม่ใช่ benchmark จริง
SAMPLE EFFICIENCY
Efficiency = Output / Input อาจเรียนจากตัวอย่างได้ แต่ต้องเสียข้อมูลเท่าใดในการค้นพบ Ratio นี้ใหม่?
INTERACTยืดหยุ่น แต่ต้องประมาณ division และ invariance จาก data
—ใส่ relation ที่รู้แล้ว จึงใช้ sample น้อยกว่าใน simulation นี้
—คำถามที่ดีกว่า “เรียนได้ไหม” คือ “ต้องใช้ข้อมูลเท่าใดเพื่อ Rediscover สิ่งที่เรารู้อยู่แล้ว?” นี่คือมุมหนึ่งของ Sample Efficiency
RAW RECORDS VS RELATIONSHIPS
A → B
B → C
C → D
D → A
B → Dมองทีละแถว คุณเห็น Cycle หรือ Community ชัดแค่ไหน?
MLP ที่รับ Record แยกกันไม่เห็น Topology นี้ ส่วน GNN ช่วยได้เพราะเราเปลี่ยน Representation เป็น Graph แล้ว การเปลี่ยน Architecture ไม่ได้ทำให้ Representation Design หายไป
DOMAIN KNOWLEDGE VS BRUTE FORCE
ลาก Feature ลงกล่องตามแหล่งกำเนิดของ Information แล้วกดตรวจคำตอบ
PREDICTIVE MAINTENANCE
ยืดหยุ่น · อาจพบ pattern ใหม่
data hungry · compute สูง · shortcut risksample efficient · interpretable · prior knowledge
อาจทิ้งข้อมูลใหม่ · พึ่ง expertraw signal + known features
เพิ่ม integration และ validation costTHE MOST DANGEROUS CASE
Training set ทำให้ Shape และ Background สัมพันธ์กับ Class พร้อมกัน
Deep Learning optimize Objective ที่เราให้ ไม่ได้ค้นพบ Explanation ที่เราตั้งใจโดยอัตโนมัติ
CORRELATION ≠ MECHANISM
เลือกคำตอบ แล้วอธิบายว่าข้อมูล Observational เพียงพอหรือไม่
FEATURE ENGINEERING TAXONOMY
| Feature type | DL approximate? | Information in X? | Data requirement | Interpretability | Domain knowledge |
|---|
INTERACTIVE CHALLENGE
FINAL MENTAL MODEL
อย่าถามเพียงว่า “Deep Learning เรียนสิ่งนี้ได้ไหม?” ให้ถามว่า Model มี Information อะไร เรากำลังใส่ Assumption อะไร และมันต้องเสีย Data เท่าใดเพื่อค้นพบสิ่งที่เรารู้อยู่แล้ว
Feature engineering is not merely preprocessing.
At its best, it is the process of injecting knowledge about the problem into its representation.