← warin.me · Data Science and EngineeringEnglish

DOMAIN FEATURE ENGINEERING ATLAS

สูตรอาจไม่ซับซ้อน แต่ความหมายของ Feature อยู่ในบริบทของแต่ละสาขา

Feature ที่ใช้ซ้ำได้ไม่ใช่เพียงตัวเลข แต่ต้องบอกว่าวัดอะไร ข้อมูลพร้อมเมื่อใด คำนวณอย่างไร และไม่ควรตีความเกินขอบเขตอย่างไร หน้านี้เปรียบเทียบ 12 สาขาด้วยลำดับการเรียนรู้เดียวกัน

01สาขา
02Features
03ตัวอย่างข้อมูล
04การคำนวณ
05เวลาและต้นทุน
01

vital signs · laboratory · encounter

สุขภาพและการวิเคราะห์ทางคลินิก

Healthcare & Clinical Analytics

Features สำคัญ—ตั้งแต่ข้อมูลต้นทางจนเป็น Feature Contract ที่ใช้ซ้ำได้

เลือก Feature เพื่อเปิดดูข้อมูล ขั้นคำนวณ Output Contract ต้นทุนประมวลผล และขอบเขตการตีความ

01

Heart-rate variability

SDNN, RMSSD จากระยะ R–Rสะท้อนความแปรปรวนของจังหวะหัวใจ ไม่ใช่คำวินิจฉัย
วัดอะไร และมีประโยชน์อย่างไร

สะท้อนความแปรปรวนของจังหวะหัวใจ ไม่ใช่คำวินิจฉัย

ข้อมูลนำเข้า
vital signs · laboratory · encounter
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
patient_id, event_time, HR=96, HR_prev=82, SpO2=93, temp=38.1ใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. SDNN, RMSSD จากระยะ R–R
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
HR_delta = 96−82 = 14 bpm; fever = 1; hours_since_medication = 6ตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
heart-rate_variability__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
O(n) ต่อผู้ป่วย; rolling 30 วันบน 1M events ≈ วินาที–นาทีใน columnar engineเวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
ต้องยึด event time, หน่วยวัด และช่วงที่ข้อมูลพร้อมใช้จริง ห้ามนำผลตรวจที่ออกภายหลังมาใช้ย้อนหลัง
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
02

NEWS-like trend

แนวโน้มชีพจร ความดัน อุณหภูมิ SpO₂ใช้คัดกรองการเปลี่ยนแปลงของผู้ป่วย
วัดอะไร และมีประโยชน์อย่างไร

ใช้คัดกรองการเปลี่ยนแปลงของผู้ป่วย

ข้อมูลนำเข้า
vital signs · laboratory · encounter
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
patient_id, event_time, HR=96, HR_prev=82, SpO2=93, temp=38.1ใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. แนวโน้มชีพจร ความดัน อุณหภูมิ SpO₂
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
HR_delta = 96−82 = 14 bpm; fever = 1; hours_since_medication = 6ตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
news-like_trend__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
O(n) ต่อผู้ป่วย; rolling 30 วันบน 1M events ≈ วินาที–นาทีใน columnar engineเวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
ต้องยึด event time, หน่วยวัด และช่วงที่ข้อมูลพร้อมใช้จริง ห้ามนำผลตรวจที่ออกภายหลังมาใช้ย้อนหลัง
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
03

Lab delta

ค่าปัจจุบัน − ค่าก่อนหน้าเห็นทิศทางที่ค่าเดี่ยวอาจซ่อนอยู่
วัดอะไร และมีประโยชน์อย่างไร

เห็นทิศทางที่ค่าเดี่ยวอาจซ่อนอยู่

ข้อมูลนำเข้า
vital signs · laboratory · encounter
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
patient_id, event_time, HR=96, HR_prev=82, SpO2=93, temp=38.1ใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. ค่าปัจจุบัน − ค่าก่อนหน้า
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
HR_delta = 96−82 = 14 bpm; fever = 1; hours_since_medication = 6ตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
lab_delta__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
O(n) ต่อผู้ป่วย; rolling 30 วันบน 1M events ≈ วินาที–นาทีใน columnar engineเวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
ต้องยึด event time, หน่วยวัด และช่วงที่ข้อมูลพร้อมใช้จริง ห้ามนำผลตรวจที่ออกภายหลังมาใช้ย้อนหลัง
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
04

Comorbidity count

จำนวนโรคร่วมในช่วงเวลาที่กำหนดสรุปความซับซ้อนของผู้ป่วย
วัดอะไร และมีประโยชน์อย่างไร

สรุปความซับซ้อนของผู้ป่วย

ข้อมูลนำเข้า
vital signs · laboratory · encounter
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
patient_id, event_time, HR=96, HR_prev=82, SpO2=93, temp=38.1ใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. จำนวนโรคร่วมในช่วงเวลาที่กำหนด
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
HR_delta = 96−82 = 14 bpm; fever = 1; hours_since_medication = 6ตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
comorbidity_count__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
O(n) ต่อผู้ป่วย; rolling 30 วันบน 1M events ≈ วินาที–นาทีใน columnar engineเวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
ต้องยึด event time, หน่วยวัด และช่วงที่ข้อมูลพร้อมใช้จริง ห้ามนำผลตรวจที่ออกภายหลังมาใช้ย้อนหลัง
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
05

Medication exposure

dose × duration และเวลาหลังได้รับยาเชื่อมผลลัพธ์กับการได้รับยาอย่างมีเวลา
วัดอะไร และมีประโยชน์อย่างไร

เชื่อมผลลัพธ์กับการได้รับยาอย่างมีเวลา

ข้อมูลนำเข้า
vital signs · laboratory · encounter
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
patient_id, event_time, HR=96, HR_prev=82, SpO2=93, temp=38.1ใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. dose × duration และเวลาหลังได้รับยา
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
HR_delta = 96−82 = 14 bpm; fever = 1; hours_since_medication = 6ตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
medication_exposure__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
O(n) ต่อผู้ป่วย; rolling 30 วันบน 1M events ≈ วินาที–นาทีใน columnar engineเวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
ต้องยึด event time, หน่วยวัด และช่วงที่ข้อมูลพร้อมใช้จริง ห้ามนำผลตรวจที่ออกภายหลังมาใช้ย้อนหลัง
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
DATA EXAMPLE

ตัวอย่างข้อมูลขนาดเล็ก

patient_id, event_time, HR=96, HR_prev=82, SpO2=93, temp=38.1
CALCULATION

จากข้อมูลสู่ Feature

HR_delta = 96−82 = 14 bpm; fever = 1; hours_since_medication = 6
COMPUTE TIME

เวลาและการเติบโตของต้นทุน

O(n) ต่อผู้ป่วย; rolling 30 วันบน 1M events ≈ วินาที–นาทีใน columnar engine

02

DNA · RNA · protein · omics

ชีวสารสนเทศ

Bioinformatics

Features สำคัญ—ตั้งแต่ข้อมูลต้นทางจนเป็น Feature Contract ที่ใช้ซ้ำได้

เลือก Feature เพื่อเปิดดูข้อมูล ขั้นคำนวณ Output Contract ต้นทุนประมวลผล และขอบเขตการตีความ

01

GC content

(G+C)/sequence lengthบอกองค์ประกอบลำดับและ bias เบื้องต้น
วัดอะไร และมีประโยชน์อย่างไร

บอกองค์ประกอบลำดับและ bias เบื้องต้น

ข้อมูลนำเข้า
DNA · RNA · protein · omics
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
sequence=ACGCGTATGC; expression=120; cohort_mean=80; sd=20ใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. (G+C)/sequence length
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
GC=6/10=0.60; expression_z=(120−80)/20=2.0ตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
gc_content__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
composition O(n); k-mer O(n); alignment โดยทั่วไป O(nm); RNA folding แบบคลาสสิก O(n³)เวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
ระบุ genome build, strand, transcript version, normalization และ tool version ทุกครั้ง
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
02

k-mer frequency

จำนวนคำยาว k เช่น 3-mer/6-merแทนรูปแบบเฉพาะที่โดยไม่ต้อง alignment
วัดอะไร และมีประโยชน์อย่างไร

แทนรูปแบบเฉพาะที่โดยไม่ต้อง alignment

ข้อมูลนำเข้า
DNA · RNA · protein · omics
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
sequence=ACGCGTATGC; expression=120; cohort_mean=80; sd=20ใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. จำนวนคำยาว k เช่น 3-mer/6-mer
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
GC=6/10=0.60; expression_z=(120−80)/20=2.0ตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
k-mer_frequency__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
composition O(n); k-mer O(n); alignment โดยทั่วไป O(nm); RNA folding แบบคลาสสิก O(n³)เวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
ระบุ genome build, strand, transcript version, normalization และ tool version ทุกครั้ง
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
03

ORF length

ความยาวช่วงเปิดการอ่านใช้บอกศักยภาพการเข้ารหัสโปรตีน
วัดอะไร และมีประโยชน์อย่างไร

ใช้บอกศักยภาพการเข้ารหัสโปรตีน

ข้อมูลนำเข้า
DNA · RNA · protein · omics
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
sequence=ACGCGTATGC; expression=120; cohort_mean=80; sd=20ใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. ความยาวช่วงเปิดการอ่าน
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
GC=6/10=0.60; expression_z=(120−80)/20=2.0ตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
orf_length__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
composition O(n); k-mer O(n); alignment โดยทั่วไป O(nm); RNA folding แบบคลาสสิก O(n³)เวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
ระบุ genome build, strand, transcript version, normalization และ tool version ทุกครั้ง
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
04

Secondary structure

MFE, paired fraction, stem/loopแทนเสถียรภาพและรูปทรงที่คาดการณ์
วัดอะไร และมีประโยชน์อย่างไร

แทนเสถียรภาพและรูปทรงที่คาดการณ์

ข้อมูลนำเข้า
DNA · RNA · protein · omics
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
sequence=ACGCGTATGC; expression=120; cohort_mean=80; sd=20ใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. MFE, paired fraction, stem/loop
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
GC=6/10=0.60; expression_z=(120−80)/20=2.0ตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
secondary_structure__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
composition O(n); k-mer O(n); alignment โดยทั่วไป O(nm); RNA folding แบบคลาสสิก O(n³)เวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
ระบุ genome build, strand, transcript version, normalization และ tool version ทุกครั้ง
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
05

Expression z-score

expression เทียบกลุ่มอ้างอิงทำให้ยีนต่างสเกลเปรียบเทียบกันได้
วัดอะไร และมีประโยชน์อย่างไร

ทำให้ยีนต่างสเกลเปรียบเทียบกันได้

ข้อมูลนำเข้า
DNA · RNA · protein · omics
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
sequence=ACGCGTATGC; expression=120; cohort_mean=80; sd=20ใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. expression เทียบกลุ่มอ้างอิง
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
GC=6/10=0.60; expression_z=(120−80)/20=2.0ตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
expression_z-score__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
composition O(n); k-mer O(n); alignment โดยทั่วไป O(nm); RNA folding แบบคลาสสิก O(n³)เวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
ระบุ genome build, strand, transcript version, normalization และ tool version ทุกครั้ง
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
DATA EXAMPLE

ตัวอย่างข้อมูลขนาดเล็ก

sequence=ACGCGTATGC; expression=120; cohort_mean=80; sd=20
CALCULATION

จากข้อมูลสู่ Feature

GC=6/10=0.60; expression_z=(120−80)/20=2.0
COMPUTE TIME

เวลาและการเติบโตของต้นทุน

composition O(n); k-mer O(n); alignment โดยทั่วไป O(nm); RNA folding แบบคลาสสิก O(n³)

03

price · volume · quote · fundamentals

หุ้นและการเงิน

Finance & Capital Markets

Features สำคัญ—ตั้งแต่ข้อมูลต้นทางจนเป็น Feature Contract ที่ใช้ซ้ำได้

เลือก Feature เพื่อเปิดดูข้อมูล ขั้นคำนวณ Output Contract ต้นทุนประมวลผล และขอบเขตการตีความ

01

Log return

ln(Pt/Pt−1)ผลตอบแทนที่บวกสะสมตามเวลาได้
วัดอะไร และมีประโยชน์อย่างไร

ผลตอบแทนที่บวกสะสมตามเวลาได้

ข้อมูลนำเข้า
price · volume · quote · fundamentals
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
close_prev=100, close=103, bid=102.8, ask=103.2, debt=60M, equity=40Mใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. ln(Pt/Pt−1)
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
return=ln(103/100)=2.956%; spread=0.4/103=0.388%; D/E=1.5ตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
log_return__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
rolling feature O(T); 5,000 assets × 10 years daily ≈ วินาที–นาทีแบบ vectorizedเวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
ปรับ split/dividend, calendar และ survivorship bias; Indicator ไม่ใช่คำสั่งซื้อขาย
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
02

Realized volatility

SD ของ return ใน windowวัดความผันผวนในอดีต ไม่ใช่ความเสี่ยงทั้งหมด
วัดอะไร และมีประโยชน์อย่างไร

วัดความผันผวนในอดีต ไม่ใช่ความเสี่ยงทั้งหมด

ข้อมูลนำเข้า
price · volume · quote · fundamentals
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
close_prev=100, close=103, bid=102.8, ask=103.2, debt=60M, equity=40Mใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. SD ของ return ใน window
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
return=ln(103/100)=2.956%; spread=0.4/103=0.388%; D/E=1.5ตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
realized_volatility__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
rolling feature O(T); 5,000 assets × 10 years daily ≈ วินาที–นาทีแบบ vectorizedเวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
ปรับ split/dividend, calendar และ survivorship bias; Indicator ไม่ใช่คำสั่งซื้อขาย
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
03

RSI

อัตราส่วน average gain/lossบอกตำแหน่ง momentum ในกรอบที่เลือก
วัดอะไร และมีประโยชน์อย่างไร

บอกตำแหน่ง momentum ในกรอบที่เลือก

ข้อมูลนำเข้า
price · volume · quote · fundamentals
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
close_prev=100, close=103, bid=102.8, ask=103.2, debt=60M, equity=40Mใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. อัตราส่วน average gain/loss
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
return=ln(103/100)=2.956%; spread=0.4/103=0.388%; D/E=1.5ตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
rsi__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
rolling feature O(T); 5,000 assets × 10 years daily ≈ วินาที–นาทีแบบ vectorizedเวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
ปรับ split/dividend, calendar และ survivorship bias; Indicator ไม่ใช่คำสั่งซื้อขาย
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
04

Relative spread

(ask−bid)/midประมาณ quoted liquidity ณ เวลาหนึ่ง
วัดอะไร และมีประโยชน์อย่างไร

ประมาณ quoted liquidity ณ เวลาหนึ่ง

ข้อมูลนำเข้า
price · volume · quote · fundamentals
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
close_prev=100, close=103, bid=102.8, ask=103.2, debt=60M, equity=40Mใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. (ask−bid)/mid
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
return=ln(103/100)=2.956%; spread=0.4/103=0.388%; D/E=1.5ตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
relative_spread__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
rolling feature O(T); 5,000 assets × 10 years daily ≈ วินาที–นาทีแบบ vectorizedเวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
ปรับ split/dividend, calendar และ survivorship bias; Indicator ไม่ใช่คำสั่งซื้อขาย
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
05

Debt-to-equity

total debt/equityอ่านโครงสร้างเงินทุนของกิจการ
วัดอะไร และมีประโยชน์อย่างไร

อ่านโครงสร้างเงินทุนของกิจการ

ข้อมูลนำเข้า
price · volume · quote · fundamentals
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
close_prev=100, close=103, bid=102.8, ask=103.2, debt=60M, equity=40Mใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. total debt/equity
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
return=ln(103/100)=2.956%; spread=0.4/103=0.388%; D/E=1.5ตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
debt-to-equity__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
rolling feature O(T); 5,000 assets × 10 years daily ≈ วินาที–นาทีแบบ vectorizedเวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
ปรับ split/dividend, calendar และ survivorship bias; Indicator ไม่ใช่คำสั่งซื้อขาย
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
DATA EXAMPLE

ตัวอย่างข้อมูลขนาดเล็ก

close_prev=100, close=103, bid=102.8, ask=103.2, debt=60M, equity=40M
CALCULATION

จากข้อมูลสู่ Feature

return=ln(103/100)=2.956%; spread=0.4/103=0.388%; D/E=1.5
COMPUTE TIME

เวลาและการเติบโตของต้นทุน

rolling feature O(T); 5,000 assets × 10 years daily ≈ วินาที–นาทีแบบ vectorized

04

sensor · machine state · quality

การผลิตและการบำรุงรักษาเชิงคาดการณ์

Manufacturing & Predictive Maintenance

Features สำคัญ—ตั้งแต่ข้อมูลต้นทางจนเป็น Feature Contract ที่ใช้ซ้ำได้

เลือก Feature เพื่อเปิดดูข้อมูล ขั้นคำนวณ Output Contract ต้นทุนประมวลผล และขอบเขตการตีความ

01

RMS vibration

sqrt(mean(x²))พลังงานสั่นสะเทือนของเครื่อง
วัดอะไร และมีประโยชน์อย่างไร

พลังงานสั่นสะเทือนของเครื่อง

ข้อมูลนำเข้า
sensor · machine state · quality
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
vibration=[1,−2,2,−1]; temp 70→82°C in 20 min; 3 defects/500 unitsใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. sqrt(mean(x²))
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
RMS=sqrt(10/4)=1.58; slope=12/20=0.6°C/min; defect_rate=0.6%ตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
rms_vibration__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
window W ต่อ sensor: O(N); FFT feature O(N log N); streaming latency มัก ms–sเวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
แยก machine mode และ maintenance period มิฉะนั้น model จะสับสนระหว่างงานหนักกับความเสียหาย
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
02

Kurtosis

ความหนาหางของสัญญาณช่วยเห็น impulsive fault
วัดอะไร และมีประโยชน์อย่างไร

ช่วยเห็น impulsive fault

ข้อมูลนำเข้า
sensor · machine state · quality
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
vibration=[1,−2,2,−1]; temp 70→82°C in 20 min; 3 defects/500 unitsใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. ความหนาหางของสัญญาณ
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
RMS=sqrt(10/4)=1.58; slope=12/20=0.6°C/min; defect_rate=0.6%ตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
kurtosis__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
window W ต่อ sensor: O(N); FFT feature O(N log N); streaming latency มัก ms–sเวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
แยก machine mode และ maintenance period มิฉะนั้น model จะสับสนระหว่างงานหนักกับความเสียหาย
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
03

Temperature slope

Δtemperature/Δtimeจับภาวะร้อนขึ้นต่อเนื่อง
วัดอะไร และมีประโยชน์อย่างไร

จับภาวะร้อนขึ้นต่อเนื่อง

ข้อมูลนำเข้า
sensor · machine state · quality
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
vibration=[1,−2,2,−1]; temp 70→82°C in 20 min; 3 defects/500 unitsใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. Δtemperature/Δtime
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
RMS=sqrt(10/4)=1.58; slope=12/20=0.6°C/min; defect_rate=0.6%ตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
temperature_slope__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
window W ต่อ sensor: O(N); FFT feature O(N log N); streaming latency มัก ms–sเวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
แยก machine mode และ maintenance period มิฉะนั้น model จะสับสนระหว่างงานหนักกับความเสียหาย
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
04

Cycle-time deviation

cycle−baselineเห็นคอขวดหรือเสื่อมสมรรถนะ
วัดอะไร และมีประโยชน์อย่างไร

เห็นคอขวดหรือเสื่อมสมรรถนะ

ข้อมูลนำเข้า
sensor · machine state · quality
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
vibration=[1,−2,2,−1]; temp 70→82°C in 20 min; 3 defects/500 unitsใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. cycle−baseline
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
RMS=sqrt(10/4)=1.58; slope=12/20=0.6°C/min; defect_rate=0.6%ตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
cycle-time_deviation__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
window W ต่อ sensor: O(N); FFT feature O(N log N); streaming latency มัก ms–sเวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
แยก machine mode และ maintenance period มิฉะนั้น model จะสับสนระหว่างงานหนักกับความเสียหาย
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
05

Defect rate

defects/unitsคุณภาพผลผลิตตาม line/shift
วัดอะไร และมีประโยชน์อย่างไร

คุณภาพผลผลิตตาม line/shift

ข้อมูลนำเข้า
sensor · machine state · quality
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
vibration=[1,−2,2,−1]; temp 70→82°C in 20 min; 3 defects/500 unitsใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. defects/units
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
RMS=sqrt(10/4)=1.58; slope=12/20=0.6°C/min; defect_rate=0.6%ตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
defect_rate__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
window W ต่อ sensor: O(N); FFT feature O(N log N); streaming latency มัก ms–sเวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
แยก machine mode และ maintenance period มิฉะนั้น model จะสับสนระหว่างงานหนักกับความเสียหาย
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
DATA EXAMPLE

ตัวอย่างข้อมูลขนาดเล็ก

vibration=[1,−2,2,−1]; temp 70→82°C in 20 min; 3 defects/500 units
CALCULATION

จากข้อมูลสู่ Feature

RMS=sqrt(10/4)=1.58; slope=12/20=0.6°C/min; defect_rate=0.6%
COMPUTE TIME

เวลาและการเติบโตของต้นทุน

window W ต่อ sensor: O(N); FFT feature O(N log N); streaming latency มัก ms–s

05

transaction · customer · product

ค้าปลีกและการวิเคราะห์ลูกค้า

Retail & Customer Analytics

Features สำคัญ—ตั้งแต่ข้อมูลต้นทางจนเป็น Feature Contract ที่ใช้ซ้ำได้

เลือก Feature เพื่อเปิดดูข้อมูล ขั้นคำนวณ Output Contract ต้นทุนประมวลผล และขอบเขตการตีความ

01

RFM

recency, frequency, monetaryสรุปความสัมพันธ์กับลูกค้าแบบตีความง่าย
วัดอะไร และมีประโยชน์อย่างไร

สรุปความสัมพันธ์กับลูกค้าแบบตีความง่าย

ข้อมูลนำเข้า
transaction · customer · product
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
last_purchase=10 days; 4 orders/90d; spend=3200; baseline=100; promo_sales=135ใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. recency, frequency, monetary
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
R=10, F=4, M=3200; apparent_lift=(135−100)/100=35%ตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
rfm__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
group-by O(N); exact basket pairs O(B·k²); 100M lines ≈ นาทีใน distributed warehouseเวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
Promotion lift ที่ไม่มี control ไม่ใช่ causal effect; คืนสินค้าและ identity resolution ต้องถูกรวม
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
02

Basket size

จำนวน/มูลค่าต่อใบเสร็จอ่านพฤติกรรมการซื้อแต่ละครั้ง
วัดอะไร และมีประโยชน์อย่างไร

อ่านพฤติกรรมการซื้อแต่ละครั้ง

ข้อมูลนำเข้า
transaction · customer · product
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
last_purchase=10 days; 4 orders/90d; spend=3200; baseline=100; promo_sales=135ใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. จำนวน/มูลค่าต่อใบเสร็จ
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
R=10, F=4, M=3200; apparent_lift=(135−100)/100=35%ตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
basket_size__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
group-by O(N); exact basket pairs O(B·k²); 100M lines ≈ นาทีใน distributed warehouseเวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
Promotion lift ที่ไม่มี control ไม่ใช่ causal effect; คืนสินค้าและ identity resolution ต้องถูกรวม
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
03

Category affinity

สัดส่วนยอดซื้อรายหมวดใช้ personalization และ assortment
วัดอะไร และมีประโยชน์อย่างไร

ใช้ personalization และ assortment

ข้อมูลนำเข้า
transaction · customer · product
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
last_purchase=10 days; 4 orders/90d; spend=3200; baseline=100; promo_sales=135ใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. สัดส่วนยอดซื้อรายหมวด
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
R=10, F=4, M=3200; apparent_lift=(135−100)/100=35%ตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
category_affinity__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
group-by O(N); exact basket pairs O(B·k²); 100M lines ≈ นาทีใน distributed warehouseเวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
Promotion lift ที่ไม่มี control ไม่ใช่ causal effect; คืนสินค้าและ identity resolution ต้องถูกรวม
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
04

Promotion lift

ยอดช่วงโปร − baselineประมาณผลต่างที่สัมพันธ์กับแคมเปญ
วัดอะไร และมีประโยชน์อย่างไร

ประมาณผลต่างที่สัมพันธ์กับแคมเปญ

ข้อมูลนำเข้า
transaction · customer · product
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
last_purchase=10 days; 4 orders/90d; spend=3200; baseline=100; promo_sales=135ใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. ยอดช่วงโปร − baseline
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
R=10, F=4, M=3200; apparent_lift=(135−100)/100=35%ตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
promotion_lift__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
group-by O(N); exact basket pairs O(B·k²); 100M lines ≈ นาทีใน distributed warehouseเวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
Promotion lift ที่ไม่มี control ไม่ใช่ causal effect; คืนสินค้าและ identity resolution ต้องถูกรวม
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
05

Stockout exposure

เวลาที่สินค้าขาด/เวลาขายแยก demand ต่ำออกจากของไม่มีขาย
วัดอะไร และมีประโยชน์อย่างไร

แยก demand ต่ำออกจากของไม่มีขาย

ข้อมูลนำเข้า
transaction · customer · product
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
last_purchase=10 days; 4 orders/90d; spend=3200; baseline=100; promo_sales=135ใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. เวลาที่สินค้าขาด/เวลาขาย
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
R=10, F=4, M=3200; apparent_lift=(135−100)/100=35%ตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
stockout_exposure__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
group-by O(N); exact basket pairs O(B·k²); 100M lines ≈ นาทีใน distributed warehouseเวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
Promotion lift ที่ไม่มี control ไม่ใช่ causal effect; คืนสินค้าและ identity resolution ต้องถูกรวม
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
DATA EXAMPLE

ตัวอย่างข้อมูลขนาดเล็ก

last_purchase=10 days; 4 orders/90d; spend=3200; baseline=100; promo_sales=135
CALCULATION

จากข้อมูลสู่ Feature

R=10, F=4, M=3200; apparent_lift=(135−100)/100=35%
COMPUTE TIME

เวลาและการเติบโตของต้นทุน

group-by O(N); exact basket pairs O(B·k²); 100M lines ≈ นาทีใน distributed warehouse

06

flow · log · identity · endpoint

ความมั่นคงปลอดภัยไซเบอร์และเครือข่าย

Cybersecurity & Network Analytics

Features สำคัญ—ตั้งแต่ข้อมูลต้นทางจนเป็น Feature Contract ที่ใช้ซ้ำได้

เลือก Feature เพื่อเปิดดูข้อมูล ขั้นคำนวณ Output Contract ต้นทุนประมวลผล และขอบเขตการตีความ

01

Flow duration

last packet−first packetแยก session สั้น/ยาว
วัดอะไร และมีประโยชน์อย่างไร

แยก session สั้น/ยาว

ข้อมูลนำเข้า
flow · log · identity · endpoint
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
flow: 20 packets, 12,000 bytes, 4 sec; login failures=12/5minใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. last packet−first packet
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
600 bytes/packet; 5 packets/s; failure_velocity=2.4/minตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
flow_duration__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
flow aggregation O(P); entropy O(k); streaming ต่อ event ≈ sub-ms–ms หาก state อยู่ใน memoryเวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
รักษา source clock, NAT และ asset role; rarity ไม่เท่ากับ malicious และ alert ต้องมีบริบท
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
02

Bytes/packet

bytes/packet countลักษณะ payload โดยไม่อ่านข้อความ
วัดอะไร และมีประโยชน์อย่างไร

ลักษณะ payload โดยไม่อ่านข้อความ

ข้อมูลนำเข้า
flow · log · identity · endpoint
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
flow: 20 packets, 12,000 bytes, 4 sec; login failures=12/5minใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. bytes/packet count
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
600 bytes/packet; 5 packets/s; failure_velocity=2.4/minตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
bytes_packet__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
flow aggregation O(P); entropy O(k); streaming ต่อ event ≈ sub-ms–ms หาก state อยู่ใน memoryเวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
รักษา source clock, NAT และ asset role; rarity ไม่เท่ากับ malicious และ alert ต้องมีบริบท
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
03

Failed-login velocity

failure ต่อ user/IP/windowเห็น burst ของการพยายามเข้าใช้
วัดอะไร และมีประโยชน์อย่างไร

เห็น burst ของการพยายามเข้าใช้

ข้อมูลนำเข้า
flow · log · identity · endpoint
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
flow: 20 packets, 12,000 bytes, 4 sec; login failures=12/5minใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. failure ต่อ user/IP/window
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
600 bytes/packet; 5 packets/s; failure_velocity=2.4/minตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
failed-login_velocity__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
flow aggregation O(P); entropy O(k); streaming ต่อ event ≈ sub-ms–ms หาก state อยู่ใน memoryเวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
รักษา source clock, NAT และ asset role; rarity ไม่เท่ากับ malicious และ alert ต้องมีบริบท
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
04

Destination entropy

entropy ของปลายทางบอกความกระจายของ scan/beacon
วัดอะไร และมีประโยชน์อย่างไร

บอกความกระจายของ scan/beacon

ข้อมูลนำเข้า
flow · log · identity · endpoint
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
flow: 20 packets, 12,000 bytes, 4 sec; login failures=12/5minใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. entropy ของปลายทาง
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
600 bytes/packet; 5 packets/s; failure_velocity=2.4/minตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
destination_entropy__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
flow aggregation O(P); entropy O(k); streaming ต่อ event ≈ sub-ms–ms หาก state อยู่ใน memoryเวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
รักษา source clock, NAT และ asset role; rarity ไม่เท่ากับ malicious และ alert ต้องมีบริบท
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
05

Rare process score

−log frequency(process)เน้นโปรเซสที่ไม่ปกติในบริบทเดียวกัน
วัดอะไร และมีประโยชน์อย่างไร

เน้นโปรเซสที่ไม่ปกติในบริบทเดียวกัน

ข้อมูลนำเข้า
flow · log · identity · endpoint
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
flow: 20 packets, 12,000 bytes, 4 sec; login failures=12/5minใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. −log frequency(process)
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
600 bytes/packet; 5 packets/s; failure_velocity=2.4/minตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
rare_process_score__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
flow aggregation O(P); entropy O(k); streaming ต่อ event ≈ sub-ms–ms หาก state อยู่ใน memoryเวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
รักษา source clock, NAT และ asset role; rarity ไม่เท่ากับ malicious และ alert ต้องมีบริบท
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
DATA EXAMPLE

ตัวอย่างข้อมูลขนาดเล็ก

flow: 20 packets, 12,000 bytes, 4 sec; login failures=12/5min
CALCULATION

จากข้อมูลสู่ Feature

600 bytes/packet; 5 packets/s; failure_velocity=2.4/min
COMPUTE TIME

เวลาและการเติบโตของต้นทุน

flow aggregation O(P); entropy O(k); streaming ต่อ event ≈ sub-ms–ms หาก state อยู่ใน memory

07

document · token · embedding

การประมวลผลภาษาธรรมชาติ

Natural Language Processing

Features สำคัญ—ตั้งแต่ข้อมูลต้นทางจนเป็น Feature Contract ที่ใช้ซ้ำได้

เลือก Feature เพื่อเปิดดูข้อมูล ขั้นคำนวณ Output Contract ต้นทุนประมวลผล และขอบเขตการตีความ

01

TF–IDF

term frequency × inverse document frequencyให้น้ำหนักคำที่จำเพาะต่อเอกสาร
วัดอะไร และมีประโยชน์อย่างไร

ให้น้ำหนักคำที่จำเพาะต่อเอกสาร

ข้อมูลนำเข้า
document · token · embedding
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
docs=100; “pipeline” appears in 4 docs; term frequency in doc=3ใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. term frequency × inverse document frequency
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
IDF=ln(100/4)=3.219; TF–IDF=3×3.219=9.657ตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
tf_idf__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
TF–IDF O(tokens); transformer โดยคร่าว O(L²d) ต่อ layer; batch GPU ≈ ms–s/documentเวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
ภาษา การตัดคำ tokenizer และ model version เปลี่ยน feature; sentiment ข้าม domain อาจตีความผิด
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
02

Length/readability

token, sentence, syllable statisticsบอกโครงสร้าง ไม่ใช่คุณภาพเนื้อหา
วัดอะไร และมีประโยชน์อย่างไร

บอกโครงสร้าง ไม่ใช่คุณภาพเนื้อหา

ข้อมูลนำเข้า
document · token · embedding
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
docs=100; “pipeline” appears in 4 docs; term frequency in doc=3ใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. token, sentence, syllable statistics
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
IDF=ln(100/4)=3.219; TF–IDF=3×3.219=9.657ตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
length_readability__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
TF–IDF O(tokens); transformer โดยคร่าว O(L²d) ต่อ layer; batch GPU ≈ ms–s/documentเวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
ภาษา การตัดคำ tokenizer และ model version เปลี่ยน feature; sentiment ข้าม domain อาจตีความผิด
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
03

Sentiment score

polarity/confidenceสรุปท่าทีตาม model/domain
วัดอะไร และมีประโยชน์อย่างไร

สรุปท่าทีตาม model/domain

ข้อมูลนำเข้า
document · token · embedding
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
docs=100; “pipeline” appears in 4 docs; term frequency in doc=3ใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. polarity/confidence
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
IDF=ln(100/4)=3.219; TF–IDF=3×3.219=9.657ตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
sentiment_score__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
TF–IDF O(tokens); transformer โดยคร่าว O(L²d) ต่อ layer; batch GPU ≈ ms–s/documentเวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
ภาษา การตัดคำ tokenizer และ model version เปลี่ยน feature; sentiment ข้าม domain อาจตีความผิด
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
04

Named entities

จำนวนและชนิดบุคคล องค์กร สถานที่สร้างสัญญาณเชิงความหมาย
วัดอะไร และมีประโยชน์อย่างไร

สร้างสัญญาณเชิงความหมาย

ข้อมูลนำเข้า
document · token · embedding
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
docs=100; “pipeline” appears in 4 docs; term frequency in doc=3ใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. จำนวนและชนิดบุคคล องค์กร สถานที่
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
IDF=ln(100/4)=3.219; TF–IDF=3×3.219=9.657ตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
named_entities__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
TF–IDF O(tokens); transformer โดยคร่าว O(L²d) ต่อ layer; batch GPU ≈ ms–s/documentเวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
ภาษา การตัดคำ tokenizer และ model version เปลี่ยน feature; sentiment ข้าม domain อาจตีความผิด
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
05

Embedding

dense semantic vectorเทียบความคล้ายเชิงบริบท
วัดอะไร และมีประโยชน์อย่างไร

เทียบความคล้ายเชิงบริบท

ข้อมูลนำเข้า
document · token · embedding
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
docs=100; “pipeline” appears in 4 docs; term frequency in doc=3ใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. dense semantic vector
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
IDF=ln(100/4)=3.219; TF–IDF=3×3.219=9.657ตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
embedding__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
TF–IDF O(tokens); transformer โดยคร่าว O(L²d) ต่อ layer; batch GPU ≈ ms–s/documentเวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
ภาษา การตัดคำ tokenizer และ model version เปลี่ยน feature; sentiment ข้าม domain อาจตีความผิด
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
DATA EXAMPLE

ตัวอย่างข้อมูลขนาดเล็ก

docs=100; “pipeline” appears in 4 docs; term frequency in doc=3
CALCULATION

จากข้อมูลสู่ Feature

IDF=ln(100/4)=3.219; TF–IDF=3×3.219=9.657
COMPUTE TIME

เวลาและการเติบโตของต้นทุน

TF–IDF O(tokens); transformer โดยคร่าว O(L²d) ต่อ layer; batch GPU ≈ ms–s/document

08

image · region · pixel · embedding

คอมพิวเตอร์วิทัศน์

Computer Vision

Features สำคัญ—ตั้งแต่ข้อมูลต้นทางจนเป็น Feature Contract ที่ใช้ซ้ำได้

เลือก Feature เพื่อเปิดดูข้อมูล ขั้นคำนวณ Output Contract ต้นทุนประมวลผล และขอบเขตการตีความ

01

Color histogram

การกระจายค่าสีต่อ channelสรุปสีโดยไม่รักษาตำแหน่ง
วัดอะไร และมีประโยชน์อย่างไร

สรุปสีโดยไม่รักษาตำแหน่ง

ข้อมูลนำเข้า
image · region · pixel · embedding
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
object area=400 px²; perimeter=100 px; edges=2,000/40,000 pixelsใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. การกระจายค่าสีต่อ channel
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
edge_density=5%; compactness=4πA/P²=0.503ตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
color_histogram__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
histogram O(HW); convolution ≈ O(HWk²CinCout); GPU inference ≈ ms–100ms/imageเวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
resize, crop, lighting และ camera domain เป็นส่วนหนึ่งของนิยาม Feature ไม่ใช่ preprocessing ที่มองข้ามได้
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
02

Edge density

edge pixels/all pixelsแทนความซับซ้อนของเส้นขอบ
วัดอะไร และมีประโยชน์อย่างไร

แทนความซับซ้อนของเส้นขอบ

ข้อมูลนำเข้า
image · region · pixel · embedding
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
object area=400 px²; perimeter=100 px; edges=2,000/40,000 pixelsใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. edge pixels/all pixels
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
edge_density=5%; compactness=4πA/P²=0.503ตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
edge_density__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
histogram O(HW); convolution ≈ O(HWk²CinCout); GPU inference ≈ ms–100ms/imageเวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
resize, crop, lighting และ camera domain เป็นส่วนหนึ่งของนิยาม Feature ไม่ใช่ preprocessing ที่มองข้ามได้
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
03

Texture

LBP/GLCM contrast, homogeneityอ่านพื้นผิวและรูปแบบซ้ำ
วัดอะไร และมีประโยชน์อย่างไร

อ่านพื้นผิวและรูปแบบซ้ำ

ข้อมูลนำเข้า
image · region · pixel · embedding
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
object area=400 px²; perimeter=100 px; edges=2,000/40,000 pixelsใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. LBP/GLCM contrast, homogeneity
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
edge_density=5%; compactness=4πA/P²=0.503ตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
texture__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
histogram O(HW); convolution ≈ O(HWk²CinCout); GPU inference ≈ ms–100ms/imageเวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
resize, crop, lighting และ camera domain เป็นส่วนหนึ่งของนิยาม Feature ไม่ใช่ preprocessing ที่มองข้ามได้
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
04

Shape descriptors

area, perimeter, compactnessตีความรูปทรงของ region
วัดอะไร และมีประโยชน์อย่างไร

ตีความรูปทรงของ region

ข้อมูลนำเข้า
image · region · pixel · embedding
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
object area=400 px²; perimeter=100 px; edges=2,000/40,000 pixelsใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. area, perimeter, compactness
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
edge_density=5%; compactness=4πA/P²=0.503ตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
shape_descriptors__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
histogram O(HW); convolution ≈ O(HWk²CinCout); GPU inference ≈ ms–100ms/imageเวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
resize, crop, lighting และ camera domain เป็นส่วนหนึ่งของนิยาม Feature ไม่ใช่ preprocessing ที่มองข้ามได้
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
05

CNN embedding

vector จากชั้นลึกแทนลักษณะภาพระดับสูง
วัดอะไร และมีประโยชน์อย่างไร

แทนลักษณะภาพระดับสูง

ข้อมูลนำเข้า
image · region · pixel · embedding
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
object area=400 px²; perimeter=100 px; edges=2,000/40,000 pixelsใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. vector จากชั้นลึก
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
edge_density=5%; compactness=4πA/P²=0.503ตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
cnn_embedding__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
histogram O(HW); convolution ≈ O(HWk²CinCout); GPU inference ≈ ms–100ms/imageเวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
resize, crop, lighting และ camera domain เป็นส่วนหนึ่งของนิยาม Feature ไม่ใช่ preprocessing ที่มองข้ามได้
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
DATA EXAMPLE

ตัวอย่างข้อมูลขนาดเล็ก

object area=400 px²; perimeter=100 px; edges=2,000/40,000 pixels
CALCULATION

จากข้อมูลสู่ Feature

edge_density=5%; compactness=4πA/P²=0.503
COMPUTE TIME

เวลาและการเติบโตของต้นทุน

histogram O(HW); convolution ≈ O(HWk²CinCout); GPU inference ≈ ms–100ms/image

09

telemetry · event stream · device

IoT และระบบอนุกรมเวลา

IoT & Time-series Systems

Features สำคัญ—ตั้งแต่ข้อมูลต้นทางจนเป็น Feature Contract ที่ใช้ซ้ำได้

เลือก Feature เพื่อเปิดดูข้อมูล ขั้นคำนวณ Output Contract ต้นทุนประมวลผล และขอบเขตการตีความ

01

Rolling mean/std

ระดับและความผันผวนใน windowลด noise และเห็น regime
วัดอะไร และมีประโยชน์อย่างไร

ลด noise และเห็น regime

ข้อมูลนำเข้า
telemetry · event stream · device
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
temperature=[20,22,23,25]; timestamps every minute; one 5-min gapใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. ระดับและความผันผวนใน window
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
mean=22.5; slope=(25−20)/3=1.67°C/min; gap_flag=1ตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
rolling_mean_std__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
rolling incremental O(1)/event; FFT O(N log N); edge latency µs–ms/featureเวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
resampling ต้องระบุ timezone, late event และ gap policy; interpolate อาจสร้างเหตุการณ์ที่ไม่เคยเกิด
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
02

Lag features

x(t−1), x(t−k)เก็บความจำของระบบ
วัดอะไร และมีประโยชน์อย่างไร

เก็บความจำของระบบ

ข้อมูลนำเข้า
telemetry · event stream · device
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
temperature=[20,22,23,25]; timestamps every minute; one 5-min gapใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. x(t−1), x(t−k)
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
mean=22.5; slope=(25−20)/3=1.67°C/min; gap_flag=1ตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
lag_features__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
rolling incremental O(1)/event; FFT O(N log N); edge latency µs–ms/featureเวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
resampling ต้องระบุ timezone, late event และ gap policy; interpolate อาจสร้างเหตุการณ์ที่ไม่เคยเกิด
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
03

Rate of change

Δx/Δtเห็นการเปลี่ยนเร็วผิดปกติ
วัดอะไร และมีประโยชน์อย่างไร

เห็นการเปลี่ยนเร็วผิดปกติ

ข้อมูลนำเข้า
telemetry · event stream · device
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
temperature=[20,22,23,25]; timestamps every minute; one 5-min gapใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. Δx/Δt
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
mean=22.5; slope=(25−20)/3=1.67°C/min; gap_flag=1ตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
rate_of_change__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
rolling incremental O(1)/event; FFT O(N log N); edge latency µs–ms/featureเวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
resampling ต้องระบุ timezone, late event และ gap policy; interpolate อาจสร้างเหตุการณ์ที่ไม่เคยเกิด
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
04

Missingness

gap length, missing ratioคุณภาพ sensor เป็นสัญญาณหนึ่ง
วัดอะไร และมีประโยชน์อย่างไร

คุณภาพ sensor เป็นสัญญาณหนึ่ง

ข้อมูลนำเข้า
telemetry · event stream · device
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
temperature=[20,22,23,25]; timestamps every minute; one 5-min gapใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. gap length, missing ratio
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
mean=22.5; slope=(25−20)/3=1.67°C/min; gap_flag=1ตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
missingness__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
rolling incremental O(1)/event; FFT O(N log N); edge latency µs–ms/featureเวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
resampling ต้องระบุ timezone, late event และ gap policy; interpolate อาจสร้างเหตุการณ์ที่ไม่เคยเกิด
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
05

Spectral energy

พลังงานตามย่านความถี่จับวงจรที่ time domain มองยาก
วัดอะไร และมีประโยชน์อย่างไร

จับวงจรที่ time domain มองยาก

ข้อมูลนำเข้า
telemetry · event stream · device
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
temperature=[20,22,23,25]; timestamps every minute; one 5-min gapใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. พลังงานตามย่านความถี่
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
mean=22.5; slope=(25−20)/3=1.67°C/min; gap_flag=1ตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
spectral_energy__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
rolling incremental O(1)/event; FFT O(N log N); edge latency µs–ms/featureเวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
resampling ต้องระบุ timezone, late event และ gap policy; interpolate อาจสร้างเหตุการณ์ที่ไม่เคยเกิด
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
DATA EXAMPLE

ตัวอย่างข้อมูลขนาดเล็ก

temperature=[20,22,23,25]; timestamps every minute; one 5-min gap
CALCULATION

จากข้อมูลสู่ Feature

mean=22.5; slope=(25−20)/3=1.67°C/min; gap_flag=1
COMPUTE TIME

เวลาและการเติบโตของต้นทุน

rolling incremental O(1)/event; FFT O(N log N); edge latency µs–ms/feature

10

coordinate · trajectory · region

ภูมิสารสนเทศและการเคลื่อนที่

Geospatial & Mobility

Features สำคัญ—ตั้งแต่ข้อมูลต้นทางจนเป็น Feature Contract ที่ใช้ซ้ำได้

เลือก Feature เพื่อเปิดดูข้อมูล ขั้นคำนวณ Output Contract ต้นทุนประมวลผล และขอบเขตการตีความ

01

Haversine distance

ระยะบนทรงกลมระหว่างพิกัดวัดการเคลื่อนที่ทางภูมิศาสตร์
วัดอะไร และมีประโยชน์อย่างไร

วัดการเคลื่อนที่ทางภูมิศาสตร์

ข้อมูลนำเข้า
coordinate · trajectory · region
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
A=(13.7563,100.5018), B≈1 km east, elapsed=120 secใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. ระยะบนทรงกลมระหว่างพิกัด
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
distance≈1,000m; speed≈8.33m/s≈30km/hตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
haversine_distance__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
distance O(N); spatial join index ≈ O(N log M); naive pairwise O(NM)เวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
GPS accuracy, map matching และ privacy มีผลต่อการตีความ; cell boundary ทำให้จุดใกล้กันอยู่คนละกลุ่มได้
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
02

Speed/acceleration

distance/time และ Δspeed/timeอ่านรูปแบบการเดินทาง
วัดอะไร และมีประโยชน์อย่างไร

อ่านรูปแบบการเดินทาง

ข้อมูลนำเข้า
coordinate · trajectory · region
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
A=(13.7563,100.5018), B≈1 km east, elapsed=120 secใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. distance/time และ Δspeed/time
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
distance≈1,000m; speed≈8.33m/s≈30km/hตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
speed_acceleration__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
distance O(N); spatial join index ≈ O(N log M); naive pairwise O(NM)เวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
GPS accuracy, map matching และ privacy มีผลต่อการตีความ; cell boundary ทำให้จุดใกล้กันอยู่คนละกลุ่มได้
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
03

Geohash/H3 cell

รหัสพื้นที่หลาย resolutionรวมข้อมูลเชิงพื้นที่อย่างมีสเกล
วัดอะไร และมีประโยชน์อย่างไร

รวมข้อมูลเชิงพื้นที่อย่างมีสเกล

ข้อมูลนำเข้า
coordinate · trajectory · region
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
A=(13.7563,100.5018), B≈1 km east, elapsed=120 secใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. รหัสพื้นที่หลาย resolution
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
distance≈1,000m; speed≈8.33m/s≈30km/hตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
geohash_h3_cell__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
distance O(N); spatial join index ≈ O(N log M); naive pairwise O(NM)เวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
GPS accuracy, map matching และ privacy มีผลต่อการตีความ; cell boundary ทำให้จุดใกล้กันอยู่คนละกลุ่มได้
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
04

POI density

จำนวนจุดสนใจใน radiusแทนบริบทของพื้นที่
วัดอะไร และมีประโยชน์อย่างไร

แทนบริบทของพื้นที่

ข้อมูลนำเข้า
coordinate · trajectory · region
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
A=(13.7563,100.5018), B≈1 km east, elapsed=120 secใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. จำนวนจุดสนใจใน radius
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
distance≈1,000m; speed≈8.33m/s≈30km/hตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
poi_density__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
distance O(N); spatial join index ≈ O(N log M); naive pairwise O(NM)เวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
GPS accuracy, map matching และ privacy มีผลต่อการตีความ; cell boundary ทำให้จุดใกล้กันอยู่คนละกลุ่มได้
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
05

Dwell time

เวลาที่อยู่ในพื้นที่แยกผ่านทางออกจากการหยุด
วัดอะไร และมีประโยชน์อย่างไร

แยกผ่านทางออกจากการหยุด

ข้อมูลนำเข้า
coordinate · trajectory · region
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
A=(13.7563,100.5018), B≈1 km east, elapsed=120 secใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. เวลาที่อยู่ในพื้นที่
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
distance≈1,000m; speed≈8.33m/s≈30km/hตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
dwell_time__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
distance O(N); spatial join index ≈ O(N log M); naive pairwise O(NM)เวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
GPS accuracy, map matching และ privacy มีผลต่อการตีความ; cell boundary ทำให้จุดใกล้กันอยู่คนละกลุ่มได้
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
DATA EXAMPLE

ตัวอย่างข้อมูลขนาดเล็ก

A=(13.7563,100.5018), B≈1 km east, elapsed=120 sec
CALCULATION

จากข้อมูลสู่ Feature

distance≈1,000m; speed≈8.33m/s≈30km/h
COMPUTE TIME

เวลาและการเติบโตของต้นทุน

distance O(N); spatial join index ≈ O(N log M); naive pairwise O(NM)

11

activity · assessment · sequence

การวิเคราะห์การเรียนรู้

Learning Analytics

Features สำคัญ—ตั้งแต่ข้อมูลต้นทางจนเป็น Feature Contract ที่ใช้ซ้ำได้

เลือก Feature เพื่อเปิดดูข้อมูล ขั้นคำนวณ Output Contract ต้นทุนประมวลผล และขอบเขตการตีความ

01

Mastery estimate

correct/attempts แยกทักษะบอกหลักฐานความเข้าใจราย concept
วัดอะไร และมีประโยชน์อย่างไร

บอกหลักฐานความเข้าใจราย concept

ข้อมูลนำเข้า
activity · assessment · sequence
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
answers=[0,1,1,1]; times=[50,42,35,31] sec; concept=OSI routingใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. correct/attempts แยกทักษะ
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
mastery=3/4=75%; time slope=(31−50)/3=−6.33 sec/attemptตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
mastery_estimate__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
aggregation O(events); sequence model O(L)–O(L²); dashboard มัก sub-second หลัง aggregateเวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
คะแนนคือหลักฐานบางส่วน ไม่ใช่ตัวตนผู้เรียน; ปกป้องข้อมูลและแยก “ยังไม่เรียน” จาก “ทำไม่ได้”
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
02

Response time

เวลาอ่านและตอบแยกความคล่องจากการเดาได้บางส่วน
วัดอะไร และมีประโยชน์อย่างไร

แยกความคล่องจากการเดาได้บางส่วน

ข้อมูลนำเข้า
activity · assessment · sequence
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
answers=[0,1,1,1]; times=[50,42,35,31] sec; concept=OSI routingใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. เวลาอ่านและตอบ
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
mastery=3/4=75%; time slope=(31−50)/3=−6.33 sec/attemptตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
response_time__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
aggregation O(events); sequence model O(L)–O(L²); dashboard มัก sub-second หลัง aggregateเวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
คะแนนคือหลักฐานบางส่วน ไม่ใช่ตัวตนผู้เรียน; ปกป้องข้อมูลและแยก “ยังไม่เรียน” จาก “ทำไม่ได้”
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
03

Attempt trajectory

คะแนน/ความผิดพลาดตามลำดับเห็นการพัฒนา ไม่ใช่เพียงคะแนนสุดท้าย
วัดอะไร และมีประโยชน์อย่างไร

เห็นการพัฒนา ไม่ใช่เพียงคะแนนสุดท้าย

ข้อมูลนำเข้า
activity · assessment · sequence
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
answers=[0,1,1,1]; times=[50,42,35,31] sec; concept=OSI routingใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. คะแนน/ความผิดพลาดตามลำดับ
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
mastery=3/4=75%; time slope=(31−50)/3=−6.33 sec/attemptตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
attempt_trajectory__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
aggregation O(events); sequence model O(L)–O(L²); dashboard มัก sub-second หลัง aggregateเวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
คะแนนคือหลักฐานบางส่วน ไม่ใช่ตัวตนผู้เรียน; ปกป้องข้อมูลและแยก “ยังไม่เรียน” จาก “ทำไม่ได้”
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
04

Spacing

ช่วงห่างระหว่างการทบทวนอธิบายรูปแบบการฝึก
วัดอะไร และมีประโยชน์อย่างไร

อธิบายรูปแบบการฝึก

ข้อมูลนำเข้า
activity · assessment · sequence
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
answers=[0,1,1,1]; times=[50,42,35,31] sec; concept=OSI routingใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. ช่วงห่างระหว่างการทบทวน
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
mastery=3/4=75%; time slope=(31−50)/3=−6.33 sec/attemptตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
spacing__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
aggregation O(events); sequence model O(L)–O(L²); dashboard มัก sub-second หลัง aggregateเวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
คะแนนคือหลักฐานบางส่วน ไม่ใช่ตัวตนผู้เรียน; ปกป้องข้อมูลและแยก “ยังไม่เรียน” จาก “ทำไม่ได้”
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
05

Misconception pattern

distribution ของ distractorบอกว่าเข้าใจผิดอย่างไร
วัดอะไร และมีประโยชน์อย่างไร

บอกว่าเข้าใจผิดอย่างไร

ข้อมูลนำเข้า
activity · assessment · sequence
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
answers=[0,1,1,1]; times=[50,42,35,31] sec; concept=OSI routingใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. distribution ของ distractor
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
mastery=3/4=75%; time slope=(31−50)/3=−6.33 sec/attemptตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
misconception_pattern__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
aggregation O(events); sequence model O(L)–O(L²); dashboard มัก sub-second หลัง aggregateเวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
คะแนนคือหลักฐานบางส่วน ไม่ใช่ตัวตนผู้เรียน; ปกป้องข้อมูลและแยก “ยังไม่เรียน” จาก “ทำไม่ได้”
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
DATA EXAMPLE

ตัวอย่างข้อมูลขนาดเล็ก

answers=[0,1,1,1]; times=[50,42,35,31] sec; concept=OSI routing
CALCULATION

จากข้อมูลสู่ Feature

mastery=3/4=75%; time slope=(31−50)/3=−6.33 sec/attempt
COMPUTE TIME

เวลาและการเติบโตของต้นทุน

aggregation O(events); sequence model O(L)–O(L²); dashboard มัก sub-second หลัง aggregate

12

meter · weather · tariff · grid

พลังงานและโครงข่ายอัจฉริยะ

Energy & Smart Grid

Features สำคัญ—ตั้งแต่ข้อมูลต้นทางจนเป็น Feature Contract ที่ใช้ซ้ำได้

เลือก Feature เพื่อเปิดดูข้อมูล ขั้นคำนวณ Output Contract ต้นทุนประมวลผล และขอบเขตการตีความ

01

Load factor

average load/peak loadบอกความสม่ำเสมอของการใช้กำลัง
วัดอะไร และมีประโยชน์อย่างไร

บอกความสม่ำเสมอของการใช้กำลัง

ข้อมูลนำเข้า
meter · weather · tariff · grid
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
hourly load=[80,100,120,100] MW; renewable=90 MWh; total=400 MWhใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. average load/peak load
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
avg=100; peak=120; load_factor=0.833; renewable_share=22.5%ตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
load_factor__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
aggregation O(T); forecast features across S sites O(ST); streaming ≈ ms/eventเวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
อากาศ วันหยุด tariff และ outage ต้องตรงตามเวลาที่รู้จริง; meter revision ต้อง version ได้
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
02

Ramp rate

ΔMW/Δtimeวัดความเร็วที่ระบบต้องปรับตัว
วัดอะไร และมีประโยชน์อย่างไร

วัดความเร็วที่ระบบต้องปรับตัว

ข้อมูลนำเข้า
meter · weather · tariff · grid
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
hourly load=[80,100,120,100] MW; renewable=90 MWh; total=400 MWhใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. ΔMW/Δtime
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
avg=100; peak=120; load_factor=0.833; renewable_share=22.5%ตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
ramp_rate__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
aggregation O(T); forecast features across S sites O(ST); streaming ≈ ms/eventเวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
อากาศ วันหยุด tariff และ outage ต้องตรงตามเวลาที่รู้จริง; meter revision ต้อง version ได้
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
03

Degree hours

ความต่างอุณหภูมิจากฐานสะสมแทน demand จากอากาศ
วัดอะไร และมีประโยชน์อย่างไร

แทน demand จากอากาศ

ข้อมูลนำเข้า
meter · weather · tariff · grid
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
hourly load=[80,100,120,100] MW; renewable=90 MWh; total=400 MWhใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. ความต่างอุณหภูมิจากฐานสะสม
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
avg=100; peak=120; load_factor=0.833; renewable_share=22.5%ตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
degree_hours__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
aggregation O(T); forecast features across S sites O(ST); streaming ≈ ms/eventเวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
อากาศ วันหยุด tariff และ outage ต้องตรงตามเวลาที่รู้จริง; meter revision ต้อง version ได้
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
04

Peak/off-peak ratio

พลังงานช่วง peak/off-peakอ่านรูปแบบเวลาและ tariff
วัดอะไร และมีประโยชน์อย่างไร

อ่านรูปแบบเวลาและ tariff

ข้อมูลนำเข้า
meter · weather · tariff · grid
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
hourly load=[80,100,120,100] MW; renewable=90 MWh; total=400 MWhใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. พลังงานช่วง peak/off-peak
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
avg=100; peak=120; load_factor=0.833; renewable_share=22.5%ตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
peak_off-peak_ratio__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
aggregation O(T); forecast features across S sites O(ST); streaming ≈ ms/eventเวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
อากาศ วันหยุด tariff และ outage ต้องตรงตามเวลาที่รู้จริง; meter revision ต้อง version ได้
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
05

Renewable share

renewable/total generationบริบทความผันผวนของ supply
วัดอะไร และมีประโยชน์อย่างไร

บริบทความผันผวนของ supply

ข้อมูลนำเข้า
meter · weather · tariff · grid
ระบุ Entity, Source, Unit, Event Time และ Availability Time ให้ครบ Field ชื่อเดียวกันจากคนละระบบอาจมีความหมายไม่เท่ากัน
ตัวอย่างข้อมูลขนาดเล็ก
hourly load=[80,100,120,100] MW; renewable=90 MWh; total=400 MWhใช้เฉพาะ Record ที่มีอยู่จริง ณ Feature Timestamp
ขั้นตอนคำนวณ
  1. กรอง Entity และ Time Window ที่กำหนด
  2. ตรวจหน่วย Missing Value และค่าที่เป็นไปไม่ได้
  3. renewable/total generation
  4. แนบ Timestamp, Parameter และ Code Version
ตัวอย่างผลคำนวณ
avg=100; peak=120; load_factor=0.833; renewable_share=22.5%ตัวอย่างย่อเพื่อเห็นวิธีคิด ข้อมูลจริงต้องมี Validation และ Reference Window ที่เหมาะสม
รูปแบบผลลัพธ์
renewable_share__value
entity_id · as_of · available_at · window · unit · versionMetadata ทำให้สร้างค่าซ้ำและเปรียบเทียบกันได้
เวลาและต้นทุนคำนวณ
aggregation O(T); forecast features across S sites O(ST); streaming ≈ ms/eventเวลาจริงขึ้นกับ Volume, Window, Index, Hardware, Implementation และการใช้ผลกลางซ้ำ จึงต้อง Benchmark บนระบบเป้าหมาย
ขอบเขตการตีความ
อากาศ วันหยุด tariff และ outage ต้องตรงตามเวลาที่รู้จริง; meter revision ต้อง version ได้
หนึ่ง Feature คือหลักฐานหนึ่งชิ้น ไม่ใช่สภาวะทั้งหมดของคน เครื่องจักร ตลาด หรือระบบ
DATA EXAMPLE

ตัวอย่างข้อมูลขนาดเล็ก

hourly load=[80,100,120,100] MW; renewable=90 MWh; total=400 MWh
CALCULATION

จากข้อมูลสู่ Feature

avg=100; peak=120; load_factor=0.833; renewable_share=22.5%
COMPUTE TIME

เวลาและการเติบโตของต้นทุน

aggregation O(T); forecast features across S sites O(ST); streaming ≈ ms/event

CROSS-DOMAIN LESSON

Feature ที่ดีต้องรักษาความหมายไว้ได้ ข้ามเวลา ข้ามทีม และข้ามระบบ

Observation

กำหนด Entity, Field, Unit, Source และกระบวนการวัด

Time

แยก Event Time, Processing Time และ Availability Time

Version

เก็บสูตร Parameter, Reference Population และ Code Version

Validation

ตรวจ Range, Missingness, Drift, Parity และ Leakage