warin.me · ห้องทดลองวิจัย EN · ไทย
การทำนายตำแหน่งโปรตีนมนุษย์ · 2026

ตำแหน่งในมนุษย์
หลักฐานบนเครื่อง

งานต่อยอดจาก PlantLoc ในบริบทมนุษย์ ใช้ annotation จากกล้องจุลทรรศน์ที่มีหลักฐานรองรับ รัน sequence predictor ในเครื่อง และใช้ PSO รวมผลแบบ multilabel โดยเปิดให้เห็นคำตอบก่อนถ่วงน้ำหนัก

ทำไมต้องมี Human Lab

หน้าที่และบริบทสุขภาพ

ตำแหน่งเปลี่ยนความหมาย

variant หรือการแสดงออกที่เปลี่ยนไปอาจมีผลต่างกันมาก ขึ้นกับว่าโปรตีนไปถึงนิวเคลียส เยื่อหุ้มเซลล์ ไมโทคอนเดรีย หรือระบบหลั่งหรือไม่

ชีววิทยาแบบหลายตำแหน่ง

หนึ่งโปรตีน หลาย compartment

โปรตีนมนุษย์สามารถ shuttle ผ่านออร์แกเนลล์และย้ายตามสภาวะของเซลล์ การบังคับให้ตอบ top-1 อาจซ่อนตำแหน่งรองที่ถูกต้อง

ทำซ้ำได้

ไม่ต้องรอ remote RPA

WoLF PSORT, Light Attention และ ngLOC animal รันใน container แยกกัน เก็บหลักฐานและ cache ก่อนให้ PSO โหวต

ขอบเขต: นี่คืองานพัฒนาวิธีและระบบ ไม่ใช่เครื่องมือวินิจฉัย ผลใช้จัดลำดับสมมติฐานและไม่ทดแทนหลักฐานจากห้องปฏิบัติการ

ชุดข้อมูลทดลองเฉพาะมนุษย์

จับคู่ Human Protein Atlas v25.1 เฉพาะ annotation ระดับ Enhanced หรือ Supported กับลำดับ Homo sapiens ที่ reviewed ใน UniProt แล้วแบ่ง fit, validation และ locked test ด้วย stable hash ของ accession

4,222
โปรตีนมนุษย์ที่จับคู่ได้
fit 2,933 · validation 625 · locked test 664

โครงสร้างย่อย 49 แบบของ HPA ถูก map อย่างเปิดเผยเป็น 9 compartment ที่ predictor ใช้ร่วมกัน ได้แก่ nucleus, cytoplasm, plasma membrane, mitochondrion, extracellular, ER, Golgi, peroxisome และ lysosome กำหนดความยาวไม่เกิน 1,200 residues เพื่อให้ขอบเขตการทดลองบน CPU ทำซ้ำได้ โดยตัด long-tail 492 รายการจากชุดที่จับคู่ได้ครั้งแรก

ตัวทำนายที่ติดตั้งบนเครื่อง

Predictorโหมดบทบาทข้อจำกัด
Light AttentionProtT5 + published checkpointหลักฐานจาก protein language modelหัวทำนายเดิมเป็น single-label และอาจมีข้อมูลสาธารณะซ้อนกับ benchmark
WoLF PSORTAnimal kNNsorting signal และ sequence evidenceเป็นโมเดลเก่าและต้อง map label
ngLOC 1.0Animal n-gram modelหลักฐานเชิงกำเนิดที่เป็นอิสระชุดเรียน Swiss-Prot รุ่นเก่าและต้อง normalize legacy scores

ทำไมจึงมีผล PSO สองแบบ

objective เปลี่ยนพฤติกรรมของโมเดลโดยตรง การ optimize exact match ทำให้ voter ระมัดระวังและเพิ่ม exact accuracy จาก Light Attention 37.05% เป็น 37.80% แต่พลาดคลาสหายากหลายคลาส ส่วนการ optimize macro F1 เพิ่ม macro F1 จาก 43.57% เป็น 51.34% แต่ตอบชุด label มากเกินไปจน exact accuracy เหลือ 3.16% Prediction panel ใช้ exact-match voter ที่เลือกจาก validation และแสดงผลทั้งสองแบบในตาราง

Prediction panel

วางลำดับ FASTA ของโปรตีนมนุษย์ ครั้งแรกอาจใช้เวลาหลายนาทีเพราะทุกโมเดลรันบนเครื่องจริง

ผลโหวต

จะแสดง raw answer, coefficient, weighted contribution และ threshold ของทุกตำแหน่ง

ผลบน locked test

การทดลองกำลังทำงาน ตารางจะอ่านค่าจาก frozen artifact โดยตรง

น้ำหนักและ threshold จาก PSO

Confusion matrix ราย localization

ประเมินแต่ละตำแหน่งเป็น binary decision แยกกัน เพราะโปรตีนหนึ่งตัวมีหลาย label ที่ถูกต้องได้

เครดิตและเอกสารอ้างอิง

  1. Human Protein Atlas subcellular resource และ downloadable data รุ่น 25.1
  2. Thul et al. (2017), A subcellular map of the human proteome, Science
  3. Stärk et al. (2021), Light Attention
  4. Horton et al. (2007), WoLF PSORT
  5. King และ Guda, ngLOC standalone
  6. แนวทาง PSO vote สืบเนื่องจาก PSO-LocBact (2019) และ PlantLoc (2021) โดย base predictor ทั้งหมดยังคงเป็นผลงานของผู้สร้างที่อ้างอิงไว้