ตำแหน่งเปลี่ยนความหมาย
variant หรือการแสดงออกที่เปลี่ยนไปอาจมีผลต่างกันมาก ขึ้นกับว่าโปรตีนไปถึงนิวเคลียส เยื่อหุ้มเซลล์ ไมโทคอนเดรีย หรือระบบหลั่งหรือไม่
งานต่อยอดจาก PlantLoc ในบริบทมนุษย์ ใช้ annotation จากกล้องจุลทรรศน์ที่มีหลักฐานรองรับ รัน sequence predictor ในเครื่อง และใช้ PSO รวมผลแบบ multilabel โดยเปิดให้เห็นคำตอบก่อนถ่วงน้ำหนัก
variant หรือการแสดงออกที่เปลี่ยนไปอาจมีผลต่างกันมาก ขึ้นกับว่าโปรตีนไปถึงนิวเคลียส เยื่อหุ้มเซลล์ ไมโทคอนเดรีย หรือระบบหลั่งหรือไม่
โปรตีนมนุษย์สามารถ shuttle ผ่านออร์แกเนลล์และย้ายตามสภาวะของเซลล์ การบังคับให้ตอบ top-1 อาจซ่อนตำแหน่งรองที่ถูกต้อง
WoLF PSORT, Light Attention และ ngLOC animal รันใน container แยกกัน เก็บหลักฐานและ cache ก่อนให้ PSO โหวต
ขอบเขต: นี่คืองานพัฒนาวิธีและระบบ ไม่ใช่เครื่องมือวินิจฉัย ผลใช้จัดลำดับสมมติฐานและไม่ทดแทนหลักฐานจากห้องปฏิบัติการ
จับคู่ Human Protein Atlas v25.1 เฉพาะ annotation ระดับ Enhanced หรือ Supported กับลำดับ Homo sapiens ที่ reviewed ใน UniProt แล้วแบ่ง fit, validation และ locked test ด้วย stable hash ของ accession
โครงสร้างย่อย 49 แบบของ HPA ถูก map อย่างเปิดเผยเป็น 9 compartment ที่ predictor ใช้ร่วมกัน ได้แก่ nucleus, cytoplasm, plasma membrane, mitochondrion, extracellular, ER, Golgi, peroxisome และ lysosome กำหนดความยาวไม่เกิน 1,200 residues เพื่อให้ขอบเขตการทดลองบน CPU ทำซ้ำได้ โดยตัด long-tail 492 รายการจากชุดที่จับคู่ได้ครั้งแรก
| Predictor | โหมด | บทบาท | ข้อจำกัด |
|---|---|---|---|
| Light Attention | ProtT5 + published checkpoint | หลักฐานจาก protein language model | หัวทำนายเดิมเป็น single-label และอาจมีข้อมูลสาธารณะซ้อนกับ benchmark |
| WoLF PSORT | Animal kNN | sorting signal และ sequence evidence | เป็นโมเดลเก่าและต้อง map label |
| ngLOC 1.0 | Animal n-gram model | หลักฐานเชิงกำเนิดที่เป็นอิสระ | ชุดเรียน Swiss-Prot รุ่นเก่าและต้อง normalize legacy scores |
objective เปลี่ยนพฤติกรรมของโมเดลโดยตรง การ optimize exact match ทำให้ voter ระมัดระวังและเพิ่ม exact accuracy จาก Light Attention 37.05% เป็น 37.80% แต่พลาดคลาสหายากหลายคลาส ส่วนการ optimize macro F1 เพิ่ม macro F1 จาก 43.57% เป็น 51.34% แต่ตอบชุด label มากเกินไปจน exact accuracy เหลือ 3.16% Prediction panel ใช้ exact-match voter ที่เลือกจาก validation และแสดงผลทั้งสองแบบในตาราง
วางลำดับ FASTA ของโปรตีนมนุษย์ ครั้งแรกอาจใช้เวลาหลายนาทีเพราะทุกโมเดลรันบนเครื่องจริง
จะแสดง raw answer, coefficient, weighted contribution และ threshold ของทุกตำแหน่ง
| การทดลองกำลังทำงาน ตารางจะอ่านค่าจาก frozen artifact โดยตรง |
ประเมินแต่ละตำแหน่งเป็น binary decision แยกกัน เพราะโปรตีนหนึ่งตัวมีหลาย label ที่ถูกต้องได้