โหวตได้ดี แต่ระบบเปราะบาง
ระบบปี 2021 ใช้ RPA ส่งลำดับไปยังเว็บ classifier หกแห่ง เก็บผลใน SQL แล้วใช้ PSO ถ่วงน้ำหนัก เมื่อเว็บหรือคิวเปลี่ยน คำขอหนึ่งอาจใช้เวลามากกว่าห้านาที
เรานำแนวคิด weighted ensemble ด้วย PSO จากงานปี 2021 มาสร้างใหม่ โดยรันตัวทำนายบนเครื่อง แสดงคำตอบของ classifier ทุกตัวก่อนคูณน้ำหนัก และทดสอบกับข้อมูลขนาดใหญ่ที่โปรตีนหนึ่งตัวมีได้หลายตำแหน่ง
5 predictors รวม ngLOC · locked primary-location test 831 โปรตีน · exact value 0.9049338
ตำแหน่งภายในเซลล์สัมพันธ์กับหน้าที่ของโปรตีน แต่การตรวจด้วยการทดลองใช้ทั้งเวลาและทรัพยากร ตัวทำนายเชิงคอมพิวเตอร์จึงช่วยจัดลำดับสมมติฐาน อย่างไรก็ตามแต่ละโมเดลใช้หลักฐานต่างกันและอาจตอบไม่ตรงกัน งานนี้จึงถามว่าเราจะรวมหลักฐานเหล่านั้นอย่างโปร่งใส ทำซ้ำได้ และเร็วพอสำหรับใช้งานจริงได้หรือไม่
ระบบปี 2021 ใช้ RPA ส่งลำดับไปยังเว็บ classifier หกแห่ง เก็บผลใน SQL แล้วใช้ PSO ถ่วงน้ำหนัก เมื่อเว็บหรือคิวเปลี่ยน คำขอหนึ่งอาจใช้เวลามากกว่าห้านาที
รุ่นนี้ใช้ predictor ใน Docker แยกกัน เก็บ cache ปรับชื่อคลาสให้ตรงกัน และเปิดให้ตรวจ raw score ก่อนคูณ coefficient เพื่อให้เร็วขึ้นและตรวจสอบย้อนกลับได้
เราทดสอบโปรตีน Viridiplantae 5,116 ตัวทั้งแบบ single-label ตามบทความเดิมและแบบ multilabel การเพิ่ม ngLOC ช่วย TVPSO เล็กน้อย แต่ทำให้ multilabel voter แย่ลง
โปรตีนไม่ได้อยู่เพียงช่องเดียวเสมอไป มันอาจถูกขนส่งผ่านหลายออร์แกเนลล์ อยู่ชั่วคราวในตำแหน่งหนึ่ง ถูกดัดแปลงในที่หนึ่งแล้วไปทำงานอีกที่หนึ่ง หรือมีหน้าที่จริงหลายตำแหน่งตามสภาวะของเซลล์ การบังคับให้เหลือคำตอบเดียวจึงอาจตัดชีววิทยาส่วนสำคัญทิ้ง
พัฒนาการ ความเครียด signalling และ post-translational modification สามารถเปลี่ยนเส้นทางของโปรตีนพืชได้ top-1 label อาจซ่อนพฤติกรรมตามเวลาเหล่านี้
ผลหลายตำแหน่งช่วยเลือก organelle marker ช่วงเวลา และเงื่อนไขที่ควรตรวจ แทนการถือว่าหลักฐานรองทุกอย่างเป็นความผิดพลาด
โมเดลอาจตอบตำแหน่งหลักถูก แต่พลาดตำแหน่งรองทั้งหมด เราจึงรายงาน exact accuracy, micro/macro F1, Hamming loss และ confusion matrix รายคลาส
ความหมายของผลบนหน้านี้: voter ใช้ threshold แยกต่อ localization จึงตอบได้มากกว่าหนึ่งตำแหน่ง ส่วน pie chart แสดงสัดส่วนแรงสนับสนุนจาก ensemble ไม่ได้หมายถึงสัดส่วนเวลาที่โปรตีนอยู่จริงในแต่ละออร์แกเนลล์
| ประเด็น | PlantLoc ปี 2021 | ห้องทดลองปัจจุบัน |
|---|---|---|
| การเรียก classifier | เว็บภายนอก 6 ตัวผ่าน RPA | production ใช้ local predictor 4 ตัว และทดลอง ngLOC เป็นตัวที่ 5 |
| สถาปัตยกรรม | Frontend + Backend + SQL queue + web crawling | Docker แยก service, local adapter, cache และ rate limit |
| ข้อมูลทดลอง | Dataset S จำนวน 753 โปรตีน | DeepLoc Viridiplantae ที่มี experimental evidence 5,116 โปรตีน |
| โจทย์ตำแหน่ง | ตำแหน่งหลัก 12 คลาส | 10 คลาสร่วมแบบ multilabel; เก็บ raw cytoskeleton ของ ngLOC แต่ไม่รวมใน vote |
| PSO | Time-varying PSO เพิ่ม primary accuracy | ทำ TVPSO decision rule เดิมซ้ำ และเพิ่ม thresholded multilabel PSO แยกต่างหาก |
| การประเมิน | 10-fold บน primary label | locked test 831 single-label และ 963 multilabel พร้อมผลรายคลาส |
| การอธิบายผล | ตารางคะแนนเรียงลำดับและ pie chart | raw answer → coefficient → weighted contribution → threshold → output พร้อม weights และ confusion matrices |
| ผลหลัก | 92.3% ในชุดเดิม 753 ตัว | TVPSO 5 predictors ได้ 90.5% primary accuracy; production multilabel ได้ exact accuracy 75.0% |
ห้ามเปรียบเทียบเปอร์เซ็นต์ตรง ๆ เพราะชุดข้อมูล พื้นที่ label, base classifier และคำถามในการประเมินต่างกัน หน้านี้แยกสอง formulation เพื่อไม่ให้การปรับระบบถูกตีความเป็น accuracy claim แบบเดียวกับบทความเดิม
Weighted Ensemble for Plant Protein Subcellular Localization Using Particle Swarm Optimization
Warin Wattanapornprom, Thanagorn Glomrit, Tinnaphop Prayongsup, Pitchayanin Suwanthanarat และ Supatcha Lertampaiporn
เป็นต้นทางของ workflow แบบ RPA, น้ำหนัก PSO ราย localization, การจัดอันดับผล และรูปแบบการนำเสนอที่นำมาศึกษาต่อ
A Consensus Method for Optimizing Multiple Classifier Results for Predicting the Subcellular Localization of Bacterial Proteins
Supatcha Lertampaiporn, Sirapop Nuannimnoi, Tayvich Vorapreeda, Nipa Chokesajjawatee, Wonnop Visessanguan และ Chinae Thammarongtham
เป็นแหล่งพารามิเตอร์ time-varying PSO ที่ใช้สร้างซ้ำในงานนี้
LOCALIZER, WoLF PSORT, Light Attention, SherLoc2 และ ngLOC เป็นผลงานของผู้สร้าง base predictors ตามเอกสารอ้างอิงด้านล่าง งานนี้นำผลของโมเดลเหล่านั้นมา ensemble ไม่ได้อ้างว่าเป็นผู้สร้างโมเดลฐาน
เป็น inference จริงบนเครื่อง ไม่ใช่ค่าตัวอย่าง วางลำดับโปรตีนหนึ่งตัวแล้วรัน voter สี่โมเดล
ครั้งแรกอาจใช้เวลานาน ลำดับเดิมจะใช้ local cache และ public API มี rate limit
ตารางจะแสดง raw score และคำตอบ Yes/No → coefficient → weighted numerator → vote/threshold → ผลสุดท้าย
| โมเดล | Macro F1 | Micro F1 | Weighted F1 | Exact accuracy | Hamming loss |
|---|---|---|---|---|---|
| Light Attention | .766 | .839 | .831 | .764 | .034 |
| Restored production PSO · 3 predictors | .743 | .833 | .833 | .771 | .037 |
| Experimental PSO · 4 predictors | .764 | .833 | .829 | .750 | .038 |
| Experimental PSO + ngLOC · 5 predictors | .674 | .827 | .808 | .734 | .037 |
| ngLOC native top-1 | .500 | .608 | .582 | .562 | .084 |
| SherLoc2 sequence-only | .327 | .415 | .372 | .307 | .112 |
คืน production เป็น voter สามตัวจาก artifact เดิมซึ่งได้ exact accuracy 77.1% ส่วน SherLoc2 และ ngLOC เก็บไว้เป็นการทดลองรอง เพราะการเพิ่ม classifier ไม่ได้เพิ่ม exact accuracy; exact accuracy จะนับว่าถูกต่อเมื่อทั้งสิบ label ตรงทั้งหมด
| โมเดล | Primary accuracy | Macro F1 | Weighted F1 |
|---|---|---|---|
| TVPSO · 5 predictors รวม ngLOC | .905 | .840 | .905 |
| TVPSO · 4 predictors | .901 | .822 | .900 |
| Light Attention | .901 | .820 | .900 |
| ngLOC 1.0 plant | .651 | .537 | .637 |
| WoLF PSORT | .596 | .350 | .573 |
| LOCALIZER | .514 | .181 | .419 |
| SherLoc2 sequence-only | .434 | .357 | .445 |
ใช้ 25 particles, 1,000 objective evaluations, inertia .9→.4, c1 2.5→.5, c2 .5→2.5, น้ำหนัก [0,1] และ seed 42
เลือกดู LOCALIZER, WoLF PSORT, Light Attention, SherLoc2, unweighted vote หรือ PSO voter ได้โดยตรง แต่ละการ์ดแสดง TN, FP, FN และ TP ของ localization นั้น
แถวคือค่าจากการทดลอง คอลัมน์คือค่าที่โมเดลทำนาย สีเข้มหมายถึงจำนวนโปรตีนมาก
Light Attention พัฒนาบนข้อมูลที่เกี่ยวข้องกับ DeepLoc แม้ partition 4 ไม่ได้ใช้ปรับ voter แต่ไม่สามารถรับประกันว่า pretrained base model ไม่เคยเห็นข้อมูลทั้งหมด งานนี้จึงเป็นการพัฒนา PSO และศึกษาระบบ ไม่ใช่ independent benchmark ของ Light Attention นอกจากนี้ผล prediction เป็นสมมติฐานสำหรับการตรวจต่อ ไม่ใช่หลักฐานแทนการทดลองในห้องปฏิบัติการ