STORM Retrieval
KEY POINT
RAG ที่พัฒนาตัวเองได้
ทำการ fine-tuning โดยอัตโนมัติจากฟีดแบ็ก ทำให้คุณภาพการค้นคืนดีขึ้นอย่างต่อเนื่องเพียงประเมินคำตอบง่ายๆ ของผู้ใช้
สถาปัตยกรรมการค้นคืนที่เหมาะกับชุดเอกสารขนาดใหญ่
การกรองหลายขั้นตอนช่วยนำทางในชุดเอกสารขนาดใหญ่ได้อย่างมีประสิทธิภาพ ให้คำตอบที่แม่นยำแม้ในชุดข้อมูลที่ซับซ้อน
เพิ่มความแม่นยำด้วยการค้นหาแบบไฮบริด
ผสานการค้นหาเชิงคำศัพท์เพื่อจับคู่คีย์เวิร์ดที่ตรงกัน เข้ากับการค้นหาเชิงความหมายเพื่อความคล้ายคลึงตามบริบท รับประกันผลลัพธ์ที่แม่นยำและครอบคลุม
RAG PERFORMANCE
ด้วยการปรับแต่งแต่ละเอนจินในเทคสแตกและการออกแบบตรรกะการค้นหาเวกเตอร์ที่มีประสิทธิภาพสูง เราได้ยกระดับประสิทธิภาพและคุณภาพของระบบ RAG ของเราอย่างมีนัยสำคัญ

1. เปรียบเทียบคุณภาพการค้นหาของ <O Corp. Embedding + Re-ranker> และ <STORM Embedding + Re-ranker + Search Logic> โดยใช้ RECALL@K
2. เปรียบเทียบคุณภาพการค้นหาของ <O Corp. Embedding> และ <STORM Embedding> โดยใช้ RECALL@K
3. หลังจากค้นคืนชังก์โดยใช้ <O Corp. embedding model> ได้เปรียบเทียบประสิทธิภาพการจัดอันดับใหม่ระหว่าง <O Corp. Re-ranker> และ <STORM Re-ranker> โดยใช้ RECALL@K
CORE TECHNOLOGY

กลยุทธ์การแบ่งชังก์ที่เหมาะสม
เพิ่มความเข้าใจตามบริบทด้วยการรักษาความต่อเนื่องระดับเอกสารและใช้การแบ่งชังก์แบบหลายสเกล
- LATE CHUNKING: รักษาบริบทของเอกสารในภาพรวม
- MULTI-SCALE CHUNKING: ใช้ชังก์หลายขนาดพร้อมกัน
- CONTEXTUAL CHUNKING: เพิ่มบริบทเฉพาะที่ให้แต่ละชังก์

การขยายคำค้น (Query Expansion)
ตีความเจตนาเบื้องหลังคำถามของผู้ใช้ และเสริมคำค้นด้วยคำพ้องความหมายและสำนวนที่เกี่ยวข้องเชิงความหมายเพื่อเพิ่มความแม่นยำและความครอบคลุมในการค้นคืน
- วิเคราะห์สัญญาณหลากหลายในคำค้นและสำรวจเส้นทางการค้นคืนหลายเส้นทาง
- ขยายคำค้นให้รวมคำที่เกี่ยวข้องเชิงความหมายและคำพ้องโดยอัตโนมัติ
- ปรับรูปแบบคำค้นใหม่ตามบริบทของบทสนทนาก่อนหน้า
- ตีความและปรับสำหรับสำนวนเชิงเวลา เช่น “ปีที่แล้ว” หรือ “เมื่อวานนี้”

การค้นหาแบบไฮบริด
เพิ่มความแม่นยำในการค้นหาสูงสุดด้วยกลยุทธ์การค้นคืนแบบ LEXICAL + SEMANTIC
- การจับคู่คีย์เวิร์ดที่ตรงกัน (LEXICAL)
- การค้นหาความคล้ายคลึงเชิงความหมาย (SEMANTIC)
- การจัดอันดับผลลัพธ์แบบไฮบริดที่ผสานและปรับให้เหมาะสม

การประมวลผลหลังการค้นคืน
ปรับผลลัพธ์สุดท้ายให้เหมาะสมด้วยการจัดอันดับใหม่หลายชั้นและการจัดกลุ่มชังก์
- จัดอันดับผลลัพธ์ใหม่ตามความคล้ายคลึงเชิงความหมาย
- เพิ่มคุณภาพคำตอบของ LLM ด้วยการจัดกลุ่มชังก์ที่เกี่ยวข้องเพื่อเสริมบริบท
- ผสานข้อมูลที่ทับซ้อนและอยู่ติดกันเพื่อสร้างอินพุตที่ขัดเกลายิ่งขึ้น ทำให้ได้คำตอบจาก LLM ที่มีคุณภาพสูง