STORM Retrieval

    ยกระดับเทคโนโลยีการจัดโครงสร้างข้อมูลและการแบ่งชังก์
    ด้วยไปป์ไลน์ RAG เฉพาะที่มีความสมบูรณ์สูง STORM RAG เพิ่มทั้งประสิทธิภาพและคุณภาพให้สูงสุด พร้อมทั้งให้แม้แต่ผู้ที่ไม่ใช่ผู้เชี่ยวชาญปรับปรุงโมเดลได้โดยตรงผ่านฟีดแบ็กของผู้ใช้

    KEY POINT

    RAG ที่พัฒนาตัวเองได้

    ทำการ fine-tuning โดยอัตโนมัติจากฟีดแบ็ก ทำให้คุณภาพการค้นคืนดีขึ้นอย่างต่อเนื่องเพียงประเมินคำตอบง่ายๆ ของผู้ใช้

    สถาปัตยกรรมการค้นคืนที่เหมาะกับชุดเอกสารขนาดใหญ่

    การกรองหลายขั้นตอนช่วยนำทางในชุดเอกสารขนาดใหญ่ได้อย่างมีประสิทธิภาพ ให้คำตอบที่แม่นยำแม้ในชุดข้อมูลที่ซับซ้อน

    เพิ่มความแม่นยำด้วยการค้นหาแบบไฮบริด

    ผสานการค้นหาเชิงคำศัพท์เพื่อจับคู่คีย์เวิร์ดที่ตรงกัน เข้ากับการค้นหาเชิงความหมายเพื่อความคล้ายคลึงตามบริบท รับประกันผลลัพธ์ที่แม่นยำและครอบคลุม

    RAG PERFORMANCE

    ด้วยการปรับแต่งแต่ละเอนจินในเทคสแตกและการออกแบบตรรกะการค้นหาเวกเตอร์ที่มีประสิทธิภาพสูง เราได้ยกระดับประสิทธิภาพและคุณภาพของระบบ RAG ของเราอย่างมีนัยสำคัญ

    performance

    1. เปรียบเทียบคุณภาพการค้นหาของ <O Corp. Embedding + Re-ranker> และ <STORM Embedding + Re-ranker + Search Logic> โดยใช้ RECALL@K

    2. เปรียบเทียบคุณภาพการค้นหาของ <O Corp. Embedding> และ <STORM Embedding> โดยใช้ RECALL@K

    3. หลังจากค้นคืนชังก์โดยใช้ <O Corp. embedding model> ได้เปรียบเทียบประสิทธิภาพการจัดอันดับใหม่ระหว่าง <O Corp. Re-ranker> และ <STORM Re-ranker> โดยใช้ RECALL@K

    CORE TECHNOLOGY

    กลยุทธ์การแบ่งชังก์ที่เหมาะสม

    กลยุทธ์การแบ่งชังก์ที่เหมาะสม

    เพิ่มความเข้าใจตามบริบทด้วยการรักษาความต่อเนื่องระดับเอกสารและใช้การแบ่งชังก์แบบหลายสเกล

    • LATE CHUNKING: รักษาบริบทของเอกสารในภาพรวม
    • MULTI-SCALE CHUNKING: ใช้ชังก์หลายขนาดพร้อมกัน
    • CONTEXTUAL CHUNKING: เพิ่มบริบทเฉพาะที่ให้แต่ละชังก์
    การขยายคำค้น (Query Expansion)

    การขยายคำค้น (Query Expansion)

    ตีความเจตนาเบื้องหลังคำถามของผู้ใช้ และเสริมคำค้นด้วยคำพ้องความหมายและสำนวนที่เกี่ยวข้องเชิงความหมายเพื่อเพิ่มความแม่นยำและความครอบคลุมในการค้นคืน

    • วิเคราะห์สัญญาณหลากหลายในคำค้นและสำรวจเส้นทางการค้นคืนหลายเส้นทาง
    • ขยายคำค้นให้รวมคำที่เกี่ยวข้องเชิงความหมายและคำพ้องโดยอัตโนมัติ
    • ปรับรูปแบบคำค้นใหม่ตามบริบทของบทสนทนาก่อนหน้า
    • ตีความและปรับสำหรับสำนวนเชิงเวลา เช่น “ปีที่แล้ว” หรือ “เมื่อวานนี้”
    การค้นหาแบบไฮบริด

    การค้นหาแบบไฮบริด

    เพิ่มความแม่นยำในการค้นหาสูงสุดด้วยกลยุทธ์การค้นคืนแบบ LEXICAL + SEMANTIC

    • การจับคู่คีย์เวิร์ดที่ตรงกัน (LEXICAL)
    • การค้นหาความคล้ายคลึงเชิงความหมาย (SEMANTIC)
    • การจัดอันดับผลลัพธ์แบบไฮบริดที่ผสานและปรับให้เหมาะสม
    การประมวลผลหลังการค้นคืน

    การประมวลผลหลังการค้นคืน

    ปรับผลลัพธ์สุดท้ายให้เหมาะสมด้วยการจัดอันดับใหม่หลายชั้นและการจัดกลุ่มชังก์

    • จัดอันดับผลลัพธ์ใหม่ตามความคล้ายคลึงเชิงความหมาย
    • เพิ่มคุณภาพคำตอบของ LLM ด้วยการจัดกลุ่มชังก์ที่เกี่ยวข้องเพื่อเสริมบริบท
    • ผสานข้อมูลที่ทับซ้อนและอยู่ติดกันเพื่อสร้างอินพุตที่ขัดเกลายิ่งขึ้น ทำให้ได้คำตอบจาก LLM ที่มีคุณภาพสูง