คู่มือ AI ภาษา

ประโยค-BERT Embeddings

Sentence-BERT (SBERT) ปรับ BERT เพื่อสร้างเวกเตอร์ที่มีความยาวคงที่เพียงตัวเดียวสำหรับทั้งประโยค จึงสามารถเปรียบเทียบความหมายกับความคล้ายคลึงของโคไซน์ที่รวดเร็วได้

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It made semantic search and clustering over millions of sentences practical, turning a job that took BERT hours into milliseconds.

เจาะลึก

BERT แบบธรรมดาสามารถเปรียบเทียบสองประโยคเพื่อความคล้ายคลึงกันได้ แต่เพียงป้อนทั้งสองประโยคเข้าด้วยกันผ่านเครือข่าย ซึ่งช้าเกินไปในขนาด: การเปรียบเทียบ 10,000 ประโยคในคู่จะต้องใช้การส่งต่อประมาณ 50 ล้านครั้ง Sentence-BERT ซึ่งเปิดตัวในปี 2019 โดย Reimers และ Gurevych แก้ไขปัญหานี้โดยใช้เครือข่ายสยาม (คู่) โดยที่หอคอย BERT สองแห่งที่มีน้ำหนักร่วมกัน แต่ละเข้ารหัสหนึ่งประโยคแยกจากกัน จากนั้นขั้นตอนการรวมกลุ่ม (โดยปกติหมายถึงการรวมกลุ่มกับการฝังโทเค็น) ให้ผลลัพธ์หนึ่งเวกเตอร์ต่อประโยค โมเดลนี้ได้รับการปรับแต่งอย่างละเอียดเพื่อให้ประโยคที่คล้ายกันทางความหมายมาอยู่ใกล้กันในพื้นที่เวกเตอร์ ตอนนี้แต่ละประโยคได้รับการเข้ารหัสครั้งเดียวเป็นการฝังที่สามารถนำกลับมาใช้ใหม่ได้ และความคล้ายคลึงกันกลายเป็นผลิตภัณฑ์ดอทราคาถูก ช่วยให้สามารถค้นหา การขจัดข้อมูลซ้ำซ้อน และการจัดกลุ่มในวงกว้างได้

ข้อมูลเชิงลึกทางเทคนิค

โดยทั่วไปแล้ว SBERT จะได้รับการฝึกอบรมเกี่ยวกับสถาปัตยกรรมสยามและมีวัตถุประสงค์เชิงเปรียบเทียบหรือแบบแฝด ข้อมูลการอนุมานภาษาธรรมชาติเป็นเรื่องปกติ: คู่ความผูกพันจะถูกดึงเข้าหากัน ความขัดแย้งถูกแยกออกจากกัน หอคอยทั้งสองแห่งใช้น้ำหนักร่วมกัน ดังนั้นการเข้ารหัสจึงมีความสมมาตร โดยทั่วไปการรวมค่าเฉลี่ยของเวกเตอร์โทเค็นสุดท้ายจะมีประสิทธิภาพดีกว่าการใช้โทเค็น [CLS] เพียงอย่างเดียว ทำให้เกิดการฝังที่ความคล้ายคลึงกันของโคไซน์ติดตามความใกล้ชิดทางความหมายได้อย่างน่าเชื่อถือ

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ

เข้าถึงและเข้าถึง

ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร

การตัดสินใจที่ชัดเจนยิ่งขึ้น

ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ

อนาคตของการฝังประโยค-BERT

ตัวเข้ารหัสแบบ SBERT ในรูปแบบ SBERT สนับสนุนการสร้างการเรียกข้อมูลแบบเสริม โดยป้อนบริบทที่เกี่ยวข้องให้กับโมเดลภาษาขนาดใหญ่ ฟิลด์นี้กำลังเคลื่อนไปสู่โมเดลการฝังที่ปรับแต่งตามคำแนะนำที่ใหญ่ขึ้น การฝังหลายภาษาและหลายรูปแบบ และการเป็นตัวแทน Matryoshka ซึ่งสามารถตัดขนาดให้สั้นลงได้เพื่อความรวดเร็ว ไปป์ไลน์แบบไฮบริดจับคู่การดึงข้อมูลตัวเข้ารหัสสองตัวที่รวดเร็วกับการจัดอันดับตัวเข้ารหัสข้ามที่ช้ากว่า โดยรวมขนาดของ SBERT เข้ากับตัวเลือกอันดับต้นๆ ที่มีความแม่นยำสูงกว่า

การใช้งานจริงในโลกแห่งความเป็นจริง

เครื่องมือค้นหาความหมายฝังข้อความค้นหาและเอกสารทั้งหมด จากนั้นส่งคืนเวกเตอร์ที่ใกล้ที่สุด แทนที่จะอาศัยคำสำคัญที่ทับซ้อนกัน

ระบบการสร้างการเรียกข้อมูลแบบเสริมใช้การฝัง SBERT เพื่อดึงข้อความที่เกี่ยวข้องเพื่อตอบคำถามของแชทบอท

เครื่องมือสนับสนุนลูกค้าจัดกลุ่มตั๋วขาเข้าโดยการฝังความคล้ายคลึงกับกลุ่มปัญหาที่ซ้ำกันหรือที่เกี่ยวข้องโดยอัตโนมัติ

ไลบรารี Python ของตัวแปลงประโยคมีโมเดล SBERT ที่ได้รับการฝึกล่วงหน้าสำหรับการขุดถอดความและขจัดข้อความที่ซ้ำกันที่ใกล้เคียงกัน

ความเสี่ยงและรั้ว

ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ

ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน

ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ

แผนงานการดำเนินงาน

1

กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว

2

การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ

3

รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง

4

ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Sentence-BERT Embeddings quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การฝังเอกสารสมมุติของ HyDE

คำถามที่พบบ่อย

What is Sentence-BERT Embeddings?

Sentence-BERT (SBERT) ปรับ BERT เพื่อสร้างเวกเตอร์ที่มีความยาวคงที่เพียงตัวเดียวสำหรับทั้งประโยค จึงสามารถเปรียบเทียบความหมายกับความคล้ายคลึงของโคไซน์ที่รวดเร็วได้ ทำให้การค้นหาเชิงความหมายและการจัดกลุ่มประโยคหลายล้านประโยคใช้งานได้จริง เปลี่ยนงานที่ใช้เวลาหลายชั่วโมงของ BERT ให้เป็นมิลลิวินาที

Sentence-BERT แก้ปัญหาหลักอะไรกับ BERT ธรรมดา

BERT ธรรมดาจะต้องประมวลผลคู่ประโยคร่วมกัน ดังนั้นการเปรียบเทียบแบบคู่ขนาดใหญ่จึงเป็นไปไม่ได้ในการคำนวณ SBERT เข้ารหัสแต่ละประโยคหนึ่งครั้งให้เป็นเวกเตอร์ที่นำมาใช้ซ้ำได้

Sentence-BERT ใช้สถาปัตยกรรมเครือข่ายแบบใด

SBERT ใช้โครงสร้างสยาม (แฝด) โดยที่ตัวเข้ารหัส BERT สองตัวจะแบ่งน้ำหนักกัน และแต่ละอันจะฝังหนึ่งประโยคแยกกัน

กลยุทธ์การรวมกลุ่มใดที่แนะนำมากที่สุดสำหรับการฝัง SBERT

โดยทั่วไปการรวมค่าเฉลี่ยของเวกเตอร์โทเค็นสุดท้ายจะมีประสิทธิภาพดีกว่าการใช้โทเค็น [CLS] เพียงอย่างเดียวสำหรับการฝังประโยค

เมื่อฝังประโยคแล้ว โดยทั่วไปแล้วจะวัดความคล้ายคลึงกันอย่างไร

จุดรวมของ SBERT คือความคล้ายคลึงกันลดลงเหลือการเปรียบเทียบโคไซน์/ดอทโปรดัคราคาถูกระหว่างเวกเตอร์ที่คำนวณไว้ล่วงหน้า

ชุดข้อมูลประเภทใดที่มักใช้เพื่อปรับแต่ง SBERT

ข้อมูล NLI ถูกนำมาใช้กันอย่างแพร่หลาย: คู่ความผูกพันจะถูกดึงเข้าด้วยกันและความขัดแย้งถูกแยกออกจากกัน ทำให้เกิดพื้นที่การฝังที่มีความหมาย