ยุคสมัยของ AI เสียง

สายโทรศัพท์อัตโนมัติส่วนใหญ่แย่มากเทคโนโลยีใหม่เปลี่ยนสิ่งนั้น

ปัญหาเดิมไม่ใช่ระบบโทรศัพท์อัตโนมัติไม่มีเสียงที่ฟังรื่นหู แต่คือระบบเข้าใจไม่มากพอที่จะทำให้บทสนทนาจริงดำเนินต่อไปได้

ระบบเมนูโทรศัพท์แบบลำดับชั้น

ยุค IVR

ผู้โทรต้องพูดแบบเครื่องจักร

ระบบอัตโนมัติหมายถึงเมนู ทางเลือกจากแป้นกด และคิว ซึ่งใช้งานได้เมื่อผู้โทรรู้เส้นทางที่ถูกต้องอยู่แล้ว

ช่วงเวลาที่ติดขัด

เจตนาถูกย่อให้เหลือการกดปุ่ม ดังนั้นทุกอย่างที่อยู่นอกเมนูจึงกลายเป็นการโอนสายหรือการพูดซ้ำ

ตัวอย่างการโทร

ยุค IVR

ผู้โทร

"ฉันต้องการเลื่อนนัดพรุ่งนี้"

ระบบ

"สำหรับการเรียกเก็บเงิน กด 1 สำหรับการนัดหมาย กด 2 สำหรับคำถามอื่นทั้งหมด กด 9"

ผลลัพธ์

ผู้โทรต้องเดา รอ และอธิบายเรื่องเดิมซ้ำอีกครั้ง

ระบบคิดอย่างไร

3 ขั้นตอน

ข้อความเมนู

แก้ไขแล้ว

สคริปต์ตายตัวแสดงรายการตัวเลือก

เส้นทาง DTMF

ไม่เสถียร

ปุ่มเดียวกลายเป็นเจตนาทั้งหมด

คิว

ขัดข้อง

บริบทจริงจะมาพร้อมกับมนุษย์

โมเดลแบบกำหนดเอง

AI ยุคแรก

ระบบเข้าใจได้เฉพาะขอบเขตแคบ ๆ แล้วก็ไปต่อไม่ได้

ทีมต่าง ๆ ฝึกโมเดลเสียง ตัวแยกประเภทเจตนา และตัวดึงข้อมูลช่องสำหรับขั้นตอนการโทรเฉพาะทาง มีประโยชน์ แต่ปรับเปลี่ยนได้มีต้นทุนสูง

ช่วงเวลาที่ติดขัด

ระบบจับเจตนาที่ฝึกไว้ได้หนึ่งอย่าง จากนั้นอาจตกหล่นคำขอที่สองหรือถามคำถามติดตามแบบตายตัว

ตัวอย่างการโทร

AI ยุคแรก

ผู้โทร

"ช่วยเลื่อนนัดพรุ่งนี้และเพิ่มคู่สมรสของฉันได้ไหม"

ระบบ

"ฉันช่วยเลื่อนนัดได้ คุณต้องการวันที่เท่าไร"

ผลลัพธ์

รายละเอียดเรื่องคู่สมรสสูญหาย เพราะไม่มีอยู่ในขั้นตอนที่ฝึกไว้

ระบบคิดอย่างไร

3 ขั้นตอน

ASR แบบกำหนดเอง

แก้ไขแล้ว

ปรับให้เหมาะกับโดเมนและชุดสำเนียง

โมเดลเจตนา

ไม่เสถียร

จัดประเภทคำขอที่ใกล้เคียงกับที่รู้จักที่สุด

การเติมช่องข้อมูล

ขัดข้อง

ข้อมูลที่ขาดจะกระตุ้นการแก้ไขตามสคริปต์

สแตกแบบ Vapi / Retell / ElevenLabs

ไปป์ไลน์ 3 ขั้นตอน

ระบบมีความยืดหยุ่นขึ้น แต่แต่ละขั้นตอนเชื่อถือขั้นตอนก่อนหน้า

รูปแบบสมัยใหม่ที่พบได้ทั่วไปเชื่อมเสียงเป็นข้อความ LLM และข้อความเป็นเสียงเข้ากับวงจรการโทรเดียว

ช่วงเวลาที่ติดขัด

เมื่อข้อความถอดเสียงผิดหรือผู้โทรขัดจังหวะ LLM จะตอบคำถามผิดอย่างมั่นใจ

ตัวอย่างการโทร

ไปป์ไลน์ 3 ขั้นตอน

ผู้โทร

"ไม่ฉันเช่าที่นี่"

ระบบ

"เข้าใจแล้ว เป็นอสังหาริมทรัพย์แบบฟาร์มปศุสัตว์ ใช่หรือไม่"

ผลลัพธ์

ความคลาดเคลื่อนในการได้ยินเพียงครั้งเดียวกลายเป็นความผิดพลาดในการพูด

ระบบคิดอย่างไร

3 ขั้นตอน

เสียงเป็นข้อความ

ขัดข้อง

ข้อความถอดเสียงหนึ่งชุดกลายเป็นแหล่งข้อมูลอ้างอิงเดียว

LLM

ไม่เสถียร

สร้างคำตอบจากข้อความ ไม่ใช่จากเสียงต้นฉบับ

ข้อความเป็นเสียง

ขัดข้อง

พูดคำตอบกลับอย่างมั่นใจ

AI เอเจนต์เสียงแบบบูรณาการ

ThunderPhone

ระบบสามารถฟัง ให้เหตุผล และกู้คืนได้ในวงจรเดียว

ThunderPhone ประสานความเข้าใจเสียง การกำหนดเส้นทางโมเดล การผลัดกันพูด และการสร้างคำตอบไว้ในสถาปัตยกรรมเดียว

สิ่งที่เปลี่ยนไป

เส้นทางการรับฟังหลายเส้นทางและการให้เหตุผลที่เข้าใจเสียงช่วยลดความล้มเหลวจากขั้นตอนเดียวก่อนส่งถึงผู้โทร

ตัวอย่างการโทร

ThunderPhone

ผู้โทร

"ไม่ฉันเช่าที่นี่"

ระบบ

"เข้าใจแล้ว คุณเช่าบ้านอยู่ ดังนั้นฉันจะข้ามคำถามเรื่องกรรมสิทธิ์"

ผลลัพธ์

การสนทนาดำเนินต่อไปได้โดยไม่ทำให้ผู้โทรต้องฝืนรับมือกับระบบ

ระบบคิดอย่างไร

4 ขั้นตอน

สตรีมเสียง

ผ่านการตรวจสอบ

เสียงดิบยังพร้อมให้ใช้ในการให้เหตุผล

การรับฟังแบบซ้ำซ้อน

ผ่านการตรวจสอบ

มีการเปรียบเทียบสัญญาณก่อนดำเนินการ

การกำหนดเส้นทางโมเดล

ผ่านการตรวจสอบ

เส้นทางที่รวดเร็วและเส้นทางที่วิเคราะห์ลึกทำงานร่วมกันในแต่ละรอบการสนทนา

การตอบกลับอย่างเป็นธรรมชาติ

ผ่านการตรวจสอบ

ผู้โทรได้ยินบริบทที่แก้ไขแล้ว

ผลลัพธ์ที่ได้

ความก้าวหน้าครั้งสำคัญไม่ใช่แค่เสียงหุ่นยนต์ที่ไพเราะขึ้นแต่คือสถาปัตยกรรมที่ทำให้การสนทนาดำเนินไปตามเป้าหมาย

การรับฟังที่ดีกว่า

ระบบสามารถเปรียบเทียบสัญญาณและวิเคราะห์เสียงแทนการเชื่อถือข้อความถอดเสียงเพียงชุดเดียว

จังหวะที่ดีกว่า

การผลัดกันพูดและการจัดการเมื่อถูกขัดจังหวะเป็นส่วนหนึ่งของวงจรการสนทนา

การกำหนดเส้นทางที่ดีกว่า

สามารถเลือกเส้นทางที่รวดเร็วหรือการวิเคราะห์เชิงลึกตามความต้องการของแต่ละช่วงโต้ตอบ

ประสบการณ์ที่ดีกว่า

ผู้โทรใช้เวลาน้อยลงในการแก้ไขระบบอัตโนมัติและมีเวลามากขึ้นในการทำงานให้เสร็จ