ความประทับใจแรกของเราต่อ API GPT-Live-1 สำหรับเอเจนต์เสียง
OpenAI เปิดตัว GPT-Live-1 โมเดลเสียงแบบฟูลดูเพล็กซ์รุ่นใหม่ผ่าน API เมื่อสองวันก่อน เราสร้างและดูแล AI เอเจนต์โทรศัพท์ที่ใช้งานจริงในระบบผลิต จึงนำมันไปใช้กับหมายเลขโทรศัพท์จริงแล้วโทรคุยกับมัน หลายครั้งมาก
เราทดสอบด้วยสคริปต์คัดกรองลีดที่มีแนวโน้มสูงราว 13,000 โทเค็นจากลูกค้าประกันรายหนึ่งของเรา ซึ่งมีประโยคที่กำหนดให้ต้องพูดตามคำทุกคำ กฎการทวนข้อมูลที่เข้มงวด และคำถามติดตามแบบแตกแขนง ตลอดวันอันยาวนานวันหนึ่ง เราโทรจริง 12 สาย จำลองการสัมภาษณ์ราว 25 ครั้ง และทดสอบแบบไม่มีโครงสร้างอีกชุดหนึ่ง
นี่คือความประทับใจแรกของเรา พร้อมบทสนทนาและเสียงบันทึก เราจะเผยแพร่บทวิเคราะห์เชิงลึกในเร็ว ๆ นี้
บทสนทนามาจากสายทดสอบของเรา โดยถอดเสียงด้วย GPT-Live เราเปลี่ยนชื่อและถ้อยคำที่ระบุตัวตน ตัดบางช่วงของบทสนทนา และรวมส่วนที่แยกกันออกมาแล้ว เวลาที่ระบุเป็นวินาทีนับจากเริ่มสาย มาจากไฟล์ต้นฉบับ
ความเป็นธรรมชาติโดดเด่นเป็นพิเศษ
GPT-Live-1 เป็นคู่สนทนาที่ฟังดูเป็นธรรมชาติที่สุดเท่าที่เราเคยนำขึ้นสายโทรศัพท์ นี่คือก้าวกระโดดอย่างแท้จริง
มันฟังและพูดผ่านสตรีมเสียงต่อเนื่องเดียว โดยไม่มีขั้นตอนถอดเสียงและสังเคราะห์เสียงแยกจากกัน กลไกการสนทนาส่วนใหญ่ทำงานได้อย่างราบรื่น ผู้โทรได้ยินเสียงแรกของมันหลังหยุดพูดราว 1.3 วินาที (ค่ามัธยฐาน) หรือราว 0.7 วินาทีหากไม่นับช่วงของระบบโทรศัพท์ เราไม่ได้เพิ่มระบบตรวจจับกิจกรรมเสียงหรือโลจิกการผลัดตาเลย มันรับมือกับการพูดแทรกได้อย่างนุ่มนวล สร้างเสียงตอบรับระหว่างฟังอย่างเป็นธรรมชาติ ("อือฮึ") และพูดด้วยจังหวะกระฉับกระเฉงคล้ายมนุษย์
เมื่อได้รับเป้าหมายแทนประโยคที่ต้องอ่าน มันปรับคำถามให้เข้ากับบทสนทนาและรับมือกับการแก้ไขข้อมูลได้อย่างลื่นไหล:
มันไม่เคยเสียจังหวะจากการแก้ไขข้อมูล การพูดแทรก หรือผู้โทรเปลี่ยนคำตอบระหว่างสาย หากความเป็นธรรมชาติคือทั้งหมดของงาน บทความนี้คงจบลงตรงนี้ แต่น่าเสียดายที่เรื่องนี้มีมากกว่านั้น
มันทำตามคำสั่งได้ไม่สม่ำเสมอ
GPT-Live-1 ไม่ได้ทำตามคำสั่งได้อย่างน่าเชื่อถือในพฤติกรรมที่สำคัญสำหรับสายโทรศัพท์ตามสคริปต์
มากกว่าหนึ่งครั้ง มันตอบต่อคำว่า "ใช่" ที่ชัดเจนราวกับว่าคำตอบคือ "ไม่" โดยถามคำถามเดิมซ้ำ หรือดำเนินต่อไปราวกับผู้โทรปฏิเสธ
ความล้มเหลวที่เกิดซ้ำมากที่สุดคือการตีความคำสั่งตรงตัวเกินไป พรอมป์ต์ของเราระบุว่า หากผู้โทรบอกว่าสถานะที่อยู่อาศัยในข้อมูลไม่ถูกต้อง ให้ถามว่าพวกเขาเป็นเจ้าของบ้าน เช่าบ้าน หรืออาศัยอยู่กับพ่อแม่ ผู้โทรคนหนึ่งพูดว่า "ไม่ ตอนนี้ฉันเป็นเจ้าของแล้ว" ซึ่งตอบคำถามนั้นอยู่แล้ว แต่โมเดลกลับอ่านตัวเลือกทั้งหมด:
ความแปลกบางอย่างในช่วงแรกเกิดจากพรอมป์ต์ของเราเอง แต่ความตรงตัวเกินไปนี้ยังคงอยู่ในพรอมป์ต์ทุกรูปแบบที่เราลองใช้ คำตอบใดก็ตามที่เราไม่ได้ระบุไว้ล่วงหน้าถูกจัดการแบบกลไก แทนที่จะเป็นไปอย่างสมเหตุสมผล
บางครั้งมันยังคิดออกเสียงเมื่ออยู่ภายใต้แรงกดดัน:
ตัวเลขและอักขระผสมมีความเสี่ยง
การสะกด ที่อยู่ วันเกิด และหมายเลขประจำตัวต้องถูกต้องแม่นยำ นี่คือจุดที่การพูดของ GPT-Live-1 มีปัญหามากที่สุด
เราได้ยินว่าโมเดลตัดและแทนที่อักขระในสตริงอักขระผสม ตัวอย่างนี้เป็นการอ่านหมายเลขเคลมที่แต่งขึ้น คลิปไม่ได้ผ่านการแก้ไขนอกจากตัดช่วงเงียบออก ในภาษาอังกฤษ ทรานสคริปต์ของโมเดลถูกต้อง แต่เสียงเพิ่ม "Y" เข้ามา:
ในภาษารัสเซียแย่กว่าเดิม: "Q" กลายเป็น "X" ทั้งในเสียงและทรานสคริปต์
วันที่ก็ทำให้เกิดปัญหาเดียวกัน ผู้โทรแจ้งวันเกิดเป็นตัวเลข ซึ่งต่อมาโมเดลอ่านกลับเป็นจำนวนตัวเลข:
บางครั้งโมเดลยังพูดประโยคที่ควรเป็นของผู้โทรเอง:
สำเนียงในภาษาอื่น
เราทดสอบโมเดลเสียงใหม่ใน 47 ภาษาที่ผลิตภัณฑ์ของเรารองรับ ภาษารัสเซียของ GPT-Live-1 พูดได้คล่อง แต่มีสำเนียงอเมริกันชัดเจน (ขณะที่เสียง TTS ที่เราใช้จริงในระบบโปรดักชันมักฟังดูเหมือนเจ้าของภาษา):
เรายังลองภาษาลูกันดาด้วย ในการโทรครั้งแรก โมเดลตอบเป็นภาษาสวาฮีลีแทน ครั้งที่สอง โมเดลพูดภาษาลูกันดาได้เป็นธรรมชาติกว่าที่เราคาดจากโมเดลทั่วไป แต่ยังคงมีสำเนียงอเมริกันชัดเจน เราไม่ได้ทดสอบครบทุกภาษา แต่คาดว่ารูปแบบเรื่องสำเนียงนี้น่าจะเกิดขึ้นโดยทั่วไป ซึ่งไม่สำคัญสำหรับเอเจนต์ที่ใช้ภาษาอังกฤษเท่านั้น แต่เป็นข้อควรระวังที่สำคัญมากสำหรับกรณีใช้งานในภาษาอื่น
ข้อจำกัด API บางประการที่ควรรู้
จากสิ่งที่เราพบในสัปดาห์นี้ มีข้อจำกัด API บางประการที่สำคัญสำหรับเอเจนต์ที่ใช้งานจริง:
- คำสั่งจะเปลี่ยนแปลงไม่ได้หลังจากเริ่มเซสชัน และจำกัดที่ 16,384 โทเค็น
- เสียงเอาต์พุตจะสตรีมต่อเนื่องไม่หยุด — รวมถึงความเงียบด้วย — ดังนั้นจึงใช้ "เสียงหยุดแล้ว" เป็นสัญญาณสิ้นสุดเทิร์นไม่ได้ สำหรับกรณีใช้งานที่ต้องแบ่งเทิร์น
- เข้าถึงได้ผ่านเอนด์พอยต์ใหม่
v1/live/sessionsเท่านั้น และยังไม่พร้อมใช้งานบน Azure ในตอนที่เราตรวจสอบ
ความเห็นของเราจนถึงตอนนี้
เอเจนต์โทรศัพท์สำหรับใช้งานจริงต้องฟังเป็นธรรมชาติและทำตามสคริปต์ได้อย่างสม่ำเสมอ GPT-Live-1 ทำได้ยอดเยี่ยมในด้านแรก แต่ยังมีปัญหาร้ายแรงบางประการในด้านหลัง เราจะทดสอบเพิ่มเติมต่อไปตามเวลา และจะรายงานสิ่งที่เราพบอย่างต่อเนื่อง