Microsoft เปิดตัว GPT-Realtime Speech-to-Speech Model บน Azure AI Foundry

/th/images/GPT-4o-Azure-AI.jpg

อ่านหน้าการเปิดเผยข้อมูลของเราเพื่อดูว่าคุณจะช่วย Windows Insight ได้อย่างไรสนับสนุนทีมบรรณาธิการ อ่านเพิ่มเติม

ผู้อ่านช่วยสนับสนุน Windows Insight เราอาจได้รับค่าคอมมิชชั่นหากคุณซื้อผ่านลิงก์ของเรา

Microsoft ได้ประกาศอย่างเป็นทางการเกี่ยวกับความพร้อมใช้งานทั่วไปของ GPT-Realtime ซึ่งเป็นโมเดลคำพูดเป็นคำพูดล่าสุด (S2S) บน Azure AI Foundry โมเดลใหม่รวบรวมการปรับปรุงการพูดด้วยคำพูดของ Microsoft ในข้อเสนอที่รวมเป็นหนึ่งเดียวโดยมุ่งเน้นไปที่ภาษาธรรมชาติคุณภาพเสียงและการเรียนการสอนที่ดีขึ้นต่อไปนี้

นักพัฒนาสามารถเข้าถึง GPT-Realtime ผ่าน API แบบเรียลไทม์ซึ่งรองรับเสียงที่เป็นธรรมชาติและแสดงออกได้และเสียงคุณภาพสูง เสียงใหม่สองเสียง Marin และ Cedar รวมอยู่ในรีลีสนี้ออกแบบมาเพื่อให้เอาต์พุตคำพูดที่มีชีวิตและชัดเจน

Microsoft เน้นการปรับปรุงหลายอย่างรวมถึงการเรียกใช้ฟังก์ชั่นที่ได้รับการปรับปรุงความแม่นยำในการเรียนการสอนที่ดีขึ้นและการสนับสนุนการป้อนข้อมูลภาพช่วยให้ผู้ใช้สามารถเพิ่มภาพลงในการสนทนาและพูดคุยผ่านเสียงโดยไม่ต้องใช้วิดีโอ

นอกเหนือจากการอัพเกรดทางเทคนิคแล้วยังมีการปรับราคา GPT-REALTIME มีราคาถูกกว่า 20% เมื่อเทียบกับตัวอย่าง GPT-4O-Realtime ก่อนหน้านี้โดยมีค่าใช้จ่ายตามการใช้งานต่อล้านครั้ง

สัญญาณการเปิดใช้งานการผลักดันของ Microsoft เพื่อขยายขีดความสามารถ AI แบบเรียลไทม์สำหรับทั้งนักพัฒนาและองค์กร ด้วยการรวมการสังเคราะห์เสียงที่แสดงออกเสียงคุณภาพสูงและอินพุตหลายรูปแบบ GPT-Realtime อยู่ในตำแหน่งที่จะรองรับกรณีการใช้งานที่หลากหลายตั้งแต่ระบบสนับสนุนลูกค้าไปจนถึงเครื่องมือการเข้าถึง

รุ่นนี้มีให้บริการในวันนี้ผ่าน Azure AI Foundry พร้อมเอกสารฉบับเต็มที่เผยแพร่บน Microsoft Learn

*ลิงค์แหล่งที่มา:

ประกาศอย่างเป็นทางการ gpt-realtime Microsoft เรียนรู้]( https://learn.microsoft.com/en-us/azure/ai-foundry/openai/whats-new#realtime-api-audio-model-ga)