เอเจนต์หลายรูปแบบ (การมองเห็น + เสียง + การกระทำ)
เอเจนต์ที่มองเห็นหน้าจอ ได้ยินเสียงพูด และลงมือในโลกจริงหรือโลกดิจิทัล — แนวหน้าถัดไปของเทคโนโลยี
เอเจนต์หลายรูปแบบ (การมองเห็น + เสียง + การกระทำ) เป็นบทเรียน AI Agents ฟรีบน CoddyKit นี่คือบทเรียนที่ 3 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน AI Agents และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส AI Agents มีบทเรียนทั้งหมด 4 บทเรียน
ก้าวพ้นข้อความ
เอเจนต์สมัยใหม่รองรับหลายรูปแบบมากขึ้นเรื่อย ๆ:
- การมองเห็น — มองเห็นหน้าจอ รูปภาพ และวิดีโอ
- เสียง — พูดคุยและฟังผู้ใช้
- การกระทำ — ควบคุมเบราว์เซอร์ หุ่นยนต์ และ GUI
เอเจนต์ด้านการมองเห็น
เราได้กล่าวถึงเรื่องนี้ในหลักสูตร 24 แล้ว สรุปอีกครั้ง:
- GPT-4o, คลอด โซเน็ต 4.5 และเจมินีสำหรับทำความเข้าใจหน้าจอ
- คำอธิบายประกอบ SoM เพื่อการโต้ตอบที่เชื่อถือได้
- การใช้งานคอมพิวเตอร์สำหรับควบคุมเดสก์ท็อปตั้งแต่ต้นจนจบ
เอเจนต์ด้านเสียง
# OpenAI Realtime API (WebSocket)
import websockets, json
async def main():
async with websockets.connect('wss://api.openai.com/v1/realtime?model=gpt-4o-realtime-preview') as ws:
await ws.send(json.dumps({'type': 'response.create', 'response': {'modalities': ['audio'], 'instructions': 'Greet the user'}}))
async for msg in ws:
event = json.loads(msg)
if event['type'] == 'response.audio.delta':
play_audio(event['delta'])เป้าหมายเวลาแฝงของเสียง
การสนทนาด้วยเสียงต้องตอบสนองภายในเวลาไม่ถึง 500 มิลลิวินาทีจึงจะไม่รู้สึกผิดธรรมชาติ กลยุทธ์มีดังนี้:
- การสตรีม ASR + TTS
- ข้ามโมเดลที่ใช้การคิด
- แคชวลีที่ใช้บ่อย
- ใช้โมเดลน้ำหนักเบา
เสียง + การใช้เครื่องมือ
เอเจนต์เสียงใช้เครื่องมือได้เช่นกัน — API แบบเรียลไทม์รองรับการเรียกใช้ฟังก์ชัน ลองนึกภาพว่า «เพิ่มนมลงในรายการซื้อของ» -> เอเจนต์เรียกใช้คำสั่งเพิ่มลงรายการ
การกระทำ: การใช้เบราว์เซอร์ / คอมพิวเตอร์
เราได้กล่าวถึงเรื่องนี้ในหลักสูตร 24 แล้ว การใช้งานคอมพิวเตอร์ของแอนโทรปิก, Operator ของ OpenAI และ OpenInterpreter ล้วนช่วยให้เอเจนต์ควบคุมเครื่องจริงได้
การกระทำ: หุ่นยนต์
เอเจนต์ที่มีร่างกายเป็นแนวหน้าถัดไป Google RT-2, Figure 02 และ NVIDIA GR00T ผสาน VLM เข้ากับการควบคุมหุ่นยนต์ ปัจจุบันยังอยู่ในระยะการวิจัยเป็นส่วนใหญ่ และมีการนำไปใช้จริงเพียงไม่กี่ระบบ
การทำความเข้าใจวิดีโอ
เจมินีและ GPT-4o รับวิดีโอได้ กรณีการใช้งานมีดังนี้:
- สรุปการเฝ้าระวัง
- ดึงสูตรอาหารจากวิดีโอทำอาหาร
- การวิเคราะห์กีฬา
- สรุปการประชุมจากไฟล์บันทึก
การสร้างรูปภาพเป็นเครื่องมือ
โมเดลการแพร่กระจาย (DALL-E 3, อิมาเจน, สเตเบิลดิฟฟิวชัน) กลายเป็นเครื่องมือที่เอเจนต์เรียกใช้ได้:
tools = [{'name': 'generate_image', 'description': 'Generate an image from a prompt', 'parameters': {'prompt': {'type': 'string'}}}]การให้เหตุผลข้ามรูปแบบ
เอเจนต์ที่ผสานหลายรูปแบบเข้าด้วยกัน: «ดูแผนภูมินี้ ถอดความบันทึกเหล่านี้ แล้วร่างอีเมลสรุป» แต่ละรูปแบบมีบทบาทของตนเอง
ชุดเครื่องมือเรียลไทม์ของ OpenAI
OpenAI เปิดตัว Realtime Agent SDK แบบโอเพนซอร์สพร้อมตัวอย่างต่าง ๆ ซึ่งเป็นจุดเริ่มต้นที่ดีหากเป้าหมายคือการสร้างเอเจนต์เสียง
Pipecat และเอเจนต์ของ LiveKit
เฟรมเวิร์กแบบโอเพนซอร์สสำหรับเอเจนต์เสียงและวิดีโอผ่าน WebRTC สตาร์ตอัปจำนวนมากใช้เฟรมเวิร์กเหล่านี้สร้างผู้ช่วยลักษณะเดียวกับ Alexa
ความเป็นส่วนตัวในระบบหลายรูปแบบ
เสียงและวิดีโอมีข้อมูล PII อยู่เป็นจำนวนมาก ควรเข้ารหัสขณะจัดเก็บ ลบข้อมูลสำคัญออกจากบทถอดเสียง และจัดเตรียมปุ่มสำหรับ delete ให้ผู้ใช้ ข้อมูลชีวมิติจากเสียงอาจต้องได้รับความยินยอมตาม GDPR มาตรา 9
โมเดลตามระดับเวลาแฝง
สำหรับเอเจนต์เสียงและวิดีโอ ควรเลือกใช้โมเดลที่เร็วที่สุด เช่น Groq Llama 3.1, GPT-4o-realtime และ Gemini Flash และหลีกเลี่ยงโมเดลให้เหตุผลในเส้นทางการทำงานหลัก
ยุคแว่นตาอัจฉริยะ
Meta Ray-Ban, Apple Vision Pro และอุปกรณ์สวมใส่อื่น ๆ กำลังนำเอเจนต์หลายรูปแบบที่ทำงานอยู่ตลอดเวลาเข้ามา การนี้อาจเป็นหมวดหมู่ผลิตภัณฑ์สำหรับผู้บริโภคถัดไปของ AI แบบรับรู้สภาพแวดล้อม
เวลาแฝงของเสียง
เป้าหมายเวลาแฝงโดยทั่วไปสำหรับเอเจนต์เสียงแบบสนทนาคือเท่าใด
สรุปทบทวน
การมองเห็น (หน้าจอ รูปภาพ วิดีโอ) เสียง (การสนทนา) และการลงมือทำ (เบราว์เซอร์ คอมพิวเตอร์ หุ่นยนต์) ควรผสานหลายรูปแบบเข้าด้วยกันเพื่อสร้างเอเจนต์ที่มีความสามารถมากขึ้น พร้อมคำนึงถึงเวลาแฝง ความเป็นส่วนตัว และต้นทุน
คำถามที่พบบ่อย
บทเรียน “เอเจนต์หลายรูปแบบ (การมองเห็น + เสียง + การกระทำ)” ฟรีหรือไม่
ใช่ — ข้อความเต็มของ “เอเจนต์หลายรูปแบบ (การมองเห็น + เสียง + การกระทำ)” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส AI Agents ให้อัปเกรดเป็น CoddyKit PRO คอร์ส AI Agents มีบทเรียนทั้งหมด 4 บทเรียน
คุณจะเรียนรู้อะไรในบทเรียน “เอเจนต์หลายรูปแบบ (การมองเห็น + เสียง + การกระทำ)”
เอเจนต์ที่มองเห็นหน้าจอ ได้ยินเสียงพูด และลงมือในโลกจริงหรือโลกดิจิทัล — แนวหน้าถัดไปของเทคโนโลยี คุณปฏิบัติ AI Agents ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน
คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน AI Agents หรือไม่
ไม่จำเป็นต้องมีประสบการณ์มาก่อน AI Agents บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 3 จากทั้งหมด 4 บทเรียน
บทเรียน “เอเจนต์หลายรูปแบบ (การมองเห็น + เสียง + การกระทำ)” ใช้เวลานานแค่ไหน
บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย
ฉันเขียนและรันโค้ดในบทเรียน AI Agents นี้ได้ไหม
ได้ บทเรียน AI Agents ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ
บทเรียนทั้งหมดในหลักสูตรนี้
- การให้เหตุผลแบบเอเจนต์ (o1, o3, โมเดลให้เหตุผล)
- เอเจนต์เชิงสัญลักษณ์ผสมโครงข่ายประสาท
- เอเจนต์หลายรูปแบบ (การมองเห็น + เสียง + การกระทำ)
- ปัญหาที่ยังเปิดอยู่: ความทนทาน การสอดคล้อง และหน่วยความจำระยะยาว