0Pricing
AI Agents · บทเรียน

เอเจนต์หลายรูปแบบ (การมองเห็น + เสียง + การกระทำ)

เอเจนต์ที่มองเห็นหน้าจอ ได้ยินเสียงพูด และลงมือในโลกจริงหรือโลกดิจิทัล — แนวหน้าถัดไปของเทคโนโลยี

เอเจนต์หลายรูปแบบ (การมองเห็น + เสียง + การกระทำ) เป็นบทเรียน AI Agents ฟรีบน CoddyKit นี่คือบทเรียนที่ 3 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน AI Agents และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส AI Agents มีบทเรียนทั้งหมด 4 บทเรียน

ก้าวพ้นข้อความ

เอเจนต์สมัยใหม่รองรับหลายรูปแบบมากขึ้นเรื่อย ๆ:

  • การมองเห็น — มองเห็นหน้าจอ รูปภาพ และวิดีโอ
  • เสียง — พูดคุยและฟังผู้ใช้
  • การกระทำ — ควบคุมเบราว์เซอร์ หุ่นยนต์ และ GUI

เอเจนต์ด้านการมองเห็น

เราได้กล่าวถึงเรื่องนี้ในหลักสูตร 24 แล้ว สรุปอีกครั้ง:

  • GPT-4o, คลอด โซเน็ต 4.5 และเจมินีสำหรับทำความเข้าใจหน้าจอ
  • คำอธิบายประกอบ SoM เพื่อการโต้ตอบที่เชื่อถือได้
  • การใช้งานคอมพิวเตอร์สำหรับควบคุมเดสก์ท็อปตั้งแต่ต้นจนจบ

เอเจนต์ด้านเสียง

API แบบเรียลไทม์ของ OpenAI, เสียงของแอนโทรปิก / คลอด และ Conversational AI ของ ElevenLabs ช่วยให้คุณสร้างเอเจนต์ที่รับเสียงและส่งเสียงได้:

# OpenAI Realtime API (WebSocket)
import websockets, json

async def main():
    async with websockets.connect('wss://api.openai.com/v1/realtime?model=gpt-4o-realtime-preview') as ws:
        await ws.send(json.dumps({'type': 'response.create', 'response': {'modalities': ['audio'], 'instructions': 'Greet the user'}}))
        async for msg in ws:
            event = json.loads(msg)
            if event['type'] == 'response.audio.delta':
                play_audio(event['delta'])

เป้าหมายเวลาแฝงของเสียง

การสนทนาด้วยเสียงต้องตอบสนองภายในเวลาไม่ถึง 500 มิลลิวินาทีจึงจะไม่รู้สึกผิดธรรมชาติ กลยุทธ์มีดังนี้:

  • การสตรีม ASR + TTS
  • ข้ามโมเดลที่ใช้การคิด
  • แคชวลีที่ใช้บ่อย
  • ใช้โมเดลน้ำหนักเบา

เสียง + การใช้เครื่องมือ

เอเจนต์เสียงใช้เครื่องมือได้เช่นกัน — API แบบเรียลไทม์รองรับการเรียกใช้ฟังก์ชัน ลองนึกภาพว่า «เพิ่มนมลงในรายการซื้อของ» -> เอเจนต์เรียกใช้คำสั่งเพิ่มลงรายการ

การกระทำ: การใช้เบราว์เซอร์ / คอมพิวเตอร์

เราได้กล่าวถึงเรื่องนี้ในหลักสูตร 24 แล้ว การใช้งานคอมพิวเตอร์ของแอนโทรปิก, Operator ของ OpenAI และ OpenInterpreter ล้วนช่วยให้เอเจนต์ควบคุมเครื่องจริงได้

การกระทำ: หุ่นยนต์

เอเจนต์ที่มีร่างกายเป็นแนวหน้าถัดไป Google RT-2, Figure 02 และ NVIDIA GR00T ผสาน VLM เข้ากับการควบคุมหุ่นยนต์ ปัจจุบันยังอยู่ในระยะการวิจัยเป็นส่วนใหญ่ และมีการนำไปใช้จริงเพียงไม่กี่ระบบ

การทำความเข้าใจวิดีโอ

เจมินีและ GPT-4o รับวิดีโอได้ กรณีการใช้งานมีดังนี้:

  • สรุปการเฝ้าระวัง
  • ดึงสูตรอาหารจากวิดีโอทำอาหาร
  • การวิเคราะห์กีฬา
  • สรุปการประชุมจากไฟล์บันทึก

การสร้างรูปภาพเป็นเครื่องมือ

โมเดลการแพร่กระจาย (DALL-E 3, อิมาเจน, สเตเบิลดิฟฟิวชัน) กลายเป็นเครื่องมือที่เอเจนต์เรียกใช้ได้:

tools = [{'name': 'generate_image', 'description': 'Generate an image from a prompt', 'parameters': {'prompt': {'type': 'string'}}}]

การให้เหตุผลข้ามรูปแบบ

เอเจนต์ที่ผสานหลายรูปแบบเข้าด้วยกัน: «ดูแผนภูมินี้ ถอดความบันทึกเหล่านี้ แล้วร่างอีเมลสรุป» แต่ละรูปแบบมีบทบาทของตนเอง

ชุดเครื่องมือเรียลไทม์ของ OpenAI

OpenAI เปิดตัว Realtime Agent SDK แบบโอเพนซอร์สพร้อมตัวอย่างต่าง ๆ ซึ่งเป็นจุดเริ่มต้นที่ดีหากเป้าหมายคือการสร้างเอเจนต์เสียง

Pipecat และเอเจนต์ของ LiveKit

เฟรมเวิร์กแบบโอเพนซอร์สสำหรับเอเจนต์เสียงและวิดีโอผ่าน WebRTC สตาร์ตอัปจำนวนมากใช้เฟรมเวิร์กเหล่านี้สร้างผู้ช่วยลักษณะเดียวกับ Alexa

ความเป็นส่วนตัวในระบบหลายรูปแบบ

เสียงและวิดีโอมีข้อมูล PII อยู่เป็นจำนวนมาก ควรเข้ารหัสขณะจัดเก็บ ลบข้อมูลสำคัญออกจากบทถอดเสียง และจัดเตรียมปุ่มสำหรับ delete ให้ผู้ใช้ ข้อมูลชีวมิติจากเสียงอาจต้องได้รับความยินยอมตาม GDPR มาตรา 9

โมเดลตามระดับเวลาแฝง

สำหรับเอเจนต์เสียงและวิดีโอ ควรเลือกใช้โมเดลที่เร็วที่สุด เช่น Groq Llama 3.1, GPT-4o-realtime และ Gemini Flash และหลีกเลี่ยงโมเดลให้เหตุผลในเส้นทางการทำงานหลัก

ยุคแว่นตาอัจฉริยะ

Meta Ray-Ban, Apple Vision Pro และอุปกรณ์สวมใส่อื่น ๆ กำลังนำเอเจนต์หลายรูปแบบที่ทำงานอยู่ตลอดเวลาเข้ามา การนี้อาจเป็นหมวดหมู่ผลิตภัณฑ์สำหรับผู้บริโภคถัดไปของ AI แบบรับรู้สภาพแวดล้อม

เวลาแฝงของเสียง

เป้าหมายเวลาแฝงโดยทั่วไปสำหรับเอเจนต์เสียงแบบสนทนาคือเท่าใด

สรุปทบทวน

การมองเห็น (หน้าจอ รูปภาพ วิดีโอ) เสียง (การสนทนา) และการลงมือทำ (เบราว์เซอร์ คอมพิวเตอร์ หุ่นยนต์) ควรผสานหลายรูปแบบเข้าด้วยกันเพื่อสร้างเอเจนต์ที่มีความสามารถมากขึ้น พร้อมคำนึงถึงเวลาแฝง ความเป็นส่วนตัว และต้นทุน

คำถามที่พบบ่อย

บทเรียน “เอเจนต์หลายรูปแบบ (การมองเห็น + เสียง + การกระทำ)” ฟรีหรือไม่

ใช่ — ข้อความเต็มของ “เอเจนต์หลายรูปแบบ (การมองเห็น + เสียง + การกระทำ)” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส AI Agents ให้อัปเกรดเป็น CoddyKit PRO คอร์ส AI Agents มีบทเรียนทั้งหมด 4 บทเรียน

คุณจะเรียนรู้อะไรในบทเรียน “เอเจนต์หลายรูปแบบ (การมองเห็น + เสียง + การกระทำ)”

เอเจนต์ที่มองเห็นหน้าจอ ได้ยินเสียงพูด และลงมือในโลกจริงหรือโลกดิจิทัล — แนวหน้าถัดไปของเทคโนโลยี คุณปฏิบัติ AI Agents ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน

คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน AI Agents หรือไม่

ไม่จำเป็นต้องมีประสบการณ์มาก่อน AI Agents บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 3 จากทั้งหมด 4 บทเรียน

บทเรียน “เอเจนต์หลายรูปแบบ (การมองเห็น + เสียง + การกระทำ)” ใช้เวลานานแค่ไหน

บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย

ฉันเขียนและรันโค้ดในบทเรียน AI Agents นี้ได้ไหม

ได้ บทเรียน AI Agents ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ

บทเรียนทั้งหมดในหลักสูตรนี้

  1. การให้เหตุผลแบบเอเจนต์ (o1, o3, โมเดลให้เหตุผล)
  2. เอเจนต์เชิงสัญลักษณ์ผสมโครงข่ายประสาท
  3. เอเจนต์หลายรูปแบบ (การมองเห็น + เสียง + การกระทำ)
  4. ปัญหาที่ยังเปิดอยู่: ความทนทาน การสอดคล้อง และหน่วยความจำระยะยาว
← กลับไปที่ AI Agents