Learn AI with Python · บทเรียน

สภาพแวดล้อม Gymnasium แบบกำหนดเอง

คลาสย่อยของ gym.Env พื้นที่สังเกตและการกระทำ step/reset/render และการลงทะเบียนสภาพแวดล้อมแบบกำหนดเอง

บทเรียน 4 จาก 413 ขั้นตอน

สภาพแวดล้อม Gymnasium แบบกำหนดเอง เป็นบทเรียน Learn AI with Python ฟรีบน CoddyKit นี่คือบทเรียนที่ 4 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน Learn AI with Python และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส Learn AI with Python มีบทเรียนทั้งหมด 4 บทเรียน

Gymnasium คืออะไร

Gymnasium (รุ่นสืบทอดที่มีการดูแลต่อจาก OpenAI Gym) คือส่วนเชื่อมต่อมาตรฐานสำหรับสภาพแวดล้อม RL ตัวแทนใดก็ตามที่ทำตามส่วนเชื่อมต่อนี้จะทำงานร่วมกับสภาพแวดล้อมที่เข้ากันได้ทุกแบบ ดังนั้นการสร้างสภาพแวดล้อมของคุณเองจึงเปิดทางให้ใช้ RL กับปัญหาเฉพาะได้

pip install gymnasium

import gymnasium as gym

การสืบทอดจาก gymnasium.Env

สภาพแวดล้อมแบบกำหนดเองจะสืบทอดจาก gymnasium.Env และต้องใช้งานสี่อย่าง ได้แก่ พื้นที่การกระทำและพื้นที่การสังเกต รวมถึง reset และ step ข้อตกลงนี้คือทั้งหมดที่ตัวแทนต้องใช้

class GridWorld(gym.Env):
    def __init__(self):
        super().__init__()

พื้นที่การกระทำ

action_space ประกาศว่าการกระทำใดใช้ได้ Discrete(n) หมายถึงตัวเลือก n แบบ (เช่น ขึ้น/ลง/ซ้าย/ขวา) ส่วน Box กำหนดช่วงต่อเนื่องสำหรับการกระทำอย่างการบังคับทิศทาง

self.action_space = gym.spaces.Discrete(4)  # 4 moves

พื้นที่การสังเกต

observation_space อธิบายสิ่งที่ตัวแทนมองเห็น พื้นที่แบบ Box กำหนดรูปร่างและขอบเขตค่าของเวกเตอร์การสังเกต เพื่อให้อัลกอริทึมทราบมิติของข้อมูลป้อนเข้า

self.observation_space = gym.spaces.Box(
    low=0, high=10, shape=(2,), dtype=float
)  # agent (x, y) position

เมธอด reset

reset เริ่มตอนใหม่และส่งคืนทูเพิล (observation, info) โดยรับ seed เพื่อให้ทำซ้ำผลลัพธ์ได้ ต้องส่งคืนการสังเกตเริ่มต้นที่นี่เสมอ

def reset(self, seed=None, options=None):
    super().reset(seed=seed)
    self.pos = [0, 0]
    obs = self._get_obs()
    info = {}
    return obs, info

เมธอด step

step(action) ทำให้สภาพแวดล้อมดำเนินไปหนึ่งจังหวะ โดยส่งคืน ห้าค่า: (obs, reward, terminated, truncated, info) การใช้รูปแบบการเรียกนี้ให้ถูกต้องเป็นสิ่งจำเป็นต่อความเข้ากันได้

def step(self, action):
    self._move(action)
    obs = self._get_obs()
    ...

terminated เทียบกับ truncated

มีแฟล็กแยกกันสองตัว: terminated หมายถึงงานจบลงตามธรรมชาติ (บรรลุเป้าหมายหรือล้มเหลว) ส่วน truncated หมายถึงงานถูกตัดจบ (เช่น หมดเวลาที่กำหนด) การแยกสองกรณีนี้ทำให้อัลกอริทึมจัดการแต่ละกรณีได้อย่างถูกต้อง

    terminated = (self.pos == self.goal)
    truncated = (self.steps >= self.max_steps)
    reward = 1.0 if terminated else -0.01
    return obs, reward, terminated, truncated, {}

การออกแบบรางวัล

ฟังก์ชันรางวัล กำหนดเป้าหมาย ควรออกแบบอย่างระมัดระวัง: การหักคะแนนเล็กน้อยในแต่ละก้าวร่วมกับโบนัสเมื่อถึงเป้าหมาย จะส่งเสริมให้ไปถึงเป้าหมายอย่างรวดเร็ว การออกแบบรางวัลที่ไม่ดีเป็นสาเหตุที่พบบ่อยที่สุดของความล้มเหลวใน RL

การลงทะเบียนสภาพแวดล้อม

ลงทะเบียนสภาพแวดล้อมของคุณด้วย ID เพื่อให้สร้างได้ผ่าน gym.make ตามแบบแผนเดียวกับสภาพแวดล้อมที่มีมาให้

gym.register(id="GridWorld-v0", entry_point=GridWorld)
env = gym.make("GridWorld-v0")

การใช้กับตัวแทน

เนื่องจากสภาพแวดล้อมนี้ทำตามส่วนเชื่อมต่อมาตรฐาน จึงนำไปต่อเข้ากับไลบรารีอย่าง Stable-Baselines3 ได้โดยตรง ไม่ต้องใช้โค้ดเชื่อมเพิ่มเติม

from stable_baselines3 import PPO

env = gym.make("GridWorld-v0")
model = PPO("MlpPolicy", env, verbose=1)
model.learn(total_timesteps=50_000)

ลูปการโต้ตอบมาตรฐาน

ลูป RL ทุกแบบมีหน้าตาเหมือนกัน: เรียกใช้ reset เพื่อรับการสังเกตแรก จากนั้นเลือกการกระทำ เรียกใช้ step ซ้ำ ๆ และหยุดเมื่อ terminated หรือ truncated ความเป็นแบบเดียวกันนี้คือจุดประสงค์หลักของ Gymnasium

obs, info = env.reset()
done = False
while not done:
    action = env.action_space.sample()
    obs, reward, terminated, truncated, info = env.step(action)
    done = terminated or truncated

ตรวจสอบความเข้าใจ

ทดสอบความรู้เกี่ยวกับ Gymnasium

ทบทวน: สภาพแวดล้อม Gymnasium แบบกำหนดเอง

คุณได้สร้างสภาพแวดล้อมแบบกำหนดเองโดยสืบทอดจาก gymnasium.Env กำหนด action_space และ observation_space ใช้งาน reset() (ส่งคืน obs, info) และ step() (ส่งคืน obs, reward, terminated, truncated, info) รวมถึงออกแบบรางวัล การทำตามส่วนเชื่อมต่อมาตรฐานทำให้ไลบรารี RL ใด ๆ ก็สามารถใช้ฝึกกับสภาพแวดล้อมนี้ได้

เริ่มต้นได้ฟรี

เรียนรู้ Python ด้วย AI tutor — ฟรี

เขียนและเรียกใช้โค้ดจริงในเบราว์เซอร์ของคุณ รับความช่วยเหลือทันทีจาก AI tutor 24/7 และเรียนรู้ต่อจากที่คุณหยุดบนเว็บหรือในแอป

คอร์ส
53
บทเรียน
225

คำถามที่พบบ่อย

บทเรียน “สภาพแวดล้อม Gymnasium แบบกำหนดเอง” ฟรีหรือไม่

ใช่ — ข้อความเต็มของ “สภาพแวดล้อม Gymnasium แบบกำหนดเอง” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส Learn AI with Python ให้อัปเกรดเป็น CoddyKit PRO คอร์ส Learn AI with Python มีบทเรียนทั้งหมด 4 บทเรียน

คุณจะเรียนรู้อะไรในบทเรียน “สภาพแวดล้อม Gymnasium แบบกำหนดเอง”

คลาสย่อยของ gym.Env พื้นที่สังเกตและการกระทำ step/reset/render และการลงทะเบียนสภาพแวดล้อมแบบกำหนดเอง คุณปฏิบัติ Learn AI with Python ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน

คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน Learn AI with Python หรือไม่

ไม่จำเป็นต้องมีประสบการณ์มาก่อน Learn AI with Python บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 4 จากทั้งหมด 4 บทเรียน

บทเรียน “สภาพแวดล้อม Gymnasium แบบกำหนดเอง” ใช้เวลานานแค่ไหน

บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย

ฉันเขียนและรันโค้ดในบทเรียน Learn AI with Python นี้ได้ไหม

ได้ บทเรียน Learn AI with Python ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ

บทเรียนทั้งหมดในหลักสูตรนี้

  1. วิธีไล่ระดับนโยบาย: REINFORCE
  2. วิธี Actor-Critic (A2C)
  3. การปรับให้เหมาะสมของนโยบายแบบใกล้เคียง (PPO)
  4. สภาพแวดล้อม Gymnasium แบบกำหนดเอง
← กลับไปที่ Learn AI with Python