화면 이해를 위한 비전 모델
스크린샷을 멀티모달 모델에 보내 에이전트가 사람이 보는 것을 '보게' 합니다.
화면 이해를 위한 비전 모델은(는) CoddyKit의 무료 AI Agents 강의입니다. 이것은 4개 중 2번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 AI Agents 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. AI Agents 강의에는 총 4개의 강의가 포함되어 있습니다.
이 강의의 일부는 아직 번역되지 않았으며 영어로 표시됩니다.
왜 비전 기능을 사용하나요
일부 웹 작업은 선택자로 표현하기 어렵습니다:
- 캡차(정확히는 캡차를 처리하려는 시도)
- 시각적 위치에 따라 배치된 요소(채팅 말풍선, 동적 UI)
- 안정적인 DOM이 없는 앱(Canvas / WebGL)
멀티모달 LLM을 사용하면 에이전트가 화면을 SEE할 수 있습니다.
Take a Screenshot, Send to LLM
import base64
page.screenshot(path='screen.png')
with open('screen.png', 'rb') as f:
b64 = base64.b64encode(f.read()).decode()
response = client.chat.completions.create(
model='gpt-4o',
messages=[{
'role': 'user',
'content': [
{'type': 'text', 'text': 'What buttons are visible? Return JSON.'},
{'type': 'image_url', 'image_url': {'url': f'data:image/png;base64,{b64}'}}
]
}]
)Anthropic Vision
response = client.messages.create(
model='claude-sonnet-4-5',
max_tokens=1024,
messages=[{
'role': 'user',
'content': [
{'type': 'image', 'source': {'type': 'base64', 'media_type': 'image/png', 'data': b64}},
{'type': 'text', 'text': 'Describe what you see.'}
]
}]
)비전 품질
GPT-4o와 Claude Sonnet 4.5는 다음 작업을 수행할 수 있습니다:
- 스크린샷을 정확하게 설명하기
- 이미지 속 텍스트 읽기(OCR)
- 위치로 UI 요소 식별하기
- 패턴과 이상 징후 찾기
하지만 매우 작은 텍스트, 복잡한 표, 정확한 픽셀 좌표를 처리하는 데는 여전히 어려움이 있습니다.
설명으로 요소 찾기
모델에 "Submit 버튼이 어디에 있나요?"라고 물으면 대략적인 좌표나 지침을 반환합니다:
prompt = 'Look at the screenshot. Where is the Submit button? Return the approximate (x, y) coordinates of its center.'
# Response: {"x": 420, "y": 530}좌표 정밀도의 한계
모델의 좌표는 픽셀 단위로 정확하지 않습니다. 좌표는 참고 정보로 취급하십시오. 정확하게 클릭하려면 가능한 경우 DOM 선택자와 함께 사용하십시오.
SoM(표시 집합)
상호작용할 수 있는 요소 주위에 번호가 매겨진 상자를 그려 스크린샷에 주석을 추가하십시오. 모델에 "어느 번호를 클릭하시겠습니까?"라고 물으십시오:
- DOM을 통해 상호작용 가능한 요소 식별
- 번호가 매겨진 오버레이 그리기
- 주석이 추가된 스크린샷을 LLM에 보내기
- LLM이 번호로 응답하면 해당 요소 클릭
자유 형식 좌표보다 훨씬 안정적입니다.
Code for SoM
elements = page.query_selector_all('button, a, input, [role="button"]')
annotated = draw_numbered_overlays(screenshot, elements)
idx = ask_llm_for_choice(annotated, prompt='Click the Submit button')
elements[idx].click()다중 프레임 추론
동적인 페이지에서는 여러 시점에 스크린샷을 찍어 모두 모델에 보내십시오. 모델은 시간에 따른 변화를 추론할 수 있습니다.
지연 시간과 비용
각 스크린샷은 전체 해상도에서 약 85k 토큰에 해당합니다. 비용은 다음과 같습니다:
- gpt-4o: 이미지 100장당 $0.85
- claude-sonnet-4-5: 이미지 100장당 약 $1.50
보내기 전에 크기를 조정하고, DOM 기반 선택이 실패할 때만 비전 기능을 사용하십시오.
Resize for Cheaper Calls
from PIL import Image
img = Image.open('screen.png')
img.thumbnail((1024, 1024))
img.save('screen-small.png')OCR 대체 수단
순수한 텍스트 추출에는 OCR(Tesseract, PaddleOCR)이 비전 LLM보다 훨씬 저렴하고 더 나은 경우가 많습니다.
SoM 패턴
Set-of-Marks(SoM) 프롬프트 패턴이란 무엇입니까?
복습
화면을 이해하기 위해 GPT-4o 또는 Claude에 스크린샷을 보내십시오. 안정적인 상호작용에는 SoM 주석을 사용하십시오. 순수한 텍스트에는 OCR을 사용하십시오. 비용을 절약하려면 크기를 조정하십시오.
자주 묻는 질문
“화면 이해를 위한 비전 모델” 강의는 무료인가요?
네 — “화면 이해를 위한 비전 모델” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 AI Agents 강의 전체를 잠금 해제할 수 있습니다. AI Agents 강의에는 총 4개의 강의가 포함되어 있습니다.
“화면 이해를 위한 비전 모델”에서 뭘 배우나요?
스크린샷을 멀티모달 모델에 보내 에이전트가 사람이 보는 것을 '보게' 합니다. 브라우저에서 직접 실행하는 실습 코드로 AI Agents을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.
AI Agents을(를) 시작하는 데 경험이 필요한가요?
사전 경험은 필요하지 않습니다. CoddyKit의 AI Agents은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 2번째 강의입니다.
“화면 이해를 위한 비전 모델” 강의는 얼마나 걸리나요?
대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.
이 AI Agents 강의에서 코드를 작성하고 실행할 수 있나요?
네. 모든 AI Agents 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.