0Pricing
AI Agents · 강의

컴퓨터 사용 패턴(Anthropic Computer-Use)

Anthropic의 Computer Use는 스크린샷, 마우스, 키보드를 Claude의 도구로 제공합니다.

컴퓨터 사용 패턴(Anthropic Computer-Use)은(는) CoddyKit의 무료 AI Agents 강의입니다. 이것은 4개 중 3번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 AI Agents 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. AI Agents 강의에는 총 4개의 강의가 포함되어 있습니다.

이 강의의 일부는 아직 번역되지 않았으며 영어로 표시됩니다.

컴퓨터 사용이란 무엇인가요

Anthropic의 "Computer Use" 기능(Claude 3.5 이상)은 스크린샷, 마우스, 키보드를 도구로 제공합니다. 모델은 가상 데스크톱을 처음부터 끝까지 제어할 수 있습니다.

도구 세트

핵심 도구는 세 가지입니다:

  • computer — 스크린샷, 클릭, 입력, 스크롤
  • bash — 셸 명령 실행
  • text_editor — 파일 읽기/쓰기

Quickstart

from anthropic import Anthropic
client = Anthropic()

response = client.beta.messages.create(
    model='claude-sonnet-4-5',
    max_tokens=4096,
    tools=[{'type': 'computer_20241022', 'name': 'computer', 'display_width_px': 1280, 'display_height_px': 720}],
    messages=[{'role': 'user', 'content': 'Open Firefox and search for the weather.'}]
)

반환되는 도구 호출

모델은 다음과 같은 tool_use 블록을 생성합니다:

{
    'type': 'tool_use',
    'name': 'computer',
    'input': {
        'action': 'screenshot'  # or 'left_click', 'type', 'mouse_move'
    }
}

작업 유형

  • screenshot — 스크린샷을 찍어 반환
  • left_click {coordinate: [x, y]} — 클릭
  • type {text: "hello"} — 텍스트 입력
  • key {text: "Return"} — 키 누르기
  • mouse_move {coordinate: [x, y]}
  • scroll {coordinate: [...], scroll_direction: "down"}

실행기는 직접 구축합니다

Anthropic은 도구 DEFINITION을 제공하고, 실행은 사용자가 구현합니다. 일반적으로 Playwright, X11 또는 Docker의 헤드리스 데스크톱을 사용합니다:

from playwright.sync_api import sync_playwright
p = sync_playwright().start()
browser = p.chromium.launch()
page = browser.new_page(viewport={'width': 1280, 'height': 720})

def execute(action_input):
    action = action_input['action']
    if action == 'screenshot':
        return page.screenshot()
    if action == 'left_click':
        x, y = action_input['coordinate']
        page.mouse.click(x, y)
        return page.screenshot()
    if action == 'type':
        page.keyboard.type(action_input['text'])
        return page.screenshot()
    # ... etc.

Returning the Result

tool_result_content = [
    {'type': 'image', 'source': {'type': 'base64', 'media_type': 'image/png', 'data': screenshot_b64}}
]

messages.append({
    'role': 'user',
    'content': [{
        'type': 'tool_result',
        'tool_use_id': tc.id,
        'content': tool_result_content
    }]
})

샌드박스 필수

Computer Use를 사용하면 모델이 ANYWHERE를 클릭할 수 있습니다. 샌드박스 처리된 VM(Docker + Xvfb + 헤드리스 브라우저)에서 실행하고, 노트북에서는 절대 실행하지 마십시오.

Anthropic 참조 Docker 이미지

Anthropic은 Xvfb, Firefox, 데스크톱 환경, 실행기를 하나로 묶은 참조 Docker 이미지를 제공합니다. 시작점으로 사용하기에 좋습니다.

속도와 비용

  • 각 Step에는 1~5초가 걸립니다(스크린샷 + LLM + 작업)
  • 각 스크린샷은 컨텍스트에 토큰을 추가합니다
  • 긴 작업 흐름은 실행당 $0.50~$5의 비용이 들 수 있습니다

실패 유형

  • 요소를 잘못 클릭함(10px 정도 빗나감)
  • 팝업이나 쿠키 배너에서 멈춤
  • 페이지가 아직 로드되지 않음(기다리십시오!)
  • 캡차

OpenAI Operator

OpenAI도 유사한 제품인 Operator를 출시했습니다. 개념은 같지만 구현은 다릅니다. 두 제품에는 사소한 차이가 있지만 기능은 비슷합니다.

사용 사례

  • 레거시 인트라넷 앱에서 양식 입력
  • 여러 브라우저에 걸친 테스트 자동화
  • QA 탐색적 테스트
  • "어떤 웹 앱이든 대신 사용해 주는" 도우미

컴퓨터 사용 도구

Anthropic의 Computer Use는 모델에 어떤 도구를 제공합니까?

복습

Anthropic의 Computer Use를 사용하면 Claude가 데스크톱을 제어할 수 있습니다. Playwright 또는 X11을 사용해 스크린샷 촬영, 클릭, 입력을 구현하십시오. 샌드박스에서만 실행하십시오. 느리지만 유연합니다.

자주 묻는 질문

“컴퓨터 사용 패턴(Anthropic Computer-Use)” 강의는 무료인가요?

네 — “컴퓨터 사용 패턴(Anthropic Computer-Use)” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 AI Agents 강의 전체를 잠금 해제할 수 있습니다. AI Agents 강의에는 총 4개의 강의가 포함되어 있습니다.

“컴퓨터 사용 패턴(Anthropic Computer-Use)”에서 뭘 배우나요?

Anthropic의 Computer Use는 스크린샷, 마우스, 키보드를 Claude의 도구로 제공합니다. 브라우저에서 직접 실행하는 실습 코드로 AI Agents을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.

AI Agents을(를) 시작하는 데 경험이 필요한가요?

사전 경험은 필요하지 않습니다. CoddyKit의 AI Agents은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 3번째 강의입니다.

“컴퓨터 사용 패턴(Anthropic Computer-Use)” 강의는 얼마나 걸리나요?

대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.

이 AI Agents 강의에서 코드를 작성하고 실행할 수 있나요?

네. 모든 AI Agents 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.

이 강의의 모든 강의

  1. Playwright로 브라우저 자동화
  2. 화면 이해를 위한 비전 모델
  3. 컴퓨터 사용 패턴(Anthropic Computer-Use)
  4. 신뢰할 수 있는 양식 작성 에이전트 구축
← AI Agents(으)로 돌아가기