0Pricing
AI Agents · 课时

网页浏览研究智能体

结合搜索工具、获取工具和 LLM,研究一个主题并撰写有来源依据的摘要。

网页浏览研究智能体 是 CoddyKit 上的免费 AI Agents 课时。 这是第 3 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 AI Agents 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 AI Agents 课程共包含 4 节课。

本课时的部分内容尚未翻译,以英文显示。

项目目标

构建一个代理,通过搜索网络、获取网页并撰写带来源的摘要来研究主题——类似 Perplexity 的小型版本。

所需工具

  1. search——查询搜索 API(Tavily、Serper、Brave)并返回结果
  2. fetch_url——下载网页并返回清理后的文本
  3. answer——代理撰写带引用的最终摘要

Step 1: Search Tool

import requests

def search(query: str, k: int = 5) -> list[dict]:
    r = requests.post(
        'https://api.tavily.com/search',
        json={'api_key': TAVILY_KEY, 'query': query, 'max_results': k}
    )
    return r.json()['results']   # list of {url, title, snippet}

Step 2: Fetch Tool

from bs4 import BeautifulSoup

def fetch_url(url: str) -> str:
    r = requests.get(url, timeout=10)
    soup = BeautifulSoup(r.text, 'html.parser')
    for tag in soup(['script', 'style', 'nav', 'footer']):
        tag.decompose()
    return soup.get_text(separator='\n', strip=True)[:5000]   # truncate

Step 3: Tool Definitions

tools = [
    {'type': 'function', 'function': {
        'name': 'search',
        'description': 'Search the web for a query, return top results with URLs',
        'parameters': {'type': 'object', 'properties': {'query': {'type': 'string'}}, 'required': ['query']}
    }},
    {'type': 'function', 'function': {
        'name': 'fetch_url',
        'description': 'Download the text of a URL',
        'parameters': {'type': 'object', 'properties': {'url': {'type': 'string'}}, 'required': ['url']}
    }}
]
import json
print(json.dumps(tools, indent=2))

Step 4: The Agent Loop

def research(question, max_steps=8):
    messages = [
        {'role': 'system', 'content': 'You are a research agent. Use search and fetch_url to gather facts. Cite each claim with a URL.'},
        {'role': 'user', 'content': question}
    ]
    for _ in range(max_steps):
        r = oai.chat.completions.create(model='gpt-4o-mini', messages=messages, tools=tools)
        msg = r.choices[0].message
        messages.append(msg)
        if not msg.tool_calls:
            return msg.content
        for tc in msg.tool_calls:
            result = dispatch(tc)
            messages.append({'role': 'tool', 'tool_call_id': tc.id, 'content': json.dumps(result)})
    return 'Step limit reached'

Tool Dispatcher

def dispatch(tc):
    args = json.loads(tc.function.arguments)
    if tc.function.name == 'search':
        return search(**args)
    if tc.function.name == 'fetch_url':
        return fetch_url(**args)
    return {'error': 'unknown tool'}

添加步骤上限

没有上限时,代理可能会无限循环。max_steps=8 是一个合理的默认值。

截断获取的网页

大多数网页都超过 50KB,太大了。请将其截断为 5000 个字符(约 1300 个令牌)。模型很少需要更多内容。

遵守 robots.txt

生产环境中的网页浏览必须遵守 robots.txt 和网站的服务条款。如有疑问,请使用托管式搜索/获取服务。

缓存结果

相同的查询和 URL 会被频繁请求。请将结果缓存在 Redis 中,缓存一小时:

@lru_cache(maxsize=1000)
def cached_fetch(url):
    return fetch_url(url)

处理失败

网络错误很常见。请将错误返回给模型,以便它尝试其他来源:

try:
    return fetch_url(url)
except Exception as e:
    return {'error': f'Could not fetch {url}: {e}'}

强制要求引用

在系统提示词末尾加入:“您的最终答案必须为每项陈述包含 URL,例如 [1] https://...”——并考虑进行输出模式检查。

关注成本

研究代理的成本很高——每个问题需要调用工具 5–15 次,每次都会获取数 KB 的内容。请设置每次查询的预算上限。

步骤上限

为什么要为代理循环设置 max_steps 限制?

回顾

搜索 + 获取 + LLM + 步骤上限 = 50 行代码即可构建一个可运行的研究代理。这是非常出色的第 3 个项目。

常见问题解答

「网页浏览研究智能体」课时是免费的吗?

是的 — 「网页浏览研究智能体」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 AI Agents 课程的其余内容,请升级到 CoddyKit PRO。 AI Agents 课程共包含 4 节课。

「网页浏览研究智能体」这节课中我会学到什么?

结合搜索工具、获取工具和 LLM,研究一个主题并撰写有来源依据的摘要。 你通过在浏览器中直接运行的动手代码来练习 AI Agents,全天候 AI 导师会在你学习这节课的过程中回答你的问题。

学习 AI Agents 需要有经验吗?

无需任何先前经验。CoddyKit 上的 AI Agents 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 3 节课,共 4 节。

「网页浏览研究智能体」课时需要多长时间?

大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。

我能在这节 AI Agents 课中编写并运行代码吗?

能。每节 AI Agents 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。

此课程中的所有课时

  1. 基于您的文档构建问答机器人
  2. 代码讲解智能体
  3. 网页浏览研究智能体
  4. 面向您的 DB 的 SQL 助手
← 返回 AI Agents