AI Engineering Academy · 课时

LLM 的能力与局限

探索 LLM 真正擅长的领域及其失效之处,包括幻觉、知识截止时间和推理局限,从而为项目设定合理预期。

第 4 / 4 课13 个步骤

LLM 的能力与局限 是 CoddyKit 上的免费 AI Engineering Academy 课时。 这是第 4 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 AI Engineering Academy 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 AI Engineering Academy 课程共包含 4 节课。

LLM 真正擅长的事情

LLM 擅长语言类工作:总结、翻译、编写代码,以及将文本转换为 JSON 等格式。只要给出几个示例,它们就能快速掌握模式。

幻觉:根本性故障模式

幻觉是指模型自信地陈述错误信息。它预测的是听起来可能正确的内容,而不是真实内容——因此绝不能把它当作事实的唯一来源。

知识截止时间与过时信息

每个模型都有一个知识截止时间——它对该日期之后的信息一无所知。要获取最新信息,您可以在查询时通过 RAG 向模型提供新文档。

推理局限:它不是逻辑引擎

LLM 会模仿推理,但并不是真正的逻辑引擎,因此在精确数学和多步骤逻辑方面容易出错。对于精确任务,应将其交给真正的工具处理——请参阅代码。

# Illustrating why you should use tools for computation
from openai import OpenAI

client = OpenAI()

# BAD: asking LLM to compute this directly
prompt_bad = 'What is 7.3% of 48,291.67?'

# GOOD: let Python compute, LLM just formats the answer
def calculate_percentage(value, pct):
    return round(value * pct / 100, 2)

result = calculate_percentage(48291.67, 7.3)
print(f'7.3% of 48,291.67 is {result}')  # 3525.29 - always correct

上下文窗口:一个硬性约束

上下文窗口是模型一次能够处理的最大词元数量,包括提示、历史记录和输出。超过这个限制,请求就会失败。

对提示措辞的敏感性

LLM 对提示措辞非常敏感。稍微改写一下,或者加入“逐步思考”,都可能大幅改变答案——这很有用,但值得谨慎测试。

不一致性与非确定性

LLM 具有非确定性:相同的提示可能得到不同的答案。一个正确率为 95% 的模型仍会每 20 次出错 1 次,因此要在大量示例上进行测试,而不是只测试几个。

import openai

client = openai.OpenAI()

def sample_with_majority_vote(prompt, n=5):
    responses = []
    for _ in range(n):
        r = client.chat.completions.create(
            model='gpt-4o-mini',
            messages=[{'role': 'user', 'content': prompt}],
            temperature=0.3,
            max_tokens=10
        )
        responses.append(r.choices[0].message.content.strip())
    # Return most common answer
    return max(set(responses), key=responses.count)

谄媚性:认同偏差

谄媚性是指模型即使您错了也附和您,因为评分者更喜欢迎合性的答案。若想获得真正的批评,请让它为另一方进行辩护。

LLM 做不到的事情

有些限制是固有的:LLM无法自行浏览网页、运行代码、回忆过去的聊天记录或进行精确数学计算。对于这些任务,请将它与相应工具结合使用。

偏见与代表性问题

LLM 在互联网文本上训练,因此会吸收其中的偏见,包括刻板印象、语言覆盖不均和观点失衡。请在不同群体上进行测试,并记录这些限制,告知您的用户。

为项目设定现实的预期

精美的演示在真实输入下仍可能失败。这并不意味着应该放弃 LLM,而是说明您需要从第一天起就加入评估,并在开发过程中持续衡量失败情况。

快速检查

检验您对本课人工智能工程概念的理解。

课程回顾

回顾:幻觉需要通过 RAG 或验证来处理,知识截止时间需要检索机制,非确定性则需要真正的评估。接下来:您的第一个 OpenAI API 调用。🎉

免费开始

用 AI 导师学习 Python — 免费

在浏览器中编写并运行真实代码,获得全天候 AI 导师的即时帮助,并在网页或应用中继续学习。

课程
30
课程
120

常见问题解答

「LLM 的能力与局限」课时是免费的吗?

是的 — 「LLM 的能力与局限」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 AI Engineering Academy 课程的其余内容,请升级到 CoddyKit PRO。 AI Engineering Academy 课程共包含 4 节课。

「LLM 的能力与局限」这节课中我会学到什么?

探索 LLM 真正擅长的领域及其失效之处,包括幻觉、知识截止时间和推理局限,从而为项目设定合理预期。 你通过在浏览器中直接运行的动手代码来练习 AI Engineering Academy,全天候 AI 导师会在你学习这节课的过程中回答你的问题。

学习 AI Engineering Academy 需要有经验吗?

无需任何先前经验。CoddyKit 上的 AI Engineering Academy 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 4 节课,共 4 节。

「LLM 的能力与局限」课时需要多长时间?

大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。

我能在这节 AI Engineering Academy 课中编写并运行代码吗?

能。每节 AI Engineering Academy 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。

此课程中的所有课时

  1. 从自动补全到 ChatGPT
  2. 用通俗语言理解 Transformer 与注意力机制
  3. LLM 如何训练
  4. LLM 的能力与局限
← 返回 AI Engineering Academy