LLM 的能力与局限
探索 LLM 真正擅长的领域及其失效之处,包括幻觉、知识截止时间和推理局限,从而为项目设定合理预期。
LLM 的能力与局限 是 CoddyKit 上的免费 AI Engineering Academy 课时。 这是第 4 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 AI Engineering Academy 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 AI Engineering Academy 课程共包含 4 节课。
LLM 真正擅长的事情
LLM 擅长语言类工作:总结、翻译、编写代码,以及将文本转换为 JSON 等格式。只要给出几个示例,它们就能快速掌握模式。
幻觉:根本性故障模式
幻觉是指模型自信地陈述错误信息。它预测的是听起来可能正确的内容,而不是真实内容——因此绝不能把它当作事实的唯一来源。
知识截止时间与过时信息
每个模型都有一个知识截止时间——它对该日期之后的信息一无所知。要获取最新信息,您可以在查询时通过 RAG 向模型提供新文档。
推理局限:它不是逻辑引擎
LLM 会模仿推理,但并不是真正的逻辑引擎,因此在精确数学和多步骤逻辑方面容易出错。对于精确任务,应将其交给真正的工具处理——请参阅代码。
# Illustrating why you should use tools for computation
from openai import OpenAI
client = OpenAI()
# BAD: asking LLM to compute this directly
prompt_bad = 'What is 7.3% of 48,291.67?'
# GOOD: let Python compute, LLM just formats the answer
def calculate_percentage(value, pct):
return round(value * pct / 100, 2)
result = calculate_percentage(48291.67, 7.3)
print(f'7.3% of 48,291.67 is {result}') # 3525.29 - always correct上下文窗口:一个硬性约束
上下文窗口是模型一次能够处理的最大词元数量,包括提示、历史记录和输出。超过这个限制,请求就会失败。
对提示措辞的敏感性
LLM 对提示措辞非常敏感。稍微改写一下,或者加入“逐步思考”,都可能大幅改变答案——这很有用,但值得谨慎测试。
不一致性与非确定性
LLM 具有非确定性:相同的提示可能得到不同的答案。一个正确率为 95% 的模型仍会每 20 次出错 1 次,因此要在大量示例上进行测试,而不是只测试几个。
import openai
client = openai.OpenAI()
def sample_with_majority_vote(prompt, n=5):
responses = []
for _ in range(n):
r = client.chat.completions.create(
model='gpt-4o-mini',
messages=[{'role': 'user', 'content': prompt}],
temperature=0.3,
max_tokens=10
)
responses.append(r.choices[0].message.content.strip())
# Return most common answer
return max(set(responses), key=responses.count)谄媚性:认同偏差
谄媚性是指模型即使您错了也附和您,因为评分者更喜欢迎合性的答案。若想获得真正的批评,请让它为另一方进行辩护。
LLM 做不到的事情
有些限制是固有的:LLM无法自行浏览网页、运行代码、回忆过去的聊天记录或进行精确数学计算。对于这些任务,请将它与相应工具结合使用。
偏见与代表性问题
LLM 在互联网文本上训练,因此会吸收其中的偏见,包括刻板印象、语言覆盖不均和观点失衡。请在不同群体上进行测试,并记录这些限制,告知您的用户。
为项目设定现实的预期
精美的演示在真实输入下仍可能失败。这并不意味着应该放弃 LLM,而是说明您需要从第一天起就加入评估,并在开发过程中持续衡量失败情况。
快速检查
检验您对本课人工智能工程概念的理解。
课程回顾
回顾:幻觉需要通过 RAG 或验证来处理,知识截止时间需要检索机制,非确定性则需要真正的评估。接下来:您的第一个 OpenAI API 调用。🎉
用 AI 导师学习 Python — 免费
在浏览器中编写并运行真实代码,获得全天候 AI 导师的即时帮助,并在网页或应用中继续学习。
- 课程
- 30
- 课程
- 120
常见问题解答
「LLM 的能力与局限」课时是免费的吗?
是的 — 「LLM 的能力与局限」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 AI Engineering Academy 课程的其余内容,请升级到 CoddyKit PRO。 AI Engineering Academy 课程共包含 4 节课。
「LLM 的能力与局限」这节课中我会学到什么?
探索 LLM 真正擅长的领域及其失效之处,包括幻觉、知识截止时间和推理局限,从而为项目设定合理预期。 你通过在浏览器中直接运行的动手代码来练习 AI Engineering Academy,全天候 AI 导师会在你学习这节课的过程中回答你的问题。
学习 AI Engineering Academy 需要有经验吗?
无需任何先前经验。CoddyKit 上的 AI Engineering Academy 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 4 节课,共 4 节。
「LLM 的能力与局限」课时需要多长时间?
大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。
我能在这节 AI Engineering Academy 课中编写并运行代码吗?
能。每节 AI Engineering Academy 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。