Tokenibudjetit vaihekohtaisesti
Rajoittakaa syöte- ja tulostetokenien määrää kussakin solmussa, jotta hallitsematon silmukka ei voi ajaa teitä vararikkoon.
Tokenibudjetit vaihekohtaisesti on ilmainen Tekoälyagentit-oppitunti CoddyKitissä. Tämä on oppitunti 1/4. Voit lukea koko oppitunnin alta ilmaiseksi ja harjoitella sen jälkeen käytännössä selaimessa sisäänrakennetulla koodieditorilla ja ympäri vuorokauden käytettävissä olevan tekoälytuutorin avulla. Oppitunti kuuluu Tekoälyagentit-oppimispolkuun, ja edistymisesi synkronoituu verkon ja CoddyKit-sovelluksen välillä. Tekoälyagentit-kurssilla on yhteensä 4 oppituntia.
Tokenit maksavat
Jokainen lähettämänne tai vastaanottamanne tokeni maksaa rahaa ja aikaa. Tuotantoagentit seuraavat tokenien käyttöä jokaisessa vaiheessa ja asettavat niille ylärajat.
Rajaa max_tokens kaikissa kutsuissa
Asettakaa max_tokens aina jokaisessa kutsussa. Ilman sitä virheellinen kehote voi tuottaa 10 000 tokenin vastauksia:
response = client.chat.completions.create(
model='gpt-4o-mini',
messages=messages,
max_tokens=1024, # cap per response
)Vaihekohtaiset rajat agenttisilmukassa
Eri vaiheet tarvitsevat erikokoiset budjetit:
STEP_BUDGETS = {
'planner': 512,
'classifier': 64,
'final_synthesis': 2048,
'tool_call': 256
}
response = client.chat.completions.create(
model=model,
messages=messages,
max_tokens=STEP_BUDGETS[step_name]
)Karsikaa syötetokeneita
Myös syötetokenit maksavat. Karsikaa niitä reilusti:
import tiktoken
enc = tiktoken.encoding_for_model('gpt-4o-mini')
def trim_to_budget(text, max_tokens=4000):
toks = enc.encode(text)
if len(toks) > max_tokens:
return enc.decode(toks[:max_tokens])
return textAjon kokonaisbudjetti
Laskekaa yhteen kaikkien vaiheiden syöte- ja tulostetokenit ja keskeyttäkää ajo, jos raja ylittyy:
MAX_TOKENS_PER_RUN = 50_000
total = 0
for step in agent_steps:
r = call_step(step)
total += r.usage.total_tokens
if total > MAX_TOKENS_PER_RUN:
return 'Budget exhausted; partial result'Kustannusrajat dollareina
Joskus budjetointi dollareina on mielekkäämpää:
PRICES = {'gpt-4o-mini': {'in': 0.15e-6, 'out': 0.60e-6}}
for step in agent_steps:
r = call_step(step)
cost = r.usage.prompt_tokens * PRICES[model]['in'] + r.usage.completion_tokens * PRICES[model]['out']
total_cost += cost
if total_cost > MAX_COST_PER_RUN:
breakMukautuvat budjetit
Käyttäkää vaikeimpiin vaiheisiin enemmän tokeneita:
if step_difficulty == 'easy':
max_tokens = 256
elif step_difficulty == 'hard':
max_tokens = 2048Tulosteen pituuden arviointi
Joskus voitte pyytää mallia arvioimaan, kuinka pitkä vastauksen pitäisi olla:
preview = llm.invoke(f'How many tokens (approx) does {question} need to answer?').content
budget = parse_int(preview, default=512)
final = llm.invoke(question, max_tokens=budget)Lyhentäkää työkalutulosteita
Suuret työkalutulosteet (HTML, lokit) paisuttavat kontekstia. Lyhentäkää ne ennen niiden lähettämistä mallille:
tool_result = run_tool(...)
text = json.dumps(tool_result)
if len(text) > 4000:
text = text[:4000] + '\n...[truncated]'Tiivistäkää historia
Tiivistäkää pitkien keskustelujen vanhemmat vuorot tokenien säästämiseksi:
if total_message_tokens(messages) > 8000:
messages = compact(messages)Tulostemuoto vaikuttaa tokenien määrään
JSON on sanallinen. Harkitkaa lyhyitä rakenteisia vastauksia varten seuraavia vaihtoehtoja:
- Yksittäinen työkalukutsun argumentti
- Pilkulla eroteltu luettelo
- Tiivis mukautettu muoto
Seuratkaa tokenijakaumaa
Vaihekohtaiset histogrammit paljastavat, mitä vaiheita kannattaa optimoida:
metrics.observe('step.planner.tokens', r.usage.total_tokens, tags={'agent': 'qa'})Miksi max_tokens?
Miksi max_tokens kannattaa asettaa jokaisessa LLM-kutsussa?
Yhteenveto
Rajaatte max_tokens-arvon jokaisessa kutsussa. Karsikaa syötteitä. Käyttäkää vaihekohtaisia budjetteja. Asettakaa ajon kokonaisrajat. Seuratkaa jakaumia. Tiivistäkää historia.
Opi Tekoälyagentit tekoälytuutorin avulla — ilmaiseksi
Kirjoita ja suorita oikeaa koodia selaimessa, saa välitöntä apua tekoälytuutorilta ympäri vuorokauden ja jatka siitä, mihin jäit, verkossa tai sovelluksessa.
- Kurssit
- 60
- Oppitunnit
- 239
Usein kysytyt kysymykset
Onko oppitunti ”Tokenibudjetit vaihekohtaisesti” ilmainen?
Kyllä – oppitunnin ”Tokenibudjetit vaihekohtaisesti” koko tekstin voi lukea täällä verkossa ilmaiseksi. Jos haluat harjoitella interaktiivisesti sisäänrakennetulla koodieditorilla ja ympäri vuorokauden käytettävissä olevan tekoälytuutorin avulla sekä avata koko Tekoälyagentit-kurssin, päivitä CoddyKit PROhon. Tekoälyagentit-kurssilla on yhteensä 4 oppituntia.
Mitä opin oppitunnilla ”Tokenibudjetit vaihekohtaisesti”?
Rajoittakaa syöte- ja tulostetokenien määrää kussakin solmussa, jotta hallitsematon silmukka ei voi ajaa teitä vararikkoon. Harjoittelet Tekoälyagentit-aihetta koodilla, jonka suoritat suoraan selaimessa. Ympäri vuorokauden käytettävissä oleva tekoälytuutori vastaa kysymyksiisi oppitunnin aikana.
Tarvitsenko kokemusta aloittaakseni Tekoälyagentit-opiskelun?
Aiempi kokemus ei ole tarpeen. CoddyKitin Tekoälyagentit-oppimispolku sopii vasta-alkajista edistyneisiin, joten voit aloittaa tästä tai alusta ja edetä omaan tahtiisi. Tämä on oppitunti 1/4.
Kuinka kauan ”Tokenibudjetit vaihekohtaisesti”-oppitunnin suorittaminen kestää?
Useimmat CoddyKitin oppitunnit kestävät noin 5–10 minuuttia. Jokainen oppitunti on lyhyt ja interaktiivinen, joten edistyt tasaisesti ja voit jatkaa siitä, mihin jäit – sekä verkossa että sovelluksessa.
Voinko kirjoittaa ja suorittaa koodia tällä Tekoälyagentit-oppitunnilla?
Kyllä. Jokainen Tekoälyagentit-oppitunti sisältää sisäänrakennetun koodieditorin, joten voit kirjoittaa ja suorittaa oikeaa koodia suoraan selaimessa ja saada välitöntä palautetta tekoälyltä – paikallista asennusta ei tarvita.
Kaikki tämän kurssin oppitunnit
- Tokenibudjetit vaihekohtaisesti
- Mallien reititys (halvasta kalliiseen)
- Kehotteiden ja tulosten välimuisti (Anthropic, Vertex)
- Kvantitointi ja spekulatiivinen dekoodaus