Tekoälyagentit · Oppitunti

Tokenibudjetit vaihekohtaisesti

Rajoittakaa syöte- ja tulostetokenien määrää kussakin solmussa, jotta hallitsematon silmukka ei voi ajaa teitä vararikkoon.

Oppitunti 1/414 vaihetta

Tokenibudjetit vaihekohtaisesti on ilmainen Tekoälyagentit-oppitunti CoddyKitissä. Tämä on oppitunti 1/4. Voit lukea koko oppitunnin alta ilmaiseksi ja harjoitella sen jälkeen käytännössä selaimessa sisäänrakennetulla koodieditorilla ja ympäri vuorokauden käytettävissä olevan tekoälytuutorin avulla. Oppitunti kuuluu Tekoälyagentit-oppimispolkuun, ja edistymisesi synkronoituu verkon ja CoddyKit-sovelluksen välillä. Tekoälyagentit-kurssilla on yhteensä 4 oppituntia.

Tokenit maksavat

Jokainen lähettämänne tai vastaanottamanne tokeni maksaa rahaa ja aikaa. Tuotantoagentit seuraavat tokenien käyttöä jokaisessa vaiheessa ja asettavat niille ylärajat.

Rajaa max_tokens kaikissa kutsuissa

Asettakaa max_tokens aina jokaisessa kutsussa. Ilman sitä virheellinen kehote voi tuottaa 10 000 tokenin vastauksia:

response = client.chat.completions.create(
    model='gpt-4o-mini',
    messages=messages,
    max_tokens=1024,   # cap per response
)

Vaihekohtaiset rajat agenttisilmukassa

Eri vaiheet tarvitsevat erikokoiset budjetit:

STEP_BUDGETS = {
    'planner': 512,
    'classifier': 64,
    'final_synthesis': 2048,
    'tool_call': 256
}

response = client.chat.completions.create(
    model=model,
    messages=messages,
    max_tokens=STEP_BUDGETS[step_name]
)

Karsikaa syötetokeneita

Myös syötetokenit maksavat. Karsikaa niitä reilusti:

import tiktoken
enc = tiktoken.encoding_for_model('gpt-4o-mini')

def trim_to_budget(text, max_tokens=4000):
    toks = enc.encode(text)
    if len(toks) > max_tokens:
        return enc.decode(toks[:max_tokens])
    return text

Ajon kokonaisbudjetti

Laskekaa yhteen kaikkien vaiheiden syöte- ja tulostetokenit ja keskeyttäkää ajo, jos raja ylittyy:

MAX_TOKENS_PER_RUN = 50_000
total = 0
for step in agent_steps:
    r = call_step(step)
    total += r.usage.total_tokens
    if total > MAX_TOKENS_PER_RUN:
        return 'Budget exhausted; partial result'

Kustannusrajat dollareina

Joskus budjetointi dollareina on mielekkäämpää:

PRICES = {'gpt-4o-mini': {'in': 0.15e-6, 'out': 0.60e-6}}

for step in agent_steps:
    r = call_step(step)
    cost = r.usage.prompt_tokens * PRICES[model]['in'] + r.usage.completion_tokens * PRICES[model]['out']
    total_cost += cost
    if total_cost > MAX_COST_PER_RUN:
        break

Mukautuvat budjetit

Käyttäkää vaikeimpiin vaiheisiin enemmän tokeneita:

if step_difficulty == 'easy':
    max_tokens = 256
elif step_difficulty == 'hard':
    max_tokens = 2048

Tulosteen pituuden arviointi

Joskus voitte pyytää mallia arvioimaan, kuinka pitkä vastauksen pitäisi olla:

preview = llm.invoke(f'How many tokens (approx) does {question} need to answer?').content
budget = parse_int(preview, default=512)
final = llm.invoke(question, max_tokens=budget)

Lyhentäkää työkalutulosteita

Suuret työkalutulosteet (HTML, lokit) paisuttavat kontekstia. Lyhentäkää ne ennen niiden lähettämistä mallille:

tool_result = run_tool(...)
text = json.dumps(tool_result)
if len(text) > 4000:
    text = text[:4000] + '\n...[truncated]'

Tiivistäkää historia

Tiivistäkää pitkien keskustelujen vanhemmat vuorot tokenien säästämiseksi:

if total_message_tokens(messages) > 8000:
    messages = compact(messages)

Tulostemuoto vaikuttaa tokenien määrään

JSON on sanallinen. Harkitkaa lyhyitä rakenteisia vastauksia varten seuraavia vaihtoehtoja:

  • Yksittäinen työkalukutsun argumentti
  • Pilkulla eroteltu luettelo
  • Tiivis mukautettu muoto

Seuratkaa tokenijakaumaa

Vaihekohtaiset histogrammit paljastavat, mitä vaiheita kannattaa optimoida:

metrics.observe('step.planner.tokens', r.usage.total_tokens, tags={'agent': 'qa'})

Miksi max_tokens?

Miksi max_tokens kannattaa asettaa jokaisessa LLM-kutsussa?

Yhteenveto

Rajaatte max_tokens-arvon jokaisessa kutsussa. Karsikaa syötteitä. Käyttäkää vaihekohtaisia budjetteja. Asettakaa ajon kokonaisrajat. Seuratkaa jakaumia. Tiivistäkää historia.

Aloita maksutta

Opi Tekoälyagentit tekoälytuutorin avulla — ilmaiseksi

Kirjoita ja suorita oikeaa koodia selaimessa, saa välitöntä apua tekoälytuutorilta ympäri vuorokauden ja jatka siitä, mihin jäit, verkossa tai sovelluksessa.

Kurssit
60
Oppitunnit
239

Usein kysytyt kysymykset

Onko oppitunti ”Tokenibudjetit vaihekohtaisesti” ilmainen?

Kyllä – oppitunnin ”Tokenibudjetit vaihekohtaisesti” koko tekstin voi lukea täällä verkossa ilmaiseksi. Jos haluat harjoitella interaktiivisesti sisäänrakennetulla koodieditorilla ja ympäri vuorokauden käytettävissä olevan tekoälytuutorin avulla sekä avata koko Tekoälyagentit-kurssin, päivitä CoddyKit PROhon. Tekoälyagentit-kurssilla on yhteensä 4 oppituntia.

Mitä opin oppitunnilla ”Tokenibudjetit vaihekohtaisesti”?

Rajoittakaa syöte- ja tulostetokenien määrää kussakin solmussa, jotta hallitsematon silmukka ei voi ajaa teitä vararikkoon. Harjoittelet Tekoälyagentit-aihetta koodilla, jonka suoritat suoraan selaimessa. Ympäri vuorokauden käytettävissä oleva tekoälytuutori vastaa kysymyksiisi oppitunnin aikana.

Tarvitsenko kokemusta aloittaakseni Tekoälyagentit-opiskelun?

Aiempi kokemus ei ole tarpeen. CoddyKitin Tekoälyagentit-oppimispolku sopii vasta-alkajista edistyneisiin, joten voit aloittaa tästä tai alusta ja edetä omaan tahtiisi. Tämä on oppitunti 1/4.

Kuinka kauan ”Tokenibudjetit vaihekohtaisesti”-oppitunnin suorittaminen kestää?

Useimmat CoddyKitin oppitunnit kestävät noin 5–10 minuuttia. Jokainen oppitunti on lyhyt ja interaktiivinen, joten edistyt tasaisesti ja voit jatkaa siitä, mihin jäit – sekä verkossa että sovelluksessa.

Voinko kirjoittaa ja suorittaa koodia tällä Tekoälyagentit-oppitunnilla?

Kyllä. Jokainen Tekoälyagentit-oppitunti sisältää sisäänrakennetun koodieditorin, joten voit kirjoittaa ja suorittaa oikeaa koodia suoraan selaimessa ja saada välitöntä palautetta tekoälyltä – paikallista asennusta ei tarvita.

Kaikki tämän kurssin oppitunnit

  1. Tokenibudjetit vaihekohtaisesti
  2. Mallien reititys (halvasta kalliiseen)
  3. Kehotteiden ja tulosten välimuisti (Anthropic, Vertex)
  4. Kvantitointi ja spekulatiivinen dekoodaus
← Takaisin: Tekoälyagentit