Wzorce rozumowania między modalnościami
Ugruntowywanie twierdzeń tekstowych w obrazach i synteza multimodalnego kontekstu z wielu źródeł.
Wzorce rozumowania między modalnościami to bezpłatna lekcja AI Agents na CoddyKit. To lekcja 4 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej AI Agents, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs AI Agents zawiera 4 lekcji w sumie.
Rozumowanie multimodalne
Rozumowanie multimodalne występuje, gdy agent musi uzgodnić informacje pochodzące z co najmniej dwóch modalności — tekstu, obrazów, wykresów lub tabel — które mogą być ze sobą zgodne, sprzeczne albo wzajemnie się uzupełniać. Przykład: tekst raportu mówi, że przychody wzrosły o 20%, ale dołączony wykres pokazuje linię pozostającą na stałym poziomie.
Agent musi zdecydować, które źródło jest poprawne, albo oznaczyć rozbieżność do weryfikacji przez człowieka.
Ugruntowanie tekstu w obrazie
Ugruntowanie tekstu w obrazie oznacza weryfikowanie, czy twierdzenia zawarte w tekście można potwierdzić wizualnie na towarzyszącym mu obrazie. Na przykład: czy opis produktu odpowiada jego zdjęciu? Czy dokument wspomina o tabeli, która rzeczywiście znajduje się na obrazie?
import anthropic
import base64
def ground_text_in_image(
text_claim: str,
image_path: str
) -> dict:
client = anthropic.Anthropic(api_key='YOUR_API_KEY')
with open(image_path, 'rb') as f:
b64 = base64.standard_b64encode(f.read()).decode('utf-8')
prompt = (
f'Text claim: "{text_claim}"\n\n'
'Does the image above support, contradict, or partially support this claim?\n'
'Return JSON: {"verdict": "support|contradict|partial|insufficient_evidence", '
'"confidence": 0.0, "evidence": "..."}'
)
response = client.messages.create(
model='claude-opus-4-5', max_tokens=256,
messages=[{'role': 'user', 'content': [
{'type': 'image', 'source': {'type': 'base64',
'media_type': 'image/jpeg', 'data': b64}},
{'type': 'text', 'text': prompt}
]}]
)
import json
return json.loads(response.content[0].text)Wykrywanie sprzeczności między wykresem a tekstem
Częsty scenariusz z rzeczywistych zastosowań: opis w raporcie finansowym mówi jedno, ale wykres osadzony w dokumencie przedstawia inną sytuację. Agent może wizualnie wyodrębnić dane z wykresu i porównać je z twierdzeniami liczbowymi zawartymi w tekście.
def compare_chart_to_text(
chart_image_path: str,
text_with_claims: str
) -> dict:
import anthropic, base64, json
client = anthropic.Anthropic(api_key='YOUR_API_KEY')
with open(chart_image_path, 'rb') as f:
b64 = base64.standard_b64encode(f.read()).decode('utf-8')
prompt = (
'The following text makes claims about data.\n'
f'TEXT: {text_with_claims}\n\n'
'Compare the chart image to the text claims. '
'List any contradictions and agreements. '
'Return JSON: {"agreements": [str], "contradictions": [str], '
'"verdict": "consistent|inconsistent|partial"}'
)
response = client.messages.create(
model='claude-opus-4-5', max_tokens=512,
messages=[{'role': 'user', 'content': [
{'type': 'image', 'source': {'type': 'base64',
'media_type': 'image/jpeg', 'data': b64}},
{'type': 'text', 'text': prompt}
]}]
)
return json.loads(response.content[0].text)Strategie łączenia sygnałów
Gdy sygnały z wielu modalności są zgodne, należy zwiększyć poziom pewności. Gdy są sprzeczne, należy zastosować strategię rozstrzygania konfliktów: zaufać bardziej ustrukturyzowanemu źródłu (w przypadku liczb wykresy są ważniejsze niż opis), oznaczyć sprawę do weryfikacji przez człowieka lub poprosić LLM o rozumowanie, które źródło jest bardziej wiarygodne.
SIGNAL_SOURCES = {
'chart': 0.9, # high trust for quantitative data
'table': 0.85,
'photo': 0.8,
'prose': 0.6, # lower trust — may be imprecise or outdated
'caption': 0.7
}
def combine_signals(signals: list) -> dict:
"""
signals: list of {'source': str, 'claim': str, 'supports': bool}
Returns weighted verdict.
"""
support_weight = 0.0
total_weight = 0.0
for sig in signals:
w = SIGNAL_SOURCES.get(sig['source'], 0.5)
total_weight += w
if sig['supports']:
support_weight += w
confidence = support_weight / total_weight if total_weight > 0 else 0.0
return {
'confidence': round(confidence, 3),
'verdict': 'supported' if confidence >= 0.6 else 'contested',
'needs_review': 0.4 <= confidence < 0.6
}
if __name__ == '__main__':
signals = [
{'source': 'chart', 'claim': 'Revenue grew 20%', 'supports': True},
{'source': 'prose', 'claim': 'Revenue grew 20%', 'supports': False},
]
print(combine_signals(signals))
Potok weryfikacji tekstu na podstawie obrazu
Potok weryfikacji produktu: mając opis produktu i jego zdjęcie, należy sprawdzić, czy każda kluczowa cecha wymieniona w tekście jest widoczna na obrazie. Należy zwrócić ustrukturyzowany raport zawierający zgodności i rozbieżności.
def verify_product_description(
description: str,
product_image_path: str
) -> dict:
import anthropic, base64, json
client = anthropic.Anthropic(api_key='YOUR_API_KEY')
with open(product_image_path, 'rb') as f:
b64 = base64.standard_b64encode(f.read()).decode('utf-8')
prompt = (
f'Product description:\n{description}\n\n'
'For each attribute mentioned in the description (color, shape, material, '
'size, features), check whether it is visible in the product photo.\n'
'Return JSON: {"verified": [{"attribute": str, "status": str}], '
'"unverified": [str], "overall_match": float}\n'
'status: confirmed / contradicted / not_visible\n'
'overall_match: 0.0-1.0'
)
response = client.messages.create(
model='claude-opus-4-5', max_tokens=512,
messages=[{'role': 'user', 'content': [
{'type': 'image', 'source': {'type': 'base64',
'media_type': 'image/jpeg', 'data': b64}},
{'type': 'text', 'text': prompt}
]}]
)
return json.loads(response.content[0].text)Porównywanie dokumentu z obrazem
Podczas analizowania zeskanowanych dokumentów dostępne są zarówno tekst OCR, jak i obraz źródłowy. Należy je porównać: czy wyodrębniony tekst odpowiada temu, co jest widoczne na obrazie? Rozbieżności mogą wskazywać na błędy OCR wymagające korekty.
def crossref_ocr_with_image(
ocr_text: str,
document_image_path: str
) -> dict:
import anthropic, base64, json
client = anthropic.Anthropic(api_key='YOUR_API_KEY')
with open(document_image_path, 'rb') as f:
b64 = base64.standard_b64encode(f.read()).decode('utf-8')
prompt = (
f'The OCR system produced this text from the document image:\n\n'
f'{ocr_text}\n\n'
'Compare the OCR text to what you actually see in the image. '
'Identify any OCR errors, missed text, or hallucinated characters.\n'
'Return JSON: {"ocr_errors": [{"incorrect": str, "correct": str}], '
'"missed_sections": [str], "accuracy_estimate": float}'
)
response = client.messages.create(
model='claude-opus-4-5', max_tokens=512,
messages=[{'role': 'user', 'content': [
{'type': 'image', 'source': {'type': 'base64',
'media_type': 'image/jpeg', 'data': b64}},
{'type': 'text', 'text': prompt}
]}]
)
return json.loads(response.content[0].text)Agent rozumujący na podstawie wielu źródeł
Agent rozumujący na podstawie wielu źródeł systematycznie zbiera dowody z każdej modalności, łączy sygnały i przedstawia końcowy wniosek wraz z oceną pewności. Wskazuje, które źródła potwierdzały wniosek, a które mu zaprzeczały.
def multi_source_reasoning(
claim: str,
evidence_sources: list # list of {'type': 'text'|'image', 'content': str|path}
) -> dict:
import anthropic, base64, json
client = anthropic.Anthropic(api_key='YOUR_API_KEY')
content_blocks = [
{'type': 'text',
'text': f'Evaluate this claim using ALL sources below:\nClaim: "{claim}"\n'}
]
for i, src in enumerate(evidence_sources):
if src['type'] == 'text':
content_blocks.append(
{'type': 'text', 'text': f'Source {i+1} (text): {src["content"]}'}
)
elif src['type'] == 'image':
with open(src['content'], 'rb') as f:
b64 = base64.standard_b64encode(f.read()).decode('utf-8')
content_blocks.append(
{'type': 'text', 'text': f'Source {i+1} (image):'}
)
content_blocks.append(
{'type': 'image', 'source': {'type': 'base64',
'media_type': 'image/jpeg', 'data': b64}}
)
content_blocks.append({'type': 'text', 'text':
'Return JSON: {"verdict": str, "confidence": float, '
'"supporting_sources": [int], "contradicting_sources": [int]}'
})
response = client.messages.create(
model='claude-opus-4-5', max_tokens=512,
messages=[{'role': 'user', 'content': content_blocks}]
)
return json.loads(response.content[0].text)Generowanie faktów z obrazu do tekstu
Czasami dostępny jest obraz, z którego należy wygenerować ustrukturyzowane fakty na potrzeby dalszego rozumowania opartego na tekście. Fakty ilościowe z wykresów i tabel należy wyodrębnić jako JSON, aby można je było matematycznie zweryfikować względem twierdzeń tekstowych.
def extract_facts_from_chart(chart_path: str) -> dict:
import anthropic, base64, json
client = anthropic.Anthropic(api_key='YOUR_API_KEY')
with open(chart_path, 'rb') as f:
b64 = base64.standard_b64encode(f.read()).decode('utf-8')
prompt = (
'Extract all quantitative data from this chart. '
'Return JSON with: chart_type, x_axis_label, y_axis_label, '
'and data_points as [{label: str, value: float}].\n'
'Also extract any trend: increasing/decreasing/stable/volatile.'
)
response = client.messages.create(
model='claude-opus-4-5', max_tokens=512,
messages=[{'role': 'user', 'content': [
{'type': 'image', 'source': {'type': 'base64',
'media_type': 'image/jpeg', 'data': b64}},
{'type': 'text', 'text': prompt}
]}]
)
return json.loads(response.content[0].text)Kierowanie na podstawie progu pewności
Po rozumowaniu multimodalnym wynik należy skierować na odpowiednią ścieżkę na podstawie poziomu pewności: wysoka pewność → automatyczne zatwierdzenie, średnia → oznaczenie do opcjonalnej weryfikacji, niska → eskalacja do człowieka. Sprzecznych sygnałów nie wolno automatycznie zatwierdzać niezależnie od oceny pewności.
def route_cross_modal_result(result: dict) -> str:
confidence = result.get('confidence', 0.0)
has_contradiction = bool(result.get('contradicting_sources'))
if has_contradiction:
return 'ESCALATE'
if confidence >= 0.85:
return 'AUTO_APPROVE'
if confidence >= 0.6:
return 'OPTIONAL_REVIEW'
return 'ESCALATE'
# Example routing table:
# confidence >= 0.85, no contradiction -> AUTO_APPROVE
# confidence 0.6-0.85, no contradiction -> OPTIONAL_REVIEW
# any contradiction, or confidence < 0.6 -> ESCALATE
def handle_routing(claim: str, evidence_sources: list):
result = multi_source_reasoning(claim, evidence_sources)
action = route_cross_modal_result(result)
print(f'Claim: "{claim}"')
print(f'Verdict: {result["verdict"]} (confidence={result["confidence"]:.2f})')
print(f'Action: {action}')
return action, resultObsługa niewystarczających dowodów wizualnych
Czasami obraz ma zbyt niską rozdzielczość, jest rozmazany lub częściowo zasłonięty, aby dostarczyć użytecznych dowodów. Agent musi to wykryć i powstrzymać się od wyciągania wniosku multimodalnego, zamiast tworzyć jego halucynację.
def assess_image_evidence_quality(
image_path: str,
claim: str
) -> dict:
import anthropic, base64, json
client = anthropic.Anthropic(api_key='YOUR_API_KEY')
with open(image_path, 'rb') as f:
b64 = base64.standard_b64encode(f.read()).decode('utf-8')
prompt = (
f'Claim to verify: "{claim}"\n\n'
'Assess whether this image provides sufficient evidence to evaluate the claim.\n'
'Consider: image quality, relevance, completeness, and readability.\n'
'Return JSON: {"sufficient": bool, "quality_issues": [str], '
'"usable_evidence": str}'
)
response = client.messages.create(
model='claude-opus-4-5', max_tokens=256,
messages=[{'role': 'user', 'content': [
{'type': 'image', 'source': {'type': 'base64',
'media_type': 'image/jpeg', 'data': b64}},
{'type': 'text', 'text': prompt}
]}]
)
return json.loads(response.content[0].text)Budowanie weryfikatora faktów multimodalnych
Wszystkie elementy razem tworzą weryfikator faktów w dokumencie, który przyjmuje raport (tekst i osadzone obrazy) oraz sprawdza każde twierdzenie ilościowe w tekście względem powiązanych wykresów i tabel. Zwraca ustrukturyzowany raport weryfikacji.
def fact_check_report(
report_text: str,
image_paths: list
) -> dict:
import re
# Extract numeric claims from text (simple regex pattern)
claim_pattern = r'[A-Z][^.!?]*[0-9][%$][^.!?]*[.!?]'
claims = re.findall(claim_pattern, report_text)
results = []
for claim in claims:
sources = [
{'type': 'text', 'content': report_text},
] + [{'type': 'image', 'content': p} for p in image_paths]
reasoning = multi_source_reasoning(claim, sources)
action = route_cross_modal_result(reasoning)
results.append({
'claim': claim,
'verdict': reasoning['verdict'],
'confidence': reasoning['confidence'],
'action': action
})
total = len(results)
auto_approved = sum(1 for r in results if r['action'] == 'AUTO_APPROVE')
return {
'total_claims': total,
'auto_approved': auto_approved,
'escalated': total - auto_approved,
'details': results
}Sprawdzenie wiedzy
Co powinien zrobić agent multimodalny zgodnie z najlepszymi praktykami, gdy sygnały tekstowe i sygnały z wykresu są ze sobą sprzeczne?
Podsumowanie: wzorce rozumowania multimodalnego
Ta lekcja została ukończona. Najważniejsze informacje:
- Ugruntowanie tekstu w obrazie: należy weryfikować twierdzenia tekstowe na podstawie dowodów wizualnych
- Łączenie sygnałów: ważone zaufanie (wykresy > opis w przypadku liczb), źródła ustrukturyzowane są ważniejsze od nieustrukturyzowanych
- Wykrywanie sprzeczności: należy zawsze eskalować sprawę do człowieka — nigdy nie rozstrzygać sprzeczności automatycznie
- Kierowanie na podstawie pewności: automatyczne zatwierdzenie (wysoka) → opcjonalna weryfikacja (średnia) → eskalacja (niska lub sprzeczność)
- Niewystarczające dowody: należy wstrzymać się od wniosku, zamiast tworzyć halucynację multimodalnej konkluzji
Następny kurs: agenci IoT sterowani przez sensory — przetwarzanie strumieni danych ze świata rzeczywistego za pomocą MQTT.
Często zadawane pytania
Czy lekcja „Wzorce rozumowania między modalnościami” jest bezpłatna?
Tak — pełny tekst „Wzorce rozumowania między modalnościami” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu AI Agents, przejdź na CoddyKit PRO. Kurs AI Agents zawiera 4 lekcji w sumie.
Co nauczysz się w „Wzorce rozumowania między modalnościami”?
Ugruntowywanie twierdzeń tekstowych w obrazach i synteza multimodalnego kontekstu z wielu źródeł. Ćwiczysz AI Agents z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.
Czy potrzebuję doświadczenia, aby zacząć AI Agents?
Nie wymagamy żadnego doświadczenia. AI Agents w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 4 z 4.
Ile czasu zajmuje lekcja „Wzorce rozumowania między modalnościami”?
Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.
Czy mogę pisać i uruchamiać kod w tej lekcji AI Agents?
Tak. Każda lekcja AI Agents zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.
Wszystkie lekcje w tym kursie
- Agenci obrazu i tekstu z Claude Vision i GPT-4V
- Przepływy pracy agentów audio i tekstu
- Rozumienie wideo przez agentów
- Wzorce rozumowania między modalnościami