Language- und Vision-APIs in der Praxis
Rufen Sie die Computer Vision API auf, um ein Bild zu analysieren, und die Text Analytics API, um mithilfe von REST-Anforderungen Stimmung und Schlüsselphrasen aus Kundenbewertungen zu extrahieren.
Language- und Vision-APIs in der Praxis ist eine kostenlose Cloud & IT Cert Prep-Lektion auf CoddyKit. Dies ist Lektion 2 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des Cloud & IT Cert Prep-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der Cloud & IT Cert Prep-Kurs umfasst insgesamt 4 Lektionen.
Aufrufen der Computer Vision API
Die Computer Vision API (/vision/v3.2/analyze) analysiert eine Bild-URL oder einen Binärdatenstrom und gibt eine umfangreiche JSON-Antwort mit erkannten Objekten, einer natürlichsprachlichen Szenenbeschreibung, dominanten Farben und der Information zurück, ob das Bild nicht jugendfreie Inhalte enthält. Sie geben an, welche visuellen Merkmale Sie benötigen – Categories, Description, Objects, Tags, Faces, Color, Adult –, um den Berechnungsumfang der API zu steuern und nur die tatsächlich verwendeten Funktionen zu bezahlen.
# Analyse an image URL with Computer Vision
curl -X POST 'https://myVision.cognitiveservices.azure.com/vision/v3.2/analyze?visualFeatures=Description,Objects,Tags' \
-H 'Ocp-Apim-Subscription-Key: <key>' \
-H 'Content-Type: application/json' \
-d '{"url": "https://upload.wikimedia.org/wikipedia/commons/thumb/3/3a/Cat03.jpg/1200px-Cat03.jpg"}'OCR: Text aus Bildern lesen
Die Read API (/vision/v3.2/read/analyze) ist der empfohlene OCR-Endpunkt zum Extrahieren von Text aus Bildern und PDFs. Anders als der ältere Endpunkt /ocr arbeitet die Read API asynchron: Sie übermitteln das Bild, erhalten eine Vorgangs-URL, fragen diese bis zum Abschluss wiederholt ab und rufen anschließend das Ergebnis ab. Die API unterstützt gedruckten und handschriftlichen Text in 164 Sprachen, bewahrt die Lesereihenfolge von Textblöcken und verarbeitet gedrehte oder niedrig aufgelöste Bilder besser als der synchrone OCR-Endpunkt.
# Step 1: Submit image for reading
curl -X POST 'https://myVision.cognitiveservices.azure.com/vision/v3.2/read/analyze' \
-H 'Ocp-Apim-Subscription-Key: <key>' \
-H 'Content-Type: application/json' \
-d '{"url": "https://example.com/invoice.jpg"}'
# Returns: Operation-Location header with result URL
# Step 2: Poll for result
curl 'https://myVision.cognitiveservices.azure.com/vision/v3.2/read/analyzeResults/<operation-id>' \
-H 'Ocp-Apim-Subscription-Key: <key>'Sentimentanalyse mit Text Analytics
Der Endpunkt Sentiment Analysis (/text/analytics/v3.1/sentiment) gibt für jedes übermittelte Dokument ein Sentimentlabel (positive, negative, neutral oder mixed) und einen Konfidenzwert zwischen 0 und 1 zurück. Außerdem bietet er Opinion Mining (aspektbasierte Sentimentanalyse), das erkennt, auf welche konkreten Aspekte eines Produkts oder Dienstes sich die Kommentare eines Rezensenten beziehen und welches Sentiment jeweils vorliegt – beispielsweise, dass eine Restaurantbewertung das Essen positiv, den Service jedoch negativ beurteilt.
# Sentiment analysis request
curl -X POST 'https://myLanguage.cognitiveservices.azure.com/text/analytics/v3.1/sentiment?opinionMining=true' \
-H 'Ocp-Apim-Subscription-Key: <key>' \
-H 'Content-Type: application/json' \
-d '{
"documents": [
{"id": "1", "language": "en", "text": "The food was great but the service was terrible."}
]
}'Extraktion von Schlüsselbegriffen
Die Extraktion von Schlüsselbegriffen identifiziert die wichtigsten Themen und Konzepte in einem Text und gibt sie als Liste von Ausdrücken zurück. Bei einer E-Mail an den Kundensupport könnte sie beispielsweise Ausdrücke wie Lieferverzögerung, Auftragsbestätigung und Erstattungsanfrage zurückgeben. Dies ist hilfreich, um Supporttickets automatisch zu taggen, Dokumente für die Suchindizierung zusammenzufassen oder Inhalte in einer Wissensdatenbank zu priorisieren. Die API verarbeitet bis zu 1.000 Dokumente pro Anforderung und unterstützt mehr als 10 Sprachen.
# Key phrase extraction
curl -X POST 'https://myLanguage.cognitiveservices.azure.com/text/analytics/v3.1/keyPhrases' \
-H 'Ocp-Apim-Subscription-Key: <key>' \
-H 'Content-Type: application/json' \
-d '{
"documents": [
{"id": "1", "language": "en",
"text": "Azure offers scalable storage, compute, and AI services for enterprises."}
]
}'Erkennung benannter Entitäten
Die Erkennung benannter Entitäten (NER) identifiziert und kategorisiert Erwähnungen von Entitäten in Texten – etwa Person, Organisation, Location, DateTime, Quantity, URL und Email. Die Variante zur Erkennung personenbezogener Daten (PII) findet vertrauliche Daten wie Kreditkartennummern, Sozialversicherungsnummern und Telefonnummern und kann diese unkenntlich machen. Die PII-Erkennung ist hilfreich, um Daten vor dem Speichern oder der Verarbeitung für Analysen automatisch zu anonymisieren.
# PII entity recognition
curl -X POST 'https://myLanguage.cognitiveservices.azure.com/text/analytics/v3.1/entities/recognition/pii' \
-H 'Ocp-Apim-Subscription-Key: <key>' \
-H 'Content-Type: application/json' \
-d '{
"documents": [
{"id": "1", "language": "en",
"text": "Please contact John Smith at john@example.com for refund."}
]
}'Azure AI Translator in der Praxis
Die Translator API (/translate) wandelt Text in einem einzigen REST-Aufruf zwischen mehr als 100 Sprachen um. Sie übergeben den Ausgangstext, geben einen oder mehrere Zielsprachcodes an und erhalten den übersetzten Text zusammen mit der erkannten Ausgangssprache. Die API bietet außerdem Transliteration (die Umwandlung eines Schriftsystems, z. B. von arabischen in lateinische Zeichen) und eine Wörterbuchabfrage für Übersetzungsalternativen auf Wortebene. Translator unterstützt die Stapelverarbeitung von bis zu 100 Dokumenten pro Anforderung und eignet sich dadurch effizient für die Lokalisierung großer Inhaltsmengen.
# Translate English text to French and Spanish
curl -X POST 'https://api.cognitive.microsofttranslator.com/translate?api-version=3.0&to=fr&to=es' \
-H 'Ocp-Apim-Subscription-Key: <key>' \
-H 'Ocp-Apim-Subscription-Region: eastus' \
-H 'Content-Type: application/json' \
-d '[{"text": "Hello, how are you?"}]'Custom Vision: Trainieren Ihres eigenen Modells
Azure AI Custom Vision ermöglicht es Ihnen, ohne ML-Code ein Modell zur Bildklassifizierung oder Objekterkennung anhand eigener gekennzeichneter Bilder zu trainieren. Im Custom Vision-Portal laden Sie Bilder hoch, versehen sie mit Tags und klicken auf Train. Der Dienst trainiert ein Modell und gibt Leistungsmetriken (Precision, Recall, AP) zurück. Anschließend testen Sie das Modell mit neuen Bildern und veröffentlichen es als Prediction-Endpunkt. Modelle können auch für die Inferenz auf Geräten als ONNX oder CoreML exportiert werden.
# Create a Custom Vision project via CLI
az cognitiveservices account create \
--name myCustomVision \
--resource-group myRG \
--kind CustomVision.Training \
--sku S0 \
--location eastusLanguage Understanding (CLU)
Conversational Language Understanding (CLU) ist der Nachfolger von LUIS. Sie definieren Intents (was der Benutzer möchte, z. B. BookFlight oder GetWeather) und Entities (zu extrahierende Daten, z. B. Zielort oder Reisedatum), stellen Beispieläußerungen für jede Absicht bereit, trainieren das Modell und stellen es bereit. Anwendungen rufen den CLU-Prediction-Endpunkt auf, um Benutzereingaben der richtigen Absicht zuzuordnen und Entitäten zu extrahieren. CLU bildet die Verständnisebene virtueller Assistenten und Chatbots.
Behandeln von API-Fehlern und Drosselung
Die APIs von Azure AI Services geben standardisierte HTTP-Statuscodes zurück. 400 Bad Request bedeutet, dass die Eingabe fehlerhaft formatiert ist (z. B. weil ein Dokument zu lang ist – Text Analytics unterstützt bis zu 5.120 Zeichen pro Dokument). 401 Unauthorized bedeutet, dass ein API-Schlüssel ungültig ist oder fehlt. 429 Too Many Requests bedeutet, dass Sie Ihr Dienstkontingent überschritten haben – implementieren Sie exponentielles Backoff mit Jitter und wiederholen Sie die Anforderung. Für Produktionsumgebungen sollten Sie eine dedizierte Ressource (nicht die kostenlose Tarifstufe) verwenden und über das Azure-Portal eine Erhöhung des Kontingents beantragen, wenn Sie einen höheren Durchsatz benötigen.
Integrieren von AI Services in Logic Apps
Azure AI Services lassen sich mithilfe integrierter Connectors in Azure Logic Apps integrieren, sodass KI-Workflows ohne Code möglich sind. Beispiel: Wenn eine neue E-Mail eintrifft → Anlagen extrahieren → die Computer Vision Read API aufrufen, um Text aus den Anlagen per OCR zu erfassen → Text Analytics aufrufen, um Schlüsselbegriffe zu extrahieren → Ergebnisse in eine SharePoint-Liste schreiben. Logic Apps umfasst Connectors für Cognitive Services (Language, Vision, Translator), die Authentifizierung und API-Aufrufe verwalten, ohne dass Sie Code für REST-Anforderungen schreiben müssen.
AI-Dienste mit dem Python SDK verwenden
Microsoft veröffentlicht offizielle Python-Pakete für jeden AI-Dienst. Installieren Sie azure-ai-textanalytics für Language-APIs oder azure-cognitiveservices-vision-computervision für Vision. Das SDK übernimmt Authentifizierung, Serialisierung und die Logik für Wiederholungsversuche automatisch. Authentifizieren Sie sich mit einem AzureKeyCredential oder einer DefaultAzureCredential (unterstützt verwaltete Identitäten). In Produktionscode wird die Verwendung des SDK gegenüber direkten HTTP-Anfragen bevorzugt, da es Typsicherheit und einfachere Upgrades bei Änderungen der API-Versionen bietet.
# Python — Text Analytics sentiment analysis
from azure.ai.textanalytics import TextAnalyticsClient
from azure.core.credentials import AzureKeyCredential
client = TextAnalyticsClient(
endpoint='https://myLanguage.cognitiveservices.azure.com/',
credential=AzureKeyCredential('<key>')
)
docs = ['The product quality exceeded my expectations.']
result = client.analyze_sentiment(docs)
for doc in result:
print(doc.sentiment, doc.confidence_scores)Schnelltest
Testen Sie Ihr Verständnis der Konzepte von Microsoft Azure Fundamentals (AZ-900) aus dieser Lektion.
Zusammenfassung der Lektion
In dieser Lektion haben Sie Folgendes gelernt: Die Computer Vision API analysiert Bilder auf Objekte, Beschreibungen und OCR-Text (mit der asynchronen Read API), die Text Analytics APIs extrahieren aus Texten die Stimmung, Schlüsselbegriffe und personenbezogene Daten (PII), und die Translator API übersetzt Text in einem einzigen Aufruf zwischen mehr als 100 Sprachen. Als Nächstes sehen wir uns Azure Machine Learning Studio zum Trainieren und Bereitstellen benutzerdefinierter ML-Modelle an.
Häufig gestellte Fragen
Ist die Lektion „Language- und Vision-APIs in der Praxis“ kostenlos?
Ja — der vollständige Text von „Language- und Vision-APIs in der Praxis“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des Cloud & IT Cert Prep-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der Cloud & IT Cert Prep-Kurs umfasst insgesamt 4 Lektionen.
Was lerne ich in „Language- und Vision-APIs in der Praxis“?
Rufen Sie die Computer Vision API auf, um ein Bild zu analysieren, und die Text Analytics API, um mithilfe von REST-Anforderungen Stimmung und Schlüsselphrasen aus Kundenbewertungen zu extrahieren. Du übst Cloud & IT Cert Prep mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.
Brauche ich Erfahrung, um Cloud & IT Cert Prep zu starten?
Keine Vorkenntnisse erforderlich. Cloud & IT Cert Prep auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 2 von 4.
Wie lange dauert die Lektion „Language- und Vision-APIs in der Praxis“?
Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.
Kann ich in dieser Cloud & IT Cert Prep-Lektion Code schreiben und ausführen?
Ja. Jede Cloud & IT Cert Prep-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.
Alle Lektionen in diesem Kurs
- Überblick über Azure Cognitive Services
- Language- und Vision-APIs in der Praxis
- Azure Machine Learning Studio
- Azure OpenAI Service