0Pricing
Azure Fundamentals · Lekcja

Interfejsy API Language i Vision w praktyce

Wywołaj interfejs Computer Vision API, aby przeanalizować obraz, oraz Text Analytics API, aby wyodrębnić ton emocjonalny i kluczowe frazy z opinii klientów za pomocą żądań REST.

Interfejsy API Language i Vision w praktyce to bezpłatna lekcja Azure Fundamentals na CoddyKit. To lekcja 2 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej Azure Fundamentals, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs Azure Fundamentals zawiera 4 lekcji w sumie.

Wywoływanie interfejsu Computer Vision API

Computer Vision API (/vision/v3.2/analyze) analizuje adres URL obrazu lub strumień binarny i zwraca rozbudowaną odpowiedź JSON zawierającą wykryte obiekty, opis sceny w języku naturalnym, dominujące kolory oraz informację, czy obraz zawiera treści dla dorosłych. Należy określić, które cechy wizualne mają zostać użyte — Categories, Description, Objects, Tags, Faces, Color, Adult — aby kontrolować zakres obliczeń wykonywanych przez interfejs API i płacić tylko za wykorzystane funkcje.

# Analyse an image URL with Computer Vision
curl -X POST 'https://myVision.cognitiveservices.azure.com/vision/v3.2/analyze?visualFeatures=Description,Objects,Tags' \
  -H 'Ocp-Apim-Subscription-Key: <key>' \
  -H 'Content-Type: application/json' \
  -d '{"url": "https://upload.wikimedia.org/wikipedia/commons/thumb/3/3a/Cat03.jpg/1200px-Cat03.jpg"}'

OCR: odczytywanie tekstu z obrazów

Read API (/vision/v3.2/read/analyze) to zalecany punkt końcowy OCR do wyodrębniania tekstu z obrazów i plików PDF. W przeciwieństwie do starszego punktu końcowego /ocr Read API działa asynchronicznie — należy przesłać obraz, odebrać adres URL operacji, odpytywać go do czasu zakończenia, a następnie pobrać wynik. Interfejs obsługuje tekst drukowany i odręczny w 164 językach, zachowuje kolejność odczytu bloków tekstu oraz lepiej radzi sobie z obróconymi obrazami i obrazami o niskiej rozdzielczości niż synchroniczny punkt końcowy OCR.

# Step 1: Submit image for reading
curl -X POST 'https://myVision.cognitiveservices.azure.com/vision/v3.2/read/analyze' \
  -H 'Ocp-Apim-Subscription-Key: <key>' \
  -H 'Content-Type: application/json' \
  -d '{"url": "https://example.com/invoice.jpg"}'
# Returns: Operation-Location header with result URL

# Step 2: Poll for result
curl 'https://myVision.cognitiveservices.azure.com/vision/v3.2/read/analyzeResults/<operation-id>' \
  -H 'Ocp-Apim-Subscription-Key: <key>'

Analiza tonacji za pomocą Text Analytics

Punkt końcowy Sentiment Analysis (/text/analytics/v3.1/sentiment) zwraca etykietę tonacji (pozytywna, negatywna, neutralna lub mieszana) oraz wynik pewności z zakresu od 0 do 1 dla każdego przesłanego dokumentu. Udostępnia również funkcję opinion mining (analizę tonacji opartą na aspektach), która identyfikuje konkretne aspekty produktu lub usługi, do których odnosi się recenzent, oraz tonację dotyczącą każdego aspektu — na przykład wykrywa, że recenzja restauracji jest pozytywna w odniesieniu do jedzenia, ale negatywna w odniesieniu do obsługi.

# Sentiment analysis request
curl -X POST 'https://myLanguage.cognitiveservices.azure.com/text/analytics/v3.1/sentiment?opinionMining=true' \
  -H 'Ocp-Apim-Subscription-Key: <key>' \
  -H 'Content-Type: application/json' \
  -d '{
    "documents": [
      {"id": "1", "language": "en", "text": "The food was great but the service was terrible."}
    ]
  }'

Wyodrębnianie kluczowych fraz

Wyodrębnianie kluczowych fraz identyfikuje główne tematy i pojęcia w tekście, zwracając je jako listę fraz. W przypadku wiadomości e-mail do działu obsługi klienta mogą to być na przykład frazy opóźnienie dostawy, potwierdzenie zamówienia i prośba o zwrot pieniędzy. Funkcja ta jest przydatna do automatycznego oznaczania zgłoszeń do pomocy technicznej, tworzenia podsumowań dokumentów na potrzeby indeksowania wyszukiwania lub ustalania priorytetów treści w bazie wiedzy. Interfejs API przetwarza do 1000 dokumentów na żądanie i obsługuje ponad 10 języków.

# Key phrase extraction
curl -X POST 'https://myLanguage.cognitiveservices.azure.com/text/analytics/v3.1/keyPhrases' \
  -H 'Ocp-Apim-Subscription-Key: <key>' \
  -H 'Content-Type: application/json' \
  -d '{
    "documents": [
      {"id": "1", "language": "en",
       "text": "Azure offers scalable storage, compute, and AI services for enterprises."}
    ]
  }'

Rozpoznawanie nazwanych jednostek

Rozpoznawanie nazwanych jednostek (NER) identyfikuje i kategoryzuje wzmianki o jednostkach w tekście — takich jak Person, Organisation, Location, DateTime, Quantity, URL i Email. Wariant wykrywania danych osobowych (PII, Personal Identifiable Information) wyszukuje i może redagować poufne dane, takie jak numery kart kredytowych, numery ubezpieczenia społecznego i numery telefonów. Wykrywanie danych osobowych jest przydatne do automatycznej anonimizacji danych przed ich zapisaniem lub przetwarzaniem na potrzeby analizy.

# PII entity recognition
curl -X POST 'https://myLanguage.cognitiveservices.azure.com/text/analytics/v3.1/entities/recognition/pii' \
  -H 'Ocp-Apim-Subscription-Key: <key>' \
  -H 'Content-Type: application/json' \
  -d '{
    "documents": [
      {"id": "1", "language": "en",
       "text": "Please contact John Smith at john@example.com for refund."}
    ]
  }'

Azure AI Translator w praktyce

Translator API (/translate) konwertuje tekst między ponad 100 językami za pomocą pojedynczego wywołania REST. Należy przekazać tekst źródłowy, określić co najmniej jeden kod języka docelowego i odebrać przetłumaczony tekst wraz z wykrytym językiem źródłowym. Interfejs API udostępnia również transliterację (konwersję pisma, np. z alfabetu arabskiego na łaciński) oraz wyszukiwanie w słowniku w celu uzyskania alternatywnych tłumaczeń na poziomie słów. Translator obsługuje przetwarzanie wsadowe do 100 dokumentów na żądanie, dzięki czemu efektywnie nadaje się do lokalizacji treści na dużą skalę.

# Translate English text to French and Spanish
curl -X POST 'https://api.cognitive.microsofttranslator.com/translate?api-version=3.0&to=fr&to=es' \
  -H 'Ocp-Apim-Subscription-Key: <key>' \
  -H 'Ocp-Apim-Subscription-Region: eastus' \
  -H 'Content-Type: application/json' \
  -d '[{"text": "Hello, how are you?"}]'

Custom Vision: trenowanie własnego modelu

Azure AI Custom Vision umożliwia wytrenowanie modelu klasyfikacji obrazów lub wykrywania obiektów na podstawie własnych oznaczonych obrazów, bez pisania kodu ML. W portalu Custom Vision należy przesłać obrazy, oznaczyć je i kliknąć przycisk Train. Usługa trenuje model i zwraca miary skuteczności (Precision, Recall, AP). Następnie można przetestować model na nowych obrazach i opublikować go jako punkt końcowy predykcji. Modele można również eksportować w formatach ONNX lub CoreML na potrzeby wnioskowania na urządzeniu.

# Create a Custom Vision project via CLI
az cognitiveservices account create \
  --name myCustomVision \
  --resource-group myRG \
  --kind CustomVision.Training \
  --sku S0 \
  --location eastus

Rozumienie języka (CLU)

Conversational Language Understanding (CLU) jest następcą LUIS. Należy zdefiniować intencje (czego chce użytkownik, np. BookFlight, GetWeather) oraz jednostki (dane do wyodrębnienia, np. miasto docelowe i data podróży), podać przykładowe wypowiedzi dla każdej intencji, wytrenować model i wdrożyć go. Aplikacje wywołują punkt końcowy predykcji CLU w celu sklasyfikowania danych wejściowych użytkownika jako właściwej intencji i wyodrębnienia jednostek. CLU zapewnia warstwę rozumienia wirtualnych asystentów i chatbotów.

Obsługa błędów API i ograniczania liczby żądań

Interfejsy API Azure AI Services zwracają standardowe kody stanu HTTP. 400 Bad Request oznacza nieprawidłowo sformatowane dane wejściowe (np. zbyt długi dokument — Text Analytics obsługuje do 5120 znaków na dokument). 401 Unauthorized oznacza nieprawidłowy lub brakujący klucz API. 429 Too Many Requests oznacza przekroczenie limitu usługi — należy zaimplementować wykładnicze wycofywanie z losowym opóźnieniem i ponawianie prób. W środowisku produkcyjnym warto rozważyć dedykowany zasób (a nie warstwę bezpłatną) oraz zażądać zwiększenia limitów za pośrednictwem portalu Azure, jeśli potrzebna jest większa przepustowość.

Integracja usług AI z Logic Apps

Azure AI Services można integrować z Azure Logic Apps za pomocą wbudowanych łączników, co umożliwia tworzenie przepływów pracy AI bez kodu. Przykładowy przepływ: nadejście nowej wiadomości e-mail → wyodrębnienie załączników → wywołanie Read API usługi Computer Vision w celu wykonania OCR tekstu z załączników → wywołanie Text Analytics w celu wyodrębnienia kluczowych fraz → zapisanie wyników na liście programu SharePoint. Logic Apps zawiera łączniki Cognitive Services (Language, Vision, Translator), które obsługują uwierzytelnianie i wywołania API bez konieczności pisania kodu żądań REST.

Korzystanie z usług AI za pomocą Python SDK

Firma Microsoft publikuje oficjalne pakiety języka Python dla każdej usługi AI. Należy zainstalować azure-ai-textanalytics dla interfejsów API Language lub azure-cognitiveservices-vision-computervision dla usługi Vision. SDK automatycznie obsługuje uwierzytelnianie, serializację i logikę ponawiania prób. Uwierzytelnianie odbywa się za pomocą AzureKeyCredential lub DefaultAzureCredential (z obsługą zarządzanej tożsamości). W kodzie produkcyjnym zaleca się korzystanie z SDK zamiast bezpośrednich żądań HTTP, ponieważ zapewnia ono bezpieczeństwo typów i ułatwia aktualizacje przy zmianach wersji interfejsu API.

# Python — Text Analytics sentiment analysis
from azure.ai.textanalytics import TextAnalyticsClient
from azure.core.credentials import AzureKeyCredential

client = TextAnalyticsClient(
    endpoint='https://myLanguage.cognitiveservices.azure.com/',
    credential=AzureKeyCredential('<key>')
)
docs = ['The product quality exceeded my expectations.']
result = client.analyze_sentiment(docs)
for doc in result:
    print(doc.sentiment, doc.confidence_scores)

Szybkie sprawdzenie

Sprawdź swoją znajomość zagadnień Microsoft Azure Fundamentals (AZ-900) omówionych w tej lekcji.

Podsumowanie lekcji

W tej lekcji poznali Państwo: interfejs Computer Vision API analizuje obrazy pod kątem obiektów, opisów i tekstu rozpoznanego za pomocą OCR (z użyciem asynchronicznego interfejsu Read API), interfejsy Text Analytics APIs wyodrębniają z tekstu informacje o tonie wypowiedzi, kluczowe frazy i dane osobowe (PII), a Translator API tłumaczy tekst między ponad 100 językami w ramach jednego wywołania. W następnej części omówimy Azure Machine Learning Studio, służące do trenowania i wdrażania niestandardowych modeli ML.

Często zadawane pytania

Czy lekcja „Interfejsy API Language i Vision w praktyce” jest bezpłatna?

Tak — pełny tekst „Interfejsy API Language i Vision w praktyce” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu Azure Fundamentals, przejdź na CoddyKit PRO. Kurs Azure Fundamentals zawiera 4 lekcji w sumie.

Co nauczysz się w „Interfejsy API Language i Vision w praktyce”?

Wywołaj interfejs Computer Vision API, aby przeanalizować obraz, oraz Text Analytics API, aby wyodrębnić ton emocjonalny i kluczowe frazy z opinii klientów za pomocą żądań REST. Ćwiczysz Azure Fundamentals z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.

Czy potrzebuję doświadczenia, aby zacząć Azure Fundamentals?

Nie wymagamy żadnego doświadczenia. Azure Fundamentals w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 2 z 4.

Ile czasu zajmuje lekcja „Interfejsy API Language i Vision w praktyce”?

Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.

Czy mogę pisać i uruchamiać kod w tej lekcji Azure Fundamentals?

Tak. Każda lekcja Azure Fundamentals zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.

Wszystkie lekcje w tym kursie

  1. Przegląd usług Azure Cognitive Services
  2. Interfejsy API Language i Vision w praktyce
  3. Azure Machine Learning Studio
  4. Azure OpenAI Service
← Powrót do Azure Fundamentals