Практическое использование API Language и Vision
Вызывайте API Computer Vision для анализа изображения и API Text Analytics для извлечения тональности и ключевых фраз из отзывов клиентов с помощью REST-запросов.
«Практическое использование API Language и Vision» — бесплатный урок Cloud & IT Cert Prep на CoddyKit. Это урок 2 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения Cloud & IT Cert Prep, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс Cloud & IT Cert Prep содержит 4 уроков всего.
Вызов API Computer Vision
Computer Vision API (/vision/v3.2/analyze) анализирует URL-адрес изображения или двоичный поток и возвращает подробный ответ JSON, содержащий обнаруженные объекты, описание сцены на естественном языке, преобладающие цвета и сведения о наличии материалов для взрослых. Вы указываете нужные визуальные признаки — Categories, Description, Objects, Tags, Faces, Color, Adult, — чтобы управлять вычислениями API и платить только за используемые возможности.
# Analyse an image URL with Computer Vision
curl -X POST 'https://myVision.cognitiveservices.azure.com/vision/v3.2/analyze?visualFeatures=Description,Objects,Tags' \
-H 'Ocp-Apim-Subscription-Key: <key>' \
-H 'Content-Type: application/json' \
-d '{"url": "https://upload.wikimedia.org/wikipedia/commons/thumb/3/3a/Cat03.jpg/1200px-Cat03.jpg"}'OCR: чтение текста с изображений
Read API (/vision/v3.2/read/analyze) — рекомендуемая конечная точка OCR для извлечения текста из изображений и PDF-файлов. В отличие от старой конечной точки /ocr, Read API работает асинхронно: Вы отправляете изображение, получаете URL операции, опрашиваете его до завершения, а затем извлекаете результат. API поддерживает печатный и рукописный текст на 164 языках, сохраняет порядок чтения текстовых блоков и лучше обрабатывает повернутые изображения и изображения низкого разрешения, чем синхронная конечная точка OCR.
# Step 1: Submit image for reading
curl -X POST 'https://myVision.cognitiveservices.azure.com/vision/v3.2/read/analyze' \
-H 'Ocp-Apim-Subscription-Key: <key>' \
-H 'Content-Type: application/json' \
-d '{"url": "https://example.com/invoice.jpg"}'
# Returns: Operation-Location header with result URL
# Step 2: Poll for result
curl 'https://myVision.cognitiveservices.azure.com/vision/v3.2/read/analyzeResults/<operation-id>' \
-H 'Ocp-Apim-Subscription-Key: <key>'Анализ тональности с помощью Text Analytics
Конечная точка анализа тональности (/text/analytics/v3.1/sentiment) возвращает для каждого отправленного документа метку тональности (положительная, отрицательная, нейтральная или смешанная) и показатель уверенности от 0 до 1. Она также поддерживает извлечение мнений (анализ тональности на уровне аспектов), определяя, какие именно характеристики продукта или службы упоминает автор отзыва и какова тональность каждой характеристики — например, выявляя, что отзыв о ресторане положительно оценивает еду, но отрицательно — обслуживание.
# Sentiment analysis request
curl -X POST 'https://myLanguage.cognitiveservices.azure.com/text/analytics/v3.1/sentiment?opinionMining=true' \
-H 'Ocp-Apim-Subscription-Key: <key>' \
-H 'Content-Type: application/json' \
-d '{
"documents": [
{"id": "1", "language": "en", "text": "The food was great but the service was terrible."}
]
}'Извлечение ключевых фраз
Извлечение ключевых фраз определяет основные темы и понятия в тексте и возвращает их в виде списка фраз. Например, для письма в службу поддержки оно может вернуть фразы задержка доставки, подтверждение заказа и запрос на возврат средств. Это полезно для автоматической маркировки обращений в службу поддержки, составления кратких версий документов для поисковой индексации или расстановки приоритетов содержимого в базе знаний. API обрабатывает до 1 000 документов за один запрос и поддерживает более 10 языков.
# Key phrase extraction
curl -X POST 'https://myLanguage.cognitiveservices.azure.com/text/analytics/v3.1/keyPhrases' \
-H 'Ocp-Apim-Subscription-Key: <key>' \
-H 'Content-Type: application/json' \
-d '{
"documents": [
{"id": "1", "language": "en",
"text": "Azure offers scalable storage, compute, and AI services for enterprises."}
]
}'Распознавание именованных сущностей
Распознавание именованных сущностей (NER) выявляет и классифицирует упоминания сущностей в тексте, например Person, Organisation, Location, DateTime, Quantity, URL и Email. Вариант обнаружения PII (персональных идентифицирующих данных) специально находит и может скрывать конфиденциальные сведения, такие как номера банковских карт, номера социального страхования и номера телефонов. Обнаружение PII полезно для автоматической анонимизации данных перед их хранением или обработкой в целях аналитики.
# PII entity recognition
curl -X POST 'https://myLanguage.cognitiveservices.azure.com/text/analytics/v3.1/entities/recognition/pii' \
-H 'Ocp-Apim-Subscription-Key: <key>' \
-H 'Content-Type: application/json' \
-d '{
"documents": [
{"id": "1", "language": "en",
"text": "Please contact John Smith at john@example.com for refund."}
]
}'Azure ИИ Translator на практике
Translator API (/translate) преобразует текст между более чем 100 языками за один вызов REST. Вы передаете исходный текст, указываете один или несколько кодов целевых языков и получаете переведенный текст с определенным исходным языком. API также предоставляет транслитерацию (преобразование письменности, например арабских символов в латинские) и поиск в словаре для получения вариантов перевода на уровне слов. Translator поддерживает пакетную обработку до 100 документов за запрос, что делает его эффективным для локализации больших объемов содержимого.
# Translate English text to French and Spanish
curl -X POST 'https://api.cognitive.microsofttranslator.com/translate?api-version=3.0&to=fr&to=es' \
-H 'Ocp-Apim-Subscription-Key: <key>' \
-H 'Ocp-Apim-Subscription-Region: eastus' \
-H 'Content-Type: application/json' \
-d '[{"text": "Hello, how are you?"}]'Custom Vision: обучение собственной модели
Azure ИИ Custom Vision позволяет обучить модель классификации изображений или обнаружения объектов на собственных размеченных изображениях без написания кода машинного обучения. На портале Custom Vision Вы загружаете изображения, добавляете к ним метки и нажимаете Train. Служба обучает модель и возвращает показатели качества (Precision, Recall, AP). Затем Вы проверяете модель на новых изображениях и публикуете ее как конечную точку прогнозирования. Модели также можно экспортировать в формате ONNX или CoreML для выполнения прогнозов на устройстве.
# Create a Custom Vision project via CLI
az cognitiveservices account create \
--name myCustomVision \
--resource-group myRG \
--kind CustomVision.Training \
--sku S0 \
--location eastusПонимание языка (CLU)
Conversational Language Understanding (CLU) — преемник LUIS. Вы определяете намерения (чего хочет пользователь, например BookFlight или GetWeather) и сущности (данные для извлечения, например город назначения или дату поездки), добавляете примеры высказываний для каждого намерения, обучаете модель и развертываете ее. Приложения вызывают конечную точку прогнозирования CLU, чтобы классифицировать ввод пользователя по правильному намерению и извлекать сущности. CLU обеспечивает уровень понимания виртуальных помощников и чат-ботов.
Обработка ошибок API и ограничения частоты
API служб Azure ИИ возвращают стандартные коды состояния HTTP. 400 Bad Request означает некорректно сформированный ввод (например, слишком длинный документ — Text Analytics поддерживает до 5 120 символов в документе). 401 Unauthorized означает недействительный или отсутствующий ключ API. 429 Too Many Requests означает превышение квоты службы — реализуйте экспоненциальную задержку с разбросом и повторяйте запрос. Для рабочей среды рассмотрите выделенный ресурс (не бесплатный уровень) и запросите увеличение квоты через портал Azure, если Вам нужна более высокая пропускная способность.
Интеграция служб ИИ с Logic Apps
Службы Azure ИИ можно интегрировать с Azure Logic Apps с помощью встроенных соединителей, создавая рабочие процессы ИИ без написания кода. Например: при поступлении нового письма → извлечь вложения → вызвать Read API службы Computer Vision для распознавания текста во вложениях → вызвать Text Analytics для извлечения ключевых фраз → записать результаты в список SharePoint. Logic Apps включает соединители для Cognitive Services (Language, Vision, Translator), которые управляют аутентификацией и вызовами API без написания кода REST-запросов.
Использование AI Services с Python SDK
Microsoft публикует официальные пакеты Python для каждого AI Service. Установите azure-ai-textanalytics для языковых API или azure-cognitiveservices-vision-computervision для работы с изображениями. SDK автоматически обрабатывает аутентификацию, сериализацию и логику повторных попыток. Для аутентификации используйте AzureKeyCredential или DefaultAzureCredential (с поддержкой управляемых удостоверений). В рабочем коде предпочтительно использовать SDK, а не необработанные HTTP-запросы, поскольку SDK обеспечивает проверку типов и упрощает обновление при изменении версий API.
# Python — Text Analytics sentiment analysis
from azure.ai.textanalytics import TextAnalyticsClient
from azure.core.credentials import AzureKeyCredential
client = TextAnalyticsClient(
endpoint='https://myLanguage.cognitiveservices.azure.com/',
credential=AzureKeyCredential('<key>')
)
docs = ['The product quality exceeded my expectations.']
result = client.analyze_sentiment(docs)
for doc in result:
print(doc.sentiment, doc.confidence_scores)Быстрая проверка
Проверьте своё понимание концепций Microsoft Azure Fundamentals (AZ-900), рассмотренных в этом уроке.
Итоги урока
В этом уроке Вы узнали, что API компьютерного зрения анализирует изображения, выявляя объекты и составляя описания, а также извлекает текст с помощью OCR (через асинхронный API Read); API Text Analytics извлекают из текста тональность, ключевые фразы и PII; а API Translator преобразует текст между более чем 100 языками за один вызов. Далее мы рассмотрим Azure Machine Learning Studio для обучения и развёртывания пользовательских моделей ML.
Часто задаваемые вопросы
Урок «Практическое использование API Language и Vision» бесплатный?
Да — полный текст урока «Практическое использование API Language и Vision» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс Cloud & IT Cert Prep, подпишись на CoddyKit PRO. Курс Cloud & IT Cert Prep содержит 4 уроков всего.
Чему я научусь в уроке «Практическое использование API Language и Vision»?
Вызывайте API Computer Vision для анализа изображения и API Text Analytics для извлечения тональности и ключевых фраз из отзывов клиентов с помощью REST-запросов. Ты практикуешь Cloud & IT Cert Prep с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.
Нужен ли мне опыт, чтобы начать Cloud & IT Cert Prep?
Предыдущий опыт не требуется. Cloud & IT Cert Prep на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 2 из 4.
Сколько времени занимает урок «Практическое использование API Language и Vision»?
Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.
Можно ли писать и запускать код в этом уроке Cloud & IT Cert Prep?
Да. Каждый урок Cloud & IT Cert Prep включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.
Все уроки этого курса
- Обзор Azure Cognitive Services
- Практическое использование API Language и Vision
- Azure Machine Learning Studio
- Azure OpenAI Service