Azure OpenAI Service
Déployez un modèle GPT dans Azure OpenAI Service, appelez l’API de complétion depuis un script et comprenez les principes d’une IA responsable ainsi que les options de filtrage du contenu.
Azure OpenAI Service est une leçon Azure Fundamentals gratuite sur CoddyKit. Ceci est la leçon 4 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage Azure Fundamentals, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours Azure Fundamentals comprend 4 leçons au total.
Qu’est-ce qu’Azure OpenAI Service ?
Azure OpenAI Service fournit un accès aux grands modèles de langage d’OpenAI — notamment GPT-4, GPT-3.5-turbo, DALL-E et les modèles d’incorporations — via l’infrastructure cloud Azure de Microsoft. Contrairement à l’utilisation directe de l’API OpenAI, Azure OpenAI offre des fonctionnalités d’entreprise : réseau privé via VNet/Private Link, certifications de conformité de Microsoft (ISO 27001, SOC 2, GDPR), filtrage du contenu, confidentialité des données client (vos données ne servent pas à entraîner les modèles de base d’OpenAI) et intégration avec RBAC et la supervision Azure.
Demander un accès et déployer des modèles
Azure OpenAI nécessite un abonnement approuvé — l’accès est soumis à autorisation et doit être demandé au moyen d’un formulaire. Une fois l’accès approuvé, vous créez une ressource Azure OpenAI, puis un déploiement au sein de celle-ci. Un déploiement associe un modèle (par exemple gpt-4) à un nom de déploiement (par exemple my-gpt4) et à un quota de jetons (limite de jetons par minute). Vous appelez l’API à l’aide du nom du déploiement, et non du nom du modèle de base. Plusieurs déploiements avec des modèles ou des quotas différents peuvent coexister dans une même ressource.
# Create an Azure OpenAI resource
az cognitiveservices account create \
--name myOpenAI \
--resource-group myRG \
--kind OpenAI \
--sku S0 \
--location eastus
# Create a deployment
az cognitiveservices account deployment create \
--name myOpenAI \
--resource-group myRG \
--deployment-name my-gpt4 \
--model-name gpt-4 \
--model-version '0613' \
--model-format OpenAI \
--sku-name Standard \
--sku-capacity 10API de complétion de conversation
L’API de complétion de conversation (/openai/deployments/{deployment}/chat/completions) accepte une liste de messages associés à des rôles (system, user, assistant) et renvoie la réponse du modèle. Le message system définit le comportement et la personnalité du modèle. Le message user contient l’invite ou la question. Les échanges précédents de la conversation sont inclus dans le tableau de messages afin que le modèle conserve le contexte tout au long d’un dialogue à plusieurs tours. La température (0–2) contrôle le caractère aléatoire de la réponse.
# Chat completion API call
curl -X POST 'https://myOpenAI.openai.azure.com/openai/deployments/my-gpt4/chat/completions?api-version=2024-02-01' \
-H 'api-key: <key>' \
-H 'Content-Type: application/json' \
-d '{
"messages": [
{"role": "system", "content": "You are a helpful Azure expert."},
{"role": "user", "content": "Explain what a Recovery Services vault is."}
],
"temperature": 0.7,
"max_tokens": 500
}'Notions de base de la conception d’invites
La conception d’invites consiste à formuler des messages d’entrée efficaces pour obtenir les meilleurs résultats d’un modèle de langage. Les principales techniques comprennent : invite système — attribuer au modèle un rôle et des contraintes clairs ; exemples en peu de coups — montrer au modèle 2 à 5 exemples du format entrée-sortie souhaité ; chaîne de raisonnement — demander au modèle de réfléchir étape par étape avant de donner la réponse finale ; contraintes — indiquer explicitement au modèle le format, la longueur et les éléments à éviter. De bonnes invites réduisent les hallucinations et améliorent la cohérence.
Incorporations pour la recherche sémantique
Les incorporations convertissent le texte en un vecteur numérique dense qui en capture le sens sémantique. Deux textes de sens similaire auront des vecteurs proches dans l’espace vectoriel (mesurés par similarité cosinus). Le point de terminaison d’incorporations Azure OpenAI (/embeddings) utilise le modèle text-embedding-ada-002 pour générer des vecteurs de 1 536 dimensions. Vous utilisez les incorporations pour créer une recherche sémantique (trouver des documents similaires à une requête), la RAG (génération augmentée par récupération) et des systèmes de recommandation.
# Get an embedding vector for a piece of text
curl -X POST 'https://myOpenAI.openai.azure.com/openai/deployments/my-embedding/embeddings?api-version=2024-02-01' \
-H 'api-key: <key>' \
-H 'Content-Type: application/json' \
-d '{
"input": "Azure Site Recovery replicates VMs to a secondary region."
}'Filtrage du contenu
Azure OpenAI comprend un système multicouche de filtrage du contenu qui s’exécute à la fois sur les invites (entrée) et sur les complétions (sortie). Il détecte et bloque les contenus appartenant à quatre catégories : haine, contenu sexuel, violence et automutilation. Chaque catégorie comporte trois niveaux de gravité (faible, moyen, élevé) et vous pouvez configurer les seuils de filtrage pour chacune d’elles. Les tentatives d’injection d’invite (contournements visant à remplacer l’invite système) sont également filtrées. Le filtrage du contenu est activé par défaut et ne peut pas être désactivé pour la plupart des modèles sans justification liée au cas d’utilisation.
Génération augmentée par récupération (RAG)
La RAG ancre les réponses du modèle de langage dans vos propres données au lieu de s’appuyer uniquement sur les connaissances acquises lors de son entraînement. Le fonctionnement est le suivant : (1) indexez vos documents dans un magasin vectoriel (par exemple, Azure AI Search), (2) lorsqu’un utilisateur pose une question, incorporez-la et recherchez dans le magasin vectoriel les extraits de documents pertinents, (3) incluez ces extraits dans l’invite système en tant que contexte, (4) le modèle répond en fonction du contexte fourni. La RAG réduit les hallucinations et permet aux grands modèles de langage de répondre à des questions sur des données privées et à jour sans réglage fin.
Réglage fin ou RAG
Deux approches étendent les capacités des modèles avec des données personnalisées. Le réglage fin entraîne une nouvelle version du modèle à partir de vos exemples, en intégrant les connaissances dans les poids du modèle — ce qui convient particulièrement pour lui apprendre des styles, des formats ou des comportements spécifiques difficiles à décrire dans un prompt. Le RAG récupère les informations pertinentes au moment de l’inférence et les fournit dans le contexte — ce qui convient mieux aux grandes bases de connaissances qui évoluent fréquemment, puisque vous mettez à jour l’index vectoriel au lieu de réentraîner le modèle. Pour la plupart des cas d’utilisation en entreprise, le RAG est privilégié en raison de son coût inférieur et de cycles d’itération plus rapides.
Azure AI Studio (AI Foundry)
Azure AI Studio (qui est rebaptisé Azure AI Foundry) est un portail unifié permettant de créer des applications d’IA générative sur Azure. Il fournit un environnement d’expérimentation pour tester interactivement les complétions des modèles, des outils pour évaluer la qualité des modèles à l’aide de jeux de données de référence, un concepteur de flux de prompts pour créer et déployer des pipelines RAG sous forme d’API REST, ainsi qu’une intégration avec GitHub et VS Code pour les flux de travail des développeurs. Azure AI Studio simplifie le passage du déploiement d’un modèle à la mise en production d’une application d’IA.
Tarification des jetons et gestion des quotas
Azure OpenAI est facturé par 1 000 jetons traités — un jeton correspondant approximativement à 4 caractères ou 0,75 mot. Les jetons d’entrée (prompt) comme les jetons de sortie (complétion) sont facturés. GPT-4 coûte nettement plus cher par jeton que GPT-3.5-turbo. Chaque déploiement dispose d’un quota de jetons par minute (TPM) qui limite le débit afin d’empêcher les abus. Si votre application dépasse le quota, l’API renvoie 429 TooManyRequests. Vous pouvez demander une augmentation du quota ou mettre en œuvre une temporisation exponentielle côté client ainsi qu’une logique de nouvelle tentative.
IA responsable pour l’IA générative
Microsoft applique ses principes d’IA responsable spécifiquement à l’IA générative. Fondement factuel — les réponses doivent s’appuyer sur des informations vérifiables (le RAG y contribue). Transparence — les utilisateurs doivent savoir qu’ils interagissent avec une IA. Prévention des préjudices — des filtres de contenu bloquent les sorties nuisibles. Confidentialité — vos données dans Azure OpenAI ne sont pas utilisées pour entraîner les modèles mondiaux d’OpenAI. Les applications conçues avec Azure OpenAI doivent inclure une évaluation des risques liés au cas d’utilisation et mettre en œuvre des mesures d’atténuation pour les préjudices identifiés, conformément aux exigences de la Politique d’utilisation acceptable de Microsoft.
Vérification rapide
Vérifiez votre compréhension des concepts de Microsoft Azure Fundamentals (AZ-900) abordés dans cette leçon.
Récapitulatif de la leçon
Dans cette leçon, vous avez appris que le Service Azure OpenAI fournit un accès de niveau entreprise à GPT-4 et à d’autres modèles, avec des fonctionnalités de réseau privé et de conformité, que l’API de complétion de conversations permet de gérer des conversations à plusieurs tours à l’aide des rôles de message système/utilisateur/assistant, et que les représentations vectorielles et le RAG ancrent les réponses du modèle dans vos données privées afin de réduire les hallucinations. Nous allons maintenant découvrir Azure Arc pour gérer les ressources hybrides et locales par l’intermédiaire du plan de contrôle Azure.
Questions Fréquemment Posées
La leçon « Azure OpenAI Service » est-elle gratuite ?
Oui — le texte complet de « Azure OpenAI Service » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours Azure Fundamentals, passe à CoddyKit PRO. Le cours Azure Fundamentals comprend 4 leçons au total.
Qu'est-ce que j'apprendrai dans « Azure OpenAI Service » ?
Déployez un modèle GPT dans Azure OpenAI Service, appelez l’API de complétion depuis un script et comprenez les principes d’une IA responsable ainsi que les options de filtrage du contenu. Tu pratiques Azure Fundamentals avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.
Dois-je avoir de l'expérience pour commencer Azure Fundamentals ?
Aucune expérience préalable n'est requise. Azure Fundamentals sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 4 sur 4.
Combien de temps prend la leçon « Azure OpenAI Service » ?
La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.
Peux-tu écrire et exécuter du code dans cette leçon Azure Fundamentals ?
Oui. Chaque leçon Azure Fundamentals inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.
Toutes les leçons de ce cours
- Présentation des services cognitifs Azure
- API de langage et de vision en pratique
- Azure Machine Learning Studio
- Azure OpenAI Service