Serviço Azure OpenAI
Implante um modelo GPT no Azure OpenAI Service, chame a API de conclusões a partir de um script e entenda os princípios de IA responsável e as opções de filtragem de conteúdo.
Serviço Azure OpenAI é uma aula grátis de Azure Fundamentals no CoddyKit. Esta é a aula 4 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de Azure Fundamentals, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de Azure Fundamentals inclui 4 aulas no total.
O que é o Azure OpenAI Service?
O Azure OpenAI Service fornece acesso aos modelos de linguagem grandes da OpenAI — incluindo os modelos GPT-4, GPT-3.5-turbo, DALL-E e de Embeddings — por meio da infraestrutura de nuvem Azure da Microsoft. Diferentemente do uso direto da API da OpenAI, o Azure OpenAI oferece recursos empresariais: rede privada por meio de VNet/Private Link, certificações de conformidade da Microsoft (ISO 27001, SOC 2, GDPR), filtragem de conteúdo, privacidade dos dados do cliente (seus dados não são usados para treinar os modelos-base da OpenAI) e integração com RBAC e monitoramento do Azure.
Solicitando acesso e implantando modelos
O Azure OpenAI exige uma assinatura aprovada; o acesso é controlado e deve ser solicitado por meio de um formulário. Após a aprovação, você cria um recurso do Azure OpenAI e, em seguida, uma implantação dentro dele. Uma implantação associa um modelo (por exemplo, gpt-4) a um nome de implantação (por exemplo, my-gpt4) e a uma cota de tokens (limite de tokens por minuto). Você chama a API usando o nome da implantação, não o nome do modelo-base. Várias implantações com modelos ou cotas diferentes podem coexistir em um único recurso.
# Create an Azure OpenAI resource
az cognitiveservices account create \
--name myOpenAI \
--resource-group myRG \
--kind OpenAI \
--sku S0 \
--location eastus
# Create a deployment
az cognitiveservices account deployment create \
--name myOpenAI \
--resource-group myRG \
--deployment-name my-gpt4 \
--model-name gpt-4 \
--model-version '0613' \
--model-format OpenAI \
--sku-name Standard \
--sku-capacity 10API de conclusões de Chat
A API de conclusões de Chat (/openai/deployments/{deployment}/chat/completions) aceita uma lista de mensagens com funções (system, user, assistant) e retorna a resposta do modelo. A mensagem system define o comportamento e a persona do modelo. A mensagem user contém o prompt ou a pergunta. Os turnos anteriores da conversa são incluídos na matriz de mensagens para que o modelo mantenha o contexto ao longo de um diálogo com vários turnos. A temperatura (0–2) controla a aleatoriedade da resposta.
# Chat completion API call
curl -X POST 'https://myOpenAI.openai.azure.com/openai/deployments/my-gpt4/chat/completions?api-version=2024-02-01' \
-H 'api-key: <key>' \
-H 'Content-Type: application/json' \
-d '{
"messages": [
{"role": "system", "content": "You are a helpful Azure expert."},
{"role": "user", "content": "Explain what a Recovery Services vault is."}
],
"temperature": 0.7,
"max_tokens": 500
}'Fundamentos da engenharia de prompts
Engenharia de prompts é a prática de elaborar mensagens de entrada eficazes para obter os melhores resultados de um modelo de linguagem. As principais técnicas incluem: Prompt do sistema — forneça ao modelo uma função e restrições claras; Exemplos de poucas amostras — mostre ao modelo de 2 a 5 exemplos do formato de entrada e saída desejado; Raciocínio passo a passo — peça ao modelo que pense passo a passo antes de fornecer a resposta final; Restrições — instrua explicitamente o modelo sobre o formato, o tamanho e o que deve evitar. Bons prompts reduzem alucinações e melhoram a consistência.
Embeddings para pesquisa semântica
Embeddings convertem texto em um vetor numérico denso que captura seu significado semântico. Dois trechos de texto com significado semelhante terão vetores próximos no espaço vetorial (medidos pela similaridade do cosseno). O endpoint de embeddings do Azure OpenAI (/embeddings) usa o modelo text-embedding-ada-002 para gerar vetores de 1.536 dimensões. Você usa embeddings para criar pesquisa semântica (encontrar documentos semelhantes a uma consulta), RAG (Geração aumentada por recuperação) e sistemas de recomendação.
# Get an embedding vector for a piece of text
curl -X POST 'https://myOpenAI.openai.azure.com/openai/deployments/my-embedding/embeddings?api-version=2024-02-01' \
-H 'api-key: <key>' \
-H 'Content-Type: application/json' \
-d '{
"input": "Azure Site Recovery replicates VMs to a secondary region."
}'Filtragem de conteúdo
O Azure OpenAI inclui um sistema de filtragem de conteúdo em várias camadas, que atua tanto sobre os prompts (entrada) quanto sobre as conclusões (saída). Ele detecta e bloqueia conteúdo em quatro categorias: ódio, sexual, violência e automutilação. Cada categoria tem três níveis de gravidade (baixo, médio e alto), e você pode configurar os limites de filtragem por categoria. Tentativas de injeção de prompt (jailbreaks que tentam substituir o prompt do sistema) também são filtradas. A filtragem de conteúdo vem ativada por padrão e não pode ser desabilitada para a maioria dos modelos sem uma justificativa relacionada ao caso de uso.
Geração aumentada por recuperação (RAG)
O RAG fundamenta as respostas dos modelos de linguagem em seus próprios dados, em vez de depender exclusivamente do conhecimento usado no treinamento do modelo. O padrão funciona assim: (1) indexe seus documentos em um armazenamento vetorial (por exemplo, o Azure AI Search); (2) quando um usuário fizer uma pergunta, gere o embedding da pergunta e pesquise no armazenamento vetorial os trechos de documentos relevantes; (3) inclua esses trechos no prompt do sistema como contexto; (4) o modelo responderá com base no contexto fornecido. O RAG reduz alucinações e permite que LLMs respondam a perguntas sobre dados privados e atualizados sem ajuste fino.
Ajuste fino vs. RAG
Há duas abordagens para ampliar os recursos de um modelo usando dados personalizados. O ajuste fino treina uma nova versão do modelo com base nos seus exemplos, incorporando o conhecimento aos pesos do modelo — é ideal para ensinar estilos, formatos ou comportamentos específicos que são difíceis de descrever em um prompt. O RAG recupera informações relevantes no momento da inferência e as fornece no contexto — é mais adequado para grandes bases de conhecimento que mudam com frequência, pois o índice vetorial é atualizado em vez de o modelo ser treinado novamente. Para a maioria dos casos de uso empresariais, o RAG é preferido devido ao menor custo e à iteração mais rápida.
Azure AI Studio (AI Foundry)
O Azure AI Studio (que está sendo renomeado como Azure AI Foundry) é um portal unificado para criar aplicações de IA generativa no Azure. Ele oferece um ambiente de experimentação para testar interativamente as conclusões do modelo, ferramentas para avaliar a qualidade do modelo com base em conjuntos de dados de referência, um designer de fluxo de prompts para criar e implantar pipelines RAG como APIs REST e integração com GitHub e VS Código para os fluxos de trabalho de desenvolvimento. O Azure AI Studio simplifica o caminho desde a implantação do modelo até uma aplicação de IA em produção.
Preços por token e gerenciamento de cotas
O Azure OpenAI tem cobrança por 1.000 tokens processados — um token corresponde aproximadamente a 4 caracteres ou 0,75 palavra. Tanto os tokens de entrada (prompt) quanto os tokens de saída (conclusão) são cobrados. O GPT-4 custa significativamente mais por token do que o GPT-3.5-turbo. Cada implantação tem uma cota de tokens por minuto (TPM) que limita o processamento para evitar abusos. Se a sua aplicação exceder a cota, a API retornará 429 TooManyRequests. Você pode solicitar aumentos de cota ou implementar um recuo exponencial e uma lógica de novas tentativas no lado do cliente.
IA responsável para IA generativa
A Microsoft aplica seus princípios de IA responsável especificamente à IA generativa. Fundamentação — as respostas devem basear-se em informações verificáveis (o RAG ajuda nesse aspecto). Transparência — os usuários devem saber que estão interagindo com uma IA. Prevenção de danos — filtros de conteúdo bloqueiam resultados prejudiciais. Privacidade — seus dados no Azure OpenAI não são usados para treinar os modelos globais da OpenAI. As aplicações criadas no Azure OpenAI devem incluir uma avaliação de riscos do caso de uso e implementar medidas de mitigação para os danos identificados, conforme exigido pela Política de Uso Aceitável da Microsoft.
Verificação rápida
Teste sua compreensão dos conceitos do Microsoft Azure Fundamentals (AZ-900) abordados nesta lição.
Recapitulação da lição
Nesta lição, você aprendeu que o Azure OpenAI Service oferece acesso de nível empresarial ao GPT-4 e a outros modelos, com rede privada e recursos de conformidade; a API de conclusões de chat permite conversas com várias interações usando as funções de mensagem sistema/usuário/assistente; e embeddings e RAG fundamentam as respostas do modelo nos seus dados privados para reduzir alucinações. A seguir, exploraremos o Azure Arc para gerenciar recursos híbridos e locais por meio do plano de controle do Azure.
Perguntas Frequentes
A aula “Serviço Azure OpenAI” é grátis?
Sim — o texto completo de “Serviço Azure OpenAI” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de Azure Fundamentals, atualize para CoddyKit PRO. O curso de Azure Fundamentals inclui 4 aulas no total.
O que vou aprender em “Serviço Azure OpenAI”?
Implante um modelo GPT no Azure OpenAI Service, chame a API de conclusões a partir de um script e entenda os princípios de IA responsável e as opções de filtragem de conteúdo. Você pratica Azure Fundamentals com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.
Preciso ter experiência prévia para começar Azure Fundamentals?
Nenhuma experiência prévia é necessária. Azure Fundamentals no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 4 de 4.
Quanto tempo leva a aula “Serviço Azure OpenAI”?
A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.
Posso escrever e executar código nesta aula de Azure Fundamentals?
Sim. Cada aula de Azure Fundamentals inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.
Todas as aulas deste curso
- Visão Geral dos Serviços Cognitivos do Azure
- APIs de Linguagem e Visão na Prática
- Azure Machine Learning Studio
- Serviço Azure OpenAI