ai-agents-for-beginners

Construindo Agentes de Uso de Computador (CUA)

Agentes de uso de computador podem interagir com websites do mesmo jeito que uma pessoa faria: abrindo um navegador, inspecionando a página e tomando a melhor decisão a partir do que veem. Nesta lição, você construirá um agente de automação de navegador que busca no Airbnb, extrai dados estruturados de anúncios e identifica a estadia mais barata em Estocolmo.

A lição combina Browser-Use para navegação dirigida por IA, Playwright e Chrome DevTools Protocol (CDP) para controle do navegador, Azure OpenAI para raciocínio habilitado por visão, e Pydantic para extração estruturada.

Introdução

Esta lição abordará:

Objetivos de Aprendizagem

Após completar esta lição, você saberá como:

Exemplo de Código

Esta lição inclui um tutorial em notebook:

Pré-requisitos

Configuração

Instale os pacotes usados no notebook:

pip install browser_use playwright python-dotenv
playwright install chromium

Defina as variáveis de ambiente Azure OpenAI usadas pelo notebook:

AZURE_OPENAI_ENDPOINT=...
AZURE_OPENAI_API_KEY=...
AZURE_OPENAI_CHAT_DEPLOYMENT_NAME=...
# Opcional: padrão para a versão mais recente da API quando omitido
AZURE_OPENAI_API_VERSION=...

Visão Geral da Arquitetura

O notebook demonstra um fluxo híbrido de automação de navegador:

  1. O Chrome inicia com CDP habilitado para que Playwright e Browser-Use possam compartilhar a mesma sessão do navegador.
  2. Um agente Browser-Use gerencia tarefas de navegação abertas como abrir o Airbnb, dispensar pop-ups e pesquisar Estocolmo.
  3. A página ativa é inspecionada com um esquema estruturado Pydantic para extrair títulos dos anúncios, preços por noite, avaliações e URLs.
  4. A lógica Python compara os anúncios extraídos e destaca o resultado mais barato.

Essa abordagem mantém o raciocínio flexível baseado em visão que Browser-Use faz bem, enquanto te dá controle determinístico do navegador quando necessário.

Pontos-Chave e Boas Práticas

Quando Usar Agente vs Ator

Cenário Usar Agente Usar Ator
Layouts dinâmicos Sim, IA pode se adaptar a mudanças na página Não, seletores frágeis podem quebrar
Estrutura conhecida Não, agente é mais lento que controle direto Sim, rápido e preciso
Encontrar elementos Sim, linguagem natural funciona bem Não, seletores exatos são necessários
Controle de tempo Não, menos previsível Sim, controle total sobre esperas e tentativas
Fluxos complexos Sim, lida com estados inesperados da UI Não, requer ramificações explícitas

Boas Práticas de Browser-Use

  1. Comece com um agente para exploração e navegação dinâmica.
  2. Mude para controle direto da página quando a interação se tornar previsível.
  3. Use modelos de saída estruturada para que os dados extraídos sejam validados e tipados com segurança.
  4. Adicione atrasos estrategicamente após ações que provocam mudanças visíveis na UI.
  5. Capture screenshots enquanto itera para facilitar debugging de falhas.
  6. Espere que sites mudem e desenhe estratégias de fallback para pop-ups e deslocamentos de layout.
  7. Misture padrões de agente e ator para obter flexibilidade e precisão.

Medidas de Segurança para Agentes de Navegador

Agentes de navegador operam em sites ao vivo, então precisam de limites mais rigorosos que um script que só chama uma API conhecida. Antes de sair de um demo em notebook para um fluxo real, defina controles sobre o que o agente pode ver, clicar e enviar.

  1. Limite o ambiente de navegação. Rode o agente em um perfil de navegador ou sandbox dedicado, e restrinja aos domínios necessários para a tarefa.
  2. Separe observação de ação. Deixe o agente buscar, ler e extrair dados primeiro; exija aprovação explícita antes de enviar formulários, enviar mensagens, reservar viagens, realizar compras, apagar registros ou alterar configurações.
  3. Mantenha segredos fora de prompts e rastros. Não coloque senhas, detalhes de pagamento, cookies de sessão ou dados pessoais crus no contexto do modelo. Deixe o usuário assumir a autenticação e redigir campos sensíveis dos logs.
  4. Trate conteúdo da página como entrada não confiável. Um site pode conter instruções destinadas ao agente, não ao usuário. O agente deve ignorar textos que peçam para mudar suas metas, revelar dados, desativar salvaguardas ou visitar sites não relacionados.
  5. Use verificações determinísticas em passos arriscados. Verifique URL atual, título da página, item selecionado, preço, destinatário e resumo da ação com código antes de pedir aprovação final do usuário.
  6. Defina orçamentos e condições de parada. Limite o número de ações, tentativas, abas e minutos que o agente pode usar. Pare quando o estado da página estiver ambíguo em vez de continuar clicando.
  7. Registre evidências úteis, não tudo. Mantenha resumos das ações, timestamps, URLs, descrições dos elementos selecionados e referências a screenshots para que falhas possam ser revisadas sem armazenar conteúdo sensível desnecessário.

No exemplo do Airbnb, o padrão seguro é buscar anúncios e extrair preços. Fazer login, contactar um anfitrião ou concluir uma reserva deve ser uma ação separada aprovada pelo usuário.

Aplicações no Mundo Real

Exemplo Real: Microsoft Project Opal

O agente que você constrói nesta lição é uma versão pequena e local de um agente de uso de computador (CUA) — um programa que dirige um navegador da mesma forma que uma pessoa. A Microsoft está levando essa mesma ideia para a empresa com o Project Opal (Frontier), uma funcionalidade do Microsoft 365 Copilot.

Com o Project Opal, você descreve uma tarefa e o agente trabalha em seu nome usando uso do computador em um Windows 365 Cloud PC seguro, operando entre os aplicativos, sites e dados baseados em navegador da sua organização. Funciona assincronamente em segundo plano, e você pode guiar o trabalho ou assumir o controle a qualquer momento. Exemplos de tarefas incluem:

Opal é uma referência útil para como é um agente de uso de computador de nível de produção e confiável — e reforça conceitos de lições anteriores:

Conceito neste curso Como o Project Opal aplica
Humano no loop (Lição 06) Opal pausa para credenciais de login, dados sensíveis ou instruções ambíguas, e nunca insere senhas nem envia formulários sem confirmação explícita. Você pode Assumir Controle e Devolver Controle no meio da tarefa.
Agentes seguros e confiáveis (Lições 06 & 18) Roda em um Windows 365 Cloud PC isolado, é somente navegador por padrão (outro acesso ao computador bloqueado via Intune), usa sua identidade para acessar só o autorizado, e registra cada ação para auditoria.
Planejamento & metacognição (Lições 07 & 09) Opal gera um plano da tarefa primeiro, depois supervisiona seu próprio raciocínio em cada passo e pausa se detectar atividade suspeita.
Capacidades / ferramentas reutilizáveis (Lição 04) Skills deixam você escrever instruções para trabalhos repetíveis (importadas de arquivo .md ou criadas com Opal) e reutilizá-las em conversas.

Disponibilidade: O Project Opal está atualmente disponível para usuários no programa de acesso antecipado Frontier com assinatura Microsoft 365 Copilot, e seu administrador deve completar a configuração. Por ser um recurso experimental Frontier, as capacidades podem mudar com o tempo.

Recursos Adicionais

Lição Anterior

Explorando o Microsoft Agent Framework

Próxima Lição

Desenvolvendo Agentes Escaláveis


Aviso Legal: Este documento foi traduzido usando o serviço de tradução por IA Co-op Translator. Embora nos esforcemos pela precisão, por favor, esteja ciente de que traduções automatizadas podem conter erros ou imprecisões. O documento original em seu idioma nativo deve ser considerado a fonte autorizada. Para informações críticas, recomenda-se tradução profissional humana. Não nos responsabilizamos por quaisquer mal-entendidos ou interpretações incorretas decorrentes do uso desta tradução.