Uso de Computador
Uso de Computador é uma capacidade de IA, lançada publicamente pela Anthropic em outubro de 2024, que permite a um modelo de linguagem controlar a interface gráfica de um computador—movendo o cursor, clicando botões, digitando texto e lendo capturas de tela—para completar tarefas como um operador humano.
Uso de Computador refere-se à capacidade de um sistema de IA de perceber e manipular um computador desktop ou máquina virtual por meio da mesma interface gráfica que um humano usaria: observando a tela através de capturas de tela, emitindo eventos de clique de mouse e teclado e iterando até que um objetivo seja alcançado. Anthropic introduziu a capacidade como uma versão beta do Claude 3.5 Sonnet em outubro de 2024, marcando a primeira vez que um modelo de linguagem de propósito geral comercial foi explicitamente treinado e avaliado para interação GUI em escala de produção.
O loop técnico funciona da seguinte maneira: o modelo recebe uma captura de tela do estado atual da tela; ele raciocina sobre a próxima ação necessária; ele produz um comando de ação estruturado como um clique em coordenadas de pixel específicas, uma string digitada ou uma combinação de teclas; uma camada de execução fina aplica essa ação ao SO ou a uma máquina virtual em sandbox; a captura de tela atualizada alimenta de volta o modelo. Esse ciclo perceber-planejar-agir continua até que a tarefa seja concluída ou uma condição de erro seja detectada. O modelo opera em pixels visuais em vez de dados de DOM ou árvore de acessibilidade por padrão, tornando-o aplicável a qualquer GUI—incluindo aplicações legadas—sem trabalho de integração.
Uso de Computador é importante porque permite que IA opere software para o qual nenhuma API existe e realize fluxos de trabalho multietapas que abrangem várias aplicações. Abordagens anteriores de automação como RPA baseado em Selenium exigiam seletores de elemento predefinidos que quebravam quando UIs mudavam; um agente baseado em visão pode adaptar-se a mudanças de layout da maneira que um operador humano faz. Avaliações de benchmark em OSWorld e WebArena mostram desempenho significativo mas imperfeito—modelos em 2025 alcançaram aproximadamente 20–40% taxas de sucesso em tarefas complexas multietapas, com pontuações melhorando com cada geração sucessiva de modelo.
Em 2026, capacidades do tipo Uso de Computador são oferecidas por múltiplos fornecedores: Anthropic (Claude), OpenAI (Operator, lançado janeiro de 2025) e Google (Project Mariner). Aplicações empresariais incluem teste QA automatizado, entrada de dados em sistemas ERP legados e substituição de bots RPA frágeis. Desafios de segurança—particularmente evitar que conteúdo web malicioso sequestre o agente através de injeção de prompt incorporada em texto de página visível—permanecem uma área de pesquisa ativa.