One Useful Thing (Ethan Mollick)→ original

Сумерки чат-ботов: Opus 4.7 за $251 выполняет работу программиста на 2 недели

ИИ больше не чат-бот — он полноценный рабочий. Opus 4.7 от Anthropic в тесте Epoch AI автономно трудился 14 часов и создал ПО стоимостью 2–17 недель инженерного труда, потратив $251 на токены. Четверть сотрудников OpenAI уже управляют минимум четырьмя агентами еженедельно. Ключ к успеху — доменная экспертиза, а не умение кодить.

Processado por IA de One Useful Thing (Ethan Mollick); editado por Hamidun News
Сумерки чат-ботов: Opus 4.7 за $251 выполняет работу программиста на 2 недели
Fonte: One Useful Thing (Ethan Mollick). Colagem: Hamidun News.
◐ Ouvir artigo

Em 30 de junho de 2026, o professor da Wharton Ethan Mollick publicou uma análise que marca um ponto de virada: a era dos chatbots está chegando ao fim, substituída por agentes de IA autônomos capazes de trabalhar por horas sem a participação humana — e isso já está acontecendo dentro dos maiores laboratórios de IA.

O que os agentes são capazes de fazer hoje

O Opus 4.7 da Anthropic, em um estudo da Epoch AI, trabalhou de forma autônoma por 14 horas e criou um software cuja desenvolvimento levaria de 2 a 17 semanas para humanos. O custo: $251 em tokens.

  • Epoch AI (2026): Opus 4.7 trabalhou autonomamente por 14 horas — equivalente a 2–17 semanas de trabalho de engenharia por $251
  • Experimentos de Mollick: Claude Fable concluiu projetos técnicos complexos em 9 horas — algo em que uma equipe levaria uma semana inteira
  • METR e o AI Security Institute (Reino Unido) registram crescimento da autonomia da IA mais rápido do que qualquer previsão
  • OpenAI: um quarto dos funcionários da empresa gerencia pelo menos 4 agentes toda semana
  • O horizonte de trabalho contínuo da IA cresceu de 2 horas para 16+ horas por prompt em apenas alguns meses

Mollick enfatiza: os sistemas de IA ainda não passam em todos os testes, "mas estão inequivocamente melhorando em uma velocidade muito alta" — isso é confirmado por vários benchmarks independentes, incluindo o GDPval, que compara o desempenho da IA com o nível de especialistas humanos em diferentes setores.

Por que especialistas de domínio importam mais do que programadores

Um estudo interno da OpenAI revelou um padrão inesperado: o sucesso ao trabalhar com Claude Code não dependia do histórico profissional — advogados se saíam tão bem quanto desenvolvedores.

"Quanto mais experiência de domínio uma pessoa tem, mais ela usa com sucesso o Claude Code em sua área.

E — o que é ainda mais interessante — mais resultado útil ela obtém de cada prompt", afirma a análise de Ethan Mollick, citando dados da OpenAI.

Quando a escrita de código se torna uma tarefa do agente, as fronteiras profissionais se dissolvem: um advogado, médico ou analista financeiro passa a ter acesso às mesmas ferramentas que um desenvolvedor. A vantagem agora está com quem compreende profundamente sua própria área, e não com quem sabe programar. Para testar diferenças qualitativas, Mollick utilizou um teste não convencional: pediu aos modelos de IA que construíssem simulações interativas de um porto marítimo. Os modelos divergiram significativamente em design e julgamento — características que os benchmarks padrão não capturam.

Em paralelo, dois níveis de modelos se formaram. Os modelos fechados americanos (Anthropic, OpenAI, Google) estão no nível máximo de desempenho. Os modelos chineses de pesos abertos ficam 6–12 meses atrás, mas são significativamente mais baratos e estão disponíveis para implantação local.

Por que as empresas não conseguem acompanhar as mudanças

As instituições se movem na velocidade das pessoas — aprovações, comitês, trimestres. A IA melhora em uma exponencial não humana, e a lacuna aumenta a cada ciclo.

"A instabilidade é o que acontece quando instituições que se movem na

velocidade humana (ou, pior ainda, na velocidade de comitês) tentam acompanhar uma curva de capacidades que por sua natureza é completamente não humana", — Ethan Mollick, One Useful Thing.

No início de 2025, um agente de IA conseguia trabalhar autonomamente por cerca de 2 horas com uma alta taxa de erros. Em meados de 2026, já são 16+ horas por único prompt. As estratégias de IA escritas no final de 2024 descrevem hoje uma realidade obsoleta. Exemplos concretos incluem medidas regulatórias emergenciais em cibersegurança após um salto repentino nas capacidades da IA e oscilações bruscas no mercado de ações quando a IA ameaçou repentinamente os modelos de negócios de setores inteiros.

O que isso significa

Não estamos entrando em um período de transição antes de uma estabilização — estamos entrando em um estado permanente de aceleração. Quem vence é quem sabe atribuir tarefas aos agentes, avaliar seus resultados e possui profundo conhecimento em sua área profissional.

Perguntas frequentes

Quanto custa rodar um agente de IA em um projeto grande?

Segundo dados da Epoch AI, o Opus 4.7 executou o equivalente a 2–17 semanas de trabalho de engenharia por $251 em tokens. O custo final depende do modelo, da duração da tarefa e do número de prompts.

Qual a diferença entre um agente de IA e um chatbot?

Um chatbot responde a uma pergunta e aguarda a próxima. Um agente recebe uma tarefa, divide-a de forma independente em etapas, corrige erros ao longo do processo e trabalha por horas sem intervenção do usuário — é exatamente assim que funcionam o Claude Code da Anthropic e o Codex da OpenAI.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?

Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).

O que você acha?
Carregando comentários…