Close Menu
    Facebook X (Twitter) Instagram
    Facebook X (Twitter) Instagram YouTube TikTok
    SantoTechSantoTech
    PODCAST
    • Inicio
      • Notícias
    • Tecnologia
    • Negócios
    • Oportunidades
    • Ciber
    • Ciência
    • Colunistas
    SantoTechSantoTech
    Home»Notícias»Tecnologia & Inovação»OpenAI apresenta chip próprio para acelerar o futuro dos agentes de IA

    OpenAI apresenta chip próprio para acelerar o futuro dos agentes de IA

    Tecnologia & Inovação 02/09/2026Brinsley AragãoPor Brinsley Aragão6 minutos de leitura
    santotech jalapeno chip

    A corrida pela inteligência artificial entrou em uma nova fase: não basta criar modelos mais capazes, também é preciso encontrar maneiras mais rápidas, baratas e eficientes de executá-los. É nesse cenário que a OpenAI apresentou resultados do Jalapeño, seu primeiro chip próprio desenvolvido especificamente para inferência de modelos de linguagem.

    O tema ganhou destaque no vídeo “Novo chip de IA da OpenAI chega com tudo e supera a NVIDIA”, publicado pelo canal AI Revolution em Português. A partir do conteúdo apresentado no vídeo e das informações técnicas divulgadas pela própria OpenAI, o que mais chama a atenção não é uma suposta substituição imediata da NVIDIA, mas a tentativa da empresa de controlar uma parcela cada vez maior da cadeia de computação necessária para manter serviços como ChatGPT, Codex e sua futura geração de agentes.

    O que é o Jalapeño

    O Jalapeño é um ASIC, ou seja, um circuito integrado desenvolvido para uma finalidade específica. Em vez de ser um acelerador genérico adaptado a diferentes cargas, ele foi projetado desde o início para executar inferência de grandes modelos de linguagem. Na prática, isso significa processar prompts e gerar respostas com menor latência, mantendo alto volume de trabalho por unidade de energia.

    A OpenAI afirma que o chip foi desenvolvido em parceria com a Broadcom e chegou da concepção ao tape-out em apenas nove meses. O projeto também contou com a participação da Celestica na integração de placas, racks e sistemas. De acordo com a empresa, a arquitetura foi pensada em conjunto com memória, rede, software e padrões reais de uso, evitando que o ganho de um componente seja perdido por gargalos de comunicação ou movimentação de dados.

    Os resultados divulgados pela OpenAI

    Nos testes apresentados pela OpenAI com o benchmark público InferenceX, da SemiAnalysis, o Jalapeño foi comparado a sistemas comerciais em diferentes pontos de operação. A avaliação considerou não apenas a velocidade máxima, mas também a latência percebida pelo usuário e a quantidade de trabalho útil entregue por watt.

    Segundo a publicação técnica da OpenAI, o Jalapeño alcançou entre 1,5 e 1,9 vez mais trabalho de IA por watt no pico de vazão e apresentou latência ponta a ponta entre 1,7 e 3,6 vezes menor que os sistemas de comparação. Em cargas altamente interativas, o ganho informado ficou entre 2,1 e 4,1 vezes. O chip tem potência nominal de 700 watts, enquanto o consumo sustentado permaneceu em 550 watts ou menos nos workloads avaliados.

    É importante fazer uma distinção que costuma se perder nas manchetes: dizer que o Jalapeño pode ser mais de 100 vezes eficiente em uma condição específica não significa que ele seja 100 vezes mais rápido. Essa diferença está relacionada à comparação de trabalho por quilowatt quando o sistema concorrente é pressionado em uma faixa de baixa latência, na qual sua eficiência energética pode cair bastante. O resultado é expressivo, mas precisa ser lido dentro das condições do teste.

    A arquitetura foi avaliada com modelos de perfis diferentes, como GPT-OSS 120B, DeepSeek R1 de 670 bilhões de parâmetros e Kimi K2.5 de 1 trilhão de parâmetros. A proposta é equilibrar as duas etapas principais da inferência: o prefill, que processa o prompt e exige bastante computação, e o decode, que gera a resposta token por token e depende mais da largura de banda da memória. A OpenAI também destaca o uso de memória local para o KV cache e de uma rede integrada ao sistema para reduzir deslocamentos desnecessários de dados.

    IA ajudando a construir a infraestrutura da própria IA

    Outro ponto relevante é que a OpenAI usou seus próprios modelos durante o desenvolvimento do chip. A empresa diz que a IA ajudou a explorar implementações, encurtar ciclos de projeto e verificação e otimizar circuitos aritméticos. O trabalho teria permitido concluir o tape-out em nove meses.

    A companhia também relata que utilizou o Codex com o GPT-Astra para adaptar três modelos de código aberto que não estavam no plano original de produção do Jalapeño. Em blocos selecionados de atenção e mistura de especialistas do GPT-OSS, as implementações geradas por IA teriam sido entre 1,5 e 1,8 vez mais rápidas que versões escritas por especialistas humanos. A ressalva é essencial: esses números valem para blocos específicos, não para o desempenho completo dos modelos.

    Na minha avaliação, esse é o aspecto mais simbólico da notícia. A IA está sendo usada para projetar o hardware que executará a próxima geração de IA e, ao mesmo tempo, para programar esse hardware. Se esse ciclo se mostrar sustentável, a competição deixará de acontecer somente entre modelos e passará a envolver toda a pilha: chips, memória, rede, software, datacenters e produtos.

    Anthropic e Alibaba também aceleram

    O vídeo do AI Revolution em Português também aborda novidades envolvendo a Anthropic e a Alibaba. No caso da Anthropic, surgiram especulações sobre modelos internos identificados pelos codinomes “Melon” e “Marshmallow”, associados a possíveis versões futuras do Claude. Como não se trata de um anúncio oficial consolidado, considero mais correto tratar essa parte como rumor, e não como lançamento confirmado.

    Já a frente da Alibaba tem dados públicos mais concretos. A equipe do Qwen anunciou o Qwen3.8-Flash e abriu os pesos do Qwen3.8-Flash-Next, apresentado como uma prévia da arquitetura que deverá influenciar a família Qwen4. O modelo suporta nativamente 262.144 tokens de contexto e pode ser estendido para 1 milhão de tokens com YaRN. A Alibaba afirma que o treinamento exige cerca de um nono do custo do Qwen3.7-Plus.

    O preço divulgado para o Qwen3.8-Flash também chama atenção: US$ 0,15 por milhão de tokens de entrada e US$ 0,47 por milhão de tokens de saída. Em um mercado no qual o custo de inferência pode definir a viabilidade de agentes e aplicações em larga escala, esse tipo de redução aumenta a pressão sobre todos os concorrentes.

    O que muda para o mercado

    O Jalapeño não elimina a necessidade de GPUs da NVIDIA. A própria OpenAI afirma que continuará usando aceleradores da NVIDIA e de outros parceiros tanto em treinamento quanto em inferência. O movimento parece mais estratégico: criar uma plataforma especializada para workloads nos quais latência, previsibilidade e eficiência energética têm impacto direto no custo operacional.

    Para quem usa serviços de IA, os benefícios esperados são respostas mais rápidas, agentes capazes de executar mais etapas sem longas esperas e maior disponibilidade em momentos de alta demanda. Para as empresas que oferecem esses serviços, cada ganho por watt pode significar mais usuários atendidos com a mesma infraestrutura e menor custo por tarefa.

    A OpenAI planeja começar a implantar o Jalapeño em sua infraestrutura de computação até o fim de 2026 e já menciona uma segunda geração em desenvolvimento. Ainda será necessário observar os resultados em produção, a disponibilidade do software e o desempenho em modelos que não foram escolhidos pela própria empresa. Mesmo assim, o anúncio mostra uma direção clara: a próxima batalha da IA será travada também dentro dos racks dos datacenters.

    Fontes e atribuição

    Este texto foi reescrito a partir do vídeo “Novo chip de IA da OpenAI chega com tudo e supera a NVIDIA”, do canal AI Revolution em Português, disponível em https://youtu.be/XZPQCgLtgAU?si=DR_VH_LSJfyn53FS.

    Alibaba Qwen Anthropic Chips de IA Claude inferência de IA inteligência artificial Jalapeño NVIDIA OpenAI Qwen3.8-Flash
    Compartilhar. Facebook Twitter Pinterest LinkedIn Email Telegram WhatsApp Copiar link
    Brinsley Aragão
    • Website
    • Facebook
    • X (Twitter)
    • Instagram
    • LinkedIn

    ☁️ Sysadmin por teimosia / 🚀 Transformando código em soluções! / 🎬 Amante de filmes da moda ou fora / ☕️ Viciado em café encomendado em loja estranha / 🍔 Apreciador de hambúrguer barato de rua

    Notícias relacionadas

    30/08/2026

    Agile Jampa 2026 reúne líderes de tecnologia em João Pessoa e coloca IA e produtividade no centro do debate

    24/08/2026

    Shadow IA: a adoção invisível de IA generativa que desafia a governança corporativa

    23/08/2026

    Cloudflare lança Kitesurf, navegador criado especificamente para agentes de IA

    banner site 300x250
    Siga nas redes
    • Facebook
    • Twitter
    • Instagram
    • YouTube
    • TikTok
    Em Destaque

    Brasil pode levar até 30 anos para compensar déficit de produtividade com jornada de 40 horas, aponta CNI

    Impulsiona RH e Lideranças reúne mais de 200 empresários e gestores em evento sobre pessoas e liderança na Paraíba

    Braskem Decide Pedir Recuperação Extrajudicial para Reestruturar US$10,9 Bi em Dívidas

    TikTok cria operação logística de R$ 111 milhões no Brasil e avança sobre o e-commerce

    © 2026 Santo Tech. por NIBWOZ.
    • Início
      • Notícias
    • Tecnologia
    • Negócios
    • Oportunidades
    • Ciber
    • Ciência

    Digite o que busca acima e tecle Enter para procurar ou tecle Esc para cancelar.