A Amazon Web Services e a Cerebras Systems anunciaram uma parceria estratégica para oferecer soluções de inferência de IA voltadas a aplicações de inteligência artificial generativa. O acordo, revelado nesta sexta-feira, promete acelerar significativamente o desempenho de chatbots, assistentes de codificação e outros serviços baseados em IA.
Como funciona a solução de inferência de IA
A tecnologia será implantada no Amazon Bedrock, dentro dos data centers da AWS, combinando servidores equipados com AWS Trainium, sistemas Cerebras CS-3 e rede Elastic Fabric Adapter. O processo de inferência foi dividido em duas etapas distintas: o “prefill”, que converte solicitações humanas em tokens compreensíveis pelos sistemas de IA, e o “decode”, responsável por gerar as respostas finais aos usuários.
Segundo informações divulgadas pelo TI Inside, David Brown, vice-presidente de Serviços de Computação e ML na AWS, afirmou que a velocidade ainda representa um gargalo crítico para aplicações exigentes como assistência de codificação em tempo real.








