Segundo o The Information, a Amazon Web Services emitiu ordens internas de redução de custos em maio para as equipes de engenharia, orientando-as a reduzir o uso de recursos computacionais para garantir capacidade suficiente para a demanda futura dos clientes. Os engenheiros da AWS começaram a desligar servidores virtuais EC2 ociosos para liberar capacidade de CPU para clientes externos.
Um engenheiro interno da AWS observou que as solicitações de servidores com CPU, que antes levavam horas para ser atendidas, agora levam vários dias — um atraso sem precedentes em sua carreira. As Spot Instances com desconto da AWS, que podem ser interrompidas em até dois minutos, tornaram-se cada vez mais difíceis de obter nos últimos meses. A empresa atribuiu a oferta restrita ao aumento da demanda, embora tenha declarado que a capacidade contratada pelos clientes externos continua sendo atendida. O analista Jing Xie, da Elendil Labs, destacou que os aplicativos de agentes de IA estão impulsionando o aumento da demanda, com os gastos de TI per capita dos clientes dobrando devido à ampla adoção de agentes de IA para o desenvolvimento de software. A Intel divulgou, em abril, que a proporção entre CPU e GPU na inferência de IA era de 1:4; em julho, essa proporção havia se aproximado de 1:1, indicando um crescimento da demanda por CPU mais rápido do que o esperado.