Accueil IA ACTU Cerebras dévoile CS-4, un accélérateur d’IA livré dès ce trimestre

Cerebras dévoile CS-4, un accélérateur d’IA livré dès ce trimestre

0
Illustration du rack CS-4 et de ses trois modules de calcul sur tranche de silicium. Illustration éditoriale — conception : rédaction Actu IA; informations : Cerebras.

Cerebras annonce un système à trois processeurs géants sur tranche de silicium, conçu pour accélérer les réponses des grands modèles. Le fabricant promet jusqu’à 30 fois la vitesse de systèmes à GPU, mais une partie des résultats repose sur ses propres tests et projections.

Cerebras ouvre une nouvelle étape dans la course au matériel pour l’intelligence artificielle. La société américaine a présenté le 19 août CS-4, quatrième génération de son système d’accélération, dont les premières livraisons doivent commencer pendant le trimestre en cours. Chaque machine réunit trois processeurs WSE-3 Turbo construits à l’échelle d’une tranche entière de silicium, une approche différente des grappes de puces graphiques utilisées dans la plupart des centres de données.

Le constructeur affirme que CS-4 peut produire des réponses jusqu’à trente fois plus vite que des systèmes à GPU sur l’ensemble de modèles qu’il a testé. Pour les modèles dépassant dix mille milliards de paramètres, il annonce plus de 1 000 unités de texte par seconde grâce à une latence de communication entre tranches abaissée jusqu’à deux microsecondes. Les graphiques publiés combinent toutefois des mesures internes, des résultats attribués à Artificial Analysis et, pour certaines très grandes tailles, des extrapolations. Ils ne remplacent pas une comparaison indépendante menée sur des configurations et des coûts identiques.

La machine inaugure aussi une architecture de rack appelée Nexus. Les modules de calcul, d’alimentation et d’entrées-sorties ont été séparés pour faciliter l’assemblage et les mises à niveau. Cerebras indique que le bloc de calcul arrière comporte 50 % de composants en moins, recourt à 60 % d’automatisation industrielle supplémentaire et peut être installé en quelques heures au lieu de plusieurs jours. Le refroidissement liquide et la conversion électrique sont intégrés au plus près de la tranche afin de limiter les pertes.

CS-4 pourra partager le travail avec d’autres accélérateurs. Une plateforme AMD Helios ou AWS Trainium peut traiter la demande initiale, puis transférer l’état du modèle à Cerebras pour générer la réponse. Cette séparation vise les fournisseurs de cloud qui possèdent déjà plusieurs types de puces. La connexion passe notamment par Ethernet RoCE v2, tandis que des liens directs relient plusieurs systèmes sans commutateur intermédiaire.

Les données essentielles pour juger l’offre restent absentes de l’annonce : prix du rack, consommation électrique totale, disponibilité par pays, modèles réellement pris en charge au lancement et résultats obtenus par des clients indépendants. La promesse de dix fois plus de débit par watt que CS-3 concerne la génération précédente de Cerebras, et non une comparaison générale avec tous les GPU du marché. Les premières installations devront préciser la vitesse soutenue, le coût par réponse, les contraintes de refroidissement et les délais de déploiement à grande échelle. Elles diront aussi si l’architecture reste avantageuse quand le trafic varie et que les machines ne fonctionnent pas en permanence à pleine charge.

Cet article vous est proposé en collaboration avec Aïobi. Contact : team@aiobi.world