Le fondateur de DeepSeek dit que la puissance de calcul est le plus grand écart entre l'IA de la Chine et celle des États-Unis
JAKARTA - Le fondateur de DeepSeek, Liang Wenfeng, a dit que les limites de la puissance de calcul étaient le plus grand écart entre l’IA chinoise et les États-Unis, et non un manque de talents ou de technologie.
Yicai Global a cité vendredi 23 juillet, citant l’évaluation qui figure dans le compte-rendu de la réunion des investisseurs pour le dernier tour de financement de DeepSeek. Cependant, ni Liang ni l’entreprise à Hangzhou n’ont confirmé l’étiquette de l’écrit.
« La plus grande différence entre nous et les États-Unis réside dans les ressources », a déclaré Liang, selon le communiqué.
Selon le document, Liang a associé les différences de talents, de capacités de modélisation et d'application de l'IA à l'inégalité des ressources informatiques.
La Chine fait également face à des restrictions sur l’achat d’unités de traitement graphique ou GPU sophistiquées. Ces restrictions découlent des contrôles à l’exportation des États-Unis qui limitent l’accès des entreprises chinoises aux puces AI les plus sophistiquées de Nvidia.
Le document indique également que les investissements chinois en IA sont plus petits que ceux des États-Unis, tandis que les salaires des professionnels de l'IA ne représentent qu'une part relativement faible des dépenses totales.
DeepSeek a attiré l’attention du monde entier en étant capable de développer des modèles de langage de grande envergure à moindre coût. L’entreprise a clôturé son premier tour de financement externe fin mai en collectant plus de 50 milliards de yuans, soit environ 7,4 milliards de dollars.
Le financement a été realisé avec une valorisation de l’entreprise avant l’investissement d’environ 367,5 milliards de yuans ou 54,3 milliards de dollars É.-U.
Les investisseurs impliqués incluent Tencent Holdings, Contemporary Amperex Technology, NetEase, JD.Com, IDG Capital et le National Artificial Intelligence Industry Investment Fund.
Liang a versé 20 milliards de yuans, le plus gros montant d’un investisseur dans ce tour.
DeepSeek-R1 lancé en janvier de l’an dernier a été nommé par l’investisseur de la Silicon Valley Marc Andreessen comme « le moment de Sputnik AI ». Ce terme est utilisé pour décrire une surprise technologique qui provoque une concurrence intense.
Selon un document consulté par Yicai, DeepSeek estime que sa capacité est encore de 12 à 18 mois en retard par rapport aux entreprises d’IA américaines de premier plan.
Cependant, l'entreprise affirme avoir obtenu des résultats comparables en utilisant seulement environ un dixième de la puissance de calcul de ses concurrents.
DeepSeek vise à réduire cette lacune à trois à six mois, même si l'accès aux puces sophistiquées est encore limité.
L’entreprise aurait des ressources informatiques équivalentes à environ 20 000 GPU Nvidia de la série H. La plupart du matériel a été reçu au cours des deux derniers mois.
Liang a dit que les plus grands modèles d’IA actuels ont environ 800 milliards de paramètres actifs. Alors que le modèle chinois le plus avancé n’a que des dizaines de milliards de paramètres, soit environ dix fois plus.
Les paramètres actifs sont une partie des paramètres du modèle utilisés lorsque l'IA traite une commande.
Selon Liang, DeepSeek n’a toujours pas été en mesure d’entraîner un modèle aussi grand, même si tous les nouveaux fonds ont été dépensés pour acheter de la puissance de calcul.
Le document indique également que DeepSeek travaille avec Huawei Technologies pour optimiser son modèle pour l’écosystème de calcul Ascend de Huawei.
DeepSeek utilise son propre langage de programmation, Tile Language, pour réduire la dépendance à CUDA.
CUDA est une plate-forme de programmation d'Nvidia largement utilisée pour exécuter le calcul AI sur les GPU.
Cette approche peut, selon les prévisions, augmenter l'efficience de l'inferential avec une baisse de performance de seulement 1 à 2 %.
L'infertilisation est le processus par lequel un modèle IA utilise les capacités qu'il a apprises pour produire des réponses ou des prédictions.
Le document indique que le Huawei 950 SuperPod est jugé comparable aux Nvidia GB200 et GB300 en termes de performance et de prix.
Les principaux obstacles sont législatifs, et non technologiques ou l’étanchée de l’écosystené. Selon le document, les problèmes écosystenées sont prévuément en grande partie solvable en un an.
Dans son plan technologique, DeepSeek estime que le voyage vers l’intelligence générale artificielle ou l’IA va passer par la raisonnement en chaîne, les agents IA, l’apprentissage continu et l’étape « singularité », lorsque les systèmes commencent à se développer eux-mêmes.
L'AGI est une IA conçue pour avoir des capacités de raisonnement général au niveau humain.
Le stade suivant est l'IA incarnée, c'est-à-dire l'intelligence artificielle qui interagit avec le monde physique via des robots ou des appareils.
DeepSeek place la création de vidéos et de modèles mondiaux en dehors de son cheminement principal de développement. Les modèles mondiaux sont des systèmes d'IA qui imite un environnement réel pour prédire des événements futurs.