DeepSeek 创始人称计算能力是中国与美国人工智能的最大差距
雅加达 - DeepSeek创始人梁文锋表示,计算能力的局限性是中国人工智能与美国之间的最大差距,而不是人才或技术的不足。
Yicai Global于7月23日星期五援引,称该评估在DeepSeek最新一轮融资的投资者会议纪要中列出。然而,梁和杭州公司尚未确认文件的真实性。
“我们与美国之间的最大差距在于资源,”梁说,根据该文件。
根据该文件,梁将人才、模特能力和AI应用与计算资源不平等联系起来。
中国还面临着购买高端图形处理单元或GPU的限制。这些限制来自美国的出口管制,该管制限制了中国公司获得英伟达最先进的人工智能芯片的机会。
该文件还指出,中国的AI投资规模小于美国,而AI专业人员的工资仅占总支出的相对较小比例。
DeepSeek吸引了世界关注,因为它能够以更低的成本开发大型语言模型。该公司于5月底完成了其首次外部融资,筹集了超过500亿元人民币,约合74亿美元。
融资是在投资前估值约3675亿元人民币或543亿美元。
参与的投资者包括腾讯控股、当代电池技术、网易、京东、IDG Capital和国家人工智能产业投资基金。
梁将200亿元人民币存入,这是该轮融资中最大的投资者。
DeepSeek-R1于一年前的1月推出,被硅谷投资者Marc Andreessen称为“人工智能斯普特尼克时刻”。这个词通常用来描述引发重大竞争的技术冲击。
根据Yicai看到的一份简报,DeepSeek认为其能力仍落后于美国领先的AI公司约12至18个月。
然而,该公司声称,它只使用其竞争对手的十分之一的计算能力就能获得与之相当的结果。
DeepSeek的目标是将这一差距缩短到三到六个月,尽管获得先进芯片的机会仍然有限。
该公司拥有大约20,000台Nvidia H系列GPU的计算资源。大部分硬件在过去两个月内收到了。
梁说,目前最大的AI模型有大约8000亿个活动参数。而中国最先进的模型只有几十亿个参数,大约是其十倍。
激活参数是模型参数的一部分,在 AI 处理命令时使用。
根据梁的说法,DeepSeek仍然无法训练如此大的模型,即使它花费了所有新资金来购买计算能力。
该白皮书还提到,DeepSeek正在与华为技术有限公司合作,为华为的Ascend计算生态系统优化其模型。
DeepSeek 使用自己开发的编程语言 Tile Language 来减少对 CUDA 的依赖。
CUDA 是 Nvidia 的编程平台,用于在 GPU 上运行 AI 计算。
这种方法据称可以提高推理效率,性能下降仅为1%到2%。
推断是AI模型使用已学习的能力来产生答案或预测的过程。
该白皮书称,华为950 SuperPod在性能和价格方面与Nvidia GB200和GB300相当。
主要障碍被认为是生产能力,而不是技术或生态系统成熟度。根据该文件,生态系统问题预计将在一年内解决。
在其技术路线图中,DeepSeek表示,它认为通往通用人工智能或AGI的旅程将通过链式推理,AI代理,持续学习和“奇点”阶段,系统开始自我发展。
AGI 是设计具有人类水平一般推理能力的人工智能。
下一个阶段是实体化的人工智能,即通过机器人或设备与物理世界互动的人工智能。
DeepSeek 将视频制作和世界模型置于其主要开发轨道之外。世界模型是一种模仿真实环境的 AI 系统,用于预测未来事件。