.hd-box .hd-fr

阿里达摩院发布全球最大 AI 预训练模型 M6:参数跃迁至 10 万亿

2021-11-08 20:04IT之家(潇公子)23评

IT之家 11 月 8 日消息,今天,阿里巴巴达摩院公布多模态大模型 M6 最新进展,其参数已从万亿跃迁至 10 万亿,成为全球最大的 AI 预训练模型。

M6 是达摩院研发的通用性人工智能大模型,拥有多模态、多任务能力,尤其擅长设计、写作、问答,在电商、制造业、文学艺术、科学研究等领域有广泛应用前景。

与传统 AI 相比,大模型拥有成百上千倍“神经元”数量,认知和创造能力也更胜一筹,被普遍认为是未来的“基础模型”。但大模型的算力成本相当高昂,训练 1750 亿参数语言大模型 GPT-3 所需能耗,相当于汽车行驶地月往返距离。

今年 5 月,通过专家并行策略及优化技术,达摩院 M6 团队将万亿模型能耗降低超八成、效率提升近 11 倍。

10 月,M6 再次突破业界极限,使用 512 GPU 在 10 天内即训练出具有可用水平的 10 万亿模型。相比去年发布的大模型 GPT-3,M6 实现同等参数规模,能耗仅为其 1%。

▲ 将 10 万亿参数放进 512 张 GPU

模型扩展到千亿及以上参数的超大规模时,将很难放在一台机器上。

为了帮助多模态预训练模型进行快速迭代训练,达摩院在阿里云 PAI 自研 Whale 框架上搭建 MoE 模型,并通过更细粒度的 CPU offload 技术,最终实现将 10 万亿参数放进 512 张 GPU:

此外,针对训练效率问题,M6 团队设计了 Pseudo-to-Real(共享解除)机制,即利用训练好的共享参数模型初始化大模型,让收敛效率进一步提升 7 倍,解决大模型训练速度慢的问题。

对比不使用该机制,预训练达到同样 loss 用时仅需 6%;和此前万亿模型相比,训练样本量仅需 40%。

作为国内首个商业化落地的多模态大模型,M6 已在超 40 个场景中应用,日调用量上亿。

今年,大模型首次支持双 11,应用包括但不限于:

▲ M6 设计的飞行汽车

未来,M6 将积极探索与科学应用的结合,通过 AI for science 让大模型的潜力充分发挥,并加强 M6 与国产芯片的软硬一体化研究。

目前,达摩院联合阿里云已推出 M6 服务化平台(https://m6.aliyun.com),为大模型训练及应用提供完备工具,首次让大模型实现“开箱即用”,算法人员及普通用户均可方便地使用平台。

广告声明:文内含有的对外跳转链接(包括不限于超链接、二维码、口令等形式),用于传递更多信息,节省甄选时间,结果仅供参考,IT之家所有文章均包含本声明。

下载IT之家APP,分享赚金币换豪礼
相关文章
大家都在买广告
热门评论
查看更多评论