蚂蚁百灵开源 Ling-3.0-tiny 模型,支持英伟达 DGX Spark、苹果 Mac mini 部署

2026-08-11 17:57 IT之家 - 潞源

IT之家 8 月 11 日消息,蚂蚁百灵今天在 Hugging Face 平台开源 Ling-3.0-tiny 模型,该模型为轻量级混合推理 MoE 架构,总参数 7.9B,每 Token 激活 1.3B 参数。官方提供 BF16、FP8 和 INT4 权重版本,适配不同平台的部署需求。

据介绍,Ling-3.0-tiny 主打低成本推理,采用高效混合线性架构,将 KDA(Kimi Delta Attention)和 MLA(Multi-Head Latent Attention,多头潜在注意力)按照 3:1 比例交替堆叠。采用包含 128 个路由专家(routed experts)的稀疏 MoE 前馈网络(FFN),在上下文处理能力和计算成本间取得平衡。

IT之家注意到,该模型支持快速响应模式和多步骤推理模式,专为本地部署设计,官方已在英伟达 DGX Spark、Apple Silicon MacBook 和 Mac mini 等电脑验证。在 M4 Pro 的 MacBook 上可达到约 86-90 Token/s 的推理速度,8K 上下文长度下,峰值内存占用约为 8.34 GiB。

参考:

广告声明:文内含有的对外跳转链接(包括不限于超链接、二维码、口令等形式),用于传递更多信息,节省甄选时间,结果仅供参考,IT之家包含外链的文章均包含本声明。

文章价值:
人打分
有价值 还可以 无价值
置顶评论
    热门评论
      文章发布时间太久,仅显示热门评论
      全部评论
      一大波评论正在路上
        取消 发送
        分享成功

        长按关注IT之家公众号
        阅读更多精彩文章

        查看更多原创好文
        软媒旗下人气应用

        如点击保存海报无效,请长按图片进行保存分享