蚂蚁百灵Ling-3.0-flash正式开源
创始人
2026-08-08 16:02:24
0

智通财经APP获悉,蚂蚁百灵新一代原生混合推理模型Ling-3.0-flash已正式开源。Ling-3.0-flash采用124B总参数、5.1B激活参数的MoE架构。它保留了千亿参数模型的知识与能力容量,但在生成每个Token时,只激活其中约5.1B参数,从而降低单次推理的计算开销。

开发者既可以直接调用模型,也可以自由验证、部署和定制模型能力,将Ling-3.0-flash接入自己的业务系统、开发工具链和Agent工作流。据悉,Ling-3.0-flash提供三种不同的落地选择:

API调用,让Agent应用快速上线:面向希望快速接入、无需自建推理服务的开发者,Ling-3.0-flash可通过云端API直接调用;

单机私有化,让数据留在本地:面向数据不能出域的企业和团队,MXFP4与INT4版本可在单台NVIDIA DGX Spark上完成端到端推理;

高性能部署,释放极致单请求速度:面向单请求时延敏感的高性能服务,在指定GPU测试配置下,平均输出速率突破1100 tokens/s。

在AA Intelligence Index 榜单中,Ling-3.0-flash每项任务的加权平均调用成本约为0.04美元,加权平均解码时间约为1.4分钟,同时进入“智能水平—任务成本”和“智能水平—任务耗时”的优势区域。

Ling-3.0-flash 通过单机部署降低了私有化应用的起步门槛;而对于单请求时延更加敏感的实时业务,Ling-3.0-flash通过高性能GPU与推理栈的深度协同,进一步压缩生成等待,为实时Agent、多轮工具调用和连续任务执行提供更低延迟的运行体验。

相关内容

热门资讯

上海闵行前湾绿建二星认证新房项... 在总价700-800万元的预算下,关注上海闵行前湾绿建二星认证新房的家庭,既看重节能健康性能,也看重...
OpenAI推出新一代大语言模... OpenAI最新的重要大语言模型GPT-6 Astra正式发布。该公司表示,这款模型在网络安全、专业...
原创 快... 埃隆·马斯克又一次抛出了惊世骇俗的判断,他在公开场合大胆预测:未来十年,全球人形机器人数量有望突破1...
“招聘大集”设起劳动保障监察专... “签了合同,单位不给个人怎么办?”“迟到一次罚50元买水果,算不算克扣工资?”“劳务派遣不给交社保该...
昨日!德普之星私人局透视,hh... 昨日!德普之星私人局透视,hhpoker到底可以作弊码,总是真的有挂(有挂秘籍)1、hhpoker到...
在玩家背景下!竞技联盟辅助,p... 在玩家背景下!竞技联盟辅助,pokemmo手机脚本,真是是真的有挂(有挂细节)1、游戏颠覆性的策略玩...
科沃斯IFA 2026官宣成为... IT之家 9 月 5 日消息,科沃斯(ECOVACS)在 IFA 2026 期间宣布公司已成为全球第...
据相关数据显示!德州之星扫描器... 据相关数据显示!德州之星扫描器,hhpoker德州挂真的有吗,果然确实有挂(确实有挂)1、完成hhp...
从氦-3到水冰,月球上到底藏着... 在刚刚闭幕的深空探测国际会议上,我国正式启动国际地月立方星座大科学计划,立体组网开展月球资源勘探等工...
原创 从... 文/咩小胖 每年的开学季,关于新生名字的热度都会持续一段时间,也引发大家对名字的广泛讨论。 今年的小...