百灵Ling & Ring 2.6技术报告发布:面向真实Agent工作流的高效万亿级模型
不久前,我们陆续发布并开源了百灵 2.6 系列模型,包括 Ling-2.6-flash、Ling-2.6-1T 和 Ring-2.6-1T。今天,我们正式发布 Ling & Ring 2.6 Tech
阅读全文不久前,我们陆续发布并开源了百灵 2.6 系列模型,包括 Ling-2.6-flash、Ling-2.6-1T 和 Ring-2.6-1T。今天,我们正式发布 Ling & Ring 2.6 Tech
阅读全文从传感材料、器件设计,到信号处理、系统集成与数据分析,下一代传感技术正在深刻改变医疗健康、环境监测、智能制造、基础设施等关键应用场景。面向这一快速演进的前沿领域,施普林格·自然于 2026 年推出全新
阅读全文预训练语料的价值,可能不只取决于文本质量,还取决于它在 Web 网络里的位置。大模型预训练一直在筛数据。过去筛的是文本本身:干不干净,重复不重复,质量高不高,属于哪个领域。普林斯顿陈丹琦组这篇新作,把
阅读全文生成式奖励模型(Generative Reward Model,GRM)通过思维链(Chain-of-Thought,CoT)提示增强大语言模型(LLM)的推理能力,但其现有实现面临效率低下与奖励信号
阅读全文几篇 AutoResearch 论文刷屏之后,真正值得打开的 SKILL.md 终于放出来了。过去几周,很多人都在关注陈德里的 AutoResearch SKILL。最早让它出圈的,是一篇由他和两个
阅读全文即使 SFT(Supervised Fine-Tuning,监督微调)训练已收敛、loss 已平稳、所有超参都调无可调,你的模型在训练集上重新测试——仍然有平均 15.3% 的样本答不对。这不是过拟合
阅读全文一个基于 Qwen2.5-Coder-3B 的小模型,靠后训练在 AIME26、LiveCodeBench v6 等可验证任务上冲到前沿模型附近。3B 参数,本来应该是小模型的舒适区。能本地跑,成本低
阅读全文无需里程计、无需轨迹规划,仅凭一台单目相机和一个端到端神经网络,把「所见」直接变成「所动」——让无人机像猛禽穿林一样,看一眼便侧身钻过比自己还窄、且朝向未知的缝隙。苍鹰俯冲穿过树干间的缝隙时,从不会在
阅读全文采用 Gemini-2.5/3.1-Pro API,通过“结构化剧本+证据链”生成 10 万条训练数据,VITA-1.5-7B、Qwen2.5-Omni-7B、Qwen3-Omni-30B 模型在 O
阅读全文今天的大语言模型,可能一直活在"只顾眼前"的诅咒里。Next-Token Prediction(NTP)无疑是一个英雄。它与 Transformer 一起,开启了大模型时代。每一步只预测一个 toke
阅读全文956 篇 CVPR Highlight 显示,好摘要和好引言并不是凭感觉写出来的。为什么要单独研究 abstract 和 intro?因为这两段很大程度上决定了审稿人会先如何理解你的故事和亮点。这两
阅读全文想象一个桌面 Agent 正在替你整理表格、配置浏览器、修改 VS Code workspace。它既能像人一样点击界面,也能直接调用工具完成结构化操作。这听起来像是一个更强的 Agent:看到按钮就
阅读全文模型权重之外,Agent 的上下文、工具、记忆、失败修复和源码更新,正在成为新的能力来源。现在看一个 Agent 强不强,已经不能只看它背后的模型。它能看到哪些上下文,能调用哪些工具,动作如何被约束,
阅读全文引言当 Agent 开始自主调用工具、执行多步任务,安全风险的防御就不再只是一句简单的 Prompt 拦截。工程团队面临的核心挑战是:如何高效、可控地将安全规范对齐到 Agent 的复杂执行轨迹中?传
阅读全文不改注意力形式、不做推理后压缩,只让 K 和 V 共享投影,KV Cache 就能少掉一半。Transformer 的 Q、K、V 三套投影,早已是注意力机制的默认配置。Q 负责发起查询,K 负责匹配
阅读全文本文在大模型 Agent 上观察到了社会心理学中反复验证过的行动者-观察者不对称现象,并构建了 AFB 基准来量化这一偏见。我们提出 ReTAS 模型,借助费希特辩证法的「正题、反题、合题」三步推理,
阅读全文Transformer 擅长并行训练,RNN 擅长固定记忆。MIT 这项工作试图把两者接到一起。RNN 真的输给 Transformer 了吗?过去几年,序列建模的主角几乎一直是 Transforme
阅读全文RepoZero 是首个能够全自动、可验证、可扩展评估大语言模型从零开始生成完整代码仓库能力的基准测试系统。这项由北京大学与百度合作的研究成果,重新定义了 AI 代码生成的评估标准。论文标题:Repo
阅读全文PaperWeekly × 星弧 STARC 科研觉醒AI前沿讲座 直播主题 从攻击机理到防御之道:一场关于"可信机器学习"的深度对话 直播嘉宾 张景锋复旦大学可信具身智能研究院副教授 直播时间 2
阅读全文一组 10T tokens 控制实验显示,纯代码能稳稳提升编程能力,却不一定带来更强复杂数学推理。过去几年,大模型训练里有个很常见的判断:多喂代码,模型会更会推理。这个判断听起来很顺。代码有语法、有结
阅读全文从几十个 3D 关节点出发,AI 正在绕开人脸与外观,重新定义行人重识别的技术边界。在安防监控、医疗健康和具身智能等场景中,目标身份的精准识别始终是机器视觉领域的核心技术。传统方法高度依赖外观或面部特
阅读全文当存储器“变软”:从结绳记事到液态金属,柔性存储开启人机融合新路径Flexible Memory: Progress, Challenges, and Opportunities扫描二维码阅读原文ht
阅读全文如果一个模型能读论文、跑实验、做 Poster、处理报告视频,它离“科研助手”还有多远?现在很多自动化科研项目里,默认选择仍然是 Opus、GPT 这类闭源旗舰模型。倒不是大家迷信海外模型,而是科研任
阅读全文近日,浙江大学计算机学院、经济学院、区块链与数据安全国家重点实验室联合阿里云发布综述论文《Token Economics for LLM Agents: A Dual-View Study from
阅读全文AI 画图终于不只停在 PNG 了:生成之后,还能继续变成可编辑 SVG。现在让 AI 先画一版论文配图,已经不算难事。方法图、架构图、poster 配图,给模型一段说明文本,往往能出一张看起来不错的
阅读全文点亮👆“☆”星标,不错过推送内容~2026年,美团技术团队数十篇论文被 ACL、SIGIR、ICML、KDD 等顶会收录,我们近期将精选 32 篇文章,分成 5 大专场进行解读。内容涵盖大模型推理、智
阅读全文这篇论文给出一个数据中心视角:大模型更强,不只因为能表示更多,也因为更能保留长尾任务。大模型为什么比小模型强?参数更多、数据更多、算力更多,模型能力也随之提高,似乎已经成了过去几年大模型发展的稳定经验
阅读全文不动损失函数、不加参数、不做最优传输,仅仅换掉一个集合的定义,跨分词器蒸馏在 12 个评测格子上全部刷新——中科大团队提出 SimCT,把跨分词器蒸馏的天花板抬到了新的位置。On-Policy Dis
阅读全文多 Agentic 工作流正在从推理时协作走向统一训练,TeamTR 用信任域约束给出了稳定微调方案。多智能体 LLM 系统正在从多智能体辩论(Multi-Agent Debate)走向“智能体工作流
阅读全文