如何打造TTRL测试时强化学习+Memory的Agent,做经验时代AI的主人。| 最新
编者按:AI能像人类一样不断从经验中学习、进化,而不仅仅依赖于人工标注的数据?测试时强化学习(TTRL)与记忆系统的结合正在开启这一全新可能!本文深度解析了这项突破性技术如何让AI实现自我监督学习,在
阅读全文编者按:AI能像人类一样不断从经验中学习、进化,而不仅仅依赖于人工标注的数据?测试时强化学习(TTRL)与记忆系统的结合正在开启这一全新可能!本文深度解析了这项突破性技术如何让AI实现自我监督学习,在
阅读全文近期,打造出全球首个AI软件工程师 Devin 的 Cognition 团队,又一次放出“大招”:他们开源了一个名为 DeepWiki 的项目,旨在自动生成 GitHub 项目的可读性极强的文档页面,
阅读全文👆👆👆重要提醒!微信推荐机制大幅调整,大家务必将我们公众号设为★星标,否则很可能看不到推送了......时间很快就要走到 5 月,Google I/O 2025 也已悄然进入倒计时。这场科技圈最具影响
阅读全文(点击上方图片进入商城)干净整洁的家就像一个温暖的怀抱,尤其是所有衣物、物品摆放得井井有条,让人一踏入就感受到无比的舒适和放松。但是很多朋友都搞不定衣物被子收纳的问题,每次一到换季,都很发愁。尤其是租
阅读全文👆👆👆重要提醒!微信推荐机制大幅调整,大家务必将我们公众号设为★星标,否则很可能看不到推送了......2025上海车展,问界成为流量C位,来往观众熙熙攘攘,好不热闹。在赛力斯智能安全发布会上,赛力斯
阅读全文👆👆👆重要提醒!微信推荐机制大幅调整,大家务必将我们公众号设为★星标,否则很可能看不到推送了......虽然现在和大家聊空调的话题有些早了,不过就南方今年的情况来看,恐怕“入夏”已经近在咫尺了,国内的
阅读全文Abstract高质量的监督微调(SFT)数据对于激发预训练大型语言模型(LLM)的强大能力至关重要。通常情况下,指令会与从其他 LLM 中采样的多个响应配对,而这些响应往往偏离了要微调的目标模型的
阅读全文©PaperWeekly 原创 · 作者 | 苏剑林单位 | 科学空间研究方向 | NLP、神经网络不知道大家有没有留意到前段时间的《Transformers without Normalizatio
阅读全文多模态大模型(MLLMs)在视觉理解与推理等领域取得了显著成就。然而,随着解码(decoding)阶段不断生成新的 token,推理过程的计算复杂度和 GPU 显存占用逐渐增加,这导致了多模态大模型推
阅读全文背景:长上下文视频生成的挑战目前的视频生成技术大多是在短视频数据上训练,推理时则通过滑动窗口等策略,逐步扩展生成的视频长度。然而,这种方式无法充分利用视频的长时上下文信息,容易导致生成内容在时序上出现
阅读全文在大模型时代,数据质量决定了一切。但在资源受限的边缘设备上,高效的语言模型(Edge LMs)更是依赖于高质量的数据。如何在海量数据中筛选出最优子集,让小模型也能大放异彩?近日芯片巨头英伟达联合 La
阅读全文4月25日,Create2025百度AI开发者大会在武汉举办。百度创始人李彦宏发布了文心大模型4.5 Turbo及深度思考模型X1 Turbo两大模型,以及多款AI应用。百度首席技术官王海峰现场详细解
阅读全文机器之心报道编辑:Panda近些年,AI 领域的技术不断快速迭代,各种新名词层出不穷,MoE、强化学习、智能体、computer-use、A2A…… 对没有技术背景的普通用户来说,这些名词和技术概念无
阅读全文机器之心报道机器之心编辑部最近,独角兽 AI 公司 Cognition AI(Cognition Labs)推出了一个开源项目——DeepWiki,旨在为 GitHub 上的公共代码仓库生成 AI 驱
阅读全文论文有两位共同一作。郑凯文为清华大学计算机系三年级博士生,何冠德为德州大学奥斯汀分校(UT Austin)一年级博士生。扩散模型(Diffusion Models)近年来在生成任务上取得了突破性的进展
阅读全文本文由上海人工智能实验室,悉尼大学,牛津大学联合完成。第一作者周恒为上海 ailab 实习生和 Independent Researcher 耿鹤嘉。通讯作者为上海人工智能实验室青年科学家白磊和牛津大
阅读全文Scaling Law 走到尽头了吗?扩散模型会成为主流吗?通用 Agent 还有多久会来?作者丨郑佳美、梁丙鉴编辑丨马晓宁自 GPT-4 发布至今已有两年,但对大语言模型的研究并没有放缓,我们仍处在
阅读全文前言哈喽,AI 安全工坊的伙伴们。 咱们搞 AI+网络安全的,是不是经常有这种感觉:明明是前沿阵地,找个趁手的“兵器”(工具、数据集、论文)却像是在信息汪洋里捞针? 时间哗哗流走,焦虑蹭蹭上涨?我对此
阅读全文欢迎收看最新一期的 Hunt Good 周报!在本期内容你会看到:9 条新鲜资讯5 个有用工具1 个有趣案例4 个鲜明观点Hunt for News|先进头条🤯 o3 猜照片位置走红网络,程序员:超现
阅读全文DeepSeek R2细节流出,参数直接飙到1.2万亿,还把成本砍到了骨折价!刚刚,一份来自韭研公社的爆料刷屏了整个AI圈——DeepSeek R2被曝即将发布,参数规模达到惊人的1.2万亿,并首次采
阅读全文鱼羊 一水 发自 凹非寺量子位 | 公众号 QbitAI如果有这么一个人,写下这样的复杂公式,并声称是受女神梦中启发所得,大家伙儿通常会送他两个字:民科。但当这个人一生中数千次写下类似的数学公式和命题
阅读全文编辑部 整理自 凹非寺量子位 | 公众号 QbitAI今年是AI应用创业最好的时期。在第三届AIGC产业峰会上,不到2年时间在AI PPT赛道做到NO.1的赵充如是说。原因有三:1)DeepSeek带
阅读全文RealSyn团队 投稿量子位 | 公众号 QbitAI新的亿级大规模图文对数据集来了,CLIP达成新SOTA!格灵深瞳最新发布的高质量数据集RealSyn,不仅规模大——包含1亿组图文对,而且每张图
阅读全文universea 投稿量子位 | 公众号 QbitAI自主通才科学家(AGS)正成为现实!来自多伦多大学、IIT、清华大学、浙江大学、罗格斯大学、哈佛大学、佐治亚理工学院和伦敦大学学院的跨学科团队的
阅读全文大家好,我是HxShine!今天分享一篇来自清华大学和上海人工智能实验室的文章,标题为 TTRL: Test-Time Reinforcement Learning(测试时强化学习)。这篇文章探讨了
阅读全文整理 | 傅宇琪、褚杏娟 小米被曝要求员工日均工时不低于 11.5 小时;小红书宣布取消员工大小周、竞业;传百川智能重大组织结构变化,老班底所剩无几,多位核心高管变动;传 Manus 母公司完成超 5
阅读全文整理 | 核子可乐、褚杏娟 近期, Claude Code 迎来一次品牌危机。据报道,部分是 Anthropic 向一位试图对 Claude Code 进行逆向工程的开发者发出了下架通知,而 Clau
阅读全文新智元报道 编辑:Aeneas 犀牛【新智元导读】o3看照片识位置的功能,简直令人毛骨悚然!Django Web大神Simon Wilson发现,o3凭借Python代码,就能破解自己照片的地理
阅读全文