首个小时级实时交互的世界模型来了!无限世界,触手可及
当我们谈论“世界模拟”时,脑海中浮现的或许是精心设计的游戏关卡,或是影视作品中宏大的虚拟场景。然而,如果有一个系统,能够根据你的指令,实时、无限地生成一个视觉连贯、可交互的生动世界,并且这个世界能够持
阅读全文当我们谈论“世界模拟”时,脑海中浮现的或许是精心设计的游戏关卡,或是影视作品中宏大的虚拟场景。然而,如果有一个系统,能够根据你的指令,实时、无限地生成一个视觉连贯、可交互的生动世界,并且这个世界能够持
阅读全文导读:刚说过的偏好,AI 下次就忘;反复强调的禁忌,它还是照犯。NapMem 的转折在于:它不再把记忆当成几条检索结果,而是让模型主动在用户画像、主题轨迹、记忆记录和原始对话之间查证。更有意思的是,拉
阅读全文AI深入生产核心,用户端的发展方向已十分清晰,智能体将全面渗透产业。长远来看,智能体将演变为类似“AI操作系统”的复杂系统。用户只需下达任务,系统便能自动将任务拆解并协同多个智能体共同完成。可见技术底
阅读全文一台机器人在厨房里准备早餐,它需要从碗中取出面包片放入烤面包机,再将两个小碗叠放到盘子上。这看似简单的任务,却要求机器人具备精准的抓取、稳定的放置、以及多步骤的逻辑规划能力。在实验室的模拟环境中,它或
阅读全文记忆张量MemTensor WAIC 2026 专题论坛嘉宾阵容正式公布。7 月 17 日,记忆张量MemTensor 将在 WAIC 2026 现场,上海世博展览馆 9 号会议室举办《从一次性 Ag
阅读全文在智能助手、实时翻译或客服对话等场景中,用户期望与多模态大模型进行如同真人般的流畅交流:用户一边说话,模型一边理解并生成语音回复,用户甚至可以在模型回复过程中随时打断。这种实时、多轮、支持打断的交互模
阅读全文> 本文转载自「HAMi 社区」 HAMi 晋升 CNCF Incubating 项目2026 年 7 月 2 日,HAMi 正式晋升为CNCF Incubating(孵化) 项目,CNCF 技术监督
阅读全文> 作者:北辰昨天我收到一封 Google Scholar Alerts 邮件,标题是:The Effect of Forecasting and Budgeting Practices on Lon
阅读全文> 本文来自社区投稿导读领域任务不只是缺一个更大的模型。在金融风控、医疗、企业知识库、城市智能和个人设备等场景中,系统既需要大模型的通用知识与推理能力,也需要小模型贴近本地数据、业务流程和部署资源。但
阅读全文> 作者:李剑锋导读:如果你也经常需要讲课、汇报、答辩、面试,或者写一些希望别人认真读完的文章,那么 MIT 经典课程 How to Speak 就非常值得一看。它讲的并不只是“如何演讲”,而是如何把
阅读全文> 本文来自社区投稿摘要设想一条商品 AI 口播视频:主播得是指定的那张脸,手里的商品不能变形,嘴型要跟着声音走,表情和身体节奏也要自然,动作还得严格服从给定的 pose,最后整段画面还要和文本描述对
阅读全文图片由 AI 生成摘要在智能客服、多轮对话等场景中,大语言模型需要处理不断累积的对话历史。为了提升效率,系统通常会缓存历史对话对应的键值对(KV Cache),避免重复计算。然而,随着对话轮次增加,历
阅读全文最近 AI 编程圈里,一个词又开始刷屏了 — Loop Engineering。 Claude Code 的创始人 Boris Cherney 和 OpenClaw 之父 Peter Steinber
阅读全文在学术会议、商业路演或内部汇报中,一份优秀的PPT是成功沟通的关键。然而,从零开始制作一份既专业又符合个人风格的PPT,往往需要耗费大量时间和精力。尽管现有的AI工具已经能够根据文本生成幻灯片,但它们
阅读全文> 本文编译自外网把 SQL parser 重写一遍这种重活儿,听起来不该让 Agent 去干。因为Parser 是典型的"一个字符都不能错"的东西。PostHog 里尤其如此:用户直接写 SQL 查
阅读全文> 本文来自社区投稿视频生成模型(Video Generative Models)是近年最炙手可热的方向。从 Sora、Veo 到 Kling、Seedance,它们能生成以假乱真的画面,对时间动态与
阅读全文> 作者:李剑锋上一篇我们已经完成了视觉大模型的基础概念、环境配置和 Qwen3-VL 调用实战。接下来这一篇会继续沿着工程落地链路往后走,重点放在数据集准备、LoRA 微调、adapter 推理、模
阅读全文SMARTFLOW AI · 前沿洞察OpenAI 把刀,捅向了英伟达的定价权2026 年 6 月 24 日 · OpenAI×Broadcom Jalapeño · 共 7 节一家做模型的公司,开始
阅读全文在电影制作、广告创意或在线教育中,我们或许都曾有过这样的体验:输入一段文字描述,满怀期待地等待AI生成一段视频。传统的视频生成模型,如Sora、Veo等,通常以"离线、一次性"的方式工作:用户提交提示
阅读全文当我们在家中拿起一个杯子,走向水槽并冲洗它时,这一系列看似简单的动作背后,涉及了复杂的感知、推理和规划能力。对于旨在与物理世界交互的智能体而言,这些被称为具身能力的技能至关重要。如今,多模态大语言模型
阅读全文周末冲浪的时候,偶然发现一个开源的 Harness Engineering 教程,点进去一看——惊了。完全遵守 OpenAI 和 Anthropic 大厂的原意,没有自己胡编乱造,所有的概念、框架、实
阅读全文> 本文来自社区投稿逻辑智能团队关于低资源语言 TTS 的研究论文被机器学习顶级会议 ICML 2026 接收。该工作证明,即使真实语音数据稀缺,合成数据也能训练出稳定、自然、可克隆的语音模型。作者丨
阅读全文> 本文来自社区投稿引言GTA-2 将智能体评测从原子级工具调用扩展到长程开放式工作流,在结果导向的评估框架下,统一衡量模型能力与执行框架(agent harness)的系统级表现。实验发现前沿模型工
阅读全文> 作者:李剑锋1. 前言在前面的课程中,我们已经围绕大模型的使用与优化,学习了提示词设计、RAG 知识库问答、监督微调、模型部署以及模型测评等内容。通过这些内容,我们其实已经逐步建立起了一条比较完整
阅读全文> 作者:北辰这两天听了 Nathan Lambert 对 Finbarr Timbers 的访谈《Frontier Post-Training Recipe Review》[1],访谈中,两人一起回
阅读全文> 本文转载自「司南评测体系」通用具身操作模型的竞争,正在从“谁的总分更高”,走向“谁的能力结构更完整”。今年 4 月,上海人工智能实验室(上海AI实验室)推出了面向具身操作模型的仿真评测框架 EBe
阅读全文在当今的大语言模型推理部署领域,我们常常面临一个效率瓶颈。当你向模型输入一个提示词,等待它生成下一个词元时,传统的执行方式(如PyTorch)会为模型中的每一个算子(如线性层、注意力层、归一化层)单独
阅读全文来源 | InfoQ 作者 | AICon 全球人工智能开发与应用大会 策划 | 李忠良编辑 | 宇琪AI 代码生成率冲到 50%以上,研发周期却没变短;非研发人员开始用 Vibe Coding 写软
阅读全文