不需要精确描述的文本提示词,即可实现“导演级”多镜头运镜克隆!快手清北联合提出视频生成新框架OmniDirector
在电影制作中,导演通过精妙的镜头语言——推、拉、摇、移、跟,来讲述故事、烘托氛围。如今,AI视频生成技术正试图掌握这门艺术,但如何让AI像导演一样,精准地“克隆”一段参考视频中的复杂运镜,并将其无缝应
阅读全文在电影制作中,导演通过精妙的镜头语言——推、拉、摇、移、跟,来讲述故事、烘托氛围。如今,AI视频生成技术正试图掌握这门艺术,但如何让AI像导演一样,精准地“克隆”一段参考视频中的复杂运镜,并将其无缝应
阅读全文在现实世界中,一个为软件开发人员设计的智能体,可能需要面对代码库从Python迁移到Go、依赖版本不断升级、API接口持续演变的挑战。一个长期陪伴用户的个性化助手,需要理解用户从“喜欢咖啡”到“最近改
阅读全文图片由 AI 生成人工智能系统在各类基准测试中屡创佳绩,但在许多专业领域,这些进步并未转化为具有经济意义的实际部署。我们普遍观察到一个现象:AI模型在测试中表现出色,却难以胜任真实、复杂且具有经济价值
阅读全文> 本文转载自「OpenBMB」-- 完 --加入机智流 Pro,1 天一块钱,AI 能力指数级增长时代,不掉队。机智流 AI 团队将燃烧远超人类的智能的 AI Tokens 驱动 AI Agents
阅读全文> 作者:李剑锋1. 前言1.1 课程回顾在前面的内容中,我们已经围绕模型训练、模型测评以及本地模型运行,逐步学习了大模型从能力构建到能力调用的基本流程。模型训练主要回答的是模型能不能获得更符合预期的
阅读全文> 作者:北辰随着 Claude Mythos 5/Fable 5 的发布,大家是不是也像我一样被下面这张表刷屏了?特别是 SWE-bench Pro 80.3% 的得分,可以说是完全“碾压” GPT
阅读全文在大语言模型在线服务日益普及的今天,无论是智能问答、代码生成还是智能体交互,用户对响应速度的期待越来越高。一个理想的系统不仅要能同时处理大量请求,保证高吞吐量,还必须确保每个用户都能在可接受的时间内获
阅读全文你正在剪辑一段视频,需要将背景音乐替换为吉他旋律,同时让人声听起来更低沉、更有磁性,并且不能改变说话的内容。又或者,你需要将一段带有地方口音的中文对话,精准地修改为标准普通话发音,同时保留说话人的音色
阅读全文清晨,你一边听书,一边下意识留意着周围的动静,随时准备回应家人的呼唤。这种对连续声音流的实时感知、决策与响应,是人类与生俱来的交互能力。然而,对于当前的人工智能而言,这却是一个巨大的挑战。现有的音频大
阅读全文> 本文翻译自外网,机智流编辑部校对一个只靠 prompt 描述的 AI skill,跑出来的结果看起来挺像回事,但每次都不一样。出错不报错,跑偏不提醒,你都不知道它什么时候搞砸的。这是 skill
阅读全文图片由AI生成在科研论文的撰写过程中,制作一张清晰、美观、符合出版规范的图表,往往是研究者们耗时耗力的环节。从构思布局、绘制元素、调整样式到最终排版,每一步都需要精细的手工操作。尽管文本生成图像技术近
阅读全文> 作者:李剑锋1. 前言1.1 课程回顾在前面的内容中,我们已经围绕大模型训练与模型测评,逐步梳理了从数据构建、监督微调、参数高效调优到效果评估的基本流程。到这一阶段为止,实际上已经回答了两个关键问
阅读全文图片由 AI 生成当你在家中指挥一个机器人助手“给窗边的植物浇水”时,你期望它完成任务,但更希望它足够“聪明”,能注意到植物下方那个正在通电的插线板。一个鲁莽的浇水动作,可能引发短路甚至火灾。现实世界
阅读全文图片由 AI 生成在大语言模型(LLM)浪潮席卷全球的今天,从智能对话到代码生成,再到企业自动化,AI应用正经历着前所未有的范式转移。然而,当我们将这些动辄数百亿甚至上千亿参数的“庞然大物”推向实际生
阅读全文> 作者:北辰MiniMax-M3 发布今天是 6.1 儿童节,先祝所有超龄的小朋友节日快乐。今天 MiniMax-M3 发布,小编第一时间实测了一下,这次测试我刻意只给了简单提示词,重点看它能不能在
阅读全文图片由 AI 生成在多人在线游戏中,几个角色正在一片虚拟世界中协作建造一座高塔。一个角色负责采集资源,另一个负责搭建结构,第三个则在远处警戒。他们各自的视角画面实时同步,动作与反应环环相扣,共同推进着
阅读全文> 本文编译自外网,机智流编辑部校对上个月,一个每周跑 20 万次 CI job 的团队问我们:既然已经有 Claude Code 了,为什么不直接拿它来修复构建失败的CI?我们自己每天都在用 Cla
阅读全文Claude Opus 4.8 发布了,相信大家已经刷到了很多更强、更快、更诚实、价格不变,还带来 Fast Mode、effort control 和 Claude Code dynamic wor
阅读全文> 作者:李剑锋1. 前言在前面的课程中,我们已经围绕大模型训练过程中的几个关键阶段进行了较为系统的学习。从 SFT(监督微调) 到 继续预训练,再到后面的 DPO 偏好优化,我们实际上一直在讨论同一
阅读全文> 本文来自社区投稿这个问题看起来答案应该是肯定的。GUI actions 负责点击、输入、拖拽和滚动,tool calls 负责高效处理结构化操作,两者结合似乎天然应该强于任何单一路径。但在真实桌面
阅读全文图片由 AI 生成随着大语言模型应用场景的不断扩展,一个典型的推理服务后台往往需要同时承载多个不同架构、不同规模、不同专长的模型。这些模型共享着有限且异构的硬件资源,尤其是宝贵的GPU内存。当GPU内
阅读全文想用 AI 助力创业,第一步可以从一个更大的问题开始:怎样创建一家真正 AI-native 的公司?近期,Claude 官方发布了一份面向创业者手册:The founder's playbook: B
阅读全文> 本文由 Intern-S2 等 AI 生成,机智流编辑部校对智能体的能力,不只在模型里当一个智能体被要求修复代码、整理调研报告、操作网页、调用工具,甚至跨多轮会话持续完成一件事时,真正决定体验的往
阅读全文> 本文编译自外网,机智流编辑部校对Vibe coding 这条路越走越宽了。很多程序员朋友日常都在用 AI 写代码,但用法分两种:一种像许愿池,对着 AI 一通输入,祈祷某次能吐出正确结果;另一种是
阅读全文图片由 AI 生成在数字世界中,一个智能体正面对一项看似简单的任务:加热一个盘子并将其放入橱柜。它环顾四周,发现了炉灶和微波炉。对于人类而言,选择微波炉是显而易见的,但对于一个正在学习的智能体,这却是
阅读全文> 作者:李剑锋前言在前面的课程中,我们已经重点讲解了 SFT(监督微调) 的相关内容,并在上一节课中进一步介绍了 继续预训练 的基本思路。而在这一节课里,我们将继续沿着模型训练能力不断增强的这条路线
阅读全文科学研究是一个不断试错、迭代、积累的过程。一个研究者提出假设,设计实验,观察失败,基于失败修正计划,然后再次尝试。然而,现有的基于大语言模型的自主研究系统,往往将这一复杂过程简化为一条直线:从想法到论
阅读全文> 本文来自社区投稿近日,Meta AI 与香港中文大学颠覆性提出了一种全新的视觉推理范式 ATLAS,不用外部工具,不显式生成中间图像,没有视觉监督信号,只用一个离散 word,首次颠覆性地代替 A
阅读全文图片由 AI 生成在当今的在线大语言模型服务场景中,无论是检索增强生成系统,还是复杂的智能体应用,我们都能观察到两种显著的模式。用户的请求往往由多个可复用的“片段”拼接而成,例如固定的系统指令、检索到
阅读全文> 本文由 Intern-S2 等 AI 生成,机智流编辑部校对下午,千问大模型官方账号发了一条预告:这是一条很会吊胃口的预告,既没有直接说是“新模型”,也没有说是“新功能”,反而用了“新朋友”?那我
阅读全文