深度解析 Gemma 3n 端侧全能模型:手机端 60FPS 视频实时解析
编辑:机智流编辑部和被奴役的AI全文约4000字,阅读时间8分钟。今天稍早,我们介绍了 Google 刚刚推出的全新开源模型 Gemma 3n。这是一个多模态开源模型,支持图像、语音、视频和文本输入,
阅读全文编辑:机智流编辑部和被奴役的AI全文约4000字,阅读时间8分钟。今天稍早,我们介绍了 Google 刚刚推出的全新开源模型 Gemma 3n。这是一个多模态开源模型,支持图像、语音、视频和文本输入,
阅读全文全文约 1200 字,预计阅读时间 3 分钟新闻资讯1. Black Forest Labs发布FLUX.1 Kontext图像生成与编辑模型,支持上下文感知处理Black Forest Labs推
阅读全文多模态大模型的演进正在不断突破我们对技术边界的认知。从最初的 Qwen-VL 到如今的 Qwen2.5 -VL,我们在提升模型对图像内容的理解能力方面取得了一些进展。今天,我们正式推出 Qwen VL
阅读全文👆👆👆重要提醒!微信推荐机制大幅调整,大家务必将我们公众号设为★星标,否则很可能看不到推送了......永不塌房的AI歌手,才是最值得追的明星?6月上旬,汗青工作室旗下的AI.TALK节目打造的AI歌
阅读全文👆👆👆重要提醒!微信推荐机制大幅调整,大家务必将我们公众号设为★星标,否则很可能看不到推送了......做系统难,建生态更难。但要说有什么比前两者更难,那应该是:在市场已经被三大成熟平台(iOS、An
阅读全文👆👆👆重要提醒!微信推荐机制大幅调整,大家务必将我们公众号设为★星标,否则很可能看不到推送了......智能门锁行业维持销量增长要靠AI了?据市场调研机构洛图科技报告,2015年到2024年,中国智能
阅读全文👆👆👆重要提醒!微信推荐机制大幅调整,大家务必将我们公众号设为★星标,否则很可能看不到推送了......说起手机,那可是我们生活中不可或缺的伙伴。除了在家使用以外,出门办事那是离不开一点半点。要学习有
阅读全文今天,我们正式发布 jina-embeddings-v4,一款全新的多模态向量模型,参数规模达到 38 亿,并首次实现了对文本与图像的同步处理。为了在各类检索任务中发挥极致性能,我们在模型内置了一套面
阅读全文我想问您一个问题:上次为了让AI代理调用某个第三方API,您花了多长时间写包装代码?一天?三天?还是一周?不过现在,Brandeis大学的研究者们带来了一个让人眼前一亮的解决方案——Doc2Agent
阅读全文我们推出了 MiniMax-Speech,这是一款基于自回归 Transformer 的文本转语音(TTS)模型,能够生成高质量的语音。其关键创新在于我们可学习的说话人编码器,它可以从参考音频中提取
阅读全文这个PasteMax和我之前写的AI Context 源代码分析工具异曲同工,都是将整个仓库进行分析全并后拖喂给大模型,然后对整个项目,整个仓库进行对话。我开发的线上工具地址如下:https://by
阅读全文文|豆包Seed1.6-Thinking + OpenAI o3 + DeepResearchPrompt | 骆轶航高考是左右命运的人生“大考”,也是人工智能的试金石。AI 写作文到 AI 解数学和
阅读全文作者|Yoky邮箱|yokyliu@pingwest.com智谱“中国版OpenAI”的身份,被OpenAI官方“认可”了。6月25日,OpenAI官网在最新一期的《The Prompt》专栏中,介绍
阅读全文文章转载于白鲸实验室作者:八尺01多年以后,科技的风把两个旧时代的人吹到AI这条路上。罗永浩准备做AI产品,王自如已开始做AI测评博主。冤家路窄,两人折腾半生,归来可能又将成为死敌。罗永浩理想主义本色
阅读全文坦白地说,你是不是觉得 Transformer 已经被研究透了?经过了无数轮的验证与优化,Transformer 的结果看似已经达到了非常稳定的最佳状态,想做出颠覆 Transformer 的结构创新
阅读全文机器之心报道编辑:泽南AI 生成的「最后一道关卡」已经突破?因为生成式 AI,火遍全球的 Labubu 有了超萌专属 BGM:视频来自可灵 AI 创意圈用户。复杂的自然环境也可以获得相应的背景音。视频
阅读全文机器之心报道机器之心编辑部只需一眨眼的功夫,Mercury 就把任务完成了。「我们非常高兴地推出 Mercury,这是首款专为聊天应用量身定制的商业级扩散 LLM!Mercury 速度超快,效率超高,
阅读全文本文第一作者为北京邮电大学副教授、彩云科技首席科学家肖达,其他作者为彩云科技算法研究员孟庆业、李省平,彩云科技CEO袁行远。残差连接(residual connections)自何恺明在 2015 年
阅读全文整理 | 褚杏娟 当地时间 6 月 26 日,在上个月的 Google I/O 上首次亮相预览后,谷歌如今正式发布了 Gemma 3n 完整版,可以直接在本地硬件上运行。“迫不及待地想看看这些 And
阅读全文作者 | 华卫 “选择合成数据赛道的底层逻辑其实很简单,AI 的快速爆发带来了数据需求,这个 Gap 要靠合成数据去填。”光轮智能联合创始人兼总裁杨海波表示,在大语言模型领域不存在外部合成数据的发展机
阅读全文新智元报道 编辑:Aeneas KingHZ【新智元导读】GPT-5,已经被OpenAI员工抢先用上了?就在今天,奥特曼在X上关注了一个神秘人,引起全网猜测。不止两人爆料,自己可能提前体验了GP
阅读全文新智元报道 编辑:kingHZ【新智元导读】谷歌扔下重磅炸弹:AI编程工具Gemini CLI,开源!免费!权限拉满!百万token上下文、千次调用额度、VS Code+终端全打通,谷歌彻底掀桌
阅读全文新智元报道 编辑:LRST【新智元导读】当前大型视觉语言模型(LVLMs)存在物体幻觉问题,即会生成图像中不存在的物体描述。西安交通大学研究团队提出了一种名为Nullu的方法,通过提取「幻觉子空
阅读全文新智元报道 【新智元导读】2025年9月7日,新智元将迎来十岁生日!值此,新智元诚邀你加入,共同见证ASI降临。2015年9月7日—2025年9月7日,新智元星舰远航十年。「新智元」星舰搭载了数
阅读全文西风 发自 凹非寺量子位 | 公众号 QbitAI2025年已成为名副其实的Agent元年。不论是Operator、Manus、Genspark等爆款Agent的相继出现,还是各大厂商陆续发布MCP协
阅读全文闻乐 时令 发自 凹非寺量子位 | 公众号 QbitAI扔100次,99次「同一面朝上」。这个由碳纤维和碳化钨(航空材料)打造的“几何怪物”,竟破解了60年数学悬案。如果这个发明早一点出现,或许“雅典
阅读全文克雷西 发自 凹非寺量子位 | 公众号 QbitAI谷歌开源模型,又上新了。今天凌晨,谷歌正式官宣了Gemma 3n,原生支持文本、图像和音视频等多种模态。在大模型竞技场中,Gemma 3n取得了13
阅读全文梦晨 发自 凹非寺量子位 | 公众号 QbitAI让机器人下厨房,获数千万元融资!享刻智能正式官宣完成数千万元Pre-A轮系列融资,投资方阵容相当豪华:世纪长河科技集团、启迪之星联合领投,网龙天映创投
阅读全文不圆 发自 凹非寺量子位 | 公众号 QbitAIAgent能“看懂网页”,像人类一样上网?阿里发布WebDancer,就像它的名字一样,为“网络舞台”而生。只要输入指令,它就可以帮你上网搜索、做攻略
阅读全文嘿,大家好!这里是一个专注于前沿AI和智能体的频道~今年,各种 AI Agent层出不穷。因为manus,GAIA火了,每家都能试着在GAIA上刷个榜,然后再发布。很多开源项目跑出来的效果跟论文里差了
阅读全文