LiblibAI 母公司完成近 3 亿美元融资:AI 应用层开始进入「收入说话」的阶段
演语科技,正在成为这一轮变化中最值得观察的中国样本之一。 作者丨郑佳美 编辑丨马晓宁
阅读全文SE-Bridge-TTS:合成数据也能训出稳定、自然、可克隆的低资源语言 SOTA TTS。 作者丨逻辑智能
阅读全文PE-Field将传统的2D位置编码扩展为结构化的3D场,使DiT能够更加直接地在3D空间中处理几何信息。 作者丨美图影像研究院(MT Lab)
阅读全文仅附加一个轻量级深度预测头,就可以让标准 VLM 成为同时输出稠密深度图与自然语言响应的统一多模态基础模型。 作者丨DepthVLM团队
阅读全文All-in-One Slider 实现了对人脸属性的连续精细化控制,并最大限度地保持了图像整体结构及面部细节信息。 作者丨美图影像研究院(MT Lab)
阅读全文LearnIR通过训练轻量网络预测梯度校正分布,实现无需前向算子的扩散后验采样校正;并设计动态分辨率模块,进一步抑制噪声。 作者:vivo BlueImage Lab
阅读全文算力时代“微光”,广工本科生靠古早Titan显卡拼下顶会大奖;十年树木,CV社区将最高荣誉授予已故先驱孙剑。 作者丨小雷哥 编辑丨岑 峰
阅读全文Agent 安全正在从“看一条轨迹是否安全”,进一步走向“在运行时阻止 unsafe final delivery”。
阅读全文