当前位置:首页 > 电商学院 > 汉潮快讯 > 从「看懂」到「控制」,美图影像研究院科研能力再突破

从「看懂」到「控制」,美图影像研究院科研能力再突破

0人阅读|来源:极客公园|发布时间:2026-08-18 00:30:02
导读:作为 AI 影像领域的「长期玩家」,美图影像研究院(MT Lab)围绕高频创作场景的真实痛点,持续展开研究

人工智能的快速发展推动 AI 生成能力不断刷新认知,但 AI 在视觉领域的进化,离不开视觉理解、空间建模、时序一致性、美学表达等多个方向的持续突破,这更考验长期的视觉技术积累。

作为 AI 影像领域的「长期玩家」,美图影像研究院(MT Lab)围绕高频创作场景的真实痛点,持续展开研究。2026 年以来,共有 11 篇论文被 ICLR、CVPR、ICML、ECCV、ACM MM 等国际顶会接收,覆盖视频编辑、人像编辑、智能交互、视觉理解等多个方向,并将研究成果不断通过产品落地,转化为服务美图用户的 AI 影像能力。

在围绕模型的编辑能力方面,美图影像研究院(MT Lab)提出参考帧引导视频编辑统一框架 MiVE,实现包括改变发型、变换服装、妆容造型、重新打光、更换背景、天气变换、局部优化等在内的通用视频编辑能力;一致特征传输重打光新方案 CFT 实现人物一致性的丰富打光效果,目前已研发上线超过 50 种复杂光效;基于随机桥模型的新框架 BridgeRemoval 显著提升 AI 视频消除的精准度及时序一致性,并实现视频身材美型保护能力;基于 Self-Prompting 的图像文本编辑方法,实现在繁体中文、泰语、日语甚至是特殊符号等复杂文字场景中的「无痕改字」。面向原生 2K 多服饰试衣的新框架实现了端到端的多服饰生成,并且在 2K 高分辨率下,依旧能够保持羊毛、棉麻、粗针织等等服饰材质的真实质感。此外,提出了 All-in-One Slider 的统一多属性控制框架,为更灵活的组合、调度编辑能力奠定了基础。

在围绕「真实意图理解」方面,美图影像研究院(MT Lab)提出基于双向语义流的条件分割方法 FlowSeg,精准对齐画面对象与语言指令,准确判断编辑目标。

在前沿能力建设方面,美图影像研究院(MT Lab)提出了基于 DiT 的 3D 位置编码框架 PE-Field、动态毛发渲染框架 ControlHair、协同式图像编辑框架 SI-Edit 分别被深度学习领域顶级会议 ICLR 2026、计算机视觉领域三大顶会之一的 ECCV 2026、国际多媒体领域顶级会议 ACM MM2026 收录。

随着生成能力进化为更通用的基础能力,AI 影像真正的较量也开始深入真实创作场景,美图影像研究院(MT Lab)将前沿研究、专业数据、模型评测、工程落地环环紧扣,为美图形成真正可落地的产品力,而长期深耕 AI 影像的价值,也在这些细节中显现,在持续抬高模型能力上限的同时,让 AI 更懂真实创作需求,推动 AI 产品从「用户可用」走向「用户爱用」。

来源:互联网

免责声明:本文为转载,仅作信息分享交流之用。版权归原作者所有,如有侵权,请联系删除。

汉潮热门产品

HOT PRODUCT
  • AI搜荐(GEO产品)
  • 五大AI数字员工
  • AI大模型外呼机器人
  • 汉潮O2O城市生活服务系统
  • 汉潮智慧门店新零售系统