新闻与深度文章
在刚刚落幕的计算机视觉与人工智能领域最具影响力的国际顶会之一 CVPR 2026 上,来自微软亚洲研究院的论文《Native and Compact Structured Latents for 3D Generation》(即TRELLIS.2)从全球 16,092篇投稿中脱颖而出,荣膺最佳学生论文奖(Best Student Paper Award)。 作为全新的 3D 资产生成范式,TREL…
《AI Next》是微软亚洲研究院推出的一档利用 AI 技术制作的播客,内容聚焦 AI 前沿技术、科研趋势与社会影响。第一季主要围绕当今智能发展的核心议题,探索前沿趋势。 作为本季收官之作,第八期节目请到了微软亚洲研究院院长周礼栋博士,与大家深度探讨 AI 与底层系统的协同进化,一起拆解智能时代基础设施的重构逻辑。周院长将通过解析系统…
在大语言模型 (LLMs) 的训练中,数据的高效利用是决定模型最终能力的关键。过去的很多研究将精力集中在“数据筛选”(Data Selection)上,也就是如何从海量互联网语料中挑出最高质量的子集。 如今,这个问题依然十分重要。当前大模型通常只在海量数据上训练一轮或少数几轮,模型很可能只“读”一遍教材,因此数据样本呈现的时间顺序直接决定了模型的学习轨迹。如果把训练过程类比为上课,那么数据选择决定…
体检偶然发现的肾脏小肿块,常常让患者和医生陷入两难:它究竟是良性还是恶性?是立即手术,还是继续观察?现实中,一部分术后证实为良性的肿块,意味着患者可能承担了不必要的风险和医疗成本。如果能够在术前更准确地判断肿块的性质,并进一步推演治疗方案,将对肾癌的精准诊疗产生重要价值。 现有的通用医疗 AI 模型虽然具有广泛的医学影像表征能力,但往往无法深入理解肾癌诊疗中那些细微但关键的专科信息,例如肿瘤的形态…
编者按:什么样的研究员能在AI浪潮中持续保持创造力?微软亚洲研究院高级研究员郭宗昱,习惯把一件事从构想到落地一路推进,尤其专注于完成从0到80分的关键跨越。清醒的自我认知,让他在流媒体浪潮下扎根视频编解码研究,又在生成式AI爆发后果断转向Agentic Media(智能体式媒体)这一前沿方向。在唯快不破的AI时代,这种拥抱变化、主动转身的勇气,以及对信息本质的追寻,或许正是每一位身处浪潮中的探索者…
编者按:欢迎阅读“科研上新”栏目!“科研上新”汇聚了微软亚洲研究院最新的创新成果与科研动态。在这里,你可以快速浏览研究院的亮点资讯,紧跟前沿领域发展态势。 6月3日至7日,全球计算机视觉领域的顶尖学术盛会 CVPR 将在美国科罗拉多州丹佛市举行。本期“科研上新”将为大家带来多篇微软亚洲研究院入选 CVPR 2026 的精选论文解读,具体方向包括生成式视频压缩、扩散图像压缩、3D空间理解及实时说话人…
当前,大语言模型智能体(agent)的真正难点已经不在于“能不能调用工具”,而在于“能不能稳定、可复用地完成任务”。过去,智能体的技能通常有三种来源:专家手写、由前沿大模型一次性生成,或者运行后进行松散的自我修订。这些方法虽然在某些场景下能勉强见效,但都普遍缺少深度学习优化器才具有的“训练纪律”。 由于缺乏稳定的步长控制、显式的验证集选择,以及对失败修改的负反馈记忆,智能体的技能往往越改越长、越改…
我们已经习惯让大模型回答问题、生成代码、撰写报告,但当它真正要成为一名”贴身的个人助理”时,最难的反而是一件最朴素的事——记得住。 它需要记得住你三个月前提过的过敏药物,记得住你上周才搬家到新的城市,记得住你昨天交给它的那份长达 30 页的项目报告…… 为了攻克这一难题,来自微软亚洲研究院、微软AI与中国人民大学的研究团队提出了RHELM(Realistic, Heterogeneous, and…
| Yifan Yang, Xuemei Gao, Qi Dai, Bei Liu, Kai Qiu, Dongdong Chen, 和 Chong Luo
AI agents often fail because their instructions, or skills, are manually modified with no guarantee of improvement. Learn how SkillOpt turns skill editing into a training process, making agent behavior more reliable without changing model weights.