출판 A Fourier Space Perspective on Diffusion Models Fabian Falck, Teodora Pandeva, Kiarash Zahirnia, Rachel Lawrence, Richard Turner, Edward Meeds, Javier Zazo, Sushrut Karmalkar May 2025
출판 Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning Bo Wang, Zhongqi Yue, Fengda Zhang, Shuo Chen, L. Bi, Junzhe Zhang, Xue Song, Kelvin Chan, Jiachun Pan, Weijia Wu, Min Zhou, Wang Lin, Kaihang Pan, Saining Zhang, Liyu Jia, Wentao Hu, Wei Zhao, Hanwang Zhang May 2025 arXiv | May 2025
출판 VoLUT: Efficient Volumetric Streaming Enhanced By LUT-Based Super-Resolution Yifan Yang, Lili Qiu, Yuqing Yang, Xinyang Jiang The Eighth Annual Conference on Machine Learning and Systems | May 2025
출판 Unified Multimodal Understanding and Generation Models: Advances, Challenges, and Opportunities Xinjie Zhang, Jintao Guo, Shanshan Zhao, Minghao Fu, Lunhao Duan, Guoxin Wang, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang May 2025 arXiv | May 2025
출판 Efficient Vocabulary-Free Fine-Grained Visual Recognition in the Age of Multimodal LLMs Hari Chandana Kuchibhotla, Sai Srinivas Kancheti, Abbavaram Gowtham Reddy, Vineeth N Balasubramanian TMLR | May 2025, 제 2025 권
출판 TEMPURA: Temporal Event Masked Prediction and Understanding for Reasoning in Action Jen-Hao Cheng, Vivian Wang, Huayu Wang, Huapeng Zhou, Yi-Hao Peng, Hou-I Liu, Hsiang-Wei Huang, Kuang-Ming Chen, Cheng-Yen Yang, Wenhao Chai, Yi-Ling Chen, Vibhav Vineet, Qin Cai, Jenq-Neng Hwang 2025 COLM | May 2025
출판 Response Wide Shut: Surprising Observations in Basic Vision Language Model Capabilities Shivam Chandhok, Wan-Cyuan Fan, Vered Shwartz, Vineeth N Balasubramanian, Leonid Sigal ACL | May 2025
출판 3DiFACE: Synthesizing and Editing Holistic 3D Facial Animation Balamurugan Thambiraja, Malte Prinzler, Sadegh Aliakbarian, Darren Cosker, Justus Thies International Conference on 3D Vision 2025 | May 2025
출판 Robust Optical Transceiver Manipulation in Cluttered Cable Environments Using 3D Scene Understanding and Planning Iason Sarantopoulos, Chenyu Liu, Bohong Weng, Sicheng Xu, Yizhong Zhang, Jiaolong Yang, Xin Tong, Fabian Otto, David Sweeney, Andromachi Chatzieleftheriou, Ant Rowstron 2025 IEEE International Conference on Robotics and Automation | May 2025 프로젝트
출판 FlexCAD: Unified and Versatile Controllable CAD Generation with Fine-tuned Large Language Models Zhanwei Zhang, Shizhao Sun, Wenxiao Wang, Deng Cai, Jiang Bian (jiabia) International Conference on Learning Representations | April 2025 Github