출판 No Pose, No Problem: Surprisingly Simple 3D Gaussian Splats from Sparse Unposed Images Botao Ye, Sifei Liu, Haofei Xu, Xueting Li, Marc Pollefeys, Ming-Hsuan Yang, Songyou Peng ICLR 2025 | October 2024
출판 MMWorld: Towards Multi-discipline Multi-faceted World Model Evaluation in Videos Xuehai He, Weixi Feng, Kaizhi Zheng, Yujie Lu, Wanrong Zhu, Jiachen Li, Yue Fan, Jianfeng Wang, Linjie Li, Zhengyuan Yang, K. Lin, William Yang Wang, Lijuan Wang, Xin Eric Wang ICLR 2025 | June 2024
출판 MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models Fanqing Meng, Jin Wang, Chuanhao Li, Quanfeng Lu, Hao Tian, Jiaqi Liao, Xizhou Zhu, Jifeng Dai, Yu Qiao, Ping Luo, Kaipeng Zhang, Wenqi Shao ICLR 2025 | August 2024
출판 MMIE: Massive Multimodal Interleaved Comprehension Benchmark for Large Vision-Language Models Peng Xia, Siwei Han, Shi Qiu, Yiyang Zhou, Zhaoyang Wang, Wenhao Zheng, Zhaorun Chen, Chenhang Cui, Mingyu Ding, Linjie Li, Lijuan Wang, Huaxiu Yao ICLR 2025 | October 2024
출판 GenXD: Generating Any 3D and 4D Scenes Yuyang Zhao, Chung-Ching Lin, K. Lin, Zhiwen Yan, Linjie Li, Zhengyuan Yang, Jianfeng Wang, Gim Hee Lee, Lijuan Wang ICLR 2025 | November 2024
출판 Fine-Grained Verifiers: Preference Modeling as Next-token Prediction in Vision-Language Alignment Chenhang Cui, An Zhang, Yiyang Zhou, Zhaorun Chen, Gelei Deng, Huaxiu Yao, Tat-Seng Chua ICLR 2025 | October 2024
출판 EditRoom: LLM-parameterized Graph Diffusion for Composable 3D Room Layout Editing Kaizhi Zheng, Xiaotong Chen, Xuehai He, Jing Gu, Linjie Li, Zhengyuan Yang, K. Lin, Jianfeng Wang, Lijuan Wang, Xin Eric Wang, Linjie Li ICLR 2025 | October 2024
출판 Certainly Uncertain: A Benchmark and Metric for Multimodal Epistemic and Aleatoric Awareness Khyathi Raghavi Chandu, Linjie Li, Anas Awadalla, Ximing Lu, J. Park, Jack Hessel, Lijuan Wang, Yejin Choi ICLR 2025 | July 2024
출판 VoLUT: Efficient Volumetric Streaming Enhanced By LUT-Based Super-Resolution Yifan Yang, Lili Qiu, Yuqing Yang, Xinyang Jiang The Eighth Annual Conference on Machine Learning and Systems | May 2025
출판 VidTok: A Versatile and Open-Source Video Tokenizer Anni Tang, Tianyu He, Junliang Guo, Xinle Cheng, Li Song, Jiang Bian December 2024 ArXiv | December 2024 Github