MemeBridge: A Dataset for Benchmarking and Mitigating the Bidirectional Cultural Gap in Meme Interpretation. Hangxiao Zhu, Suliu Qin, Zhuoyan Li, Ming Jiang 0018, Yu Zhang 0044, Meng Xia 0002 该来源暂未提供摘要。
FireSentry: A Multi-Modal Spatio-temporal Benchmark Dataset for Fine-Grained Wildfire Spread Forecasting. Nan Zhou, Huandong Wang, Jiahao Li, Han Li, Yali Song, Qiuhua Wang, Yong Li 0008, Xinlei Chen 该来源暂未提供摘要。
VQFlow: A Benchmark Dataset for Encrypted Video Streaming Traffic across QoS Configurations. Ziming Zhao 0008, Zhaoxuan Li, Tingting Li 0004, Fan Zhang 0010 该来源暂未提供摘要。
QuaMap: A Multi-Backend Benchmark Dataset for Quantum Circuit Mapping and Learning-Based Compiler Evaluation. Ziming Zhao 0008, Tingting Li 0004, Jianwei Yin 该来源暂未提供摘要。
Learning Multimodal Embeddings for Traffic Accident Prediction and Causal Estimation. Ziniu Zhang, Minxuan Duan, Haris N. Koutsopoulos, Hongyang R. Zhang 该来源暂未提供摘要。
FinWorld: An All-in-One Open-Source Platform for End-to-End Financial AI Research and Deployment. Wentao Zhang 0007, Yilei Zhao 0001, Chuqiao Zong, Xinrun Wang, Bo An 0001 该来源暂未提供摘要。
Exploring Recommender System Evaluation: A Multi-Modal LLM Agent Framework for A/B Testing. Wenlin Zhang 0001, Xiangyang Li 0004, Qiyuan Ge, Kuicai Dong, Pengyue Jia, Xiaopeng Li 0014, Zijian Zhang 0009, Maolin Wang 0001, Yichao Wang 0002, Huifeng Guo 等 该来源暂未提供摘要。
Automated Annotation of Privacy Information in User Interactions with Large Language Models. Hang Zeng, Xiangyu Liu, Yong Hu, Chaoyue Niu, Fan Wu 0006, Shaojie Tang 0001, Guihai Chen 该来源暂未提供摘要。
MM-SpuBench: Towards Better Understanding of Spurious Biases in Multimodal LLMs. Wenqian Ye, Bohan Liu, Guangtao Zheng, Di Wang 0053, Xu Cao, Yunsheng Ma, Bolin Lai, James M. Rehg, Aidong Zhang 0001 该来源暂未提供摘要。
GUI-Robust: A Comprehensive Dataset for Testing GUI Agent Robustness in Real-World Anomalies. Jingqi Yang, Zhilong Song, Jiawei Chen 0007, Mingli Song, Sheng Zhou 0004, Linjun Sun, Xiaogang Ouyang, Chun Chen 0001, Can Wang 0001 该来源暂未提供摘要。
Heaven-Sent or Hell-Bent? Benchmarking the Intelligence and Defectiveness of LLM Hallucinations. Chengxu Yang, Jingling Yuan, Siqi Cai 0001, Jiawei Jiang 0001, Chuang Hu 该来源暂未提供摘要。
From Memorization to Creation: Evaluating the Cognitive Depth of LLM?Generated Educational Questions. Xiaolong Wang, Zhe Zhao 0008, Song Lai 0001, Chaoli Zhang 0001, Zijie Geng, Yu Tong, Ye Wei, Qingsong Wen 该来源暂未提供摘要。
LitBench: A Graph-Centric Large Language Model Benchmarking Tool For Literature Tasks. Andreas Varvarigos, Ali Maatouk, Jiasheng Zhang, Ngoc Bui, Jialin Chen, Leandros Tassiulas, Rex Ying 该来源暂未提供摘要。
IRLBench: A Multi-modal, Culturally Grounded, Parallel Irish-English Benchmark for Open-Ended LLM Reasoning Evaluation. Khanh-Tung Tran, Duc-Hai Nguyen, Barry O'Sullivan, Hoang D. Nguyen 该来源暂未提供摘要。
X-MethaneWet: A Cross-scale Global Wetland Methane Emission Benchmark Dataset for Advancing Science Discovery with AI. Yiming Sun 0004, Shuo Chen, Shengyu Chen, Chonghao Qiu, Licheng Liu, Youmi Oh, Sparkle L. Malone, Gavin McNicol, Qianlai Zhuang, Chris Smith 等 该来源暂未提供摘要。
Let's Verify Math Questions Step by Step. Chengyu Shen, Zhen Hao Wong, Runming He, Hao Liang 0017, Meiyi Qiang, Zimo Meng, Zhengyang Zhao 0003, Bohan Zeng, Zhengzhou Zhu, Bin Cui 0001 等 该来源暂未提供摘要。
Generating Realistic Human Mobility Data with Hybrid Large Language Model Agent. Chenyang Shao, Bingbing Fan, Jingtao Ding, Yuan Yuan 0032, Meng Wang 0001, Fengli Xu 该来源暂未提供摘要。
HAROOD: A Benchmark for Out-of-distribution Generalization in Sensor-based Human Activity Recognition. Wang Lu 0003, Yao Zhu 0003, Jindong Wang 0001 该来源暂未提供摘要。
ITDR: An Instruction Tuning Dataset for Enhancing Large Language Models in Recommendations. Zekun Liu, Xiaowen Huang 0001, Jitao Sang 0001 该来源暂未提供摘要。
CNText2Sign and CNSign: Unified Chinese Sign Language Datasets for Bidirectional Accessibility. Yulong Li 0002, Yuxuan Zhang, Feilong Tang, Ming Hu, Zhixiang Lu, Haochen Xue, Jianghao Wu 0001, Rui Chen, Mian Zhou, Kang Dang 等 该来源暂未提供摘要。