每周精选

近7天内社区解读较多的方向与热门关键词,适合先读一眼再决定是否深入。

以下为搜索结果。

标题 arXiv 发布时间 状态
When Text Misleads: Inconsistent-Aware Reasoning for Audio-Grounded Dialogue
Yen-Ju Lu, Yuzhe Wang, Yaohan Guan, Xiluo He, Jiarui Hai, Mingrui Liang, Kaavya Chaparala, Thomas Thebaud, Laureano Moro-Velazquez, Najim Dehak, Jesus Villalba
cs.CL cs.CL cs.AI cs.LG
2608.27176v1 2026-08-27 14:26:46 待赞助
How AI Experiences Art: Emergent Aesthetic Structure in a Self-Supervised Multimodal Embedding Space
Corey D. C. Heath
cs.MM cs.MM cs.CV cs.LG
2608.27121v1 2026-08-27 13:34:18 待赞助
DocTalkBN: A Novel Dataset of Expert Telemedicine Conversations in Bengali
Anik Saha, Fahmida Sultana Naznin, Sadatul Islam Sadi, Ananya Shahrin Promi, Wahid Al Azad Navid, Rifat Shahriyar
cs.CL cs.CL
2608.27110v1 2026-08-27 13:25:17 待赞助
Omni-Interactive Universal Embedder
Wei-Yao Wang, Kazuya Tateishi, Shuyang Cui, Christian Simon, Takashi Shibuya, Shusuke Takahashi, Yuki Mitsufuji
cs.AI cs.AI cs.CV
2608.27044v1 2026-08-27 12:31:55 待赞助
Direct or Mediated? Task-Dependent Audio Information Routing in Large Audio Language Models
Yizhou Zhang, Wangjin Zhou, Xin Gu, Yichi Wang, Wei Tan, Yi Zhao, Zhi Gong, Keisuke Imoto, Tatsuya Kawahara
cs.SD cs.SD cs.MM
2608.27026v1 2026-08-27 12:12:26 待赞助
Mitigating Strong-Modality Collapse in Multimodal Learning via Inverted Asymmetric Fusion
Mary Ogbuka Kenneth, Foaad Khosmood, Abbas Edalat
cs.LG cs.LG cs.MM
2608.26879v1 2026-08-27 09:39:09 待赞助
Emotion Understanding in Streaming Video with Trajectory-Aware Reliability
Qingsong Wang, Qigong Lei, Zitong Wang, Bohan Yu, Zhiang Dong, Jian liu, Weiqiang Wang, Chang Yao, Jingyuan Chen
cs.MM cs.MM
2608.26786v1 2026-08-27 08:16:09 待赞助
EmoSay: Artificial Intelligence-Driven Text-to-Emotional-Speech System for Affective Communication in Extended Reality
Sikiru Ademola Adewale, Sunday D. Ubur, Nikitha Donekal Chandrashekar, Onyeka Emebo, Denis Gračanin
cs.HC cs.HC
2608.26566v1 2026-08-27 03:17:55 待赞助
Multi2AV-Safety: Benchmarking Safety in Multimodal-to-Audio-Video Generation
Kaichao Jiang, Changtao Miao, Baiqi Wu, Zhiyuan Lu, Kang Yang, Peiwei Zhao, Junchi Chen, Yunfeng Diao, He Liu, Qi Chu, Tao Gong, Nenghai Yu
cs.AI cs.AI
2608.26535v1 2026-08-27 02:12:25 待赞助
HUG-VIS: A Multimodal Benchmark for Human-centered Understanding and Generation in Visual Intelligence
Fei Ma, Zebang Cheng, Minghui Li, Hongbo Xu, Yuyong Tan, Yihua Shao, Hanling Wang, Zhou Liu, Yuqing Gao, Dong Wang, Long Ma, Laizhong Cui, Nicu Sebe, Qi Tian
cs.CV cs.CV
2608.26517v1 2026-08-27 01:43:47 待赞助
SpeechGym: An Audio-Native Gym for Training Voice Agents via Reinforcement Learning
Jiajun Fan, Jingyuan Li, Prashanth Gurunath Shivakumar, Jia-Hong Huang, Qi Luo, M. Maruf, Ivan Bulyko, Ge Liu, Roger Ren
cs.SD cs.SD cs.AI cs.CL
2608.26432v1 2026-08-26 22:16:05 待赞助
AudioSpan: Spanning the Duration and Depth of Audio Comprehension
Wen Huang, Yunfei Chu, Meng Gao, Haolin He, Jin Xu
cs.SD cs.SD eess.AS
2608.26431v1 2026-08-26 22:15:48 待赞助
StreamAV-Bench: A Comprehensive Benchmark for Streaming Audio-Video Generation
Kaiqi Liu, Haoxuan Zeng, Jingqi Liu, Jiacong Fang, Ziqi Cai, Yunyao Mao, Henglin Liu, Yu Sheng, Shuchen Weng, Boxin Shi
cs.SD cs.SD cs.CV cs.MM
2608.26336v1 2026-08-26 19:16:24 待赞助
Modality Maturity Index: A benchmark for assessing multimodal capabilities of omni models
Rohit Patel, Dieuwke Hupkes, Sloan Strader
cs.CV cs.CV cs.AI cs.MM
2608.26317v1 2026-08-26 18:48:52 待赞助
Why ML-based cough models do not generalize: a systematic cross-dataset evaluation for tuberculosis screening
Wensi Zhang, Tomas Teijeiro, Jérôme Thevenot, David Atienza
eess.AS eess.AS cs.AI cs.LG
2608.25846v1 2026-08-26 14:22:32 待赞助
Cooperative Multi-Agent Reinforcement Learning for Adaptive Aggregation in Semi-Supervised Federated Learning with non-IID Data
Rene Glitza, Luca Becker, Rainer Martin
cs.LG cs.LG cs.DC cs.SD
2608.25794v1 2026-08-26 13:46:43 待赞助
PUMA: Post-Hoc Sparsification of Universal Multimodal Embeddings for Efficient Retrieval
Matteo Attimonelli, Alessandro De Bellis, Franco Maria Nardini, Claudio Pomo, Cosimo Rulli, Rossano Venturini, Tommaso Di Noia
cs.IR cs.IR
2608.25780v1 2026-08-26 13:26:39 待赞助
InteractGesture: Progressive Chunk Guidance for Continuous Streaming Co-Speech Gesture Control
Ekkasit Pinyoanuntapong, Ajinkya Deogade, Paul Streli, Wenjing Zhang, Joanna Materzynska, Pu Wang, Vittorio Ferrari, Jie Shen
cs.CV cs.CV
2608.25734v1 2026-08-26 12:46:26 待赞助
Overview of SHROOM-Visions 2026: A Shared Task on Hallucination Detection in Large Vision-Language Models
Raúl Vázquez, Aman Sinha, Chuyuan Li, Claudio Savelli, Eduardo Calò, Emilio Raimond, Stella Frank, Hengyu Luo, Flavio Giobergia, Vincent Segonne, Lorenzo Vaiani, Jörg Tiedemann, Timothee Mickus
cs.CL cs.CL
2608.25662v1 2026-08-26 11:44:35 待赞助
Video-IFBench: Evaluating Instruction Following of Multimodal LLMs in Video Understanding Scenarios
Hongbo Liu, Peixian Chen, Sihan Liu, Peiyuan Zhang, Kai Zou, Dian Zheng, Xiaoxing Hu, Yuhao Dong, Mengdan Zhang, Yunhang Shen, Haoyu Cao, Wei Liu, Weibo Gu, Xing Sun, Shengjie Zhao
cs.CV cs.CV
2608.25529v1 2026-08-26 08:35:42 待赞助