


default search action
64th ACL 2026: San Diego, California, USA - Long Papers
- Maria Liakata, Viviane P. Moreira, Jiajun Zhang, David Jurgens:

Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), ACL 2026, San Diego, California, United States, July 2-7, 2026. Association for Computational Linguistics 2026, ISBN 979-8-89176-390-6 - Frontfatter.

- Pan Lu, Bowen Chen, Sheng Liu, Rahul Thapa, Joseph Boen, James Zou:

OctoTools: A Multi-Agent Framework with Extensible Tools for Complex Reasoning. 1-86 - Jimin Jung, MyoungJin Kim, Jaehyung Seo, Heuiseok Lim:

No Reader Left Behind: Multi-Agent Summaries Everyone Can Understand. 87-116 - Chengwu Liu, Yichun Yin, Ye Yuan, Jiaxuan Xie, Botao Li, Siqi Li, Jianhao Shen, Yan Xu, Lifeng Shang, Ming Zhang:

Discover and Prove: An Open-source Agentic Framework for Hard Mode Automated Theorem Proving in Lean 4. 117-133 - Chung-ju Huang, Huiqiang Zhao, Yuanpeng He, Lijian Li, Wenpin Jiao, Zhi Jin, Peixuan Chen, Leye Wang:

Your Inference Request Will Become a Black Box: Confidential Inference for Cloud-based Large Language Models. 134-154 - Louie Hong Yao, Vishesh Anand, Yuan Zhuang, Tianyu Jiang:

Rhetorical Questions in LLM Representations: A Linear Probing Study. 155-172 - Yifu Chen, Shengpeng Ji, Zhengqing Liu, Qian Chen, Wen Wang, Ziqing Wang, Yangzhuo Li, Tianle Liang, Zhou Zhao:

Dual-Axis Generative Reward Model Toward Semantic and Turn-taking Robustness in Interactive Spoken Dialogue Models. 173-208 - Daria Kryvosheieva, Andrea Gregor de Varda, Evelina Fedorenko, Greta Tuckute:

Different types of syntactic agreement recruit the same units within large language models. 209-227 - Mengshi Chen, Yuxiang Sun, Tengchao Li, Jianwei Wang, Kai Wang, Xuemin Lin, Ying Zhang, Wenjie Zhang:

Empowering Tabular Data Preparation with Language Models: Why and How? 228-246 - Zhiyuan Fan, Guanqiao Chen, Yanyi Huang, Mingkuan Zhao, Dadi Guo, Yi R. Fung:

Learning Diverse Responses with Prefix-Conditioned Supervised Fine-Tuning. 247-276 - Myunghoon Kang, Dahyun Jung, Suhyune Son, Seonmin Koo, Changwoo Chun, Daniel Rim, Haeyoung Kwon, Yuna Hur, Heuiseok Lim:

EASE: Entity-Aware Sub-table Generation for Real-world Multi-table QA. 277-302 - Yizhen Yuan, Rui Kong, Dongze Li, Yuanchun Li, Yunxin Liu:

Benchmarking LLM's Capability in Reasoning over Conflicting Web References. 303-322 - Qianli Wang, Van Bach Nguyen, Yihong Liu, Fedor Splitt

, Nils Feldhus, Christin Seifert, Hinrich Schütze, Sebastian Möller, Vera Schmitt:
Parallel Universes, Parallel Languages: A Comprehensive Study on LLM-based Multilingual Counterfactual Example Generation. 323-346 - Seungyoon Lee, Minhyuk Kim, Seongtae Hong, Youngjoon Jang, Dongsuk Oh, Heuiseok Lim:

CLEAR: Cross-Lingual Enhancement in Retrieval via Reverse-training. 347-362 - Chenming Tang, Yutong Yang, Kexue Wang, Yunfang Wu:

Aligning Language Models with Real-time Knowledge Editing. 363-378 - Jiho Choi, Seojeong Park, Seongjong Song, Hyunjung Shim:

PosterForest: Hierarchical Multi-Agent Collaboration for Scientific Poster Generation. 379-401 - Lukas Helff, Ahmad Omar, Felix Friedrich, Antonia Wüst, Hikaru Shindo, Rupert Mitchell, Tim Woydt, Patrick Schramowski, Wolfgang Stammer, Kristian Kersting:

SLR: Automated Synthesis for Scalable Logical Reasoning. 402-426 - Niclas Doll, Jasper Schulze Buschhoff, Shalaka Satheesh, Hammam Abdelwahab, Héctor Allende-Cid, Katrin Klug:

Can Continual Pretraining Bridge the Performance Gap between General-purpose and Specialized Language Models in the Medical Domain? 427-444 - Jie He, Nan Hu, Wanqiu Long, Jiaoyan Chen, Jeff Z. Pan:

MINTQA: A Multi-Hop Question Answering Benchmark for Evaluating LLMs on New and Long-tail Knowledge. 445-479 - Adam Storek, Mukur Gupta, Samira Hajizadeh, Prashast Srivastava, Suman Jana:

Sense and Sensitivity: Examining the Influence of Semantic Recall on Long Context Code Understanding. 480-498 - Pierluigi Cassotti, Naomi Baes, Stefano De Pascale, Jáder Martins Camboim de Sá, Francesco Periti, Nick Haslam

, Dirk Geeraerts, Nina Tahmasebi:
SenseRel: A Sense-Level Benchmark for Denotational and Connotational Meaning Relations. 499-515 - Yifei He, Pranit Chawla, Yaser Souri, Subhojit Som, Xia Song:

WebSTAR: Scalable Data Synthesis for Computer Use Agents with Step-Level Filtering. 516-533 - Behrooz Azarkhalili, Linyi Li, Maxwell W. Libbrecht:

PR-XAI: PageRank-Based Feature Attribution for Transformers. 534-554 - Shengli Zhou, Xiangchen Wang, Guanhua Chen, Feng Zheng:

CAPruner: Conceptual-Adjacent Scene Graph Pruner for Enhancing 3D Spatial Reasoning of Large Language Models. 555-567 - Angelo Ortiz Tandazo, Manel Khentout, Youssef Benchekroun, Thomas Hueber, Emmanuel Dupoux:

MauBERT: Universal Phonetic Inductive Biases for Few-Shot Acoustic Units Discovery. 568-585 - Zi-Ao Ma, Xian-Ling Mao, Tian Lan, Chen Xu, Zhijing Wu:

Your Reasoning Model Knows What Counts: Self-Guided Chain-of-Thought Pruning for Efficient Reasoning. 586-605 - Ching-Yun Ko, Payel Das, Sihui Dai, Georgios Kollias, Subhajit Chaudhury, Aurélie C. Lozano, Pin-Yu Chen:

ImReasoner: Improving Memory-based Language Models for Reasoning-in-a-Haystack Tasks. 606-622 - Zidi Xiong, Yuping Lin, Wenya Xie, Pengfei He, Zirui Liu, Jiliang Tang, Himabindu Lakkaraju, Zhen Xiang:

How Memory Management Impacts LLM Agents: An Empirical Study of Experience-Following Behavior. 623-645 - Tianyang Zhou, Ziyi Zhang, Haowen Lin, Somesh Jha, Mihai Christodorescu, Kirill Levchenko, Varun Chandrasekaran:

SACTOR: LLM-Driven Correct and Idiomatic C to Rust Translation with Static Analysis and FFI-Based Verification. 646-673 - Fengbo Ma, Zixin Rao, Xiaoting Li, Zhetao Chen, Hongyue Sun, Yiping Zhao, Xianyan Chen, Zhen Xiang:

IntrAgent: An LLM Agent for Content-Grounded Information Retrieval through Literature Review. 674-715 - Can Jin, Rui Wu, Tong Che, Qixin Zhang, Hongwu Peng, Jiahui Zhao, Zhenting Wang, Wenqi Wei, Ligong Han, Zhao Zhang, Yuan Cao, Ruixiang Tang, Dimitris N. Metaxas:

Reasoning over Precedents Alongside Statutes: Case-Augmented Deliberative Alignment for LLM Safety. 716-749 - Maoxiao Ye, Xinfeng Ye, Sathiamoorthy Manoharan:

Hybrid Autoregressive-Diffusion Model for Real-Time Sign Language Production. 750-763 - Zhiqing Cui, Binwu Wang, Qingxiang Liu, Yeqiang Wang, Zhengyang Zhou, Yuxuan Liang, Yang Wang:

Augur: Modeling Covariate Causal Associations in Time Series via Large Language Models. 764-787 - Zheyuan Zhang, Kaiwen Shi, Zhengqing Yuan, Zehong Wang, Tianyi Ma, Keerthiram Murugesan, Vincent Galassi, Chuxu Zhang, Yanfang Ye:

AgentRouter: A Knowledge-Graph-Guided LLM Router for Collaborative Multi-Agent Question Answering. 788-809 - Haonan Chen, Hong Liu, Yuping Luo, Liang Wang, Nan Yang, Furu Wei, Zhicheng Dou:

MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings. 810-823 - Yaxun Dai, Wenxuan Xie

, Xialie Zhuang, Tianyu Yang, Ziyi Liu, Haiqin Yang, Yiying Yang, Yuhang Zhao, Pingfu Chao, Wenhao Jiang:
ReEx-SQL: Reasoning with Execution-Aware Reinforcement Learning for Text-to-SQL. 824-847 - Tingfeng Hui, Pengyu Zhu, Bowen Ping, Ling Tang, Guanting Dong, Yaqi Zhang, Sen Su:

DecIF: Improving Instruction-Following through Decomposition. 848-867 - Lingfeng Zhang, Xiaoshuai Hao, Yingbo Tang, Haoxiang Fu, Xinyu Zheng, Pengwei Wang, Zhongyuan Wang, Wenbo Ding, Shanghang Zhang:

NavA³: Understanding Any Instruction, Navigating Anywhere, Finding Anything. 868-878 - Gen Li, Peiyu Liu:

FastV-RAG: Towards Fast and Fine-Grained Video QA with Retrieval-Augmented Generation. 879-889 - Ruiyi Yan, Yugo Murawaki:

Efficient Provably Secure Linguistic Steganography via Range Coding. 890-907 - Kai Zou, Ziqi Huang, Yuhao Dong, Shulin Tian, Dian Zheng, Hongbo Liu, Jingwen He

, Bin Liu, Yu Qiao, Ziwei Liu:
Uni-MMMU: A Massive Multi-discipline Multimodal Unified Benchmark. 908-924 - Sheng Zhang, Junyi Li, Yingyi Zhang, Pengyue Jia, Yichao Wang, Xiaowei Qian, Wenlin Zhang, Maolin Wang, Yong Liu, Xiangyu Zhao:

MemSearch-o1: Empowering Large Language Models with Reasoning-Aligned Memory Growth in Agentic Search. 925-943 - Bolun Sun, Charles Chang, Yuen Yuen Ang, Ruotong Mu, Yuchen Xu, Zhengxin Zhang, Pingxu Hao:

CAPC-CG: A Large-Scale, Expert-Directed LLM-Annotated Corpus of Adaptive Policy Communication in China. 944-966 - Shuhang Chen, Hangjie Yuan, Yunqiu Xu, Pengwei Liu, Tao Feng, Jun Cen, Zeying Huang, Yi Yang:

MathFlow: Enhancing the Perceptual Flow of MLLMs for Visual Mathematical Problems. 967-992 - Ruiyi Yan, Shiao Meng, Yugo Murawaki:

Anchored Sliding Window: Toward Robust and Imperceptible Linguistic Steganography. 993-1012 - Guangzeng Han, Xiaolei Huang:

What Makes Good Instruction-Tuning Data? An In-Context Learning Perspective. 1013-1027 - Xinyu Shi, Kairong Luo, Zhen Zheng, Wenguang Chen:

RoBSA: RoPE-based Blockwise Sparse Multi-head Latent Attention. 1028-1044 - Nuo Chen, Andre Huikai Lin, Jiaying Wu, Junyi Hou, Zining Zhang, Qian Wang, Xidong Wang, Bingsheng He:

XtraGPT: Context-Aware and Controllable Academic Paper Revision via Human-AI Collaboration. 1045-1074 - Beidan Liu, Zhengqiu Zhu, Chen Gao, Tianle Pu, Yong Zhao, Wei Qi, Quanjun Yin:

Learn to Relax with Large Language Models: Solving Constraint Optimization Problems via Bidirectional Coevolution. 1075-1094 - Guoxi Zhang, Jiawei Chen, Tianzhuo Yang, Jiaming Ji, Yaodong Yang, Juntao Dai:

A Game-Theoretica Negotiation Framework for Cross-Cultural Consensus. 1095-1134 - Zifeng Cheng, Lingyun Qian, Zhiwei Jiang, Cong Wang, Yafeng Yin, Fei Shen, Ao Zhou, Qing Gu:

Focusing Condition: Inference-Time Self-Contrastive Steering Elicits Better Conditional Text Embeddings in LLMs. 1135-1147 - Ziheng Wang, Zihao Yue, Wenxuan Wang, Qin Jin:

Exploring Attention Attractors in Large Language Models. 1148-1160 - Yulin Ou, Yu Wang, Yang Xu, Hendrik Buschmeier

:
Identifying the Periodicity of Information in Natural Language. 1161-1175 - Jing Ye, Lu Xiang, Yaping Zhang, Chengqing Zong:

EmoHarbor: Evaluating Personalized Emotional Support by Simulating the User's Internal World. 1176-1202 - Jianlyu Chen, Junwei Lan, Chaofan Li, Defu Lian, Zheng Liu:

ReasonEmbed: Enhanced Text Embeddings for Reasoning-Intensive Document Retrieval. 1203-1221 - Binxian Su, Haoye Lou, Shucheng Zhu, Weikang Wang, Ying Liu, Dong Yu, Pengyuan Liu:

SPAGBias: Uncovering and Tracing Structured Spatial Gender Bias in Large Language Models. 1222-1251 - Yixiao He, Menghao Zhang, Haifeng Sun, Jing Wang, Kangheng Lin, Jinghan Wang, Chenye Xu, Pengfei Ren, Qi Qi, Jingyu Wang:

VALU: A Benchmark for Video Anomaly Temporal Localization and Understanding at Multiple Semantic Levels. 1252-1296 - Xiaoyang Yi, Jing Chen, Yuru Bao, Jian Zhang:

CoreGaze: Core Subgraph-Driven Visual Gaze Diffusion for Training-Free Referring Multimodal Large Language Models. 1297-1315 - Shakhrul Iman Siam, Tiantian Feng, Jiankun Zhang, Shrikanth Narayanan, Mi Zhang:

RespiraMFM: A Multimodal Foundation Model with Contrastive Audio-Language Alignment for Respiratory Disease Identification. 1316-1330 - Conghui Niu, Ningxin Wu, Ziran Zhao, Dong Yu, Chen Kang, Pengyuan Liu:

Beyond Detection: Evaluating Fallacy Awareness of LLMs in Interactive Scenarios. 1331-1352 - Deniz Bayazit, Aaron Mueller, Antoine Bosselut:

Crosscoding Through Time: Tracking Emergence & Consolidation Of Linguistic Representations Throughout LLM Pretraining. 1353-1377 - Zihan Zhang, Yu Bao, Xiao Ding, Tianyi Jiang, Kai Xiong:

Is EEG-to-Text Feasible in Real-World Scenarios? An In-Depth Analysis Using a Neuropsychology-Inspired Benchmark. 1378-1393 - Yuxuan Jiang, Zehua Chen, Zeqian Ju, Yusheng Dai, Weibei Dou, Jun Zhu:

ControlAudio: Tackling Text-Guided, Timing-Indicated and Intelligible Audio Generation via Progressive Diffusion Modeling. 1394-1413 - Sapir Harary, Eran Hirsch, Aviv Slobodkin, David Wan, Mohit Bansal, Ido Dagan:

PrefixNLI: Detecting Factual Inconsistencies as Soon as They Arise. 1414-1433 - Ziyang Zhou, Ziqi Liu, Yan Wang, Yiming Lin, Yangbin Chen:

RAM-SD: Retrieval-Augmented Multi-agent framework for Sarcasm Detection. 1434-1448 - Michelle Chao Chen, Moritz Miller, Bernhard Schölkopf, Siyuan Guo:

On the Emergence and Test-Time Use of Structural Information in Large Language Models. 1449-1465 - Sher Badshah, Ali Emami, Hassan Sajjad:

SAGE: A Search-AuGmented Evaluation of Large Language Models on Free-Form QA. 1466-1491 - Austin Xu, Yilun Zhou, Xuan-Phi Nguyen, Caiming Xiong, Shafiq Joty:

J4R: Learning to Judge with Equivalent Initial State Group Relative Policy Optimization. 1492-1511 - Xianren Zhang, Shreyas Prasad, Di Wang, Qiuhai Zeng, Suhang Wang, Wenbo Yan, Mat Hans:

A Functionality-Grounded Benchmark for Evaluating Web Agents in E-commerce Domains. 1512-1528 - Jiongxiao Wang, Qiaojing Yan, Yawei Wang, Yijun Tian, Soumya Smruti Mishra, Zhichao Xu, Megha Gandhi, Panpan Xu, Lin Lee Cheong:

Reinforcement Learning for Self-Improving Agent with Skill Library. 1529-1550 - Rui Wang, Junda Wu, Yu Xia, Tong Yu, Ruiyi Zhang, Ryan A. Rossi, Subrata Mitra, Lina Yao, Julian J. McAuley:

CachePrune: Teaching LLMs What Not to Follow via KV-Cache Editing. 1551-1570 - Parsa Hejabi, Elnaz Rahmati, Alireza Salkhordeh Ziabari, Morteza Dehghani:

Flip-Flop Consistency: Unsupervised Training for Robustness to Prompt Perturbations in LLMs. 1571-1587 - Zedian Shao, Hongbin Liu, Yuepeng Hu, Neil Zhenqiang Gong:

Leave My Images Alone: Preventing Multi-Modal Large Language Models from Analyzing Images via Visual Prompt Injection. 1588-1604 - Ningyuan Yang, Kaizhu Huang:

Logic Matters in Lightweight Hallucination Classification for RAG System. 1605-1617 - Shuyao Xu, Cheng Peng, Jiangxuan Long, Weidi Xu, Wei Chu, Yuan Qi:

Harnessing Negative Signals: Reinforcement Distillation from Teacher Data for LLM Reasoning. 1618-1639 - Mayank Singh, Vikas Yadav, Shiva Krishna Reddy Malay, Shravan Nayak, Sai Rajeswar, Sathwik Tejaswi Madhusudhan, Eduardo Blanco:

Grammar Search for Multi-Agent Systems. 1640-1655 - David H. Yang, Yuxuan Zhu, Mohammad Mohammadi Amiri, Keerthiram Murugesan, Tejaswini Pedapati, Subhajit Chaudhury, Pin-Yu Chen:

ZoomR: Memory Efficient Reasoning through Multi-Granularity Key Value Retrieval. 1656-1669 - Suhaib Abdurahman, Etsuko Ishii, Katerina Margatina, Divya Bhargavi, Monica Sunkara, Yi Zhang:

Explicit Trait Inference for Multi-Agent Coordination. 1670-1704 - Yuxin Xiao, Shujian Zhang, Marzyeh Ghassemi, Wenxuan Zhou:

SFTMix: Elevating Language Model Instruction Tuning with Mixup Recipe. 1705-1718 - Amin Banayeeanzade, Ala N. Tak, Fatemeh Bahrani, Anahita Bolourani, Leonardo Blas, Emilio Ferrara, Jonathan Gratch, Sai Praneeth Karimireddy:

Psychological Steering in LLMs: An Evaluation of Effectiveness and Trustworthiness. 1719-1771 - Siqi Ouyang, Shuoyang Ding, Oleksii Hrinchuk, Vitaly Lavrukhin, Brian Yan, Boris Ginsburg, Lei Li:

Hierarchical Policy Optimization for Simultaneous Translation of Unbounded Speech. 1772-1787 - Songtao Jiang, Yuan Wang, Ruizhe Chen, Yan Zhang, Ruilin Luo, Bohan Lei, Yeying Jin, Sibo Song, Zhibo Yang, Jimeng Sun, Jian Wu, Zuozhu Liu:

Act as you think: Reinforcing Consistent Reasoning in Medical Visual Question Answering. 1788-1805 - Tomer Ashuach, Dana Arad, Aaron Mueller, Martin Tutek, Yonatan Belinkov:

CRISP: Persistent Concept Unlearning via Sparse Autoencoders. 1806-1825 - Penghui Yang, Cunxiao Du, Fengzhuo Zhang, Haonan Wang, Tianyu Pang, Chao Du, Bo An:

LongSpec: Long-Context Lossless Speculative Decoding with Efficient Drafting and Verification. 1826-1844 - Dota Tianai Dong, Yifan Luo, Po-Ya Angela Wang, Asli Özyürek, Paula Rubio-Fernández:

Using Perspectival Words Is Harder Than Vocabulary Words for Humans - and Even More So for Multimodal Language Models. 1845-1870 - Noy Sternlicht, Tom Hope:

CHIMERA: A Knowledge Base of Scientific Idea Recombinations for Research Analysis and Ideation. 1871-1905 - Houxing Ren, Mingjie Zhan, Zimu Lu, Ke Wang, Yunqiao Yang, Haotian Hou, Hongsheng Li:

Towards Robust Real-World Spreadsheet Understanding with Multi-Agent Multi-Format Reasoning. 1906-1933 - Jianwen Luo, Yiming Huang, Jinxiang Meng, Fangyu Lei, Shizhu He, Xiao Liu, Shanshan Jiang, Bin Dong, Jun Zhao, Kang Liu:

GATE: Graph-based Adaptive Tool Evolution Across Diverse Tasks. 1934-1961 - Huazheng Wang, Yongcheng Jing, Haifeng Sun, Yingjie Wang, Jingyu Wang, Jianxin Liao, Dacheng Tao:

Erasing Without Remembering: Implicit Knowledge Forgetting in Large Language Models. 1962-1994 - Xingyu Zhu, Junfeng Fang, Shuo Wang, Beier Zhu, Zhicai Wang, Yonghui Yang, Xiangnan He:

Mitigating Hallucinations in Large Vision-Language Models without Performance Degradation. 1995-2009 - Yuxiang Huang, Mingye Li, Xu Han, Chaojun Xiao, Weilin Zhao, Ao Sun, Ziqi Yuan, Hao Zhou, Fandong Meng, Zhiyuan Liu:

APB-V: Accelerating Long-Video Understanding via Sequence-Parallelism-aware Approximate Attention. 2010-2025 - Sultan Alrowili, Younes Samih, Abed Alhakim Freihat, Mathan Kumar Eswaran:

AraVQA: Building a New Arabic Factoid Visual Question Answering Dataset from Wikipedia. 2026-2042 - Andrew Halterman, Katherine A. Keith:

What is a protest anyway? Codebook conceptualization is still a first-order concern in LLM-era classification. 2043-2059 - Chaewan Chun, Delvin Ce Zhang, Dongwon Lee:

When Misinformation Speaks and Converses: Rethinking Fact-Checking in Audio Platforms. 2060-2075 - Jerry Huang, Siddarth Madala, Cheng Niu, Julia Hockenmaier, Tong Zhang:

Contextual Relevance and Adaptive Sampling for LLM-Based Document Reranking. 2076-2089 - Jinseok Chung, Minkyoung Song, Hyunji Jung, Namhoon Lee:

Quantifying Aleatoric Uncertainty of In-Context Learning for Robust Measure of LLM Prediction Confidence. 2090-2108 - Yanxiao Zhao, Yaqian Li, Zihao Bo, Rinyoichi Takezoe, Haojia Hui, Mo Guang, Lei Ren, Xiaolin Qin, Kaiwen Long:

SATQuest: A Verifier for Logical Reasoning Evaluation and Reinforcement Fine-Tuning of LLMs. 2109-2131 - Xi Xiao, Chenrui Ma, Yunbei Zhang, Chen Liu, Zhuxuanzi Wang, Yanshu Li, Lin Zhao, Guosheng Hu, Tianyang Wang, Hao Xu:

Not All Directions Matter: Towards Structured and Task-Aware Low-Rank Model Adaptation. 2132-2154 - Peixuan Zhang, Zijian Jia, Ziqi Cai, Shuchen Weng, Si Li, Boxin Shi:

ReContraster: Making Your Posters Stand Out with Regional Contrast. 2155-2171 - Xiangchen Song, Aashiq Muhamed, Yujia Zheng, Lingjing Kong, Zeyu Tang, Mona T. Diab, Virginia Smith, Kun Zhang:

Mechanistic Interpretability Should Prioritize Feature Consistency in Sparse Autoencoders. 2172-2210 - Jiawei Liu, Qisi Chen, Jianshu Zhang, Quan Liu, Defu Lian:

EquivPruner: Boosting Efficiency and Quality in LLM-Based Search via Action Pruning. 2211-2226 - Xinjie Chen, Minpeng Liao, Guoxin Chen, Chengxi Li, Biao Fu, Kai Fan, Xinggao Liu:

From Data-Centric to Sample-Centric: Enhancing LLM Reasoning via Progressive Optimization. 2227-2242 - Moshe Kimhi, Nimrod Shabtay, Raja Giryes, Chaim Baskin, Eli Schwartz:

CARES: Context-Aware Resolution Selector for VLMs. 2243-2256 - Simon Lupart, Mohammad Aliannejadi, Evangelos Kanoulas:

ChatR1: Reinforcement Learning for Conversational Reasoning and Retrieval Augmented Question Answering. 2257-2274 - Zhichen Liu, Yongyuan Li, Yang Xu:

Think in Sentences: Explicit Sentence Boundaries Enhance Language Model's Capabilities. 2275-2288 - Mehul Agarwal, Aditya Aggarwal, Arnav Goel, Medha Hira, Anubha Gupta:

MORPHOGEN: A Multilingual Benchmark for Evaluating Gender-Aware Morphological Generation. 2289-2313 - Yuxuan Gu, Wuyang Zhou, Giorgos Iacovides, Danilo P. Mandic:

TeRA: Vector-based Random Tensor Network for High-Rank Adaptation of Large Language Models. 2314-2329 - Xi Chen, Chuan Qin, Jinpeng Li, Shasha Hu, Chao Wang, Hengshu Zhu, Hui Xiong:

GenDis: Generative-Discriminative Dual-View Co-Training for Generalized Category Discovery. 2330-2351 - Jingwei Shi, Xinxiang Yin, Jing Huang, Shengyu Tao, Jinman Zhao

:
CodeHacker: Automated Test Case Generation for Detecting Vulnerabilities in Competitive Programming Solutions. 2352-2382 - Kevin Stowe, Svetlana Afanaseva, Rodolfo Raimundo, Yitao Sun, Kailash Patil:

Identifying Bias in Machine-generated Text Detection. 2383-2395 - Yage Zhang, Yukun Jiang, Michael Backes, Yang Zhang:

DE-CLIP: Few-Shot Anomaly Detection via Difference-Guided Embedding Editing. 2396-2407 - Tianyi Hu, Andrea Morales-Garzón, Jingyi Zheng, Maria Maistro, Daniel Hershcovich:

Culinary Crossroads: A RAG Framework for Enhancing Diversity in Cross-Cultural Recipe Adaptation. 2408-2423 - Yuhang Zhou, Mingrui Zhang, Ke Li, Mingyi Wang, Qiao Liu, Qifei Wang, Jiayi Liu, Fei Liu, Serena Li, Weiwei Li, Mingze Gao, Abhishek Kumar, Xiangjun Fan, Zhuokai Zhao, Lizhu Zhang:

Mixture-of-Minds: Multi-Agent Reinforcement Learning for Table Understanding. 2424-2439 - Biao Wu, Yutong Xie, Zeyu Zhang, Vu Minh Hieu Phan, Qi Chen, Ling Chen, Qi Wu:

MMCLIP: Cross-Modal Attention Masked Modelling for Medical Language-Image Pre-Training. 2440-2455 - Jinming Wu, Zihao Deng, Wei Li, Yiding Liu, Bo You, Bo Li, Zejun Ma, Ziwei Liu:

MMSearch-R1: Incentivizing LMMs to Search. 2456-2487 - Yanrui Du, Fenglei Fan, Sendong Zhao, Jiawei Cao, Ming Ma, Danyang Zhao, Shuren Qi, Ting Liu, Bing Qin:

Toward Secure Tuning: Mitigating Security Risks from Instruction Fine-Tuning. 2488-2506 - Wenxuan Xie

, Yaxun Dai, Wenhao Jiang:
SDE-SQL: Enhancing Text-to-SQL Generation in Large Language Models via Self-Driven Exploration with SQL Probes. 2507-2525 - Eylon Caplan, Tania Chakraborty, Dan Goldwasser:

Splits! Flexible Sociocultural Linguistic Investigation at Scale. 2526-2550 - Lujain Ibrahim, Myra Cheng:

Thinking beyond the anthropomorphic paradigm benefits LLM research. 2551-2563 - Qisheng Hu, Quanyu Long, Wenya Wang:

Coordinating Search-Informed Reasoning and Reasoning-Guided Search in Claim Verification. 2564-2585 - Xiao Pu, Zepeng Cheng, Lin Yuan, Yu Wu, Xiuli Bi:

Breaking the Generator Barrier: Disentangled Representation for Generalizable AI-Text Detection. 2586-2598 - Chen Xu, Yu Ji, Zhenyu Lv, Yang Yi, Yizhe Yang, Luyao Ji, Chaoyi Chen, Xianyang Wang, Tian Lan, Zhihua Wang, Juan Wang, Xunde Dong, Fuze Tian, Qunxi Dong, Bin Hu:

PUPPET: Neural-Symbolic Standardized Patients for Mental Health. 2599-2634 - Jingyuan Wang, Yankai Chen, Zhonghang Li, Chao Huang:

LightReasoner: Can Small Language Models Teach Large Language Models Reasoning? 2635-2663 - Zhanyu Liu, Shiyao Wang, Xingmei Wang, Rongzhou Zhang, Jiaxin Deng, Honghui Bao, Jinghao Zhang, Wuchao Li, Penggei Zheng, Xiangyu Wu, Yifei Hu, Qigen Hu, Xinchen Luo, Lejian Ren, Zixing Zhang, Qianqian Wang, Kuo Cai, Yunfan Wu, Hongtao Cheng, Zexuan Cheng, Lu Ren, Huanjie Wang, Yi Su, Ruiming Tang, Kun Gai, Guorui Zhou:

OneRec-Think: In-Text Reasoning for Generative Recommendation. 2664-2681 - Xiaojian Li, Rongwu Xu, Tianyun Zhang, Yue Wang, Shuo Chen, Qiner Lyu, Briana Zhang, Peiran Yang, Kyle Xue Chen, Haoyuan Shi, Yu Wang, Wei Xu:

AwarenessBench: Assessing Cognitive Capabilities of Language Models. 2682-2741 - Rui Pu, Chaozhuo Li, Rui Ha, Litian Zhang, Lirong Qiu, Xi Zhang:

Beyond Surface-Level Detection: Towards Cognitive-Driven Defense Against Jailbreak Attacks via Meta-Operations Reasoning. 2742-2759 - Zongqi Wang, Tianle Gu, Chen Gong, Xin Tian, Siqi Bao, Yujiu Yang:

SCAN: Structured Capability Assessment and Navigation for LLMs. 2760-2799 - Hamin Koo, Jaehyung Kim:

EMCEE: Improving Multilingual Capability of LLMs via Bridging Knowledge and Reasoning with Extracted Synthetic Multilingual Context. 2800-2822 - Sirui Xia, Aili Chen, Xintao Wang, Tinghui Zhu, Yikai Zhang, Jiangjie Chen, Yanghua Xiao:

Can LLMs Learn to Map the World from Local Descriptions? 2823-2845 - Yanhao Li, Lu Ma, Jiaran Zhang, Lexiang Tang, Wentao Zhang, Guibo Luo:

LEASH: Adaptive Length Penalty and Reward Shaping for Efficient Large Reasoning Model. 2846-2856 - Chunhua Liu, Kabir Manandhar Shrestha, Sukai Huang:

ALIGN: Word Association Learning for Cultural Alignment in Large Language Models. 2857-2879 - Enzhi Wang, Jiaming Zhou, Yuhang Jia, Aobo Kong, Qicheng Li, Yong Qin:

RealTalk-CN: A Realistic Chinese Speech Task-Oriented Dialogue Benchmark with Cross-Modal Analysis. 2880-2897 - Tu-Phuong Mai

, Minh-Ha H. Le, Duc-Luong Tran, Phuong-Anh Chu, Duy-Cat Can, Hoang-Quynh Le:
HOPE: Hybrid Optimized Parallel Encoding with Supervised and Unsupervised Semantic Fusion for Depression Symptom Detection. 2898-2911 - Kangwen Zhao, Jianfeng Cai, Jinhua Zhu, Ruopei Sun, Dongyun Xue, Wengang Zhou, Li Li, Houqiang Li:

Bias Fitting to Mitigate Length Bias of Reward Model in RLHF. 2912-2927 - Xinyu Tang, Yuliang Zhan, Zhixun Li, Xin Zhao, Zhenduo Zhang, Zujie Wen, Zhiqiang Zhang, Jun Zhou:

Rethinking Sample Polarity in Reinforcement Learning with Verifiable Rewards. 2928-2954 - Jinyang Wu, Mingkuan Feng, Shuai Zhang, Feihu Che, Zhengqi Wen, Chonghua Liao, Ling Yang, Haoran Luo, Zheng Lian, Jianhua Tao:

Beyond Examples: Towards Automated Thought-level In-Context Reasoning for Large Language Models. 2955-2995 - Mingkuan Feng, Jinyang Wu, Siyuan Liu, Shuai Zhang, Hongjian Fang, Ruihan Jin, Feihu Che, Pengpeng Shao, Zhengqi Wen, Jianhua Tao:

Two-Stage Regularization-Based Structured Pruning for LLMs. 2996-3012 - Donald Shenaj, Ondrej Bohdal, Taha Ceritli, Mete Ozay, Pietro Zanuttigh, Umberto Michieli:

K-Merge: Online Continual Merging of Adapters for On-device Large Language Models. 3013-3029 - Wenxi Chen, Ruiqi Yan, Yushen Chen, Zhikang Niu, Ziyang Ma, Xiquan Li, Yuzhe Liang, Wenhan Lin, Shunshun Yin, Ming Tao, Xinsheng Wang, Xie Chen:

SAC: Neural Speech Codec with Semantic-Acoustic Dual-Stream Quantization. 3030-3048 - Zhongyuan Peng, Yifan Yao, Kaijing Ma, Shuyue Guo, Yizhe Li, Yichi Zhang, Chenchen Zhang, Yifan Zhang, Zhouliang Yu, Luming Li, Minghao Liu, Yihang Xia, Jiawei Shen, Yuchen Wu, Yixin Cao, Zhaoxiang Zhang, Wenhao Huang, Jiaheng Liu, Ge Zhang:

CriticLean: Critic-Guided Reinforcement Learning for Mathematical Formalization. 3049-3088 - Zhihao Gong, Zeyu Sun, Dong Huang, Qingyuan Liang, Jie M. Zhang, Dan Hao:

TRACE: Evaluating Execution Efficiency of LLM-Based Code Translation. 3089-3117 - Diana Abagyan, Alejandro Salamanca, Andrés Felipe Cruz-Salinas, Kris Cao, Hangyu Lin, Acyr Locatelli, Marzieh Fadaee, Ahmet Üstün, Sara Hooker:

One Tokenizer To Rule Them All: Emergent Language Plasticity via Multilingual Tokenizers. 3118-3136 - Kevin Du, Clara Kümpel, Michelle Wastl, Alex Warstadt:

It's Not What You Say, It's How You Say It: Evaluating LLM Responses to Expressions of Belief. 3137-3151 - Junyi Li, Yongqiang Chen, Ningning Ding:

CiPO: Counterfactual Unlearning for Large Reasoning Models through Iterative Preference Optimization. 3152-3170 - Jason S. Lucas, Matt Murtagh-White, Ali Al-Lawati, Uchendu Uchendu, Adaku Uchendu, Dongwon Lee:

DIA-HARM: Dialectal Disparities in Harmful Content Detection Across 50 English Dialects. 3171-3214 - Dahyun Jung, Jaewook Lee, Heuiseok Lim:

Towards Scalable Lifelong Knowledge Editing with Selective Knowledge Suppression. 3215-3231 - Zhengxiang Cheng, Dongping Chen, Mingyang Fu, Tianyi Zhou:

Optimizing Length Compression in Large Reasoning Models. 3232-3250 - Yupeng Hou, Jiacheng Li, Xiangjun Fu, Zhankui He, An Yan, Xiusi Chen, Julian J. McAuley:

Bridging Language and Items for Retrieval and Recommendation: Benchmarking LLMs as Semantic Encoders. 3251-3265 - Zhenhua Liu, Lijun Li, Ruizhe Chen, Yuxian Jiang, Tong Zhu, Zhaochen Su, Wenliang Chen, Jing Shao:

Evolutionary Guided Decoding: Iterative Value Refinement for LLMs. 3266-3283 - Adarsh Singh, Kushal Raj Bhandari, Jianxi Gao, Soham Dan, Vivek Gupta:

CRAFT: Training-Free Cascaded Retrieval for Tabular QA. 3284-3298 - Jinu Lee, Kyoung-Woon On, Sophia Simeng Han, Arman Cohan, Julia Hockenmaier:

Evaluating Legal Reasoning Traces with Legal Issue Tree Rubrics. 3299-3322 - Nikita Tatarinov, Vidhyakshaya Kannan, Haricharana Srinivasa, Arnav Raj, Harpreet Singh Anand, Varun Singh, Aditya Luthra, Ravij Lade, Agam Shah, Sudheer Chava:

KG-MuLQA: A Framework for KG-based Multi-Level QA Extraction and Long-Context LLM Evaluation. 3323-3359 - Guangya Wan, Mingyang Ling, Xiaoqi Ren, Rujun Han, Sheng Li, Zizhao Zhang:

COMPASS: Enhancing Agent Long-Horizon Reasoning with Evolving Context. 3360-3380 - Abdelrahman Abdallah, Mohammed Ali, Bhawna Piryani, Adam Jatowt:

BracketRank: Large Language Model Document Ranking via Reasoning-based Competitive Elimination. 3381-3397 - Zirui Yan, Dennis Wei, Dmitriy A. Katz, Prasanna Sattigeri, Ali Tajer:

Multi-component Causal Tracing in Large Language Models. 3398-3418 - Ruixuan Deng, Xiaoyang Hu, Miles Gilberti, Shane Storks, Aman Taxali, Mike Angstadt, Chandra Sekhar Sripada, Joyce Chai:

Sparse Feature Coactivation Reveals Causal Semantic Modules in Large Language Models. 3419-3451 - Ido Andrew Atad, Itamar Zimerman, Shahar Katz, Lior Wolf:

TensorLens: End-to-End Transformer Analysis via High-Order Attention Tensors. 3452-3468 - Mingtian Tan, Mike A. Merrill, Zachary Gottesman, Tim Althoff, David Evans, Thomas Hartvigsen:

Inferring Events from Time Series using Language Models. 3469-3490 - Minjae Lee, Minhyuk Seo, Tingyu Qu, Tinne Tuytelaars, Jonghyun Choi:

OASIS: Online Sample Selection for Continual Instruction Tuning. 3491-3515 - Michael Lan, Narmeen Fatimah Oozeer, Chaithanya Bandi, Philip Quirke, Austin Meek, Fazl Barez, Amir Abdullah:

Make Mechanistic Interpretability Auditable: A Call to Develop Guidelines via Continuous Collaborative Reviewing. 3516-3540 - Boyang Xue, Bin Wu, Shuofei Qiao, Sheng Wang, Rui Wang, Yiming Du, Hongru Wang, Jeff Z. Pan, Emine Yilmaz, Kam-Fai Wong, Aldo Lipani:

Mitigating Context Interference for Reliable and Efficient Search Agents. 3541-3558 - Shaohua Duan, Pengcheng Huang, Xinze Li, Zhenghao Liu, Xiaoyuan Yi, Yukun Yan, Shuo Wang, Yu Gu, Ge Yu, Maosong Sun:

Chunks as Arms: Multi-Armed Bandit-Guided Sampling for Long-Context LLM Preference Optimization. 3559-3575 - Ghadir Alselwi, Hao Xue, Shoaib Jameel, Basem Suleiman, Flora D. Salim, Imran Razzak:

Long Context Modeling with Ranked Memory-Augmented Retrieval. 3576-3590 - Congmin Zheng, Jiachen Zhu, Zhuoying Ou, Yuxiang Chen, Kangning Zhang, Rong Shan, Zeyu Zheng, Mengyue Yang, Jianghao Lin, Yong Yu, Weinan Zhang:

A Comprehensive Survey of Process Reward Models: Data Generation, Model Construction, and Usage. 3591-3607 - Xue Jiang, Yihong Dong, Mengyang Liu, Hongyi Deng, Tian Wang, Yongding Tao, Zhi Jin, Wenpin Jiao, Ge Li:

CODERL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment. 3608-3622 - Yihong Dong, Zhaoyu Ma, Xue Jiang, Zhiyuan Fan, Jiaru Qian, Yongmin Li, Jianha Xiao, Zhi Jin, Ge Li:

Saber: Efficient Sampling with Adaptive Acceleration and Backtracking Enhanced Remasking for Diffusion Language Model in Code Generation. 3623-3642 - Hao Li, Jiayang Gu, Jingkuan Song, An Zhang, Lianli Gao:

Debiased Orthogonal Boundary-Driven Efficient Noise Mitigation. 3643-3662 - Yi Jiang, Sendong Zhao, Jianbo Li, Haochun Wang, Lizhe Zhang, Yan Liu, Bing Qin:

Collaborative Chain-of-Agents for Parametric-Retrieved Knowledge Synergy. 3663-3680 - Pengyun Zhu

, Qiheng Sun, Long Wen, Yanbo Wang, Yang Cao, Junxu Liu, Deyi Xiong, Jinfei Liu, Zhibo Wang, Kui Ren:
APPSI-139: A Parallel Corpus of English Application Privacy Policy Summarization and Interpretation. 3681-3706 - Da Li, Yuxiao Luo, Keping Bi, Jiafeng Guo, Wei Yuan, Biao Yang, Yan Wang, Fan Yang, Tingting Gao, Guorui Zhou:

Compressing then Matching: An Efficient Pre-training Paradigm for Multimodal Embedding. 3707-3718 - Minh Chu Xuan, Tien-Phat Nguyen, Linh Ngo Van, Dinh Viet Sang, Nguyen Thi Ngoc Diep, Trung Le:

LLM-XTM: Enhancing Cross-Lingual Topic Models with Large Language Models. 3719-3737 - Min-Jae Kim, Jun-Yeong Moon, Mujeen Sung, Gyeong-Moon Park:

Open Your Model's Eyes: Video and Context-Aware Multimodal Backchannel Prediction. 3738-3755 - Joonhyung Park, Jaeyun Song, Sihwan Park, Eunho Yang:

Bringing Real-World Relations into Video Generation with Graph-Structured Knowledge. 3756-3771 - Yoonhyung Lee, Hyunsin Park, Jinhwan Park, Jinkyu Lee:

FC-TTS: Style and Timbre Control in Zero-Shot Text-to-Speech with Disentangled Speech Representations. 3772-3791 - Shuo Yang, Zheyu Zhang, Bardh Prenkaj, Gjergji Kasneci:

SAGE: Sparse Adaptive Guidance for Dependency-Aware Tabular Data Generation. 3792-3807 - Payel Santra, Lavisha Sharma, Madhusudan Ghosh, Partha Basuchowdhuri:

Mask-to-Correct⁺: Leveraging Retriever Diversity for Masking-guided Faithful Fact Correction. 3808-3825 - Jusen Du, Jiaxi Hu, Zhang Tao, Weigao Sun, Yu Cheng:

Native Hybrid Attention for Efficient Sequence Modeling. 3826-3842 - Woongyeong Yeo, Kangsan Kim, Soyeong Jeong, Jinheon Baek, Sung Ju Hwang:

UniversalRAG: Retrieval-Augmented Generation over Corpora of Diverse Modalities and Granularities. 3843-3871 - Yi Su, Dian Yu, Linfeng Song, Juntao Li, Haitao Mi, Zhaopeng Tu, Min Zhang, Dong Yu:

Crossing the Reward Bridge: Expanding Reinforcement Learning with Verifiable Rewards Across Diverse Domains. 3872-3892 - Song-Li Wu, Zhaocheng Du, Weinan Gan, Jingyi Wang, Xianquan Wang:

From ID to LLM: Rethinking Representation Learning for Recommendation. 3893-3905 - Tianle Liu, Zhiliang Tian, Zhen Huang, Tianlun Liu, Jingyuan Huang, Zhaoning Zhang, Chengcheng Shao, Dongsheng Li:

DMHM: Density-aware Manifold Learning and Hybrid Mahalanobis Energy for LLMs-generated Text Detection. 3906-3929 - Li Zheng, Yanyi Luo, Hao Fei, Yuzhe Ding

, Yujie Huang, Fei Li, Chong Teng, Donghong Ji:
Dynamic Emotion and Personality Profiling for Multimodal Deception Detection. 3930-3940 - Jingsheng Zheng, Jintian Zhang, Yujie Luo, Yuren Mao, Yunjun Gao, Lun Du, Huajun Chen, Ningyu Zhang:

Can We Predict Before Executing Machine Learning Agents? 3941-3974 - Md Mokarram Chowdhury, Daniel Agyei Asante, Ernie Chang, Yang Li:

IMPACT: Importance-Aware Activation Space Reconstruction. 3975-3992 - Yupeng Chang, Yuan Wu, Yi Chang:

SOS-LoRA: Static Orthogonal-Subspace Low-Rank Adaptation with Fixed Multi-Scale Scaling. 3993-4005 - Jingyu Lu, Yuhan Wang, Fan Zhuo, Xize Cheng, Changhao Pan, Xueyi Pu, Yifu Chen, Chenyuhao Wen, Tianle Liang, Zhou Zhao:

SDiaReward: Modeling and Benchmarking Spoken Dialogue Rewards with Modality and Colloquialness. 4006-4028 - Satyam Kumar, Kaustubh Shivshankar Shejole

, Pushpak Bhattacharyya:
Looking at Radiology Report Generation through a Causal Lens: A Survey. 4029-4057 - Tianlun Liu, Zhiliang Tian, Zhen Huang, Xingzhi Zhou, Wanlong Yu, Tianle Liu, Feng Liu, Dongsheng Li:

CTTA-T: Continual Test-Time Adaptation for Text Understanding via Teacher-Student with a Domain-aware and Generalized Teacher. 4058-4078 - Hongyuan Lu, Zixuan Li, Zefan Zhang, Bowen Cao, Wai Lam:

Adam's Law: Textual Frequency Law on Large Language Models. 4079-4105 - Dongqi Liu, Hang Ding, Qiming Feng, Xurong Xie, Zhucun Xue, Chengjie Wang, Jian Li, Jiangning Zhang, Yabiao Wang:

Disco-RAG: Discourse-Aware Retrieval-Augmented Generation. 4106-4136 - Zhihao Zhan, Yuhao Chen, Jiaying Zhou, Qinhan Lyu, Hao Liu, Keze Wang, Liang Lin, Guangrun Wang:

Stable Language Guidance for Vision-Language-Action Models. 4137-4159 - Yongqi Li, Hao Lang, Tieyun Qian, Yongbin Li:

Controlling Multimodal Conversational Agents with Coverage-Enhanced Latent Actions. 4160-4180 - Zhengyi Zhao

, Shubo Zhang, Zezhong Wang, Yuxi Zhang, Huimin Wang, Yutian Zhao, Yefeng Zheng, Binyang Li, Kam-Fai Wong, Xian Wu:
Guaranteeing Knowledge Integration with Joint Decoding for Retrieval-Augmented Generation. 4181-4205 - Li Zheng, Xin Zhang, Shuyi He, Fei Li, Chong Teng, Jiang-Ming Yang, Donghong Ji, Zhuang Li:

Are Emotion and Rhetoric Neurons in LLM? Neuron Recognition and Adaptive Masking for Emotion-Rhetoric Prediction Steering. 4206-4216 - Yifan Yang, Bing Han, Hui Wang, Wei Wang, Ziyang Ma, Long Zhou, Zengrui Jin, Guanrou Yang, Tianrui Wang, Xu Tan, Xie Chen:

Towards Fine-Grained and Multi-Granular Contrastive Language-Speech Pre-training. 4217-4235 - Chenfei Liao, Wensong Wang, Zichen Wen, Xu Zheng, Yiyu Wang, Haocong He, Yuanhuiyi Lyu, Lutao Jiang, Xin Zou, Yuqian Fu, Bin Ren, Linfeng Zhang, Xuming Hu:

Are We Using the Right Benchmark: An Evaluation Framework for Visual Token Compression Methods. 4236-4253 - Bo Li, Mingda Wang, Gexiang Fang, Shikun Zhang, Wei Ye:

Retrieval as Generation: A Unified Framework with Self-Triggered Information Planning. 4254-4274 - Shei Pern Chua, Zhen Leng Thai, Kai Jun Teh, Xiao Li, Qibing Ren, Xiaolin Hu:

Between a Rock and a Hard Place: The Tension Between Ethical Reasoning and Safety Alignment in LLMs. 4275-4310 - Zhengyi Zhao

, Shubo Zhang, Yiming Du, Bin Liang, Baojun Wang, Zhongyang Li, Binyang Li, Kam-Fai Wong:
EventWeave: A Dynamic Framework for Capturing Core and Supporting Events in Dialogue Systems. 4311-4339 - Zhenyun Yin, Shujie Wang, Xuhong Wang, Xingjun Ma, Yingchun Wang:

Deliberative Searcher: Improving LLM Reliability via Reinforcement Learning with Constraints. 4340-4354 - Zhiyuan Yu, Shijian Xiao, Cam-Tu Nguyen, Zhangyue Yin, Lekai Xing, Wenzhong Li, Sanglu Lu:

Thermometer of Thoughts: Enhancing LLM's Exploration via Attention Temperature Modulation. 4355-4368 - Sizhe Wang, Zhengren Wang, Dongsheng Ma, Yongan Yu, Rui Ling, Zhiyu Li, Feiyu Xiong, Wentao Zhang:

CodeFlowBench: A Multi-turn, Iterative Benchmark for Complex Code Generation. 4369-4402 - Chuyi Kong, Wei Gao, Jing Ma, Hongzhan Lin, Yuxi Sun:

REFLEX: Self-Refining Explainable Fact-Checking via Verdict-Anchored Style Control. 4403-4431 - Haoming Xu, Ningyuan Zhao, Yunzhi Yao, Weihong Xu, Hongru Wang, Xinle Deng, Shumin Deng, Jeff Z. Pan, Huajun Chen, Ningyu Zhang:

Illusions of Confidence? Diagnosing LLM Truthfulness via Neighborhood Consistency. 4432-4457 - Sensen Gao, Shanshan Zhao, Xu Jiang, Lunhao Duan, Yong Xien Chng, Qing-Guo Chen, Weihua Luo, Kaifu Zhang, Jia-Wang Bian, Mingming Gong:

Scaling Beyond Context: A Survey of Multimodal Retrieval-Augmented Generation for Document Understanding. 4458-4489 - Yanzhi Tian

, Cunxiang Wang, Zeming Liu, Heyan Huang, Wenbo Yu, Dawei Song, Jie Tang, Yuhang Guo:
Beyond Literal Mapping: Benchmarking and Improving Non-Literal Translation Evaluation. 4490-4524 - Yongxin Guo, Wenbo Deng, Zhenglin Cheng, Xiaoying Tang:

G²RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance. 4525-4539 - Chen Zhang, Jiuheng Lin, Zhiyuan Liao, Yansong Feng:

Efficient Low-Resource Language Adaptation via Multi-Source Dynamic Logit Fusion. 4540-4557 - Yukun Jiang, Xinyue Shen, Michael Backes, Zheng Li, Yang Zhang:

Open Schrödinger's Closed Box: Identifying Retrieval Augmented Generation in API-Accessible Large Language Model Services. 4558-4580 - Yuhao Zhang, Liang Yan, Shaoming Duan, Xinyu Zha, Jinhang Su, Peiyi Han, Chuanyi Liu:

AFT-Tab: Adversarial Fine-Tuning for Tabular Data Synthesis with Long Text Columns. 4581-4594 - Yang Liu, Hongming Li, Melissa Xiaohui Qin, Chao Huang, Qiankun Liu:

Revisiting a Pain in the Neck: A Semantic Reasoning Benchmark for Language Models. 4595-4618 - Yichuan Ma, Linyang Li, Yongkang Chen, Peiji Li, Xiaozhe Li, Qipeng Guo, Dahua Lin, Kai Chen:

Timely Machine: Awareness of Time Makes Test-Time Scaling Agentic. 4619-4636 - Xiaoyu Liu, Yun Zhang, Wei Li, Simiao Li, Xudong Huang, Hanting Chen, Yehui Tang, Jie Hu, Zhiwei Xiong, Yunhe Wang:

Multi-Granularity Semantic Revision for Large Language Model Distillation. 4637-4658 - Zhijie Tan, Xu Chu, Guanyu Wang, Ziyu Li, Weiping Li, Tong Mo:

RADO: Reasoning Audit-Driven Optimization for Rigorous Reasoning in High-Stakes Domains. 4659-4683 - Bo Li, Mingda Wang, Shikun Zhang, Wei Ye:

Instruction Data Selection via Answer Divergence. 4684-4702 - Dianyun Wang, Qingsen Ma, Yuhu Shang, Zhifeng Lu, Zhenbo Xu, Lechen Ning, Huijia Wu, Zhaofeng He:

Interpretable Safety Alignment via SAE-Constructed Low-Rank Subspace Adaptation. 4703-4721 - Kangcheng Luo, Tinglang Wu, Yansong Feng:

D²Plan: Dual-Agent Dynamic Global Planning for Complex Retrieval-Augmented Reasoning. 4722-4754 - Qingyu Ren, Qianyu He, Powei Chang, Jie Zeng, Zeye Sun, Fei Yu, Jiaqing Liang, Yanghua Xiao:

Instructions are all you need: Self-supervised Reinforcement Learning for Instruction Following. 4755-4776 - Zehua Pei, Hui-Ling Zhen, Lancheng Zou, Xianzhi Yu, Wulong Liu, Sinno Jialin Pan, Mingxuan Yuan, Bei Yu:

Analytical FFN-to-MoE Restructuring via Activation Pattern Analysis. 4777-4789 - Xu Chu, Guanyu Wang, Zhijie Tan, Xinrong Chen, Ziyu Li, Tong Mo, Weiping Li:

Towards Order Fairness: Mitigating LLMs Order Sensitivity through Dual Group Advantage Optimization. 4790-4805 - Junhao Liu

, Haonan Yu, Zhenyu Yan, Xin Zhang:
Revitalizing Black-Box Interpretability: Actionable Interpretability for LLMs via Proxy Models. 4806-4844 - Yakun Zhu, Yutong Huang, Shengqian Qin, Zhongzhen Huang, Shaoting Zhang, Xiaofan Zhang:

MedMCP-Calc: Benchmarking LLMs for Realistic Medical Calculator Scenarios via MCP Integration. 4845-4873 - Tarek Mahmoud, Veronika Solopova, Premtim Sahitaj, Ariana Sahitaj, Max Upravitelev, Mervat Abassy, Hana Fatima Shaikh, Neda Foroutan, Vera Schmitt, Preslav Nakov:

Uncovering Temporal Framing in the News. 4874-4902 - Ye Wang, Qianglong Chen, Siyuan Wang, Zejun Li, Shijie Guo, Zhirui Zhang, Zhongyu Wei:

Simple-VGC: Enhancing Visual Grounding in Multimodal Reasoning via Adaptive Tool Composition. 4903-4929 - Hansi Wang, Qiliang Liang, Yue Wang, Yang Liu

:
Enhancing Lexical Relation Mining with Structured Sememe Knowledge. 4930-4947 - Xuchen Li, Xuzhao Li, Jiahui Gao, Renjie Pi, Shiyu Hu, Wentao Zhang:

Look Less, Reason More: Rollout-Guided Adaptive Pixel-Space Reasoning. 4948-4967 - Xin Cheng, Wangding Zeng, Damai Dai, Qinyu Chen, Bingxuan Wang, Zhenda Xie, Kezhao Huang, Xingkai Yu, Zhewen Hao, Han Zhang, Yukun Li, Huishuai Zhang, Dongyan Zhao, Wenfeng Liang:

Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models. 4968-4990 - Hao Shen, Zhouhong Gu, Haokai Hong, Weili Han, Hongfeng Chai:

PII-Bench: Evaluating Query-Aware Privacy Protection Systems. 4991-5026 - Jingxuan Wei, Xingyue Wang, Yanghaoyu Liao, Jie Dong, Yuchen Liu, Caijun Jia, Bihui Yu, Junnan Zhu:

GenProve: Learning to Generate Text with Fine-Grained Provenance. 5027-5048 - Yihang Li, Chenhui Chu:

Rethinking Meeting Effectiveness: A Benchmark and Framework for Temporal Fine-grained Automatic Meeting Effectiveness Evaluation. 5049-5066 - Lang Feng, Fuchao Yang, Feng Chen, Xin Cheng, Haiyang Xu, Zhenglin Wan, Ming Yan, Bo An:

AgentOCR: Reimagining Agent History via Optical Self-Compression. 5067-5086 - Wenhao Wang, Peizhi Niu, Zhao Xu, Zhaoyu Chen, Jian Du, Yaxin Du, Xianghe Pang, Keduan Huang, Yanfeng Wang, Qiang Yan, Siheng Chen:

MCP-Flow: Facilitating LLM Agents to Master Real-World, Diverse and Scaling MCP Tools. 5087-5116 - Yuhang Yang, Kai Tang, Chao Ye, Haobo Wang, Qiqi Luo, Jin Guang Zheng, Zhixin Zhang:

Everyone is unique: Towards Behaviorally Heterogeneous Negotiation Dialogue Systems for Debt Collection. 5117-5151 - Jiaying Wu, Zihang Fu, Haonan Wang, Fanxiao Li, Jiafeng Guo, Preslav Nakov, Min-Yen Kan:

Beyond the Crowd: LLM-Augmented Community Notes for Governing Health Misinformation. 5152-5171 - Hexiang Tan, Wanli Yang, Junwei Zhang, Xin Chen, Rui Tang, Du Su, Jingang Wang, Yuanzhuo Wang, Fei Sun, Xueqi Cheng:

BaseCal: Unsupervised Confidence Calibration via Base Model Signals. 5172-5187 - Yang Li, Qiang Sheng, Zhengjia Wang, Yehan Yang, Danding Wang, Juan Cao:

Beyond the Final Actor: Modeling the Dual Roles of Creator and Editor for Fine-Grained LLM-Generated Text Detection. 5188-5203 - Haoyu Zheng, Yun Zhu, Yuqian Yuan, Bo Yuan, Wenqiao Zhang, Siliang Tang, Jun Xiao:

PILOT: Planning via Internalized Latent Optimization Trajectories for Large Language Models. 5204-5222 - Shuyang Jiang, Yuhao Wang, Ya Zhang, Yanfeng Wang, Yu Wang:

Miner: Mining Intrinsic Mastery for Data-Efficient RL in Large Reasoning Models. 5223-5246 - Tian Lan, Jiang Li, Rong Yan, Feilong Bao, Weihua Wang, Guanglai Gao, Xiangdong Su:

CEDAR: A Chinese Evaluation Dataset for Computational Argumentation. 5247-5269 - Xiangyu Zhao, Wanghan Xu, Bo Liu, Yuhao Zhou, Fenghua Ling, Ben Fei, Xiaoyu Yue, Lei Bai, Wenlong Zhang, Xiao-Ming Wu:

MSEarth: A Multimodal Benchmark for Earth Science Phenomenon Discovery with MLLMs. 5270-5301 - Yeonjun In, Wonjoong Kim, Sangwu Park, Chanyoung Park:

Reasoning Structure Matters for Safety Alignment of Reasoning Models. 5302-5318 - Yu Wang, Leyi Lao, Langchu Huang, Gabriel Skantze, Yang Xu, Hendrik Buschmeier

:
Investigating the Representation of Backchannels and Fillers in Fine-tuned Language Models. 5319-5348 - Hao Fang, Xiaohang Sui, Hongyao Yu, Kuofeng Gao, Jiawei Kong, Sijin Yu, Bin Chen, Shu-Tao Xia:

Retrievals Can Be Detrimental: Unveiling the Backdoor Vulnerability of Retrieval-Augmented Diffusion Models. 5349-5367 - Yingxue Fu, Anaïs Ollagnier:

A Theoretically Grounded Approach to Summarizing Conversation Dynamics for Forecasting the Derailment of Online Conversations. 5368-5384 - Zequn Xie, Xin Liu, Fangming Feng, Boyun Zhang, Tao Jin:

DPDV: Dual-Pathway and Dual-View Representation Learning for Bridging Information Asymmetry in Text-Video Retrieval. 5385-5394 - Jiang Li, Tian Lan, Shanshan Wang, Zdongxing, Dianqing Lin, Guanglai Gao, Derek F. Wong, Xiangdong Su:

Who Wrote This Line? Evaluating the Detection of LLM-Generated Classical Chinese Poetry. 5395-5413 - Xuyuan Liu, Shengyu Chen, Xinshuai Dong, Yanchi Liu, Xujiang Zhao, Haoyu Wang, Yujun Yan, Haifeng Chen, Zhengzhang Chen:

Representation Interventions Enable Lifelong Knowledge Memory Control in LLMs. 5414-5436 - Lina Yang, Yusheng Liao, Yanfeng Wang, Yu Wang:

SLoRA: Balancing Plasticity and Forgetting in Large Language Models for Continual Learning. 5437-5454 - Yang Yang, Feng Hu, Haiming Zhang, X. U. Cheng, Gui Zheng, Liang Yao, Wenqi Ren:

G-Cap: A Game Character Caption Generator. 5455-5473 - Sangmitra Madhusudan, Trush Shashank More, Steph Buongiorno, Renata Dividino, Jad Kabbara, Ali Emami:

Common to Whom? Regional Cultural Commonsense and LLM Bias in India. 5474-5519 - Zheng Zhang

, Deheng Ye, Peilin Zhao, Hao Wang:
The Stackelberg Speaker: Optimizing Persuasive Communication in Social Deduction Games. 5520-5544 - Junhyeok Kim, Jaewoo Park, Junhee Park, Sangeyl Lee, Jiwan Chung, Jisung Kim, Ji Hoon Joung, Youngjae Yu:

GuideDog: A Real-World Egocentric Multimodal Dataset for Blind and Low-Vision Accessibility-Aware Guidance. 5545-5574 - Yilin Xiao, Jin Chen, Qinggang Zhang, Yujing Zhang, Chuang Zhou, Longhao Yang, Lingfei Ren, Xin Yang, Xiao Huang:

LogicPoison: Logical Attacks on Graph Retrieval-Augmented Generation. 5575-5591 - Michele Joshua Maggini, Søren Fomsgaard, Michele Maestroni, Gaël Dias, Pablo Gamallo:

Par-ITA: Benchmarking Seq2Seq and LLMs on a Human-Supervised Parallel Corpus for Italian Hyperpartisan Neutralization. 5592-5615 - Jiang Zhou, Xiaohu Zhao, Xinwei Wu, Tianyu Dong, Hao Wang, Yangyang Liu, Heng Liu, Linlong Xu, Longyue Wang, Weihua Luo, Deyi Xiong:

Incentivizing Parametric Knowledge via Reinforcement Learning with Verifiable Rewards for Cross-Cultural Entity Translation. 5616-5638 - Xuanyu Lei, Chenliang Li, Yuning Wu, Kaiming Liu, Weizhou Shen, Peng Li, Ming Yan, Fei Huang, Ya-Qin Zhang, Yang Liu:

Writing-RL: Advancing Long-form Writing via Adaptive Curriculum Reinforcement Learning. 5639-5661 - Minghui Jia, Qichao Zhang, Ali Luo, Linjing Li, Shuo Ye, Hailing Lu, Wen Hou, Dongbin Zhao:

Spec-o3: A Tool-Augmented Vision-Language Agent for Rare Celestial Object Candidate Vetting via Automated Spectral Inspection. 5662-5681 - Wenqi Pei, Shizheng Hou, Boyan Li, Chen Han, Zhichao Shi, Yuyu Luo:

ROSE: An Intent-Centered Evaluation Metric for NL2SQL. 5682-5709 - Xin Liu, Yu-An Liu, Ruqing Zhang, Yixing Fan, Lixin Su, Jiafeng Guo, Xueqi Cheng:

Compete to Complete: Co-opetition Adversarial Learning for Retrieval-Augmented Generation. 5710-5725 - Pengqi Li, Lizhong Ding, Zhehao Zhou, Chunhui Zhang, Jiarun Fu, Hao Li, Ye Yuan, Guoren Wang:

Demystifying Uncertainty in LLMs: Active Calibration between Concepts and Human Evaluations. 5726-5759 - Haonan Zhang, Dongxia Wang, Yi Liu, Kexin Chen, Wenhai Wang:

LLM-VA: Resolving the Jailbreak-Overrefusal Trade-off via Vector Alignment. 5760-5776 - Yifan Wang, Binbin Liu, Fengze Liu, Yuanfan Guo, Jiyao Deng, Xuecheng Wu, Weidong Zhou, Xiaohuan Zhou, Taifeng Wang:

TiKMiX: Efficient Semi-Dynamic Data Mixture via Data Influence for LLM Pre-training. 5777-5793 - Beomsik Cho, Jaehyung Kim:

Revisit What You See: Revealing Visual Semantics in Vision Tokens to Guide LVLM Decoding. 5794-5824 - Zhihao Ding, Jinming Li, Ze Lu, Jieming Shi:

FlexGuard: Continuous Risk Scoring for Strictness-Adaptive LLM Content Moderation. 5825-5851 - Zhaodan Zhang, Jin Zhang, Jiafeng Guo, Xueqi Cheng:

Modeling Human-Like Cognition for Stance Detection: Integrating Intuitive Judgment and Analytical Reasoning. 5852-5867 - Jiajie Jin, Yuyao Zhang, Yimeng Xu, Hongjin Qian, Yutao Zhu, Zhicheng Dou:

FinSight: Towards Real-World Financial Deep Research. 5868-5894 - Xinyu Zhang, Yuchen Wan, Boxuan Zhang, Zesheng Yang, Lingling Zhang, Bifan Wei, Jun Liu:

Dual-Cluster Memory Agent: Resolving Multi-Paradigm Ambiguity in Optimization Problem Solving. 5895-5908 - Hao Yu, Tianyi Xu, Michael A. Hedderich, Wassim Hamidouche, Syed Waqas Zamir, David Ifeoluwa Adelani:

AfriqueLLM: How Data Mixing and Model Architecture Impact Continued Pre-training for African Languages. 5909-5928 - Shaomu Tan, Dawei Zhu, Ke Tran, Michael J. Denkowski, Sony Trenous, Leonardo F. R. Ribeiro, Bill Byrne, Felix Hieber:

What Does LLM Refinement Actually Improve? A Systematic Study on Document-Level Literary Translation. 5929-5957 - Deming Ding, Shichun Liu, Enhui Yang, Jiahang Lin, Ziying Chen, Shihan Dou, Honglin Guo, Weiyu Cheng, Pengyu Zhao, Chengjun Xiao, Qunhong Zeng, Qi Zhang, Xuanjing Huang, Qidi Xu, Tao Gui:

OctoBench: Benchmarking Scaffold-Aware Instruction Following in Repository-Grounded Agentic Coding. 5958-5978 - Jinwei Hu

, Xinmiao Huang, Youcheng Sun, Yi Dong, Xiaowei Huang:
Lying with Truths: Open-Channel Multi-Agent Collusion for Belief Manipulation via Generative Montage. 5979-5996 - Yi-Fan Lu, Xian-Ling Mao, Bo Wang, Xiao Liu, Heyan Huang:

EXCEEDS: Extracting Complex Events via Nugget-based Grid Modeling in Scientific Domain. 5997-6022 - Zheng Liu, Mengjie Liu, Siwei Wen, Mengzhang Cai, Bin Cui, Conghui He, Wentao Zhang:

Heterogeneous Adaptive Policy Optimization: Tailoring Optimization to Every Token's Nature. 6023-6045 - Tianjun Wei, Huizhong Guo, Yingpeng Du, Zhu Sun, Huang Chen, Dongxia Wang, Jie Zhang:

Mirroring Users: Towards Building Preference-aligned User Simulator with User Feedback in Recommendation. 6046-6071 - Qian Zhang, Xinye Li, Xiaokai Wu, Junhao Xu, Zhanyue Qin, Qingbin Liu, Junxian Cai, Xi Chen, Bolin Zhang, Zhiying Tu, Dianhui Chu, Xiaoyan Yu, Dianbo Sui:

Editing the Moving World: Model Editing for Video LLMs. 6072-6091 - Yuhang Niu, Hongyuan Xu, Ciyi Liu, Bofan Wei, Jiaqi Ye, Yanlong Wen, Xiaojie Yuan:

Bridging the Sensory Gap: Visual Injection for Taxonomy Completion. 6092-6107 - Yang Ji

, Ying Sun:
OCP: Outlier-Centric Probing for Dynamic Structured Pruning of LLMs. 6108-6124 - Zhengxuan Lu, Dongfang Li, Yukun Shi, Beilun Wang, Longyue Wang, Baotian Hu:

Structured Episodic Event Memory. 6125-6141 - Quyu Kong, Xu Zhang, Zhenyu Yang, Nolan Gao, Chen Liu, Panrong Tong, Chenglin Cai, Hanzhang Zhou, Jianan Zhang, Liangyu Chen, Zhidan Liu, Steven Hoi, Yue Wang:

MobileWorld: Benchmarking Autonomous Mobile Agents in Agent-User Interactive and MCP-Augmented Environments. 6142-6167 - Yueqi Xie, Tao Qi, Jingwei Yi, Xiyuan Yang, Ryan Whalen, Junming Huang, Qian Ding, Yu Xie, Xing Xie, Fangzhao Wu:

Measuring Human Contribution in AI-Assisted Content Generation. 6168-6190 - Qingqing Lyu, Linjuan Wu, Yongliang Shen, Hengwei Liu, Hao Li, Shengpei Jiang, Yin Zhang, Weiming Lu:

AutoTaskEval: Towards Domain-Specific and Fine-Grained Evaluation for LLMs. 6191-6223 - Zhiyuan Yao, Zishan Xu, Yifu Guo, Zhiguang Han, Cheng Yang, Shuo Zhang, Weinan Zhang, Xingshan Zeng, Weiwen Liu:

ACE-Router: Generalizing History-Aware Routing from MCP Tools to the Agent Web. 6224-6240 - Yee Man Choi, Xuehang Guo, Yi R. Fung, Qingyun Wang:

CiteGuard: Faithful Citation Attribution for LLMs via Retrieval-Augmented Validation. 6241-6257 - Ling Shi, Xinwei Wu, Xiaohu Zhao, Hao Wang, Heng Liu, Yangyang Liu, Linlong Xu, Longyue Wang, Deyi Xiong, Weihua Luo:

From Insight to Action: A Novel Framework for Interpretability-Guided Data Selection in Large Language Models. 6258-6272 - Junhoo Lee, Seungyeon Kim, Nojun Kwak:

Unlocking the Potential of Diffusion Language Models through Template Infilling. 6273-6287 - Truong Dinh Do, Nguyen-Khang Le, Le-Minh Nguyen:

UniSpec: Training-Free Speculative Decoding for Robust LLM Acceleration Across Languages and Hardware. 6288-6310 - Hao Mi, Qiang Sheng, Shaofei Wang, Beizhe Hu, Yifan Sun, Zhengjia Wang, Hengqi Zeng, Yang Li, Danding Wang, Juan Cao:

Logical Consistency as a Bridge: Improving LLM Hallucination Detection via Label Constraint Modeling between Responses and Self-Judgments. 6311-6330 - Yifan Ji, Zhipeng Xu, Zhenghao Liu, Zulong Chen, Qian Zhang, Zhibo Yang, Junyang Lin, Yu Gu, Ge Yu, Maosong Sun:

UNIKIE-BENCH: Benchmarking Large Multimodal Models for Key Information Extraction in Visual Documents. 6331-6352 - Chiwei Zhu, Benfeng Xu, Mingxuan Du, Shaohan Wang, Xiaorui Wang, Zhendong Mao, Yongdong Zhang:

FS-Researcher: Test-Time Scaling for Long-Horizon Research Tasks with File-System-Based Agents. 6353-6373 - Mutaz Ayesh, Saif M. Mohammad, Nedjma Ousidhoum:

Annotating Dimensions of Social Perception in Text: A Sentence-Level Dataset of Warmth and Competence. 6374-6412 - Junhao Jia, Hanwen Zheng, Yueyi Wu, Huangwei Chen

, Haishuai Wang, Jiajun Bu, Lei Wu
:
SCOUT: Selective Coupling via Optimal Unbalanced Transport for Interpretable Text Classification. 6413-6431 - I-Fan Lin, Faegheh Hasibi, Suzan Verberne:

LLMs Enable Bag-of-Texts Representations for Short-Text Clustering. 6432-6447 - Ziyi Wang, Chen Zhang, Wenjun Peng, Qi Wu, Xinyu Wang:

TriEx: A Game-based Tri-View Framework for Explaining Internal Reasoning in Multi-Agent LLMs. 6448-6479 - Fanxiao Li, Jiaying Wu, Tingchao Fu, Dayang Li, Herun Wan, Wei Zhou, Min-Yen Kan:

What's Left Unsaid? Detecting and Correcting Misleading Omissions in Multimodal News Previews. 6480-6502 - Haoran Li, Yulin Chen, Huihao Jing, Wenbin Hu, Tsz Ho Li, Chanhou Lou, Hong Ting Tsang, Sirui Han, Yangqiu Song:

ContextLens: Modeling Imperfect Privacy and Safety Context for Legal Compliance. 6503-6518 - Huawei Zheng, Xinqi Jiang, Sen Yang, Shouling Ji, Yingcai Wu, Dazhen Deng:

StealthGraph: Exposing Domain-Specific Risks in LLMs through Knowledge-Graph-Guided Harmful Prompt Generation. 6519-6539 - Wentao Shi, Zichun Yu, Fuli Feng, Xiangnan He, Chenyan Xiong:

Efficient Multi-Agent System Training with Data Influence-Oriented Tree Search. 6540-6558 - Haoliang Huang, Zihuang Cai, Zhuo Tang, Yifan Liu, Chen Tian, Kenli Li, Changjian Chen:

Integrating Data Validation with Large Language Models for Regulation-Guided Tabular Anomaly Detection. 6559-6581 - Linhao Zhong, Linyu Wu, Wen Wang, Yuling Xi, Chenchen Jing, Jiaheng Zhang, Hao Chen, Chunhua Shen:

Efficient Self-Evaluation for Diffusion Language Models via Sequence Regeneration. 6582-6602 - Rongqing Jiang, Xuebo Liu, Shengxin Liu, Yutong Wang, Min Zhang, Shimin Tao, Daimeng Wei:

DeReA: Improving Idiom Translation with Detect-Retrieve-Arbitrate Reasoning. 6603-6621 - Bar Alon, Itamar Zimerman, Lior Wolf:

Faithful Serum: Mitigating the Faithfulness Gap in Textual Explanations of LLM Decisions via Attribution Guidance. 6622-6645 - Zengbin Wang, Feng Xiong, Liang Lin, Xuecai Hu, Yong Wang, Yanlin Wang, Man Zhang, Xiangxiang Chu:

Visually-Guided Policy Optimization for Multimodal Reasoning. 6646-6664 - Ruwen Zhang, Bo Liu, Zhang Sheng Xiang, Yida Chen, Hantao Zhao, Ding Ding, Jiahui Jin, Jiuxin Cao:

Don't Be Misled by Style: A Style-Adaptive Reranker for Capturing Effective Knowledge in Retrieval-Augmented Generation. 6665-6681 - Jonas Gottal, Florian Matthes:

Text2Tabular - Reconstructing Tabular Research Data from Scientific Publications. 6682-6697 - Rui Ha, Rui Pu, Chaozhuo Li, Li Sun, Sen Su:

From "Aha Moments" to Controllable Thinking: Toward Meta-Cognitive Reasoning in LRMs via Decoupled Reasoning and Control. 6698-6710 - Shanwen Tan, Ziyang Dong, Wei Ju, Yiwei Fu

, Hao Wu, Kun Wang, Yifan Wang, Ziyue Qiao:
Calibrating Inference Time Alignment with Sequence-level Risk Accumulation. 6711-6735 - Xinchen Ma, Gaole He, Yunshi Lan, Weining Qian:

Diff4TST: Masked Diffusion Language Model for Text Style Transfer. 6736-6748 - Hiba Arnaout, Noy Sternlicht, Tom Hope, Iryna Gurevych:

In-depth Research Impact Summarization through Fine-Grained Temporal Citation Analysis. 6749-6789 - Junlin Zhu, Baizhou Huang, Xiaojun Wan:

QuantileMark: A Message-Symmetric Multi-bit Watermark for LLMs. 6790-6806 - Verena Blaschke, Miriam Winkler, Barbara Plank:

Standard-to-Dialect Transfer Trends Differ across Text and Speech: A Case Study on Intent and Topic Classification in German Dialects. 6807-6829 - Yilin Zhang, Yingkai Hua, Chunyu Wei, Xin Wang, Yueguo Chen:

Don't Click That: Teaching Web Agents to Resist Deceptive Interfaces. 6830-6852 - Pengcheng Huang, Tianming Liu, Zhenghao Liu, Yukun Yan, Shuo Wang, Tong Xiao, Zulong Chen, Maosong Sun:

Empirical Analysis of Decoding Biases in Masked Diffusion Models. 6853-6876 - Xin Wang, Jiahao Li, Licheng Zhang, Zhendong Mao:

LAFaCT: Attribution-based Localization and Focused Sequential Analysis of Fact-Critical Tokens for Hallucination Detection. 6877-6896 - Boyan Li, Ou Ocean Kun Hei, Yue Yu, Yuyu Luo:

DPC: Training-Free Text-to-SQL Candidate Selection via Dual-Paradigm Consistency. 6897-6913 - Qianyu He, Junting Lu, Yikai Zhang, Siyu Yuan, Xiaojun Meng, Jiansheng Wei, Jiaqing Liang, Yanghua Xiao:

Metaphor Reasoning is Meta-reasoning. 6914-6935 - Linhao Zhong, Linyu Wu, Bozhen Fang, Tianjian Feng, Chenchen Jing, Wen Wang, Jiaheng Zhang, Hao Chen, Chunhua Shen:

Beyond Hard Masks: Progressive Token Evolution for Diffusion Language Models. 6936-6959 - Pengxiang Zhao, Guangyi Liu, Yaozhen Liang, Weiqing He, Zhengxi Lu, WenHao Wang, Yuehao Huang, Yuxiang Chai, Zhaolu Kang, Yaxuan Guo, Hao Wang, Kexin Zhang, Liang Liu, Yong Liu:

MAS-Bench: A Unified Benchmark for Shortcut-Augmented Hybrid Mobile GUI Agents. 6960-6985 - Andrew Zhuoer Feng, Cunxiang Wang, Yu Luo, Lin Fan, Irene Zhou, Zikang Wang, Xiaotao Gu, Jie Tang, Hongning Wang, Minlie Huang:

HoWToBench: Holistic Evaluation for LLM's Capability in Human-level Writing using Tree of Writing. 6986-7034 - Shuai Zhen, Yanhua Yu, Ruopei Guo, Nan Cheng, Yang Deng:

Hierarchical Reinforcement Learning with Augmented Step-Level Transitions for LLM Agents. 7035-7053 - Diandian Guo, Cong Cao, Fangfang Yuan, Pin Xu, Cheng Hu, Zhicheng Zhang, Yu Liu

, Yanbing Liu:
Two Streams, One Sarcasm: Orthogonal Expert Tuning for Holistic Multimodal Sarcasm Understanding. 7054-7072 - Renyu Fu, Guibo Luo:

SeLaR: Selective Latent Reasoning in Large Language Models. 7073-7087 - Hongru Ji, Yuyin Fan, Meng Zhao, Xianghua Li, Lianwei Wu, Chao Gao:

STRIDE-ED: A Strategy-Grounded Stepwise Reasoning Framework for Empathetic Dialogue Systems. 7088-7102 - Jiarui Ji, Zehua Zhang, Zhewei Wei, Bin Tong, Guan Wang, Bo Zheng:

GRAPHIA: Harnessing Social Graph Data to Enhance LLM-Based Social Simulation. 7103-7128 - Peihua Mai, Xuanrong Gao, Youlong Ding, Xianglong Du, Wei Liu, Yan Pang:

SharedRequest: Privacy-Preserving Model-Agnostic Inference for Large Language Models. 7129-7150 - Huidong Ma, Xinyan Shi, Hui Sun, Xiaofei Yue, Xiaoguang Liu, Gang Wang, Wentong Cai:

Efficient Learned Data Compression via Dual-Stream Feature Decoupling. 7151-7164 - Zechen Li, Qiannan Zhu, Mei Wang, Jia Li, Hua Huang:

Planning-Guided Tutoring with Assessment-Driven Memory for Pedagogical LLM Tutors. 7165-7188 - Tao Zhang, Ziqian Zeng, Hao Peng, Huiping Zhuang, Cen Chen:

MixKVQ: Query-Aware Mixed-Precision KV Cache Quantization for Long-Context Reasoning. 7189-7204 - Sichu Liang, Zhenglin Wang, Jiajia Chu, Pengfei Xia, Hui Zang, Deyu Zhou:

When KV Cache Reuse Fails in Multi-Agent Systems: Cross-Candidate Interaction is Crucial for LLM Judges. 7205-7230 - Hanzhang Yuan, Mengxuan Hu, Wenhao Zhang, Tianlong Wang, Zhongliang Zhou, Jiasen Lu, Sheng Li:

Reducing Token Redundancy in LVLMs: A Systematic Review of Token Pruning Methods. 7231-7251 - Peng Yu, En Xu, Bin Chen, Haibiao Chen, Yinfei Xu:

STEM: Structure-Tracing Evidence Mining for Knowledge Graphs-Driven Retrieval-Augmented Generation. 7252-7285 - Bingyu Yan, Xiaoming Zhang, Jinyu Hou, Chaozhuo Li, Ziyi Zhou, Yiming Hei, Litian Zhang:

Evo-Attacker: Memory-Augmented Reinforcement Learning for Long-Horizon Tool Attacks on LLM-MAS. 7286-7300 - Xinying Qian, Ying Zhang, Xuhui Sui, Yu Zhao, Baohang Zhou, Jeff Z. Pan:

Beyond Timestamps: Bridging Forward and Backward Reasoning in Temporal Numerical and Relational Understanding. 7301-7321 - Dongyi Lv, Qiuyu Ding, Heng-Da Xu, Zhaoxu Sun, Zhi Wang, Feng Xiong, Mu Xu:

Reasoning Over Space: Enabling Geographic Reasoning for LLM-Based Generative Next POI Recommendation. 7322-7336 - Yifei Chen, Guanting Dong, Zhicheng Dou:

ET-Agent: Incentivizing Effective Tool-Integrated Reasoning Agent via Behavior Calibration. 7337-7359 - Huanxuan Liao, Shizhu He, Yupu Hao, Yequan Wang, Wenhao Teng, Xiangwen Liao, Jun Zhao, Kang Liu:

Spectral Disentanglement: Rank-Aware Task Adaptation for Rehearsal-free Continual Learning in LLMs. 7360-7376 - Yinger Zhang, Shutong Jiang, Renhao Li, Jianhong Tu, Yang Su, Lianghao Deng, Xudong Guo, Chenxu Lv, Junyang Lin:

DeepPlanning: Benchmarking Long-Horizon Agentic Planning with Verifiable Constraints. 7377-7407 - Hao Li, Yizheng Sun, Viktor Schlegel, Kailai Yang, Riza Batista-Navarro, Goran Nenadic:

Arg-LLaDA: Argument Summarization via Large Language Diffusion Models and Sufficiency-Aware Refinement. 7408-7421 - Keyu Li, Junhao Shi, Yang Xiao, Mohan Jiang, Jie Sun, Yunze Wu, Dayuan Fu, Shijie Xia, Xiaojie Cai, Tianze Xu, Weiye Si, Wenjie Li, Dequan Wang, Pengfei Liu:

AgencyBench: Benchmarking the Frontiers of Autonomous Agents in 1M-Token Real-World Contexts. 7422-7440 - Dan Wang, Guozhao Mo, Yafei Shi, Cheng Zhang, Bo Zheng, Boxi Cao, Xuanang Chen, Yaojie Lu, Hongyu Lin, Ben He, Xianpei Han, Le Sun:

All Languages Matter: Understanding and Mitigating Language Bias in Multilingual RAG. 7441-7455 - Qisheng Su, Shiting Huang, Zhen Fang, Ziyan Chen, Zehui Chen, Feng Zhao:

Beyond Accuracy: Unveiling Inefficiency Patterns in Tool-Integrated Reasoning. 7456-7477 - Wang Cai, Yilin Wen, Jinchang Hou, Du Su, Guoqiu Wang, Zhonghou Lv, Chenfu Bao, Yunfang Wu:

Safety-Utility Conflicts Are Not Global: Surgical Alignment via Head-Level Diagnosis. 7478-7496 - Chenglin Li, Feng Han, Yikun Wang, Ruilin Li, Shuai Dong, Haowen Hou, Haitao Li, Qianglong Chen, Feng Tao, Jingqi Tong, Yin Zhang, Jiaqi Wang:

VideoPro: Adaptive Program Reasoning for Long Video Understanding. 7497-7513 - Negar Foroutan, Clara Meister, Debjit Paul, Joel Niklaus, Sina Ahmadi, Antoine Bosselut, Rico Sennrich:

Parity-Aware Byte-Pair Encoding: Improving Cross-lingual Fairness in Tokenization. 7514-7538 - Nianyi Lin, Jiajie Zhang, Lei Hou, Juanzi Li:

Boundary-Guided Policy Optimization for Memory-efficient RL of Diffusion Large Language Models. 7539-7550 - Zheng Liu, Honglin Lin, Xiaoyang Wang, Xin Gao, Yu Li, Mengzhang Cai, Yun Zhu, Zhanping Zhong, Qizhi Pei, Zhuoshi Pan, Xiaoran Shang, Conghui He, Bin Cui, Wentao Zhang, Lijun Wu:

ChartVerse: Scaling Chart Reasoning via Reliable Programmatic Synthesis from Scratch. 7551-7577 - Zhongtao Miao, Kaiyan Zhao, Masaaki Nagata, Yoshimasa Tsuruoka:

NeoAMT: Neologism-Aware Agentic Machine Translation with Reinforcement Learning. 7578-7601 - Weiqi Wang, Jiefu Ou, Yangqiu Song, Benjamin Van Durme, Daniel Khashabi:

arXiv2Table: Toward Realistic Benchmarking and Evaluation for LLM-Based Literature-Review Table Generation. 7602-7624 - Hiba Arnaout, Anmol Goel, H. Andrew Schwartz, Steffen Eberhardt, Dana Atzil-Slonim, Gavin Doherty, Brian Schwartz, Wolfgang Lutz, Tim Althoff, Munmun De Choudhury, Hamidreza Jamalabadi, Raj Sanjay Shah, Flor Miriam Plaza del Arco, Dirk Hovy, Maria Liakata, Iryna Gurevych:

Responsible Evaluation of AI for Mental Health. 7625-7660 - Xi Wang, Songlei Jian, Shasha Li, Xiaopeng Li, Zhaoye Li, Bin Ji, Baosheng Wang, Jie Yu:

JPU: Bridging Jailbreak Defense and Unlearning via On-Policy Path Rectification. 7661-7674 - Hui Wang, Jinghua Zhao, Yifan Yang, Shujie Liu, Junyang Chen, Yanzhe Zhang, Shiwan Zhao, Jinyu Li, Jiaming Zhou, Haoqin Sun, Yan Lu, Yong Qin:

SpeechLLM-as-Judges: Towards General and Interpretable Speech Quality Evaluation. 7675-7700 - Fanyu Wang, Xiaoxi Kang, Paul Burgess, Aashish Srivastava, Chetan Arora, Adnan Trakic, Lay-Ki Soon, Md Khalid Hossain, Lizhen Qu:

LePREC: Reasoning as Classification over Structured Factors for Assessing Relevance of Legal Issues. 7701-7736 - Yu Zhang, Songwei Liu, Chenqian Yan, Sheng Lin, Beichen Ning, Fangmin Chen, Xing Wang:

S2O: Early Stopping for Sparse Attention via Online Permutation. 7737-7751 - Boyu Guan, Chuang Han, Yang Zhao, Chengqing Zong:

DART: Disambiguation-Aware Reasoning for Video-guided Machine Translation. 7752-7772 - Yizhou Zhang, Siming Chen, Hao Ye, Erhu Feng:

HCSpec: Two-Tier Horizontal Cascade Speculative Decoding for High-Efficiency Large Language Model Inference. 7773-7783 - Jianshuo Dong, Yutong Zhang, Liu Yan, Zhenyu Zhong, Tao Wei, Chao Zhang, Han Qiu:

Revisiting the Reliability of Language Models in Instruction-Following. 7784-7812 - Xingrun Xing, Zheng Liu, Shitao Xiao, Boyan Gao, Yiming Liang, Haokun Lin, Xianlin Zeng, Guoqi Li, Jiajun Zhang:

EfficientLLM: Unified Pruning-Aware Pretraining for Auto-Designed Compact Language Models. 7813-7830 - Tianyi Wang, Yixia Li, Long Li, Yibiao Chen, Shaohan Huang, Yun Chen, Peng Li, Yang Liu, Guanhua Chen:

SPPO: Sequence-Level PPO for Long-Horizon Reasoning Tasks. 7831-7853 - Ao Wang, Xinghao Yang, Yongshun Gong, Wei Liu, Bao-di Liu, Weifeng Liu:

Enhancing the Transferability of Jailbreak Attacks on Large Language Models via Exploiting Reparameterization Invariance. 7854-7865 - Zhiwen Ruan, Yichao Du, Jianjie Zheng, Longyue Wang, Yun Chen, Peng Li, Jinsong Su, Yang Liu, Guanhua Chen:

GIFT: Guided Fine-Tuning and Transfer for Enhancing Instruction-Tuned Language Models. 7866-7878 - Taolin Zhang, Dongyang Li, Chen Chen, Qizhou Chen, Jiuheng Wan, Xiaofeng He, Chengyu Wang, Richang Hong:

AMATA: Adaptive Multi-Agent Trajectory Alignment for Knowledge-Intensive Question Answering. 7879-7900 - Jincheng Liu, Sijun He, Jingjing Wu, Xiangsen Wang, Yang Chen, Zhaoqi Kuang, Siqi Bao, Yuan Yao:

ChessArena: A Chess Testbed for Evaluating Strategic Reasoning Capabilities of Large Language Models. 7901-7954 - Jiajun Zhang, Zeyu Cui, Jiaxi Yang, Lei Zhang, Yuheng Jing, Zeyao Ma, Tianyi Bai, Zilei Wang, Qiang Liu, Liang Wang, Binyuan Hui, Junyang Lin:

From Completion to Editing: Unlocking Context-Aware Code Infilling via Search-and-Replace Instruction Tuning. 7955-7984 - Powei Chang, Jin Xiao, Guanglei Yue, Qianyu He, Yanghua Xiao, Deqing Yang, Jiaqing Liang:

What Makes an Ideal Quote? Recommending "Unexpected yet Rational" Quotations via Novelty. 7985-8017 - Chenming Tang, Hsiu-Yuan Huang, Weijie Liu, Clive Bai, Saiyong Yang, Yunfang Wu:

Do Not Step Into the Same River Twice: Learning to Reason from Trial and Error. 8018-8032 - Wenshuo Wang, Boyu Cao, Nan Zhuang, Wei Li:

iTAG: Inverse Design for Natural Text Generation with Accurate Causal Graph Annotations. 8033-8063 - Zhuoen Chen, Dongfang Li, Meishan Zhang, Baotian Hu, Min Zhang:

Dynamic Long Context Reasoning over Compressed Memory via End-to-End Reinforcement Learning. 8064-8083 - Yixia Li, Hongru Wang, Jiahao Qiu, Zhenfei Yin, Dongdong Zhang, Cheng Qian, Zeping Li, Xiaoteng Ma, Guanhua Chen, Heng Ji:

From Word to World: Can Large Language Models be Implicit Text-based World Models? 8084-8111 - Xiangdong Hu, Yangyang Jiang, Qin Hu, Xiaojun Jia:

GAMBIT: A Gamified Jailbreak Framework for Multimodal Large Language Models. 8112-8129 - Jiahang Sun, Zhiyong Wang, Runhan Yang, Chenjun Xiao, John C. S. Lui, Zhongxiang Dai:

Large Language Model-Enhanced Multi-Armed Bandits. 8130-8145 - Wenrui Zhou, Mohamed Hendy, Shu Yang, Qingsong Yang, Zikun Guo, Yuyu Luo, Lijie Hu, Di Wang:

Flattery in Motion: Benchmarking and Analyzing Sycophancy in Video-LLMs. 8146-8172 - Yiting Shen, Kun Li, Wei Zhou, Songlin Hu:

Mem2ActBench: A Benchmark for Evaluating Long-Term Memory Utilization in Task-Oriented Autonomous Agents. 8173-8190 - Jiawei Zhou, Hang Ding, Haiyun Jiang:

ARK: Answer-Centric Retriever Tuning via KG-augmented Curriculum Learning. 8191-8208 - Yuan Ge, Haishu Zhao, Aokai Hao, Junxiang Zhang, Bei Li, Xiaoqian Liu, Chenglong Wang, Jianjin Wang, Bingsen Zhou, Bingyu Liu, JingBo Zhu, Zhengtao Yu, Tong Xiao:

On the Emotion Understanding of Synthesized Speech. 8209-8223 - Taolin Zhang, Pukun Zhao, Qizhou Chen, Jiuheng Wan, Chen Chen, Xiaofeng He, Chengyu Wang, Richang Hong:

Taming "Zombie" Agents: A Markov State-Aware Framework for Resilient Multi-Agent Evolution. 8224-8243 - Yunjia Xi, Jianghao Lin, Yongzhao Xiao, Zheli Zhou, Rong Shan, Te Gao, Jiachen Zhu, Weiwen Liu, Yong Yu, Weinan Zhang:

A Survey of Large Language Model-Based Search Agents. 8244-8279 - Yidan Liang, Jia Zhu, Weijie Shi, Hanghui Guo, Yue Cui, Jiawei Shen, Guoqing Ma, Jingjiang Liu, Qingyu Niu, Yilin Wang, Shimin Di, Jiajie Xu:

RSDA: Restoring Stale Data Affinity via Dynamic Renovation Strategy for Mitigating Data Scarcity. 8280-8309 - Chenlong Yin, Zeyang Sha, Shiwen Cui, Changhua Meng, Zechao Li:

The Reasoning Trap: How Enhancing LLM Reasoning Amplifies Tool Hallucination. 8310-8328 - Jonathan Tonglet, Tinne Tuytelaars, Marie-Francine Moens, Iryna Gurevych:

Protecting multimodal large language models against misleading visualizations. 8329-8349 - Luoyang Sun, Guangyan Li, Cheng Deng, Haifeng Zhang, Jian Zhao, Yongqiang Tang, Wensheng Zhang, Jun Wang:

Dual Activation-Weight Sparsity: A Training-Free Framework for Efficient Large Language Model Compression. 8350-8366 - Kumiko Tanaka-Ishii:

Repeated Sequences Reveal Gaps between Large Language Models and Natural Language. 8367-8382 - Lisa Alazraki, Lihu Chen, Ana Brassard, Joe Stacey, Hossein A. Rahmani, Marek Rei:

AgentCoMa: A Compositional Benchmark Mixing Commonsense and Mathematical Reasoning in Real-World Scenarios. 8383-8410 - Haowei Zhang, Shudong Yang, Jinlan Fu, See-Kiong Ng, Xipeng Qiu:

HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding. 8411-8430 - Wenrui Cai, Chengyu Wang, Junbing Yan, Jun Huang, Xiangzhong Fang:

Reasoning with OmniThought: A Large CoT Dataset with Verbosity and Cognitive Difficulty Annotations. 8431-8450 - Haochen Shi, Tianshi Zheng, Weiqi Wang, Baixuan Xu, Chunyang Li, Chunkit Chan, Tao Fan, Yangqiu Song:

InferenceDynamics: Adaptive LLM Routing through Structured Capability and Knowledge Profiling. 8451-8469 - Jujia Zhao, Zhaoxin Huan, Zihan Wang, Xiaolu Zhang, Jun Zhou, Suzan Verberne, Zhaochun Ren:

ReportLogic: Evaluating Logical Quality in Deep Research Reports. 8470-8502 - Yuanbo Xie, Yingjie Zhang, Yulin Li, Shouyou Song, Xiaokun Chen, Zhihan Liu, Liya Su, Tingwen Liu:

Detecting RAG Extraction Attack via Dual-Path Runtime Integrity Game. 8503-8518 - Rajvee Sheth

, Samridhi Raj Sinha, Mahavir Patil, Himanshu Beniwal, Mayank Singh:
Beyond Monolingual Assumptions: A Survey on Code-Switched NLP in the Era of Large Language Models across Modalities. 8519-8566 - Zhuoran Jin, Kejian Zhu, Hongbang Yuan, Yupu Hao, Pengfei Cao, Yubo Chen, Kang Liu, Jun Zhao:

Look Light, Think Heavy: What Multimodal Chain-of-Thought Reasoning Can and Cannot Do. 8567-8608 - Haoqian Meng, Yilun Luo, Yafei Zhao, Wenyuan Liu, Peng Zhang, Xindian Ma:

ARCQuant: Boosting NVFP4 Quantization with Augmented Residual Channels for LLMs. 8609-8623 - Taiqiang Wu, Runming Yang, Tao Liu, Jiahao Wang, Ngai Wong:

Revisiting Model Interpolation for Efficient Reasoning. 8624-8638 - Yizhe Zeng, Wei Zhang, Yunpeng Li, Juxin Xiao, Xiao Wang, Yuling Liu:

MirageBackdoor: A Stealthy Attack that Induces Think-Well-Answer-Wrong Reasoning. 8639-8659 - Zihan Wu, Jie Xu, Yun Peng, Chun Yong Chong, Xiaohua Jia:

MulVul: Retrieval-augmented Multi-Agent Code Vulnerability Detection via Cross-Model Prompt Evolution. 8660-8673 - Ying Zhan, Xiuqi Tang, Yan Zhang, Xiao Tan, Dian Shen, Zhou Yu, Beilun Wang:

LiGen: Active Lipid Generation via a Molecular Language Model. 8674-8686 - Lintang Sutawika, Gokul Swamy, Steven Wu, Graham Neubig:

Gained in Translation: Privileged Pairwise Judges Enhance Multilingual Reasoning. 8687-8705 - Jiameng Huang, Zhi Zhang, Zhenyu He, Jiacheng Sun, Di He:

Ted-Tok: Maintaining an Evolving Vocabulary for Lifelong Learning. 8706-8719 - Boyu Xiao, Xiuqi Tian, Xuwen Song, Haochun Wang, Guanchun Song, Sendong Zhao, Bing Qin:

When Correct Beliefs Collapse: Epistemic Resilience of LLMs under Clinical Pressure. 8720-8764 - Fabian Retkowski, Maike Züfle, Thai-Binh Nguyen, Jan Niehues, Alexander Waibel:

Beyond Transcripts: A Renewed Perspective on Audio Chaptering. 8765-8787 - Wuttikorn Ponwitayarat, Peerat Limkonchotiwat, Raymond Ng, Jann Railey Montalan, Thura Aung, Jian Gang Ngui, Yosephine Susanto, William-Chandra Tjhi, Panuthep Tasawong, Erik Cambria, Ekapol Chuangsuwanich, Sarana Nutanong:

SEA-BED: How Do Embedding Models Represent Southeast Asian Languages? 8788-8822 - Jonathan Tonglet, Jan Zimny, Tinne Tuytelaars, Iryna Gurevych:

Is this chart lying to me? Automating the detection of misleading visualizations. 8823-8844 - Jia Li, Yuxin Su, Michael R. Lyu:

From Laboratory to Real-World Applications: Benchmarking Agentic Code Reasoning at the Repository Level. 8845-8869 - Anmol Goel, Cornelius Emde, Seong Joon Oh, Sangdoo Yun, Martin Gubri

:
Privacy Collapse: Benign Fine-Tuning Can Break Contextual Privacy in Language Models. 8870-8892 - Wei Zhu, Jian Zhang, Lixing Yu, Kun Yue, Zhiwen Tang:

Dissecting Failure Dynamics in Large Language Model Reasoning. 8893-8914 - Zhensheng Luo, Sai Wu, Yuan Qiu, Chang Yao, Gang Chen, Xiu Tang:

QBridge: Bridging Natural Language and SQL via Gold Query Rewriting with Agentic Refinement. 8915-8933 - Zixuan Zhou, Yujun Diao, Zicheng Kong, Dehua Ma, Zhenbo Xu, Pei Pei Li, Zhaofeng He:

SCVQ: Sparse-Compensated Vector Quantization for Large Language Models. 8934-8950 - Cheng-Han Chiang, Xiaofei Wang, Linjie Li, Chung-Ching Lin, Kevin Lin, Shujie Liu, Zhendong Wang, Zhengyuan Yang, Hung-yi Lee, Lijuan Wang:

Shanks: Simultaneous Hearing and Thinking for Spoken Language Models. 8951-8972 - Xinyuan Wang, Luozhijie Jin, Bo Wang, Yuan Li, Zhangyue Yin, Xipeng Qiu:

Efficient KL Divergence Estimation via Truncated Top-K Integration for Large Language Models. 8973-8985 - Wei Cai, Jian Zhao, Yuchen Yuan, Tianle Zhang, Ming Zhu, Haichuan Tang, Xuelong Li:

Visual Attention Reasoning via Hierarchical Search and Self-Verification. 8986-8997 - Yixia Li, Yaqing Shi, Zhiwen Ruan, Dongdong Zhang, Lingjie Jiang, Shaohan Huang, Yun Chen, Guanhua Chen, Furu Wei:

VFA: Empowering Multilingual MLLMs via Vision-Free Adaptation. 8998-9015 - Ziji Sheng, Guiyao Tie, Weidong Wang, Pan Zhou, Daizong Liu:

LearnerCoMPASS: Intelligent Tutoring System with Dynamic Cognitive Diagnosis and Multi-Model Path Planning. 9016-9042 - Ziyao Xu, Cong Wang, Houfeng Wang:

Investigating More Explainable and Partition-Free Compositionality Estimation for LLMs: A Rule-Generation Perspective. 9043-9060 - Peter Zeng, Weiling Li, Amie J. Paige, Zhengxiang Wang, Panagiotis Kaliosis, Dimitris Samaras, Gregory J. Zelinsky, Susan Brennan, Owen Rambow:

LVLMs and Humans Ground Differently in Referential Communication. 9061-9087 - Tianrui Wang, Ziyang Ma, Yizhou Peng, Haoyu Wang, Zhikang Niu, Zikang Huang, Yihao Wu, Yi-Wen Chao, Yu Jiang, Yuheng Lu, Guanrou Yang, Xuanchen Li, Hexin Liu, Chunyu Qiang, Cheng Gong, Yifan Yang, Tianchi Liu, Junyu Wang, Nana Hou, Meng Ge, Fuming You, Yang Wei, Zhongqian Sun, Haifeng Hu, Xiaobao Wang, Eng Siong Chng, Xie Chen, Longbiao Wang, Jianwu Dang:

Evaluating the Expressive Appropriateness of Speech in Rich Contexts. 9088-9106 - Zhenyu Liu, Yunxin Li, Xuanyu Zhang, Qixun Teng, Shenyuan Jiang, Xinyu Chen, Haoyuan Shi, Haolan Chen, Fanbo Meng, Mingjun Zhao, Yu Xu, Yancheng He, Baotian Hu, Haizhou Li, Min Zhang:

UniMoE-Audio: Unified Speech and Music Generation with Dynamic-Capacity Mixture-of-Experts. 9107-9119 - Tiancheng Xing, Jerry Li, Yixuan Du, Xiyang Hu:

Are LLMs Reliable Rankers? Rank Manipulation via Two-Stage Token Optimization. 9120-9132 - Jingjiang Liu, Jia Zhu, Hanghui Guo, Weijie Shi, Yue Cui, Xiaokang Jin

, Yilin Wang, Qingyu Niu, Jiawei Shen, Guoqing Ma, Yidan Liang, Shimin Di, Jiajie Xu:
KCVR: Knowledge-Centric Video Reconstruction for Structured Pedagogical Summarization via Dynamic Graph Planning. 9133-9160 - Zhiyuan Peng, Xin Yin, Pu Zhao, Fangkai Yang, Lu Wang, Ran Jia, Xu Chen, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang:

RepoGenesis: Benchmarking End-to-End Microservice Generation from Readme to Repository. 9161-9189 - Haotian Xu, Yue Hu, Zhengqiu Zhu, Chen Gao, Ziyou Wang, Junreng Rao, Wenhao Lu, Weishi Li, Quanjun Yin, Yong Li:

CityCube: Benchmarking Cross-view Spatial Reasoning on Vision-Language Models in Urban Environments. 9190-9215 - Xingchi Chen, Peiyuan Zong, Ziqiang Gao, Qing Li, Yong Jiang, Fa Zhu

, Hui Li:
ContrastKV: Robust KV Cache Eviction via Contrastive Signal Fusion for Multi-Query Generalization. 9216-9229 - Pankayaraj Pathmanathan, Furong Huang:

Teach a Reward Model to Correct Itself: Reward Guided Adversarial Failure Discovery for Robust Reward Modeling. 9230-9263 - Zhenyu Liu, Xuanyu Zhang, Yunxin Li, Qixun Teng, Shenyuan Jiang, Haolan Chen, Mingjun Zhao, Fanbo Meng, Yu Xu, Yancheng He, Baotian Hu, Haizhou Li, Min Zhang:

Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs. 9264-9280 - Huawei Ji, Yuanhao Sun, Yuan Jin, Cheng Deng, Jiaxin Ding, Luoyi Fu, Xinbing Wang:

VisPCO: Visual Token Pruning Configuration Optimization via Budget-Aware Pareto-Frontier Learning for Vision-Language Models. 9281-9301 - Mengfan Li, Xuanhua Shi, Yang Deng:

CoSToM: Causal-oriented Steering for Intrinsic Theory-of-Mind Alignment in Large Language Models. 9302-9317 - Morris Alper, Moran Yanuka, Raja Giryes, Gasper Begus

:
ConlangCrafter: Constructing Languages with a Multi-Hop LLM Pipeline. 9318-9349 - Yitian Gong, Luozhijie Jin, Kuangwei Chen, Dong Zhang, Ruifan Deng, Xiaogui Yang, Xin Zhang, Zhaoye Fei, Qinyuan Cheng, Shimin Li, Xipeng Qiu:

XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs. 9350-9369 - Xinwei Yang, Junyi Fan, Yuqing Liu, Jiaxuan Wang, Jiashuai Zhang, Hongru Liang, Wenqiang Lei, Yao Song:

Empathy in Diversity: Personalized Depression and Anxiety Therapy via Dialogue State Tracking and Patient-Aware Planning. 9370-9416 - Rui Hu, Delai Qiu, Yining Wang, Shengping Liu, Jitao Sang:

VAPO: End-to-end Slide-Enhanced Speech Recognition with Omni-modal Large Language Models. 9417-9432 - Ruyuan Wan, Changye Li

, Ting-Hao 'Kenneth' Huang:
"Newspaper Eat" Means "Not Tasty": A Taxonomy and Benchmark for Coded Language in Real-World Chinese Online Reviews. 9433-9446 - Kailai Yang, Xiao Liu, Lei Ji, Hao Li, Xiao Liang, Zhiwei Liu, Yeyun Gong, Peng Cheng, Mao Yang:

Data Mixing Agent: Learning to Re-weight Domains for Continual Pre-training. 9447-9473 - Zhengxi Lu, Jiabo Ye, Fei Tang, Yongliang Shen, Haiyang Xu, Ziwei Zheng, Weiming Lu, Ming Yan, Fei Huang, Jun Xiao, Yueting Zhuang:

Experience-driven Multi-turn Reinforcement Learning for GUI Agents. 9474-9496 - Xiaofan Zheng, Xinghao Wang, Xiaojun Wan:

UMMF: Protecting Copyright of Large Vision-Language Models through Unlearning-based Multimodal Memorization Fingerprint. 9497-9513 - Ahmad Mustapha Wali, Sergiu Nisioi

:
Automatic Correction of Writing Anomalies in Hausa Texts. 9514-9528 - Qiushi Sun, Mukai Li, Zhoumianze Liu, Zhihui Xie, Fangzhi Xu, Zhangyue Yin, Kanzhi Cheng, Zehao Li, Zichen Ding, Qi Liu, Zhiyong Wu, Zhuosheng Zhang, Ben Kao, Lingpeng Kong:

OS-Sentinel: Towards Safety-Enhanced Mobile GUI Agents via Hybrid Validation in Realistic Workflows. 9529-9553 - Zhihao Xu, Fuzhen Yang, Liang Lin, Xiting Wang:

PAM: Enhancing General Alignment of Large Reasoning Models through Priority-Aware Metacognition. 9554-9573 - Qi Jia, Ye Shen, Xiujie Song, Kaiwei Zhang, Shibo Wang, Dun Pei, Xiangyang Zhu, Guangtao Zhai:

One Battle After Another: Probing LLMs' Limits on Multi-Turn Instruction Following with a Benchmark Evolving Framework. 9574-9590 - Guanran Luo, Wentao Qiu, Wanru Zhao, Wenhan Lv, Zhongquan Jian, Meihong Wang, Qingqiang Wu:

AGSC: Adaptive Granularity and Semantic Clustering for Uncertainty Quantification in Long-text Generation. 9591-9605 - Yu Li, Xiaoran Shang, Qizhi Pei, Yun Zhu, Xin Gao, Honglin Lin, Zhanping Zhong, Zhuoshi Pan, Zheng Liu, Xiaoyang Wang, Conghui He, Dahua Lin, Feng Zhao, Lijun Wu:

Tracing the Roots: A Multi-Agent Framework for Uncovering Data Lineage in Post-Training LLMs. 9606-9625 - Jonathan Drechsel, Erisa Bytyqi, Steffen Herbold:

Understanding or Memorizing? A Case Study of German Definite Articles in Language Models. 9626-9652 - Baihui Liu, Kaiyuan Tian, Wei Wang, Zhaoning Zhang, Linbo Qiao, Dongsheng Li:

Alloc-MoE: Budget-Aware Expert Activation Allocation for Efficient Mixture-of-Experts Inference. 9653-9667 - Qiushi Sun, Jingyang Gong, Lei Li, Qipeng Guo, Fei Yuan:

CodeEvo: Interaction-Driven Synthesis of Code-centric Data through Hybrid and Iterative Feedback. 9668-9687 - Tianhong Gao, Jundong Shen, Jiapeng Wang, Bei Shi, Ying Ju, Junfeng Yao, Huiyu Yu:

Benchmarking and Learning Real-World Customer Service Dialogue. 9688-9711 - Yongliang Miao, Yangyang Liang, Mengnan Du:

AdaJudge: Adaptive Multi-Perspective Judging for Reward Modeling. 9712-9724 - Yichen Cai

, Jiayang Li, Junyuan Qiu, Jingya Guo, Weitao You, Changyuan Yang, Lingyun Sun, Pei Chen:
IEvoAgent: Evolving Conversational Agent based on User Implicit Feedback. 9725-9743 - Jiaqi Li, Zhijing Zhang, Jiahui Geng, Sheng Bi, Chuanyi Zhang, Fan Liu, Guilin Qi:

SGPVT: Self-Generated Proximal Visual Tokens for Mitigating Proximal Collateral Damage in MLLM Unlearning. 9744-9763 - Junda Lin, Zhaomeng Zhou, Zhi Zheng, Shuochen Liu, Tong Xu, Yong Chen, Enhong Chen:

VIGIL: Defending LLM Agents Against Tool-Stream Injection via Verify-Before-Commit. 9764-9785 - Naen Xu, Jiayi Sheng, Changjiang Li, Chunyi Zhou, Yuyuan Li, Tianyu Du, Jun Wang, Zhihui Fu, Jinbao Li, Shouling Ji:

"I See What You Did There": Can Large Vision-Language Models Understand Multimodal Puns? 9786-9805 - Liqi He, Zuchao Li, Hao Huang, Ping Wang:

TRACE: Traversal Retrieval-Augmented Chain of Evidence for Document Understanding. 9806-9825 - Xiang Li, Penglei Sun, Wanyun Zhou, Zikai Wei, Yongqi Zhang, Xiaowen Chu:

FinKario: Event-Enhanced Automated Construction of Financial Knowledge Graph. 9826-9845 - Xiaoyu Xiong, Yuqi Ren, Deyi Xiong:

EvoSci: A Bio-Inspired Multi-Agent Framework for the Evolution of Scientific Discovery. 9846-9878 - Elad Ben-Avraham, Changhao Li, Ron Dorfman, Roy Ganz, Oren Nuriel, Amir Dudai, Aviad Aberdam, Noah Flynn, Elman Mansimov, Aditya Kalyanpur, Ron Litman:

DREAM: Deep Research Evaluation with Agentic Metrics. 9879-9904 - Yichen Cai

, Pei Chen, Jiayang Li, Jingya Guo, Zejian Li, Changyuan Yang, Lingyun Sun:
ThinkPersona: Thinking with Persona Graphs for Faithful Individualized Role-Playing. 9905-9927 - Libo Zhang, Zhaoning Zhang, Wangyang Hong, Dongsheng Li:

Sparrow: Text-Anchored Window Attention with Visual-Semantic Glimpsing for Speculative Decoding in Video LLMs. 9928-9942 - Ming Chen, Wenyao Li, Chao Liang, Shi Gu, Peng Lin, De Ma, Huajin Tang, Qian Zheng, Gang Pan:

SPEAK: Spiking Neurons as an Entropy-Aware Tokenizer for Large Language Models. 9943-9960 - Zhihao Xu, Rumei Li, Jiahuan Li, Rongxiang Weng, Jingang Wang, Xunliang Cai, Xiting Wang:

Unlocking Implicit Experience: Synthesizing Tool-Use Trajectories from Text. 9961-9980 - Qinghua Zhao, Xueling Gong, Xinyu Chen, Zhongfeng Kang, Xinlu Li:

A Layer-wise Analysis of Supervised Fine-Tuning. 9981-9992 - Yiyang Jiang, Li Zhang, Xiao-Yong Wei, Li Qing:

Think in Latent Thoughts: A New Paradigm for Gloss-Free Sign Language Translation. 9993-10012 - Biao Yi, Tiansheng Huang, Baolei Zhang, Tong Li, Lihai Nie, Zheli Liu, Li Shen:

CTRAP: Embedding Collapse Trap to Safeguard Large Language Models from Harmful Fine-Tuning. 10013-10030 - Tingchao Fu, Wenkai Wang, Fanxiao Li, Huadong Zhang, Jinhong Zhang, Dayang Li, Yunyun Dong, Renyang Liu, Wei Zhou:

Correct When Paired, Wrong When Split: Decoupling and Editing Modality-Specific Neurons in MLLMs. 10031-10048 - Hengyu An, Minxi Li, Jinghuai Zhang, Naen Xu, Chunyi Zhou, Changjiang Li, Xiaogang Xu, Tianyu Du, Shouling Ji:

ACIArena: Toward Unified Evaluation for Agent Cascading Injection. 10049-10066 - Yuzhen Shi, Huanghai Liu, Yiran Hu, Gaojie Song, Xinran Xu, Yubo Ma, Tianyi Tang, Li Zhang, Qingjing Chen, Di Feng, Wenbo Lv, Weiheng Wu, Kexin Yang, Sen Yang, Wei Wang, Rongyao Shi, Yuanyang Qiu, Yuemeng Qi, Jingwen Zhang, Xiaoyu Sui, Yifan Chen, Yi Zhang, An Yang, Bowen Yu, Dayiheng Liu, Junyang Lin, Weixing Shen, Bing Zhao, Charles L. A. Clarke, Hu Wei:

PLAWBENCH: A Rubric-Based Benchmark for Evaluating LLMs in Real-World Legal Practice. 10067-10116 - Tianle Liang, Yifu Chen, Shengpeng Ji, Yijun Chen, Zhiyang Jia, Jingyu Lu, Fan Zhuo, Xueyi Pu, Yangzhuo Li, Zhou Zhao:

VoxMind: An End-to-End Agentic Spoken Dialogue System. 10117-10139 - Zhaopeng Feng, Yupu Liang, Shaosheng Cao, Jiayuan Su, Jiahan Ren, Zhijie Zhou, Wenxuan Huang, Jian Wu, Zuozhu Liu:

MT³: A Synergistic Multi-Task RL Framework for Specializing MLLMs in Text Image Machine Translation. 10140-10157 - Yu Wang, Emmanuele Chersoni, Chu-Ren Huang:

Do LLMs Capture Embodied Cognition and Cultural Variation? Cross-Linguistic Evidence from Demonstratives. 10158-10174 - Guangrui Fan, Dandan Liu, Aznul Qalid Md Sabri, Rui Zhang, Lihu Pan:

Feeling Rules in Language Models: Mapping Norms of Emotional Appropriateness Across Roles, Institutions, and Intensity. 10175-10193 - Sunguk Shin, Fangzhao Wu, Byung-Jun Lee, Meeyoung Cha, Sungwon Park:

SGT: Securing Open-Source LLMs Against Malicious Fine-tuning via Safety Guidance Trigger. 10194-10207 - Xiang Hu, Zhanchao Zhou, Ruiqi Liang, Zehuan Li, Wei Wu, Jianguo Li:

Every Token Counts: Generalizing 16M Ultra-Long Context in Large Language Models. 10208-10220 - Jian Mu, Qixin Zhang, Zhiyong Wang, Menglin Yang, Shuang Qiu, Chengwei Qin, Zhongxiang Dai, Yao Shu:

Self-Reflective Generation at Test Time. 10221-10239 - Leonor Veloso, Hinrich Schütze:

GKnow: Measuring the Entanglement of Gender Bias and Factual Gender. 10240-10260 - Kun Luo, Hongjin Qian, Zheng Liu, Ziyi Xia, Shitao Xiao, Zhao Cao, Siqi Bao, Jun Zhao, Kang Liu:

Reinforcing Agentic Search Via Reward Density Optimization. 10261-10283 - Zijun Liu, Zhennan Wan, Peng Li, Ming Yan, Fei Huang, Yang Liu:

Scaling External Knowledge Input Beyond Context Windows of LLMs via Multi-Agent Collaboration. 10284-10314 - Hao Wang, Linlong Xu, Heng Liu, Yangyang Liu, Xiaohu Zhao, Bo Zeng, Liangying Shao, Yichen Dong, Xinwei Wu, Jiang Zhou, Tianyu Dong, Xiangxiang Zeng, Longyue Wang, Weihua Luo:

M²PO: Multi-Perspective Multi-Pair Preference Optimization for Machine Translation. 10315-10336 - Tzu-Quan Lin, Heng-Cheng Kuo, Tzu-Chieh Wei, Hsi-Chun Cheng, Chun Wei Chen, Hsien-Fu Hsiao, Yu Tsao, Hung-yi Lee:

An Exploration of Mamba for Speech Self-Supervised Models. 10337-10350 - Zheng Jia, Shengbin Yue, Wei Chen, Siyuan Wang, Yidong Liu, Zejun Li, Yun Song, Zhongyu Wei:

Ready Jurist One: Benchmarking Language Agents for Legal Intelligence in Dynamic Environments. 10351-10376 - Anh Trac Duc Dinh, Khang Hoang Nhat Vo, Tai Tien Ta, Vinh Cong Doan, Tho Quan:

When Morphology Hides in Plain Sight: Breaking the Isolation in Vietnamese and Beyond. 10377-10392 - Xiquan Li, Xuenan Xu, Ziyang Ma, Wenxi Chen, Haolin He, Qiuqiang Kong, Xie Chen:

FineLAP: Taming Heterogeneous Supervision for Fine-grained Language-Audio Pretraining. 10393-10408 - Jinze Li, Yang Zhang, Xin Yang, Jiayi Qu, Jinfeng Xu, Shuo Yang, Junhua Ding, Edith Cheuk-Han Ngai:

OCR-Memory: Optical Context Retrieval for Long-Horizon Agent Memory. 10409-10420 - Kaiwen Wei, Kejun He, Xiaomian Kang, Jie Zhang, Ymyang, Li Jin, Zhenyang Li, Jiang Zhong, Richard He Bai, Junnan Zhu:

From Past To Path: Masked History Learning for Next-Item Prediction in Generative Recommendation. 10421-10441 - Guanyu Wang

, Xu Chu, Zhijie Tan, Xinrong Chen, Tong Mo, Weiping Li:
MuSe: Multi-Stage Graph Reasoning via Vision-Language Models. 10442-10462 - Dongding Lin, Jian Wang, Yongqi Li, Wenjie Li:

Where and What: Reasoning Dynamic and Implicit Preferences in Situated Conversational Recommendation. 10463-10481 - Chenghao Yang

, Yuning Zhang, Zhoufutu Wen, Tao Gong, Jiaheng Liu, Qi Chu, Nenghai Yu:
When Agents Look the Same: Quantifying Distillation-Induced Similarity in Tool-Use Behaviors. 10482-10502 - Luise Ge, Yongyan Zhang, Yevgeniy Vorobeychik:

Mind the (DH) Gap! A Contrast in Risky Choices Between Reasoning and Conversational LLMs. 10503-10525 - Wenqing Hou, Hongkui Tu, Ye Wang, Yue Zhang, Yuying Liu, Dong Zhu, Liqun Gao, Bin Zhou:

Beyond Single-View Detection: A Dual-Space Reasoning Framework for Interpretable Harmful Meme Understanding. 10526-10544 - Pei Chen, Xilai Wang, Qixu Shi, Zejian Li, Lingyun Sun:

From Experts to Bases: Orthogonal Subspace Mixture for Continual Multimodal Instruction Tuning. 10545-10561 - Yihang Wang, Bin Wu, Yueyang Su, Tianfu Zhang, Yiqi Du, Lei Yu, Jiafeng Guo, Xueqi Cheng:

Distilling Large Embeddings via Hyperspherical Householder Quantization. 10562-10576 - Tomer Ashuach, Shai Gretz, Yoav Katz, Yonatan Belinkov, Liat Ein-Dor:

Masked by Consensus: Disentangling Privileged Knowledge in LLM Correctness. 10577-10596 - Sashuai Zhou, Qiang Zhou, Jijin Hu, Hanqing Yang, Yue Cao, Junpeng Ma, Yinchao Ma, Jun Song, Tiezheng Ge, Cheng Yu, Bo Zheng, Zhou Zhao:

Unified Thinker: A General Reasoning Core for Image Generation. 10597-10613 - Haoran Sun, Natthawut Kertkeidkachorn, Kiyoaki Shirai:

Visual and Memory-Augmented Soccer Commentary Generation. 10614-10629 - Junyou Su, He Zhu, Xiao Luo, Liyu Zhang, Hong-Yu Zhou, Yun Chen, Peng Li, Yang Liu, Guanhua Chen:

InstructDiff: Domain-Adaptive Data Selection via Contrastive Entropy for Efficient LLM Fine-Tuning. 10630-10648 - Haiduo Huang, Fuwei Yang, Zhenhua Liu, Pengju Ren:

Jakiro: Boosting Speculative Decoding via Decoupled MoE. 10649-10668 - Refael Shaked Greenfeld, Reut Tsarfaty:

Beyond Word Boundaries: A Hebrew Coreference Benchmark and an Evaluation Protocol for Morphologically Complex Text. 10669-10683 - Yongxue Shan, Jie Peng, Zixuan Dong, Fei Hu, Xiaodong Wang:

Reasoning with Ontology Graph: Toward Type-Constrained Knowledge Graph Question Answering. 10684-10697 - Qishun Yang, Shu Yang, Lijie Hu, Di Wang:

Visual Self-Fulfilling Alignment: Shaping Safety-Oriented Personas via Threat-Related Images. 10698-10718 - Ziyang Wang

, Jiangfeng Xiao, Chuan Xiao, Ruoxiang Li, Rui Mao, Jianbin Qin:
GRASPrune: Global Gating for Budgeted Structured Pruning of Large Language Models. 10719-10736 - Yuechen Jiang, Zhiwei Liu, Yupeng Cao, Yueru He, Ziyang Xu, Chen Xu, Zhiyang Deng, Prayag Tiwari, Xi Chen, Alejandro Lopez-Lira, Jimin Huang, Junichi Tsujii, Sophia Ananiadou:

All That Glisters Is Not Gold: A Benchmark for Reference-Free Counterfactual Financial Misinformation Detection. 10737-10776 - Congren Dai, Yue Yang, Krinos Li, Huichi Zhou, Shijie Liang, Zhang Bo, Enyang Liu, Ge Jin, Hongran An, Haosen Zhang, Peiyuan Jing

, Kinhei Lee, Zhenxuan Zhang, Xiaobing Li, Maosong Sun:
Musical Score Understanding Benchmark: Evaluating Large Language Models' Comprehension of Complete Musical Scores. 10777-10799 - Chaoyin She, Ruifang Lu, Lida Chen, Wei Wang, Qinghua Huang:

EchoVLM: Dynamic Mixture-of-Experts Vision-Language Model for Universal Ultrasound Intelligence. 10800-10822 - Vu Tuan Truong, Long Bao Le:

Critical-CoT: A Robust Defense Framework against Reasoning-Level Backdoor Attacks in Large Language Models. 10823-10841 - Zhen Yang, Ping Jian, Zhongbin Guo, Zuming Zhang, Chengzhi Li, Yonghong Deng, Xinyue Zhang, Wenpeng Lu:

How Do LLMs and VLMs Understand Viewpoint Rotation Without Vision? An Interpretability Study. 10842-10864 - Lorenzo Molfetta, Alessio Cocchieri, Luca Ragazzi, Ilaria Bartolini, Marco Patella, Gianluca Moro:

Sycophants in the Courtroom: Are LLMs Fragile to Juridical Authority and Evolving Legal Standards? 10865-10886 - Stefan Krsteski, Giuseppe Russo, Serina Chang, Robert West, Kristina Gligoric:

Valid Survey Simulations with Limited Human Data: The Roles of Prompting, Fine-Tuning, and Rectification. 10887-10906 - Zhensheng Wang, ZhanTeng Lin, Wenmian Yang, Kun Zhou, Yiquan Zhang, Weijia Jia:

ODUTQA-MDC: A Task for Open-Domain Underspecified Tabular QA with Multi-turn Dialogue-based Clarification. 10907-10928 - Xing Ma, Yangjie Zhou, Wu Sun, Zihan Liu, Jingwen Leng, Yun Lin, Shixuan Sun, Minyi Guo, Jin Song Dong:

CuBridge: An LLM-Based Framework for Understanding and Reconstructing High-Performance Attention Kernels. 10929-10946 - Peiyang Liu, Zhirui Chen

, Xi Wang, Di Liang, Youru Li, Zhi Cai, Wei Ye:
Learning from Contrasts: Synthesizing Reasoning Paths from Diverse Search Trajectories. 10947-10969 - Shawn Li, Chenxiao Yu, Zhiyu Ni, Hao Li, Charith Peris, Chaowei Xiao, Yue Zhao:

Defenses Against Prompt Attacks Learn Surface Heuristics. 10970-10987 - Fengxian Dong, Zhi Zheng, Xiao Han, Wei Chen, Jingqing Ruan, Tong Xu, Yong Chen, Enhong Chen:

Memory-Augmented LLM-based Multi-Agent System for Automated Feature Generation on Tabular Data. 10988-11007 - Qiao Liang, Yuke Zhu, Chao Ge, Lei Yang, Ying Shen, Bo Zheng, Sheng Guo:

Learning from the Irrecoverable: Error-Localized Policy Optimization for Tool-Integrated LLM Reasoning. 11008-11028 - Mengxiang Zhang, Lingyuan Liu:

Learning from Evolving Training Dynamics: An Entropy-Maximizing Data Curation Strategy for LLM Supervised Post-Training. 11029-11045 - Siheng Li, Kejiao Li, Zenan Xu, Guanhua Huang, Kun Li, Haoyuan Wu, Jiajia Wu, Zihao Zheng, Chenchen Zhang, Kun Shi, Xue Gong, Qi Yi, Ruibin Xiong, Tingqiang Xu, Yuhao Jiang, Jianfeng Yan, Yuyuan Zeng, Guanghui Xu, Jinbao Xue, Zhijiang Xu, Zheng Fang, Shuai Li, Qibin Liu, Xiaoxue Li, Zhuoyu Li, Yangyu Tao, Fei Gao, Cheng Jiang, Bochao Wang, Kai Liu, Jianchen Zhu, Wai Lam, Bo Zhou, Di Wang:

Reinforcement Learning on Pre-Training Data. 11046-11057 - Selma Liliane Wanna, Agnes Luhtaru, Jonathan Salfity, Ryan Barron, Juston Moore, Cynthia Matuszek, Mitch Pryor:

Limited Linguistic Diversity in Embodied AI Datasets. 11058-11086 - Jiaqi Li, Guangming Wang, Shuntian Zheng, Minzhe Ni, Xiaoman Lu, Guanghui Ye, Yu Guan:

Towards Mitigating Modality Bias in Vision-Language Models for Temporal Action Localization. 11087-11104 - Kangyu Wang, Zhiyun Jiang, Haibo Feng, Weijia Zhao, Lin Liu, Jianguo Li, Zhenzhong Lan, Weiyao Lin:

CreditDecoding: Accelerating Parallel Decoding in Diffusion Large Language Models with Trace Credit. 11105-11123 - Jamshid Mozafari

, Bhawna Piryani, Adam Jatowt:
Question Difficulty Estimation for Large Language Models via Answer Plausibility Scoring. 11124-11151 - Bo Zhou, Xikang Chen, Yan Gong, Yin Zhang:

Vector Calligrapher: Generating Scalable Vector Graphics via Structured Linguistic Supervision. 11152-11168 - Jiahui Geng, Fengyu Cai, Shaobo Cui, Qing Li, Liangwei Chen, Chenyang Lyu, Haonan Li, Derui Zhu, Alexander Pretschner, Heinz Koeppl, Fakhri Karray:

CoQuIR: A Comprehensive Benchmark for Code Quality-Aware Information Retrieval. 11169-11185 - Hong Huang

, Decheng Wu, Qiangqiang Hu, Guanghua Yu, Jinhai Yang
, Jianchen Zhu, Xue Liu, Dapeng Wu
:
Sherry: Hardware-Efficient 1.25-Bit Ternary Quantization via Fine-grained Sparsification. 11186-11204 - Wenzhuo Xu, Zhipeng Wei, Zonghao Ying, Deyue Zhang, Dongdong Yang, Xiangzheng Zhang, Quanchen Zou:

DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs. 11205-11221 - Pawel Batorski, Paul Swoboda:

PIAST: Rapid Prompting with In-context Augmentation for Scarce Training data. 11222-11242 - Jianshu Zhang, Chengxuan Qian, Haosen Sun, Haoran Lu, Dingcheng Wang, Letian Xue, Han Liu:

ProgressLM: Towards Progress Reasoning in Vision-Language Models. 11243-11271 - Yubo Wang, Juntian Zhang, Yichen Wu, Yankai Lin, Nils Lukas, Yuhan Liu:

Forest Before Trees: Latent Superposition for Efficient Visual Reasoning. 11272-11288 - Xin Shi, Chao Zhang, Yifan Zhu, Xueqiao Zhang, Yawei Luo:

Beyond Pedagogical Principles: Multi-Horizon Preference Optimization for Efficient Socratic Tutoring. 11289-11306 - Xinhang Ma, William Yeoh, Ning Zhang, Yevgeniy Vorobeychik:

Protecting Language Models Against Unauthorized Distillation through Trace Rewriting. 11307-11324 - Weihao Xuan, Qingcheng Zeng, Heli Qi, Yunze Xiao, Junjue Wang, Naoto Yokoya:

The Confidence Dichotomy: Analyzing and Mitigating Miscalibration in Tool-Use Agents. 11325-11349 - Adam Storek, Mukur Gupta, Noopur Bhatt, Aditya Gupta, Janie Kim, Prashast Srivastava, Suman Jana:

XOXO: Stealthy Cross-Origin Context Poisoning Attacks against AI Coding Assistants. 11350-11373 - Lichao Wang, ZhaoXing Ren, Tianzhuo Yang, Jiaming Ji, Chi Harold Liu, Yaodong Yang, Juntao Dai:

SafeMCP: Proactive Power Regulation for LLM Agent Defense via Environment-Grounded Look-Ahead Reasoning. 11374-11396 - Akira Kawabata, Saku Sugawara:

C2: Scalable Rubric-Augmented Reward Modeling from Binary Preferences. 11397-11424 - Fengqi Zhu, Rongzhen Wang, Shen Nie, Xiaolu Zhang, Chunwei Wu, Jun Zhou, Yankai Lin, Ji-Rong Wen, Chongxuan Li:

LLaDA 1.5: Variance-Reduced Preference Optimization for Large Language Diffusion Models. 11425-11460 - Yuexiao Liu, Lijun Li, Xingjun Wang, Jing Shao:

HarmRLVR: Weaponizing Verifiable Rewards for Harmful LLM Alignment. 11461-11479 - Ahmed Ewais, Ahmed Hashish, Amr Ali:

Just Pass Twice: Efficient Token Classification with LLMs for Zero-Shot NER. 11480-11497 - Xiaoao Zhu, Jie Ren, Zhiqiang Li, Jie Zheng, Zhanyong Tang, Zheng Wang:

Lifting Optimized Binaries to Canonical Compiler IR via Structure-Aware Retrieval and Iterative Verification. 11498-11516 - Kaitong Cai, Jusheng Zhang, Keze Wang:

Provably Safe Offline-to-Online RL: Decoupling Learning from Data-Driven Safety Enforcement. 11517-11536 - Sihang Zhao, Kangrui Yu, Youliang Yuan, Pinjia He, Hongyi Wen:

SHAPE: Unifying Safety, Helpfulness and Pedagogy for Educational LLMs. 11537-11553 - Ruizi Han, Miao Zhang, Ziyue Qiao, Liqiang Nie:

Evolving Sparsity: Leveraging Token Importance Dynamics for Efficient LLM Decoding with Sparse Attention. 11554-11566 - Chonghua Liao, Ke Wang, Yuchuan Wu, Ruoran Li, Fei Huang, Yongbin Li:

MOA: Multi-Objective Alignment for Role-Playing Agents. 11567-11588 - Eva Vanmassenhove:

Losing our Tail, Again: (Un)Natural Selection & Multilingual LLMs. 11589-11600 - Niu Lian, Yuting Wang, Hanshu Yao, Jinpeng Wang, Bin Chen, Yaowei Wang, Min Zhang, Shu-Tao Xia:

From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents. 11601-11617 - Xiucheng Xu, Bingbing Xu, Tian Xueyun, Zihe Huang, Rongxin Chen, Yunfan Li, Huawei Shen:

Chain-of-Memory: Lightweight Memory Construction with Dynamic Evolution for LLM Agents. 11618-11631 - Chenxu Liu, Yingjie Fu, Wei Yang, Ying Zhang, Tao Xie:

WebCoderBench: Benchmarking Web Application Generation with Comprehensive and Interpretable Evaluation Metrics. 11632-11666 - Jingwei Ni, Ekaterina Fadeeva, Tianyi Wu, Mubashara Akhtar, Jiaheng Zhang, Elliott Ash, Markus Leippold, Timothy Baldwin, See-Kiong Ng, Artem Shelmanov, Mrinmaya Sachan:

Efficient Test-Time Scaling of Multi-Step Reasoning by Probing Internal States of Large Language Models. 11667-11689 - Haoyue Liu, Zhichao Wang, Yongxin Guo, Haoran Shou, Xiaoying Tang:

Adaptive Prompt Structure Factorization: A Framework for Self-Discovering and Optimizing Compositional Prompt Programs. 11690-11714 - Fengyuan Liu, Yi Huang, Sichun Luo, Yuqi Wang, Yazheng Yang, Xinye Li, Zefa Hu, Junlan Feng, Qi Liu:

Cognitive Alpha Mining via LLM-Driven Code-Based Evolution. 11715-11749 - Qiao Liang, Ying Shen, Yao Liu, Tiantian Chen, Lin Zhang:

Why Do Emotions Change? Appraisal-Guided Reasoning for Emotion-Cause Triplet Extraction in Conversations. 11750-11772 - Yixuan Tang, Yi Yang:

KV-Embedding: Training-free Text Embedding via Internal KV Re-routing in Decoder-only LLMs. 11773-11794 - Yuepeng Hu, Zhengyuan Jiang, Mengyuan Li, Osama Ahmed, Zhicong Huang, Cheng Hong, Neil Zhenqiang Gong:

Fingerprinting LLMs via Prompt Injection. 11795-11810 - Chuanxin Zhang, Jiajun Liu, Yao He, Wenjun Ke, Peng Wang, Yankun Le, Sirui Liu, Zhaoyu Yang:

Exploring Layer Activation Dynamic of CoT via Knowledge Probe. 11811-11830 - Tulika Tewari, Nalin Asanka Gamagedara Arachchilage, Jagat Sesh Challa, Dhruv Kumar:

From Trust to Compromise: Outcome-Verified LLM Phishing Simulation and Real-Time Defense. 11831-11845 - Xiaoying Le, Pengfei Qian, Yuanzhao Zhai, Xu Zhang, Qian Liu, Dawei Feng, Bo Ding:

EvoNarrator: Modeling Scientific Evolution for Feasible Hypothesis Generation. 11846-11865 - Fan Xu, Huixuan Zhang, Xiaojun Wan:

DecoCal: Decoding with Calibration in Diffusion Large Language Models. 11866-11880 - Cheng Xu, Changhong Jin, Yingjie Niu, Nan Yan, Yuke Mei, Shuhao Guan, Liming Chen, M. Tahar Kechadi:

LiveFact: A Dynamic, Time-Aware Benchmark for LLM-Driven Fake News Detection. 11881-11910 - Jingyi Ren, Ante Wang, Yunghwei Lai, Xiaolong Wang, Linlu Gong, Weitao Li, Weizhi Ma, Yang Liu:

Beyond "I Don't Know": Evaluating LLM Self-Awareness in Discriminating Data and Model Uncertainty. 11911-11929 - Renjie Gu, Jiazhen Du, Yihua Zhang, Sijia Liu:

Unlearners Can Lie: Evaluating and Improving Honesty in LLM Unlearning. 11930-11952 - Changle Qu, Sunhao Dai, Hengyi Cai, Jun Xu, Shuaiqiang Wang, Dawei Yin:

MatchTIR: Fine-Grained Supervision for Tool-Integrated Reasoning via Bipartite Matching. 11953-11968 - Pingzhi Tang, Yiding Wang, Muhan Zhang:

Knowledge is Not Enough: Injecting RL Skills for Continual Adaptation. 11969-11997 - Raghvendra Kumar, Devankar Raj, Sriparna Saha:

BhashaSutra: A Task-Centric Unified Survey of Indian NLP Datasets, Corpora, and Resources. 11998-12064 - Rei Emura, Saku Sugawara:

A Dual-Task Paradigm to Investigate Sentence Comprehension Strategies in Language Models. 12065-12084 - Haomin Zuo, Yidi Li, Luoxiao Yang, Xiaofeng Zhang:

Diffusion-CAM: Faithful Visual Explanations for dMLLMs. 12085-12101 - Yu Yan

, Chunhong Zhang, Haiyu Zhao, Ziyang Zeng, Zihao Liu, Yongkang Wu, Jianzhou Diao, Yijie Chen, Shujie Wang, Zheng Hu:
Beyond Noise: Characterizing Creative Potential in Unverifiable LLM Hallucinations. 12102-12124 - Hui Gao, Changhao Song, Peng Zhang, Jing Zhang, Chang Yang, Liuxian Ge:

LLM-SLM Collaborative Framework of Idiomatic Expression Generation. 12125-12145 - Lingkun Long, Yushi Huang, Shihao Bai, Ruihao Gong, Jun Zhang, Ao Zhou, Jianlei Yang:

Focus-dLLM: Accelerating Long-Context Diffusion LLM Inference via Confidence-Guided Context Focusing. 12146-12160 - Wei Zhou, Bolei Ma

, Annemarie Friedrich, Mohsen Mesgar:
Table Question Answering in the Era of Large Language Models: A Comprehensive Survey of Tasks, Methods, and Evaluation. 12161-12189 - Jize Wang, Han Wu, Zhiyuan You, Yiming Song, Yijun Wang, Zifei Shan, Yining Li, Songyang Zhang, Xinyi Le, Cailian Chen, Xinping Guan, Dacheng Tao:

RouteMoA: Dynamic Routing without Pre-Inference Boosts Efficient Mixture-of-Agents. 12190-12208 - Irina Bigoulaeva, Jonas Rohweder, Subhabrata Dutta, Iryna Gurevych:

Patches of Nonlinearity: Instruction Vectors in Large Language Models. 12209-12262 - Ivan Kartác, Mateusz Lango, Ondrej Dusek:

Reasoning Gets Harder for LLMs Inside A Dialogue. 12263-12303 - Jing Zhou, Peng Wang, Wenjun Ke, Jiajun Liu, Yao He:

Capability Decomposition for Unified Information Extraction via Hierarchical Mixture-of-Experts. 12304-12318 - Jinhan Liu, Yibo Yang, Ruiying Lu, Piotr Piekos, Yimeng Chen, Peng Wang, Dandan Guo:

PDR: A Plug-and-Play Positional Decay Framework for LLM Pre-training Data Detection. 12319-12344 - Yuhang Zhou, Yixin Cao, Yuchen Ni, Shihan Dou, Xutian Chen, Ge Zhang, Xiang Liu, Guangnan Ye:

PRISM: Probabilistic Reward Model with Inherent Structural Modeling. 12345-12362 - Saeed Almheiri, Bilal Elbouardi, Salsabila Zahirah Pranida, Irina Nikishina, Ashwath Rao, Parameswari Krishnamurthy, Muhammad Cendekia Airlangga, Rifo Ahmad Genadi, Nguyen Phan Gia Bao, Amir Hossein Yari, Hawau Olamide Toyin, Nurdaulet Mukhituly, Mena Attia, Besher Hassan, Ahmad Fathan Hidayatullah, Tatsuki Kuribayashi, Haonan Li, Suma Bhat, Fajri Koto:

Multilingual Idioms in Sentences and Conversations Across High-, Medium-, and Low-Resource Languages. 12363-12389 - Qian Ruan, Iryna Gurevych:

Author-in-the-Loop Response Generation and Evaluation: Integrating Author Expertise and Intent in Responses to Peer Review. 12390-12418 - Andrey Veprikov, Vladimir Solodkin, Alexander Zyl, Andrey V. Savchenko, Aleksandr Beznosikov:

WeightLoRA: Keep Only Necessary Adapters. 12419-12437 - Furkan Sahinuç, Subhabrata Dutta, Iryna Gurevych:

Reward Modeling for Scientific Writing Evaluation. 12438-12479 - Letian Peng, Kun Zhou, Longfei Yun, Yupeng Hou, Jingbo Shang:

Deriving Character Logic from Storyline as Codified Decision Trees. 12480-12509 - Xuan Zhou, Yanhui Sun, Hantao Yao, Allen He, Yongdong Zhang, Wu Liu:

GASim: A Graph-Accelerated Hybrid Framework for Social Simulation. 12510-12528 - Yuanjie Lyu, Chengyu Wang, Lei Shen, Jun Huang, Tong Xu:

Mock Worlds, Real Skills: Building Small Agentic Language Models with Synthetic Tasks, Simulated Environments, and Rubric-Based Rewards. 12529-12545 - Zhiyu Xu, Lean Wang, Yuanxin Liu, Lei Li, Hao Zhou, Fandong Meng, Jie Zhou, Xu Sun:

Investigating Cross-Modal Skill Injection: Scenarios, Methods, and Hyperparameters. 12546-12563 - Lingyin Zhang, Jun Gao, Xiaoxue Ren, Ziqiang Cao:

The Bidirectional Process Reward Model. 12564-12580 - Kaibo Huang, Jin Tan, Yukun Wei, Wanling Li, Zipei Zhang, Hui Tian, Zhongliang Yang, Linna Zhou:

AgentMark: Utility-Preserving Behavioral Watermarking for Agents. 12581-12603 - Yadong Zhang, Xinshu Shen, Yupei Ren, Shangqing Zhao, Man Lan:

Generative Gamer: Learning Equilibrium Strategy by LLM-driven Dynamic Deduction. 12604-12617 - Eleftheria Tsipidi, Samuel Kiegeland, Francesco Ignazio Re, Tianyang Xu, Mario Giulianelli, Karolina Stanczak, Ryan Cotterell:

Probing for Reading Times. 12618-12642 - Zhicong Li, Lingjie Jiang, Yulan Hu, Xingchen Zeng, Yixia Li, Xiangwen Zhang, Guanhua Chen, Zheng Pan, Xin Li, Yong Liu:

No More Stale Feedback: Co-Evolving Critics for Open-World Agent Learning. 12643-12660 - Ye-eun Cho:

Continuous Interpretive Steering for Scalar Diversity. 12661-12678 - Shengji Tang, Jianjian Cao, Weihao Lin, Jiale Hong, Bo Zhang, Shuyue Hu, Lei Bai, Tao Chen, Wanli Ouyang, Peng Ye:

A Scalable Multi-LLM Collaboration System with Retrieval-based Selection and Exploration-Exploitation-Driven Enhancement. 12679-12697 - Qingyan Wang, Lianwei Wu, Botao Wang, Kang Wang, Yaxiong Wang:

From Form to Logic: Masked Reconstruction and Reasoning Distillation for Short Video Fake News Detection. 12698-12711 - Weitao Li, Boran Xiang, Xiaolong Wang, Jingyi Ren, Ante Wang, Zhinan Gou, Weizhi Ma, Yang Liu:

UR² : Unify RAG and Reasoning through Reinforcement Learning. 12712-12751 - Dawei Xiang, Kexin Chu, Wenyan Xu, Wenhui Zhang, Wei Zhang:

LLM-as-Scheduler: Agentic Workflow Dynamic Scheduling. 12752-12763 - Dadi Guo, Jiayu Liu, Zhiyuan Fan, Zhitao He, Haoran Li, Yuxin Li, Yumeng Wang, Yi R. Fung:

Mathematical Proof as a Litmus Test: Revealing Failure Modes of Advanced Large Reasoning Models. 12764-12804 - Sikuan Yan, Xiufeng Yang, Zuchao Huang, Ercong Nie, Zifeng Ding, Zonggen Li, Xiaowen Ma, Jinhe Bi, Kristian Kersting, Jeff Z. Pan, Hinrich Schütze, Volker Tresp, Yunpu Ma:

Memory-R1: Enhancing Large Language Model Agents to Manage and Utilize Memories via Reinforcement Learning. 12805-12825 - Jiayu Liu, Cheng Qian, Zhaochen Su, Qing Zong, Shijue Huang, Bingxiang He, Yi R. Fung:

CostBench: Evaluating Multi-Turn Cost-Optimal Planning and Adaptation in Dynamic Environments for LLM Tool-Use Agents. 12826-12858 - Junpeng Ding, Zichen Tang, Haihong E, Mengyuan Ji, Yang Liu, Haolin Tian, Haiyang Sun, Pengqi Sun, Yang Xu, Yichen Liu, Haocheng Gao, Zijie Xi, Ruomeng Jiang, Peizhi Zhao, Rongjin Li, Yuanze Li, Jiacheng Liu, Zhongjun Yang, Jintong Chen, Siying Lin:

Decoding Scientific Experimental Images: The SPUR Benchmark for Perception, Understanding, and Reasoning. 12859-12882 - Yuejiao Wang, Zihao Ji, Pengfei Cai, Xu Li, Haorui Zheng, Zewen Song, Zhongliang Liu, Chen Zhang, Pengfei Wan:

SegTune: Structured and Fine-Grained Control for Song Generation. 12883-12897 - Yibin Lei, Shwai He, Ang Li, Andrew Yates:

Making Large Language Models Efficient Dense Retrievers. 12898-12913 - Jiaquan Zhang, Chaoning Zhang, Shuxu Chen, Zhenzhen Huang, Pengcheng Zheng, Zhicheng Wang, Ping Guo, Fan Mo, Sung-Ho Bae, Jie Zou, Jiwei Wei, Yang Yang:

Lightweight LLM Agent Memory with Small Language Models. 12914-12929 - Siran Liu, Yang Ye, Qianchao Zhu, Zane Cao, Yongchao He:

HeteroSpec: Leveraging Contextual Heterogeneity for Efficient Speculative Decoding. 12930-12947 - Brandon Duderstadt, Hayden S. Helm:

A Model of the Language Process. 12948-12959 - Yu Guo, Shenghao Ye, Shuangwu Chen, Zijian Wen, Tao Zhang, Qirui Bai, Dong Jin, Yunpeng Hou, Huasen He, Jian Yang, Xiaobin Tan:

Rethinking Table Pruning in TableQA: From Sequential Revisions to Gold Trajectory-Supervised Parallel Search. 12960-12976 - Chuanliu Fan, Zicheng Ma, Huanran Meng, Aijia Zhang, Wenjie Du, Jun Zhang, Ziqiang Cao, Guohong Fu:

Interleaved Tool-Call Reasoning for Protein Function Understanding. 12977-12995 - Francesco Corso, Giuseppe Russo, Francesco Pierri, Gianmarco De Francisci Morales:

Among Us: Language of Conspiracy Theorists on Mainstream Reddit. 12996-13017 - Bowen Zeng, Feiyang Ren, Jun Zhang, Xiaoling Gu, Ke Chen, Lidan Shou, Huan Li:

HybridKV: Hybrid KV Cache Compression for Efficient Multimodal Large Language Model Inference. 13018-13034 - Tianyi Ma, Yue Zhang, Zehao Wang, Parisa Kordjamshidi:

Breaking Down and Building Up: Mixture of Skill-Based Vision-and-Language Navigation Agents. 13035-13065 - Zimo Yan, Zheng Xie, Runfan Duan, Chang Liu, Wumei Du:

Bridging Distance and Spectral Positional Encodings via Anchor-Based Diffusion Geometry Approximation. 13066-13085 - Shuzheng Si, Haozhe Zhao, Kangyang Luo, Gang Chen, Fanchao Qi, Minjia Zhang, Baobao Chang, Maosong Sun:

A Goal Without a Plan Is Just a Wish: Efficient and Effective Global Planner Training for Long-Horizon Agent Task. 13086-13113 - Nurkhan Laiyk, Daniil Orel, Ayana Mussabayeva, Maiya Goloburda, Kamila Kuishibekova, Liya Goloburda, Diana Turmakhan, Preslav Nakov, Yuxia Wang, Fajri Koto:

Stereotype Bias in a Bilingual Setting: A Culturally Grounded Evaluation in Kazakhstan. 13114-13131 - Shramay Palta, Peter Rankel, Sarah Wiegreffe

, Rachel Rudinger:
Arguments that Alter Minds: LLM Rationales Sway Human (and LLM) Notions of Plausibility. 13132-13152 - Xinyu Yang, Chenlong Deng, Zhicheng Dou:

GLARE: Agentic Reasoning for Legal Judgment Prediction. 13153-13170 - Zhenyu Li, Zuchao Li, Ping Wang, Lefei Zhang, Haojun Ai:

Vista-LLM: Decoupled Query-Guided Visual Token Pruning for Efficient Long-Video Large Language Models. 13171-13187 - Chenduo Ying, Linkang Du, Yuanchao Shu, Peng Cheng:

RoboFailRing: Retrieval-Augmented and Language Grounding Failure Detection for VLM-enabled Robotic Manipulation. 13188-13202 - Yifan Zhang, Tao Yu, Feng Li, Chaoyou Fu, Yibo Hu, Kun Wang, Qingsong Wen, Zhang Zhang, Liang Wang, Rong Jin:

Scaling Law for Multimodal Large Language Model Supervised Fine-Tuning. 13203-13228 - Peiyu Li, Xiaobao Huang, Ting Hua, Nitesh V. Chawla:

CrochetBench: Can Vision-Language Models Move from Describing to Doing in Crochet Domain? 13229-13251 - Guangming Qin, Yuhao Deng, Yukun Zhao, Zhenyang Li, Junfeng Wang, Dawei Yin, Ye Yuan, Guoren Wang, Yizhou Yan, Chengliang Chai, Lei Cao:

DORA: A Dual-Objective Reinforcement Learning Framework for Effective and Efficient Multimodal Agentic Search. 13252-13272 - Haozhi Fan, Jinhao Duan, Kaidi Xu:

IUQ: Interrogative Uncertainty Quantification for Long-Form Large Language Model Generation. 13273-13289 - Myeongsoo Kim, Chao-Chun Hsu, Dingmin Wang, Shweta Garg, Varun Kumar, Murali Krishna Ramanathan:

CODESTRUCT: Code Agents over Structured Action Spaces. 13290-13306 - Abinitha Gourabathina, Inkit Padhi, Manish Nagireddy, Subhajit Chaudhury, Prasanna Sattigeri:

Answering the Wrong Question: Reasoning Trace Inversion for Abstention in LLMs. 13307-13324 - Bingsen Chen, Boyan Li, Ping Nie, Yuyu Zhang, Xi Ye, Chen Zhao:

Beyond Single-shot Writing: Deep Research Agents are Unreliable at Multi-turn Report Revision. 13325-13356 - Dong Shu, Yanguang Liu, Huopu Zhang, Mengnan Du:

FinCall-Surprise: A Large Scale Multi-modal Benchmark for Earning Surprise Prediction. 13357-13370 - Tianyu Yang, Terry Ruas, Yijun Tian, Jan Philip Wahle, Daniel Kurzawe, Bela Gipp:

ALDEN: Reinforcement Learning for Active Navigation and Evidence Gathering in Long Documents. 13371-13392 - Yuhao Wang, Ruiyang Ren, Yucheng Wang, Xin Zhao, Jing Liu, Hua Wu, Haifeng Wang:

Reinforced Informativeness Optimization for Long-Form Retrieval-Augmented Generation. 13393-13406 - Guo Gan, Yuxuan Ding, Cong Chen, Yuwei Ren, Yin Huang, Hong Zhou:

Android Coach: Improve Online Agentic Training Efficiency with Single State Multiple Actions. 13407-13428 - Jihao Zhao, Ding Chen, Zhaoxin Fan, Kerun Xu, Mengting Hu, Bo Tang, Feiyu Xiong, Zhiyu Li:

Inside Out: Evolving User-Centric Core Memory Trees for Long-Term Personalized Dialogue Systems. 13429-13446 - Dong Shu, Haoyang Yuan, Yuchen Wang, Yanguang Liu, Huopu Zhang, Mengnan Du:

FinChart-Bench: Benchmarking Financial Chart Comprehension in Vision-Language Models. 13447-13466 - Jiahao Tang, Henry Hengyuan Zhao, Lijian Wu, Zijian Zhang, Yifei Tao, Dongxing Mao, Yang Wan, Jingru Tan, Min Zeng, Min Li, Alex Jinpeng Wang:

From Charts to Code: A Hierarchical Benchmark for Multimodal Models. 13467-13566 - Hao Wang, Hao Gu, Hongming Piao, Kaixiong Gong, Yuxiao Ye, Xiangyu Yue, Sirui Han, Yike Guo, Dapeng Wu:

Learning While Staying Curious: Entropy-Preserving Supervised Fine-Tuning via Adaptive Self-Distillation for Large Reasoning Models. 13567-13581 - Qimin Zhong, Hao Liao, Haiming Qin, Mingyang Zhou, Rui Mao, Wei Chen, Naipeng Chao:

Toward Consistent World Models with Multi-Token Prediction and Latent Semantic Enhancement. 13582-13602 - Zihan Chang, Shuibing He, Bo Zhou, Sheng Xiao, Siling Yang, Rui Wang, Zhe Pan:

SpiderFlow: Efficient Topology-Aware Scheduling for LLM Training Across Decentralized GPU Clusters. 13603-13615 - Jiacheng Hua, Yishu Yin, Yuhang Wu, Tai Wang, Yifei Huang, Miao Liu:

Unleashing Spatial Reasoning in Multimodal Large Language Models via Textual Representation Guided Reasoning. 13616-13637 - Zhen Fang, Ruiyan Han, XinYu Sun, Yuchen Ma, Ziheng Wang, Yu Zeng, Zehui Chen, Lin Chen, Wenxuan Huang, Wei-Jie Xu, Yi Cao, Feng Zhao:

UniCorn: Towards Self-Improving Unified Multimodal Models through Self-Generated Supervision. 13638-13669 - Yu Wang, Sharon Li:

Why Multimodal In-Context Learning Lags Behind? Unveiling the Inner Mechanisms and Bottlenecks. 13670-13685 - Cheng Qian, Emre Can Acikgoz, Bingxuan Li, Xiusi Chen, Yuji Zhang, Bingxiang He, Qinyu Luo, Gokhan Tur, Dilek Hakkani-Tür, Yunzhu Li, Heng Ji:

Current Agents Fail to Leverage World Model as Tool for Foresight. 13686-13723 - Cassie Huang, Stuti Mohan, Ziyi Yang, Stefanie Tellex, Li Zhang:

Language Model as Planner and Formalizer under Constraints. 13724-13756 - Jinchang Zhu, Jindong Li, Cheng Zhang, Jiahong Liu, Menglin Yang:

HeLa-Mem: Hebbian Learning and Associative Memory for LLM Agents. 13757-13769 - Lipeng He, Vasisht Duddu, N. Asokan:

Locket: Robust Feature-Locking Technique for Language Models. 13770-13784 - Yuanpu Cao, Ziyi Yin, Fenglong Ma, Jinghui Chen:

Can Factual Opinions Be Edited (Manipulated) in Large Language Models? 13785-13801 - Shaoyang Xu, Wenxuan Zhang:

Language of Thought Shapes Output Diversity in Large Language Models. 13802-13816 - Livia Qian, Gabriel Skantze:

Aligning Backchannel and Dialogue Context Representations via Contrastive LLM Fine-Tuning. 13817-13833 - Chang Liu

, Benjamin Wagley, Zibo Wang, Mehmet E. Belviranli, Bo Wu:
Closing the Spatial Execution Gap in Digital Whiteboards via Verifiable Reinforcement Learning. 13834-13849 - Lingxiao Tang, He Ye, Zhaoyang Chu, Muyang Ye, Zhongxin Liu, Xiaoxue Ren, Lingfeng Bao:

ExecVerify: White-Box RL with Verifiable Stepwise Rewards for Code Execution Reasoning. 13850-13875 - Haobo Xu, Sirui Chen, Ruizhong Qiu, Yuchen Yan, Chen Luo, Monica Xiao Cheng, Jingrui He, Hanghang Tong:

Prune as You Generate: Online Rollout Pruning for Faster and Better RLVR. 13876-13893 - Zixuan Huang, Yanxiang Ma, Luhan Wang, Yunke Wang, Duo Shi, Chang Xu:

Mitigating Legal Hallucinations via Symbolic Constraints and Analogical Precedents. 13894-13920 - Disen Liao, Freda Shi:

How Tokenization Limits Phonological Knowledge Representation in Language Models and How to Improve Them. 13921-13938 - Katelyn Xiaoying Mei, Yi-Li Hsu, Minjoon Choi, Zongwan Cao, Chenjun Xu, Bingbing Wen, Su Lin Blodgett, Lucy Lu Wang:

Illusions of the Gold Standard: A Large-scale Analysis of Human Evaluation Protocols for Long-form Text Generation. 13939-13961 - Chi-Min Chan, Yujin Zhou, Pengcheng Wen, Boqin Yin, Jiaming Ji, Juntao Dai, Wei Xue, Sirui Han, Yike Guo:

Omni-RewardBench: Toward a Comprehensive Evaluation of Generative Reward Models Across Modalities. 13962-13984 - Chen Zhan, Xiaoyu Tan, Gengchen Ma, Yu-Jie Xiong, Xiaoyan Jiang, Xihe Qiu:

From Answers to Arguments: Toward Trustworthy Clinical Diagnostic Reasoning with Toulmin-Guided Curriculum Goal-Conditioned Learning. 13985-14004 - Ruochong Xiong, Qien Li, Wangwang Lian, Yulong Wan, Hanlin Xue, Zhouxing Tan, Han Yang, Fengyu Lu, Junfei Liu:

Verifiable LLM-Generated Text Detection via Projected Semantic-Structural Distributions. 14005-14042 - Yuxia Wang, Rui Xing, Jonibek Mansurov, Giovanni Puccetti, Zhuohan Xie, Minh Ngoc Ta, Jiahui Geng, Jinyan Su, Mervat Abassy, Saadeldine Eletter, Kareem Ashraf Elozeiri, Nurkhan Laiyk, Maiya Goloburda, Tarek Mahmoud, Raj Vardhan Tomar, Alexander Aziz, Ryuto Koike, Masahiro Kaneko, Artem Shelmanov, Ekaterina Artemova, Vladislav Mikhailov, Akim Tsvigun, Alham Fikri Aji, Nizar Habash, Iryna Gurevych, Preslav Nakov:

Is Human-Like Text Liked by Humans? Multilingual Human Detection and Preference Against AI. 14043-14076 - David Ilic, David Stanojevic, Kostadin Cvejoski:

Powerful Training-Free Membership Inference Against Fine-Tuned Autoregressive Language Models. 14077-14093 - Yuanfei Wang, Xinju Huang, Fangwei Zhong, Yaodong Yang, Yizhou Wang, Yuanpei Chen, Hao Dong:

Communication-Efficient Desire Alignment for Proactive Embodied Human-Agent Interaction. 14094-14108 - Francesco Ortu, Zhijing Jin, Diego Doimo, Alberto Cazzaniga:

When Seeing Overrides Knowing: Disentangling Knowledge Conflicts in Vision-Language Models. 14109-14130 - Ziyi Yin, Yuanpu Cao, Ting Wang, Jinghui Chen, Fenglong Ma:

ICDAGENT: Empowering Agentic Large Language Models for Explainable Medical Coding. 14131-14149 - Lawrence Lim, Jiaming Liu, Vikas Kalagi, Divyakant Agrawal, Amr El Abbadi:

Hyperion: Private Token Sampling with Homomorphic Encryption. 14150-14159 - Gaifan Zhang, Danushka Bollegala:

Map of Encoders - Mapping Sentence Encoders using Quantum Relative Entropy. 14160-14208 - Weixi Tong, Yifeng Di, Tianyi Zhang:

Mango: Multi-Agent Web Navigation via Global-View Optimization. 14209-14223 - Qian Cao, Yahui Liu, Wei Bi, Yi Zhao, Ruihua Song, Xiting Wang, Ruiming Tang, Guorui Zhou, Han Li:

DPWriter: Reinforcement Learning with Diverse Planning Branching for Creative Writing. 14224-14250 - Bruce Qin, Dan Goldwasser:

Iterative Dual-Model Alignment for Story Evaluation. 14251-14264 - Kun Li, Zenan Xu, Junan Li, Zengrui Jin, Jinghao Deng, Zexuan Qiu, Bo Zhou:

Discovery and Reinforcement of Tool-Integrated Reasoning Chains via Rollout Trees. 14265-14283 - Hyeong Kyu Choi, Xiaojin (Jerry) Zhu, Sharon Li:

When Identity Skews Debate: Anonymization for Bias-Reduced Multi-Agent Reasoning. 14284-14311 - Clara Lachenmaier, Hannah Bultmann

, Sina Zarrieß:
Talking to a Know-It-All GPT or a Second-Guesser Claude? How Repair reveals distinct Multi-Turn Behavior in LLMs. 14312-14325 - Yi Jing, Weiyun Qiu, Yihang Peng, Zhifang Sui:

HistLens: Mapping Idea Change across Concepts and Corpora. 14326-14351 - Suyoung Bae, CheolWon Na, Jaehoon Lee, Yumin Lee, YunSeok Choi, Jee-Hyong Lee:

ReFEree: Reference-Free and Fine-Grained Method for Evaluating Factual Consistency in Real-World Code Summarization. 14352-14377 - Xiquan Li, Junxi Liu, Yuzhe Liang, Zhikang Niu, Wenxi Chen, Xie Chen:

MeanAudio: Fast and Faithful Text-to-Audio Generation with Mean Flows. 14378-14393 - Hyeong Kyu Choi, Sharon Li:

ModeX: Evaluator-Free Best-of-N Selection for Open-Ended Generation. 14394-14416 - Zhongyu Ouyang, Qianlong Wen, Chunhui Zhang, Yanfang Ye, Soroush Vosoughi:

What Makes LLMs Effective Sequential Recommenders? A Study on Preference Intensity and Temporal Context. 14417-14434 - Jiale Liu, Victor S. Bursztyn, Lin Ai, Haoliang Wang, Sunav Choudhary, Saayan Mitra, Qingyun Wu:

TeamFusion: Supporting Open-ended Teamwork with Multi-Agent Systems. 14435-14456 - Cy Xie:

FormulaSPIN: Self-Play Fine-Tuning for Natural Language to Spreadsheet Formula Generation. 14457-14471 - Sen Fang, Yalin Feng, Hongbin Zhong, Yanxin Zhang, Dimitris N. Metaxas:

Stable Signer: Hierarchical Sign Language Generative Model. 14472-14483 - Bo Zhang, Jiawei Zhang, Cong Gao, Bingxu Han, Minghao Hu, Jun Zhang, Yunbo Cao, Zhunchen Luo, Wen Yao, Guotong Geng, Zhong Wang:

DisCal: Distribution-Aware Calibration for Mathematical Reasoning Under Character-Level Noisy Inputs. 14484-14507 - Yiqiao Jin, Kartik Sharma, Vineeth Rakesh, Yingtong Dou, Menghai Pan, Mahashweta Das, Srijan Kumar:

SARA: Selective and Adaptive Retrieval-augmented Generation with Context Compression. 14508-14528 - Zhuohan Xie, Daniil Orel, Rushil Thareja, Dhruv Sahnan, Hachem Madmoun, Fan Zhang, Debopriyo Banerjee, Georgi Nenkov Georgiev, Xueqing Peng, Lingfei Qian, Jimin Huang, Jinyan Su, Aaryamonvikram Singh, Rui Xing, Rania Elbadry, Chen Xu, Haonan Li, Fajri Koto, Ivan Koychev, Tanmoy Chakraborty, Yuxia Wang, Salem Lahlou, Veselin Stoyanov, Sophia Ananiadou, Preslav Nakov:

FinChain: A Symbolic Benchmark for Verifiable Chain-of-Thought Financial Reasoning. 14529-14553 - Jenna Russell, Marzena Karpinska, Destiny Akinode, James Zhou, Katherine Thai, Bradley Emi, Max Spero, Mohit Iyyer:

AI use in American newspapers is widespread, uneven, and rarely disclosed. 14554-14580 - Wenlong Deng, Qi Zeng, Jiaming Zhang, Minghui Chen, Zixin Ding, Christos Thrampoulidis, Boying Gong, Xiaoxiao Li:

For-Value: Efficient Forward-Only Data Valuation for finetuning LLMs and VLMs. 14581-14600 - Yan Wang, Yitao Xu, Nanhan Shen, Jinyan Su, Jimin Huang, Zining Zhu:

The Illusion of Specialization: Unveiling the Domain-Invariant "Standing Committee" in Mixture-of-Experts Models. 14601-14618 - Hengyuan Zhang, Shiping Yang, Xiao Liang, Chenming Shang, Yuxuan Jiang, Chaofan Tao, Jing Xiong, Hayden Kwok-Hay So, Ruobing Xie, Angel X. Chang, Ngai Wong:

Find Your Optimal Teacher: Personalized Data Synthesis via Router-Guided Multi-Teacher Distillation. 14619-14637 - Yan Xia, Zhuangzhuang Pan, Amirrudin Kamsin, Chee Seng Chan:

Single-Pass, Depth-Selective Reading for Multi-Aspect Sentiment Analysis. 14638-14656 - Viet Pham, Thai Le:

PARASITE: Conditional System Prompt Poisoning to Hijack LLMs. 14657-14676 - Peter Jansen, Peter Clark, Doug Downey, Daniel S. Weld:

Generating Literature-Driven Scientific Theories at Scale. 14677-14698 - Zisu Huang, Muzhao Tian, Xiaohua Wang, Jingwen Xu, Zhengkang Guo, Qi Qian, Kaitao Song, Jiakang Yuan, Changze Lv, Xiaoqing Zheng:

Controllable Memory Usage: Balancing Anchoring and Innovation in Long-Term Human-Agent Interaction. 14699-14719 - Anjali Sarawgi, Esteban Garces Arias, Christof Zotter:

Digitizing Nepal's Written Heritage: A Comprehensive HTR Pipeline for Old Nepali Manuscripts. 14720-14746 - Jiahao Xu, Rui Hu, Olivera Kotevska, Zikai Zhang:

XMark: Reliable Multi-Bit Watermarking for LLM-Generated Texts. 14747-14763 - Keyu He, Tejas Srinivasan, Brihi Joshi, Xiang Ren, Jesse Thomason, Swabha Swayamdipta:

Believing without Seeing: Quality Scores for Contextualizing Vision-Language Model Explanations. 14764-14789 - Arda Yüksel, Gabriel Thiem, Susanne Walter, Patrick Felka, Gabriela Alves Werb, Ivan Habernal:

MONETA: Multimodal Industry Classification through Geographic Information with Multi Agent Systems. 14790-14814 - Anneliese Brei, Abhisheik Sharma, Nicholas Sanaie, Lu Wang, Snigdha Chaturvedi:

CASPER in the Machine: Insights into Character Variety in LLM-Generated Stories. 14815-14840 - Michael A. Lepori, Tal Linzen, Ann Yuan, Katja Filippova:

Language Models Struggle to Use Representations Learned In-Context. 14841-14857 - Yiqiao Jin, Rachneet Kaur, Zhen Zeng, Sumitra Ganesh, Srijan Kumar:

SlideAgent: Hierarchical Agentic Framework for Multi-Page Visual Document Understanding. 14858-14881 - Victor De Lima, Grace Hui Yang:

YIELD: A Large-Scale Dataset and Evaluation Framework for Information Elicitation Agents. 14882-14895 - Riyang Bao, Cheng Yang, Dazhou Yu, Zhexiang Tang, Gengchen Mai, Liang Zhao:

Spatial-Agent: Agentic Geo-spatial Reasoning with Scientific Core Concepts. 14896-14911 - Wenbo Chen, Veena Padmanabhan, Tootiya Giyahchi, Elaine Wong, Leman Akoglu:

Rethinking Evaluation for LLM Hallucination Detection: A Desiderata, A New RAG-based Benchmark, New Insights. 14912-14931 - Yuanhao Ding

, Meimingwei Li, Esteban Garces Arias, Matthias Aßenmacher, Christian Heumann, Chongsheng Zhang:
Min-k Sampling: Decoupling Truncation from Temperature Scaling via Relative Logit Dynamics. 14932-14948 - Yujan Ting, Xu Tang, Terrence Chen, Weijing Huang:

Bridging the Memorization-Utilization Gap: Near-Lossless Context Compression via Reinforcement Learning. 14949-14972 - Xiangfeng Wang, Hangyu Guo, Yanlin Lai, Mitt Huang, Liang Zhao, Chengyuan Yao, Yinmin Zhang, Qi Han, Xiaoxiao Ren, Chun Yuan, Tong Xu, Zheng Ge, Xiangyu Zhang, Daxin Jiang:

PRIME: A Process-Outcome Alignment Benchmark for Verifiable Reasoning in Mathematics and Engineering. 14973-14985 - Zechen Li

, Baiyu Chen, Hao Xue, Flora D. Salim:
ZARA: Training-Free Motion Time-Series Reasoning via Evidence-Grounded LLM Agents. 14986-15008 - Xuanwen Ding, Chengjun Pan, Zejun Li, Jiwen Zhang, Siyuan Wang, Zhongyu Wei:

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs. 15009-15034 - Yingshan Susan Wang, Linlu Qiu, Zhaofeng Wu, Roger P. Levy, Yoon Kim:

Implicit Representations of Grammaticality in Language Models. 15035-15055 - Xiutian Zhao, Björn W. Schuller, Berrak Sisman:

Discovering and Causally Validating Emotion-Sensitive Neurons in Large Audio-Language Models. 15056-15071 - Jaspreet Ranjit, Hyundong Justin Cho, Claire J. Smerdon, Yoonsoo Nam, Myles Phung, Jonathan May, John R. Blosnich, Swabha Swayamdipta:

Uncovering Intervention Opportunities for Suicide Prevention with Language Model Assistants. 15072-15092 - Bolei Ma

, Yusuke Miyao:
The Imperfective Paradox in Large Language Models. 15093-15111 - Xinghe Chen, Naiming Liu, Shashank Sonkar:

MalruleLib: Large-Scale Executable Misconception Reasoning with Step Traces for Modeling Student Thinking in Mathematics. 15112-15138 - Xinhe Shi, Qingcheng Zeng, Weihao Xuan, Linchao Zhu:

How to Improve LLMs' Performance on Specific Languages: A Perspective on LLM-Derived Language Similarity. 15139-15164 - Linrui Ma, Chun Hei Lo, Xinyu Wang, Peng Lu, Xihao Yuan, Hanting Chen, Kai Han, Xinghao Chen, Chengjun Zhan, Hanlin Xu, Yichun Yin, Lifeng Shang, Feng Wen, Boxing Chen, Yufei Cui:

MATCH: Modulating Attention via In-Context Retrieval for Long-Context Transformers. 15165-15179 - Xiao Zhan, Guangzhi Sun, Jose Such, Philip C. Woodland:

Protecting Bystander Privacy via Selective Hearing in Audio LLMs. 15180-15192 - Pei-Fu Guo, Yun-Da Tsai, Chun-Chia Hsu, Kai-Xin Chen, Ya-An Tsai, Kai-Wei Chang, Nanyun Peng, Mi-Yen Yeh, Shou-De Lin:

LiveCLKTBench: Towards Reliable Evaluation of Cross-Lingual Knowledge Transfer in Multilingual LLMs. 15193-15208 - Zohaib Khan, Mustafa Dogan, Ifeoma Okoh, Pouya Sadeghi, Siddhartha Shrestha, Sergius Justus Chesami Nyah, Mahmoud O. Mokhiamar, Michael J. Ryan, Tarek Naous:

To Lie or Not to Lie? Investigating The Biased Spread of Global Lies by LLMs. 15209-15228 - Andreia Podasca, Anup Das

:
Robertha: Eigenspectrum Regularized Attention for Robust Natural Language Understanding. 15229-15264 - Mohit Raghavendra, Anisha Gunjal, Bing Liu, Yunzhong He:

Agentic Rubrics as Contextual Verifiers for SWE Agents. 15265-15290 - Linfeng Liu

, Saptarshi Ghosh, Tianyu Jiang:
Evaluating the Impact of Verbal Multiword Expressions on Machine Translation. 15291-15319 - Jianwen Chen, Xinyu Yang, Peng Xia, Arian Azarang, Yueh Z. Lee, Gang Li, Hongtu Zhu, Yun Li, Beidi Chen, Huaxiu Yao:

MedVerse: Efficient and Reliable Medical Reasoning via DAG-Structured Parallel Execution. 15320-15336 - Saptarshi Ghosh, Tianyu Jiang:

MetFuse: Figurative Fusion between Metonymy and Metaphor. 15337-15350 - Ibne Farabi Shihab, Sanjeda Akter, Anuj Sharma:

Adaptive Constraint Propagation: Scaling Structured Inference for Large Language Models via Meta-Reinforcement Learning. 15351-15368 - Juntong Ni, Shiyu Wang, Qi He, Ming Jin, Wei Jin:

STReasoner: Empowering LLMs for Spatio-Temporal Reasoning in Time Series via Spatial-Aware Reinforcement Learning. 15369-15416 - Xiaohan Zou, Roshan Sridhar, Mohammadtaher Safarzadeh, Dan Roth:

When Vision-Language Models Judge Without Seeing: Exposing Informativeness Bias. 15417-15448 - Alexandra Bazarova, Andrei Volodichev, Aleksandr Yugay, Andrey Shulga, Alina Ermilova, Konstantin Polev, Julia Belikova, Rauf Parchiev, Dmitry Simakov, Maxim Savchenko, Andrey V. Savchenko, Serguei Barannikov, Alexey Zaytsev:

Hallucination Detection in LLMs with Topological Divergence on Attention Graphs. 15449-15470 - Saptarshi Ghosh, Tianyu Jiang:

Exploring Concreteness Through a Figurative Lens. 15471-15490 - Shachar Don-Yehiya, Asaf Yehudai, Leshem Choshen, Omri Abend:

Mediocrity is the key for LLM as a Judge Anchor Selection. 15491-15513 - Yibo Peng, James Song, Lei Li, Xinyu Yang, Mihai Christodorescu, Ravi Mangal, Corina S. Pasareanu, Haizhong Zheng, Beidi Chen:

When "Correct" Is Not Safe: Can We Trust Functionally Correct Patches Generated by Code Agents? 15514-15546 - Yuanxiang Liu, Songze Li, Xiaoke Guo, Zhaoyan Gong, Qifei Zhang, Huajun Chen, Wen Zhang:

CoG: Controllable Graph Reasoning via Relational Blueprints and Failure-Aware Refinement over Knowledge Graphs. 15547-15568 - John Seon Keun Yi, Aaron Mueller, Dokyun Lee:

Latent Agents: A Post-Training Procedure for Internalized Multi-Agent Debate. 15569-15602 - Feiteng Fang, Dingwei Chen, Xiang Huang, Ting-En Lin, Yuchuan Wu, Xiong Liu, Jing Ye, Ziqiang Liu, Haonan Zhang, Liang Zhu, Hamid Alinejad-Rokny, Min Yang, Yongbin Li:

Act-Adaptive Margin: Dynamically Calibrating Reward Models for Subjective Ambiguity. 15603-15618 - Vignesh Kothapalli, Ata Fatahi Baarzi, Hamed Firooz, Maziar Sanjabi:

To Think or Not to Think: The Hidden Cost of Meta-Training with Excessive CoT Examples. 15619-15644 - Chahat Raj, Bowen Wei, Aylin Caliskan, Antonios Anastasopoulos, Ziwei Zhu:

VIGNETTE: Socially Grounded Bias Evaluation for Vision-Language Models. 15645-15673 - Zhongxing Zhang, Emily K. Vraga, Jisu Huh, Jaideep Srivastava:

BiMind: A Dual-Head Reasoning Model with Attention-Geometry Adapter for Incorrect Information Detection. 15674-15693 - Joaquín Polonuer, Lucas Vittor, Iñaki Arango, Ayush Noori, David A. Clifton, Luciano Del Corro, Marinka Zitnik:

Autonomous Knowledge Graph Exploration with Adaptive Breadth-Depth Retrieval. 15694-15709 - Yuping Lin, Zitao Li, Yue Xing, Pengfei He, Yingqian Cui, Yaliang Li, Bolin Ding, Jingren Zhou, Jiliang Tang:

Retrieval Heads are Dynamic. 15710-15729 - Zhaoyang Wang, Yiming Liang, Xuchao Zhang, Qianhui Wu, Siwei Han, Anson Bastos, Rujia Wang, Chetan Bansal, Baolin Peng, Jianfeng Gao, Saravan Rajmohan, Huaxiu Yao:

SynthAgent: Adapting Web Agents with Synthetic Supervision. 15730-15752 - Wei He:

More Than Meets the Eye: Measuring the Semiotic Gap in Vision-Language Models via Semantic Anchorage. 15753-15767 - Shuang Liu, Ruijia Zhang, Ruoyun Ma, Yujia Deng, Lanyi Zhu, Jiayu Li, Zelong Li, Zhibin Shen, Mengnan Du:

LLM Agents in Law: Taxonomy, Applications, and Challenges. 15768-15792 - Nishant Balepur, Bhavya Rajasekaran, Hyunjin Jane Oh, Michael Xie, Atrey Desai, Vipul Gupta, Steven James Moore, Eunsol Choi, Rachel Rudinger, Jordan Lee Boyd-Graber:

BenchMarker: An Education-Inspired Toolkit for Highlighting Flaws in Multiple-Choice Benchmarks. 15793-15824 - Michael Li, Nishant Subramani:

Model Internal Sleuthing: Finding Lexical Identity and Inflectional Features in Modern Language Models. 15825-15864 - Rajen Chatterjee, Xintong Li, Paisarn Charoenpornsawat, Allen Lee:

HAT: Hallucination Annotation for Translation. 15865-15888 - Kai Yin, Xiangjue Dong, Chengkai Liu, Allen Lin, Lingfeng Shi, Ali Mostafavi, James Caverlee:

DMRetriever: A Family of Models for Improved Text Retrieval in Disaster Management. 15889-15909 - Nishant Balepur, Malachi Hamada, Varsha Kishore, Sergey Feldman, Amanpreet Singh, Pao Siangliulue, Joseph Chee Chang, Eunsol Choi, Jordan Lee Boyd-Graber, Aakanksha Naik:

Language Models Don't Know What You Want: Evaluating Personalization in Deep Research Needs Real Users. 15910-15944 - Zhivar Sourati, Zheng Wang, Marianne Menglin Liu, Yazhe Hu, Mengqing Guo, Sujeeth Bharadwaj, Kyu J. Han, Tao Sheng, Sujith Ravi, Morteza Dehghani, Dan Roth:

LAD-RAG: Layout-aware Dynamic RAG for Visually-Rich Document Understanding. 15945-15968 - Ziyuan Yang, Wenxuan Ding, Shangbin Feng, Yulia Tsvetkov:

Among Us: Measuring and Mitigating Malicious Contributions in Model Collaboration Systems. 15969-15988 - Hanbing Liu, Lang Cao, Yuanyi Ren, Mengyu Zhou, Haoyu Dong, Xiaojun Ma, Shi Han, Dongmei Zhang:

Not All Tokens Matter: Towards Efficient LLM Reasoning via Token Significance in Reinforcement Learning. 15989-16016 - Shuhua Yang, Jiahao Zhang, Yilong Wang, Dongwon Lee, Suhang Wang:

Query-Efficient Agentic Graph Extraction Attacks on GraphRAG Systems. 16017-16041 - Xiulin Yang, Heidi R. Getz, Ethan Gotlieb Wilcox:

Function Words as Statistical Cues for Language Learning. 16042-16058 - Raoyuan Zhao, Yihong Liu, Lena Altinger, Hinrich Schütze, Michael A. Hedderich:

Evaluating Robustness of Large Language Models Against Multilingual Typographical Errors. 16059-16078 - Yan Fang, Jun Chen

, Yian Yao, Shuxin Zhong, Min Sun, Kaishun Wu:
Listening Like Humans: Semantics-Guided Noise-Robust Multimodal Speech Recognition. 16079-16093 - Abdullah Mazhar, Het Riteshkumar Shah, Aseem Srivastava, Smriti Joshi, Md. Shad Akhtar:

Measuring What Matters!! Assessing Therapeutic Principles in Mental-Health Conversation. 16094-16112 - Erel Kaplan, Tomer Bitan, Lian Ghrayeb, Le Chen, Tom Yotam, Niranjan Hasabnis, Gal Oren:

ParaCodex: A Profiling-Guided Autonomous Coding Agent for Reliable Parallel Code Generation and Translation. 16113-16136 - Qi Li, Cheng-Long Wang, Yinzhi Cao, Di Wang:

CoLA: A Choice Leakage Attack Framework to Expose Privacy Risks in Subset Training. 16137-16149 - Zhan Qu, Michael Färber:

MediEval: A Unified Medical Benchmark for Patient-Contextual and Knowledge-Grounded Reasoning in LLMs. 16150-16164 - Eshgin Hasanov, Md. Mahadi Hassan, Santu Karmaker, Aashish Yadavally:

The Path Not Taken: Duality in Reasoning about Program Execution. 16165-16180 - Myra Cheng, Robert D. Hawkins, Dan Jurafsky:

Accommodation and Epistemic Vigilance: A Pragmatic Account of Why LLMs Fail to Challenge Harmful Beliefs. 16181-16203 - Tiejin Chen, Huaiyuan Yao, Jia Chen, Evangelos E. Papalexakis, Hua Wei:

Every Response Counts: Quantifying Uncertainty of LLM-based Multi-Agent Systems through Tensor Decomposition. 16204-16218 - Changdae Oh, Seongheon Park, To Eun Kim, Jiatong Li, Wendi Li, Samuel Yeh, Sean Du, Hamed Hassani, Paul Bogdan, Dawn Song, Sharon Li:

Uncertainty Quantification in LLM Agents: Foundations, Emerging Challenges, and Opportunities. 16219-16250 - Amirhosein Ghasemabadi, Keith G. Mills, Baochun Li, Di Niu:

Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence. 16251-16265 - Ilias Triantafyllopoulos, Renyi Qu, Salvatore Giorgi, Brenda Curtis, Lyle H. Ungar, João Sedoc:

Knowing When Not to Answer: Lightweight KB-Aligned OOD Detection for Safe RAG. 16266-16301 - Haiqing Li, Wenliang Zhong, Yinhao Wu, Hehuan Ma, Yuzhi Guo, Thao M. Dang, Junzhou Huang:

Guidelines as Environments: A World Model Approach to Rule Following. 16302-16318 - Tianyang Xu, Marcelo Sandoval-Castañeda, Karen Livescu, Greg Shakhnarovich, Kanishka Misra:

Cross-Modal Taxonomic Generalization in (Vision-) Language Models. 16319-16337 - Lingxiao Guan, Yuanhao Huang, Jie Liu:

Biomedical Question Answering via Multi-Level Summarization on a Local Knowledge Graph. 16338-16364 - Tu Anh Dinh, Jan Niehues:

Sigmoid Head for Quality Estimation under Language Ambiguity. 16365-16379 - Nicholas Edwards, Yukyung Lee, Yujun Audrey Mao, Yulu Qin, Sebastian Schuster, Najoung Kim:

RExBench: Can coding agents autonomously implement AI research extensions? 16380-16417 - Calvin Isch, Grace Jennings:

Narrative License and Model Sycophancy in LLM Summaries of Scientific Work. 16418-16432 - Nicolas Bougie, Gian Maria Marconi, Xiaotong Ye, Narimawa Watanabe:

AlignUSER: Human-Aligned LLM Agents via World Models for Recommender System Evaluation. 16433-16451 - Minqian Liu, Ioana Baldini, David Rabinowitz, David S. Rosenberg, Sebastian Gehrmann, Mark Dredze:

Domain Generalizable AI Guardrails with Augmented Policy Training. 16452-16469 - Pratyay Banerjee, Masud Moshtaghi, Shivashankar Subramanian, Amita Misra, Ankit Chadha:

APEX-MEM: Agentic Semi-Structured Memory with Temporal Reasoning for Long-Term Conversational AI. 16470-16489 - Harshavardhana T. Gowda, Daniel C. Comstock, Lee M. Miller:

emg2speech: synthesizing speech from electromyography using self-supervised speech models. 16490-16507 - Ruiyao Xu, Mihir Parmar, Tiankai Yang, Zhengyu Hu, Yue Zhao, Kaize Ding:

CoAct: Co-Active LLM Preference Learning with Human-AI Synergy. 16508-16525 - Artur Kulmizev, Erika Lombart, Patrick Watrin, Marie-Catherine de Marneffe:

Label and Explanation Variation in LLM-Based Annotation: a Case Study in Natural Language Inference. 16526-16543 - Mohsen Nayebi Kerdabadi, Arya Hadizadeh Moghaddam, Chen Chen, Dongjie Wang, Zijun Yao:

Text-Attributed Knowledge Graph Enrichment with Large Language Models for Medical Concept Representation. 16544-16560 - Leonardo Ranaldi:

Evolving Agents. 16561-16569 - António Loison, Quentin Macé, Antoine Edy, Victor Xing, Tom Balough, Gabriel de Souza Pereira Moreira, Bo Liu, Manuel Faysse, Céline Hudelot, Gautier Viaud:

ViDoRe V3: A Comprehensive Evaluation of Retrieval Augmented Generation in Complex Real-World Scenarios. 16570-16600 - Lei Hsiung, Tianyu Pang, Yung-Chen Tang, Linyue Song, Tsung-Yi Ho, Pin-Yu Chen, Yaoqing Yang:

Why LLM Safety Guardrails Collapse After Fine-tuning: A Similarity Analysis Between Alignment and Fine-tuning Datasets. 16601-16619 - Ehsan Hoseinzade, Ke Wang, Anandharaju Durai Raju:

TabEmb: Joint Semantic-Structure Embedding for Table Annotation. 16620-16631 - Yilun Zhu, Yuan Zhuang, Nikhita Vedula, Dushyanta Dhyani, Shaoyuan Xu, Mohsen Bayati, Bryan Wang, Shervin Malmasi:

Text-to-Distribution Prediction with Quantile Tokens and Neighbor Context. 16632-16648 - Jonathan Cook, Tim Rocktäschel, Jakob Nicolaus Foerster, Dennis Aumiller, Alex Wang:

Check Your Work: Structured Checklist Feedback for Improving Large Language Models. 16649-16688 - Binchi Zhang, Zhengzhang Chen, Zaiyi Zheng, Jundong Li, Haifeng Chen:

LOKA: Conflict-Aware LLM Knowledge Update with Adaptive Knowledge Memory. 16689-16715 - Dayu Wang, Jiaye Yang, Weikang Li, Jiahui Liang, Yang Li, Deguo Xia, Jizhou Huang:

Student Guides Teacher: Weak-to-Strong Inference via Spectral Orthogonal Exploration. 16716-16733 - Yuqing Yang, Qi Zhu, Zhen Han, Boran Han, Zhengyuan Shen, Shuai Wang, Vassilis N. Ioannidis, Huzefa Rangwala:

When LLMs Read Tables Carelessly: Measuring and Reducing Data Referencing Errors. 16734-16752 - Yiqing Zhang, Xiaozhong Liu, Fabricio Murai:

PubMed Reasoner: Dynamic Reasoning-based Retrieval for Evidence-Grounded Biomedical Question Answering. 16753-16763 - Haikang Deng, Po-Nien Kung, Nanyun Peng:

Decoupling Task-Solving and Output Formatting in LLM Generation. 16764-16781 - Qizhuo Xie, Yunhui Liu, Yu Xing, Qianzi Hou, Xudong Jin, Tao Zheng, Tieke He:

GS-Quant: Granular Semantic and Generative Structural Quantization for Knowledge Graph Completion. 16782-16797 - Binchi Zhang, Xujiang Zhao, Jundong Li, Haifeng Chen, Zhengzhang Chen:

Mind the Gap in Cultural Alignment: Task-Aware Culture Management for Large Language Models. 16798-16813 - Jiateng Liu, Zhenhailong Wang, Xiaojiang Huang, Yingjie Li, Xiang Li, Chenlei Guo, Xing Fan, Ruhi Sarikaya, Heng Ji:

Analyzing and Internalizing Complex Policy Documents for LLM Agents. 16814-16851 - Itay Yona, Amir Sarid, Michael Karasik, Yossi Gandelsman:

In-Context Representation Hijacking. 16852-16867 - Arash Asgari, Huan Wu, Amirreza Naziri, Mojtaba Kolahdouzi, Laleh Seyyed-Kalantari:

Quantifying Metric and Model Agreement in Bias Evaluation of Large Language Models. 16868-16933 - Xueqing Peng, Lingfei Qian, Yan Wang, Ruoyu Xiang, Yueru He, Yang Ren, Mingyang Jiang, Vincent Jim Zhang, Yuqing Guo, Jeff Zhao, Huan He, Yi Han, Yun Feng, Yuechen Jiang, Yupeng Cao, Haohang Li, Yangyang Yu, Xiaoyu Wang, Penglei Gao, Shengyuan Lin, Keyi Wang, Shanshan Yang, Yilun Zhao, Zhiwei Liu, Peng Lu, Jerry Huang, Suyuchen Wang, Triantafillos Papadopoulos, Polydoros Giannouris, Efstathia Soufleri, Nuo Chen, Zhiyang Deng, Heming Fu, Yijia Zhao, Mingquan Lin, Meikang Qiu, Kaleb E. Smith, Arman Cohan, Xiao-Yang Liu, Jimin Huang, Guojun Xiong, Alejandro Lopez-Lira, Xi Chen, Junichi Tsujii, Jian-Yun Nie, Sophia Ananiadou, Qianqian Xie:

MultiFinBen: Benchmarking Large Language Models for Multilingual and Multimodal Financial Application. 16934-16963 - Yuwei Zhang, Wenhao Yu, Shangbin Feng, Yifan Zhu, Letian Peng, Jayanth Srinivasa, Gaowen Liu, Jingbo Shang:

Bidirectional LMs are Better Knowledge Memorizers? A Benchmark for Real-world Knowledge Injection. 16964-16980 - Yusuke Yamauchi, Akiko Aizawa:

Mapping the Circumplex of Affect: Geometric Analysis of Emotion Representations via Hyperspherical Contrastive Learning. 16981-17004 - Xinliang Frederick Zhang, Anhad Mohananey, Alexandra Chronopoulou, Pinelopi Papalampidi, Somit Gupta, Tsendsuren Munkhdalai, Lu Wang, Shyam Upadhyay:

Do LLMs Really Need 10+ Thoughts for "Find the Time 1000 Days Later"? Towards Structural Understanding of LLM Overthinking. 17005-17030 - Jinbiao Wei, Yilun Zhao, Kangqi Ni, Arman Cohan:

Anchor: Branch-Point Data Generation for GUI Agents. 17031-17047 - Shangbin Feng, Wenxuan Ding, Alisa Liu, Zifeng Wang, Weijia Shi, Yike Wang, Shannon Zejiang Shen, Xiaochuang Han, Hunter Lang, Chen-Yu Lee, Tomas Pfister, Yejin Choi, Yulia Tsvetkov:

When One LLM Drools, Multi-LLM Collaboration Rules. 17048-17063 - Mingfei Lu, Yi Zhang, Mengjia Wu, Yue Feng:

From Query to Counsel: Structured Reasoning with a Multi-Agent Framework and Dataset for Legal Consultation. 17064-17078 - Zizhen Wang, Bo Feng, Zhengfeng Lai, Shiyu Li, Yang Lu, Meng Cao, Ping Huang, Xiaoming Simon Wang:

Putting Captions to the Test: Evaluating Video Caption Quality through Multiple-Choice Question Answering. 17079-17099 - Myeong Seok Oh, Dong-Yun Kim

, Hanseok Oh, Chaean Kang, Joeun Kang, Xiaonan Wang, Hyunjung Park, Young Cheol Jung, Hansaem Kim:
Subject-level Inference for Realistic Text Anonymization Evaluation. 17100-17135 - Chuhan Wang

, Xintong Li, Jennifer Yuntong Zhang, Junda Wu, Chengkai Huang, Lina Yao, Julian J. McAuley, Jingbo Shang:
SceneAlign: Aligning Multimodal Reasoning to Scene Graphs in Complex Visual Scenes. 17136-17150 - Muyang Li, Runze Wu, Xiangyu Zhao, Bo Han, Daoyi Dong, Tongliang Liu:

Select Before Use: On the Importance of Reference Model Selection in Preference Alignment. 17151-17171 - Shira Wein, Anna Serbina, Jiyuan Ji, Nathan Wolf, Jason DeGraaff, Prajakta Kini, Maria Leonor Pacheco:

Lost in Translation, and Found: Detecting and Interpreting Translation Effects. 17172-17187 - Aaron Mueller, Andrew Lee, Shruti Joshi, Ekdeep Singh Lubana, Dhanya Sridhar, Patrik Reizinger:

From Isolation to Entanglement: When Do Interpretability Methods Identify and Disentangle Known Concepts? 17188-17210 - Ziyue Yan, Hongying Zan, Xinglin Lyu, Hongfei Xu:

Paraphrasing as Zero-shot Translation with Feature-guided Diversity Enhancement. 17211-17223 - Avinash Amballa, Yashas Malur Saidutta, Chi-Heng Lin, Vivek Kulkarni, Srinivas Chappidi:

VOYAGER: A Training Free Approach for Generating Diverse Datasets using LLMs. 17224-17245 - Akshith Reddy Putta, Jacob Daniel Devasier, Chengkai Li:

CaseFacts: A Benchmark for Legal Fact-Checking and Precedent Retrieval. 17246-17265 - George Ma, Anurag Koul, Qi Chen, Yawen Wu, Sachit Kuhar, Yu Yu, Aritra Sengupta, Varun Kumar, Murali Krishna Ramanathan:

SpecAgent: A Speculative Retrieval and Forecasting Agent for Code Completion. 17266-17327 - Jiaqi Shi, Xulong Zhang, Yuechan Li, Xiaoyang Qu, Jianzong Wang:

From Inheritance to Saturation: Disentangling the Evolution of Visual Redundancy for Architecture-Aware MLLM Inference Acceleration. 17328-17357 - Zhenwen Liang, Ruosen Li, Yujun Zhou, Linfeng Song, Dian Yu, Xinya Du, Haitao Mi, Dong Yu:

Your Reasoning Model is Secretly a Reward Model - Optimization-Free Verification from Experience. 17358-17372 - Mengyang Li, Jingwen Wang, Pinlong Zhao:

What Do LLMs Learn First? Asymmetric Learning Dynamics of Input Complexity and Output Ambiguity in Preference Alignment. 17373-17388 - Jiaju Chen, Yuxuan Lu, Xiaojie Wang, Huimin Zeng, Jing Huang, Jiri Gesi, Ying Xu, Bingsheng Yao, Dakuo Wang:

Multi-Agent-as-Judge: Aligning LLM-Agent-Based Automated Evaluation with Multi-Dimensional Human Evaluation. 17389-17416 - Tianci Liu, Ran Xu, Tony Yu, Ilgee Hong, Carl Yang, Tuo Zhao, Haoyu Wang:

OpenRubrics: Towards Scalable Synthetic Rubric Generation for Reward Modeling and LLM Alignment. 17417-17437 - Haoxiang Sun, Yingqian Min, Zhipeng Chen, Xin Zhao, Ji-Rong Wen:

Challenging the Boundaries of Reasoning: An Olympiad-Level Math Benchmark for Large Language Models. 17438-17457 - Wenxuan Xu, Arvind Pillai, Subigya Nepal, Amanda C. Collins, Daniel M. Mackin, Michael V. Heinz, Tess Z. Griffin, Nicholas C. Jacobson, Andrew T. Campbell:

LENS: LLM-Enabled Narrative Synthesis for Mental Health by Aligning Multimodal Sensing with Language Models. 17458-17481 - Tao Fan, Guoqiang Ma, Yuanfeng Song, Lixin Fan, Kai Chen, Qiang Yang:

FedProxy: Federated Fine-Tuning of LLMs via Proxy SLMs and Heterogeneity-Aware Fusion. 17482-17497 - Siun Kim, Hyung-Jin Yoon:

DiZiNER: Disagreement-guided Instruction Refinement via Simulating Pilot Annotation for Zero-shot Named Entity Recognition. 17498-17519 - Wen Huang, Yuchen Mao, Yanmin Qian:

A Data-Centric Approach to Generalizable Speech Deepfake Detection. 17520-17539 - Yiming Huang, Zhenbo Shi, Xin-Cheng Wen, Jichuan Zeng, Cuiyun Gao, Peiyi Han, Chuanyi Liu:

Free Energy-Driven Reinforcement Learning with Adaptive Advantage Shaping for Unsupervised Reasoning in LLMs. 17540-17560 - Zhuoqun Li, Xuanang Chen, Hongyu Lin, Yaojie Lu, Xianpei Han, Shanshan Jiang, Bin Dong, Le Sun:

PaperRegister: Boosting Flexible-grained Paper Search via Hierarchical Register Indexing. 17561-17575 - Xuan Xiong, Huan Liu, Li Gu, Zhixiang Chi, Yue Qiu, Yuanhao Yu, Yang Wang:

ETR: Entropy Trend Reward for Efficient Chain-of-Thought Reasoning. 17576-17594 - Ziyou Jiang, Mingyang Li, Junjie Wang, Yuekai Huang, Jie Huang, Zhiyuan Chang, Zhaoyang Li, Qing Wang:

All Changes May Have Invariant Principles: Improving Ever-Shifting Harmful Meme Detection via Design Concept Reproduction. 17595-17613 - Jiecong Wang, Haoran Li, Hao Peng, Ziqian Zeng, Zihao Wang, Haohua Du, Zhengtao Yu:

Activation-Guided Local Editing for Jailbreaking Attacks. 17614-17633 - Yanbei Jiang, Amr Keleg, Ryandito Diandaru, Jey Han Lau, Lea Frermann, Biaoyan Fang, Fajri Koto:

Controlling Distributional Bias in Multi-Round LLM Generation via KL-Optimized Fine-Tuning. 17634-17649 - Wenxi Li, Jingyu Peng:

On the Continued Value of Universal Dependencies in the Era of Large Language Models. 17650-17662 - Fang Niu, Chaokun Wang, Hang Zhang, Songyao Wang:

Adaptive Text2GQL: Integrating Structural Twig Linking and Evolutionary In-Context Learning. 17663-17680 - Chunkit Chan, Yauwai Yim, Hongchuan Zeng, Zhiying Zou, Xinyuan Cheng, Zhifan Sun, Zheye Deng, Kawai Chung, Yuzhuo Ao, Yixiang Fan, Cheng Jiayang, Ercong Nie, Ginny Y. Wong, Helmut Schmid, Hinrich Schütze, Simon See, Yangqiu Song:

XToM: Exploring the Multilingual Theory of Mind for Large Language Models. 17681-17716 - Lin Zhong, Renjin Zhu, Shujuan Ma, Jinhao Cui, Lingzhi Wang, Hao Chen, Qing Liao:

Cognitive Policy-Driven LLM for Diagnosis and Intervention of Cognitive Distortions in Emotional Support Conversation. 17717-17746 - Tong Zhang, Honglin Lin, Zhou Liu, Chong Chen, Wentao Zhang:

SciFlow-Bench: Evaluating Structure-Aware Scientific Diagram Generation via Inverse Parsing. 17747-17765 - Sihang Jiang, Zhiyu Lu, Keyi Wang, Jiaqing Liang, Yanghua Xiao, Xiaojun Meng, Jiansheng Wei:

Immediate Inference: The Missing Foundation in Large Language Model Logical Reasoning. 17766-17799 - Jeesu Jung, Sangkeun Jung:

Tracing Logit Trajectories Across Layer Depth: Dataset-Level Explainability for Language Models. 17800-17823 - Seungmin Lee, Jeonghwan Lee, Hyunkuk Lim, Sejoon Kim, Mingi Sung:

REZE: Representation Regularization for Domain-adaptive Text Embedding Pre-finetuning. 17824-17841 - Jiyan Liu, Youzheng Liu, Taihang Wang, Yimin Wang, Ye Jiang, Diana Maynard:

TAMA: Target-Aware Multilingual Abuse Detection by Cascaded Conditional Multi-Task Learning. 17842-17859 - Yulong Wang, Yifei Fu, Jiayi Gao:

Reference Attack: A New Cross-Modal Jailbreaking Attack against Multimodal Large Language Models. 17860-17881 - Chin-Jou Li, Kalvin Chang, Shikhar Bharadwaj, Eunjung Yeo, Kwanghee Choi, Jian Zhu, David R. Mortensen, Shinji Watanabe:

POWSM: A Phonetic Open Whisper-Style Speech Foundation Model. 17882-17899 - Wenxiang Zheng, Guo Tang, Shixin Jiang, Liangyu Huo, Xiyuan Zhang, Jian Xie, Ming Liu:

LCR-RAG: Enhancing Logical Consistency in Retrieval-Augmented Generation via Neuro-symbolic Reinforcement Learning. 17900-17916 - Yongxuan Wu, Xixun Lin, He Zhang, Nan Sun, Kun Wang, Chuan Zhou, Shirui Pan, Yanan Cao:

CIA: Inferring the Communication Topology from LLM-based Multi-Agent Systems. 17917-17933 - Taehyeon Kim, Hyunsoo Lee, Youngsoo Jang, Moontae Lee:

Efficiently Learning To Reason or Not to Reason: Root-token Policy Optimization for Adaptive Thinking. 17934-17949 - Jie Huang

, Xin Liao, Junjie Wang, Mingyang Li, Wenshuo Wang, Ziyou Jiang, Shoubin Li, Qing Wang:
SAGE: Synergistic Adaptive Gating of Experts for Hateful Video Detection. 17950-17966 - Joongmin Shin, Gyuho Shim, Jeongbae Park, Jaehyung Seo, Heuiseok Lim:

HiKEY: Hierarchical Multimodal Retrieval for Open-Domain Document Question Answering. 17967-17987 - Fan Li, Yu Gu, Zhigang Wang, Fangling Leng, Zhenghao Liu, Ge Yu:

Towards Efficient and Effective Diffusion Language Model Inference via Semantic-Aware Adaptive Denoising. 17988-18002 - Yun He, Wenzhe Li, Hejia Zhang, Songlin Li, Karishma Mandyam, Sopan Khosla, Yuanhao Xiong, Nanshu Wang, Xiaoliang Peng, Beibin Li, Shengjie Bi, Shishir G. Patil, Qi Qi, Shengyu Feng, Julian Katz-Samuels, Richard Yuanzhe Pang, Sujan Kumar Gonugondla, Hunter Lang, Yue Yu, Yundi Qian, Maryam Fazel-Zarandi, Licheng Yu, Amine Benhalloum, Hany Hassan Awadalla, Manaal Faruqui:

AdvancedIF: Rubric-Based Benchmarking and Reinforcement Learning for Advancing LLM Instruction Following. 18003-18022 - Shaoqi Wang, Lu Yu, Siwei Lou, Feng Yan, Chunjie Yang, Qing Cui, Jun Zhou:

Improving Autoformalization Using Direct Dependency Retrieval. 18023-18040 - Zhenghao Liu, Zhuoyang Wu, Xinze Li, Yukun Yan, Shuo Wang, Zulong Chen, Yu Gu, Ge Yu, Maosong Sun:

Long-Chain Reasoning Distillation via Adaptive Prefix Alignment. 18041-18059 - Yilun Liu, Ruihong Qiu, Zi Huang:

TRN-R1-Zero: Text-rich Network Reasoning via LLMs with Reinforcement Learning Only. 18060-18072 - Xingyue Huang, Xueying Ding, Mingxuan Ju, Yozen Liu, Neil Shah, Tong Zhao:

Threshold Differential Attention for Sink-Free, Ultra-Sparse, and Non-Dispersive Language Modeling. 18073-18092 - Shikhar Bharadwaj, Chin-Jou Li, Yoonjae Kim, Kwanghee Choi, Eunjung Yeo, Ryan Soh-Eun Shim, Hanyu Zhou, Brendon Boldt, Karen Rosero, Kalvin Chang, Darsh Agrawal, Keer Xu, Chao-Han Huck Yang, Jian Zhu, Shinji Watanabe, David R. Mortensen:

PRiSM: Benchmarking Phone Realization in Speech Models. 18093-18112 - Xinhe Wang, Jin Huang, Xingjian Zhang, Tianhao Wang, Jiaqi W. Ma:

Your Reasoning Benchmark May Not Test Reasoning: Revealing Perception Bottleneck in Abstract Reasoning Benchmarks. 18113-18124 - Junru Song, Hengzhe Jin, Yucong Huang, Tingsong Jiang, Weien Zhou, Feifei Wang, Yang Yang, Ying Wen, Wen Yao:

Model-Based Imaginative Planning for Embodied Agents. 18125-18147 - Prerna Juneja, Lika Lomidze:

Persona-Grounded Safety Evaluation of AI Companions in Multi-Turn Conversations. 18148-18175 - Huiyao Chen

, Yi Yang
, Yinghui Li, Meishan Zhang, Baotian Hu, Min Zhang:
Beyond Chunking: Discourse-Aware Hierarchical Retrieval for Long Document Question Answering. 18176-18198 - Jingting Zheng, Yuqi Ren, Linhao Yu, Yongqi Leng, Deyi Xiong:

Beyond Value Benchmarks: Measuring Value-Structure Alignment in Large Language Models via Symmetric Q-Sorts. 18199-18230 - Yicheng Liu, Shumin Shi, Youchao Zhou, Xingchen Zhang:

Would LLMs be Good Historical Linguists and Chinese Dialect Learners? 18231-18256 - Lei Ding, Bin He, Chenguang Wang, Yang Liu:

ProActor: Timing-Aware Reinforcement Learning for Proactive Task Scheduling Agents. 18257-18303 - Jingru Li

, Wei Ren, Tianqing Zhu:
Seeing No Evil: Blinding Large Vision-Language Models to Safety Instructions via Adversarial Attention Hijacking. 18304-18323 - Jiali Chen, DingBa Fu, Xusen Hei, Yuhang Liu, Yiyang Chen, Jiayuan Xie, Wenqi Fan, Yi Cai:

CADMate: Generating CAD Assembly Plan with Geometric Chain-of-Thought and Spatial Physical Rewards. 18324-18348 - Yunyao Zhang, Xinglang Zhang, Junxi Sheng, Wenbing Li, Junqing Yu, Yi-Ping Phoebe Chen, Wei Yang, Zikai Song:

Semantic-Aware Logical Reasoning via a Semiotic Framework. 18349-18374 - Ziqi Wang, Xingzhou Lou, Meiqi Wu, Zhengqi Wen, Junge Zhang:

Calibration-Aware Policy Optimization for Reasoning LLMs. 18375-18390 - Daojun Chen, Xi Wang, Shenyuan Ren, Qingzhi Ma, Pengpeng Zhao, An Liu:

GBV-SQL: Guided Generation and SQL2Text Back-Translation Validation for Multi-Agent Text2SQL. 18391-18406 - Shiqi He, Yue Cui, Xinyu Ma, Yaliang Li, Bolin Ding, Mosharaf Chowdhury:

Branch-and-Browse: Efficient and Controllable Web Exploration with Tree-Structured Reasoning and Action Memory. 18407-18418 - Yebo Wu, Jingguang Li, Chunlin Tian, KaHou Tam, Zhijiang Guo, Li Li:

Beyond End-to-End: Dynamic Chain Optimization for Private LLM Adaptation on the Edge. 18419-18435 - Lin Mu, Haiyang Wang, Li Ni, Lei Sang, Zhize Wu, Peiquan Jin, Yiwen Zhang:

TalkLoRA: Communication-Aware Mixture of Low-Rank Adaptation for Large Language Models. 18436-18451 - Yulong Wang, Siyu Zhao:

TARE: Lightweight Token-Aware Representation Editing for Fine-tuning Transformer-like Models. 18452-18471 - Yitong Wang, Xue Han, Wenchun Gao, Qian Hu, Jiahui Wang, Ziqing Wang, Lijun Mei, Junlan Feng:

Soft Orthogonal Low-Rank Adaptation for Knowledge Sharing in Large Language Model Continual Learning. 18472-18487 - Rachneet Kaur, Nishan Srishankar, Zhen Zeng, Sumitra Ganesh:

ChartAgent: A Multimodal Agent for Visually Grounded Reasoning in Complex Chart Question Answering. 18488-18555 - Youliang Yuan, Qiuyang Mang, Jingbang Chen, Hong Wan, Xiaoyuan Liu, Junjielong Xu, Jen-tse Huang, Wenxuan Wang, Wenxiang Jiao, Pinjia He:

Curing Miracle Steps in LLM Mathematical Reasoning with Rubric Rewards. 18556-18577 - Sangwon Ryu, Heejin Do, Yunsu Kim, Gary Geunbae Lee, Jungseul Ok:

Adaptive Planning for Multi-Attribute Controllable Summarization with Monte Carlo Tree Search. 18578-18595 - Yuhan Chen, Zizhuo Shen, Miaomiao Cheng, Xu Han, Jiefu Gong, Shijin Wang, Wei Song:

CPT-Agent: A Cognitive Process Theory-driven Framework for Student Simulation in Writing Development. 18596-18616 - Wu Li, Yigeng Zhou, Zesheng Shi, Yequan Wang, Min Zhang, Jing Li:

Team-Based Self-Play With Dual Adaptive Weighting for Fine-Tuning LLMs. 18617-18632 - Xichen Zhang, Ziyi He, Yinghao Zhu, Sitong Wu, Shaozuo Yu, Meng Chu, Wenhu Zhang, Haoru Tan, Jiaya Jia:

SearchGym: Bootstrapping Real-World Search Agents via Cost-Effective and High-Fidelity Environment Simulation. 18633-18665 - Zhanyu Wu, Richong Zhang, Zhijie Nie:

Learning to Select: Query-Aware Adaptive Dimension Selection for Dense Retrieval. 18666-18677 - Zizhen Li, Chuanhao Li, Yibin Wang, Jianwen Sun, Yukang Feng, Jiaxin Ai, Fanrui Zhang, Mingzhu Sun, Yifei Huang, Kaipeng Zhang:

MeepleLM: A Virtual Playtester Simulating Diverse Subjective Experiences. 18678-18722 - Chengyan Wu, Bolei Ma

, Ningyuan Deng, Yanqing He, Yun Xue, Xiaoyong Liu:
MSMO-ABSA: Multi-Scale and Multi-Objective Optimization for Cross-Lingual Aspect-Based Sentiment Analysis. 18723-18735 - Zixuan Weng, Jinghuai Zhang, Kunlin Cai, Ying Li, Peiran Wang, Yuan Tian:

FineSteer: A Unified Framework for Fine-Grained Inference-Time Steering in Large Language Models. 18736-18756 - Xinyu Li

, Kexi Chen
, Jiajie Shen, Ying Zheng, Hong Lu, Jin Zhao, Xin Wang:
Is the Attention Matrix Really the Key to Self-Attention in Multivariate Long-Term Time Series Forecasting? 18757-18773 - Seokhoon Kang, Yejin Jeon, Seonjeong Hwang, Gary Lee:

Difficulty-Controllable Cloze Question Distractor Generation. 18774-18791 - Jianghao Lin, Yuanyuan Shi, Xin Peng, Renjie Ding, Hairui Wang, Yuxuan Peng, Bizhe Bai, Weixi Song, Fengshuo Bai, Huacan Chai, Weinan Zhang, Fei Huang, Ying Wen:

ToolPRM: Fine-Grained Inference Scaling of Structured Outputs for Function Calling. 18792-18804 - Tenghao Huang, Kung-Hsiang Huang, Prafulla Kumar Choubey, Yilun Zhou, Muhao Chen, Jonathan May, Chien-Sheng Wu:

GTA: Generating Long-horizon Tasks for Web Agents at Scale. 18805-18820 - Chaoren Wang, Heng Lu, Xueyao Zhang, Shujie Liu, Yan Lu, Jinyu Li, Zhizheng Wu:

Closing the Modality Reasoning Gap for Speech Large Language Models. 18821-18835 - Xinglang Zhang, Yunyao Zhang, ZeLiang Chen, Junqing Yu, Wei Yang, Zikai Song:

Logical Phase Transitions: Understanding Collapse in LLM Logical Reasoning. 18836-18860 - Zijian Wen, Tao Zhang, Shuangwu Chen, Shenghao Ye, Yu Guo, Qirui Chen, Jingxian Shuai, Yunpeng Hou, Huasen He, Jian Yang:

SpecCache: Speculative KV Cache Reuse for Efficient RAG Serving. 18861-18871 - Xu Wang, Bo Wang, Yang Xiang, Yihong Tang, Dongming Zhao, Zifei Yu, Yuexian Hou:

REG: Retrieval via Emotion Similarity for Guiding Empathetic Dialogue Generation. 18872-18883 - Yifan Hu, Peiji Yang, Zhisheng Wang, Yicheng Zhong, Rui Liu:

TellWhisper: Tell Whisper Who Speaks When. 18884-18898 - Zhenhao Zhou, Zhuochen Huang, Yike He, Chong Wang, Jiajun Wang, Yijian Wu, Xin Peng, Yiling Lou:

Taming System Complexity: Demystifying Software Engineering Agents in Diagnosing Linux Kernel Faults. 18899-18916 - Tao Li, Wenshuo Ge, Zhichao Wang, Zihao Cui, Yong Ma, Yingying Gao, Chao Deng, Shilei Zhang, Junlan Feng:

DisCo_Speech: Controllable Zero-Shot Speech Generation with A Disentangled Speech Codec. 18917-18931 - Hao Peng, Yunjia Qi, Xiaozhi Wang, Zijun Yao, Lei Hou, Juanzi Li:

WildReward: Learning Reward Models from In-the-Wild Human Interactions. 18932-18948 - Atsuki Yamaguchi, Terufumi Morishita, Aline Villavicencio, Nikolaos Aletras:

Mitigating Catastrophic Forgetting in Target Language Adaptation of LLMs via Source-Shielded Updates. 18949-18975 - Yuanhe Zhang, Jiayu Tian, Yibo Zhang, Shilinlu Yan, Liang Lin, Zhenhong Zhou, Li Sun, Sen Su:

SEE: Signal Embedding Energy for Quantifying Noise Interference in Large Audio Language Models. 18976-18995 - Yichi Zhang, Zhuo Chen, Lingbing Guo, Jun Xu, Mengshu Sun, Zhizhen Liu, Lei Liang, Wen Zhang, Huajun Chen:

Know the Known and the Unknown: Reasonable Answer Generation with Knowledge-Informed Citations. 18996-19011 - Fuyuan Liu, Dianyu Yu, He Ren, Nayu Liu, Xiaomian Kang, Delai Qiu, Fa Zhang, Genpeng Zhen, Shengping Liu, Jiaen Liang, Wei Huang, Yining Wang, Junnan Zhu:

FocalOrder: Focal Preference Optimization for Reading Order Detection. 19012-19029 - Wenxi Xu, Chuan Qin, Xi Chen, Chuyu Fang, Yuanchun Zhou, Hengshu Zhu:

TLSA: LLM-Guided Text-Label Space Alignment with Contrastive Learning for Generalized Category Discovery. 19030-19046 - Xueying Ding, Xingyue Huang, Mingxuan Ju, Liam Collins, Yozen Liu, Leman Akoglu, Neil Shah, Tong Zhao:

Hierarchical Token Prepending: Enhancing Information Flow in Decoder-based LLM Embeddings. 19047-19066 - Ya Su, Hu Zhang, Dan Qiao, Yujie Wang, Yunxiao Zhao, Yue Fan

, Shike Li, Ru Li, Hongye Tan:
Suggest-Verify-Revise: A Three-Stage Document-Level Event Causality Identification with Narrative Consistency. 19067-19091 - Geonhui Jang, Dongyoon Han, Youngjoon Yoo:

StoryCoder: Narrative Reformulation for Structured Reasoning in LLM Code Generation. 19092-19112 - Jinshuo Liu, Cheng Bi, Meng Wang, Juan Deng, Donghong Ji, Jeff Z. Pan:

ODL-TempLLM: Ontology-Guided and Description Logic-Reasoned Temporal Reasoning with LLMs. 19113-19126 - Xuanren Chen, Chongyang Tao, Tao Shen, Shuai Ma:

FACTrial: Factorized Clinical Contrastive Training for Scalable Patient-Trial Retrieval. 19127-19145 - Sebastian Kobler, Matthew Clemson, Angela Sun, Jonathan K. Kummerfeld:

Your Students Don't Use LLMs Like You Wish They Did. 19146-19170 - Jiaxi Bi, Tongxu Luo, Wenyu Du, Zhengyang Tang, Benyou Wang:

Cut Your Losses! Learning to Prune Paths Early for Efficient Parallel Reasoning. 19171-19189 - Zhiyu Cao, Peifeng Li, Qiaoming Zhu:

Discourse Coherence and Response-Guided Context Rewriting for Multi-Party Dialogue Generation. 19190-19207 - Xinda Wang, Zhengxu Hou, Yangshijie Zhang, Bingren Yan, Jialin Liu, Chenzhuo Zhao, Zhibo Yang, Bin-Bin Yang, Feng Xiao:

EvolvR: Self-Evolving Pairwise Reasoning for Story Evaluation to Enhance Generation. 19208-19241 - Yuhao Shen, Tianyu Liu, Junyi Shen, Jinyang Wu, Quan Kong, Huan Li, Cong Wang:

Double: Breaking the Acceleration Limit via Double Retrieval Speculative Parallelism. 19242-19263 - Zhixiong Zhao, Zukang Xu, Dawei Yang:

BWLA: Breaking the Barrier of W1AX Post-Training Quantization for LLMs. 19264-19290 - Changin Choi, Wonseok Lee, Jungmin Ko, Wonjong Rhee:

Progressive Multimodal Search and Reasoning for Knowledge-Intensive Visual Question Answering. 19291-19315 - Jiuyun Jiang, Yuecheng Hong, Bo Yang, Jin Yang, Guangxin Jiang, Xiaomeng Guo, Guang Xiao:

Dynamics of Cognitive Heterogeneity: Investigating Behavioral Biases in Multi-Stage Supply Chains with LLM-Based Simulation. 19316-19333 - Xinda Wang, Zhengxu Hou, Yangshijie Zhang, Bingren Yan, Jialin Liu, Chenzhuo Zhao, Zhibo Yang, Bin-Bin Yang, Feng Xiao:

Triviality Corrected Endogenous Reward. 19334-19355 - Miao Zhang, Kelly Chen, Md Mehrab Tanjim, Rumi Chunara:

Identity-Robust Language Model Generation via Content Integrity Preservation. 19356-19370 - Zihang Liu, Zhouhua Fang, Hui Liu, Zhiwei Liu, Yong Li, Haishuai Wang:

RFS-Guard: Detecting Reasoning Hallucinations via Cross-Phase Routing Focus in Large Reasoning Models. 19371-19385 - Xv Wang, Wang Zhenyu, Guanyu Zheng

, Rui Zhang:
Causal-ESC: Reliable Policy Learning for Emotional Support Conversation via Causal Inference. 19386-19401 - Dongxu Zhang, Yiding Sun, Cheng Tan, Wenbiao Yan, Ning Yang, Jihua Zhu, Haijun Zhang:

Chain-of-Thought Compression Should Not Be Blind: V-Skip for Efficient Multimodal Reasoning via Dual-Path Anchoring. 19402-19415 - Hongchao Jiang, Yiming Chen, Yushi Cao, Hung-Yi Lee, Robby T. Tan:

CodeJudgeBench: Benchmarking LLM-as-a-Judge for Coding Tasks. 19416-19448 - Yi Hu, Jiaqi Gu, Ruxin Wang, Zijun Yao, Hao Peng, Xiaobao Wu, Jianhui Chen, Muhan Zhang, Liangming Pan:

Towards a Mechanistic Understanding of Large Reasoning Models: A Survey of Training, Inference, and Failures. 19449-19466 - Zeguan Xiao, Siqing Li, Yong Wang, Xuetao Wei, Jian Yang, Yun Chen, Guanhua Chen:

Modeling LLM Unlearning as an Asymmetric Two-Task Learning Problem. 19467-19477 - Xiaokun Sun, Zezhong Wu, Zewen Ding, Linli Xu:

MVP: Enhancing Video Large Language Models via Self-supervised Masked Video Prediction. 19478-19493 - Peiru Yang, Haoran Zheng, Tong Ju, Shiting Wang, Wanchun Ni, Jiajun Liu, Shangguang Wang, Yongfeng Huang, Tao Qi:

Knowledge Poisoning Attacks on Medical Multi-Modal Retrieval-Augmented Generation. 19494-19513 - Naixin Zhai, Pengyang Shao, Binbin Zheng, Yonghui Yang, Fei Shen, Long Bai, Xun Yang:

Maximizing Local Entropy Where It Matters: Prefix-Aware Localized LLM Unlearning. 19514-19531 - Nannan Huang, Iffat Maab, Junichi Yamagishi:

When Bigger Isn't Better: A Comprehensive Fairness Evaluation of Political Bias in Multi-News Summarisation. 19532-19563 - Masato Mita, Taiga Someya, Ryo Yoshida, Yohei Oseki:

Language Acquisition Device in Large Language Models. 19564-19577 - Xuanbai Ren, Luoda Tan, Pei Liu, Tengfei Ma, Xiangzheng Fu, Longyue Wang, Yiping Liu, Xiangxiang Zeng:

CAML: A Conflict-Aware Molecular Language Model Merging Framework for Multi-Constraint Molecular Generation. 19578-19594 - Xiachong Feng, Deyi Yin, Xiaocheng Feng, Yi Jiang, Libo Qin, Yangfan Ye, Lei Huang, Weitao Ma, Qiming Li, Yuxuan Gu, Bing Qin, Lingpeng Kong:

Stratagem: Learning Transferable Reasoning via Trajectory-Modulated Game Self-Play. 19595-19614 - Yanyi Su, Hongshuai Wang, Zhifeng Gao, Jun Cheng:

NOSE: Neural Olfactory-Semantic Embedding with Tri-Modal Orthogonal Contrastive Learning. 19615-19647 - Cunhang Fan, Jun Zhang, Xue Zhang, Shuai Zhang, Zhao Lv, Jianhua Tao, Zhengqi Wen:

ReFL: Reflective Feedback Learning for Hallucination Detection of Large Language Models. 19648-19665 - Weitao Ma, Xiaocheng Feng, Lei Huang, Xiachong Feng, Zhanyu Ma, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He, Bing Qin:

Fine-Mem: Fine-Grained Feedback Alignment for Long-Horizon Memory Management. 19666-19684 - Yiming Chen, Zexin Li, Xianghu Yue, Robby T. Tan, Haizhou Li:

NaturalSloth: Revisiting Denial-of-Service Attacks on Large Language Models. 19685-19702 - Long Yuan, Kaiwen Tian, Zi Chen, Bolong Zheng, Chuan Ma:

HiGoE: Hierarchical Graph of Evidence to Enhance Retrieval-Augmented Generation for Long-context Summarization. 19703-19724 - Cong Huy Nguyen, Son Dinh Nguyen, Guanlin Li, Tuan Dung Nguyen, Aditya Narayan Sankaran, Mai Huy Thong, Thanh Trung Nguyen, Mai Hong Son, Reza Farahbakhsh, Phi Le Nguyen, Noël Crespi:

Region-Grounded Report Generation for 3D Medical Imaging: A Fine-Grained Dataset and Graph-Enhanced Framework. 19725-19740 - Zhengxi Lu, Fei Tang, Guangyi Liu, Jin Ma, Kaitao Song, Xu Tan, Wenqi Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen:

UI-Copilot: Advancing Long-Horizon GUI Automation via Tool-Integrated Policy Optimization. 19741-19762 - Shuyuan Zhao, Wei Chen, Weijie Zhang, Xinrui Hou, Junfeng Shen, Boyan Shi, Shengnan Guo, Youfang Lin, Huaiyu Wan:

STK-Adapter: Incorporating Evolving Graph and Event Chain for Temporal Knowledge Graph Extrapolation. 19763-19778 - Qiyuan Chen, Hongsen Huang, Jiahe Chen, Qian Shao, Jintai Chen, Hongxia Xu, Renjie Hua, Ren Chuan, Jian Wu:

Learning What Matters: Dynamic Dimension Selection and Aggregation for Interpretable Vision-Language Reward Modeling. 19779-19792 - Li Huang, Zhongxin Liu, Yifan Wu, Tao Yin, Dong Li, Jichao Bi, Nankun Mu, Hongyu Zhang, Meng Yan:

DeepGuard: Secure Code Generation via Multi-Layer Semantic Aggregation. 19793-19813 - Weixiao Zhan, Yongcheng Jing, Leszek Rutkowski, Dacheng Tao:

Distillation Traps and Guards: A Calibration Knob for LLM Distillability. 19814-19833 - Pengyun Zhu

, Yuqi Ren, Zhen Wang, Lei Yang, Deyi Xiong:
DVMap: Fine-Grained Pluralistic Value Alignment via High-Consensus Demographic-Value Mapping. 19834-19852 - Jianwen Luo, Yongkang Jin, Yu Hong, Jianmin Yao:

HTMR: Hybrid Token Masking Reinforcement Learning with Verifiable Rewards for Event Argument Extraction with Multi-Perspective Reasoning. 19853-19873 - Zechen Sun, Yuyang Sun, Zecheng Tang, Juntao Li, Wenpeng Hu, Wenliang Chen, Zhunchen Luo, Guotong Geng, Min Zhang:

IS-CoT: Breaking the Long-form Generation Collapse via Interleaved Structural Thinking. 19874-19887 - Mengzhuo Chen, Junjie Wang, Fangwen Mu, Yawen Wang, Zhe Liu, Huanxiang Feng, Qing Wang:

Seeing the Whole Elephant: A Benchmark for Failure Attribution in LLM-based Multi-Agent Systems. 19888-19905 - Yanghao Zhou, Haitian Li, Rexar Lin, Heyan Huang, Jinxing Zhou, Changsen Yuan, Tian Lan, Ziqin Zhou, Yudong Li, Jiajun Xu, Jingyun Liao, YiMing Cheng, Xuefeng Chen, Xian-Ling Mao, Yousheng Feng:

MTAVG-Bench: A Diagnostic Benchmark for Multi-Talker Dialogue-Centric Audio-Video Generation. 19906-19942 - Shanghao Li, Jinda Han, Yibo Wang, Yuanjie Zhu, Zihe Song, Langzhou He, Kenan Kamel A Alghythee, Philip S. Yu:

Why LLMs Hallucinate on Structured Knowledge: A Mechanistic Analysis of Reasoning over Linearized Representations. 19943-19956 - Shuyang Hou, Yi Hu, Muhan Zhang:

SubTokenTest: A Practical Benchmark for Real-World Sub-token Understanding. 19957-19999 - Angqing Jiang, Jianlyu Chen, Zhe Fang, Yongcan Wang, Xinpeng Li, Keyu Ding, Defu Lian:

Benchmarking and Enabling Efficient Chinese Medical Retrieval via Asymmetric Encoders. 20000-20020 - Heming Xia, Cunxiao Du, Rui Li, Chak Tou Leong, Yongqi Li, Wenjie Li:

Merlin's Whisper: Enabling Efficient Reasoning in Large Language Models via Black-box Persuasive Prompting. 20021-20039 - Shuxin Liu, Jianhao Zhang:

CAKE: Causal-Guided Adaptive Knowledge Editing for LLMs. 20040-20070 - Hanwen Shen, Ting Ying, Jiajie Lu, Shanshan Wang:

Preconditioned Test-Time Adaptation for Out-of-Distribution Debiasing in Narrative Generation. 20071-20104 - Liang Lin, Miao Yu, Moayad Aloqaily, Zhenhong Zhou, Kun Wang, Linsey Pang, Prakhar Mehrotra, Qingsong Wen:

Backdoor Collapse: Eliminating Unknown Threats Via Known Backdoor Aggregation In Language Models. 20105-20123 - Zhen Yang, Mingyang Zhang, Feng Chen, Ganggui Ding, Liang Hou, Xin Tao, Ying-Cong Chen:

Less is More: Improving LLM Reasoning with Minimal Test-Time Intervention. 20124-20137 - Qianhong Guo, Wei Xie, Xiaofang Cai, Enze Wang, Shuoyoucheng Ma, Xiaobing Sun, Tian Xia, Kai Chen, Xiaofeng Wang, Baosheng Wang:

League of LLMs: A Benchmark-Free Paradigm for Mutual Evaluation of Large Language Models. 20138-20159 - Hanjun Cho, Jay-Yoon Lee:

RARE: Redundancy-Aware Retrieval Evaluation Framework for High-Similarity Corpora. 20160-20185 - Yue Fan

, Hu Zhang, Yunxiao Zhao, Guangjun Zhang, Hao Zhan, Ru Li, Hongye Tan, Yuanlong Wang:
Leibniz: Theory-of-Mind Driven Neuro-Symbolic Logical Reasoning via Multi-Agent Collaboration. 20186-20210 - Zihan Chen, Yiming Zhang, Wenxiang Geng, Zenghui Ding, Yining Sun:

The Paradox of Outcome Optimization: A Causal Information-Theoretic Bound on Reasoning Shortcuts in LLMs. 20211-20221 - Mohammadtaher Safarzadeh, Hitesh Laxmichand Patel, Afshin Oroojlooy, Graham Horwood, Dan Roth:

SPENCE: A Syntactic Probe for Detecting Contamination in NL2SQL Benchmarks. 20222-20239 - Ai Jian, Jingqing Ruan, Xing Ma, Dailin Li, Weipeng Zhang, Ke Zeng, Xunliang Cai:

PaTaRM: Bridging Pairwise and Pointwise Signals via Preference-Aware Task-Adaptive Reward Modeling. 20240-20268 - Shichen Li, Zhouyang Wang, Zhongqing Wang, Peifeng Li:

Uncovering Sentiment Analysis Circuit in Large Language Model. 20269-20289 - Zikang Liu, Peilan Xu:

Think Before Writing: Feature-Level Multi-Objective Optimization for Generative Citation Visibility. 20290-20303 - Sourajit Saha

, Tejas Gokhale:
Zero-Shot Multimodal Retrieval with Multi-Scale Contextual Representations. 20304-20324 - Zhizhang Fu, Yuancheng Gu, Chenkai Hu, Hanmeng Liu, Yue Zhang:

ReEfBench: Quantifying the Reasoning Efficiency of LLMs. 20325-20346 - Mingze Xu, Zijing Zhao, Qiming Peng, Houwen Peng, Han Hu, Zhanhui Kang, Yuxing Han:

Beyond Ranking: Fine-Grained Diagnostics and Self-Improvement for MLLMs. 20347-20377 - Shuyao Xiao, Shengling Wang, Ke Chao:

Bridging Internal Consistency and External Alignment: A Causal and Dynamic Interpretability Framework for LLM Generation. 20378-20392 - Yifan Li, Yukai Gu, Yingqian Min, Zikang Liu, Yifan Du, Kun Zhou, Min Yang, Xin Zhao, Minghui Qiu:

Beyond the Last Frame: Process-aware Evaluation for Generative Video Reasoning. 20393-20409 - Ziyang Ling, Ronald X. Xu, Mingzhai Sun:

THOR: A Theta-Gamma Hierarchical Oscillatory Reasoning Framework for Multi-hop QA. 20410-20437 - Zhexin Zhang, Xian Qi Loye, Victor Shea-Jay Huang, Junxiao Yang, Qi Zhu, Shiyao Cui, Fei Mi, Lifeng Shang, Yingkang Wang, Hongning Wang, Minlie Huang:

How Should We Enhance the Safety of Large Reasoning Models: An Empirical Study. 20438-20457 - Tian Lan, Yiqian Yang, Qianghuai Jia, Li Zhu, Hui Jiang, Hang Zhu, Weihua Luo, Longyue Wang:

HSCodeComp: A Realistic and Expert-level Agent Benchmark for Hierarchical Rule Application. 20458-20489 - Rui Qian, Chuanhang Deng, Qiang Huang, Jian Xiong

, Mingxuan Li, Yingbo Zhou, Wei Zhai, Jintao Chen, Dejing Dou:
AnchorSeg: Language Grounded Query Banks for Reasoning Segmentation. 20490-20505 - Tong Zhao, Yutao Zhu, Yucheng Tian, Zhicheng Dou:

R⌃3AG: Retriever Routing for Retrieval-Augmented Generation. 20506-20522 - Gibson Nkhata, Uttamasha Anjally Oyshi, Quan Mai, Susan Gauch:

ClusterRAG: Cluster-Based Collaborative Filtering for Personalized Retrieval-Augmented Generation. 20523-20539 - Hao Xu, Rite Bo, Fausto Giunchiglia, Yingji Li, Rui Song:

Toward Robust In-Context Learning: Leveraging Out-of-distribution Proxies for Target Inaccessible Demonstration Retrieval. 20540-20556 - Jiaxin Bai, Wei Fan, Qi Hu, Qing Zong, Chunyang Li, Hong Ting Tsang, Hongyu Luo, Yauwai Yim, Haoyu Huang, Xiao Zhou, Feng Qin, Tianshi Zheng, Xi Peng, Xin Yao, Huiwen Yang, Leijie Wu, J. I Yi, Gong Zhang, Renhai Chen, Yangqiu Song:

AutoSchemaKG: Autonomous Knowledge Graph Construction through Dynamic Schema Induction from Web-Scale Corpora. 20557-20584 - Zhihan Zhang

, Lizi Liao:
Aligned Multi-View Scripts for Universal Chart-to-Code Generation. 20585-20611 - Jonggeun Lee, Junseong Pyo, Gyuhyeon Seo, Yohan Jo:

SpeakerSleuth: Can Large Audio-Language Models Judge Speaker Consistency across Multi-turn Dialogues? 20612-20636 - Shun Zou, Yong Wang, Zehui Chen, Lin Chen, Chongyang Tao, Feng Zhao, Xiangxiang Chu:

Breaking Block Boundaries: Anchor-based History-stable Decoding for Diffusion Large Language Models. 20637-20658 - Zhuo Chen, Minghao Li, Xiaoqian Ma, Siqi Fan, Xiusheng Huang, Liujie Zhang, Weihang Chen:

HiSVD: Principled Low-Rank Approximation of LLMs via Hierarchical Modeling of Information Capacity and Spectral Structure. 20659-20677 - Hu Chen, Binhan Yang, Wei Shen:

Unveiling the Unknown: Open-Set Entity Typing via Two-Stage Generation. 20678-20694 - Jonggeun Lee, Woojung Song, Jongwook Han, Haesung Pyun, Yohan Jo:

Don't Adapt Small Language Models for Tools; Adapt Tool Schemas to the Models. 20695-20719 - Congchi Yin, Ziyi Ye, Piji Li:

Language Reconstruction with Brain Predictive Coding from fMRI Data. 20720-20743 - Jiajie Zhang, Xin Lv, Ling Feng, Lei Hou, Juanzi Li:

Chaining the Evidence: Robust Reinforcement Learning for Deep Search Agents with Citation-Aware Rubric Rewards. 20744-20765 - Xue Zhang, Yunlong Liang, Fandong Meng, Songming Zhang, Kaiyu Huang, Yufeng Chen, Jinan Xu, Jie Zhou:

Think Natively: Unlocking Multilingual Reasoning with Consistency-Enhanced Reinforcement Learning. 20766-20783 - Zihao Cheng, Zeming Liu, Yingyu Shan, Xinyi Wang, Xiangrong Zhu, Yunpu Ma, Hongru Wang, Yuhang Guo, Wei Lin, Yunhong Wang:

Mem²Evolve: Towards Self-Evolving Agents via Co-Evolutionary Capability Expansion and Experience Distillation. 20784-20831 - Hongbo Jin, Kuanwei Lin, Wenhao Zhang, Yichen Jin, Ge Li:

VideoCuRL: Video Curriculum Reinforcement Learning with Orthogonal Difficulty Decomposition. 20832-20845 - Jiachen Qian:

Visual Inception: Compromising Long-term Planning in Agentic Recommenders via Multimodal Memory Poisoning. 20846-20862 - Mengyu Bu, Yang Feng:

Language on Demand, Knowledge at Core: Composing LLMs with Encoder-Decoder Translation Models for Extensible Multilinguality. 20863-20885 - Pengyue Jia, Yingyi Zhang, Xiangyu Zhao, Sharon Li:

GeoArena: Evaluating Open-World Geographic Reasoning in Large Vision-Language Models. 20886-20901 - Chenghao Xu, Jiexi Yan, Guangtao Lyu, Qi Liu, Muli Yang, Cheng Deng:

Fisher-Driven Adaptive Locating for Knowledge Editing in Large Language Models. 20902-20913 - Xiangyu Ma, Teng Xiao, Zuchao Li, Lefei Zhang:

From AR to Diffusion: Efficiently Adapting Large Language Models with Strictly Causal and Elastic Horizons. 20914-20927 - Yeji Park

, Jiwon Tark, Taesik Gong:
ExPerT: Personalizing LLM Responses to Users' Domain Expertise via Query-Wise Semantic and Keystroke Behavioral Cues. 20928-20963 - Wenkai Wang, Xiyun Li, Hongcan Guo, Wenhao Yu, Tianqing Fang, Haitao Mi, Dong Yu, Shengyu Zhang:

Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding. 20964-20984 - Jiayu Zhang, Shuo Ye, Qilang Ye, Zihan Song, Jiajian Huang, Zitong Yu:

Retrieving to Recover: Towards Incomplete Audio-Visual Question Answering via Semantic-consistent Purification. 20985-20995 - Runkai Li, Jia Xiong, Xiuyuan He, Jieru Zhao, Jiaqi Lv, Haowen Fang, Lei Qi, Xi Wang:

ChatHLS: Towards Systematic Design Automation and Optimization for High-Level Synthesis. 20996-21015 - Muhammad Dehan Al Kautsar, Saeed Almheiri, Momina Ahsan, Bilal Elbouardi, Younes Samih, Sarfraz Ahmad, Amr Keleg, Omar El Herraoui, Kareem Elzeky, Abed Alhakim Freihat, Mohamed Anwar, Zhuohan Xie, Junhong Liang, Mohammad Rustom Al Nasar, Preslav Nakov, Fajri Koto:

Cultural Benchmarking of LLMs in Standard and Dialectal Arabic Dialogues. 21016-21039 - Jiani Huang, Shijie Wang, Liang-Bo Ning, Wenqi Fan, Qing Li:

ReRec: Reasoning-Augmented LLM-based Recommendation Assistant via Reinforcement Fine-tuning. 21040-21055 - Jie Cao, Tianwei Lin, Bo Yuan, Rolan Yan, Hongyang He, Wenqiao Zhang, Juncheng Li, Dongping Zhang, Siliang Tang, Yueting Zhuang:

MoA: Heterogeneous Mixture of Adapters for Parameter-Efficient Fine-Tuning of Large Language Models. 21056-21073 - Miao Lu, Weiwei Sun, Weihua Du, Zhan Ling, Xuesong Yao, Kang Liu, Jiecao Chen:

Beyond the Context Window: Scaling Agentic RL via End-to-end Optimized Context Compression. 21074-21125 - Tianle Gu, Kexin Huang, Zongqi Wang, Yixu Wang, Jie Li, Xin Wang, Yang Yao, Yujiu Yang, Yan Teng, Yingchun Wang:

Probing the Safety Robustness of LLMs in Latent Space. 21126-21143 - Kangning Zhang, Weiwen Liu, Wenxiang Jiao, Kounianhua Du, Yuan Lu, Weinan Zhang, Yong Yu:

LoopTool: Closing the Data-Training Loop for Robust LLM Tool Calls. 21144-21164 - Yangyi Fang, Haolin Shi:

Placing Puzzle Pieces Where They Matter: A Question Augmentation Framework for Reinforcement Learning. 21165-21183 - Baolin Zheng, Guanlin Chen, Qingyang Teng, Hongqiong Zhong, Yingshui Tan, Zhendong Liu, Weixun Wang, Jiaheng Liu, Jian Yang, Huiyun Jing, Jincheng Wei, Wenbo Su, Xiaoyong Zhu, Bo Zheng, Kaifu Zhang:

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models. 21184-21211 - Yusong Hu, Runmin Ma, Yue Fan, Jinxin Shi, Zongsheng Cao, Yuhao Zhou, Jiakang Yuan, Shuaiyu Zhang, Shiyang Feng, Xiangchao Yan, Shufei Zhang, Wenlong Zhang, Lei Bai, Bo Zhang:

FlowSearch: Advancing Deep Research with Dynamic Structured Knowledge Flow. 21212-21245 - Ming Zhang, Yujiong Shen, Jingyi Deng, Yuhui Wang, Huayu Sha, Kexin Tan, Qiyuan Peng, Yue Zhang, Junzhe Wang, Shichun Liu, Yueyuan Huang, Jingqi Tong, Changhao Jiang, Yilong Wu, Zhihao Zhang, Mingqi Wu, Mingxu Chai, Zhiheng Xi, Shihan Dou, Tao Gui, Qi Zhang, Xuanjing Huang:

LLMEval-Fair: A Large-Scale Longitudinal Study on Robust and Fair Evaluation of Large Language Models. 21246-21273 - Lujia Yang, Weicai Yan, Yongbo He, Qifei Zhang, Tao Jin, Jinshan Zhang, Meng Xi, Jianwei Yin:

SAME: Signer-Aware Mixture-of-Experts for Test-Time Adaptation in Sign Language Translation. 21274-21289 - Yi Fang, Wenjie Wang, Mingfeng Xue, Boyi Deng, Fengli Xu, Dayiheng Liu, Fuli Feng:

Controllable LLM Reasoning via Sparse Autoencoder-Based Steering. 21290-21305 - Xunjian Yin, Sitao Cheng, Yuxi Xie, Xinyu Hu, Li Lin, Xinyi Wang, Liangming Pan, William Yang Wang, Xiaojun Wan:

LEDOM: Reverse Language Model. 21306-21326 - Bo Zhang, Tzu-Yen Ma, Zichen Tang, Junpeng Ding, Zirui Wang, Yizhuo Zhao, Peilin Gao, Zijie Xi, Zixin Ding, Haiyang Sun, Haocheng Gao, Yuan Liu, Liangjia Wang, Yiling Huang, Yujie Wang, Yuyue Zhang, Ronghui Xi, Yuanze Li, Jiacheng Liu, Zhongjun Yang, Haihong E:

AEGIS: A Holistic Benchmark for Evaluating Forensic Analysis of AI-Generated Academic Images. 21327-21363 - Yilun Liu, Chunguang Zhao, Mengyao Piao, Lingqi Miao, Shimin Tao, Minggui He, Chenxin Liu, Li Zhang, Hongxia Ma, Jiaxin Guo, Chen Liu, Liqun Deng, Jiansheng Wei, Xiaojun Meng, Fanyi Du, Daimeng Wei, Yanghua Xiao:

The GaoYao Benchmark: A Comprehensive Framework for Evaluating Multilingual and Multicultural Abilities of Large Language Models. 21364-21384 - Haofu Yang, Jiaji Liu, Chen Huang, Faguo Wu, Wenqiang Lei, See-Kiong Ng:

METRO: Towards Strategy Induction from Expert Dialogue Transcripts for Non-collaborative Dialogues. 21385-21416 - Shiqiang Tian, Cheng Ding, Qin Chen, Jie Zhou, Liang He:

TamEdit: Trajectory-Aware Meta-Learning for Specificity-Preserving Continual Knowledge Editing. 21417-21439 - Yida Cai, Ranjuexiao Hu, Huiyuan Xie, Chenyang Li, Yun Liu, Yuxiao Ye, Zhenghao Liu, Weixing Shen, Zhiyuan Liu:

LexRel: Benchmarking Legal Relation Extraction for Chinese Civil Cases. 21440-21456 - Yi Yu, Liuyi Yao, Yuexiang Xie, Qingquan Tan, Jiaqi Feng, Yaliang Li, Libing Wu:

Agentic Memory: Learning Unified Long-Term and Short-Term Memory Management for Large Language Model Agents. 21457-21483 - Huachen Qi, Ruiyu Zhuo, Bowen Shi, Xiang Chang, Fei Chao, Changjing Shang, Qiang Shen:

Profiling-Free Mixed-Precision Quantization for MoE LLMs via Fuzzy Rule Interpolation. 21484-21499 - Tao Wu, Jingyuan Chen, Wang Lin, Jian Zhan, Mengze Li, Fangzhou Jin, Min Zhang, Kun Kuang, Fei Wu:

Tailoring Diagnostic Modeling to Individual Learners: Personalized Distractor Generation via MCTS-Guided Reasoning Reconstruction. 21500-21524 - Xiaoyuan Li, Keqin Bao, Yubo Ma, Moxin Li, Wenjie Wang, Rui Men, Yichang Zhang, Fuli Feng, Dayiheng Liu:

MTR-Bench: A Comprehensive Benchmark for Multi-Turn Reasoning Evaluation. 21525-21577 - Tianjiao Li, Kai Zhao, Xiang Li, Yang Liu, Huyang Sun:

Community-Aware Assessment of Social Textual Engagement and Resonance: A Human-Centric Perspective on User-Generated Content Evaluation. 21578-21600 - Chuang Zhou, Junnan Dong, Yilin Xiao, Shengyuan Chen, Su Dong, Di Yin, Xing Sun, Zhaozhuo Xu, Xiao Huang:

Query-Aware Knowledge Retrieval via Hyperbolic Structuring. 21601-21614 - Bin Xu, Yu Bai, Huashan Sun, Yiguan Lin, Siming Liu, Xinyue Liang, Yaolin Li, Zhuangzhi Dong, Jingren Zhang, Yufan Deng, Xinyu Zou, Yang Gao, Heyan Huang:

EduBench: A Comprehensive Benchmarking Dataset for Evaluating Large Language Models in Diverse Educational Scenarios. 21615-21645 - Junjie Wang, Zequn Xie, Dan Yang, Jie Feng, Yue Shen, Duolin Sun, Meixiu Long, Yihan Jiao, Zhehao Tan, Jian Wang, Peng Wei, Jinjie Gu:

WebClipper: Efficient Evolution of Web Agents with Graph-based Trajectory Pruning. 21646-21666 - Weihua Zheng, Zhengyuan Liu, Tanmoy Chakraborty, Weiwen Xu, Xiaoxue Gao, Bryan Chen Zhengyu Tan, Bowei Zou, Chang Liu, Yujia Hu, Xing Xie, Xiaoyuan Yi, Jing Yao, Chaojun Wang, Long Li, Rui Liu, Huiyao Liu, Koji Inoue, Ryuichi Sumida, Tatsuya Kawahara, Fan Xu, Lingyu Ye, Wei Tian, Dongjun Kim, Jimin Jung, Jaehyung Seo, Nadya Yuki Wangsajaya, Pham Minh Duc, Ojasva Saxena, Palash Nandi, Xiyan Tao, Wiwik Karlina, Tuan Luong, Keertana Arun Vasan, Roy Ka-Wei Lee, Nancy F. Chen:

MMAC: A Multilingual, Multimodal Alignment Framework for Cultural Grounding Evaluation. 21667-21709 - Benteng Chen, Weida Wang, Shufei Zhang, Mingbao Lin, Min Zhang:

Step-GRPO: Internalizing Dynamic Early Exit for Efficient Reasoning. 21710-21724 - Boyan Duan, Xiao Liang, Shuai Lu, Yaoxiang Wang, Yelong Shen, Kai-Wei Chang, Ying Nian Wu, Mao Yang, Weizhu Chen, Yeyun Gong:

Gold-Medal-Level Olympiad Geometry Solving with Efficient Heuristic Auxiliary Constructions. 21725-21747 - Peichun Hua, Hao Li, Shanghao Shi, Zhiyuan Yu, Ning Zhang:

Rethinking Jailbreak Detection of Large Vision Language Models with Representational Contrastive Scoring. 21748-21785 - Yueheng Mao, Min Yu, Gengwang Li, Jianguo Jiang, Gang Li, Meng Zhang, Zhen Xu, Weiqing Huang, Ming Liu:

The Digital Dunning-Kruger Effect: Decoupling Hallucinations via Geometric Hidden-state Observation for Semantic Truthfulness. 21786-21800 - Leyi Pan, Shuchang Tao, Yunpeng Zhai, Zheyu Fu, Liancheng Fang, Minghua He, Lingzhe Zhang, Zhaoyang Liu, Bolin Ding, Aiwei Liu, Lijie Wen:

d-TreeRPO: Towards More Reliable Policy Optimization for Diffusion Language Models. 21801-21822 - Xingchen Zou, Yuhao Yang, Zheng Chen, Xixuan Hao, Yiqi Chen, Chao Huang, Yuxuan Liang:

Traffic-R1: Reinforced LLMs Bring Human-Like Reasoning to Traffic Signal Control Systems. 21823-21838 - Yuhua Jiang, Shuang Cheng, Yihao Liu, Ermo Hua, Che Jiang, Weigao Sun, Yu Cheng, Feifei Gao, Biqing Qi, Bowen Zhou:

Nirvana: A Specialized Generalist Model With Task-Aware Memory Mechanism. 21839-21857 - Jiajia Li, Weizhi Xue, Yao Yao, Qiwei Li, Chong Chen, Zuchao Li, Ping Wang, Hai Zhao:

BoYaEval: Evaluating Multimodal Large Language Models on Understanding Ancient Chinese Musical Scores. 21858-21873 - Fangming Feng, Dongjie Fu, Zequn Xie, Yu Zhang

, Yangyang Wu, Zhou Zhao, Tao Jin:
Rectifying the Emotional Flow: Aligning Priors and Dynamic Guidance for High-Arousal Text-to-Speech. 21874-21888 - Lei Liu, Hao Zhu, Xiaoyan Yang, Yue Shen, Zhixuan Chu, Jian Wang, Jinjie Gu, Kui Ren:

Perplexity-Aware Data Scaling Law: Perplexity Landscapes Predict Performance for Continual Pre-training. 21889-21901 - Qian Chen, Xianyin Zhang, Yanzhi Liu, Lifan Guo, Feng Chen, Chi Zhang:

Benchmarking Large Vision-Language Models on CFMME: A Comprehensive Chinese Financial Multimodal Evaluation Dataset. 21902-21919 - Xuanle Zhao, Zilin Sang, Yuxuan Li, Qi Shi, Weilun Zhao, Shuo Wang, Duzhen Zhang, Xu Han, Zhiyuan Liu, Maosong Sun:

AutoReproduce: Automatic AI Experiment Reproduction with Paper Lineage. 21920-21942 - Tongyao Zhu, Qian Liu, Chang Ma, Jinghan Zhang, Longxu Dou, Junxian He, Shiqi Chen:

How Can Synthetic Data Improve Multilingual Language Model Pretraining? A Data Quality Perspective. 21943-21956 - Ryan Saklad, Aman Chadha, Oleg V. Pavlov, Raha Moraffah:

Can Large Language Models Infer Causal Relationships from Real-World Text? 21957-21989 - Shaoning Sun, Mingzhu Cai, Huang He, Bingjin Chen, Siqi Bao, Yujiu Yang, Hua Wu, Haifeng Wang:

Distributional Clarity: The Hidden Driver of RL-Friendliness in Large Language Models. 21990-22006 - Wenhan Liu, Xinyu Ma, Weiwei Sun, Yutao Zhu, Yuchen Li, Dawei Yin, Zhicheng Dou:

ReasonRank: Empowering Passage Ranking with Strong Reasoning Ability. 22007-22031 - Tong Zhao, Chenghao Zhang, Yutao Zhu, Zhicheng Dou:

ATIR: Towards Audio-Text Interleaved Contextual Retrieval. 22032-22046 - Hui Liu

, Bin Zou, Kecheng Chen, Jie Liu
, Wenya Wang, Haoliang Li
:
Task-Aware LLM Routing with Multi-Level Task-Profile-Guided Data Synthesis for Cold-Start Scenarios. 22047-22076 - Hyeongsoo Lim, Jinyoung Kim, Eun Seo Seo, Min Ho Jang, Jiwon Yoon:

SelFusion: Self-distillation for Diffusion Language Models. 22077-22089 - Zijing Shi, Meng Fang, Ling Chen:

Benchmarking Web Agent Safety under E-commerce Deceptive Interfaces. 22090-22103 - Xin Guo, Zhiheng Xi, Yiwen Ding, Yitao Zhai, Xiaowei Shi, Xunliang Cai, Tao Gui, Qi Zhang, Xuanjing Huang:

Counteracting the Matthew Effect in Self-Improvement of LVLMs through Head-Tail Re-balancing. 22104-22121 - Chengao Liu, Yuan Li

, Yingze Wang, Jianbin Jiao:
MAGIC: Deep Geometric Evolution with Structural Consensus for Temporal Knowledge Graph Reasoning. 22122-22133 - Bo Li, Chuan Wu, Shaolin Zhu:

MACS: Modality-Aware Capacity Scaling for Efficient Multimodal MoE Inference. 22134-22148 - Xiaowei Yuan, Ziyang Huang, Zhao Yang, Yequan Wang, Jun Zhao, Kang Liu:

Efficient Prior-Guided Reasoning for Robust Retrieval-Augmented Generation under Conflicts. 22149-22164 - Siming Sun, Kai Zhang, Xuejun Jiang, Wenchao Meng, Qinmin Yang:

Markovian Linguistic-Temporal Bridge: Unlocking the Potential of LLMs for Time Series Forecasting. 22165-22180 - Minsik Oh, Jiwei Li, Guoyin Wang:

Template-assisted Contrastive Learning of Task-oriented Dialogue Sentence Embeddings. 22181-22198 - Hao Sun, Yu Song, Shiyu Teng, Ziwei Niu, Yen-Wei Chen:

MIRTH: Mutual-Information Reasoning with Temporal Hubs for Vision-Language-Action Agents. 22199-22215 - Navya Gupta, Rishitej Reddy Vyalla, Avinash Anand, Chhavi Kirtani, Erik Cambria, Zhengchen Zhang, Zhengkui Wang, Timothy Liu, Aik Beng Ng, Simon See, Rajiv Ratn Shah:

IRIS: Interleaved Reinforcement with Incremental Staged Curriculum for Cross-Lingual Mathematical Reasoning. 22216-22248 - Yujia Fu, Heming Zhong, Dan Huang, Yutong Lu:

FLARE: Fine-Grained Length-Aware Routing for Resource-Efficient Heterogeneous LLM Serving. 22249-22266 - Yang Zhao, Hepeng Wang, Xiao Ding, Yangou Ouyang, Bibo Cai, Kai Xiong, Jinglong Gao, Zhouhao Sun, Li Du, Bing Qin, Ting Liu:

MAESTRO: Meta-learning Adaptive Estimation of Scalarization Trade-offs for Reward Optimization. 22267-22283 - Binxing Xu, Hao Gu, Lujun Li, Hao Wang, Bei Liu, Jiacheng Liu, Qiyuan Zhu, Xintong Yang, Chao Li, Sirui Han, Yike Guo:

Bit-by-Bit: Progressive QAT Strategy with Outlier Channel Splitting for Stable Low-Bit LLMs. 22284-22299 - Bowen Yang, Kaiming Jin, Zhenyu Wu, Zhaoyang Liu, Qiushi Sun, Zehao Li, JingJing Xie, Zhoumianze Liu, Fangzhi Xu, Kanzhi Cheng, Yian Wang, Qingyun Li, Yu Qiao, Zun Wang, Zichen Ding:

OS-Symphony: A Holistic Framework for Robust and Generalist Computer-Using Agents. 22300-22330 - Zexu Sun, Yongcheng Zeng, Erxue Min, Heyang Gao, Bokai Ji, Dugang Liu, Xing Tang, Xiuqiang He, Xu Chen:

Learning from Cognition: Enhancing RL Efficiency for LLM Reasoning via Hierarchical Metacognitive Decomposition and Refinement. 22331-22348 - Zijian Chen, Xueguang Ma, Shengyao Zhuang, Ping Nie, Kai Zou, Sahel Sharifymoghaddam, Andrew Liu, Joshua Green, Kshama Patel, Ruoxi Meng, Mingyi Su, Yanxi Li, Haoran Hong, Xinyu Shi, Xuye Liu, Hosna Oyarhoseini, Nandan Thakur, Crystina Zhang, Luyu Gao, Wenhu Chen, Jimmy Lin:

BrowseComp-Plus: A Fair and Disentangled Evaluation Benchmark for Deep Search Agents. 22349-22370 - Mingzhe Lu, Yiwen Wang, Yanbing Liu, Qi You, Chong Liu, Ruize Qin, Haoyu Dong, Wenyu Zhang, JiaRui Zhang, Yue Hu, Yunpeng Li:

LitVISTA: A Benchmark for Narrative Orchestration in Literary Text. 22371-22396 - Xu Zhang, Xiaojun Wan:

RST-Guarder: Enhancing Long-Context Robustness for Safeguards via RST Parsing and Probabilistic Inference. 22397-22413 - Je Won Yeom, Jaewon Sok, Seonghyeon Park, Jeongjae Park, Taesup Kim:

EpiCaR: Knowing What You Don't Know Matters for Better Reasoning in LLMs. 22414-22443 - Hui Wu, Chao Xu, Jianghui Wang, Ziqiong Liu, Dong Li, Yiwei Dai, Emad Barsoum:

MoEC: A Memory-Routed Mixture-of-Experts Controller for Adaptive Minecraft Control. 22444-22459 - Yancui Li, Xiaoyu Zhou, Guoyi Miao, Fang Kong:

MECH: A Cost-Effective Multi-Task Cascade Framework for Classroom Opinion Evolution Recognition. 22460-22473 - Kazutoshi Shinoda, Kosuke Nishida, Kyosuke Nishida:

Debiasing Reward Models via Causally Motivated Inference-Time Intervention. 22474-22489 - Lijing Ren, Denghui Zhang:

Steganography Beyond Pixels: Reimagining Image Steganography as Cross-Modal Linguistic Communication. 22490-22501 - Shrey Pandit, Austin Xu, Xuan-Phi Nguyen, Yifei Ming, Caiming Xiong, Shafiq Joty:

Hard2Verify: A Step-Level Verification Benchmark for Open-Ended Frontier Math. 22502-22517 - Yuting Zhang, Kai Wang, Wei Ni, Ying Zhang, Wenjie Zhang:

Agent-based Substructure Counting under Local Differential Privacy. 22518-22533 - Haonan Dong, Kehan Jiang, Haoran Ye, Wenhao Zhu, Zhaolu Kang, Guojie Song:

NeuReasoner: Towards Explainable, Controllable, and Unified Reasoning via Mixture-of-Neurons. 22534-22558 - Jiawei Chen, Yang Yang, Chao Yu, Yu Tian, Zhi Cao, Xue Yang, Linghao Li, Hang Su, Zhaoxia Yin:

Red Teaming Large Reasoning Models. 22559-22591 - Jin Liu, Yunpeng Liu, Keyi Wang, Jie Shi, Xiao Xu, Wenkang Huang, Xingzhong Xu, Xin Liang, Yanghua Xiao:

InsLogicBench: An Argumentation Logic Grounded Benchmark for Complex Insurance Claims Adjudication. 22592-22619 - Xuemiao Zhang, Can Ren, Chengying Tu, Rongxiang Weng, Hongfei Yan, Jingang Wang, Xunliang Cai:

LinkQA: Synthesizing Diverse QA from Multiple Seeds Strongly Linked by Knowledge Points. 22620-22651 - Shagun Dwivedi, Kaushik Gopalan:

Comparative Analysis of the Intrinsic Metrics for Tokenizers and their effect on Downstream Tasks for Hindi and Marathi. 22652-22663 - Haejun Yoo, Yongseop Shin, Insung Lee, Myoung-Wan Koo, Du-Seong Chang:

Omni-Embed-Audio: Leveraging Multimodal LLMs for Robust Audio-Text Retrieval. 22664-22680 - Wonduk Seo, Juhyeon Lee, Yanjun Shao, Qingshan Zhou, Seunghyun Lee, Yi Bu:

SPIO: Ensemble and Selective Strategies via LLM-Based Multi-Agent Planning in Automated Data Science. 22681-22703 - Samuel Joseph Amouyal, Aya Meltzer-Asscher, Jonathan Berant:

Comparing human and language models sentence processing difficulties on complex structures. 22704-22722 - Xing Yue, Yongliang Shen, Weiming Lu:

Phun-Bench: Evaluating LLMs on Phonological Understanding in Chinese. 22723-22768 - Ailiang Lin, Zhuoyun Li, Yusong Wang, Kotaro Funakoshi, Manabu Okumura:

Causal2Vec: Improving Decoder-only LLMs as Embedding Models through a Contextual Token. 22769-22788 - Rui Song, Lida Shi, Ruihua Qi, Yingji Li, Hao Xu:

Enhancing Multimodal Large Language Models for Ancient Chinese Character Evolution Analysis via Glyph-Driven Fine-Tuning. 22789-22804 - Ding Xia, Xinyue Gui, Mark Colley, Fan Gao, Zhongyi Zhou, Dongyuan Li, Renhe Jiang, Takeo Igarashi:

See2Refine: Vision-Language Feedback Improves LLM-Based eHMI Action Designers. 22805-22822 - Zhiyin Yu, Yuchen Mou, Juncheng Yan, Junyu Luo, Chunchun Chen, Xing Wei, Yunhui Liu, Hongru Sun, Yuxing Zhang, Jun Xu, Yatao Bian, Ming Zhang, Wei Ye, Tieke He, Jie Yang, Guanjie Zheng, Zhonghai Wu, Bo Zhang, Lei Bai, Xiao Luo:

A Survey of Reinforcement Learning for Large Language Models under Data Scarcity: Challenges and Solutions. 22823-22846 - Wenhao Gao, Tianlong Wang, Wei Jia, Linhao Zhang, Aiwei Liu, Miao Fan, Xiao Zhou:

SADA: Bridging In-Context Learning and Fine-Tuning via State-Aligned Distillation Adapters. 22847-22862 - Wei Wu, Liyi Chen, Congxi Xiao, Tianfu Wang, Qimeng Wang, Chengqiang Lu, Yan Gao, Yi Wu, Yao Hu, Hui Xiong:

Anti-Length Shift: Dynamic Outlier Truncation for Training Efficient Reasoning Models. 22863-22891 - Baishi Li, Ta Yu, Kelvin J. L. Koa, Ke-Wei Huang:

The Proxy Presumption: From Semantic Embeddings to Valid Social Measures. 22892-22910 - Baixuan Li, Jialong Wu, Wenbiao Yin, Kuan Li, Zhongwang Zhang, Huifeng Yin, Zhengwei Tao, Liwen Zhang, Pengjun Xie, Jingren Zhou, Yong Jiang, Wentao Zhang, Zhiqiang Gao:

Nested Browser-Use Learning for Agentic Information Seeking. 22911-22923 - Tianxin Han, Qing Dong, Xingwei Wang, Jie Jia, Gang Wu, Bowen Yang, Fu Zhang:

CamoQuery: Language-Guided Reasoning Camouflaged Object Segmentation. 22924-22941 - Minda Zhao, Yilun Du, Mengyu Wang:

Large Language Models Are Bad Dice Players: LLMs Struggle to Generate Random Numbers from Statistical Distributions. 22942-22959 - Jungmin Lee, Peizhuo Lv, Yeonjoon Lee:

PROMPRINT: Prompt Fingerprinting via First-Token Response for LLM App Cloning Detection. 22960-22972 - Yixin Xiang, Yunshan Ma, Xiaoyu Du, Yibing Chen, Yanxin Zhang, Jinhui Tang:

MAB-DQA: Addressing Query Aspect Importance in Document Question Answering with Multi-Armed Bandits. 22973-22992 - Chenyi Li, Xinhui Tu, Zaixiang Wang:

DVCQR: Dual-View Conversational Query Rewriting with Stage-wise Reinforcement Learning. 22993-23014 - Shidong Yang, Ziyu Ma, Tongwen Huang, Yiming Hu, Yong Wang, Xiangxiang Chu:

CoEvolve: Training LLM Agents via Agent-Data Mutual Evolution. 23015-23036 - Jaewook Lee, Myeong-Cheol Kang, Jong-hun Shin:

Make LLMs See Like Investigators, Not Just Think More: The Role of Structured Analysis in Investigative Reasoning. 23037-23058 - Jordan Meadows, Lan Zhang, André Freitas:

FormalScience: Scalable Human-in-the-Loop Autoformalisation of Science with Agentic Code Generation in Lean. 23059-23077 - Hang Yan, Fangzhi Xu, Rongman Xu, Yifei Li, Jian Zhang, Haoran Luo, Xiaobao Wu, Anh Tuan Luu, Haiteng Zhao, Qika Lin, Jun Liu:

MUR: Momentum Uncertainty guided Reasoning for Large Language Models. 23078-23103 - Aditya Hemant Shahane, Anuj Kumar Sirohi, Devansh Arora, Nitin Kumar, Prathosh AP, Sandeep Kumar:

BiMol-Diff: A Unified Diffusion Framework for Molecular Generation and Captioning. 23104-23117 - Tianwei Lan, Jiaqi Wu, Zeming Liu, Zhaoxin Fan, Haifeng Wang, Yuhang Guo:

PEAP: Proactive Embodied Action Sequence Planning with Joint Understanding of Vision and Audio Perception. 23118-23138 - Tan Min Sen, Zachary Choy Kit Chun, Syed Ali Redha Alsagoff, Nadya Yuki Wangsajaya, Mohor Banerjee, Swaagat Bikash Saikia, Alvin Chan Guo Chan:

Automated Creativity Evaluation of Language Models Across Open-Ended Tasks. 23139-23173 - Jiaxuan Wang, Yulan Hu, Wenjin Yang, Zheng Pan, Xin Li, Lan-Zhe Guo:

Aligning Agents via Planning: A Benchmark for Trajectory-Level Reward Modeling. 23174-23200 - Junhong Lai, Shuzhong Lai

, Yanhao Yu, Wanlin Chen, Chenyu Yan, Haifeng Li, Lin Yao, Yueming Wang:
From Synthesis to Clinical Assistance: A Strategy-Aware Agent Framework for Autism Intervention based on Real Clinical Dataset. 23201-23241 - Minsung Kim, Dong-Kyum Kim, Jea Kwon, Nakyeong Yang, Kyomin Jung, Meeyoung Cha:

How Training Data Shapes the Use of Parametric and In-Context Knowledge in Language Models. 23242-23257 - Yao Yao, Manwen Liao, Weitian Zhang, Zuchao Li, Hai Zhao:

PAR: Training-Free Positional Perturbation and Attention Recycling for Faithful OCR. 23258-23273 - Hao Gu, Lujun Li, Hao Wang, Lei Wang, Zheyu Wang, Bei Liu, Jiacheng Liu, Qiyuan Zhu, Sirui Han, Yike Guo:

BTC-LLM: Efficient Sub-1-Bit LLM Quantization via Learnable Transformation and Binary Codebook. 23274-23294 - Xinyan Deng, Shoubin Dong, Xiaorou Zheng:

Learning What to Ignore: Mitigating Negative Transfer in Medical Knowledge Fusion via Clinical Task-Adaptive Selection. 23295-23309 - Tengchao Yang, Sichen Guo, Mengzhao Jia, Jiaming Su, Yuanyang Liu, Zhihan Zhang, Meng Jiang:

MMTutorBench: The First Multimodal Benchmark for AI Math Tutoring. 23310-23332 - Zhaohan Zhang, Ziquan Liu, Ioannis Patras:

GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models. 23333-23350 - Hong Ting Tsang, Jiaxin Bai, Haoyu Huang, Qiao Xiao, Tianshi Zheng, Baixuan Xu, Shujie Liu, Yangqiu Song:

AutoGraph-R1: End-to-End Reinforcement Learning for Knowledge Graph Construction. 23351-23374 - Xuwei Tan, Yao Ma, Xueru Zhang:

Understanding Structured Financial Data with LLMs: A Case Study on Fraud Detection. 23375-23390 - Minseo Kwak, Jaehyung Kim:

Gap-K%: Measuring Top-1 Prediction Gap for Detecting Pretraining Data. 23391-23405 - Justice Ou, Tinglin Huang, Yilun Zhao, Ziyang Yu, Peiqing Lu, Yifei Shen

, Rex Ying:
Experience Retrieval-Augmentation with Electronic Health Records Enables Accurate Discharge QA. 23406-23430 - Eunsu Kim, Junyeong Park, Juhyun Oh, Kiwoong Park, Seyoung Song, A. Seza Dogruöz, Alice Oh, Najoung Kim:

Are they lovers or friends? Evaluating LLMs' Social Reasoning in English and Korean Dialogues. 23431-23451 - Weijie Jiang, Gaolei He, Beibei Xiong, Jianlin Wang, Zhengfeng Yang:

SAIR-Comb : A Structure-Aware Iterative Refinement Framework for Combinatorics Autoformalization. 23452-23473 - Yu-An Liu, Ruqing Zhang, Hongru Song, Jiafeng Guo, Yixing Fan, Xueqi Cheng:

Stop Hardening Everything: A Training-Free Neuron-Level Defense for Neural Ranking Models. 23474-23484 - Qifan Liang, Yuansen Liu, Ruixin Wei, Nan Lu, Junchuan Zhao, Ye Wang:

TED-TTS: Training-Free Intra-Utterance Emotion and Duration Control for Text-to-Speech Synthesis. 23485-23508 - Feiran Zhang, Yixin Wu, Zhenghua Wang, Xiaohua Wang, Changze Lv, Xuanjing Huang, Xiaoqing Zheng:

VIB-Probe: Detecting and Mitigating Hallucinations in Vision-Language Models via Variational Information Bottleneck. 23509-23521 - Wei Shao, Yihang Wang, Gao yu Zhu, Ziqiang Cheng, Lei Yu, Jiafeng Guo, Xueqi Cheng:

Detoxification for LLM: From Dataset Itself. 23522-23540 - Yang Xiang, Yixin Ji, Ruotao Xu, Dan Qiao, Zheming Yang, Juntao Li, Min Zhang:

When Is Thinking Enough? Early Exit via Sufficiency Assessment for Efficient Reasoning. 23541-23556 - Zhaoxuan Tan, Zixuan Zhang, Haoyang Wen, Zheng Li, Rongzhi Zhang, Pei Chen, Fengran Mo, Zheyuan Liu, Qingkai Zeng, Qingyu Yin, Meng Jiang:

Instant Personalized Large Language Model Adaptation via Hypernetwork. 23557-23580 - Zezhou Wang, Ziyun Zhang, Xiaoyi Zhang, Zhuzhong Qian, Yan Lu:

From Off-Policy to On-Policy: Enhancing GUI Agents via Bi-level Expert-to-Policy Assimilation. 23581-23623 - Haozhong Wang, Zhuo Li, Yibo Yang, He Zhao, Hongyuan Zha, Dandan Guo:

Safeguarding LLM Fine-tuning via Push-Pull Distributional Alignment. 23624-23646 - Huilin Deng, Hongchen Luo, Yue Zhu, Long Li, Zhuoyue Chen, Xinghao Zhao, Ming Li, Chuyang Zhao, Jihai Zhang, Mengchang Wang, Yang Cao, Yu Kang:

I²B-LPO: Latent Policy Optimization via Iterative Information Bottleneck. 23647-23664 - Aditya Yadavalli, Tiago Pimentel, Tamar I. Regev, Ethan Gotlieb Wilcox, Alex Warstadt:

What Do Prosody and Text Convey? Characterizing How Meaningful Information is Distributed Across Multiple Channels. 23665-23679 - Jinhong Jeong, Junghun Park, Youngjae Yu:

Right at My Level: A Unified Multilingual Framework for Proficiency-Aware Text Simplification. 23680-23706 - Yicheng Ji, Jun Zhang, Jinpeng Chen, Cong Wang, Lidan Shou, Gang Chen, Huan Li:

See the Forest for the Trees: Loosely Speculative Decoding via Visual-Semantic Guidance for Efficient Inference of Video LLMs. 23707-23726 - Jian Gao, Richeng Xuan, Zhaolu Kang, Dingshi Liao, Wenxin Huang, Zongmou Huang, Yangdi Xu, Bowen Qin, Zheqi He, Xi Yang, Changjin Li, Yonghua Lin:

LaoBench: A Large-Scale Multidimensional Lao Benchmark for Large Language Models. 23727-23743 - Chenzhuo Zhao, Xinda Wang, Pu Zhao, Yue Huang, Junting Lu, Ziqian Liu, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang:

Gradient-Guided Multi-Judge Prompt Optimization. 23744-23773 - Xiaoke Guo, Songze Li, Zhiqiang Liu, Zhaoyan Gong, Yuanxiang Liu, Huajun Chen, Wen Zhang:

ASTRA: Adaptive Semantic Tree Reasoning Architecture for Complex Table Question Answering. 23774-23803 - Zhixuan Yang, Fu Zhang, Huangming Xu, Jingwei Cheng:

DEBAR: Mitigating Contextual Bias in Cross-Document Relation Extraction via Dual-Stream Decoupling. 23804-23815 - Bosi Wen, Yilin Niu, Cunxiang Wang, Xiaoying Ling, Ying Zhang, Pei Ke, Hongning Wang, Minlie Huang:

IF-RewardBench: Benchmarking Judge Models for Instruction-Following Evaluation. 23816-23843 - Weizhe Shi, Qiqi Wang, Yihong Pan, Qian Liu, Kaiqi Zhao:

LegalChainReasoner: Grounding Criminal Judicial Opinion Generation via Structured Legal Chains. 23844-23863 - Yixin Wan, Xingrun Chen, Kai-Wei Chang:

InsideOut: Measuring and Mitigating Insider-Outsider Bias in Interview Script Generation. 23864-23883 - Ziqing Zhuang, Linhai Zhang, Jiasheng Si, Deyu Zhou, Yulan He:

Beyond Meta-Reasoning: Metacognitive Consolidation for Self-Improving LLM Reasoning. 23884-23913 - Zihao Tang, Xin Yu, Ziyu Xiao, Zengxuan Wen, Zelin Li, Jiaxi Zhou, Hualei Wang, Haohua Wang, Haizhen Huang, Weiwei Deng, Feng Sun, Qi Zhang:

Mnemis: Dual-Route Retrieval on Hierarchical Graphs for Long-Term LLM Memory. 23914-23928 - Yang Zhao, Yangou Ouyang, Xiao Ding, Hepeng Wang, Bibo Cai, Kai Xiong, Jinglong Gao, Zhouhao Sun, Li Du, Bing Qin, Ting Liu:

Consolidation or Adaptation? PRISM: Disentangling SFT and RL Data via Gradient Concentration. 23929-23941 - Ki Jung Seo, Sehun Lim, Taeuk Kim:

ADVICE: Answer-Dependent Verbalized Confidence Estimation. 23942-23962 - He Du, Bowen Li, Aijun Yang, Siyang He, Qipeng Guo, Kai Chen, Dacheng Tao:

Powering Verifiable Learning via Automated Evolutionary Data Synthesis. 23963-23980 - Jinyang Wu, Shuo Yang, Yuhao Shen, Shuai Zhang, Zhengqi Wen, Jianhua Tao:

SPARK: Strategic Policy-Aware Exploration via Dynamic Branching for Long-Horizon Agentic Learning. 23981-24004 - Xianzhen Luo, Wenzhen Zheng, Qingfu Zhu, Rongyi Zhang, Houyi Li, Siming Huang, YuanTao Fan, Wanxiang Che:

Scaling Laws for Code: A More Data-Hungry Regime. 24005-24021 - Shenghao Ye, Yu Guo, Dong Jin, Yuxiang Wang, Yikai Shen, Yunpeng Hou, Shuangwu Chen, Jian Yang, Xiaofeng Jiang:

When TableQA Meets Noise: A Dual Denoising Framework for Complex Questions and Large-scale Tables. 24022-24045 - Dingwei Zhu, Shihan Dou, Zhiheng Xi, Senjie Jin, Guoqiang Zhang, Jiazheng Zhang, Junjie Ye, Mingxu Chai, Enyu Zhou, Ming Zhang, Yuhui Wang, Caishuang Huang, Chenhao Huang, Yunke Zhang, Yuran Wang, Tao Gui, Qi Zhang, Xipeng Qiu, Xuanjing Huang:

VRPO: Rethinking Value Modeling for Robust RL under Noisy Supervision in LLM Post-Training. 24046-24067 - Bobo Li, Rui Wu, Zibo Ji, Meishan Zhang, Hao Fei, Min Zhang, Mong-Li Lee, Wynne Hsu:

Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment. 24068-24084 - Kyomin Hwang, Hyeonjin Kim, Sangyeon Cho, Nojun Kwak:

Knowledge Beyond Language: Bridging the Gap in Multilingual Machine Unlearning Evaluation. 24085-24119 - Zefang Zong, Dingwei Chen, Yang Li, Qi Yi, Bo Zhou, Chengming Li, B. O. Qian, Peng Chen, Jie Jiang:

AT²PO: Agentic Turn-based Policy Optimization via Tree Search. 24120-24143 - Junkai Chen, Huihui Huang, Yunbo Lyu, Junwen An, Jieke Shi, Chengran Yang, Ting Zhang, Haoye Tian, Yikun Li, Zhenhao Li, Xin Zhou, Xing Hu, David Lo:

SecureVibeBench: Benchmarking Secure Vibe Coding of AI Agents via Reconstructing Vulnerability-Introducing Scenarios. 24144-24168 - Weicai Yan, Xinhua Ma, Wang Lin, Tao Jin:

Text-Guided Multi-Scale Frequency Representation Adaptation. 24169-24187 - Pei-An Chen, Yong-Ching Liang, Jia-Fong Yeh, Hung-Ting Su, Yi-Ting Chen, Min Sun, Winston H. Hsu:

ADAPT: Benchmarking Commonsense Planning under Unspecified Affordance Constraints. 24188-24206 - Jiaying Zhang, Lei Shi, Jiguo Li, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He:

GeoRA: Geometry-Aware Low-Rank Adaptation for RLVR. 24207-24221 - Yudong Li, Jiawei Cai, Linlin Shen:

KoCo: Conditioning Language Model Pre-training on Knowledge Coordinates. 24222-24235 - Xudong Shen, Li Yuan, Ye Chen, Xin Wu, Yi Cai, Zhiyong Wu:

Truth or Sophistry? LoFa: A Benchmark for LLM Robustness Against Logical Fallacies. 24236-24268 - San Kim, Gary Lee:

Merging Triggers, Breaking Backdoors: Defensive Poisoning for Instruction-Tuned Language Models. 24269-24287 - Zhengyang Ai, Zikang Shan, Xiaodong Ai, Jingxian Tang, Hangkai Hu, Pinyan Lu:

SHAPE: Stage-aware Hierarchical Advantage via Potential Estimation for LLM Reasoning. 24288-24305 - Yuchong Chen, Bowei Zou, Yuhan Chen, Yifan Fan, Xinyu Li, Shujun Cao, Yu Hong:

Looking Beyond the One: Operationalizing and Eliciting Visual Ambiguity in VLLMs. 24306-24323 - Xinyi Xu, Bingguang Hao, Yongyi Xiong, Zimo Chen, Xinchen Liu, Hongxin Guo, Xuelong Wang, Silin Zhou, Shihan Dou:

JanusMM: A Benchmark for Self-Deprecation Understanding in Real-World Multimodal Conversations. 24324-24343 - Minfeng Zhu, Linxin Bao, Wei Chen, Linchao Zhu:

Attention as Selector: Unlocking VLM Attention for Long Document Page Retrieval. 24344-24365 - Bing Zhou, Zhe Huang, Shilei Tan, Kai Zhao, Yongcheng Zhou:

LAMCL: A Length-aware Momentum Contrastive Learning Framework for Multiscale Machine-Revised Text Detection. 24366-24380 - Jiahuan Zhang, Shunwen Bai, Tianheng Wang, Kaiwen Guo, Zijia Song, Hanqing Wu, Guozheng Rao, Kai Han, Kaicheng Yu:

Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models. 24381-24404 - Mingxiang Tao, Yu Tian, Wenxuan Tu, Yue Yang, Xue Yang, Xiangyan Tang:

Safe-FedLLM: Delving into the Safety of Federated Large Language Models. 24405-24420 - Zixu Li, Yupeng Hu, Zhiheng Fu, Zhiwei Chen, Yongqi Li, Liqiang Nie:

TEMA: Anchor the Image, Follow the Text for Multi-Modification Composed Image Retrieval. 24421-24442 - Kangyang Luo, Yuzhuo Bai, Shuzheng Si, Cheng Gao, Zhitong Wang, Yingli Shen, Wenhao Li, Zhu Liu, Yufeng Han, Jiayi Wu, Cunliang Kong, Maosong Sun:

ImCoref-CeS: An Improved Lightweight Pipeline for Coreference Resolution with LLM-based Checker-Splitter Refinement. 24443-24471 - Xiaoxiao Ma, Kuofeng Gao, Zeyi Lu, Wenxi Jiang, Hao Fang, Hao Wu, Bin Chen, Shu-Tao Xia:

When Efficiency Meets Safety: A Benchmark Security Analysis of KV Cache Compression in Large Language Models. 24472-24485 - Rui Wang, Ce Zhang, Jun-Yu Ma, Jianshu Zhang, Hongru Wang, Yi Chen, Boyang Xue, Tianqing Fang, Zhisong Zhang, Hongming Zhang, Haitao Mi, Dong Yu, Kam-Fai Wong:

WebAggregator: Enhancing Compositional Reasoning Capabilities of Deep Research Agent Foundation Models. 24486-24517 - Xinshun Feng, Xinhao Song, Lijun Li, Gongshen Liu, Jing Shao:

SEARL: Joint Optimization of Policy and Tool Graph Memory for Self-Evolving Agents. 24518-24535 - Zhaoxin Feng, Zheng Chen, Jianfei Ma, Yip Tin Po, Emmanuele Chersoni, Bo Li:

Good Arguments Against the People Pleasers: How Reasoning Mitigates (Yet Masks) LLM Sycophancy. 24536-24570 - Bryan Chen Zhengyu Tan, Zhengyuan Liu, Xiaoyuan Yi, Jing Yao, Xing Xie, Nancy F. Chen, Roy Ka-Wei Lee:

Can Persona-Prompted LLMs Emulate Subgroup Values? An Empirical Analysis of Generalisability and Fairness in Cultural Alignment. 24571-24590 - Kehan Jiang, Haonan Dong, Zhaolu Kang, Zhengzhou Zhu, Guojie Song:

FoE: Forest of Errors Makes the First Solution the Best in Large Reasoning Models. 24591-24629 - Mingming Sun, Runze Jiang, Zhu Zhangchenxi, Minlong Peng, Yunfeng Cai:

Lingua-Graph: A Unified Representation of Cross-Task Common Substructures for Analytic Language Processing. 24630-24646 - Tianle Chen, Pengyu Cheng, Qiyuan Zhu, Jiacheng Wang, Bei Liu, Hao Gu, Ruijie Shen, Xiaofeng Hou, Sirui Han, Jiacheng Liu:

Adaptive Spatial and Temporal Redundancy Optimization for Efficient Reasoning in Large Language Models. 24647-24662 - Jian Xiong

, Jingbo Zhou, Jingyong Ye, Qiang Huang, Dejing Dou:
AAPO: Enhancing the Reasoning Capabilities of LLMs with Advantage Margin. 24663-24680 - Ziheng Li, Liu Kang, Feng Xiao

, Luxi Xing, Qingyi Si, Zhuoran Li, Weikang Gong, Deqing Yang, Yanghua Xiao, Hongcheng Guo:
Outcome-Grounded Advantage Reshaping for Fine-Grained Credit Assignment in Mathematical Reasoning. 24681-24693 - Jinhu Fu, Yan Bai, Longzhu He, Yihang Lou, Yanxiao Zhao, Li Sun, Sen Su:

Learning to Edit Knowledge via Instruction-based Chain-of-Thought Prompting. 24694-24711 - Fengqing Jiang, Yichen Feng, Yuetai Li, Luyao Niu, Basel Alomair, Radha Poovendran:

BadScientist: Can a Research Agent Write Convincing but Unsound Papers that Fool LLM Reviewers? 24712-24727 - Zhibang Yang, Xinke Jiang, Rihong Qiu, Ruiqing Li, Yihang Zhang, Yue Fang, Yongxin Xu, Hongxin Ding, Xu Chu, Junfeng Zhao, Yasha Wang:

DFAMS: Dynamic-flow guided Federated Alignment based Multi-prototype Search. 24728-24752 - Rongchuan Mu, Zexin Wang, Qianyu Wang, Minghua Ma, Zekun Wang, Ming Liu, Bing Qin:

PARIF: Pushing the Pareto Frontier of Instruction Following and Reasoning with Curriculum Reinforcement Learning. 24753-24783 - Yumeng Fu, Jiayin Zhu, Lingling Zhang, Wenjun Wu, Bo Zhao, Shaoxuan Ma, Yushun Zhang, Jun Liu:

GeoLaux: A Benchmark for Evaluating MLLMs' Geometry Performance on Long-Step Problems Requiring Auxiliary Lines. 24784-24809 - Qiming Li, Xiaocheng Feng, Yixuan Ma, Ruihan Chen, Zihe Tong, Zekai Ye, Xiachong Feng, Libo Qin, Haoyu Ren, Kun Chen, Yunfei Lu, Dandan Tu, Bing Qin:

Unlocking Multilingual Reasoning Capability of LLMs and LVLMs through Representation Engineering. 24810-24829 - Ki Sen Hung, Xi Yang, Chang Liu, Haoran Li, Kejiang Chen, Changxuan Fan, Tsun On Kwok, Weiming Zhang, Xiaomeng Li, Yangqiu Song:

Into the Gray Zone: Domain Contexts Can Blur LLM Safety Boundaries. 24830-24867 - Fan Gao, Sherry T. Tong, Jiwoong Sohn, Jiahao Huang, Junfeng Jiang, Ding Xia, Piyalitt Ittichaiwong, Kanyakorn Veerakanjana, Hyunjae Kim, Qingyu Chen, Edison Marrese-Taylor, Kazuma Kobayashi, Akiko Aizawa, Irene Li:

MED-COREASONER: Reducing Language Disparities in Medical Reasoning via Language-Informed Co-Reasoning. 24868-24888 - Chongyuan Dai, Jinpeng Hu, Hongchang Shi, Zhuo Li, Dan Guo, Xun Yang, Meng Wang:

Psyche-R1: Towards Reliable Psychological LLMs through Unified Empathy, Expertise, and Reasoning. 24889-24906 - Zhenxin Qin, Qiang Li, Qingzhuo Wang, Ruiyang Qin, Zhihua Wei, Wen Shen:

Mitigating Action-Relation Hallucinations in LVLMs via Relation-aware Visual Enhancement. 24907-24923 - Leonardo Ranaldi, Federico Ranaldi:

Agentic Oversight via Dialectic Reasoning. 24924-24944 - Yujie Feng, Hao Wang, Jian Li, Xu Chu, Zhaolu Kang, Yiran Liu, Yasha Wang, Philip S. Yu, Xiao-Ming Wu:

FOREVER: Forgetting Curve-Inspired Memory Replay for Language Model Continual Learning. 24945-24965 - Xiangxi Zheng, Kuang He, Jiayi Hu, Ping Yu, Rui Yan, Yuan Yao, Peng Hou, Anxiang Zeng, Alex Jinpeng Wang:

CharTide: Data-Centric Chart-to-Code Generation via Tri-Perspective Tuning and Inquiry-Driven Evolution. 24966-24985 - Junho Park, Dohoon Kim, Taesup Moon:

PRISP: Privacy-Safe Few-Shot Personalization via Lightweight Adaptation. 24986-25003 - Bosi Wen, Yilin Niu, Cunxiang Wang, Pei Ke, Xiaoying Ling, Ying Zhang, Aohan Zeng, Hongning Wang, Minlie Huang:

IF-CRITIC: Towards a Fine-Grained LLM Critic for Instruction-Following Evaluation. 25004-25029 - Yu Tian, Jie Xing, Ziming Li, Jiang Li, Zehua Duo, Tian Lan, Xu Liu, Guanglai Gao, Xiangdong Su:

Know Your Place: Diagnosing Implicit Social Adaptation Failures in Chinese Large Language Models. 25030-25062 - Zhenhua Wang, Chunlei Wang, Yue Geng, Bang Wang:

Agent Newsroom: Efficient Chronological Report Generation via Dynamic Multi-Agent Collaboration. 25063-25084 - Yifei Li, Weidong Guo, Lingling Zhang, Rongman Xu, Muye Huang, Hui Liu, Lijiao Xu, Yu Xu, Jun Liu:

Locomo-Plus: Beyond-Factual Cognitive Memory Evaluation Framework for LLM Agents. 25085-25100 - Lovisa Hagström, Youna Kim, Haeun Yu, Sang-goo Lee, Richard Johansson, Hyunsoo Cho, Isabelle Augenstein:

CUB: Benchmarking Context Utilisation Techniques for Language Models. 25101-25133 - Hung-Ting Su, Ting-Jun Wang, Jia-Fong Yeh, Min Sun, Winston H. Hsu:

VLN-NF: Feasibility-Aware Vision-and-Language Navigation with False-Premise Instructions. 25134-25150 - Yingfeng Luo, Ziqiang Xu, Yuxuan Ouyang, Murun Yang, Dingyang Lin, Kaiyan Chang, Tong Zheng, Bei Li, Peinan Feng, Quan Du, Tong Xiao, Jingbo Zhu:

NiuTrans.LMT: Toward Inclusive and Scalable Multilingual Machine Translation with LLMs. 25151-25179 - Zhirong Chen, Kaiyan Chang, Zhuolin Li, Cangyuan Li, Xinyang He, Chujie Chen, Mengdi Wang, Haobo Xu, Yinhe Han, Huawei Li, Ying Wang:

ChipSeek: Optimizing Verilog Generation via EDA-Integrated Reinforcement Learning. 25180-25201 - Jihwan Oh, Murad Aghazada, Yooju Shin, Se-Young Yun, Taehyeon Kim:

MERIT Feedback Elicits Better Bargaining in LLM Negotiators. 25202-25223 - Chuang Zhou, Zheng Yuan, Linhao Luo, Zhaozhuo Xu, Yilin Xiao, Junnan Dong, Siyu An, Di Yin, Xing Sun, Xiao Huang:

Collision to Cognition: Hash-Driven Graph Construction for Efficient RAG. 25224-25240 - Yifei Gao, Junhong Ye, Yifan Yang, Jiaqi Wang, Yi Zhang, Ruichen Zhang, Jitao Sang:

WebSynthesis: World Model-Guided Monte Carlo Tree Search for Efficient WebAgent Trajectory Synthesis. 25241-25258 - Yifan Zhang, Chen Huang, Yueke Zhang, Jiahao Zhang, Toby Jia-Jun Li, Collin McMillan, Kevin Leach, Yu Huang:

EyeMulator: Improving Code Language Models by Mimicking Human Visual Attention. 25259-25272 - Pengqian Lu, Jie Lu, Anjin Liu, Guangquan Zhang:

TPA: Next Token Probability Attribution for Detecting Hallucinations in RAG. 25273-25292 - Xin Huang, Yan Hu, Yue-Jiao Gong, Xinglin Zhang:

GMFL: Efficient Global Masking for Federated LLM Fine-tuning. 25293-25312 - Yuanfu Sun, Kang Li, Dongzhe Fan, Jiajin Liu, Qiaoyu Tan:

AgentGL: Towards Agentic Graph Learning with LLMs via Reinforcement Learning. 25313-25335 - Sua Lee, Sanghee Park, Jinbae Im:

MM-JudgeBias: A Benchmark for Evaluating Compositional Biases in MLLM-as-a-Judge. 25336-25373 - Yunfan Yang, Cuiling Lan, Jitao Sang, Yan Lu:

CSPO: Alleviating Reward Ambiguity for Structured Table-to-LaTeX Generation. 25374-25391 - Yuming Yang, Jiang Zhong, Li Jin, Xiao Sun, Jingwang Huang, Jinpeng Gao, Qing Liu, Yang Bai, Jingyuan Zhang, Rui Jiang, Qin Lei, Kaiwen Wei:

Chart-MRAG: Benchmarking Multimodal Retrieval Augmented Generation on Chart-based Documents. 25392-25445 - Di Zhang, Xun Wu, Shaohan Huang, Lingjie Jiang, Yaru Hao, Li Dong, Zewen Chi, Zhifang Sui, Furu Wei:

Towards Stable and Effective Reinforcement Learning for Mixture-of-Experts. 25446-25457 - Chuanqi Shi, Miao Gao, Zhiqiang Gao:

AIRCoder: Adaptive Integration of Multi-dimensional Retrieval for Repository-level Code Completion. 25458-25470 - Yuhang Li, Chenchen Zhang, Ruilin Lv, Ao Liu, Ken Deng, Yuanxing Zhang, Jiaheng Liu, Bo Zhou:

ReLook: Vision-Grounded RL with a Multimodal LLM Critic for Agentic Web Coding. 25471-25485 - Hao Wang, Ziyi Ni, Huacan Wang, Pin Lyu, Lei Sha:

SafetyMem: Adaptive Jailbreak Defense via Dual-Component Safety Memory. 25486-25509 - Ge Chang, Jinbo Su, Jiacheng Liu, Pengfei Yang, Yuhao Shang, Huiwen Zheng, Hongli Ma, Yan Liang, Yuanchun Li, Yunxin Liu:

Enhancing Agentic Textual Graph Retrieval with Synthetic Stepwise Supervision. 25510-25525 - Qiuyuan Ai, Zenghuang Fu, Zhaoyang Li, Ping Jiang, Haoyu Wu, Jie Song, Guannan He:

Cognitive Scaffold: From Fluid Context to Crystallized Memory for Long-Horizon DeepResearch Agents. 25526-25542 - Amir Hossein Yari, Kalmit Kulkarni, Ahmad Raza Khan, Fajri Koto:

Revisiting Metric Reliability for Fine-grained Evaluation of Machine Translation and Summarization in Indian Languages. 25543-25561 - Mengxue Yang, Jinming Li, Chun Yang, Jiaqi Zhu, Jiafan Li, Guanhua Zhang, Ying Li:

Learning to Think on Hypergraph: HyperCoT for Structure-Guided N-ary Knowledge Graph Completion. 25562-25579 - Wen Luo, Guangyue Peng, Wei Li, Shaohang Wei, Feifan Song, Liang Wang, Nan Yang, Xingxing Zhang, Jing Jin, Furu Wei, Houfeng Wang:

Two Pathways to Truthfulness: On the Intrinsic Encoding of LLM Hallucinations. 25580-25626 - Bingshen Mu, Xian Shi, Xiong Wang, Hexin Liu, Jin Xu, Lei Xie:

LLM-ForcedAligner: A Non-Autoregressive and Accurate LLM-Based Forced Aligner for Multilingual and Long-Form Speech. 25627-25638 - Seunghee Koh, Sunghyun Baek, Youngdong Kim, Junmo Kim:

Forget What Matters, Keep the Rest: Selective Unlearning of Informative Tokens. 25639-25655 - Zeng You, Yaofo Chen, Qiuwu Chen, Ying Sun, Shuhai Zhang, Yingjian Li, Yaowei Wang, Mingkui Tan:

Latent-Condensed Transformer for Efficient Long Context Modeling. 25656-25671 - Zhihui Chen, Kai He, Qingyuan Lei, Bin Pu, Jian Zhang, Yuling Xu, Mengling Feng:

MedForge: Interpretable Medical Deepfake Detection via Forgery-aware Reasoning. 25672-25692 - Xu Zhang, Hao Li, Zhichao Lu:

CrossGuard: Safeguarding MLLMs against Joint-Modal Implicit Malicious Attacks. 25693-25707 - Hyowon Wi, Noseong Park:

Can Spectral-Clipping Enable Better Learning While Forgetting Less for Low-Rank Adaptation? 25708-25734 - Jiawei Cao, Jie Ouyang, Mingyue Cheng, Zhaomeng Zhou, Chunli Liu, Yupeng Li, Zirui Liu, Shijin Wang:

Re³: Relevance & Recency Retrieval for Mitigating Temporal Hallucination. 25735-25760 - Jiujiang Guo, Zhengliang Guo, Kai Wang, Meiyang Wang, Dehua Peng, Shaozu Yuan, Chengyin Hu, Shuan Ai, Yiwei Wei:

TeCES: Collaborative Geometric Knowledge Representation Framework under Evolving Fact Snapshots. 25761-25780 - Zhiyi Duan, Zixing Shi, Bing Jia, Qi Wang:

MicroC-KT: Modeling Community Effect via Learning Micro-Environment for Evidence-Grounded Explainable Knowledge Tracing. 25781-25803 - Jiaxuan Wu, Wanli Peng, Hang Fu, Yiming Xue, Juan Wen:

ImF: Embedding an Implicit Fingerprint in Your Large Language Models. 25804-25825 - Zhaoyan Gong, Zhiqiang Liu, Songze Li, Xiaoke Guo, Yuanxiang Liu, Xinle Deng, Zhizhen Liu, Lei Liang, Huajun Chen, Wen Zhang:

Temp-R1: A Unified Autonomous Agent for Complex Temporal KGQA via Reverse Curriculum Reinforcement Learning. 25826-25845 - Minghan Li, Junjie Zou, Xinxuan Lv, Chao Zhang, Guodong Zhou:

S2G-RAG: Structured Sufficiency and Gap Judging for Iterative Retrieval-Augmented QA. 25846-25862 - Choongwon Kang, Seungjong Sun, Hyunmin Jun, Jang-Hyun Kim:

Jailbreaking Multimodal Large Language Models using Multi-Clip Video. 25863-25889 - Rongxin Chen, Tianyu Wu, Bingbing Xu, Jiatang Luo, Xiucheng Xu, Huawei Shen:

HAG: Hierarchical Demographic Tree-based Agent Generation for Topic-Adaptive Simulation. 25890-25906 - Qianchi Zhang, Hainan Zhang, Liang Pang, Hongwei Zheng, Zhiming Zheng:

Stable-RAG: Mitigating Retrieval-Permutation-Induced Hallucinations in Retrieval-Augmented Generation. 25907-25926 - Yanli Wang, Yanlin Wang, Bowen Zhang, Yiwei Zhang, Daya Guo, Jiachi Chen, Hongyu Zhang, Zibin Zheng:

From Logical to Computational Sparsity: Structure-Aware Block-Sparse Attention for Long-Code Completion. 25927-25942 - Jingjie Zeng, Huayang Li, Liang Yang, Yuanyuan Sun, Shaowu Zhang, Hongfei Lin:

CogEvolve: A Multimodal Benchmark for Evaluating Relational Reasoning in Semantic Extension. 25943-25960 - Jeongho Yoon, Chanhee Park, Yongchan Chun, Hyeonseok Moon, Heuiseok Lim:

Towards Privacy-Preserving Large Language Model: Text-free Inference Through Alignment and Adaptation. 25961-25981 - Di Wu, Yixin Wan, Kai-Wei Chang:

VisRet: Visualization Improves Knowledge-Intensive Text-to-Image Retrieval. 25982-26001 - Shize Zhou, Peiyu Liu, Lirong Fu, Tong Ye, Wenhai Wang:

Selective Knowledge Distillation: Fusing LLM Semantic Strengths with DNN Efficiency for Binary Code Similarity Detection. 26002-26014 - Wonjun Lee, Hyounghun Kim, Gary Lee:

Mixture-of-Experts with Intermediate CTC Supervision for Accented Speech Recognition. 26015-26027 - Jiaming Leng, Yunying Bi, Chuan Qin, Zhenya Huang, Bing Yin, Haojie Ren, Yanyong Zhang, Chao Wang:

TransLLM: A Unified Multi-Task Large Language Model for Urban Transportation via Learnable Prompting. 26028-26042 - Lingyue Fu, Hao Guan, Bolun Zhang, Haowei Yuan

, Yaoming Zhu, Lin Qiu, Zongyu Wang, Xuezhi Cao, Xunliang Cai, Weiwen Liu, Weinan Zhang, Yong Yu:
CoreCodeBench: Decoupling Code Intelligence via Fine-Grained Repository-Level Tasks. 26043-26067 - Yanxu Mao, Peipei Liu, Tiehan Cui, Congying Liu, Mingzhe Xing, Datao You:

Stop Fixating on Prompts: Reasoning Hijacking and Constraint Tightening for Red-Teaming LLM Agents. 26068-26085 - Zihao Yi, Zhenqing Ling, Delong Zeng, Haohao Luo, Zhe Xu, Wei Liu, Jian Luan, Wanxia Cao, Ying Shen:

Attention Basin: Why Contextual Position Matters in Large Language Models. 26086-26106 - Siran Liu, Guoxia Wang, Sa Wang, Jinle Zeng, Haoyang Xie, Siyu Lou, Jiabin Yang, Dianhai Yu, Haifeng Wang, Chao Yang:

RRAtention: Dynamic Block Sparse Attention via Per-Head Round-Robin Shifts for Long-Context Inference. 26107-26124 - Zixuan Huang, Zhihong Zhu, Xiaolong Liu, Yanchao Hao, Manman Zhang, Zheng Wei, Bowen Xing, Xian Wu, Ye Li, Fen Miao, Yefeng Zheng:

Beyond Surface Features: Advancing Medical Vision-Language Alignment via Dynamic Evidence-Guided Preference Optimization. 26125-26137 - Peidong Wang, Zhiming Ma

, Xin Dai, Yongkang Liu, Shi Feng, Xiaocui Yang, Wenxing Hu, Zhihao Wang, Mingjun Pan, Li Yuan, Daling Wang:
SAFE-QAQ: End-to-End Slow-Thinking Audio-Text Fraud Detection via Reinforcement Learning. 26138-26157 - Pengchen Chen

, Shi Chen, Qiming Ye, Xinli Chen, Xinran Li, Wei Xiang:
MaDS: Long-Horizon GUI Automation via Synergizing Dual-Layer Memory and Multi-Round Debate. 26158-26180 - Zili Wei, Yilin Wang, Xiaocui Yang, Shi Feng, Weidong Bao, Daling Wang, Zihan Wang, Yifei Zhang:

CIRAG: Construction-Integration Retrieval and Adaptive Generation for Multi-hop Question Answering. 26181-26197 - Yirong Zeng, Yufei Liu, Xiao Ding, Yutai Hou, Yuxian Wang, Wu Ning, Haonan Song, Dandan Tu, Qixun Zhang, Yuxiang He, Bibo Cai, Ting Liu:

TinyJudge: Unverifiable Constraint Alignment via Lightweight Specialist Ensembles. 26198-26212 - Boyan Han, Yiwei Wang, Yi Song, Yujun Cai, Chi Zhang:

Dynamic Infilling Anchors for Format-Constrained Generation in Diffusion Large Language Models. 26213-26227 - Rui Yin, Tianxu Han, Naen Xu, Changjiang Li, Ping He, Chunyi Zhou, Jun Wang, Zhihui Fu, Tianyu Du, Jinbao Li, Shouling Ji:

Compiling Activation Steering into Weights via Null-Space Constraints for Stealthy Backdoors. 26228-26245 - Hang Fu, Wanli Peng, Yinghan Zhou, Jiaxuan Wu, Juan Wen, Yiming Xue:

Inhibitory Attacks on Backdoor-based Fingerprinting for Large Language Models. 26246-26266 - Fan Zhang, Shiming Fan, Hua Wang:

TimeSAF: Towards LLM-Guided Semantic Asynchronous Fusion for Time Series Forecasting. 26267-26284 - Wai Man Si, Mingjie Li, Michael Backes, Yang Zhang:

Pruning Unsafe Tickets: A Resource-Efficient Framework for Safer and More Robust LLMs. 26285-26302 - Arun Ramachandran, R. Govindarajan, Murali Annavaram, Prakash Sathyanath Raghavendra:

EQUIP: EQUivariant preserving In-Place updates for Efficient Token Pruning. 26303-26323 - Xiaowei Zhu, Yubing Ren, Fang Fang, Shi Wang, Yanan Cao, Li Guo:

Exons-Detect: Identifying and Amplifying Exonic Tokens via Hidden-State Discrepancy for Robust AI-Generated Text Detection. 26324-26336 - Xiaoyu Xu, Yulan Pan, Xiaosong Yuan, Zhihong Shen, Minghao Su, Yuanhao Su, Xiaofeng Zhang:

Reasoning Fails Where Step Flow Breaks. 26337-26353 - Yijie Huang, Xiaocui Yang, Shi Feng, Wen Zhang, Kaisong Song, Yifei Zhang, Daling Wang:

Cat-MoD: Accelerating Multimodal Alignment via Caption Token Guided Asymmetric Mixture-of-Depths. 26354-26376 - Changhao Jiang, Ming Zhang, Yifei Cao, Junjie Ye, Xiaoran Fan, Shihan Dou, Zhiheng Xi, Jiajun Sun, Yi Dong, Yujiong Shen, Jingqi Tong, Baoyu Fan, Tao Gui, Qi Zhang, Xuanjing Huang:

Beyond Scaling: Measuring and Predicting the Upper Bound of Knowledge Retention in Language Model Pre-Training. 26377-26396 - Yan Liu, Feng Zhang, Zhanyu Ma, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He, Han Liu, Yangdong Deng:

Efficient Paths and Dense Rewards: Probabilistic Flow Reasoning for Large Language Models. 26397-26414 - Zhewen Tan, Wenhan Yu, Jianfeng Si, Tongxin Liu, Kaiqi Guan, Huiyan Jin, Jiawen Tao, Xiaokun Yuan, Xiangzheng Zhang, Duohe Ma, Tong Yang, Lin Sun:

TriPlay-RL: Tri-Role Self-Play Reinforcement Learning for LLM Safety Alignment. 26415-26429 - Hongcheng Liu, Yuhao Wang, Zhe Chen, Pingjie Wang, Zhiyuan Zhu, Yixuan Hou, Yanfeng Wang, Yu Wang:

Cross-Modal Coreference Alignment: Enabling Reliable Information Transfer in Omni-LLMs. 26430-26453 - Xiangxu Zhang, Lei Li, Yanyun Zhou, Xiao Zhou, Yingying Zhang, Xian Wu:

Inflated Excellence or True Performance? Rethinking Medical Diagnostic Benchmarks with Dynamic Evaluation. 26454-26493 - Xiaocheng Zhang, Xi Wang, Yifei Lu, Jianing Wang, Zhuangzhuang Ye, Mengjiao Bao, Peng Yan, Xiaohong Su:

TrendFact: A Benchmark Towards Hotspot Perception in Automatic Fact-Checking. 26494-26513 - Guanglu Sun, Xinyu Liu

, Lili Liang, Yang Yu, Fei Lang, Suxia Zhu, Ming Liu:
MPBoCo: Multimodal Prompt-based Boundary-enhanced Continual Framework for Joint Entity and Relation Extraction. 26514-26524 - Siran Liu, Zane Cao, Yongchao He:

ConfSpec: Efficient Step-Level Speculative Reasoning via Confidence-Gated Verification. 26525-26538 - Xilai Ma, Liye Zhao, Weijun Yao, Haibing Di, Wenya Wang, Jing Li:

Personalizing LLMs with Binary Feedback: A Preference-Calibrated Optimization Framework. 26539-26555 - Jiahao Xiong, Yihe Liu, Xianming Hu, Hongbo Zhao, Nuoyi Chen, Jie Zhang, Kai Zhang:

Localized Low-Rank Adaptation within Clustered Parameter Subspaces. 26556-26572 - Zenghao Liu, Yansong Zhang:

SGVEF-LOOP: Coverage-Guided Progressive Topological Exploration and Fact-Grounded Metamorphic Evaluation for MCP Agents. 26573-26599 - Xiao Sun, Yuming Yang, Xinyi Jiang, Yu Tian, Junnan Zhu, Jiang Zhong, Qin Lei, Jingwang Huang, Haoyang Zeng, Xinyu Zhou, Xin Xiao, Kaiwen Wei:

MentalSeek-Dx: Towards Progressive Hypothetico-Deductive Reasoning for Real-world Psychiatric Diagnosis. 26600-26636 - Jinliang Liu, Jiale Bai, Shaoning Zeng:

Think Parallax: Solving Multi-Hop Problems via Multi-View Knowledge-Graph-Based Retrieval-Augmented Generation. 26637-26655 - Xiping Li, Jianghong Ma:

AIM-CoT: Active Information-driven Multimodal Chain-of-Thought for Vision-Language Reasoning. 26656-26681 - Shaonan Liu, Guo Yu, Xiaoling Luo, Shiyi Zheng, Jie Liu, Wenting Chen, Linlin Shen:

Benchmarking Egocentric Clinical Intent Understanding Capability for Medical Multimodal Large Language Models. 26682-26697 - Shufang Xie, Qizhi Pei, Ang Lv, Jingyang Hu, Lijun Wu, Rui Yan:

Data Pollination: An Emergent Ecological Process Driving AI Population Evolution. 26698-26721 - Yuanzhen Hao

, Desheng Wu:
Extending First-Order Logic for Factual Reasoning over Knowledge Graphs. 26722-26738 - Chenyang Shao, Sijian Ren, Fengli Xu, Yong Li:

Diffuse Thinking: Exploring Diffusion Language Models as Efficient Thought Proposers for Reasoning. 26739-26757 - Sen Hu, Yuxiang Wei, Jiaxin Ran, Xueran Han, Zhiyuan Yao, Huacan Wang, Ronghao Chen, Lei Zou:

Does Memory Need Graphs? A Unified Framework and Empirical Analysis for Long-Term Dialog Memory. 26758-26782 - Weipeng Jiang, Xiaoyu Zhang, Juan Zhai, Shiqing Ma, Chao Shen, Yang Liu:

False Friends in the Shell: Unveiling the Emoticon Semantic Confusion in Large Language Models. 26783-26803 - Dawei Zhu, Rui Meng, Jiefeng Chen, Sujian Li, Tomas Pfister, Jinsung Yoon:

DocLens: A Tool-Augmented Multi-Agent Framework for Long Visual Document Understanding. 26804-26829 - Yujie Chen, Tailai Chen, Yifeng Gao, Zoe Wanying He, Yijue Xu, Shaobo Wang, Linfeng Zhang:

Stability Implies Redundancy: Delta Attention Selective Halting for Efficient Long-Context Prefilling. 26830-26848 - Zekun Li, Jifan Yu, Haoxuan Li, Ye He, Daniel Zhang-Li, Shangqing Tu, Joy Lim Jia Yin, Yikun Jiang, Jiaxin Yuan, Yu Zhang:

Beyond Self-Report: Bridging the Intention-Behavior Gap in Critical Thinking Assessment via Interpretable Multi-Agent System. 26849-26871 - Lihao Sun, Hang Dong, Bo Qiao, Qingwei Lin, Dongmei Zhang, Saravan Rajmohan:

LLM Reasoning as Trajectories: Step-Specific Representation Geometry and Correctness Signals. 26872-26887 - Hao Zhou, Tianhao Li, Zhijun Wang, Shuaijie She, Linjuan Wu, Hao-Ran Wei, Baosong Yang, Jiajun Chen, Shujian Huang:

A Data-Efficient Path to Multilingual LLMs: Language Expansion via Post-training PARAMΔ Integration into Upcycled MoE. 26888-26904 - Zihao Wei, Liang Pang, Jiahao Liu, Wenjie Shi, Jingcheng Deng, Shicheng Xu, Zenghao Duan, Jingang Wang, Fei Sun, Huawei Shen, Xueqi Cheng:

The Evolution of Thought: Tracking LLM Overthinking via Reasoning Dynamics Analysis. 26905-26920 - Yihan Chen, Jiawei Chen, Guozhao Mo, Xuanang Chen, Ben He, Xianpei Han, Le Sun:

CoCoNUTS: Concentrating on Content while Neglecting Uninformative Textual Styles for AI-Generated Peer Review Detection. 26921-26950 - Seonjeong Hwang, Hyounghun Kim, Gary Lee:

Can LLMs Estimate Cognitive Complexity of Reading Comprehension Items? 26951-26966 - Yindong Zhang, Wenmian Yang, Yiquan Zhang, Weijia Jia:

ReCoQA: A Benchmark for Tool-Augmented and Multi-Step Reasoning in Real Estate Question and Answering. 26967-26987 - Bingquan Zhang, Xiaoxiao Liu, Yuchi Wang, Zhou Lei, Qianqian Xie, Benyou Wang:

Human or LLM as Standardized Patients? A Comparative Study in Medical Education. 26988-27012 - Jinhui Chen, Shizhu He, Xingchang Yang, Huanxuan Liao, Yequan Wang, Xiangwen Liao, Wenhao Teng, Kang Liu, Jun Zhao:

Harmonizing the Past, Present, and Future: A Null-Space Constrained Region-Specific Method for Continual Learning in LLMs. 27013-27033 - Jing Jin, Yuhan Song

, Wen Luo, Houfeng Wang:
Attention Weights as an Indicator: Analyzing and Improving Document Utilization in Retrieval-Augmented Generation. 27034-27052 - Bruce W. Lee, Yeongheon Lee, Hyunsoo Cho:

Inertia in Moral and Value Judgments of Large Language Models. 27053-27075 - Viet Thanh Pham, Lizhen Qu, Thuy-Trang Vu, Gholamreza Haffari, Dinh Q. Phung:

LiveCultureBench: a Multi-Agent, Multi-Cultural Benchmark for Large Language Models in Dynamic Social Simulations. 27076-27105 - Zhuoyun Du, Runze Wang, Huiyu Bai, Zouying Cao, Xiaoyong Zhu, Yu Cheng, Bo Zheng, Wei Chen, Haochao Ying:

Enabling Agents to Communicate Entirely in Latent Space. 27106-27129 - Yiwen Gao, Ruochen Zhao, Yang Deng, Wenxuan Zhang:

DR-Arena: an Automated Evaluation Framework for Deep Research Agents. 27130-27152 - Liang Zhao, Xiaocheng Feng, Weihong Zhong, Lei Huang, Kun Zhu, Baoxin Wang, Dayong Wu, Guoping Hu, Ting Liu, Bing Qin:

Question Tells You Where the Answer Is: Intention-aware Long-Context KV Cache Compression. 27153-27169 - Chenglin Wang, Yucheng Zhou, Shuang Chen, Tao Wang, Kai Zhang:

LADR: Locality-Aware Dynamic Rescue for Efficient Text-to-Image Generation with Diffusion Large Language Models. 27170-27183 - Lei Wei, Xiao Peng, TT, Guannan Zhang, Chenhao Jiang, Hongyu Li, Lanbo Lin, Yuanwu Xu, Jiayao Liu, Kesu Wang, Bin Wang:

PACE: Predictive Adaptive Context Extraction for Long-Horizon LLM Agents. 27184-27199 - Jingcheng Hu, Yinmin Zhang, Shijie Shang, Xiaobo Yang, Yue Peng, Zhewei Huang, Hebin Zhou, Xin Wu, Jie Cheng, Fanqi Wan, Xiangwen Kong, Chengyuan Yao, Kaiwen Yan, Ailin Huang, Hongyu Zhou, Qi Han, Zheng Ge, Xiangyu Zhang, Heung-Yeung Shum:

PaCoRe: Learning to Scale Test-Time Compute with Parallel Coordinated Reasoning. 27200-27215 - Yuyi Zhang, Junle Liu, Peirong Zhang, Jianliang Liu, Zhenhua Yang, Lianwen Jin:

Draft, Verify, Restore: Self-Refining Historical Inscription Restoration with a Unified MLLM. 27216-27231 - Jingjing Li, Yue Feng, Yuchen Guo, Jincai Huang, Wei Ji, Qi Bi, Yongri Piao, Miao Zhang, Xiaoqi Zhao, Qiang Chen, Shihao Zou, Huchuan Lu, Li Cheng:

SAM3-I: Segment Anything with Instructions. 27232-27249 - Renliang Sun, Wei Cheng, Dawei Li, Haifeng Chen, Wei Wang:

Stop When Enough: Adaptive Early-Stopping for Chain-of-Thought Reasoning. 27250-27268 - Shanbo Cheng, Shuaijie She, Yu Bao, Jianbing Zhang, Jiajun Chen, Shujian Huang:

Improving Long-Context Translation via Self-Supervised Dual Learning. 27269-27280 - Chaohui Guo, Michel C. A. Klein, Zhisheng Huang:

CaRL-EM: Cost-Aware Reinforcement Learning for Entity Matching with LLMs. 27281-27293 - Zirui Song, Qian Jiang, Mingxuan Cui, Mingzhe Li, Lang Gao, Zeyu Zhang, Zixiang Xu, Yanbo Wang, Guangxian Ouyang, Zhenhao Chen, Xiuying Chen:

Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models. 27294-27308 - Jiahe Guo, Xiangran Guo, Yulin Hu, Zimo Long, Xingyu Sui, Xuda Zhi, Yongbo Huang, Hao He, Weixiang Zhao, Yanyan Zhao, Bing Qin:

When Personalization Legitimizes Risks: Uncovering Safety Vulnerabilities in Personalized Dialogue Agents. 27309-27335 - Yixuan Wang, Yue Huang, Hong Qian, Yunzhao Wei, Yifei Ding, Wenkai Wang, Zhi Liu, Zhongjing Huang, Aimin Zhou, Jiajun Guo:

AlphaContext: An Evolutionary Tree-based Psychometric Context Generator for Creativity Assessment. 27336-27357 - Yalun Dai, Yangyu Huang, Tongshen Yang, Yonghan Wang, Xin Zhang, Wenshan Wu, Qihao Zhao, Hao Li, Yuanyuan Gao, Kim-Hui Yap, Scarlett Li:

Demystifying Data Organization for Enhanced LLM Training. 27358-27375 - Dexuan Xu, Jiayin Yuan, Jianing Wang, Yanyuan Chen, Hanpin Wang, Yu Huang:

Beyond Single View: A Comprehensive Benchmark for Medical Multimodal Large Language Models on Multi-Image Understanding. 27376-27394 - Hongcheng Liu, Pingjie Wang, Yuhao Wang, Siqu Ou, Yanfeng Wang, Yu Wang:

When Seeing Is not Enough: Revealing the Limits of Active Reasoning in MLLMs. 27395-27422 - Ao Sun

, Xiaoyu Wang, Zhe Tan, Yu Li, Jiachen Zhu, Yuheng Jia, Shu Su:
CuMA: Aligning LLMs with Sparse Cultural Values via Demographic-Aware Mixture of Adapters. 27423-27441 - Han Zhang, Zihan Gu, Zhiyuan Wang, Tianyi Ma, Jiacheng Lu, Xinyan Zhang, Yuhao Wei, Cheng Hua:

Neo-Classic: A Benchmark for Evaluating Linguistic-Aesthetic Reasoning in Classical Chinese Poetry. 27442-27465 - Seonjeong Hwang, Jun Seo, Hyounghun Kim, Gary Lee:

A Multi-Agent Framework for Feature-Constrained Difficulty Control in Reading Comprehension Item Generation. 27466-27488 - Victor Morand, Nadi Tomeh, Josiane Mothe, Benjamin Piwowarski:

ToMMeR - Efficient Entity Mention Detection from Large Language Models. 27489-27509 - Wangtao Sun, Haotian Xu, Huanxuan Liao, Xuanqing Yu, Zhongtao Jiang, Shizhu He, Jun Zhao, Kang Liu:

Shuttle Between Symbolic Instructions and Neural Parameters of Large Language Models. 27510-27524 - Jiasen Gao, Xiaoliang Chen, Duoqian Miao, Xu Gu, Xianyong Li, Yajun Du:

Mitigating Spurious Correlations in Text Classification Using Latent Space Geometry. 27525-27539 - Minping Chen, Bowen Xiao, Du Liang, Chuxuan Zeng, Zeyi Wen:

Efficient Hyperparameter Optimization for LLM Reinforcement Learning. 27540-27552 - Zhiheng Zhang, Yuanzhe Zhang, Bohan Yu, Daojian Zeng, Kang Liu, Jun Zhao:

Hetero-Designer: Automated Design of Multi-Agent Systems with Heterogeneous LLMs. 27553-27574 - Aoyuan Jiang, Liang Hong, Haoxuan Liu, Rui Wang:

Achieving Multi-Hop Calculation and Safe Abstention in Financial Numerical Reasoning by Metric Graph Constrained LLMs. 27575-27595 - Yuncheng Hua, Sion Weatherhead, Mehdi Jafari, Hao Xue, Flora D. Salim:

SOCIA-EVO: Automated Simulator Construction via Dual-Anchored Bi-Level Optimization. 27596-27634 - Aafiya Shamshad Hussain, Gaurav Srivastava, Alvi Md. Ishmam, Zaber Ibn Abdul Hakim, Chris Thomas:

SoundBreak: A Systematic Study of Audio-Only Adversarial Attacks on Trimodal Models. 27635-27663 - Tao Feng, Xinke Jiang, Xinyan Hu, Yonggang Zhang, Zhen Tao, Wentao Zhang, Boyang Liu, Wenhao Jiang, Chao Wu:

Trust Within? Seek Beyond? Knowledge Boundary Aware Policy Optimization for Agentic Search. 27664-27682 - Yelin Chen, Fanjin Zhang, Suping Sun, Yunhe Pang, Yuanchun Wang, Jian Song, Xiaoyan Li, Lei Hou, Shu Zhao, Jie Tang, Juanzi Li:

RPC-Bench: A Fine-grained Benchmark for Research Paper Comprehension. 27683-27717 - Xiang Wang, Zongtao Yang, Zhuojian Hong, Shuhao Zhang, Wei Wei:

FusionFlow: Enabling Deep Structural Exploration for Automated Agentic Workflow Generation. 27718-27760 - Zhen Yang, Wei Du, Jie Wang, Wenze Zhou, Xiangfeng Meng, Zhengyang Wang, Suping Sun, Ziwei Du, Haodong Zou, Jie Chen, Yongbin Liu, Shicheng Tan, Jiahao Ying, Shu Zhao:

CompTab: A Comprehensive Benchmark for Real-World TableQA with Complex Reasoning and Irregular Tables. 27761-27774 - Jianzhu Bao, Haozhen Zhang, Kuicai Dong, Bozhi Wu, Sarthak Ketanbhai Modi, Zi Pong Lim, Yon Shin Teo, Wenya Wang:

Learning More from Less: Exploiting Counterfactuals for Data-Efficient Chart Understanding. 27775-27797 - Kairui Hu, Penghao Wu, Fanyi Pu, Wang Xiao, Xiang Yue, Bo Li, Yuanhan Zhang, Ziwei Liu:

Video-MMMU: Evaluating Knowledge Acquisition from Multidisciplinary Professional Videos. 27798-27828 - Xueting Li, Qi Liu, Chenghao Xu, Xu Yang, Guangtao Lyu, Jiahua Li, Cheng Deng:

Semantically Comprehensive Token Pruning in LVLMs via Maximizing Concept Coverage. 27829-27846 - Sheng Chen, Tang Zhe, Weixing Zhang, Fei Yang, Yuanyuan Wang, Tianlin Li, Yang Liu:

OptiCo: Adaptive Distributed Training Optimization via Collaborative Agent Reasoning. 27847-27867 - Zhiyu Shen, Ziming Wu, Fuming Lai, Shaobing Lian, Yanghui Rao:

MemBuilder: Reinforcing LLMs for Long-Term Memory Construction via Attributed Dense Rewards. 27868-27887 - Shunian Chen, Xinyuan Xie, Zheshu Chen, Owen Lee, Liyan Zhao, Zhan Su, Qilin Sun, Benyou Wang:

Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion. 27888-27913 - Fengying Ye, Shanshan Wang, Lidia S. Chao, Derek F. Wong:

Probing Semantic Alignment, Lexical Invariance, and Syntactic Influence in LLM Metaphor Processing. 27914-27932 - Weikang Shi, Aldrich Yu, Rongyao Fang, Houxing Ren, Ke Wang, Aojun Zhou, Changyao Tian, Xinyu Fu, Yuxuan Hu, Zimu Lu, Linjiang Huang, Si Liu, Rui Liu, Hongsheng Li:

MathCanvas: Intrinsic Visual Chain-of-Thought for Multimodal Mathematical Reasoning. 27933-27954 - Zeping Li, Hongru Wang, Yiwen Zhao, Guanhua Chen, Yixia Li, Keyang Chen, Yixin Cao, Guangnan Ye, Hongfeng Chai, Zhenfei Yin:

Rethinking the Role of Entropy in Optimizing Tool-Use Behaviors for Large Language Model Agents. 27955-27967 - Zhiqiang Liu, Yichi Zhang, Mengshu Sun, Lei Liang, Wen Zhang:

Collaboration of Fusion and Independence: Hypercomplex-driven Robust Multi-Modal Knowledge Graph Completion. 27968-27983 - Yu-Zheng Lin, Bono Po-Jen Shih, John Paul Martin Encinas, Elizabeth Victoria Abraham Achom, Karan Himanshu Patel, Jesus Horacio Pacheco, Sicong Shao, Jyotikrishna Dass, Soheil Salehi, Pratik Satam:

LLM-MC-Affect: LLM-Based Monte Carlo Modeling of Affective Trajectories and Latent Ambiguity for Interpersonal Dynamic Insight. 27984-28000 - Gerrit Quaremba, Amy Rechkemmer, Elizabeth Black, Denny Vrandecic, Elena Simperl:

Multilingual and Cross-Lingual Citation Needed Detection on Wikipedia for Lower-Resource Languages. 28001-28021 - Raffaele Pisano, Roberto Navigli:

Process Reward Models Meet Planning: Generating Precise and Scalable Datasets for Step-Level Rewards. 28022-28042 - Chunyu Qiang, Xiaopeng Wang, Kang Yin, Yuzhe Liang, Yuxin Guo, Teng Ma, Ziyu Zhang, Tianrui Wang, Cheng Gong, Yushen Chen, Ruibo Fu, Longbiao Wang, Jianwu Dang:

UniSonate: A Unified Model for Speech, Music, and Sound Effect Generation with Text Instructions. 28043-28054 - Bohan Lin, Kuo Yang, Zelin Tan, Yingchuan Lai, Chen Zhang, Guibin Zhang, Xinlei Yu, Miao Yu, Xu Wang, Yu-Dong Zhang, Yang Wang:

AgentAsk: Multi-Agent Systems Need to Ask. 28055-28077 - Zhiyu Shen, Jiyuan Liu, Yunhe Pang, Yanghui Rao, Fu Lee Wang, Jianxing Yu:

HopWeaver: Cross-Document Synthesis of High-Quality and Authentic Multi-Hop Questions. 28078-28109 - Zhuoshi Pan, Qizhi Pei, Yu Li, Zinan Tang, Qiyao Sun, H. Vicky Zhao, Conghui He, Lijun Wu:

REST: Stress Testing Large Reasoning Models by Asking Multiple Problems at Once. 28110-28140 - Ke Yang, Dongyang Liang

, Jing Yu, Shuguang Yuan, Chi Chen:
You Can Have a Second Chance: Unbiased and Multi-bit Watermarking for Diffusion Language Models with Regret-based Remasking. 28141-28160 - Xuan Gong, Senmiao Wang, Hanbo Huang, Ruoyu Sun, Shiyu Liang:

VCORE: Variance-Controlled Optimization-based Reweighting for Chain-of-Thought Supervision. 28161-28180 - Libo Sun, Jiwen Zhang, Siyuan Wang, Zhongyu Wei:

MAGNET: Towards Adaptive GUI Agents with Memory-Driven Knowledge Evolution. 28181-28206 - Xunyi Zhao, Gengze Zhou, Qi Wu:

VLN-MME: Diagnosing MLLMs as Language-guided Visual Navigation Agents. 28207-28231 - Chonghan Qin, Xiachong Feng, Weitao Ma, Xiaocheng Feng, Lingpeng Kong:

ImplicitMemBench: Measuring Unconscious Behavioral Adaptation in Large Language Models. 28232-28261 - Junmyeong Lee, Chan Hur, ChangSu Choi, Sukmin Cho, Fitsum Gaim, Eui Jun Hwang, Hoyun Song, KyungTae Lim:

Semantic Hardness Is Not Visual Hardness: Sign-Aware Hard Negative Mining for Sign Language Retrieval. 28262-28277 - Wenjie Peng, Chen Chen, Thomas Hain:

Difference in Task Performance on Sparse Speech Representations. 28278-28291 - Xiang Long, Yingjie Xia, Li Kuang, Yao Wan, Zihao Liu:

VerilogLAVD: LLM-Aided Pattern Generation for Verilog CWE Detection. 28292-28308 - Yuetai Li, Zhangchen Xu, Fengqing Jiang, Bhaskar Ramasubramanian, Luyao Niu, Bill Yuchen Lin, Xiang Yue, Radha Poovendran:

Temporal Sampling for Forgotten Reasoning in LLMs. 28309-28327 - Kexin Ma, Haotian Wang, Shenglin Chen, Yishuai Cai, Yu Huang, Ruochun Jin:

Conflict-Aware Memory for Embodied Agents: Enhancing Vector Data Quality via Detection Rules. 28328-28347 - Nicholas Moratelli, Christopher Davis, Leonardo F. R. Ribeiro, Bill Byrne, Gonzalo Iglesias:

Benchmarking Deflection and Hallucination in Large Vision-Language Models. 28348-28370 - Qiuyi Qi, Tian Liang, Mutian Bao

, Jinjian Zhang, Dongnan Liu, Wei Zhou, Linjian Mo, Ming Kong, Jie Liu, Feng Zhang, Qiang Zhu:
STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training. 28371-28392 - Jiwei Tang, Shilei Liu, Zhicheng Zhang, Qingsong Lv, Runsong Zhao, Tingwei Lu, Langming Liu, Haibin Chen, Yujin Yuan, Hai-Tao Zheng, Wenbo Su, Bo Zheng:

Read As Human: Compressing Context via Parallelizable Close Reading and Skimming. 28393-28406 - Jiayu Tang, Guowei Peng, Qiuhao Xie, Yuning Yang, Xiurui Xie, Guisong Liu:

OASIS: Mitigating Harmful Fine-tuning Attacks on LLMs via Orthogonal and Adaptive Safety Alignment Strategy. 28407-28421 - Xue Jiang, Ge Li, Jiaru Qian, Xianjie Shi, Chenjie Li, Hao Zhu, Ziyu Wang, Jielun Zhang, Zeyu Zhao, Kechi Zhang, Jia Li, Wenpin Jiao, Zhi Jin, Yihong Dong:

KoCo-Bench: Can Large Language Models Leverage Domain Knowledge in Software Development? 28422-28441 - Pierre Fihey, Matthieu Labeau, Pavlo Mozharovskyi:

Enhancing Two Steps Textual Anomaly Detection through Anisotropy Mitigation. 28442-28464 - Ziyun Zhang, Zezhou Wang, Xiaoyi Zhang, Zongyu Guo, Jiahao Li, Bin Li, Yan Lu:

InfiniteWeb: Scalable Web Environment Synthesis for GUI Agent Training. 28465-28492 - Tang Da Huang, Weidong Tang, Wen Qi Xu, Xianpeng Guo:

MagicBench: Diagnosing Visual Agency Loss and Semantic Dependency in Multimodal LLMs. 28493-28511 - Fei Zhang, Zhe Zhao, Haibin Wen, Tianshuo Wei, Zaixi Zhang, Chao Yang, Ye Wei:

Bloom-Eval: A Hierarchical Evaluation Benchmark for Automatic Survey Generation Based on Bloom's Taxonomy. 28512-28544 - Yuchen Zhang, Yaxiong Wang, Kecheng Han, Yujiao Wu, Lianwei Wu, Li Zhu, Zhedong Zheng:

Cultivating Forensic Reasoning for Generalizable Multimodal Manipulation Detection. 28545-28560 - Donghan Liu, Han Sun, Zhaohui Wang, Qin Li, Min Zhang:

Fair-CCD: Mitigating Bias in Large Language Models for Tabular Classification Through Context-Contrastive Decoding. 28561-28575 - Di Liu, Zheng Fang

, Bin Wu:
DVI-DTM: Dual-View Representation Learning for Interpretable Short Text Dynamic Topic Modeling. 28576-28593 - Hao-Xiang Xu, Chong Deng, Jiaqing Liu, Wen Wang, Qian Chen, Lujia Bao, Xiangang Li, Zhen-Hua Ling:

GenesisFunc: Multi-Agent Data Generation for Accurate and Generalizable Function-Calling. 28594-28616 - Jaeho Han, Jisoo Yang, Hyeondong Woo, Mingyu Jeon, Sunjae Yoon, Junyeong Kim:

Selective Test-Time Debiasing for CLIP via Reward Gating. 28617-28631 - Guirong Chen, Shuqi Ye, Wenkai Yang, Shiqi Shen, Guangyao Shen, Yankai Lin:

CURE: Critique-Driven Unified Reinforcement Learning for Test-Time Self-Improvement. 28632-28653 - Shuai Zhang, Weibo Xu, Jiahao Nie, Kecheng Huang:

LGSA: Label Geometry Structuring and Aligning for Hierarchical Text Classification. 28654-28665 - Yubo Shan, Kun Zhang, Qiming Xu, Liping Cao, Yingying Cao, Jian Zhang, Yu Wang, Jingyuan Li, Yuanzhuo Wang:

FactVerse: A Benchmark for Factual Consistency in Interleaved Image-Text Generation. 28666-28689 - Jiwei Tang, Zhicheng Zhang, Shunlong Wu, Jingheng Ye, Lichen Bai, Zitai Wang, Tingwei Lu, Lin Hai, Yiming Zhao, Hai-Tao Zheng, Hong-Gee Kim:

GMSA: Enhancing Context Compression via Group Merging and Layer Semantic Alignment. 28690-28704 - Mahi Luthra, Jiayi Shen, Maxime Poli

, Angelo Ortiz Tandazo, Yosuke Higuchi, Youssef Benchekroun, Martin Gleize, Charles-Éric Saint-James, Dongyan Lin, Phillip Rust, Angel Villar-Corrales, Surya Parimi, Vanessa Stark, Rashel Moritz, Juan Pino, Yann LeCun, Emmanuel Dupoux:
SpidR-Adapt: A Universal Speech Representation Model for Few-Shot Adaptation. 28705-28728 - Charlotte Noel, Nicholas Asher, Olivier Gouvert, Farah Benamara, Julie Hunter:

EIFFEL: a novel benchmark to measure bias of English heavy training on French idiomatic expressions. 28729-28747 - Zhiwen Luo, Siyu Jiang, Weilong Jiang, Kun He:

Latent Attention Denoising: A Training-Free Energy-Based Framework for Mitigating Hallucinations in Vision-Language Models. 28748-28777 - Yucheng Wang, Shen Yang, Jifan Yu, Haoxuan Li, Joy Lim Jia Yin, Daniel Zhang-Li, Huiqin Liu, Lei Hou, Juanzi Li, Bin Xu:

From Knowing to Teaching: Scaffolding Pedagogical Decisions for LLM Agent. 28778-28801 - Xinmeng Hou, Bohao Qu, Wuqi Wang, Peiliang Gong, Qing Guo, Yang Liu:

Learn Like Humans: Use Meta-cognitive Reflection for Efficient Self-Improvement. 28802-28824 - Fan Liu, Yanhao Wang

, Min Zhang, Zhikang Chen, Zeyuan Li, Lewei He, Jiahui Pan:
Think Faster Than Words: Efficient LLM Chain-of-Thought Reasoning via Dynamic Shortcut Decoding. 28825-28836 - Shufan Yang, Zifeng Cheng, Zhiwei Jiang, Qingfeng Qi, Yafeng Yin, Cong Wang, Ao Zhou, Qing Gu:

AEA: Adaptive Expert Allocation Improves Sentence Embeddings from Mixture-of-Experts LLM. 28837-28851 - Bhawna Piryani, Abdelrahman Abdallah, Jamshid Mozafari, Avishek Anand, Adam Jatowt:

It's High Time: A Survey of Temporal Question Answering. 28852-28881 - Shuang Cheng, Yuhua Jiang, Zineng Zhou, Dawei Liu, Tao Wang, Linfeng Zhang, Biqing Qi, Bowen Zhou:

SDAR-VL: Stable and Efficient Block-wise Diffusion for Vision-Language Understanding. 28882-28901 - Zheyu Lin, Jirui Yang, Yukui Qiu, Yubing Bao, Hengqi Guo, Yao Guan:

N-GLARE: An Non-Generative Latent Representation-Efficient LLM Safety Evaluator. 28902-28923 - Yuzhe Zhang, Xianwei Xue, Xingyong Wu, Mengke Chen, Chen Liu, Xinran He

, Run Shao, Feiran Liu, Huanmin Xu, Qiutong Pan, Haiwei Wang:
Don't Act Blindly: Robust GUI Automation via Action-Effect Verification and Self-Correction. 28924-28941 - Yirui Qi, Xiaoming Zhang, Ruilin Zeng, Mengyao Liu, Ziyi Zhou, Dezhuang Miao, Bingyu Yan, Zhenyu Guan:

Beyond Static Persona Consistency: Dynamic Persona Coherence in LLM Role-Playing. 28942-28956 - Dong Yan, Jian Liang, Yanbo Wang, Shuo Lu, Ran He, Tieniu Tan:

What If Consensus Lies? Selective-Complementary Reinforcement Learning at Test Time. 28957-28970 - Yi Han, Haiqi Lu, Lizi Liao, Shuhan Zhou, Yuanxing Liu, Weinan Zhang, Ting Liu:

Exploring and Distilling Multi-Dimensional Clues for Interpretable Social Bot Detection. 28971-28992 - Zhou Ziheng, Huacong Tang, Mingjie Bi, Wanying He, Fang Sun, Yizhou Sun, Ying Nian Wu, Demetri Terzopoulos, Yipeng Kang, Fangwei Zhong:

Why Are We Moral? An LLM-based Agent Simulation Approach to the Study of Moral Evolution. 28993-29046 - Doreen Osmelak, Yang Xu, Michael Hahn, Kate McCurdy:

Systematicity between Forms and Meanings across Languages Supports Efficient Communication. 29047-29083 - Zhengyi Li, Yakai Wang, Jingwen Leng, Kang Yang, Yu Yu, Jiaping Gui, Yu Feng, Ning Liu, Minyi Guo:

On the (In-)Security of the Shuffling Defense in the Transformer Secure Inference. 29084-29098 - Yingen Liu, Fan Wu, Xuyan Pan, Ruihui Li, Zhuo Tang, Kenli Li:

LaCo: Layer-wise Compensation for Pruned Large Language Models. 29099-29113 - Changxin Ke, Rui Zhang, Jiaming Guo, Yuanbo Wen, Li Ding, Shuo Wang, Xuyuan Zhu, Xiong Peng, Di Huang, Zidong Du, Xing Hu, Qi Guo, Yunji Chen:

QiMeng-PRepair: Precise Code Repair via Edit-Aware Reward Optimization. 29114-29129 - Guy Mor-Lan, Omer Goldman, Matan Eyal, Adi Mayrav Gilady, Sivan Eiger, Idan Szpektor, Avinatan Hassidim, Yossi Matias, Reut Tsarfaty:

Location Not Found: Exposing Implicit Local and Global Biases in Multilingual LLMs. 29130-29150 - Xinyu Chen, Peifeng Li, Qiaoming Zhu:

Incorporating Temporal Coherence to Cross-Document Event Coreference Resolution. 29151-29168 - Priyanshu Mahato

, Aniket Santosh Mishra
, Kripabandhu Ghosh:
LLMs in Sarcasm Detection? It's elementary! (Or is it?). 29169-29199 - Xiang Cheng, Yulan Hu, Xiangwen Zhang, Lu Xu, Lide Tan, Zheng Pan, Xin Li, Yong Liu:

Beyond Itinerary Planning - A Real-World Benchmark for Multi-Turn and Tool-Using Travel Tasks. 29200-29251 - Weicheng Lin, Yi Zhang, Jiawei Dang, Liang-Jie Zhang:

TLoRA: Task-aware Low Rank Adaptation of Large Language Models. 29252-29269 - Dawei Wang, Di Zhao, Xinyuan Liu, Marci Chi Ma, Xiaoyang Liu, Chengming Zhou, Gary Ushaw, Richard Davison:

MARS-RA: Rank Aggregation for Credit Assignment via Multimodal Comparisons in Embodied Multi-Agent Cooperation. 29270-29289 - Yuqin Yang, Haowu Zhou, Haoran Tu, Zhiwen Hui, Shiqi Yan, HaoYang Li, Dong She, Xianrong Yao, Yang Gao, Zhanpeng Jin:

Persona-E²: A Human-Grounded Dataset for Personality-Shaped Emotional Responses to Textual Events. 29290-29315 - Shuai Dong, Siyuan Wang, Xingyu Liu, Chenglin Li, Haowen Hou, Zhongyu Wei:

Interleaved Latent Visual Reasoning with Selective Perceptual Modeling. 29316-29335 - Pengna Li, Kangyi Wu, Shaoqing Xu, Fang Li, Lin Zhao, Long Chen, Zhi-Xin Yang, Nanning Zheng:

Think before Go: Hierarchical Reasoning for Image-goal Navigation. 29336-29357 - Donghyun Kim, Hyeongjun Yang, Seokju Hwang, Kyong-Ho Lee, Chanhee Lee:

LLMs as Knowledge Graph Refiners: Mitigating Factual Inconsistencies in Generative Knowledge Extraction. 29358-29378 - Yuzhe Zhang, Feiran Liu, Yi Shan

, Xinyi Huang, Xin Yang, Yueqi Zhu, Xuxin Cheng, Cao Liu, Ke Zeng, Terry Jingchen Zhang, Wenyuan Jiang:
SILO-BENCH: A Scalable Environment for Evaluating Distributed Coordination in Multi-Agent LLM Systems. 29379-29398 - Yuxuan Si, Zheqi Lv, Chengxi Zang, Zhengyu Chen, Fei Wu:

Mitigating Structural Knowledge Collapse in Domain-Specific LLMs via Morpheme-Aware KV-Aggregation. 29399-29413 - Zehan Li, Fu Zhang, Zhijun Liu, Jingwei Cheng:

Zero-shot Jianzi Recognition as Structured Visual Information Extraction in Open Compositional Symbolic Systems. 29414-29429 - Jakob Schuster, Vagrant Gautam, Katja Markert:

Whose Facts Win? LLM Source Preferences under Knowledge Conflicts. 29430-29459 - Jiuheng Lin, Cong Jiang, Zirui Wu, Jiarui Sun, Yansong Feng:

CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts. 29460-29480 - Chenhui Mao, Yuanting Lei, Zhixiang Wei, Ming Liang, Zhixiang Wang, Jingxuan Xu, Dajun Chen, Wei Jiang, Yong Li:

EGSS: Entropy-guided Stepwise Scaling for Reliable Software Engineering. 29481-29499 - Xiaohao Luo, Ying Wei, Rui Zhao:

Detecting What Queries Seek: Steering LLM Safety with FFN Output Activation Monitoring. 29500-29514 - Shihao Liu

, Xiaofei Zhou, Bo Wang, Geyuan Zhang:
Temporal Evidence Chain for Temporal Knowledge Graph Question Answering with Large Language Models. 29515-29529 - Jayeol Chun, Nianwen Xue:

Modal Dependency Parsing as Structured Prediction over Source-Cue Scope. 29530-29540 - Yawen Wang, Yihan Dai, Jianming Chen, Junjie Wang, Qing Wang:

DEFT: Demystifying VLN Failures via a Unified Dual-View Explainability Framework for LLM-based Agents. 29541-29560 - Minghan Li, Tianrui Lv, Chao Zhang, Guodong Zhou:

GLIER: Generative Legal Inference and Evidence Ranking for Legal Case Retrieval. 29561-29572 - Alessio Cocchieri, Luca Ragazzi, Giuseppe Tagliavini, Gianluca Moro:

LLMs (Almost) Never Abstain Under Medical Uncertainty. 29573-29613 - Ricardo Rei, Nuno Miguel Guerreiro, José Pombal, João Alves, M. Amin Farajian, Pedro Teixeirinha, André F. T. Martins:

TOWER+: Bridging Generality and Translation Specialization in Multilingual LLMs. 29614-29635 - Zekun Yuan, Yangfan Ye, Xiaocheng Feng, Baohang Li, Qichen Hong, Yunfei Lu, Dandan Tu, Bing Qin:

Culture-Aware Machine Translation in Large Language Models: Benchmarking and Investigation. 29636-29661 - Zhihao Shuai, Yiyun Chen, Maolin Ma, Yutong Chen, Hanjia Qiu, Jing Xu, Ziye Chen, Weikai Yang:

Learning from Near-Misses: Error-Aware Contrastive Few-Shot Learning for NL2Formula. 29662-29676 - Xuwen Zhou, Fangxin Liu, Chao Wang, Xiao Zheng, Hao Zheng, Min He, Li Jiang, Haibing Guan:

Calibrated Speculative Decoding: Frequency-Guided Candidate Selection for Efficient Inference. 29677-29688 - Tian Xueyun, Minghua Ma, Bingbing Xu, Nuoyan Lyu, Wei Li, Heng Dong, Zheng Chu, Yuanzhuo Wang, Huawei Shen:

Learning from Mistakes: Negative Reasoning Samples Enhance Out-of-Domain Generalization. 29689-29711 - Ning Li, Zheng Zhang, Zhenya Huang, Rui Li, Yi Zhan, Yinbo Luo

, Qi Liu, Enhong Chen:
LongTutor: Benchmarking Large Language Models for Long-term Personalized Tutoring. 29712-29737 - Wensheng Lu, Keyu Chen, Zhifeng Shen, Ruizhi Qiao, Xing Sun:

HiChunk: Evaluating and Enhancing Retrieval Augmented Generation with Hierarchical Chunking. 29738-29753 - Kushal Tatariya

, Artur Kulmizev, Wessel Poelman, Esther Ploeger
, Marcel Bollmann, Johannes Bjerva
, Jiaming Luo, Heather C. Lent, Miryam de Lhoneux:
How Good is Your Wikipedia? Auditing Data Quality for Low-resource and Multilingual NLP. 29754-29774 - Jiayi Zhang, Shu Yang, Junchao Wu, Derek F. Wong, Di Wang:

Understanding and Mitigating Political Stance Cross-topic Generalization in Large Language Models. 29775-29797 - Ruihan Chen, Qiming Li, Xiaocheng Feng, Weihong Zhong, Xiaoliang Yang, Yuxuan Gu, Zekun Zhou, Yunfei Lu, Haoyu Ren, Kun Chen, Dandan Tu, Bing Qin:

MPR-GUI: Benchmarking and Enhancing Multilingual Perception and Reasoning in GUI Agents. 29798-29832 - Teng Pan, Yuchen Yan, Zixuan Wang, Ruiqing Zhang, Guiyang Hou, Wenqi Zhang, Weiming Lu, Jun Xiao, Yongliang Shen:

CoVerRL: Breaking the Consensus Trap in Label-Free Reasoning via Generator-Verifier Co-Evolution. 29833-29853 - Simon Ostermann, Daniil Gurgurov, Tanja Baeumel, Michael A. Hedderich, Sebastian Lapuschkin, Wojciech Samek, Vera Schmitt:

From Weights to Activations: Is Steering the Next Frontier of Adaptation? 29854-29879 - Lirong Gao, Zeqing Wang, Yuyan Cai, Jiayi Deng, Yanmei Gu, Yiming Zhang, Jia Zhou, Yanfei Zhang, Junbo Zhao:

Can LLMs Act as Historians? Evaluating Historical Research Capabilities of LLMs via the Chinese Imperial Examination. 29880-29911 - Chenyuan Zhang, Qiguang Chen, Xie Chen, Zhuotao Tian, Bowen Xing, Meishan Zhang, Libo Qin, Baotian Hu, Min Zhang:

Less Languages, Less Tokens: An Efficient Unified Logic Cross-lingual Chain-of-Thought Reasoning Framework. 29912-29929 - Youngji Roh, Hyunjin Cho, Jaehyung Kim:

Embracing Anisotropy: Turning Massive Activations into Interpretable Control Knobs for Large Language Models. 29930-29956 - Jiawei Liu

, Xun Gong, Muli Yang, Xingrui Yu, Fen Fang, Xulei Yang, Ivor W. Tsang, Yunfeng Hu, Hong Chen, Qing Guo:
From Language to Driving: A Dual-Loop SLM-Enhanced Framework for Multi-Planner Scheduling via a Domain-Specific Language. 29957-29973 - Shunwen Bai, Jiahuan Zhang, Haoran Huang, Yurun Wang, Jiale Liu, Yanxi Wu, Ningzhe Yu, Yudong Gao, Mingjun Cheng:

One Cognitive Loop Is Enough: SODA unlocks Pure-Text Spatial Reasoning in Large Language Models. 29974-29996 - Yucheng Zhou, Junwei Sheng, Qianning Wang, Jianbing Shen:

Compatibility-Aware Dynamic Fine-Tuning for Large Language Models. 29997-30008 - Chi Zhang, Mengqi Zhang, Xiaotian Ye, Runxi Cheng, Zisheng Zhou, Ying Zhou, Pengjie Ren, Zhumin Chen:

Spectral Characterization and Mitigation of Sequential Knowledge Editing Collapse. 30009-30032 - Omar Naim, Swarnadeep Bhar, Jérôme Bolte, Nicholas Asher:

SSA: Improving Performance With a Better Scoring Function. 30033-30051 - Jiawei Li, Yang Gao, Huashan Sun, Chong Feng:

Think Better, Not Longer: Token-Level Marginal Utility for Efficient Reasoning in Large Reasoning Models. 30052-30063 - Yulang Chen, Haoxuan Peng

, Jinyan Liu, Zichen Wen, Dongrui Liu, Linfeng Zhang:
AgentSlimming: Towards Efficient and Cost-Aware Multi-Agent Systems. 30064-30086 - Shuai Ling, Lizi Liao, Dongmei Jiang, Weili Guan:

Reusable Experiences: Latent Routing and Modular Composition in LLMs. 30087-30100 - Brendon Boldt, David R. Mortensen:

Communicating in Emergent Language with an Induced Morphological Phrasebook. 30101-30121 - Zheng Zhang, Qi Liu, Siyuan Liang, Ning Li, Zirui Hu, Weibo Gao, Rui Li, Zhenya Huang, Leszek Rutkowski, Baosheng Yu, Dacheng Tao:

Controllable Contamination Detection for Reliable LLM Evaluation with Statistical Guarantees. 30122-30143 - Jia-Nan Li, Jian Guan, Songhao Wu, Wei Wu, Rui Yan:

From 1, 000, 000 Users to Every User: Scaling Up Personalized Preference for User-level Alignment. 30144-30168 - Mengxiao Zhu, Haixu Chen, Jiu Sha, Jie Liu, Ge Shi:

Beyond Atomic Characters: Glyph-Aware Sub-character Alignment for Low-Resource Multilingual OCR. 30169-30185 - Chao Xue, Yao Wang, Mengqiao Liu, Di Liang, Xingsheng Han, Peiyang Liu, Xianjie Wu, Chenyao Lu, Lei Jiang, Yu Lu, Haibo Shi, Shuang Liang, Minlong Peng, Flora D. Salim:

Why Supervised Fine-Tuning Fails to Learn: A Systematic Study of Incomplete Learning in Large Language Models. 30186-30213 - Tingyu Wu, Zhisheng Chen, Ziyan Weng, Shuhe Wang, Shuo Zhang, Sen Hu, Silin Wu, Qizhen Lan, Huacan Wang, Ronghao Chen:

KnowMe-Bench: Benchmarking Person Understanding for Lifelong Digital Companions. 30214-30238 - Federico Ravenda, Seyed Ali Bahrainian, Daniele Montagnani, Antonietta Mira, Andrea Raballo:

PersonalityDBench: A Dataset for Personality Disorders - from Modeling to Controlled Generation. 30239-30259 - Lirong Gao, Zewei Yu, Zhongrui Yin, Qi Zhang, Yuke Zhu, Bo Zheng, Haobo Wang, Junbo Zhao, Gang Chen, Sheng Guo:

Towards Interpretable Tabular Reasoning: Enhancing LLM Reasoning on Tabular Data with Pre-Constructed Logic Graph. 30260-30280 - Wentao Zhang, Yan Zhuang, ZhuHang Zheng, Mingfei Zhang, Jiawen Deng, Fuji Ren:

Beyond Explicit Refusals: Soft-Failure Attacks on Retrieval-Augmented Generation. 30281-30302 - Runhuai Chen, Dian Shen, Dandan Zhang, Kaihong Huang, Linghui Meng, Beilun Wang:

Compressing LLM Knowledge into Graph Representations for Text-attributed Graphs Learning. 30303-30318 - Guanzhong Chen, Shaoxiong Yang, Chao Li, Wei Liu, Jian Luan, Zenglin Xu:

End-to-End Optimization of LLM-Driven Multi-Agent Search Systems via Heterogeneous-Group-Based Reinforcement Learning. 30319-30338 - Yongshi Ye, Biao Fu, Chongxuan Huang, Yidong Chen, Xiaodong Shi:

Translation with Thought: Difficulty-Adaptive Reasoning via Reinforcement Learning for Multi-Domain Machine Translation. 30339-30370 - Zifan Jiang, Youngjoon Jang, Liliane Momeni, Gül Varol, Sarah Ebling, Andrew Zisserman:

Segment, Embed, and Align: A Universal Recipe for Aligning Subtitles to Signing. 30371-30384 - Gouki Minegishi, Hiroki Furuta, Takeshi Kojima, Yusuke Iwasawa, Yutaka Matsuo:

Understanding Emergent Misalignment via Feature Superposition Geometry. 30385-30414 - ZhenChun Xu, Yi Cai, Dajun Zheng, Li Yuan, Mengchen Zhao, Qixiang Wang, Jiexin Wang:

MavenCoder: Competitive Code Generation via Model Adaptive Planning Strategies and Multi-Perspective Verification Enhancement. 30415-30439 - Xin Guan, Zijian Li, Shen Huang, Pengjun Xie, Jingren Zhou, Jiuxin Cao:

Evidence-Augmented Policy Optimization with Reward Co-Evolution for Long-Context Reasoning. 30440-30454 - Jingchun Lian, Lingyu Liu, Yaxiong Wang, Yujiao Wu, Lianwei Wu, Li Zhu, Zhedong Zheng:

Generating Attribution Reports for Manipulated Facial Images: A Dataset and Baseline. 30455-30473 - Yuhang Wu, Xiangqing Shen, Fanfan Wang, Cangqi Zhou, Zhen Wu, Xinyu Dai, Rui Xia:

Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning. 30474-30490 - Junjun Pan, Yixin Liu, Rui Miao, Kaize Ding, Yu Zheng, Quoc Viet Hung Nguyen, Alan Wee-Chung Liew, Shirui Pan:

Explainable and Fine-Grained Safeguarding of LLM Multi-Agent Systems via Bi-Level Graph Anomaly Detection. 30491-30506 - Miaomiao Li, Hao Chen, Yang Wang, Tingyuan Zhu, Weijia Zhang, Kaijie Zhu, Kam-Fai Wong, Jindong Wang:

Understanding and Mitigating Bias Inheritance in LLM-based Data Augmentation on Downstream Tasks. 30507-30533 - Xiaoyang Yi, Jing Chen, Li Peng, Yuru Bao, Jian Zhang:

Beyond the Panorama: Training-Free Hierarchical Perception-Reasoning for Fine-Grained Vision in MLLMs. 30534-30549 - Luoming Hu, Liang Yang, Jingjie Zeng, Zijie Xing:

To Judge or Not to Judge: Can Large Language Models Leverage the Dispute Focus in Legal Judgment? 30550-30571 - Sungkyu Yang, Kang-Min Kim

, Mansu Kim:
CPR-RAG: Clinical Prior-Regularized Retrieval for Anatomy-Aware 3D CT Report Generation. 30572-30587 - Jin Zhao, Marta Knezevic, Tanja Käser:

Evaluating Answer Leakage Robustness of LLM Tutors against Adversarial Student Attacks. 30588-30617 - Jessica Lin, Amir Zeldes:

Expect the Unexpected? Testing the Surprisal of Salient Entities. 30618-30629 - Bojun Jin, Jianzhu Bao, Yang Sun, Yice Zhang, Ruifeng Xu:

ArgGenBench: Benchmarking the Complex Controlled Argument Generation Capability of Large Language Models. 30630-30662 - Michal Stefánik, Timothee Mickus, Marek Kadlcík, Bertram Højer, Michal Spiegel, Raúl Vázquez, Aman Sinha, Josef Kuchar, Philipp Mondorf, Pontus Stenetorp:

Language Models Learn Universal Representations of Numbers and Here's Why You Should Care. 30663-30681 - Eric Onyame, Akash Ghosh, Subhadip Baidya, Sriparna Saha, Xiuying Chen, Chirag Agarwal:

CURE-Med: Curriculum-Informed Reinforcement Learning for Multilingual Medical Reasoning. 30682-30703 - Xiaoyue Lu, Xianglin Yang, Haijun Liu, Jiahao Liu, Kuntai Cai, Yan Xiao, Jin Song Dong:

Inverting the Shield: Systematically Generating Safety Tests from Policy Specifications. 30704-30731 - Zhanyu Liu, Qingguo Hu, Ante Wang, Chenqing Liu, Zhishang Xiang, Hui Li, Delai Qiu, Jinsong Su:

HEALing Entropy Collapse: Enhancing Exploration in Few-Shot RLVR via Hybrid-Domain Entropy Dynamics Alignment. 30732-30748 - Janvijay Singh, Dilek Hakkani-Tür:

Do LLMs Encode Functional Importance of Reasoning Tokens ? 30749-30773 - Yixuan Nan, Xixun Lin, Yanmin Shang, Ge Zhang, Zheng Fang, Fang Fang, Yanan Cao:

EA-Agent: A Structured Multi-Step Reasoning Agent for Entity Alignment. 30774-30787 - Arya Shah, Deepali Mishra, Chaklam Silpasuwanchai:

Too Nice to Tell the Truth: Quantifying Agreeableness-Driven Sycophancy in Role-Playing Language Models. 30788-30801 - Jihao Gu, Qihang Ai, Yingyao Wang, Pi Bu, Jingxuan Xing, Yue Cao, Zekun Zhu, Wei Jiang, Ziming Wang, Yingxiu Zhao, Ming-Liang Zhang, Jun Song, Yuning Jiang, Bo Zheng:

Mobile-R1: Towards Interactive Capability for VLM-Based Mobile Agent via Systematic Training. 30802-30820 - Songxin Qu, Tai-Ping Sun, Yun-Jie Wang, Huan-Yu Liu, Cheng Xue, Xiao-Fan Xu, Han Fang, Yang Yang, Yu-Chun Wu, Guo-Ping Guo, Zhao-Yun Chen:

QuantumQA: Enhancing Scientific Reasoning via Physics-Consistent Dataset and Verification-Aware Reinforcement Learning. 30821-30845 - Ying He, Sihang Jiang, Xingzhou Chen, Zhouhong Gu, Yiwei Gu, Minggui He, Shimin Tao, Hongxia Ma, Yanghua Xiao:

The "Knowledge-Behavior Gap" in Cultural Taboo Safety of Large Language Models. 30846-30866 - Xianjing Han, Bin Zhu, Shiqi Hu, Franklin Mingzhe Li, Patrick Carrington, Roger Zimmermann, Jingjing Chen:

OSCBench: Benchmarking Object State Change in Text-to-Video Generation. 30867-30884 - Philipp Seeberger, Steffen Freisinger, Tobias Bocklet, Korbinian Riedhammer:

Evaluation Pitfalls and Challenges in Multimedia Event Extraction. 30885-30900 - Xiaoquan Yi, Haixing Wu, Haozhao Wang, Yichen Li, Yuhua Li, Rui Zhang, Ruixuan Li:

UMPIRE: Unveiling LLM-generated Posts via Redundant Expressions. 30901-30913 - Sirry Chen, Jieyi Wang, Wei Chen, Zhongyu Wei:

SpeechMedAssist: Efficiently and Effectively Adapting Speech Language Models for Medical Consultation. 30914-30935 - Ahao Liu, Haitong Yang, Chuanrong Wang:

An Experimental Study on the Influence of Culture on Cross-Lingual Sentiment Transfer. 30936-30955 - Tobias Schreieder

, Tim Schopf, Michael Färber:
Attribution, Citation, and Quotation: A Survey of Evidence-based Text Generation with Large Language Models. 30956-31000 - Xiangyu Wu, Yuwei Hu, Tianyu Cui, Yueying Tian, Qingguo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang, Yang Yang, Jianfeng Lu:

MirrorCAPTCHA: Wild CAPTCHA, Wild Distribution, Wild Web-based Platform Meet Multimodal LLM Agents. 31001-31017 - Zhezheng Hao, Hong Wang, Jian Luo, Jianqing Zhang, Yuyan Zhou, Qiang Lin, Can Wang, Hande Dong, Jiawei Chen:

ReCreate: Reasoning and Creating Domain Agents Driven by Experience. 31018-31046 - Arkadiusz Modzelewski, Pawel Golik, Anna Kolos, Giovanni Da San Martino:

Can AI-Generated Persuasion Be Detected? Persuaficial Benchmark and AI vs. Human Linguistic Differences. 31047-31072 - Mingqian Ding, Jianjun Li, Wenqi Yang, Zhibo Zhang, Yushen Fang:

GASE: Graph-Aware Semantic Embedding Learning with Frozen LLMs for Text-Attributed Graphs. 31073-31086 - Gorjan Radevski, Kiril Gashteovski, Giwon Hong, Carolin Lawrence, Goran Glavas:

Compositional Steering of Large Language Models with Steering Tokens. 31087-31104 - Zhezheng Hao, Hong Wang, Haoyang Liu, Jian Luo, Jiarui Yu, Hande Dong, Qiang Lin, Can Wang, Jiawei Chen:

Rethinking Entropy Interventions in RLVR: An Entropy Change Perspective. 31105-31133 - Michelle Wastl, Jannis Vamvas, Rico Sennrich:

SwissGov-RSD: A Human-annotated, Cross-lingual Benchmark for Token-level Recognition of Semantic Differences Between Related Documents. 31134-31163 - Haolei Xu, Haiwen Hong, Hongxing Li, Rui Zhou, Yang Zhang, Longtao Huang, Hui Xue, Yongliang Shen, Weiming Lu, Yueting Zhuang:

Seeing but Not Thinking: Routing Distraction in Multimodal Mixture-of-Experts. 31164-31178 - Junyi Zhou, Qiyuan Zhang, Yufei Wang, Fuyuan Lyu, Yidong Ming, Can Xu, Qingfeng Sun, Kai Zheng, Peng Kang, Xue Liu, Chen Ma:

RubricBench: Aligning Model-Generated Rubrics with Human Standards. 31179-31200 - Wenhao Yuan, Chenchen Lin, Jian Chen, Jinfeng Xu, Xuehe Wang, Edith Cheuk-Han Ngai:

Verify Before You Commit: Towards Faithful Reasoning in LLM Agents via Self-Auditing. 31201-31225 - Tianyu Huang, Yida Zhao, Chuyan Zhou, Kewei Tu:

GiLT: Augmenting Transformer Language Models with Dependency Graphs. 31226-31237 - Ishan Kavathekar, Hemang Jain, Ameya Rathod, Ponnurangam Kumaraguru, Tanuja Ganu:

TAMAS: Benchmarking Adversarial Risks in Multi-Agent LLM Systems. 31238-31268 - Ziwen Xu, Kewei Xu, Haoming Xu, Haiwen Hong, Longtao Huang, Hui Xue, Ningyu Zhang, Yongliang Shen, Guozhou Zheng, Huajun Chen, Shumin Deng:

How Controllable Are Large Language Models? A Unified Evaluation across Behavioral Granularities. 31269-31299 - Zelin Tan, Hejia Geng, Xiaohang Yu, Mulei Zhang, Guancheng Wan, Yifan Zhou, Qiang He, Xiangyuan Xue, Heng Zhou, Yutao Fan, Zhong-Zhi Li, Zaibin Zhang, Guibin Zhang, Chen Zhang, Zhenfei Yin, Philip Torr, Lei Bai:

Scaling Behaviors of LLM Reinforcement Learning Post-Training: An Empirical Study in Mathematical Reasoning. 31300-31319 - Sunzhu Li, Jiale Zhao, Huimin Ren

, Zhenlin Wei, Yang Zhou, Jingwen Yang, Shunyu Liu, Kaike Zhang, Chen Wei:
RubricHub: A Comprehensive and Highly Discriminative Rubric Dataset via Automated Coarse-to-Fine Generation. 31320-31344 - Bingbing Wang, Zhengda Jin, Bin Liang, Wenjie Li, Jing Li, Ruifeng Xu, Min Zhang:

MIND Your Reasoning: A Meta-Cognitive Intuitive-Reflective Network for Dual-Reasoning in Multimodal Stance Detection. 31345-31355 - Kedi Chen, Dezhao Ruan, Yuhao Dan, Yaoting Wang, Siyu Yan, Xuecheng Wu, Yinqi Zhang, Qin Chen, Jie Zhou, Liang He, Biqing Qi, Linyang Li, Qipeng Guo, Xiaoming Shi, Wei Zhang:

A Survey of Inductive Reasoning for Large Language Models. 31356-31382 - Haibo Tong, Zeyang Yue, Feifei Zhao, Erliang Lin, Lu Jia, Ruolin Chen, Yinqian Sun, Qian Zhang, Yi Zeng:

CogToM: A Comprehensive Theory of Mind Benchmark inspired by Human Cognition for Large Language Models. 31383-31425 - Chenghao Zhang, Qingqing Long, Ludi Wang, Wenjuan Cui, Jianjun Yu, Yi Du:

CITE: Benchmarking Heterogeneous Text-Attributed Graph Models. 31426-31448 - Weihai Lu, Zhejun Zhao, Yanshu Li, Huan He:

MM-StanceDet: Retrieval-Augmented Multi-modal Multi-agent Stance Detection. 31449-31464 - Xianda Zheng, Zijian Huang

, Meng-Fen Chiang, Jiamou Liu, Yuan Fang, Michael J. Witbrock, Kaiqi Zhao:
Disentangling Reasoning Logic to Resolve Explicit Knowledge Conflicts. 31465-31478 - Yufei Shi, Qian Chen, Wen Wang, Xiangang Li, Zhen-Hua Ling, Yang Ai:

UniVocal: Unified Speech-Singing Code-Switching Synthesis. 31479-31496 - Yuquan Wang, Mi Zhang, Yining Wang, Geng Hong, Mi Wen, Xiaoyu You, Min Yang:

ReasoningGuard: Safeguarding Large Reasoning Models with Inference-time Safety Aha Moments. 31497-31526 - Dingyu Yao, Chenxu Yang, Zhengyang Tong, Zheng Lin, Wei Liu, Jian Luan, Weiping Wang:

VecInfer: Efficient LLM Inference with Low-Bit KV Cache via Outlier-Suppressed Vector Quantization. 31527-31543 - Tongyao Zhu, Huang Chao Ming, Min-Yen Kan:

When Does Mixing Help? Analyzing Query Embedding Interpolation in Multilingual Dense Retrieval. 31544-31562 - Fangyuan Li

, Pengfei Li, Shijie Wang, Junqi Gao, Jianxing Liu, Biqing Qi, Yuqiang Li:
WIST: Web-Grounded Iterative Self-Play Tree for Domain-Targeted Reasoning Improvement. 31563-31585 - Chau Minh Pham, Jenna Russell, Dzung Pham, Mohit Iyyer:

Frankentext: Stitching random text fragments into long-form narratives. 31586-31625 - Chenxi Lin, Zhuoren Jiang, Kaisong Song, Yiquan Wu:

SAFO: Stable Adaptive Fairness Optimization for LLM-Based Social Survey Simulation. 31626-31654 - Giulio Zhou, Tsz Kin Lam, Alexandra Birch, Barry Haddow:

The Prosody of Emojis. 31655-31671 - Wonjin Lee, Kyumin Kim, Sungjae Lee, Jihun Lee, Kwang In Kim:

Piece of Table: A Divide-and-Conquer Approach for Selecting Subtables in Table Question Answering. 31672-31688 - Yitong Zhu, Yuxuan Jiang, Guanxuan Jiang, Bojing Hou, Peng Yuan Zhou, Ge Lin, Yuyang Wang:

QA-MoE: Towards a Continuous Reliability Spectrum with Quality-Aware Mixture of Experts for Robust Multimodal Sentiment Analysis. 31689-31703 - Junzhe Wang, Zhiheng Xi, Yajie Yang, Hao Luo, Shihan Dou, Tao Gui, Qi Zhang:

Enhancing LLM-based Search Agents via Contribution Weighted Group Relative Policy Optimization. 31704-31718 - Ziwen Xu, Chenyan Wu, Hengyu Sun, Haiwen Hong, Mengru Wang, Yunzhi Yao, Longtao Huang, Hui Xue, Shumin Deng, Zhixuan Chu, Huajun Chen, Ningyu Zhang:

Why Steering Works: Toward a Unified View of Language Model Parameter Dynamics. 31719-31736 - Yunbo Long, Yuhan Liu, Liming Xu:

EmoMAS: Emotion-Aware Multi-Agent System for High-Stakes Edge-Deployable Negotiation with Bayesian Orchestration. 31737-31773 - Akriti Jain, Anish Mulay, Divyansh Verma, Aishani Pandey, Pritika Ramu, Aparna Garimella:

Decisive: Guiding User Decisions with Optimal Preference Elicitation from Unstructured Documents. 31774-31786 - T. Y. S. S. Santosh:

From Naturalness to Norms: Interactional Cultural Competence for SpeechLMs. 31787-31802 - Linfeng Du, Ye Yuan, Zichen Zhao, Fuyuan Lyu, Emiliano Penaloza, Xiuying Chen, Zipeng Sun, Jikun Kang, Laurent Charlin, Xue Liu, Haolun Wu:

Optimizing User Profiles via Contextual Bandits for Retrieval-Augmented LLM Personalization. 31803-31817 - Yuxuan Ye, Raúl Santos-Rodríguez, Edwin Simpson:

Teaching Language Models to Check Grounded Claim Factuality with Human Test-Taking Strategies. 31818-31834 - Xianda Zheng, Huan Gao, Meng-Fen Chiang, Michael J. Witbrock, Kaiqi Zhao, Shangyang Li

:
Evo-PI: Aligning Medical Reasoning via Evolving Principle-Guided Supervision. 31835-31850 - Jingxuan Chen, Mohammad Taher Pilehvar, José Camacho-Collados:

Understanding LLM Performance Degradation in Multi-Instance Processing: The Roles of Instance Count and Context Length. 31851-31884 - Lingrui Mei, Shenghua Liu, Yiwei Wang, Yuyao Ge, Baolong Bi, Jiayu Yao, Jun Wan, Ziling Yin, Jiafeng Guo, Xueqi Cheng:

Gated Differentiable Working Memory for Long-Context Language Modeling. 31885-31913 - Zain Muhammad Mujahid, Dustin Wright, Isabelle Augenstein:

Stress Testing Factual Consistency Metrics for Long-Document Summarization. 31914-31933 - Yilong Liu, Xixun Lin, Pengfei Cao, Ge Zhang, Fang Fang, Yanan Cao:

Do LLMs Know Tool Irrelevance? Demystifying Structural Alignment Bias in Tool Invocations. 31934-31958 - ZhiYan Hou, Haiyun Guo, Haokai Ma, Yandu Sun, Yonghui Yang, Jinqiao Wang:

PASs-MoE: Mitigating Misaligned Co-drift among Router and Experts via Pathway Activation Subspaces for Continual Learning. 31959-31972 - Zhaoheng Huang, Yutao Zhu, Ji-Rong Wen, Zhicheng Dou:

LLM-Generated Text May Harm Your Retrieval! A Robust Detection Strategy for Retrieval-Augmented Generation. 31973-31988 - Yanning Su, Yuhang Zhou, Yang Fang, Sen Liu, Guangnan Ye, Hongfeng Chai:

GQLBench: A Large-Scale Cross-Domain, Cross-Dialect Benchmark for NL2GQL. 31989-32014 - Zhuofeng Li, Yi Lu, Dongfu Jiang, Haoxiang Zhang, Yuyang Bai, Chuan Li, Yu Wang, Shuiwang Ji, Jianwen Xie, Yu Zhang:

ReviewGrounder: Improving Review Substantiveness with Rubric-Guided, Tool-Integrated Agents. 32015-32044 - Shu Zhou

, Jinman Leng, Yufei Song, Xin Wang, Tao Fan, Hao Wang:
The Retrieval Bottleneck: Scaling Laws for Reinforcement Learning in RAG. 32045-32069 - Jianqi Gao, Hang Yu, Jian Cao, Ranran Bu, Jinghua Tang, Nengjun Zhu, Yonggang Zhang:

Generating then Refining for Reliable Knowledge Base Question Answering. 32070-32087 - Shiyu He, Minchi Kuang, Mengxian Wang, Bin Hu, Tingxiang Gu:

EvoSpark: Endogenous Interactive Agent Societies for Unified Long-Horizon Narrative Evolution. 32088-32107 - Chengran Yang, Ting Zhang, Jinfeng Jiang, Xin Zhou, Haoye Tian, Mingzhe Du, Jieke Shi, Junkai Chen, Yikun Li, Eng Lieh Ouh, Lwin Khin Shar, David Lo:

SeCuRepair: Semantics-Aligned, Curriculum-Driven, and Reasoning-Enhanced Vulnerability Repair Framework. 32108-32123 - Lingrui Mei, Shenghua Liu, Yiwei Wang, Baolong Bi, Ruibin Yuan, Xueqi Cheng:

HiddenGuard: Fine-Grained Safe Generation with Specialized Representation Router. 32124-32156 - Mohamed Aghzal, Gregory J. Stein, Ziyu Yao

:
Why Do LLM-based Web Agents Fail? A Hierarchical Planning Perspective. 32157-32180 - Weiyang Guo, Zesheng Shi, Zeen Zhu, Yuan Zhou, Min Zhang, Jing Li:

Backdoors in RLVR: Jailbreak Backdoors in LLMs From Verifiable Reward. 32181-32201 - Samuel Kiegeland, Vésteinn Snæbjarnarson

, Tim Vieira, Ryan Cotterell:
On the Proper Treatment of Units in Surprisal Theory. 32202-32224 - Olubusayo Olabisi, Ekata Mitra, Ameeta Agrawal:

ThreadSumm: Summarization of Nested Discourse Threads Using Tree of Thoughts. 32225-32240 - Qihang Ai, Pi Bu, Yue Cao, Yingyao Wang, Jihao Gu, Jingxuan Xing, Zekun Zhu, Wei Jiang, Zhicheng Zheng, Jun Song, Yuning Jiang:

InquireMobile: Teaching VLM-based Mobile Agent to Request Human Assistance via Reinforcement Fine-Tuning. 32241-32255 - Xingyu Lin, Yilin Wen, Du Su, En Wang, Wenbin Liu, Zhonghou Lv, Jinchang Hou, Chenfu Bao:

Token-Level Policy Optimization: Linking Group-Level Rewards to Token-Level Aggregation via sequence-level likelihood. 32256-32269 - Lirui Zhang, Huishuai Zhang:

De-Anonymization at Scale via Tournament-Style Attribution. 32270-32283 - Wei Li, Zhen Huang, Xinmei Tian:

Cross-Modal Masked Compositional Concept Modeling for Enhancing Visio-Linguistic Compositionality. 32284-32308 - Yerong Wu, Tianxing Wu, Minghao Zhu, Hangyu Sha, Haofen Wang:

StratMem-Bench: Evaluating Strategic Memory Use in Virtual Character Conversation Beyond Factual Recall. 32309-32328 - Zhaoheng Huang, Dacheng Wen, Yutao Zhu, Xiaoying Lian, Yushi Liang, Kai Hao, Nan Li, Liangjie Zhang, Qi Zhang, Ji-Rong Wen, Zhicheng Dou, Fangzhao Wu:

RLSeek: Evidence-Grounded Reasoning for RAG Hallucination Detection. 32329-32347 - Fengchun Zhang, Qiang Ma, Liuyu Xiang, Jinshan Lai, Tingxuan Huang, Jianwei Hu:

CO-EVO: Co-evolving Semantic Anchoring and Style Diversification for Federated DG-ReID. 32348-32359 - Miles Gilberti, Shane Storks, Huteng Dai:

Discovering Properties of Inflectional Morphology in Neural Emergent Communication. 32360-32377 - Xin Sun, Di Wu, Sijing Qin, Isao Echizen, Abdallah El Ali, Saku Sugawara:

Label Effects: Shared Heuristic Reliance in Trust Assessment by Humans and LLM-as-a-Judge. 32378-32392 - Liangliang Dong, Lianlei Shan, Shuaimin Li:

Self-SoftCoT: A Self-Consistent Framework via Position-Aware Latent Space Reinforcement Learning. 32393-32414 - Shahab Rahimirad, Guven Gergerli, Lucia Romero, Angela Qian, Matthew Lyle Olson, Simon Stepputtis, Joseph Campbell:

Bayesian Social Deduction with Graph-Informed Language Models. 32415-32440 - Tianyi Niu, Justin Chih-Yao Chen, Genta Indra Winata, Shi-Xiong Zhang, Supriyo Chakraborty, Sambit Sahu, Yue Zhang, Elias Stengel-Eskin, Mohit Bansal:

Routing with Generated Data: Annotation-Free LLM Skill Estimation and Expert Selection. 32441-32466 - Jieun Kim, Seoha Lim, YoungHae Choi, Sung-Bae Cho:

Injecting Context via Situation Working Memory for Logical Reasoning with LLMs. 32467-32480 - Hongxin Ding, Baixiang Huang, Yue Fang, Weibin Liao, Xinke Jiang, Jinyang Zhang, Yinghao Zhu, Zheng Li, Liantao Ma, Junfeng Zhao, Yasha Wang:

ProMed: Shapley Information Gain Guided Reinforcement Learning for Proactive Medical LLMs. 32481-32515 - Xueyang Zhou, Weidong Wang, Lin Lu, Jiawen Shi, Guiyao Tie, Yongtian Xu, Lixing Chen, Pan Zhou, Neil Zhenqiang Gong, Lichao Sun:

SafeAgent: Safeguarding LLM Agents via an Automated Risk Simulator. 32516-32543 - Zihan Gu, Tianyi Zhang, Xinyan Zhang, Zhiyuan Wang, Han Zhang, Yuhao Wei, Jiacheng Lu, Tianyi Ma, Xingsheng Zhang, Hua Zhang, Yue Hu:

Diagnosing Hidden Instabilities in Model Editing via Uncertainty Quantification. 32544-32566 - Abdellah El Mekki, Samar Mohamed Magdy, Houdaifa Atou, Ruwa AbuHweidi, Baraah Qawasmeh, Omer Nacar, Thikra Al-Hibiri, Razan Saadie, Hamzah A. Alsayadi, Nadia Ghezaiel Hammouda, Alshima Mohammed Alkhazimi, Aya Hamod, Al-Yas Yaqoob Al-Ghafri, Wesam El-Sayed, Asila Ismail Al Sharji, Mohamad Ballout, Anas Belfathi, Karim Ghaddar, Serry Sibaee, Alaa Aoun, Aeej Mohammed Aseri, Lina Abureesh, Ahlam Bashiti, Majdal Yousef, Abdulaziz Hafiz, Yehdih Mohamed, Emira Hamedtou, Brakehe Emehah, Rahaf Alhamouri, Youssef Nafea, Aya El Aatar, Walid Al-Dhabyani, Emhemed Hamed, Sara Shatnawi, Fakhraddin Alwajih, Khalid Elkhidir, Ashwag Alasmari, Abdurrahman Gerrio, Omar Said Alshahri, AbdelRahim A. Elmadany, Ismail Berrada, Amir Azad Adli Alkathiri, Fadi A. Zaraket, Mustafa Jarrar, Yahya Mohamed El Hadj, Hassan Alhuzali, Muhammad Abdul-Mageed:

Alexandria: A Multi-Domain Dialectal Arabic Machine Translation Dataset for Culturally Inclusive and Linguistically Diverse LLMs. 32567-32592 - Sihong Wu, Owen Jiang, Yilun Zhao, Tiansheng Hu, Yiling Ma, Kaiyan Zhang, Manasi Patwardhan, Arman Cohan:

Can AI Be a Good Peer Reviewer? A Survey of Peer Review Process, Evaluation, and the Future. 32593-32619 - Parker Seegmiller, Joseph Gatto, Sarah E. Greer, Ganza Belise Isingizwe, Rohan Ray, Timothy E. Burdick, Sarah Masud Preum:

How Much Would a Clinician Edit This Draft? Evaluating LLM Alignment for Patient Message Response Drafting. 32620-32646 - Yuxing Lu, Xukai Zhao, J. Ben Tamo, Micky C. Nnamdi, Rui Peng, Shuang Zeng, Xingyu Hu, Jinzhuo Wang, May Dongmei Wang:

MetaBench: A Multi-task Benchmark for Assessing LLMs in Metabolomics. 32647-32668 - Pham Khanh Chi, Quoc Phong Dao

, Thuat Nguyen, Linh Ngo Van, Trung Le, Thanh Hong Nguyen:
MTA: Multi-Granular Trajectory Alignment for Large Language Model Distillation. 32669-32684 - Parker Seegmiller, Sarah Masud Preum:

Measuring Distribution Shift in User Prompts and Its Effects on LLM Performance. 32685-32704 - Quoc Phong Dao

, Hoang Son Nguyen, Pham Khanh Chi, Linh Ngo Van, Nguyen Thi Ngoc Diep, Thien Huu Nguyen, Trung Le:
TALAS: Teacher-Anchored Layer Alignment with Adaptive Sharpness-Aware Minimization for Embedding Distillation. 32705-32723 - Jonas Mayer Martins, Jaap Jumelet, Viola Priesemann, Lisa Beinborn:

Vocabulary Shapes Cross-Lingual Variation of Word-Order Learnability in Language Models. 32724-32740 - Yangyi Li, Chenxu Zhao, Mengdi Huai:

Quantifying and Understanding Uncertainty in Large Reasoning Models. 32741-32754 - Daniel Zhang-Li, Joy Lim Jia Yin, Binglin Liu, Shangqing Tu, Zijun Yao, Hao Peng, Jifan Yu, Haoxuan Li, Zhanxin Hao, Ye He, Zekun Li, Jiangyi Wang, Lei Hou, Bin Xu, Xin Cong, Zhiyuan Liu, Huiqin Liu, Yu Zhang, Juanzi Li:

SimPBL: A Multi-Agent Framework for Project-Based Learning. 32755-32772 - Ming Li, Chenrui Fan, Yize Cheng, Soheil Feizi, Tianyi Zhou:

Schoenfeld's Anatomy of Mathematical Reasoning by Language Models. 32773-32802 - Yoonji Kim, Jieun Kim, Yujin Jeong, Sung-Bae Cho:

Diagnosing Spatial Consistency across Perspectives and Viewpoints in Large Vision-Language Models. 32803-32827 - Kai Wei, Yuwen Cui, Kehan Shen, Hua Wei, Guangjing Wang

:
A Multi-Agent Framework for High-Interaction Terminal Simulation. 32828-32845 - Zekai Lin, Chao Xue, Di Liang, Xingsheng Han, Peiyang Liu, Xianjie Wu, Lei Jiang, Yu Lu, Bob Simons, Shuang Liang, Minlong Peng:

Parameter Importance is Not Static: Evolving Parameter Isolation for Supervised Fine-Tuning. 32846-32864 - Haohua Song, Wenhao Gu, Zhijing Li, Yunwen Yu, Tiantian Zhu, Xiao Yang, Zexuan Zhu:

Enhanced Reasoning for Biomedical Document-Level Relation Extraction via a Novel Cascade Language Model Framework. 32865-32879 - Yucheng Zhou, Dubing Chen, Huan Zheng, Jianbing Shen:

Multimodal Large Language Models for Multi-Subject In-Context Image Generation. 32880-32898 - Bingxian Wu, Yu Zhang, Zonghao Guo, Tang Liu, Chen Qian, Yuxiang Lu, Xingbo Du, Yanghao Li, Yidan Zhang, Chi Chen, Ling Yao, Chenghu Zhou, Maosong Sun:

RSMeM: Knowledge-Enhanced Memory Evolution for Remote Sensing Agents with Systematic Evaluation. 32899-32915 - Tianhui Zhang, Bei Peng, Danushka Bollegala

:
Synthetic Data Generation for Training Diversified Commonsense Reasoning Models. 32916-32937 - Søren Kirkegaard Fomsgaard, Martial Pastor, Gaël Dias, Nelleke Oostdijk:

Discourse Realization of Generics in Human and LLM-generated Texts. 32938-32960 - Quoc Phong Dao

, Hoang Son Nguyen, Pham Khanh Chi, Tung Nguyen, Linh Ngo Van, Nguyen Thi Ngoc Diep, Trung Le:
SRA: Span Representation Alignment for Large Language Model Distillation. 32961-32975 - Pierre-Antoine Lequeu

, Léo Labat, Laurène Cave, Gaël Lejeune, François Yvon, Benjamin Piwowarski:
The GDN-CC Dataset: Automatic Corpus Clarification for AI-enhanced Democratic Citizen Consultations. 32976-33006 - Xiangchi Yuan, Dachuan Shi, Chunhui Zhang, Zheyuan Liu, Shenglong Yao, Soroush Vosoughi, Wenke Lee:

Behavior Knowledge Merge in Reinforced Agentic Models. 33007-33028 - Hengwei Liu, Haoyuan Ma, Qingqing Lyu, Daoxin Zhang, Yao Hu, Yongliang Shen, Yin Zhang, Weiming Lu:

Leveraging Outline-Optimized Generative Interactions and Critique for Self-Refining Outlines with Reinforcement Learning. 33029-33046 - Zhuowei Chen, Liwei Chen, Christian Schunn, Raquel Coelho, Xiang Lorraine Li:

Neuron-Aware Active Few-Shot Learning for LLMs. 33047-33062 - Pedro Ortiz Suarez, Laurie Burchell

, Catherine Arnett, Rafael Mosquera, Sara Hincapié Monsalve, Thom Vaughan, Damian Stewart, Malte Ostendorff, Idris Abdulmumin, Vukosi Marivate, Shamsuddeen Hassan Muhammad, Atnafu Lambebo Tonja, Hend Al-Khalifa, Nadia Ghezaiel Hammouda, Verrah Akinyi Otiende, Tack Hwa Wong, Jakhongir Saydaliev, Melika Nobakhtian, Muhammad Ravi Shulthan Habibi, Kranti Chalamalasetti, Carol Muchemi, Khang Nguyen, Faisal Muhammad Adam, Luis Frentzen Salim, Reem Alqifari, Cynthia Jayne Amol, Joseph Marvin Imperial, Ilker Kesen, Ahmad Mustafid, Pavel Stepachev, Leshem Choshen, David Anugraha, Hamada Nayel, Seid Muhie Yimam, Vallerie Alexandra Putra, My Chiffon Nguyen, Azmine Toushik Wasi, Gouthami Vadithya, Rob van der Goot, Lanwenn Ar C'horr, Karan Dua, Andrew Yates, Mithil Bangera, Yeshil Bangera, Hitesh Laxmichand Patel, Shu Okabe, Fenal Ashokbhai Ilasariya, Dmitry Gaynullin, Genta Indra Winata, Yiyuan Li, Juan Pablo Martínez, Amit Agarwal, Ikhlasul Akmal Hanif, Raia Abu Ahmad, Esther Adenuga, Filbert Aurelian Tjiaranata, Weerayut Buaphet, Michael Anugraha, Sowmya Vajjala, Benjamin Rice, Azril Hafizi Amirudin, Jesujoba Oluwadara Alabi, Srikant Panda, Yassine Toughrai, Bruhan Kyomuhendo, Daniel Ruffinelli, Akshata A, Manuel Goulão, Ej Zhou, Ingrid Gabriela Franco Ramirez, Cristina Aggazzotti, Konstantin Dobler, Jun Kevin, Quentin Pagès, Nicholas Andrews, Nuhu Ibrahim, Mattes Ruckdeschel, Amr Keleg, Mike Zhang, Casper Rufaro Muziri, Saron Samuel, Sotaro Takeshita, Kun Kerdthaisong, Luca Foppiano, Rasul Dent, Tommaso Green, Ahmad Mustapha Wali, Kamohelo Makaaka, Vicky Feliren
, Inshirah Idris, Hande Çelikkanat, Abdulhamid Abubakar
, Jean Maillard, Benoît Sagot, Thibault Clérice, Kenton Murray, Sarah K. K. Luger:
CommonLID: Re-evaluating State-of-the-Art Language Identification Performance on Web Data. 33063-33080 - Bowen Ding, Yuhan Chen, Jiayang Lyu, Jiyao Yuan, Qi Zhu, Shuangshuang Tian, Dantong Zhu, Futing Wang, Heyuan Deng, Fei Mi, Lifeng Shang, Tao Lin:

Rethinking Expert Trajectory Utilization in LLM Post-training for Mathematical Reasoning. 33081-33106 - Wei Shao, Lingchao Zheng, Pengyu Wang, Peizhen Zheng, Li Jun, Yuwei Fan:

LoPT: Lossless Parallel Tokenization Acceleration for Long Context Inference of Large Language Model. 33107-33122 - Michele Marzollo, Jiawei Zhuang, Niklas Roemer, Niklas Zwingenberger, Lorenz K. Müller, Lukas Cavigelli:

SSSD: Simply-Scalable Speculative Decoding. 33123-33139 - Wenjie Jacky Mo, Qin Liu, Xiaofei Wen, Dongwon Jung, Hadi Askari, Wenxuan Zhou, Zhe Zhao, Muhao Chen:

RedCoder: Automated Multi-Turn Red Teaming for Code LLMs. 33140-33155 - Mehrzad Samadi, Aleksander Ficek, Sean Narenthiran, Siddhartha Jain, Wasi Uddin Ahmad, Somshubra Majumdar, Vahid Noroozi, Boris Ginsburg:

Scaling Test-Time Compute to Achieve IOI Gold Medal with Open-Weight Models. 33156-33169 - Runpeng Geng, Chenlong Yin, Yanting Wang, Ying Chen, Jinyuan Jia:

PIArena: A Platform for Prompt Injection Evaluation. 33170-33192 - Sathvik Nair, Byung-Doh Oh:

Clozing the Gap: Exploring Why Language Model Surprisal Outperforms Cloze Surprisal. 33193-33210 - Jinwei Zhang, Xucheng Liang, Yu Zhang, Ruijie Yu, Xiaokang Yang, Yaohui Jin, Yanyan Xu:

ChemReason-Bench: Benchmarking Large Language Models for Procedural Reasoning in Experimental Chemistry. 33211-33248 - Ming Li, Yanhong Li, Ziyue Li, Tianyi Zhou:

How Instruction and Reasoning Data shape Post-Training: Data Quality through the Lens of Layer-wise Gradients. 33249-33299 - Yihang Yao, Guangtao Zeng, Raina Wu, Yang Zhang, Ding Zhao, Zhang-Wei Hong, Chuang Gan:

Tailored Primitive Initialization is the Secret Key to Reinforcement Learning. 33300-33318 - Pengfei Li, Shijie Wang, Fangyuan Li

, Yikun Fu, Kaifeng Liu, Kaiyan Zhang, Dazhi Zhang, Yuqiang Li, Biqing Qi, Bowen Zhou:
MARS²: Scaling Multi-Agent Tree Search via Reinforcement Learning for Code Generation. 33319-33335 - Caiqi Zhang, Xiaochen Zhu, Chengzu Li, Nigel Collier, Andreas Vlachos:

LoVeC: Reinforcement Learning for Better Verbalized Confidence in Long-Form Generation. 33336-33363 - Ming Li, Pei Chen, Zhenhao Zhang, Tao Yang, Xinyang Zhang, Han Li, Tianyu Cao, Ming Zeng, Zhuofeng Wu, Meng Jiang, Huasheng Li, Lihong Li, Bing Yin:

Mitigating Lost in Multi-turn Conversation via Curriculum RL with Verifiable Accuracy and Abstention Rewards. 33364-33381 - Aya Mourad, Mustafa Jarrar:

AdabNER: Arabic Digital Archive Books with Nested Entity Recognition. 33382-33396 - Yu Fu, Chen Luo, Josef Valvoda, Xin Zhang, Xuejing Lei, Xiao Pan, Hui Liu, Yue Dong

:
Anchoring the Cache: Mitigating Contextual Hallucination in KV-Compressed Long-Context Summarization. 33397-33413 - Jiye Wang, Yu Wang, Jianbin Li, Shiduo Yang, Kenan Guo, Yuanhe Zhao:

NeuralFSM: Adaptive Multi-Agent Coordination via Learning Finite-State Execution Policy. 33414-33436 - Mohsen Hariri, Michael Hinczewski, Jing Ma, Vipin Chaudhary:

Ranking Reasoning LLMs under Test-Time Scaling. 33437-33478 - Shiping Yang, Jie Wu, Wenbiao Ding, Ning Wu, Shining Liang, Ming Gong, Hongzhi Li, Hengyuan Zhang, Angel X. Chang, Dongmei Zhang:

Quantifying and Improving the Robustness of Retrieval-Augmented Language Models Against Spurious Features in Grounding Data. 33479-33499 - Shang Qin, Jingheng Ye, Yinghui Li, Hai-Tao Zheng, Qi Li, Jinxiao Shan, Zhixing Li, Hong-Gee Kim:

CL²GEC: A Multi-Discipline Benchmark for Continual Learning in Chinese Literature Grammatical Error Correction. 33500-33521 - Bingxuan Li, Jeonghwan Kim, Cheng Qian, Xiusi Chen, Eitan Anzenberg, Niran Kundapur, Heng Ji:

PEARL: Self-Evolving Assistant for Time Management with Reinforcement Learning. 33522-33539 - Yeqing Teng, Jiasheng Si, Shuxia Lin, Linhai Zhang, Weiyu Zhang, Wenpeng Lu, Deyu Zhou, Xiaoming Wu:

Beyond Static Artifacts: An Evolutionary Framework for Synthetic Claim Generation. 33540-33570 - Sen Hu, Zhiyu Zhang, Yuxiang Wei, Xueran Han, Zhenheng Tang, Ronghao Chen, Huacan Wang:

CloneMem: Benchmarking Long-Term Memory for AI Clones. 33571-33602 - Weijie Xu, Brian Dillon, Richard Futrell:

Memory efficiency and resource-rational encoding in sentence processing. 33603-33618 - Yuhe Wu, Guangyu Wang, Yuran Chen, Jiatong Zhang, Yutong Zhang, Yujie Chen, Jiaming Shang, Guang Zhang, Zhuang Liu:

PRISM: Probing Reasoning, Instruction, and Source Memory in LLM Hallucinations. 33619-33656 - Shubhashis Roy Dipta, Tz-Ying Wu, Subarna Tripathi:

VC-Inspector: Advancing Reference-free Evaluation of Video Captions with Factual Analysis. 33657-33672 - Parker Riley, Daniel Deutsch, Mara Finkelstein, Colten DiIanni, Juraj Juraska, Markus Freitag:

MQM Re-Annotation: A Technique for Collaborative Evaluation of Machine Translation. 33673-33684 - Aastha A K. Verma, Anwoy Chatterjee, Mehak Gupta, Tanmoy Chakraborty:

Multilingual Language Models Encode Script Over Linguistic Structure. 33685-33719 - Emily Chang, Niyati Bafna:

ChiKhaPo: A Large-Scale Multilingual Benchmark for Evaluating Lexical Comprehension and Generation in Large Language Models. 33720-33754 - Han Weng, Zhou Liu, Yuanfeng Song, Xiaoming Yin, Xing Chen, Wentao Zhang:

UniDataBench: Evaluating Data Analytics Agents Across Structured and Unstructured Data. 33755-33780 - Le Chen, Nuo Xu, Winson Chen, Bin Lei, Pei-Hung Lin, Dunzhi Zhou, Rajeev Thakur, Caiwen Ding, Ali Jannesari, Chunhua Liao:

Beyond Code Pairs: Dialogue-Based Data Generation for LLM Code Translation. 33781-33803 - Hyeonjeong Ha, Qiusi Zhan, Jeonghwan Kim, Dimitrios Bralios, Saikrishna Sanniboina, Nanyun Peng, Kai-Wei Chang, Daniel Kang, Heng Ji:

MM-PoisonRAG: Disrupting Multimodal RAG with Local and Global Knowledge Poisoning Attacks. 33804-33826 - JungMin Yun, YoungBin Kim:

IterCOMP: Reasoning-aware Adaptive Prompt Compression for Multi-hop Question Answering. 33827-33840 - Xiaoyu Luo

, Yiyi Chen
, Qiongxiu Li
, Johannes Bjerva
:
Do LLMs Really Memorize Personally Identifiable Information? Revisiting PII Leakage with a Cue-Controlled Memorization Framework. 33841-33861 - Yaxuan Wang, Zhongteng Cai, Yujia Bao, Xueru Zhang, Yang Liu:

Observations and Remedies for Large Language Model Bias in Self-Consuming Performative Loop. 33862-33882 - Hongwen Ding, Yizheng Zhao:

RAG-on-a-Diet: A Reinforcement Learning-Based Dynamic Resource Optimization Framework for RAG. 33883-33904 - Taicheng Guo, Hai Wang, Chaochun Liu, Mohsen Golalikhani, Xin Chen, Xiangliang Zhang, Chandan K. Reddy:

MTSQL-R1: Towards Long-Horizon Multi-Turn Text-to-SQL via Agentic Training. 33905-33938 - Preni Golazizian, Elnaz Rahmati, Jackson Trager, Zhivar Sourati, Nona Ghazizadeh, Georgios Chochlakis, Jose J. Alcocer, Kerby Bennett, Aarya Vijay Devnani, Parsa Hejabi, Harry G. Muttram, Akshay Kiran Padte, Mehrshad Saadatinia, Chenhao Wu, Alireza Salkhordeh Ziabari, Michael Sierra-Arévalo, Nicholas Weller, Shrikanth Narayanan, Benjamin A. T. Graham, Morteza Dehghani:

The Subjectivity of Respect in Police Traffic Stops: Modeling Community Perspectives in Body-Worn Camera Footage. 33939-33961 - Md. Arid Hasan, Firoj Alam, Md Fahad Hossain, Usman Naseem, Syed Ishtiaque Ahmed:

LLM-Based Multi-Task Bangla Hate Speech Detection: Type, Severity, and Target. 33962-33980 - Xue Xia, Zheyuan Yang, Arman Cohan, Yilun Zhao:

MMSciCode: Real-world Evaluation of Multilingual Multi-Discipline Scientific Research Coding. 33981-33999 - Sizhe Wang, Ziqi Xu, Claire Najjuuko, Charles Alba, Chenyang Lu:

CURA: Clinical Uncertainty Risk Alignment for Language Model-Based Risk Prediction. 34000-34018 - Shuochen Chang, Tong Bai, Xiaofeng Zhang, Qianli Ma, Qingyang Liu, Zhaohe Liao, Yibo Miao, Li Niu:

Unlocking the Black Box of Latent Reasoning: An Interpretability-Guided Approach to Intervention. 34019-34032 - Jiawen Deng, Wei Li, Wentao Zhang, Ziyun Jiao, Fuji Ren:

EthicMind: A Risk-Aware Framework for Ethical-Emotional Alignment in Multi-Turn Dialogue. 34033-34050 - Guan Wang, Biyu Zhou, Xuehai Tang, Jizhong Han, Songlin Hu:

Resolving the Security-Auditability Dilemma with Auditable Latent Chain-of-Thought Alignment. 34051-34067 - Ziqin Luo, Yihao Quan, Xiaofeng Zhang, Xiaosong Yuan, Chen Shen:

ART: Attention Replacement Technique to Improve Factuality in LLMs. 34068-34078 - Guan Wang, Xuehai Tang, Biyu Zhou, Jizhong Han, Songlin Hu:

More Thinking, Less Talking: Internalizing Deliberative Safety into LLM Parameters. 34079-34094 - Marianne Menglin Liu, Daniel Garcia, Fjona Parllaku, Vikas Upadhyay, Fahad Shah, Dan Roth:

ToolScope: Enhancing LLM Agent Tool Use through Tool Merging and Context-Aware Filtering. 34095-34119 - Jaewoo Lee, Archiki Prasad, Justin Chih-Yao Chen, Zaid Khan, Elias Stengel-Eskin, Mohit Bansal:

PRInTS: Reward Modeling for Long-Horizon Information Seeking. 34120-34138 - Guy Kaplan, Michael Toker, Yuval Reif, Yonatan Belinkov, Roy Schwartz:

Follow the Flow: On Information Flow Across Textual Tokens in Text-to-Image Models. 34139-34157 - Andrew Piper, Sil Hamilton, Haiqi Zhou, Federico Pianzola:

Fiction Flows: A Replication and Reinterpretation of Narrative Sequentiality. 34158-34174 - Nokimul Hasan Arif, Qian Lou, Mengxin Zheng:

Conjunctive Prompt Attacks in Multi-Agent LLM Systems. 34175-34191 - Minha Jhang, Kyeongman Park, Hyukhun Koh, Kyomin Jung:

Evaluating Visual Narrative Coherence in Story Visualization via Diversified Storylines. 34192-34207 - Maggie Mi, Golzar Atefi, Atsuki Yamaguchi, Felix A. Gers, Aline Villavicencio, Nafise Sadat Moosavi:

Rethinking the Idiomaticity Decomposability Hypothesis: Evidence from Distributional Learning. 34208-34229 - Manzi Fabrice Niyigaba, Ivory Yang, Soroush Vosoughi:

KinyaProp: Fine-Grained Propaganda Annotation in Kinyarwanda. 34230-34243 - Wei-Cheng Tseng, Xuanru Zhou, Mingyue Huo, Yiwen Shao, Hao Zhang, Dong Yu:

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation. 34244-34263 - Viraaji Mothukuri, Reza M. Parizi:

Trajectory Signatures of Deception in Large Language Models. 34264-34276 - Gauri Kambhatla, Sanjana Gautam, Angela Zhang, Alexander Liu, Ravi Srinivasan, Junyi Jessy Li, Matthew Lease:

Improving the Distributional Alignment of LLMs using Supervision. 34277-34305 - Huy Nghiem, Advik Sachdeva, Hal Daumé III:

SMARTER: A Data-efficient Framework to Improve Toxicity Detection with Explanation via Self-augmenting Large Language Models. 34306-34332 - Yunzhe Wang

, Runhui Xu, Kexin Zheng, Tianyi Zhang, Jayavibhav Niranjan Kogundi, Soham Hans, Volkan Ustun:
GameplayQA: A Benchmarking Framework for Decision-Dense POV-Synced Multi-Video Understanding of 3D Virtual Agents. 34333-34355 - Yukun Huang, Leonardo F. R. Ribeiro, Momchil Hardalov, Bhuwan Dhingra, Markus Dreyer, Venkatesh Saligrama:

DeepFact: Co-Evolving Benchmarks and Agents for Deep Research Factuality. 34356-34386 - Runpeng Dai, Tong Zheng, Run Yang, Kaixian Yu, Hongtu Zhu:

R1-RE: Cross-Domain Relation Extraction with RLVR. 34387-34401 - Xiao Liang, Zhong-Zhi Li, Zhenghao Lin, Eric Hanchen Jiang, Hengyuan Zhang, Yelong Shen, Kai-Wei Chang, Ying Nian Wu, Yeyun Gong, Weizhu Chen:

Training LLMs for Divide-and-Conquer Reasoning Elevates Test-Time Scalability. 34402-34427 - Michael Theologitis, Preetam Prabhu Srikar Dammu, Chirag Shah, Dan Suciu:

ClaimDB: A Fact Verification Benchmark over Large Structured Data. 34428-34451 - Zoher Kachwala, Bao Tran Truong, Rasika Muralidharan, Haewoon Kwak, Jisun An, Filippo Menczer:

PluRule: A Benchmark for Moderating Pluralistic Communities on Social Media. 34452-34471 - Yaning Jia, Chunhui Zhang, Xingjian Diao, Xiangchi Yuan, Zhongyu Ouyang, Chiyu Ma, Soroush Vosoughi:

What Makes a Good Curriculum? Disentangling the Effects of Data Ordering on LLM Mathematical Reasoning. 34472-34488 - Ahmed Heakl, Gustavo Bertolo Stahl, Sarim Hashmi, Seung Hun Eddie Han, Mukul Ranjan, Arina Kharlamova, Salman Khan, Abdulrahman Mahmoud:

CASS: Nvidia to AMD Transpilation with Data, Models, and Benchmark. 34489-34508 - Rania Elbadry, Sarfraz Ahmad, Ahmed Heakl, Dani Bouch, Momina Ahsan, Muhra AlMahri, Marwa Elsaid Khalil, Yuxia Wang, Salem Lahlou, Sophia Ananiadou, Veselin Stoyanov, Jimin Huang, Xueqing Peng, Preslav Nakov, Zhuohan Xie:

SAHM: A Benchmark for Arabic Financial and Shari'ah-Compliant Reasoning. 34509-34536 - Sanjeevan Selvaganapathy, Mehwish Nasim:

Confident, Calibrated, or Complicit: Safety Alignment and Ideological Bias in LLM Hate Speech Detection. 34537-34552 - Shangjian Yin, Zhepei Wei, Xinyu Zhu, Wei-Lin Chen, Yu Meng:

Aligning Large Language Models via Fully Self-Synthetic Data. 34553-34568 - Tatsuya Hiraoka:

Corpus-Dependent Subcharacter Encoding via HMM-Guided Code Assignment. 34569-34593 - Hirona Jacqueline Arai, Xiang Ren:

DRInQ: Evaluating Conversational Implicature with Controlled Context Variation. 34594-34611 - Shangjian Yin, Zhouxing Shi:

From Individual to Common: An Early Exploration of Consensus in Non-verifiable Data for Balanced Preference Optimization. 34612-34630 - Xiang Gao, Yuguang Yao, Qi Zhang, Kaiwen Dong, Avinash Baidya, Ruocheng Guo, Hilaf Hasson, Kamalika Das:

RIMRULE: Improving Tool-Using Language Agents via MDL-Guided Rule Learning. 34631-34646 - Zhaofen Wu, Hanrong Zhang, Fulin Lin, Wujiang Xu, Xinran Xu, Yankai Chen, Henry Peng Zou, Shaowen Chen, Weizhi Zhang, Xue Liu, Philip S. Yu, Hongwei Wang:

GAM: Hierarchical Graph-based Agentic Memory for LLM Agents. 34647-34664 - Zeyu Zhang, Kexuan Sun, Zheng Tang, Jens-S. Vöckler, Thien Huu Nguyen, Thuy Vu:

CypherSmith: Transforming Text-to-Cypher Generation for LLMs with Synthetic Data. 34665-34682 - Shiyao Cui, Qinglin Zhang, Di Wang, Yida Lu, Zhexin Zhang, Jinhua Gao, Jinglin Yang, Min He, Han Qiu, Minlie Huang:

New Terms, New Toxicity: Consensus-based Chinese Neologism Toxicity Detection via Search-Augmented LLMs. 34683-34701 - Huangming Xu, Fu Zhang, Zhixuan Yang, Lu Zhang, Jingwei Cheng:

ATGL: An Adaptive-Threshold Global Loss for Document-level Relation Extraction. 34702-34716 - Tianyu Zong, Rui Dai, Hongzhu Yi, Yuanxiang Wang, Zhenghao Zhang, Zhenyu Guan, Yujia Yang, Bingkang Shi, Yueyang Ding, Xiangxiang Chu, Kaikui Liu, Jungang Xu:

L2Dir: Integrating L_2-Norm and Directional Alignment for Unsupervised Contrastive Representation Learning in Multimodal Retrieval. 34717-34740 - Yutong Gao, Qinglin Meng, Yuan Zhou, Liangming Pan:

Towards Intrinsic Interpretability of Large Language Models: A Survey of Design Principles and Architectures. 34741-34754 - Khanh Chi Le, Linghe Wang, Minhwa Lee, Ross Volkov, Luan Tuyen Chau, Dongyeop Kang:

ScholaWrite: A Dataset of End-to-End Scholarly Writing. 34755-34788 - Wenquan Ma, Jiayan Nan, Wenlong Wu:

What Deserves Memory: Adaptive Memory Distillation for LLM Agents. 34789-34812 - Enming Wang, Jianlei Wang, Xueping Peng, Hongjiao Guan, Yinglong Wang, Sibo Wei, Jianbin Guo, Ruifeng Xu, Wenpeng Lu:

SOAPTriage: SOAP-Guided Multi-View Clinical Text Modeling Framework for Automated ESI Prediction. 34813-34837 - Chenyang Gu, Jiahao Cheng, Meicong Zhang, Pujun Zheng, Jinquan Zheng, Guoxiu He:

MoRI: Learning Motivation-Grounded Reasoning for Scientific Ideation in Large Language Models. 34838-34869 - Kunpeng Kang, Shuaimin Li, Kaiyuan Zhang

, Luyang Zhang, Jiasheng Si, Bing Xu, Kehai Chen, Muyun Yang, Wenpeng Lu:
WSDPO: A Generative Word Sense Disambiguation Framework with Chain-of-Thought and Preference Optimization. 34870-34889 - Qingqing Yang, Haijiang Liu, Moyan Li:

From Regulatory Approvals to Patents: Cross-Domain Linking for Cardiovascular Device Traceability. 34890-34906 - Guangzhen Zhao, Dechang Kong, Tongyu Wu, Zhenjiang Dong:

TrustTable: A Neuro-Symbolic Auditing Framework for Faithful Table QA. 34907-34934 - Chien Van Nguyen, Huy Huu Nguyen, Ruiyi Zhang, Hanieh Deilamsalehy, Puneet Mathur, Viet Dac Lai, Haoliang Wang, Jayakumar Subramanian, Ryan A. Rossi, Trung Bui, Nikos Vlassis, Franck Dernoncourt, Thien Huu Nguyen:

Lizard: An Efficient Linearization Framework for Large Language Models. 34935-34948 - Hanwen Xu, Xuyao Huang, Yuzhe Liu, Zhijie Deng:

TPS-Bench: Evaluating AI Agents' Tool Planning & Scheduling Abilities in Compounding Tasks. 34949-34961 - Feng Jiang, Zhiyu Lin, Yiyang Liu, Liumeng Xue, Fan Bu, Yuhao Du, Xiangying Chen, Benyou Wang, Haizhou Li:

S2S-Arena: Evaluating Paralinguistic Instruction Following in Speech-to-Speech Models. 34962-34978 - Zongmin Li, Jian Su, Farah Benamara, Aixin Sun:

Can LLM Safety Be Ensured by Constraining Parameter Regions? 34979-35011 - Jianjun Zhang, Hanli Wang:

CityVG: Contrastive Fine-Tuning and Reward-Based Chain-of-Thought Reasoning for Zero-Shot City-Scale 3D Visual Grounding. 35012-35031 - Jingyao Liu, Chen Huang, Zhizhao Guan, Wenqiang Lei, Yang Deng:

E2EDev: Benchmarking Large Language Models in End-to-End Software Development Task. 35032-35068 - Xin Chen, Feng Jiang, Yiqian Zhang, Hardy Chen, Shuo Yan, Wenya Xie, Min Yang, Shujian Huang:

Reasoning While Asking: Transforming Reasoning Large Language Models from Passive Solvers to Proactive Inquirers. 35069-35090 - Weiqing Luo, Zongye Hu, Xiao Wang, Zhiyuan Yu, Haofeng Zhang, Ziyi Huang:

Utility-Oriented Visual Evidence Selection for Multimodal Retrieval-Augmented Generation. 35091-35124 - Jinquan Zheng, Jia Yuan, Jiacheng Yao, Chenyang Gu, Pujun Zheng, Guoxiu He:

Mitigating Selection Bias in Large Language Models via Permutation-Aware GRPO. 35125-35143 - Zhiyang Li, Ao Ke, Yukun Cao, Xike Xie:

KG-ViP: Bridging Knowledge Grounding and Visual Perception in Multi-modal LLMs for Visual Question Answering. 35144-35157 - Mengyu Xiang, Tinghao Chen, Boxu Han, Qiudan Li, Shu Wu, Daniel Dajun Zeng:

Reinforcement Learning-Guided Adaptive Tuning for Out-of-Distribution Harmful Text Detection. 35158-35174 - Meng Li

, Lei Li, Xiting Wang, Yi Yuan, Zheng Wei, Jiang Bian, Zang Li:
SOAR: Supervision from Observation for Agentic Reinforcement Learning. 35175-35197 - Chen Yang, Ruping Xu, Ruizhe Li, Bin Cao, Jing Fan:

Business as Rulesual: A Benchmark and Framework for Business Rule Flow Modeling with LLMs. 35198-35220 - Jianing Zhang, Runan Li

, Honglin Pang, Ding Xia, Zhou Zhu, Qian Zhang, Chuntao Li, Xi Yang:
Specializing Large Models for Oracle Bone Script Interpretation via Component-Grounded Multimodal Knowledge Augmentation. 35221-35236 - Juwei Yue, Chuanrui Hu, Jiawei Sheng, Zuyi Zhou, Wenyuan Zhang, Tingwen Liu, Li Guo, Yafeng Deng:

HyperMem: Hypergraph Memory for Long-Term Conversations. 35237-35254 - Xiaoling Zhou, Mingjie Zhang, Zhemg Lee, Wei Ye, Shikun Zhang:

LeLoRA: Learnable Low-Rank Adaptation of Large Language Models. 35255-35273 - Xinyu Gao, Shaonan Wang, Nai Ding:

Gated Tree Cross-Attention for Checkpoint-Compatible Syntax Injection in Decoder-Only LLMs. 35274-35288 - Song Jin, Juntian Zhang, Xun Zhang, Zeying Tian, Fei Jiang, Guojun Yin, Wei Lin, Yong Liu, Rui Yan:

DiningBench: A Hierarchical Multi-view Benchmark for Perception and Reasoning in the Dietary Domain. 35289-35310 - Chien Van Nguyen, Ryan A. Rossi, Linh Ngo Van, Franck Dernoncourt, Thien Huu Nguyen:

Octopus: Gated Selective Attention for Memory-Bounded Long-Context Inference in Large Language Models. 35311-35323 - Jiayi Wang, Shipeng Wang, Ji Wu, Jian Sun:

SAME: Safety-Aware Model Editing Guided by Safety Transformation. 35324-35343 - Demian Inostroza Améstica, Ekaterina Vylomova

, Charles Kemp, Mae Carroll, Wanchun Li, Meladel Mistica:
Where the Cat Sat: A Multilingual Framework for Spatial Language Understanding. 35344-35362 - Nanjie Li, Xiaoyong Guo, Hao Huang, Haihua Xu, Wei Shi:

LCMA-SRT: Language-Conditional Mixture-of-Experts Adapters for Joint Multilingual Speech Recognition and Translation. 35363-35377 - Senbo Zhang, Qiqi Wang, Fanghao Lou, Guanyu Chen, Yihong Pan, Huijia Li, Qian Liu:

DefGen-Bench: A Benchmark for Chinese Criminal Defence Opinion Generation in LegalAI. 35378-35392 - Linxuan Du, Guangquan Xue, Xiaobo Liang, Qipeng Huang, Yuyang Ding, Xinyu Shi, Zhang Yijun, Ji Qi, Wenpeng Zhu, Juntao Li, Min Zhang:

Escaping the Echo Trap: On Credit Assignment Failure in Multi-turn LLM Self-Reflection. 35393-35405 - Yuxuan Zhang:

ARF-RLHF: Adaptive Reward-Following for RLHF through Emotion-Driven Self-Supervision and Trace-Biased Dynamic Optimization. 35406-35425 - Yujie Hou, Mei Wang, Yaoyao Zhong, Ting Zhang, Xuetao Ma, Hua Huang:

SMART: Evaluating LLMs' Mathematical Reasoning via a Human Cognitive Process-Inspired Benchmark. 35426-35452 - Yanbin Yin, Kun Zhou, Zhen Wang, Xiangdong Zhang, Yifei Shao, Shibo Hao, Yi Gu, Jieyuan Liu, Somanshu Singla, Tianyang Liu, Eric P. Xing, Zhengzhong Liu, Haojian Jin, Zhiting Hu:

Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models. 35453-35469 - Siqing Song, Chuang Wang, Yong Lang, Yi Yang, Xu-Yao Zhang:

LBLLM: Lightweight Binarization of Large Language Models via Three-Stage Distillation. 35470-35484 - Ronghui Yang, Jie Liu, Jiajie Zeng, Jiexin Wang, Jiuchuan Jiang, Bo An, Yi Cai, Mengchen Zhao:

SeDev: Structured Semantic Exploration for LLM-Driven Code Generation. 35485-35512 - Pei Yang, Wanyi Chen, Ke Wang, Lynn Ai, Eric Yang, Tianyu Shi:

EVM-QuestBench: An Execution-Grounded Benchmark for Natural-Language Transaction Code Generation. 35513-35529 - Yuhang Zhang

, Keyan Ding, Peilin Chen, Han Liu, Can Lin, Ruixi Chen, Shiqi Wang, Qi Song:
TIGER: Text-Informed Generalized Enzyme-Reaction Retrieval. 35530-35548 - Fuwen Luo, Shengfeng Lou, Chi Chen, Ziyue Wang, Chenliang Li, Weizhou Shen, Jiyue Guo, Peng Li, Ming Yan, Ji Zhang, Fei Huang, Yang Liu:

MUSEG: Reinforcing Video Temporal Understanding via Timestamp-Aware Multi-Segment Grounding. 35549-35561 - Xiaoyuan Wu, Roshni Kaushik, Wenkai Li, Lujo Bauer, Koichi Onoue:

User Perceptions vs. Proxy LLM Judges: Privacy and Helpfulness in LLM Responses to Privacy-Sensitive Scenarios. 35562-35579 - Subham Raj, Aman Vaibhav Jha, Mayank Anand

, Sriparna Saha:
HARPO: Hierarchical Agentic Reasoning for User-Aligned Conversational Recommendation. 35580-35599 - Pei Wang, Yanan Wu, Xiaoshuai Song, Weixun Wang, Gengru Chen, Zhongwen Li, Kezhong Yan, Qi Liu, Ken Deng, Shuaibing Zhao, Shaopan Xiong, Xuepeng Liu, Xuefeng Chen, Wanxi Deng, Wenbo Su, Bo Zheng:

ShopSimulator: Evaluating and Exploring RL-Driven LLM Agent for Shopping Assistants. 35600-35619 - Wenrui Liao, Weihong Du, Yi Li, Hongru Liang, Wenqiang Lei:

NL \Rightarrow Schedule: Evaluate Multitask Scheduling Capability of Large Language Models. 35620-35640 - Pengfei He, Shaowei Wang, Tse-Hsun Chen, Muhammad Asaduzzaman:

SLICEFORMER: Static Program Slicing Using Language Models With Dataflow-Aware Pretraining and Constrained Decoding. 35641-35652 - Qingguo Qi, Hongyang Chen, Zhao Li:

SCOPE: Boosting LLM Efficiency with Scoped Position Encoding. 35653-35673 - Guocong Li, Qirui Hu, Ping Wang, Guofeng Zhang, Jian Wu, Hongxia Xu:

Debate-of-Thoughts: Resolving Knowledge Conflicts in LLMs Through Internal Deliberation. 35674-35696 - Zenghao Duan, Zhiyi Yin, Zhichao Shi, Liang Pang, Shaoling Jing, Zihe Huang, Jiayi Wu, Yu Yan, Jingcheng Deng, Huawei Shen, Xueqi Cheng:

Projecting Out the Malice: A Global Subspace Approach to LLM Detoxification. 35697-35719 - Ziyan Wang, Enmao Diao, Qi Le, Pu Wang, Minwoo Lee, Shu-Ping Yeh, Evgeny Stupachenko, Hao Feng, Li Yang:

From Local to Global: Revisiting Structured Pruning Paradigms for Large Language Models. 35720-35739 - Advait Gosai, Tyler Vuong, Utkarsh Tyagi, Steven Li, Wenjia You, Miheer Bavare, Arda Uçar, Zhongwang Fang, Brian Jang, Bing Liu, Yunzhong He:

Audio MultiChallenge: A Multi-Turn Evaluation of Spoken Dialogue Systems on Natural Human Interaction. 35740-35770 - Weicai Long, Yusen Hou, Junning Feng, Houcheng Su, Shuo Yang, Donglin Xie, Yanlin Zhang:

GenomeQA: Benchmarking General Large Language Models for Genome Sequence Understanding. 35771-35792 - Honghao Fu, Miao Xu, Yiwei Wang, Dailing Zhang, Jun Liu, Yujun Cai:

VideoStir: Understanding Long Videos via Spatio-Temporally Structured and Intent-Aware RAG. 35793-35805 - Michael Ginn, Lindia Tjuatja, Enora Rice, Ali Marashian, Maria R. Valentini, Jasmine Xu, Graham Neubig, Alexis Palmer:

Massively Multilingual Joint Segmentation and Glossing. 35806-35820 - Chengye Wang, Lin Fu, Zexi Kuang, Yilun Zhao:

TexOCR: Advancing Document OCR Models for Compilable Page-to-LaTeX Reconstruction. 35821-35845 - Siqi Fan, Xiusheng Huang, Yiqun Yao, Xuezhi Fang, Kang Liu, Peng Han, Shuo Shang, Aixin Sun, Yequan Wang:

If an LLM Were a Character, Would It Know Its Own Story? Evaluating Lifelong Learning in LLMs. 35846-35858 - Runxuan Liu, Xianhao Ou, Xinyan Ma, Jiyuan Wang, Jiafeng Liang, Jiaqi Li, Tao He, Zheng Chu, Rongchuan Mu, Zekun Wang, Baoxin Wang, Dayong Wu, Ming Liu, Shijin Wang, Guoping Hu, Bing Qin:

Graph Reasoning Paradigm: Structured and Symbolic Reasoning with Topology-Aware Reinforcement Learning for Large Language Models. 35859-35881 - Peiwen Yuan, Shaoxiong Feng, Yiwei Li, Xinglin Wang, Yueqi Zhang, Jiayi Shi, Chuyi Tan, Boyuan Pan, Yao Hu, Kan Li:

LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient. 35882-35903 - Boci Peng, Xiao Liu, Boren Hu, Yun Zhu, Xuanbo Fan, Yanwei Yue, Chunyu Yang, Yan Zhang:

COSMOS: Connectivity-Oriented Submodular Maximization for Optimal Subgraph Retrieval. 35904-35924 - Shenglai Zeng, Tianqi Zheng, Chuan Tian, Dante Everaert, Yau-Shian Wang, Yupin Huang, Michael J. Morais, Rohit Patki, Jinjin Tian, Xinnan Dai, Kai Guo, Monica Xiao Cheng, Hui Liu:

Attn-GS: Attention-Guided Context Compression for Efficient Personalized LLMs. 35925-35946 - Aunabil Chakma, Mihai Surdeanu, Eduardo Blanco:

Structured Semantic Information Helps Retrieve Better Examples for In-Context Learning Applied to Few-Shot Relation Extraction. 35947-35971 - Yixin Bu, Runze Xia, Guanyun Zou, Yupeng Ji, Hongliang Dai, Haodong Liu, Piji Li:

DUD: Decoupled Update Dynamics for Reliable Uncertainty Quantification in Large Language Models. 35972-35993 - Ziang Chen, Guannan Li, Fanlin Ji, Yipeng Kang, Jiaqi Li, Muhan Zhang, Yangtao Zhang, Li Tianjiao, Jiannan Wang, Xin Guo, Song-Chun Zhu, Bin Ling:

JurisBench: A Deep Benchmark for Assessing Large Language Models in Professional Legal Practice. 35994-36018 - Weikang Yuan, Kaisong Song, Zhuoren Jiang, Junjie Cao, Yujie Zhang, Jun Lin, Kun Kuang, Ji Zhang, Xiaozhong Liu:

LeCoDe: A Benchmark Dataset for Interactive Legal Consultation Dialogue Evaluation. 36019-36048 - Pengfeng Li, Chen Huang, Chaoqun Hao, Hongyao Chen, Xiao-Yong Wei, Wenqiang Lei, See-Kiong Ng:

METER: Evaluating Multi-Level Contextual Causal Reasoning in Large Language Models. 36049-36073 - Yibo Lyu, Gongwei Chen, Rui Shao, Weili Guan, Liqiang Nie:

PersonalAlign: Hierarchical Implicit Intent Alignment for Personalized GUI Agent with Long-Term User-Centric Records. 36074-36089 - Tianyi Men, Zhuoran Jin, Pengfei Cao, Yubo Chen, Kang Liu, Jun Zhao:

Empowering GUI Agents via Autonomous Experience Exploration and Hindsight Experience Utilization for Task Planning. 36090-36108 - Yang Wu, Jinhong Yu, Jingwei Xiong, Zhimin Tao, Xiaozhong Liu:

"Excuse me, may I say something..." CoLabScience, A Proactive AI Assistant for Biomedical Discovery and LLM-Expert Collaborations. 36109-36129 - Weisi Liu, Guangzeng Han, Xiaolei Huang:

Knowledge-driven Augmentation and Retrieval for Integrative Temporal Adaptation. 36130-36143 - Yongkang Liu, Jiayang Yu, Mingyang Wang, Yiqun Zhang, Ercong Nie, Shi Feng, Daling Wang, Kaisong Song, Hinrich Schütze:

SAD: A Large-Scale Strategic Argumentative Dialogue Dataset. 36144-36164 - Eojin Jeon, SangKeun Lee:

PICTURE: Enhancing Theory-of-Mind in Large Language Models by Revealing, Not Hiding, Characters' Lack of Knowledge. 36165-36192 - Songhao Wu, Ang Lv, Ruobing Xie, Samm Sun, Di Wang, Rui Yan, Yankai Lin:

Union-of-Experts: Neurons in Mixture-of-Experts are Secretly Routers. 36193-36206 - Kai Qin, Liangxin Liu, Yu Liang, Longzheng Wang, Yan Wang, Yueyang Zhang, Long Xia, Zhiyuan Sun, Houde Liu, Daiting Shi:

ReflectRM: Boosting Generative Reward Models via Self-Reflection within a Unified Judgment Framework. 36207-36223 - Harper Hua, Zhen Han, Zhengyuan Shen, Meng-Chieh Lee, Sheng Guan, Qi Zhu, Sullam Jeoung, Yueyan Chen, Yunfei Bai, Shuai Wang, Vassilis N. Ioannidis, Huzefa Rangwala:

SQL-Trail: Multi-Turn Reinforcement Learning with Interleaved Feedback for Text-to-SQL. 36224-36246 - Yuhan Wu, Huan Zhang, Wei Cheng, Chen Shen, Jingyue Yang, Wei Hu:

Bootstrapping Code Translation with Weighted Multilanguage Exploration. 36247-36259 - Haosen Wang, Jing Xiao, Chaochao Du, Xiaowang Zhang, Zhiyong Feng:

Flow-Based Page Unique Semantic Mapping Architecture for Document Visual Question Answering. 36260-36280 - Qiaoyu Zheng, Zehan Ma, Yijing Zhang, Qiqi Wang, Huijia Li, Qian Liu:

Pub-LawBench: Public-Oriented Benchmarking for LegalAI. 36281-36303 - Ziping Ye, Gourab Dey, Christos Christodoulopoulos, Charith Peris, Anil Ramakrishna, Weitong Ruan, Aram Galstyan, Kai-Wei Chang, Rahul Gupta, Ninareh Mehrabi:

SWAN: Semantic Watermarking with Abstract Meaning Representation. 36304-36315 - Jialiang Guo, Fucheng Xiong, Xu He, Haodong Zhao, Xingyang Li, Ke Zeng, Xunliang Cai:

Turning Failures into Value: Negative Experience Replay for RLVR via Confidence Gating and Boundary Failure Sampling. 36316-36334 - Haoyue Zhang, Hualei Zhang, Xiaosong Ma, Jie Zhang, Song Guo:

LazyEviction: Lagged KV Eviction with Attention Pattern Observation for Efficient Long Reasoning. 36335-36352 - Yijie Li, Xi Cao

, Yuan Sun, Quulgan Minggad, Abdulla Ablikim, Jia Qing Cai Wang:
Diversity in Unity, Theory in Practice: Hierarchical Multitask Benchmarks for Chinese Minority Languages. 36353-36373 - Dongjun Kim, Jeongho Yoon, Chanjun Park, Heuiseok Lim:

LangSAE Editing: Improving Multilingual Information Retrieval via Post-hoc Language Identity Removal. 36374-36389 - Siddhant Bhambri, Upasana Biswas, Subbarao Kambhampati:

Interpretable Traces, Unexpected Outcomes: Investigating the Disconnect in Trace-Based Knowledge Distillation. 36390-36408 - Cuong Chi Le

, Minh V. T. Pham, Tung Duy Vu, Cuong Duc Van, Huy Nhat Phan, Hoang Nhat Phan, Tien N. Nguyen:
SpecMind: Cognitively Inspired, Interactive Multi-Turn Framework for Postcondition Inference. 36409-36424 - Yihua Zhu, Qianying Liu, Jiaxin Wang, Fei Cheng, Chaoran Liu, Akiko Aizawa, Sadao Kurohashi, Hidetoshi Shimodaira:

Memorization, Emergence, and Explaining Reversal Failures: A Controlled Study of Relational Semantics in LLMs. 36425-36443 - Afrozah Nadeem, Mark Dras, Usman Naseem:

Framing Political Bias in Multilingual LLMs Across Pakistani Languages. 36444-36486 - Kazuki Tsutsukawa:

InsAT: Instance-aware Semantic Alignment and Transfer from Human-Object Keypoints for Zero-to-Few-shot Action Understanding. 36487-36504 - Jun Seo Kim, Hyemi Kim, Woo Joo Oh, Hongjin Cho, Hochul Lee, Hye Hyeon Kim:

Multi-View Attention Multiple-Instance Learning Enhanced by LLM Reasoning for Cognitive Distortion Detection. 36505-36525 - Haotian Lu, Yuchen Mou, Bingzhe Wu:

CHAIRO: Contextual Hierarchical Analogical Induction and Reasoning Optimization for LLMs. 36526-36537 - Terry Jingchen Zhang, Gopal Dev, Ning Wang, Max Obreiter, Wenyuan Jiang, Punya Syon Pandey, Keenan Samway, Yinya Huang, Bernhard Schölkopf, Mrinmaya Sachan, Zhijing Jin:

Test of Time: Rethinking Temporal Signal of Benchmark Contamination. 36538-36555 - Ryo Yoshida, Shinnosuke Isono, Taiga Someya, Yohei Oseki, Tatsuki Kuribayashi:

An Existence Proof for Neural Language Models That Can Explain Garden-Path Effects via Surprisal. 36556-36569 - Shivam Adarsh, Maria Maistro, Christina Lioma:

How Context Shapes Truth: Geometric Transformations of Statement-level Truth Representations in LLMs. 36570-36590 - Khotso Selialia, Antoine Nzeyimana, Fatima M. Anwar:

Mitigating Tokenization-Induced Distance Distortion in Long-Context Multilingual Machine Translation. 36591-36602 - Kaixiong Gong, Kaituo Feng, Bohao Li, Yibing Wang, Mofan Cheng, Shijia Yang, Jiaming Han, Benyou Wang, Yutong Bai, Zhuoran Yang, Xiangyu Yue:

Probing Audio-Visual Reasoning in Multimodal Language Models through the Lens of Audio. 36603-36645 - Yuansen Liu, Yixuan Tang, Anthony Kum Hoe Tung:

Reasoning Hijacking: The Fragility of Reasoning Alignment in Large Language Models. 36646-36665 - Linqing Chen, Hanmeng Zhong, Wentao Wu, Peng Zhou:

The Dominance of Text Space: Unveiling the Asymmetric Nature of Cross-Modal Alignment in Large Language Models. 36666-36678 - Dongqi Huang, Tong Zhou, Zhuoran Jin, Shenghui Shi, Yujiao Mao, Kang Liu, Jun Zhao, Yubo Chen:

Towards Explainable Diagnosis: A Self-learned Explanatory Knowledge Base Approach. 36679-36700 - Taiwei Shi, Zhuoer Wang, Longqi Yang, Ying-Chun Lin, Zexue He, Mengting Wan, Pei Zhou, Sujay Kumar Jauhar, Sihao Chen, Shan Xia, Hongfei Zhang, Jieyu Zhao, Xiaofeng Xu, Xia Song, Jennifer Neville:

WildFeedback: Aligning LLMs With In-situ User Interactions And Feedback. 36701-36725 - Chenxi Gu, Xiaoning Du, John C. Grundy:

SSG: Logit-Balanced Vocabulary Partitioning for LLM Watermarking. 36726-36737 - Youngsik Yoon, Sungjae Lee, Seockbean Song, Siwei Wang, Wei Chen, Jungseul Ok:

PaT: Planning-after-Trial for Efficient Test-Time Code Generation. 36738-36755 - Yinan Liu, Dongying Lin, Sigang Luo, Xiaochun Yang, Bin Wang:

Joint Knowledge Base Completion and Question Answering by Combining Large Language Models and Small Language Models. 36756-36775 - Yilun Zhao, Jinbiao Wei, Tingyu Song, Siyue Zhang, Chen Zhao, Arman Cohan:

Rethinking Reasoning-Intensive Retrieval: Evaluating and Advancing Retrievers in Agentic Search Systems. 36776-36806 - Jiandong Shao, Raphael Tang, Crystina Zhang, Karin Sevegnani, Pontus Stenetorp, Jianfei Yang, Yao Lu:

The Role of Mixed-Language Documents for Multilingual Large Language Model Pretraining. 36807-36818 - Zhangyi Wang

, Jiexiang Xu, Bingnan Yu, Zongze Li:
ARCHITECT: Uncertainty-Aware Dynamic Tool Learning via Causal Intervention for Open-World Agents. 36819-36829 - Zhuoyue Gao, Xiaohui Wang, Xiaocui Yang, Wen Zhang, Daling Wang, Shi Feng, Yifei Zhang:

ES4R: Speech Encoding Based on Prepositive Affective Modeling for Empathetic Response Generation. 36830-36847 - Dongming Jiang, Yi Li, Guanpeng Li, Bingzhe Li:

MAGMA: A Multi-Graph based Agentic Memory Architecture for AI Agents. 36848-36865 - Renmiao Chen, Yida Lu, Shiyao Cui, Xuan Ouyang, Victor Shea-Jay Huang, Shumin Zhang, Chengwei Pan, Han Qiu, Minlie Huang:

The Side Effects of Being Smart: Safety Risks in MLLMs' Multi-Image Reasoning. 36866-36882 - Zhangyi Wang

, Bingnan Yu, Jiexiang Xu, Zongze Li:
Action Boundary Blindness: When LLM Agents Cannot Tell Where One Action Ends and Another Begins. 36883-36899 - Sangkwon Park, Donghun Kang, Jisoo Mok, Sungroh Yoon:

Verbal-R3: Verbal Reranker as the Missing Bridge between Retrieval and Reasoning. 36900-36918 - Yinghao Tang, Xueding Liu, Boyuan Zhang, Tingfeng Lan, Yupeng Xie, Jiale Lao, Yiyao Wang, Haoxuan Li, Tingting Gao, Bo Pan, Luoxuan Weng, Xiuqi Huang, Minfeng Zhu, Yingchaojie Feng, Yuyu Luo, Wei Chen:

IGenBench: Benchmarking the Reliability of Text-to-Infographic Generation. 36919-36954 - He Geng, Yangmin Huang, Lixian Lai, Qianyun Du, Hui Chu, Zhiyang He, Jiaxue Hu, Xiaodong Tao:

ProMedical: Hierarchical Fine-Grained Criteria Modeling for Medical LLM Alignment via Explicit Injection. 36955-36994 - Aijia Cheng, Kailong Wang, Ling Shi, Yongxin Zhao

:
R2IF: Aligning Reasoning with Decisions via Composite Rewards for Interpretable LLM Function Calling. 36995-37008 - Zhi Zeng, Jiaying Wu, Minnan Luo, Di Zhang, Yifei Yang, Xiangzheng Kong, Herun Wan, Zihan Ma:

From Detection to Understanding: Multi-Turn Reasoning for Video Misinformation Analysis. 37009-37027 - Yunsheng Zeng, Yongmei Tan:

Frozen LLMs are Native Decoders for High-Norm Semantic Vectors. 37028-37043 - Qin Zhou, Guoyan Liang, Qianyi Yang, Jingyuan Chen, Sai Wu, Chang Yao, Zhe Wang:

Enhancing Reinforcement Learning for Radiology Report Generation with Evidence-aware Rewards and Self-correcting Preference Learning. 37044-37056 - Jingkun Ma, Runzhe Zhan, Yang Li, Di Sun, Hou Pong Chan, Lidia S. Chao, Derek F. Wong:

VisAidMath: Benchmarking Visual-Aided Mathematical Reasoning. 37057-37103 - Renqi Chen, Zeyin Tao, Jianming Guo, Jingzhe Zhu, Yiheng Peng, Qingqing Sun, Tianyi Zhang, Shuai Chen:

RISK: A Framework for GUI Agents in E-commerce Risk Management. 37104-37120 - Tianyu Fan, Jingyuan Wang, Xubin Ren, Chao Huang:

MiniRAG: A Lightweight RAG system with Small Language Models. 37121-37144 - Jiale Cheng, Yusen Liu, Xinyu Zhang, Yulin Fei, Wenyi Hong, Ruiliang Lyu, Weihan Wang, Zhe Su, Xiaotao Gu, Xiao Liu, Yushi Bai, Jie Tang, Hongning Wang, Minlie Huang:

Glyph: Scaling Context Windows via Visual-Text Compression. 37145-37158 - Gyunyeop Kim, Sangwoo Kang:

TA-GRPO-d: Trajectory-Aware GRPO for Optimizing Denoising Trajectories in Diffusion LLMs. 37159-37174 - Juhyeong Kim, Gyunyeop Kim, Sangwoo Kang:

AG-GRPO: Answer-Guided GRPO for Masked Diffusion Language Models. 37175-37191 - Ndapa Nakashole:

Grammar as Control: Modular Language Generation for the Long Tail. 37192-37222 - Junhao Ruan, Abudukeyumu Abudula, Bei Li, Yongjing Yin, Xinyu Liu, Kechen Jiao, Xin Chen, Jingang Wang, Xunliang Cai, Tong Xiao, Jingbo Zhu:

MTR-Suite: A Framework for Evaluating and Synthesizing Conversational Retrieval Benchmarks. 37223-37250 - Weiqin Wang, Yile Wang, Kehao Chen, Hui Huang:

Beyond Majority Voting: Towards Fine-grained and More Reliable Reward Signal for Test-Time Reinforcement Learning. 37251-37265 - Dohyeon Lee, Yeonseok Jeong, Seung-won Hwang:

Beyond Markovian Forgetfulness: Episodic Memory for Reasoning-Intensive Retrieval. 37266-37280 - Xiaobo Liang, Wanfu Wang, Qipeng Huang, Yuyang Ding, Zecheng Tang, Yixin Ji, Qianben Chen, Zhe Zhao, Kehai Chen, Juntao Li, Min Zhang:

DUAL RM: Beyond Rule-based Preference Reward Modeling via Meta-Reward. 37281-37296 - Anda Cao, Zhuo Gou, Yi Wang, Kaixuan Chen, Yu Wang, Can Wang, Mingli Song, Jie Song:

Evolutionary Negative Module Pruning for Better LoRA Merging. 37297-37310 - Yuhao Li, Haifeng Sun, Xuesong Zhang, Shu Yao, Haoyu Zheng, Yvchuan Wang, Huazheng Wang, Zirui Zhuang, Qi Qi, Jianxin Liao, Jingyu Wang:

Example Quality Matters: Multi-Aspects Example Augmentation for Private Library Programming. 37311-37327 - Xuefei Wang, Haoyu Tang, Tianyuan Liang, Zhibin Wang, Yupeng Hu, Weili Guan:

Resonating with RoPE: Spectral Quantization for High-Fidelity Key Cache Compression. 37328-37348 - Wei Tian, Yuhao Zhou, Man Lan:

CSRP: Chain-of-Thought Reasoning for Chinese Text Correction via Reinforcement Learning with Efficiency-Aware Rewards. 37349-37365 - Jongho Kim, Jaeyoung Kim, Jihyuk Kim, Yu Jin Kim, Seung-won Hwang, Moontae Lee:

Adaptive Retrieval for Reasoning. 37366-37381 - Polina Tsvilodub, Jan-Felix Klumpp, Amir Pour, Jennifer Hu, Michael Franke:

On Emergent Social World Models - Evidence for Functional Integration of Theory of Mind and Pragmatic Reasoning in Language Models. 37382-37420 - Shouzheng Huang, Meishan Zhang, Baotian Hu, Min Zhang:

ToolOmni: Enabling Open-World Tool Use via Agentic learning with Proactive Retrieval and Grounded Execution. 37421-37439 - Baizhou Huang, Xiaojun Wan:

From TDMA to CDMA: A Multi-bit Watermark for Diffusion Language Models. 37440-37454 - Zerui Chen, Qinggang Zhang, Zhishang Xiang, Zhimin Wei, Linfeng Gao, Xiao Huang, Zhihong Zhang, Jinsong Su:

LegalGraphRAG: Multi-Agent Graph Retrieval-Augmented Generation for Reliable Legal Reasoning. 37455-37484 - Jiaoda Li, Ryan Cotterell:

Characterizing the Expressivity of Local Attention in Transformers. 37485-37507 - JungHyoun Kim, Soohyeong Kim, Seok Jun Hwang, Jeonghyeon Park, Yong Suk Choi:

TH-RAG : Topic-Based Hierarchical Knowledge Graphs for Robust Multi-hop Reasoning in Graph-based RAG Systems. 37508-37531 - Huije Lee, Jisu Shin, Hoyun Song, Changgeon Ko, Jong C. Park:

Beyond Static Benchmarks: Synthesizing Harmful Content via Persona-based Simulation for Robust Evaluation. 37532-37551 - Xinwei Li, Li Lin, Hui Jiao, Li Yao, Tien-Tsin Wong, Hanqian Wu:

DiVE: Decoupling Intra-layer Visual Evidence for Mitigating Hallucinations in Large Vision-Language Models. 37552-37568 - Muyu He, Anand Kumar, Soumyadeep Bakshi, James Zou, Nazneen Rajani:

Impatient Users Confuse AI Agents: High-fidelity Simulations of Human Traits for Testing Agents. 37569-37602 - Nakyung Lee, Sangwoo Hong, Jungwoo Lee:

Efficient Process Reward Modeling via Contrastive Mutual Information. 37603-37617 - YiFei Wang, Qizhi Pei, Jiangtao Feng, Yuntian Shi, Yi Duan, Lihao Wang, Lei Bai, Lijun Wu, Wei-Ying Ma, Hao Zhou:

R³: End-to-End Reasoning-based Planning for Multi-step Retrosynthesis via Reinforcement Learning. 37618-37632 - Yingtao Shen, An Zou:

River-LLM: Large Language Model Seamless Exit Based on KV Share. 37633-37645 - Minghan Zhang, Zhen Yang, Haodong Zou, Jie Chen, Zhen Duan, Shu Zhao:

Execution as Verification: Fine-Grained Self-Correcting Reasoning for Complex KBQA. 37646-37663 - Shixuan Ma, Jiahao Li, Zhendong Mao, Quan Wang:

Zero-Shot Detection of LLM-Generated Text using Temperature Sensitivity. 37664-37679 - Wenqi Yang, Jianjun Li, Zhibo Zhang, Mingqian Ding, Yushen Fang:

MARD: Module-Aware Reasoning Distillation for Language Models with Adaptive Supervision. 37680-37695 - Tianhao Niu, Ziyu Han, Qiguang Chen, Shiqi Zhou, Baocai Shan, Hengjie Fang, Qingfu Zhu, Wanxiang Che:

Dashboard2Code: Evaluating Multimodal Models on Reconstructing Interactive Dashboards. 37696-37732 - Rikuto Kotoge, Mai Nishimura, Jiaxin Ma:

Can Compact Language Models Search Like Agents? Distillation-Guided Policy Optimization for Preserving Agentic RAG Capabilities. 37733-37746 - Zhenpeng Su, Leiyu Pan, Minxuan Lv, Yuntao Li, Wenping Hu, Fuzheng Zhang, Kun Gai, Guorui Zhou:

CE-GPPO: Coordinating Entropy via Gradient-Preserving Clipping Policy Optimization in Reinforcement Learning. 37747-37760 - Jiawei Zhou, Chi Zhang, Xiang Feng, Qiming Zhang, Haibo Qiu, Lihuo He, Dengpan Ye, Xinbo Gao, Jing Zhang:

Omni-I2C: A Holistic Benchmark for High-Fidelity Image-to-Code Generation. 37761-37798 - Jia Liu, Jiaxin Luo

, Weiwen Xu, Jonathan M. Garibaldi, Xiaokun Wu, Yixue Hao, Min Chen:
Revealing Procedural Reasoning Structures in Chain-of-Thought Training via Span-Level Gradient Organization. 37799-37845 - Kaiyi Zhang, Ang Lv, Jinpeng Li, Yongbo Wang, Feng Wang, Haoyuan Hu, Rui Yan:

StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason. 37846-37864 - Changgeon Ko, Jisu Shin, Hoyun Song, Huije Lee, Eui Jun Hwang, Jong C. Park:

Social Dynamics as Critical Vulnerabilities that Undermine Objective Decision-Making in LLM Collectives. 37865-37890 - Jinhee Jang, Juhwan Choi, Dongjin Lee, Seunguk Yu, YoungBin Kim:

FairQE: Multi-Agent Framework for Mitigating Gender Bias in Translation Quality Estimation. 37891-37911 - Hong Ren, Liting Deng, Shaolin Zhu, Deyi Xiong:

AdaDPI: Document-level Translation Adaptive Agent via Dynamic Parametric Internalization. 37912-37929 - Eric Hanchen Jiang, Weixuan Ou, Run Liu, Shengyuan Pang, Guancheng Wan, Ranjie Duan, Wei Dong, Kai-Wei Chang, Xiaofeng Wang, Ying Nian Wu, Xinfeng Li:

Mitigating Over-Refusal in Aligned Large Language Models via Inference-Time Activation Energy. 37930-37950 - Kon Woo Kim

, Jin-Dong Kim, Akiko Aizawa:
Refining and Reusing Annotation Guidelines for LLM Annotation. 37951-37964 - Tathagata Raha, Clément Christophe, Nada Saadi, Hamza Javed, Marco A. F. Pimentel, Ronnie Rajan, Praveenkumar Kanithi:

Cross-Examination Framework: A Task-Agnostic Diagnostic for Information Fidelity in Text-to-Text Generation. 37965-37985 - Gautam Siddharth Kashyap, Mark Dras, Usman Naseem:

AlignCultura: Towards Culturally Aligned Large Language Models? 37986-37996 - Pranjal A. Chitale, Varun Gumma, Sanchit Ahuja, Prashant Kodali, Manan Uppadhyay, Deepthi Sudharsan, Sunayana Sitaram:

UPDESH: Synthesizing Grounded Instruction Tuning Data for 13 Indic Languages. 37997-38041 - Eric Hanchen Jiang, Levina Li, Frank Wan, Xiao Liang, Sophia Yin, Yuchen Wu, Xinfeng Li, Yizhou Sun, Wei Wang, Kai-Wei Chang, Ying Nian Wu:

Dynamic Generation of Multi LLM Agents Communication Topologies with Graph Diffusion Models. 38042-38060 - Gang Hu, Yating Chen, Haiyan Ding, Wang Gao, Jiajia Huang, Min Peng, Qianqian Xie, Kun Yue:

TaxPraBen: A Scalable Benchmark for Structured Evaluation of LLMs in Chinese Real-World Tax Practice. 38061-38104 - Yongjiang Liu, Haoxi Li, Xiaosong Ma, Jie Zhang, Song Guo:

Think How to Think: Mitigating Overthinking with Autonomous Difficulty Cognition in Large Reasoning Models. 38105-38126 - Xiusheng Huang, Zhe Li, Xuanwu Yin, Lu Wang, Yequan Wang, Dong Li, Emad Barsoum, Kang Liu:

Theory-optimal Quantization Based on Flatness. 38127-38142 - Akash Ghosh, Subhadip Baidya, Sriparna Saha, Xiuying Chen:

When Background Matters: Breaking Medical Vision Language Models by Transferable Attack. 38143-38170 - Chongyuan Dai, Yaling Shen, Zihan Gao, Jia Li, Yishun Jiang, Yaxiong Wang, Liu Liu, Zongyuan Ge, Jinpeng Hu:

Tears or Cheers? Benchmarking LLMs via Culturally Elicited Distinct Affective Responses. 38171-38196 - Nikita Afonin, Nikita Andriyanov, Vahagn Hovhannisyan, Nikhil Bageshpura, Kyle Liu, Kevin Zhu, Sunishchal Dev, Ashwinee Panda, Oleg Rogov, Elena Tutubalina, Alexander Panchenko, Mikhail Seleznyov:

Emergent Misalignment via In-Context Learning: Narrow in-context examples can produce broadly misaligned LLMs. 38197-38212 - Guibin Zhang, Haiyang Yu, Kaiming Yang, Bingli Wu, Fei Huang, Yongbin Li, Shuicheng Yan:

EvoRoute: Experience-Driven Self-Routing LLM Agent Systems. 38213-38225 - Jessie Wang, Jiawen Duan, Jian Wang, Kaitao Song, Chunpu Xu, Johnny K. W. Ho, Fenggang Yu, Johan F. Hoorn, Wenjie Li:

Foresight Optimization for Strategic Reasoning in Large Language Models. 38226-38246 - Junchao Wu, Yefeng Liu, Chenyu Zhu, Hao Zhang, Zeyu Wu, Tianqi Shi, Yichao Du, Longyue Wang, Weihua Luo, Jinsong Su, Derek F. Wong:

DetectRL-X: Towards Reliable Multilingual and Real-World LLM-Generated Text Detection. 38247-38294 - Jun-Hak Yun, Seung-Bin Kim, Seong-Whan Lee:

ImmersiveTTS: Environment-Aware Text-to-Speech with Multimodal Diffusion Transformer and Domain-Specific Representation Alignment. 38295-38314 - Liang-Bo Ning, Yuchen Zhu, Heqing Huang, Xin Wang, Yi Chang, Qing Li, Wenqi Fan:

When Efficiency Becomes a Vulnerability: Computational Cost Attacks on WebAgents. 38315-38335 - Siyuan Li, Yunjia Wu, Yiyong Xiao, Pingyang Huang, Peize Li, Ruitong Liu, Yan Wen, Te Sun:

Evolving Beyond Snapshots: Harmonizing Structure and Sequence via Entity State Tuning for Temporal Knowledge Graph Forecasting. 38336-38350 - Xingyu Yao, Zhendong Mao, Quan Wang:

CodeRipple: Wavelet-Based Detection of LLM-Generated Code. 38351-38364 - Yuma Ichikawa, Naoya Takagi, Takumi Nakagawa, Yuzi Kanazawa, Akira Sakai:

PHOTON: Hierarchical Autoregressive Modeling for Lightspeed and Memory-Efficient Language Generation. 38365-38383 - Runsong Zhao, Shilei Liu, Jiwei Tang, Langming Liu, Haibin Chen, Weidong Zhang, Yujin Yuan, Tong Xiao, JingBo Zhu, Wenbo Su, Bo Zheng:

CoMeT: Collaborative Memory Transformer for Efficient Long Context Modeling. 38384-38402 - Dingling Xu, Ruobing Wang, Qingfei Zhao, Yukun Yan, Zhichun Wang, Daren Zha, Shi Yu, Zhenghao Liu, Shuo Wang, Xu Han, Maosong Sun:

CheckRLM: Effective Knowledge-Thought Coherence Checking in Retrieval-Augmented Reasoning. 38403-38426 - Yukang Wu, Xiyuan Jia, Jiayi Wu, Hongchen Yu, Yuhan Qiu, Guohua Wu:

CAMEC: Complexity-Aware Multi-Expert Collaboration for Reliable Chinese Medical Question Answering. 38427-38457 - Yangneng Chen, Junlin Li, Weijun Yao, Xilai Ma, Guodong Du, Wenya Wang, Jing Li:

Vocabulary Hijacking in LVLMs: Unveiling Critical Attention Heads by Excluding Inert Tokens to Mitigate Hallucination. 38458-38485 - Xintao Wang, Jian Yang, Weiyuan Li, Rui Xie, Jen-tse Huang, Jun Gao, Shuai Huang, Yueping Kang, Yuanli Guo, Hongwei Feng, Yanghua Xiao:

HumanLLM: Benchmarking and Improving LLM Anthropomorphism via Human Cognitive Patterns. 38486-38517 - Shuliang Liu, Songbo Yang, Dong Fang, Sihang Jia, Yuqi Tang, Lingfeng Su, Ruoshui Peng, Yibo Yan, Xin Zou, Xuming Hu:

Vision-Language Introspection: Mitigating Overconfident Hallucinations in MLLMs via Interpretable Bi-Causal Steering. 38518-38543 - Zhengpeng Shi, Yanpeng Zhao, Jianqun Zhou, Yuxuan Wang, Qinrong Cui, Wei Bi, Song-Chun Zhu, Bo Zhao, Zilong Zheng:

v-HUB: A Benchmark for Video Humor Understanding from Vision and Sound. 38544-38567 - Jiho Gwak, Yuchul Jung:

Beyond Single Representations: Multi-Model Embedding Fusion for Stable Text Classification. 38568-38577 - Zhaohan Zhang, Chengzhengxu Li, Xiaoming Liu, Chao Shen, Ziquan Liu, Ioannis Patras:

Confidence Should Be Calibrated More Than One Turn Deep. 38578-38594 - Zhihao Luo, Wentao Yan, Jingyu Gong, Min Wang, Zhizhong Zhang, Xuhong Wang, Yuan Xie, Xin Tan:

NaviMaster: Learning a Unified Policy for GUI and Embodied Navigation Tasks. 38595-38615 - Timon Ziegenbein

, Maja Stahl
, Henning Wachsmuth
:
Teaching LLMs Human-Like Editing of Inappropriate Argumentation via Reinforcement Learning. 38616-38637 - Hao Wu, Hongru Sun, Wanqing Li, Xinguo Yu, Hao Ming, Xiao Luo, Wenbin Zhang, Jiahong Zhao, Yi Guo, Jie Yang:

FLAIR: Steering LLM Mathematical Problem Solving based on A Fuzzy-Logic-AssIsted Reasoner. 38638-38661 - Joeun Kim, Seunghyouk Yoon, Xuan-Bach Le, Youngeun Nam, Doyoung Kim, Hwanjun Song, Jae-Gil Lee:

QuDAR: Query-Wise Dual-Perspective Adaptive Retrieval. 38662-38679 - Zuolong Li, Pingyu Wu, Xianwen Huang, Tianyi Wei, Wenbo Zhou:

Trait Activation in Silicon: A Situation-Aware Framework for Psychologically Grounded Role-Playing. 38680-38698 - Jinyuan Fang, Zaiqiao Meng, Craig Macdonald:

SPARKLE: A Structured and Plug-and-play Agentic Retrieval Policy for Adaptive RAG Models. 38699-38719 - Fengying Ye, Yanming Sun, Runzhe Zhan, Lidia S. Chao, Zheqi Zhang, Derek F. Wong:

G-IdiomAlign: A Gloss-Pivoted Benchmark for Cross-Lingual Idiom Alignment. 38720-38739 - Tim Baumgärtner, Iryna Gurevych:

SciCoQA: Quality Assurance for Scientific Paper-Code Alignment. 38740-38770 - Yuancheng Yang, Lin Yang, Xu Wang, Chao Tong, Haihua Yang:

ImpRIF: Stronger Implicit Reasoning Leads to Better Complex Instruction Following. 38771-38796 - Feiyu Zhao, Yiming Chen, Wenhuan Lu, Daipeng Zhang, Xianghu Yue, Jianguo Wei:

HalluAudio: A Comprehensive Benchmark for Hallucination Detection in Large Audio-Language Models. 38797-38816 - Francesco Maria Molfese, Luca Moroni, Ciro Porcaro, Simone Conia, Roberto Navigli:

ReTraceQA: Evaluating Reasoning Traces of Small Language Models in Commonsense Question Answering. 38817-38832 - Baichuan Huang, Ananth Balashankar, Amir Aminifar:

BEFT: Bias-Efficient Fine-Tuning of Language Models in Low-Data Regimes. 38833-38851 - Yumeng Fu, Weitao Huang, Junjie Wu, Hao Teng, Meishan Zhang, Bingquan Liu:

JoPR: Joint Emotion Perception and Reasoning for Conversational Emotion Recognition. 38852-38864 - Yilong Chen, Junyuan Shang, Yuchen Feng, Zhenyu Zhang, Naibin Gu, Ziqi Wang, Tingwen Liu, Shuohuan Wang, Yu Sun, Hua Wu, Haifeng Wang:

Uncertainty-Aware Routing for Principled Alignment with MoE Dynamics. 38865-38880 - Guanqun Bi, Zhoufu Liu, Zhuang Chen, Dazhen Wan, Xiyao Xiao, Minlie Huang:

S⌃4: Operationalizing Speech Act Theory for Strategic Semi-Structured Psychiatric Interview. 38881-38899 - Adrián Gude, Roi Santos-Rios, Francis Bond, Dan Flickinger, Carlos Gómez-Rodríguez, Olga Zamaraeva:

More Aligned, Less Diverse? Analyzing the Grammar and Lexicon of Two Generations of LLMs. 38900-38911 - Yuewen Liu, Peng Xu, Muxi Diao, Anyi Zhang, Yang Li, Yutong Zhang:

MemCoRL: Alternating Co-Optimization of Memory Retrieval and Utilization via Collaborative Reinforcement Learning. 38912-38924 - Viktoriia Chekalina, Gerasin Timofey, Andrey Kuznetsov, Evgeny Frolov:

Fast and Accurate Fisher-Guided Quantization via Efficient Kronecker Factorization. 38925-38935 - Feihao Fang, My T. Thai, Yuanyuan Lei:

Discovering a Shared Logical Subspace: Steering LLM Logical Reasoning via Alignment of Natural-Language and Symbolic Views. 38936-38956 - Yixiao Zhou, Dongzhou Cheng, Zhiliang Wu, Yi Yang, Yu Cheng, Hehe Fan:

One Refiner to Unlock Them All: Inference-Time Reasoning Elicitation via Reinforcement Query Refinement. 38957-38978 - Dan Shi, Zhuowen Han, Simon Ostermann, Renren Jin, Josef van Genabith, Deyi Xiong:

Why Does Reinforcement Learning Generalize? A Feature-Level Mechanistic Study of Post-Training in Large Language Models. 38979-39000 - Yilong Chen, Zitian Gao, Yihao Xiao, Jason Klein Liu, Xinyu Yang, Yifan Luo, Haoming Luo, Zhengmao Ye, Tingwen Liu, Ran Tao, Bryan Dai:

Polymorphic Universal Transformer. 39001-39013 - Chengzhengxu Li, Xiaoming Liu, Zhaohan Zhang, Shengchao Liu, Guoxin Ma, Yu Lan, Cong Wang, Chao Shen:

Can Reasoning Path still be Effective as Input? Bridging Post-Reasoning to Chain-of-Thought Compression. 39014-39034 - Mengjie Li, Yuan Feng, Xike Xie, William J. Song

:
REAL: REtrieval-reAsoning and Logic-constructed Attention Behaviors for Long-Context KV Cache Compression. 39035-39052 - Pavel Chizhov, Egor Bogomolov, Ivan P. Yamshchikov:

From Where Words Come: Efficient Regularization of Code Tokenizers Through Source Attribution. 39053-39073 - Pengze Guo, Jingxi Liang, Zhiwen Xie, Qifeng Wang, Derek F. Wong:

EmoS: A High-Fidelity Multimodal Benchmark for Fine-grained Streaming Emotional Understanding. 39074-39089 - Thomas P. Utting, Mario Giulianelli, Arabella Sinclair:

Surprisal Minimisation over Goal-directed Alternatives Predicts Production Choice in Dialogue. 39090-39109 - Xueyan Wang, Dingyi Yang, Qin Jin:

HowToNarrate: A General-Domain Benchmark for Synchronized Video Narration with External Knowledge. 39110-39131 - Woody Haosheng Gan, William Barr Held, Diyi Yang:

Putting HUMANS first: Efficient LAM Evaluation with Human Preference Alignment. 39132-39174 - Thang Le, Huy Huu Nguyen, Anh Tuan Luu, Thamar Solorio, Thien Huu Nguyen:

Towards Fast and Accurate Modeling for Cross-Lingual Label Projection. 39175-39198 - Marta Vázquez Abuín, José Camacho-Collados, Marcos García:

False Friends or Cognates? A Cross-lingual Semantic Ambiguity Evaluation for Galician, Portuguese and Spanish. 39199-39214 - Rui Miao, Yixin Liu, Yili Wang, Xu Shen, Yue Tan, Yiwei Dai, Shirui Pan, Xin Wang:

BlindGuard: Safeguarding LLM-based Multi-Agent Systems under Unknown Attacks. 39215-39234 - Jinrui Wang, Zhenfeng Gao, Wendan Wang, Huili Wang, Zichen Qin, Linjie Zhu, Hongke Fu, Shangguang Wang, Tao Qi:

Black-Box Membership Inference Attacks for Video Training Data in Multimodal Large Language Models. 39235-39248 - Xiyao Dong, Guangsheng Cheng, YiLong Chen, Xiaojin Zhang, Kun He:

Mitigating Safety Context Amnesia in Multimodal Reasoning Models via Intent-Guided Safety Reasoning. 39249-39276 - Di Wu, Jiaxin Fan, Chloe Gu, Guanbo Wang, Wei Yin, Wenhao Li, Bo Jin:

On-policy Reinforcement Fine-tuning with Offline reward for Multi-step Embodied Planning. 39277-39307 - Yupeng Qi, Ziyu Lyu, Lixin Cui, Lu Bai, Feng Xia:

Please refuse to answer me! Mitigating Over-Refusal in Large Language Models via Adaptive Contrastive Decoding. 39308-39325 - Xinyue Fang, Zhiliang Tian, Zhen Huang, Ziyi Pan, Zhihua Wen, Xi Wang, Quntian Fang, Dongsheng Li:

Knowledge Injection Exists in MoE? Exploring Expert-Aware Contrast Decoding in MoE for Mitigating LLMs' Hallucinations. 39326-39343 - Yumeng Fu, Weitao Huang, Junjie Wu, Hao Teng, Shouduo Shang, Meishan Zhang, Bingquan Liu:

ERCThinker: Fast-Slow Thinking for Emotion Recognition in Conversation. 39344-39359 - Rishita Agarwal, Himanshu Singhal, Peter Baile Chen, Manan Roy Choudhury, Dan Roth, Vivek Gupta:

REaR : Retrieve, Expand and Refine for Effective Multitable Retrieval. 39360-39374 - Meiqi Chen, Fandong Meng, Jie Zhou:

Figure It Out: Improve the Frontier of Reasoning with Executable Visual States. 39375-39388 - Zhuo Li, Yupeng Zhang, Pengyu Cheng, Jiajun Song, Mengyu Zhou, Hao Li, Shujie Hu, Yu Qin, Erchao Zhao, Xiaoxi Jiang, Guanjun Jiang:

MARCH: Multi-Agent Reinforced Check for Hallucination. 39389-39415 - Jianzhe Ma

, Wenxuan Wang, Qin Jin:
A Survey of Deep Learning for Geometry Problem Solving. 39416-39448 - Yu Liang, Liangxin Liu, Longzheng Wang, Yan Wang, Yueyang Zhang, Long Xia, Zhiyuan Sun, Daiting Shi:

ConsistRM: Improving Generative Reward Models via Consistency-Aware Self-Training. 39449-39466 - Xuancheng Li, Haitao Li, Yujia Zhou, Yiqun Liu, Qingyao Ai:

Beyond Experience Retrieval: Learning to Generate Utility-Optimized Structured Experience for Frozen LLMs. 39467-39482 - Riley Grossman, Yi Chen:

Zero-shot Large Language Models for Automatic Readability Assessment. 39483-39499 - Zhi Xu, Yun Fu:

NoisyCausal: A Benchmark for Evaluating Causal Reasoning Under Structured Noise. 39500-39513 - Boxuan Wang, Zhuoyun Li, Xinmiao Huang, Xiaowei Huang, Yi Dong:

Chain-of-Thought as a Lens: Evaluating Structured Reasoning Alignment between Human Preferences and Large Language Models. 39514-39530 - Yuanhong Huang, Huili Wang, Xueying Bai, Jinrui Wang, Jiajun Liu, Ziqin Wang, Wanchun Ni, Shangguang Wang, Tao Qi:

Robust Membership Inference for Large Language Models under Adversarial Generative Corruption. 39531-39547 - Bowei Zhang, Hanbing Liu, Qixin Tian, Siyu Chen, Ziyuan Wang, Qi Qi:

Towards Trustworthy Smart Contract Synthesis: A Multi-Agent Framework with Lean-Based Verification. 39548-39582 - Seungeon Lee, Soumi Das, Manish Gupta, Krishna P. Gummadi:

LoRA on the Go: Instance-level Dynamic LoRA Selection and Merging. 39583-39601 - Hyunjung Joo, GyeongTaek Lee:

Deep Supervised Contrastive Learning of Pitch Contours for Robust Pitch Accent Classification in Seoul Korean. 39602-39621 - Shaofan Liu, Guoqiang Zhang, Shihan Dou, Huiyuan Zheng, Yiming Zhou, Junjie Ye, Shaowen Wang, Shichun Liu, Jiazheng Zhang, Tao Gui, Qi Zhang, Xuanjing Huang:

DARM: Distribution-Aware Reward Modeling by Alleviating Biases from Low Preference-Context Dependency Data. 39622-39639 - Baochang Ren, Shuofei Qiao, Ningyu Zhang, Da Zheng, Huajun Chen:

KnowRL: Exploring Knowledgeable Reinforcement Learning for Factuality. 39640-39658 - Zhenguang Wang, Bo Li, Wenhui Tan, Peng Cao, Yang Wang, Jia Duan, Fei Wang, Osmar R. Zaïane:

Rethinking Depression Prediction from a Fine-Grained Subscore Modeling Perspective via Multi-Task Learning. 39659-39672 - Hao Zhang, Mengsi Lyu, Zhuo Chen, Yulong Ao, Yonghua Lin:

PDTrim: Targeted Pruning for Prefill-Decode Disaggregation in Inference. 39673-39690 - Xu Liu, Yan Chen, Kan Ling, Yichi Zhu, Hengrun Zhang, Guisheng Fan, Huiqun Yu:

ASTRA: An Automated Framework for Strategy Discovery, Retrieval, and Evolution for Jailbreaking LLMs. 39691-39710 - Difan Jiao, Yilun Liu, Ye Yuan, Zhenwei Tang, Linfeng Du, Haolun Wu, Ashton Anderson:

LLM Safety From Within: Detecting Harmful Content with Internal Representations. 39711-39727 - Shuaiyi Nie, Siyu Ding, Wenyuan Zhang, Linhao Yu, Tianmeng Yang, Yao Chen, Weichong Yin, Yu Sun, Hua Wu, Tingwen Liu:

AttnPO: Attention-Guided Process Supervision for Efficient Reasoning. 39728-39748 - Sunil Kumar Maurya, Xin Liu:

Evaluating LLMs on Large-Scale Graph Property Estimation via Random Walks. 39749-39777 - Wenting Chen, Guolin Huang, Wenxuan Wang, Zhongrui Zhu:

MedEinst: Benchmarking the Einstellung Effect in Medical LLMs through Counterfactual Differential Diagnosis. 39778-39798 - Yifei Wei, Linqing Zhong, Yi Liu, Yuxiang Lu, Xindong He, Maoqing Yao, Guanghui Ren:

Libra-VLA: Achieving Learning Equilibrium via Asynchronous Coarse-to-Fine Dual-System. 39799-39815 - Sean Trott, Samuel M. Taylor, Cameron Robert Jones, James A. Michaelov, Pamela D. Rivière:

Language Statistics and False Belief Reasoning: Evidence from 41 Open-Weight LMs. 39816-39833 - Jingwen Pu, Mingjun Shi

, Xinrui Ren, Yizhe Wang, Xinyu Zhang, Zhaokun Wang, Kun She:
Decoding-Unlearning: Fact Forgetting via Entropy-Guided Inference. 39834-39860 - Zihan Chen, Howard Hao Yang, Tony Q. S. Quek, Kai Fong Ernest Chong:

Global Adaptive Momentum Meets Local Personalized Perturbation: Efficient Federated LLM Fine-Tuning with Zeroth-Order Gradients. 39861-39875 - Bo Lv, Jingbo Sun, Jianwei Lv, Chen Tang, Shaojie Zhang, Nayu Liu, Guoxin Yu, Zihao Li, Qichao Zhang, Dongbin Zhao, Ping Luo, Yue Yu:

Beyond Query Memorization: Large Language Model Routing with Query Decomposition and Historical Matching. 39876-39892 - Yushuo Zheng, Huiyu Duan, Zicheng Zhang, Yucheng Zhu, Xiongkuo Min, Guangtao Zhai:

Market-Bench: Benchmarking Large Language Models on Economic and Trade Competition. 39893-39906 - Manyi Zhang, Ji-Fu Li, Zhongao Sun, Haoli Bai, Hui-Ling Zhen, Zhenhua Dong, Xianzhi Yu:

Benchmarking Post-Training Quantization of Large Language Models under Microscaling Floating Point Formats. 39907-39923 - Yangfan Wang, Tianyang Sun, Chen Tang, Jie Liu, Wei Cai, Jingchi Jiang:

HiEdit: Lifelong Model Editing with Hierarchical Reinforcement Learning. 39924-39942 - Zhong-Zhi Li, Xiao Liang, Zihao Tang, Lei Ji, Peijie Wang, Haotian Xu, Xing W, Haizhen Huang, Weiwei Deng, Yeyun Gong, Zhijiang Guo, Xiao Liu, Fei Yin, Cheng-Lin Liu:

Too Long, Do Re-weighting for Efficient LLM Reasoning Compression. 39943-39962 - Haodong Chen, Qiang Huang

, Jiaqi Zhao, Qiuping Jiang, Xiaojun Chang, Jun Yu:
Measuring Social Bias in Vision-Language Models with Face-Only Counterfactuals from Real Photos. 39963-39987 - Zhangqi Duan, Nigel Fernandez, Andrew Lan:

KASER: Knowledge-Aligned Student Error Simulator for Open-Ended Coding Tasks. 39988-40006 - Weidong Tang, Jierui Li, Yueling Hou, Zihan Mei, Can Zhang, Xinyan Wan, Zhiyuan Liang, Pengfei Zhou, Yang You, Wangbo Zhao:

GroupToM-Bench: Benchmarking Group Theory of Mind and Nonlinear Social Emergence in MLLMs. 40007-40031 - Tomoki Tsujimura, Matiss Rikters, Masaki Asada, Shusaku Egami, Tatsuya Ishigaki, Ken Yano, Hiroya Takamura:

Assessing the Belief Consistency of Large Language Models on the Logical Conversation Process. 40032-40055 - Woody Haosheng Gan, Deqing Fu, Julian Asilis, Ollie Liu, Vatsal Sharan, Robin Jia, Willie Neiswanger:

Textual Steering Vectors Can Improve Visual Understanding in Multimodal Large Language Models. 40056-40087 - Ponhvoan Srey, Xiaobao Wu, Cong-Duy T. Nguyen, Anh Tuan Luu:

Learning Uncertainty from Sequential Internal Dispersion in Large Language Models. 40088-40106 - Changyu Liu, Yiyang Liu, Taowen Wang, Qiao Zhuang

, James Chenhao Liang, Wenhao Yang, Renjing Xu, Qifan Wang, Dongfang Liu, Cheng Han:
On-the-Fly VLA Adaptation via Test-Time Reinforcement Learning. 40107-40125 - Hao Luo, Xiao Yan, Xinyan Li, Qiming Zeng, Yuhao Lin, Shanshan Feng, Hao Wang, Jiawei Jiang:

AdaMix: Adaptive Mixing for Short and Long Reasoning Adapters. 40126-40147 - Kensuke Okada, Yui Furukawa, Kyosuke Bunji:

Quantifying and Mitigating Socially Desirable Responding in LLMs: A Desirability-Matched Graded Forced-Choice Psychometric Study. 40148-40166 - Lei Yang, Leiyu Pan, Bojian Xiong, Renren Jin, Shaowei Zhang, Yue Chen, Ling Shi, Jiang Zhou, Junru Wu, Zhen Wang, Jianxiang Peng, Juesi Xiao, Tianyu Dong, Zhuowen Han, Zhuo Chen, Yuqi Ren, Deyi Xiong:

From Curated Data to Scalable Models: Continual Pre-training of Dense and MoE Large Language Models for Tibetan. 40167-40182 - Mutian Bao

, Qiuyi Qi, Tian Liang, Jinjian Zhang, Wei Zhou, Ming Kong, Linjian Mo, Qiang Zhu:
UrbanGeoEval: A City-Scale Benchmark for Evaluating Large Language Models in Geospatial Reasoning. 40183-40223 - Nishanth Sridhar Nakshatri, Eylon Caplan, Rajkumar Pujari, Dan Goldwasser:

TAIGR: Towards Modeling Influencer Content on Social Media via Structured, Pragmatic Inference. 40224-40248 - Atnafu Lambebo Tonja, Srija Anand, Emilio Villa-Cueva, Israel Abebe Azime, Jesujoba Oluwadara Alabi, Muhidin Mohamed, Debela Desalegn Yadeta, Negasi Haile Abadi, Abigail Oppong, Nnaemeka Casmir Obiefuna, Idris Abdulmumin, Naome A. Etori, Eric Peter Wairagala, Kanda Patrick Tshinu, Imanigirimbabazi Emmanuel, Gabofetswe Malema, Alham Fikri Aji, David Ifeoluwa Adelani, Thamar Solorio:

Afri-MCQA: Multimodal Cultural Question Answering for African Languages. 40249-40282 - Junbo Qi, Yi Zhang, Hanchu Ni, Che Liu, Zhimin Yao, Ruilin Yang, Xiancong Ren, Liangjian Wen, Wei Ge, Yuya Ieiri, Osamu Yoshie, Yong Dai, Xiaozhu Ju:

E-ViC: Reasoning Beyond Text via Embodied Visual Chain for Spatial Intelligence. 40283-40303 - Jiayi Tuo, Cheng Tang, Zihan Wang, Chenyue Zhou, Yao Li, Yanbiao Ma, Chao Wang, Wei Dai, Mingxuan Wang, Shitong Qin, Ziwei Zhao:

MessToClean: Evidence-Grounded Structure-Preserving Reconstruction for Real-World Degraded Exam Paper Images. 40304-40322 - Milan Miletic, Julie Kallini, Ekaterina Shutova:

Phonemes to the Rescue: Multilingual Tokenization Based on International Phonetic Alphabet. 40323-40349 - Miao Xie, Xiao Zhang, Yi Li, Chunli Lv:

Structure Guided Retrieval-Augmented Generation for Factual Queries. 40350-40370 - Farzad Shami

, Subhrasankha Dey
, Nico Van de Weghe, Henrikki Tenkanen
:
GROKE: Vision-Free Navigation Instruction Evaluation via Graph Reasoning on OpenStreetMap. 40371-40391 - Eunseon Seong, Harim Lee, Dahye Kim, Changhyun Kim, Dong-Kyu Chae:

Emotion-Wheel-Guided Audio-Referred Text Representation for Multimodal Emotion Recognition in Conversation. 40392-40403 - Runtao Liu, Ziyi Liu, Jiaqi Tang, Yue Ma, Renjie Pi, Jipeng Zhang, Qifeng Chen:

LongVideoAgent: Multi-Agent Reasoning with Long Videos. 40404-40416 - Abbas Ghaddar, Ivan Kobyzev, Boxing Chen, Yufei Cui:

BOSCH: Black-Box Binary Optimization for Short-Context Attention-Head Selection in LLMs. 40417-40444 - Tingchen Fu, Yafu Li, Jiawei Gu, Xiaoye Qu, Yu Cheng:

Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models. 40445-40463 - Jingping Liu, Xingchen Peng, Yan Zhou, Ziyan Liu, Jie Zhai, Ronghao Chen, Huacan Wang, Xiaofeng Jia:

MirrorQA: Benchmarking Multimodal LLMs on Mirror-Orientation Reasoning. 40464-40476 - Zhiwei Zhang, Fei Zhao, Rui Wang, Zezhong Wang, Bin Liang, Jiakang Wang, Yao Hu, Shaosheng Cao, Kam-Fai Wong:

Robust Tool Use via Fission-GRPO: Learning to Recover from Execution Errors. 40477-40491 - Lung-Hao Lee, Liang-Chih Yu, Natalia V. Loukachevitch, Ilseyar Alimova, Alexander Panchenko, Tzu-Mi Lin, Zhe-Yu Xu, Jian-Yu Zhou, Guangmin Zheng, Jin Wang, Sharanya Awasthi, Jonas Becker, Jan Philip Wahle, Terry Ruas, Shamsuddeen Hassan Muhammad, Saif M. Mohammad:

DimABSA: Building Multilingual and Multidomain Datasets for Dimensional Aspect-Based Sentiment Analysis. 40492-40518 - Zhaokun Wang, Jinyu Guo, Jingwen Pu, Hongli Pu, Meng Yang, Xunlei Chen, Jie Ou, Wenyi Li, Guangchun Luo, Wenhong Tian:

CAP: Controllable Alignment Prompting for Unlearning in LLMs. 40519-40539 - Mohit Talreja, Joshua Diao, Jim James, Radu Casapu, Tejas Santanam, Ethan Mendes, Alan Ritter, Wei Xu, James Hays:

GeoRC: A Benchmark for Geolocation Reasoning Chains. 40540-40564 - Marc Felix Brinner, Sina Zarrieß:

SemCSE-Multi: Multifaceted and Decodable Embeddings for Aspect-Specific and Interpretable Scientific Domain Mapping. 40565-40586 - Ruihan Zhang, Jun Sun:

Rendering Data Unlearnable by Exploiting LLM Alignment Mechanisms. 40587-40598 - Johannes Kirmayr, Lukas Stappen, Elisabeth André:

CAR-bench: Evaluating the Consistency and Limit-Awareness of LLM Agents under Real-World Uncertainty. 40599-40618 - Jihang Jin, Ronghao Chen, Hao Zhang, Ziyan Liu, Huacan Wang, Qi Ye, Jingping Liu:

Tiny Scales, Great Challenges: The Limits of Multimodal LLMs in Scale Recognition. 40619-40632 - Jiatong Ma, Longteng Guo, Yuchen Liu, Zijia Zhao, Dongze Hao, Xuanxu Lin, Jing Liu:

M³-VQA: A Benchmark for Multimodal, Multi-Entity, Multi-Hop Visual Question Answering. 40633-40669 - Hang Hu, Ziyan Liu, Rujie Wen, Ruihui Hou, Xueyan Wu, Mu Zhang, Jianxing Yu, Tong Ruan, Jingping Liu:

From Selection to Refinement: Iterative Optimization for Instruction Data. 40670-40684 - Ashley Lewis, Andrew Perrault, Eric Fosler-Lussier, Michael White:

VISTA: Verification In Sequential Turn-based Assessment. 40685-40714 - Zhonghang Yuan, Zhefan Wang, Fang Hu, Zihong Chen, Jinzhe Li, Gang Li, Jie Ying, Huanjun Kong, Songyang Zhang, Nanqing Dong:

Knowledge-to-Verification: Exploring RLVR for LLMs in Knowledge-Intensive Domains. 40715-40749 - Yuanchen Bei, Tianxin Wei, Xuying Ning, Yanjun Zhao, Zhining Liu, Xiao Lin, Yada Zhu, Hendrik F. Hamann, Jingrui He, Hanghang Tong:

Mem-Gallery: Benchmarking Multimodal Long-Term Conversational Memory for MLLM Agents. 40750-40784 - Euntae Kim, Soomin Han, Buru Chang:

HarDBench: A Benchmark for Draft-Based Co-Authoring Jailbreak Attacks for Safe Human-LLM Collaborative Writing. 40785-40831 - Tong Chen, Jiawei Guo, Yuxi Li, Baiming Chen, Houxing Ren, Zhang Zhiwei, Yunxiang Zhang

, Hanyang Xia, Kun Liang, Zhaoran Fan:
Mind Reader: Latent User Demand-Guided Content Optimization for Generative Search Engine. 40832-40848 - Guangyu Yang, Jinghong Chen, Jingbiao Mei, Weizhe Lin, Bill Byrne:

Retrieval-Augmented Defense: Adaptive and Controllable Jailbreak Prevention for Large Language Models. 40849-40868 - Rui Zhao, Xuewen Zhong, Xiaoyun Zheng, Jinsong Su, Yidong Chen:

CNSL-bench: Benchmarking the Sign Language Understanding Capabilities of MLLMs on Chinese National Sign Language. 40869-40890 - Federico Ranaldi, Leonardo Ranaldi, Fabio Massimo Zanzotto, Shay B. Cohen:

Thinking in Schemas: Robust Syllogistic Reasoning in LLMs. 40891-40909 - Hongju Su, Ke Li, Lan Yang, Honggang Zhang, Yi-Zhe Song:

Amadeus: Autoregressive Model with Bidirectional Attribute Modelling for Symbolic Music. 40910-40928 - Nuredin Ali Abdelkadir, Anjali Ratnam, Zeerak Talat, Stevie Chancellor:

FedMental: Evaluating Federated Learning for Mental Health Detection from Social Media Data. 40929-40944 - Yilin Li, Xiaojun Wan:

Edit-Aware Reward Modeling for Chinese Grammatical Error Correction. 40945-40957 - Ming Wang, Shuang Wu, Bixuan Wang, Lu Lin, Yuxin Chen, Xiaocui Yang, Daling Wang, Shi Feng, Yifei Zhang, Yufan Sun:

GenPT: Beyond Self-Report for Reliable LLM Psychometrics via Generative Projective Testing. 40958-40974 - Dongwook Lee, Eunwoo Song, Che Hyun Lee, Heeseung Kim, Sungroh Yoon:

Still Between Us? Evaluating and Improving Voice Assistant Robustness to Third-Party Interruptions. 40975-41004 - Gang Cheng, Haibo Jin, Wenbin Zhang, Haohan Wang, Jun Zhuang:

Learning to Conceal Risk: Controllable Multi-turn Red Teaming for LLMs in the Financial Domain. 41005-41020 - Huicong Li, Xiangbo Ji, Wei Wu:

Beyond Static Alignment: Adaptive Arbitration for Semantic Incongruence in Semi-Supervised Multimodal Sentiment Analysis. 41021-41032 - Alessandro Corona Mendozza

, Anders Søgaard:
LLM Beliefs Are in Their Heads. 41033-41067 - Tianjian Liu, Fanqi Wan, Jiajian Guo, Xiaojun Quan:

ProactiveEval: A Unified Evaluation Framework for Proactive Dialogue Agents. 41068-41100 - Onur Keles, Asli Özyürek, Gerardo Ortega, Kadir Gökgöz, Esam Ghaleb:

The Visual Iconicity Challenge: Evaluating Vision-Language Models on Sign Language Form-Meaning Mapping. 41101-41116 - Ziwei Huang, Yin Shu, Hao Fang, Quanyu Long, Wenya Wang, Qiushi Guo, Tiezheng Ge, Leilei Gan:

From Competition to Synergy: Unlocking Reinforcement Learning for Subject-Driven Image Generation. 41117-41136 - Fangda Ye, Kuicai Dong, Zhifei Xie, Yuxin Hu, Yihang Yin, Shurui Huang, Shikai Dong, Chen Zhang, Jianzhu Bao, Shuicheng Yan:

Deep-Reporter: Deep Research for Grounded Multimodal Long-Form Generation. 41137-41177 - Wenqi Zhang, Mengna Wang, Gangao Liu, Huixin Xu, Yiwei Jiang, Yongliang Shen, Guiyang Hou, Zhe Zheng, Hang Zhang, Xin Li, Jiajun Liu, Weiming Lu, Peng Li, Yueting Zhuang:

Embodied-Reasoner: Synergizing Visual Search, Reasoning, and Action for Embodied Interactive Tasks. 41178-41207 - Zhejun Zhang

, Wenqing Zhou
, Haozhe Xu, Lin Zhang, Lei Li:
Temporal Precision Matters: Brain-Tuning Speech Language Models with Millisecond-Resolution Neural Signals. 41208-41226 - Hao Zong, Conghu Yuan, Chao Bei, Wentao Chen, Huan Liu, Kaiyu Huang, Degen Huang:

One Pair Suffices: Unlocking Universal Zero-Shot Translation via Cross-Architecture Alignment. 41227-41237 - Junxiao Yang, Haoran Liu, Jinzhe Tu, Jiale Cheng, Zhexin Zhang, Shiyao Cui, Jiaqi Weng, Jialing Tao, Hui Xue, Hongning Wang, Han Qiu, Minlie Huang:

LASA: Language-Agnostic Semantic Alignment at the Semantic Bottleneck for LLM Safety. 41238-41259 - Yinuo Xu, Veronica Derricks, Allison Earl, David Jurgens:

Modeling Annotator Disagreement with Demographic-Aware Experts and Synthetic Perspectives. 41260-41294 - Alhim Adonai Vera Gonzalez, Carlos Hinojosa, Karen Sanchez, Haidar Bin Hamid, Donghoon Kim, Bernard Ghanem:

Multimodal Safety Evaluation in Generative Agent Social Simulations. 41295-41310 - Klaudia Thellmann, Bernhard Stadler, Michael Färber, Jens Lehmann:

Quantifying the Impact of Translation Errors on Multilingual LLM Evaluation. 41311-41334 - Miao Li, Irina Saparina, Alexander Gurung, Mirella Lapata:

Long-Context Reasoning Through Proxy-Based Chain-of-Thought Tuning. 41335-41347 - Xiaoliang Fu, Jiaye Lin, Yangyi Fang, Binbin Zheng, Chaowen Hu, Zekai Shao, Cong Qin, Lu Pan, Ke Zeng, Xunliang Cai:

MASPO: Unifying Gradient Utilization, Probability Mass, and Signal Reliability for Robust and Sample-Efficient LLM Reasoning. 41348-41365 - Michael Mooney, Edmond S. L. Ho:

Towards A Scanpath-Conditioned Surprisal Theory: Modeling Reader Information States. 41366-41380 - Han Zhu, Juntao Dai, Jiaming Ji, Haoran Li, Chengkun Cai, Pengcheng Wen, Chi-Min Chan, Boyuan Chen, Yaodong Yang, Sirui Han, Yike Guo:

SafeMT: Multi-turn Safety for Multimodal Language Models. 41381-41409 - Xiaoliang Fu, Jiaye Lin, Yangyi Fang, Chaowen Hu, Cong Qin, Zekai Shao, Binbin Zheng, Lu Pan, Ke Zeng:

From łog π to π: Taming Divergence in Soft Clipping via Bilateral Decoupled Decay of Probability Gradient Weight. 41410-41430 - Mitodru Niyogi, Éric Gaussier, Arnab Bhattacharya:

Paramanu: Compact and Competitive Monolingual Language Models for Low-Resource Morphologically Rich Indian Languages. 41431-41458 - Tobias Grantner, Emanuel Sallinger, Martin Flechl:

Linear-Time and Constant-Memory Text Embeddings Based on Recurrent Language Models. 41459-41481 - Binghai Wang, Yantao Liu, Yuxuan Liu, Tianyi Tang, Shenzhi Wang, Chang Gao, Chujie Zheng, Yichang Zhang, Le Yu, Shixuan Liu, Tao Gui, Qi Zhang, Xuanjing Huang, Bowen Yu, Fei Huang, Junyang Lin:

Outcome Accuracy is Not Enough: Aligning the Reasoning Process of Reward Models. 41482-41508 - Tarikul Islam Tamiti, Tonmoy Das, Nursadul Mamun, Anomadarshi Barua:

CIS-BWE: Chaos-Informed Speech Bandwidth Extension. 41509-41529 - Alex Chen, Renato Lui Geh, Aditya Grover, Guy Van den Broeck, Daniel Mingyi Israel:

The Pitfalls of KV Cache Compression. 41530-41553 - Georg Ahnert, Anna-Carolina Haensch, Barbara Plank, Markus Strohmaier:

Survey Response Generation: Generating Closed-Ended Survey Responses In-Silico with Large Language Models. 41554-41577 - Yiming Ni, Zhi-Qi Cheng, Jiayu Li, Wei Cheng:

Sign-Language Datasets at Scale: A Comprehensive Survey on Resources, Benchmarks, and Annotation Standards. 41578-41604 - Weibin Li, Jintao Cheng, Xiaoyu Tang, Chi Man Vong:

Anchoring the Affective Manifold: Learning Canonical and Disentangled Representations via Generative Cross-Modal Alignment. 41605-41614 - Yifan Song, Wenxuan Wendy Shi, Brian P. Bailey, Tal August:

Who Plays Which Role When? Communication Role Dynamics for Peer Recognition and Team Performance Prediction. 41615-41628 - Wenqiang Wang, Yujia Wen, Yan Xiao, Zhifeng Chen, Yangshijie Zhang, Peng Chen, Mingbo Yang, Xiaochun Cao:

Incomplete In-context Learning. 41629-41650 - Bishwamittra Ghosh, Soumi Das, Till Speicher, Qinyuan Wu, Mohammad Aflah Khan, Deepak Garg, Krishna P. Gummadi, Evimaria Terzi:

Fine-tuning vs. In-context Learning in Large Language Models: A Formal Language Learning Perspective. 41651-41697 - Chenchen Yuan, Zheyu Zhang, Gjergji Kasneci:

Where Paths Split: Localized, Calibrated Control of Moral Reasoning in Large Language Models. 41698-41721 - Joel Mire, Maria Antoniak, Steven R. Wilson, Zexin Ma, Achyutarama R. Ganti, Andrew Piper, Maarten Sap:

Social Story Frames: Contextual Reasoning about Narrative Intent and Reception. 41722-41763 - Hyosik Moon, Eldan Cohen:

Lightweight and Faithful Visual Condition Checking in Behavior Trees via Expert-Regularized Reinforcement Learning. 41764-41799 - Anwar Alajmi, Gabriele Pergola:

When in Doubt, Consult: Expert Debate for Sexism Detection via Confidence-Based Routing. 41800-41822 - Meiru Zhang, Zaiqiao Meng, Nigel Collier:

Failure Modes in Multi-Hop QA: The Weakest Link Effect and the Recognition Bottleneck. 41823-41846 - Mingyue Huo, Yiwen Shao, Yuheng Zhang:

TagSpeech: End-to-End Multi-Speaker ASR and Diarization with Fine-Grained Temporal Grounding. 41847-41862 - Ruoxi Ning, Yongpeng Zhu, Qingcheng Zeng, Tatsuki Kuribayashi, Freda Shi:

On the Effect of Hyperparameters in Language Modeling for Computational Linguistics. 41863-41880 - Girish, Mohd Mujtaba Akhtar, Muskaan Singh:

Prosody as Supervision: Bridging the Non-Verbal-Verbal for Multilingual Speech Emotion Recognition. 41881-41893 - William Rudman, Michal Golovanevsky, Dana Arad, Yonatan Belinkov, Carsten Eickhoff, Ritambhara Singh, Kyle Mahowald:

Mechanisms of Prompt-Induced Hallucination in Vision-Language Models. 41894-41912 - Sajib Acharjee Dip, Adrika Zafor, Bikash Kumar Paul, Uddip Acharjee Shuvo, Muhit Islam Emon, Xuan Wang, Liqing Zhang:

LLM4Cell: Taxonomy and Evaluation of LLM and Agentic Models for Single-Cell Biology. 41913-41954 - Laerdon Kim, Vivian Nguyen, Cristian Danescu-Niculescu-Mizil:

Wait! There's a Way Out: A Decision Mechanism for Forecasting Conversational Derailment. 41955-41974 - Peyman Baghershahi, Gregoire Fournier, Pranav Nyati, Sourav Medya:

From Nodes to Narratives: Explaining Graph Neural Networks with LLMs and Graph Context. 41975-41994 - Jiajun Zhang, Yuying Li, Zhixun Li, Xingyu Guo, Jingzhuo Wu, Leqi Zheng, Yiran Yang, Jianke Zhang, Qingbin Li, Shannan Yan, Changguo Jia, Junfei Wu, Zilei Wang, Qiang Liu, Liang Wang:

RealChart2Code: Bridging the Gap in Real-World Chart-to-Code Generation via Multi-Task Evaluation. 41995-42032 - Saujas Vaduguru, Yilun Hua, Yoav Artzi, Daniel Fried:

Success and Cost Elicit Convention Formation for Efficient Communication. 42033-42050 - Hyojung Han, Nishant Balepur, Jordan Lee Boyd-Graber, Marine Carpuat:

Measuring User's Mental Models of Speech Translation in Human-AI Collaboration. 42051-42065 - Mark Rothermel, Marcus Kornmann, Marcus Rohrbach, Anna Rohrbach:

VeriTaS: The First Dynamic Benchmark for Multimodal Automated Fact-Checking. 42066-42100 - Yiyang Wei, Tingyu Song, Siyue Zhang, Yilun Zhao:

A Survey of Reasoning-Intensive Retrieval: Progress and Challenges. 42101-42122 - Yuming Yang, Mingyoung Lai, Wanxu Zhao, Xiaoran Fan, Zhiheng Xi, Mingqi Wu, Chiyue Huang, Jun Zhao, Haijun Lv, Jian Tong, Yunhua Zhou, Yicheng Zou, Qipeng Guo, Tao Gui, Qi Zhang, Xuanjing Huang:

Which Reasoning Trajectories Teach Students to Reason Better? A Simple Metric of Informative Alignment. 42123-42150 - Farima Fatahi Bayat, Pouya Pezeshkpour, Estevam Hruschka:

From Proof to Program: Characterizing Tool-Induced Reasoning Hallucinations in Large Language Models. 42151-42169 - Komal Kumar, Aman Chadha, Salman Khan, Fahad Shahbaz Khan, Hisham Cholakkal:

Paper Circle: An Open-source Multi-agent Research Discovery and Analysis Framework. 42170-42188 - Lorenzo Proietti, Roman Grundkiewicz, Matt Post:

PEAR: Pairwise Evaluation for Automatic Relative Scoring in Machine Translation. 42189-42207 - Tuochao Chen, Bandhav Veluri, Hongyu Gong, Shyamnath Gollakota:

AV-Dialog: Spoken Dialogue Models with Audio-Visual Input. 42208-42225 - Gonzalo Ariel Meyoyan, Luciano Del Corro:

A BERTology View of LLM Orchestrations: Token- and Layer-Selective Probes for Efficient Single-Pass Classification. 42226-42239 - Jiyeon Kim, Hyunji Lee, Dylan Zhou, Sue Hyun Park, Seunghyun Yoon, Trung Bui, Franck Dernoncourt, Sungmin Cha, Minjoon Seo:

Can Large Language Models Keep Up? Benchmarking Online Adaptation to Continual Knowledge Streams. 42240-42272 - Gagan Mundada, Rohan Surana, Nandhini Swaminathan, Bodhisattwa Prasad Majumder, Junda Wu, Julian J. McAuley, Zhouhang Xie:

Evaluating Language Model Pluralism through In-the-wild Crowd Discussions. 42273-42296 - Afra Feyza Akyürek, Advait Gosai, Chen Bo Calvin Zhang, Vipul Gupta, Jaehwan Jeong, Anisha Gunjal, Tahseen Rabbani, Maria Mazzone, David Randolph IV, Mohammad Mahmoudi Meymand, Gurshaan Chattha, Paula Rodriguez, Diego A Mares Buendia, Pavit Singh, Michael Liu, Subodh Chawla, Peter Cline, Lucy Ogaz, Ernesto Gabriel Hernández Montoya, Zihao Wang, Pavi Bhatter, Marcos Ayestaran, Bing Liu, Yunzhong He:

PRBench: Large-Scale Expert Rubrics for Evaluating High-Stakes Professional Reasoning. 42297-42325 - Or David Shafran, Atticus Geiger, Mor Geva:

Constructing Interpretable Features from Compositional Neuron Groups. 42326-42348 - Alexander Scarlatos, Jaewook Lee, Simon Woodhead, Andrew Lan:

Simulated Students in Tutoring Dialogues: Substance or Illusion? 42349-42385 - Tianyu Yang, Sihong Wu, Yilun Zhao, Zhenwen Liang, Lisen Dai, Chen Zhao, Minhao Cheng, Arman Cohan, Xiangliang Zhang:

A Survey of Multimodal Mathematical Reasoning: From Perception, Alignment to Reasoning. 42386-42408 - Yifeng Ding, Hung Le, Songyang Han, Kangrui Ruan, Zhenghui Jin, Varun Kumar, Zijian Wang, Anoop Deoras:

Empowering Multi-Turn Tool-Integrated Agentic Reasoning with Group Turn Policy Optimization. 42409-42423 - Mingxuan Li, Hanchen Li, Chenhao Tan:

HypoEval: Hypothesis-Guided Evaluation for Natural Language Generation. 42424-42443 - Yaxin Luo, Jiacheng Cui, Xiaohan Zhao, Xinyi Shang, Jiacheng Liu, Xinyue Bi, Zhaoyi Li, Zhiqiang Shen:

LLMSurgeon: Diagnosing Data Mixture of Large Language Models. 42444-42459 - Sheriff Issaka, Keyi Wang, Yinka Ajibola, Oluwatumininu Samuel-Ipaye, Zhaoyi Zhang, Nicte Aguillon Jimenez, Evans Kofi Agyei, Abraham Lin, Rohan Ramachandran, Sadick Abdul Mumin, Faith Nchifor, Mohammed Shuraim Issah, Erick Rosas Gonzalez, Lieqi Liu, Sylvester Kpei, Jemimah Kusi Osei, Carlene Ajeneza, Persis Boateng, Prisca Adwoa Dufie Yeboah, Saadia Gabriel:

The African Languages Lab: A Collaborative Approach to Advancing Low-Resource African NLP. 42460-42477 - He Cheng, Yifu Wu, Saksham Khatwani, Maya Kruse, Dmitriy Dligach, Timothy A. Miller, Majid Afshar, Yanjun Gao:

LogosKG: Hardware-Optimized Scalable and Interpretable Knowledge Graph Retrieval. 42478-42493 - Muhammad Umer Sheikh, Khawar Shehzad, Salman Khan, Fahad Shahbaz Khan, Muhammad Haris Khan:

GCA Framework: A GCC Countries-Grounded Dataset and Agentic Pipeline for Climate Decision Support. 42494-42506 - Alvin Po-Chun Chen, Rohan Das

, Dananjay Srinivas, Alexandra Barry, Maksim Seniw, Maria Leonor Pacheco:
Effects of Collaboration on the Performance of Interactive Theme Discovery Systems. 42507-42526 - Zehua Cheng

, Wei Dai, Jiahao Sun, Thomas Lukasiewicz:
GraphSynth: Resolving the Diversity-Reliability Trade-off with Probabilistic Factor Graphs. 42527-42543 - Rohan Das

, Advait Deshmukh, Alexandria Leto, Zohar Naaman, I-Ta Lee, Maria Leonor Pacheco:
A Structured Clustering Approach for Inducing Media Narratives. 42544-42577 - Hailing Wang, Jianglin Lu, Yitian Zhang, Huimin Zeng, Yun Fu:

ACBQ: Adaptive Cross-Block Quantization of Large Language Models. 42578-42592 - Mohamed Shaaban

, Mohamed Elmahallawy:
SecureGate: Learning When to Reveal PII Safely via Token-Gated Dual-Adapters for Federated LLMs. 42593-42610 - Bryan R. Christ, Penelope Molitz, Beau LeBlond, Zachary Gottesman, Jonathan Kropko, Thomas Hartvigsen:

EDUMATH: Generating Standards-aligned Educational Math Word Problems. 42611-42643 - Chengming Cui, Tianxin Wei, Ziyi Chen, Ruizhong Qiu, Zhichen Zeng, Zhining Liu, Xuying Ning, Duo Zhou, Jingrui He:

AdaFuse: Adaptive Ensemble Decoding for Large Language Models. 42644-42657 - Linlin Yu, Xujiang Zhao, Dong Li, Yanchi Liu, Wei Cheng, Zhengzhang Chen, Chen Zhao, Feng Chen, Haifeng Chen:

Uncertainty-Aware Test-Time Search for Optimization Problem Solving. 42658-42669 - Jinho Choo, JunSeung Lee, Jimyeong Kim, Yeeho Song, S. K. Hong, Yeong-Dae Kwon:

TLPO: Token-Level Policy Optimization for Mitigating Language Confusion in Large Language Models. 42670-42690 - Runchao Li, Yao Fu, Mu Sheng, Haotian Yu, Xianxuan Long, Kenneth A. Loparo:

JW-SVD: Bridging the Cross-Modal Mismatch in Post-Training MLLM Compression. 42691-42702 - Shaoan Xie, Lingjing Kong, Xiangchen Song, Xinshuai Dong, Guangyi Chen, Eric P. Xing, Kun Zhang:

Advancing Reasoning in Diffusion Language Models with Denoising Process Rewards. 42703-42720 - Huizi Cui, Huan Ma, Qilin Wang, Yuhang Gao, Changqing Zhang:

Estimating the Black-box LLM Uncertainty with Distribution-Aligned Adversarial Distillation. 42721-42740 - Radin Shayanfar, Chu Fei Luo, Rohan Bhambhoria, Samuel Dahan, Xiaodan Zhu:

CoDial: Interpretable Task-Oriented Dialogue Systems Through Dialogue Flow Alignment. 42741-42763 - Yuyang Liu, Jingya Wang, Liuzhenghao Lv, Yonghong Tian:

BioProAgent: Neuro-Symbolic Grounding for Constrained Scientific Planning. 42764-42783 - Mohammad Mahdi Salmani-Zarchi, Zahra Rahimi, Heshaam Faili, Mohammad Javad Dousti:

MDP-GRPO: Stabilized Group Relative Policy Optimization for Multi-Constraint Instruction Following. 42784-42797 - Sibo Xiao, Jinyuan Fu, Zhongle Xie, Lidan Shou:

TokenTiming: A Dynamic Alignment Method for Universal Speculative Decoding Model Pairs. 42798-42812 - Yaowenqi Liu, BingXu Meng, Rui Pan, Yuxing Liu, Jerry Huang, Jiaxuan You, Tong Zhang:

GUIDE: Towards Scalable Advising for Research Ideas. 42813-42834 - Jiacheng Liang, Yao Ma, Tharindu Kumarage, Satyapriya Krishna, Rahul Gupta, Kai-Wei Chang, Aram Galstyan, Charith Peris:

ARES: Adaptive Red-Teaming and End-to-End Repair of Policy-Reward System. 42835-42851 - Yijie Hao, Lingjie Chen, Ali Emami, Joyce C. Ho:

Reasoning Traces Shape Outputs but Models Won't Say So. 42852-42878 - Yijiang River Dong, Tiancheng Hu, Zheng Hui, Caiqi Zhang, Ivan Vulic, Andreea Bobu, Nigel Collier:

Value of Information: A Framework for Human-Agent Communication. 42879-42896 - Jiacheng Liang, Tanqiu Jiang, Yuhui Wang, Rongyi Zhu, Fenglong Ma, Ting Wang:

AutoRAN: Automated Hijacking of Safety Reasoning in Large Reasoning Models. 42897-42931 - Xiaoting Wu, Yi Huang, Chunyang Gao, Mengfei Guo, Jingyu Yao, Junlan Feng:

Thinking Alignment of Scenario-Oriented User Simulation. 42932-42945 - Jie Ou, Jinyu Guo, Shiyao Guo, Yuang Li, Ruiqi Wu, Zhaokun Wang, Wenyi Li, Wenhong Tian:

AdapShot: Adaptive Many-Shot In-Context Learning with Semantic-Aware KV Cache Reuse. 42946-42960 - Tanmoy Mukherjee, Thomas Bailleux, Pierre Marquis, Zied Bouraoui:

Credal Concept Bottleneck Models for Epistemic-Aleatoric Uncertainty Decomposition. 42961-42980 - Junjie Liao, Huacong Tang, Zhou Ziheng, Yizhou Wang, Fangwei Zhong:

How do Role Models Shape Collective Morality? Exemplar-Driven Moral Learning in Multi-Agent Simulation. 42981-43016 - Lina Sun:

ReActR: Reasoning through Error-Activated Reflection for LLM Post-Training. 43017-43028 - Yihong Dong, Xue Jiang, Yongding Tao, Huanyu Liu, Kechi Zhang, Lili Mou, Rongyu Cao, Yingwei Ma, Jue Chen, Binhua Li, Zhi Jin, Fei Huang, Yongbin Li, Ge Li:

RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization. 43029-43053 - Yue Yang, Fan Yang, Yu Bai, Hao Wang:

Explain the Synth: Interpretable Evaluation of LLM Data Synthesis. 43054-43077 - Wenxuan Wang, Zizhan Ma, Guo Yu, Yiu-Fai Cheung

, Meidan Ding, Jie Liu, Wenting Chen, Linlin Shen:
Beyond the Leaderboard: Rethinking Medical Benchmarks for Large Language Models. 43078-43123 - Zhen Wan, Chao-Han Huck Yang, Jinchuan Tian, Hanrong Ye, Ankita Pasad, Szu-Wei Fu, Arushi Goel, Ryo Hachiuma, Shizhe Diao, Kunal Dhawan, Sreyan Ghosh, Yusuke Hirota, Zhehuai Chen, Rafael Valle, Chenhui Chu, Shinji Watanabe, Boris Ginsburg, Yu-Chiang Frank Wang:

Speech-Hands: A Self-Reflection Voice Agentic Approach to Speech Recognition and Audio Reasoning with Omni Perception. 43124-43142 - Lang Gao, Xuhui Li, Chenxi Wang, Mingzhe Li, Wei Liu, Zirui Song, Jinghui Zhang, Rui Yan, Preslav Nakov, Xiuying Chen:

When Personalization Tricks Detectors: The Feature-Inversion Trap in Machine-Generated Text Detection. 43143-43171 - Zhiyuan Shi, Qibo Qiu, Feng Xue, Zhonglin Jiang, Li Yu, Jian Jiang, Xiaofei He, Wenxiao Wang:

HeteroCache: A Dynamic Retrieval Approach to Heterogeneous KV Cache Compression for Long-Context LLM Inference. 43172-43187 - Sijia Luo, Xiaokang Zhang, Yuxuan Hu, Bohan Zhang, Ke Wang, Jinbo Su, Mengshu Sun, Lei Liang, Jing Zhang:

Sparse-RL: Breaking the Memory Wall in LLM Reinforcement Learning via Stable Sparse Rollouts. 43188-43201 - Ziqiao Xi, Shuang Liang, Qi Liu, Jiaqing Zhang, Letian Peng, Fang Nan, Meshal Nayim, Tianhui Zhang, Rishika Mundada, Lianhui Qin, Biwei Huang, Kun Zhou:

C-World: A Computer Use Agent Environment Creator. 43202-43216 - Iseo Kim, Eunjin Hong, Juae Kim:

Do Morals Guide How LLMs Think? The Role of Ethical Perspectives in General Problem Solving. 43217-43238 - Rohit Gupta, Jayakrishnan Unnikrishnan, Fan Fei, Sheng Liu, Son Tran, Mubarak Shah:

ViLL-E: Video LLM Embeddings for Retrieval. 43239-43258 - Rui Li, Shuang Cao

:
From Trajectories to Graphs: Contract-Checked Editing for Verifier-Guided LLM Reasoning. 43259-43306 - Junpeng Liu

, Jiuyi Li, Kaiyu Huang, Bo Jin, Degen Huang, Hui Xiong:
SiLP: Enhancing Non-Dominant Language Capabilities with a Selective Bidirectional Language Projection Framework. 43307-43325 - Kunal Samanta, Faisal Tareque Shohan, Amine Trabelsi, Richard Khoury:

Simple Agents, Biased Judges: Efficient Multi-Party Dialogue Generation & The Evaluation Gap. 43326-43345 - Yiming Yao, Jianwei Niu, Bin Dai, Tao Ren:

EdgeFormer: Latency-Aware Collaborative Multi-Head Attention of Transformer Inference in Edge Networks. 43346-43361 - Robin Vujanic, Thomas Rückstieß:

LEAF: Knowledge Distillation of Text Embedding Models with Teacher-Aligned Representations. 43362-43383 - Weiyang Huang, Xuefeng Bai, Kehai Chen, Xinyang Chen, Yibin Chen, Weili Guan, Min Zhang:

SAT: Balancing Reasoning Accuracy and Efficiency with Stepwise Adaptive Thinking. 43384-43402 - Wei-Chieh Huang, Henry Peng Zou, Yaozu Wu, Dongyuan Li, Yankai Chen, Weizhi Zhang, Yangning Li, Angelo Zangari, Jizhou Guo, Chunyu Miao, Liancheng Fang, Langzhou He, Yinghui Li, Renhe Jiang, Philip S. Yu:

Deep Research with Open-Domain Evaluation and Multi-Stage Guardrails for Safety. 43403-43446 - Kwangwook Seo, Dongha Lee:

P-Check: Advancing Personalized Reward Model via Learning to Generate Dynamic Checklist. 43447-43471 - Jikun Wan, Chen Gong, Guohong Fu:

Locate and Explain: Joint Multimodal Emotion Cause Extraction and Summarization in Conversation. 43472-43489 - Ruifeng Yuan, Chaohao Yuan, David Dai, Yu Rong, Hong Cheng, Hou Pong Chan, Chenghao Xiao:

Understanding the Behaviors of Environment-aware Information Retrieval. 43490-43503 - Fengxian Ji, Jingpu Yang, Zirui Song, Lang Gao, Junhong Liang, Zhenhao Chen, Jinghui Zhang, Xiuying Chen:

ServImage: An Image Generation and Editing Benchmark from Real-world Commercial Imaging Services. 43504-43529 - Bingkang Shi, Jen-tse Huang, Luo Long, Tianyu Zong, Hongzhu Yi, Yuanxiang Wang, Songlin Hu, Xiaodan Zhang, Zhongjiang Yao:

FAIRGAMER: Evaluating Social Biases in LLM-Based Video Game NPCs. 43530-43552 - Shuo Yang, Caren Han, Xueqi Ma, Yan Li, Mohammad Reza Ghasemi Madani, Eduard H. Hovy:

EVOTOOL: Self-Evolving Tool-Use Policy Optimization in LLM Agents via Blame-Aware Mutation and Diversity-Aware Selection. 43553-43572 - Md. Asiful Islam, Mihai Surdeanu:

A Lightweight Explainable Guardrail for Prompt Safety. 43573-43591 - Hieu Man, Van-Cuong Pham, Nghia Trung Ngo, Franck Dernoncourt, Thien Huu Nguyen:

Explainable Disentangled Representation Learning for Generalizable Authorship Attribution in the Era of Generative AI. 43592-43604 - Chenning Xu, Mao Zheng, Mingyu Zheng, Mingyang Song:

PodBench: A Comprehensive Benchmark for Instruction-Aware Audio-Oriented Podcast Script Generation. 43605-43621 - Jin Cui, Jiaqi Guo, Jiepeng Zhou, Ruixuan Yang, Jiayi Lu, Jiajun Xu, Jiangcheng Song, Boran Zhao, Pengju Ren:

MIND: From Passive Mimicry to Active Reasoning through Capability-Aware Multi-Perspective CoT Distillation. 43622-43636 - Zixuan Wang, Yuanyuan Lei:

Knowledge Vector of Logical Reasoning in Large Language Models. 43637-43651 - Faisal Hossain Raquib, Akm Moshiur Rahman Mazumder, Md Fahim, Md. Tahmid Hasan Fuad, Md Farhan Ishmam, Faria Sultana, M. Ashraful Amin, Amin Ahsan Ali, Akmmahbubur Rahman:

BanHADEX: Towards Explainable HAte Speech Detection in Bangla Using Human Annotated EXplanation. 43652-43674 - JungMok Lee, Sung-Bin Kim, Joohyun Chang, Lee Hyun, Tae-Hyun Oh:

SMILE-Next: Teaching Large Language Models to Detect, Classify, and Reason about Laughter. 43675-43693 - Ziqing Wang, Yibo Wen, Abhishek Pandey, Han Liu, Kaize Ding:

MolMem: Memory-Augmented Agentic Reinforcement Learning for Sample-Efficient Molecular Optimization. 43694-43712 - Lingfeng Zhong, Qiongkai Xu, Usman Naseem:

Activation Decomposition and Steering for LLM Backdoor Remediation. 43713-43737 - Ziqing Wang, Kexin Zhang, Zihan Zhao, Yibo Wen, Abhishek Pandey, Han Liu, Kaize Ding:

A Survey of Large Language Models for Text-Guided Molecular Discovery: From Molecule Generation to Optimization. 43738-43769 - Zelin Li, Jia Leng, Dawei Song, Yangen Hu:

Reward Alignment Optimization: A Direct Point-wise Alignment Approach. 43770-43784 - Derrick Goh Xin Deik, Quanyu Long, Zhengyuan Liu, Nancy F. Chen, Wenya Wang:

Programming over Thinking: Efficient and Robust Multi-Constraint Planning. 43785-43837 - Yuchun Fan, Bei Li, Peiguang Li, Yilin Wang, Yongyu Mu, Jian Yang, Xin Chen, Rongxiang Weng, Jingang Wang, Xunliang Cai, JingBo Zhu, Tong Xiao:

LANG: Reinforcement Learning for Multilingual Reasoning with Language-Adaptive Hint Guidance. 43838-43866 - Connor Baumler, Calvin Bao, Huy Nghiem, Xinchen Yang, Marine Carpuat, Hal Daumé III:

Can You Make It Sound Like You? Post-Editing LLM-Generated Text for Personal Style. 43867-43895 - Lishui Fan, Yu Zhang, Mouxiang Chen, Zhongxin Liu:

ReCode: Reinforcing Code Generation with Reasoning-Process Rewards. 43896-43914 - Byeongjin Kim, Gyuwan Kim, Seo Yeon Park:

PPA-Plan: Proactive Pitfall Avoidance for Reliable Planning in Long-Context LLM Reasoning. 43915-43941 - Ziyi Wang, Yuxuan Lu, Wenbo Li, Amirali Amini, Bo Sun, Yakov Bart, Weimin Lyu, Jiri Gesi, Tian Wang, Jing Huang, Yu Su, Upol Ehsan, Malihe Alikhani, Toby Jia-Jun Li, Lydia B. Chilton, Dakuo Wang:

OPeRA: A Dataset of Observation, Persona, Rationale, and Action for Evaluating LLMs on Human Online Shopping Behavior Simulation. 43942-43960 - Yuxuan Lu, Jing Huang, Yan Han, Bingsheng Yao, Sisong Bei, Yaochen Xie, Yisi Sang, Qi He, Dakuo Wang:

Can LLM Agents Simulate Multi-Turn Human Behavior? Evidence from Real Online Customer Behavior Data. 43961-43977 - Weicong Liu, Zixuan Yang, Yibo Zhao, Xiang Li:

RATE: Reviewer Profiling and Annotation-free Training for Expertise Ranking in Peer Review Systems. 43978-43996 - Qingyu Lu, Liang Ding, Kanjian Zhang, Jinxia Zhang, Dacheng Tao:

The Bitter Lesson of Diffusion Language Models for Agentic Workflows: A Comprehensive Reality Check. 43997-44020 - Ziyi Wang, Yuxuan Lu, Yimeng Zhang, Pei Chen, Ziwei Dong, Jing Huang, Jiri Gesi, Xianfeng Tang, Chen Luo, Qun Liu, Yisi Sang, Hanqing Lu, Manling Li, Jin Lai, Dakuo Wang:

Trajectory2Task: Training Robust Tool-Calling Agents with Synthesized Yet Verifiable Data for Complex User Intents. 44021-44044 - Ruifeng Yuan, Wanxing Chang, Weiwei Cao, Bowen Shi, Zhongyu Wei, Ling Zhang, Jianpeng Zhang:

CT-FineBench: A Diagnostic Fidelity Benchmark for Fine-Grained Evaluation of CT Report Generation. 44045-44058 - Zheng Luo, Thirulogasankar Pranav Kutralingam, Ogochukwu N. Okoani, Wanpeng Xu, Hua Wei, Xiyang Hu:

Lost in Execution: On the Multilingual Robustness of Tool Calling in Large Language Models. 44059-44077 - Xiaopeng Li, Yuanjin Zheng, Wanyu Wang, Wenlin Zhang, Pengyue Jia, Yingyi Zhang, Haiying He, Mengyang Ma, Yiqi Wang, Maolin Wang, Xuetao Wei, Xiangyu Zhao:

MTA: A Merge-then-Adapt Framework for Personalized Large Language Models. 44078-44091 - Shubin Kim, Yejin Son, Junyeong Park, Keummin Ka, Seungbeen Lee, Jaeyoung Lee, Hyeju Jang, Alice Oh, Youngjae Yu:

Investigating Counterfactual Unfairness in LLMs towards Identities through Humor. 44092-44138 - Ke Ma, Jiaqi Tang, Bin Guo, Xueting Han, Ruonan Xu, Qingfeng He, Ziheng Wang, Xu Wang, Qifeng Chen, Zhiwen Yu, Yunhao Liu:

Response-G1: Explicit Scene Graph Modeling for Proactive Streaming Video Understanding. 44139-44153 - Yichen Xu, Liangyu Chen, Liang Zhang, Zihao Yue, Jianzhe Ma

, Wenxuan Wang, Qin Jin:
POLYCHARTQA: Benchmarking Large Vision-Language Models with Multilingual Chart Question Answering. 44154-44186 - Yiqun Zhang, Peng Ye, Xiaocui Yang, Shi Feng, Shufei Zhang, Lei Bai, Wanli Ouyang, Shuyue Hu:

Nature-Inspired Population-Based Evolution of Large Language Models. 44187-44205 - Yiqun Zhang, Hao Li, Zihan Wang, Shi Feng, Xiaocui Yang, Daling Wang, Bo Zhang, Lei Bai, Shuyue Hu:

MTRouter: Cost-Aware Multi-Turn LLM Routing with History-Model Joint Embeddings. 44206-44226 - Jeongwoo Ryu, Soomin Kim, Jinsu Eun, Kyusik Kim, Changhoon Oh, Bongwon Suh:

Feeling Right vs. Being Right: How AI Sycophancy Affects Value-Laden Deliberation. 44227-44245 - Bin Chen

, Yu Zhang, Hongfei Ye, Huiyang Wang, Wenxi Liu, Hongyang Chen:
ParaSuite: Boosting LLM Reasoning via Paradox Resolution. 44246-44256 - ZhongDong Li, Weijie Shi, Yue Cui, Haolun Ma, Yuanjun Liu, Jiawei Li, An Liu, Jia Zhu, Jiajie Xu:

ReTRE: Benchmarking LLM Transfer Robustness with Structure-Preserving Variants. 44257-44268 - Jaehyun Jeon, Min Soo Kim, Janghan Yoon, Sumin Shim, Yejin Choi, Hanbin Kim, Dae Hyun Kim, Youngjae Yu:

Do MLLMs Capture How Interfaces Guide User Behavior? A Benchmark for Multimodal UI/UX Design Understanding. 44269-44294 - Shuyu Zhang, Yujie Liu, Xinru Wang, Cheng Zhang, Yanmin Zhu, Bin Li:

DarwinTOD: LLM-Driven Lifelong Self-evolution for Task-oriented Dialog Systems. 44295-44332 - Haochun Tang, Yuliang Yan, Jiahua Lu, Huaxiao Liu, Enyan Dai:

Route to Rome Attack: Directing LLM Routers to Expensive Models via Adversarial Suffix Optimization. 44333-44347 - Xinyi Wang, Wei Dai, Kyle Qiao, Ke Wang, Peng Chen, Gang Cao, Kang Qin, Zhongpu Wang, Xiaode Zhang, Yanming Liu, Jihao Gu, Jingtao Xu, Zhi Gong:

GUI0: Self-Evolving Foundational GUI Agents in Super App Ecosystems. 44348-44361 - Yang Liu, Chenhui Chu:

Understanding the Prompt Sensitivity. 44362-44388 - Sijia Chen, Baochun Li, Di Niu:

rSIM: Incentivizing Reasoning Capabilities of LLMs via Reinforced Strategy Injection. 44389-44405 - Guanghui Ye, Huan Zhao, Qin Zhu, Fengnan Li, Jiaqi Li, Yixian Shen, Zhonghao Ren, Zhihua Jiang:

Automatic and Reliable Evaluation for Academic Caption-to-Figure Generation with LMMs. 44406-44423 - Utsav Maskey, Sumit Yadav

, Mark Dras, Usman Naseem:
SafeConstellations: Mitigating Over-Refusals in LLMs Through Task-Aware Representation Steering. 44424-44440 - Bin Chen

, Hongfei Ye, Huiyang Wang, Wenxi Liu, Yu Zhang, Furui Liu:
AIPO: Adaptive Information Guided Token-Level Reinforcement Learning for Large Language Model Reasoning. 44441-44450 - Zhiheng Xi, Dingwen Yang, Jiaqi Liu, Jixuan Huang, Honglin Guo, Baodai Huang, Tinggang Chen, Qi Zhang, Zhonghang Lu, Chenyu Liu, Jiajun Sun, Jiazheng Zhang, Dingwei Zhu, Xin Guo, Junzhe Wang, Zhihao Zhang, Yuming Yang, Junjie Ye, Minghe Gao, Dongrui Liu, Jiaming Ji, Guohao Li, Tao Gui, Xuanjing Huang:

AgentGym2: Benchmarking Large Language Model Agents in De-Idealized Real-World Environments. 44451-44479 - Shunqi Mao, Chaoyi Zhang, Tom Weidong Cai:

Through the Magnifying Glass: Adaptive Perception Magnification for Hallucination-Free VLM Decoding. 44480-44501 - Jia Deng, Junyi Li, Xin Zhao, Jinpeng Wang, Hongyu Lu, Ji-Rong Wen:

Beyond Fully Random Masking: Attention-Guided Denoising and Optimization for Diffusion Language Models. 44502-44514 - Weixin Chen, Yuhan Zhao, Jingyuan Huang, Zihe Ye, Mingxuan Ju, Tong Zhao, Neil Shah, Li Chen, Yongfeng Zhang:

MemRec: Collaborative Memory-Augmented Agentic Recommender System. 44515-44544 - Junqi Yang, Yuecong Min, Jie Zhang, Shiguang Shan, Xilin Chen:

INFACT: A Diagnostic Benchmark for Induced Faithfulness and Factuality Hallucinations in Video-LLMs. 44545-44560 - Lipika Dewangan, Chandresh Kumar Maurya:

CLAOCS-TX: Cross-Lingual Triplet Extraction with Aspect-Opinion-Aware Code-Switched Prompting and LLM-Guided Contrastive Distillation. 44561-44577 - Yuqing Zhang, Honghui Sheng, Xueyu Hu, Shengyu Zhang, Fei Wu:

DAC-Bench: A Decision-Aware Benchmark for Compositional Mobile GUI Tasks. 44578-44598 - Geonwoo Hong, Taehwan Kim:

GMoE: Global Mixture of Experts with Logit Propagation. 44599-44614 - Xuan Dong, Zhe Han, Tianhao Niu, Qingfu Zhu, Wanxiang Che:

When Does Language Matter? Multilingual Instructions Reveal Step-wise Language Sensitivity in Vision-Language-Action Models. 44615-44629 - Parisa Rabbani, Priyam Sahoo, Ruben Mathew, Aishee Mondal, Harshita Ketharaman, Nimet Beyza Bozdag, Dilek Hakkani-Tür:

DialDefer: A Framework for Detecting and Mitigating LLM Dialogic Deference. 44630-44671 - Chi-Min Chan, Han Zhu, Chunyang Jiang, Jiaming Ji, Juntao Dai, Wei Xue, Sirui Han, Yike Guo:

Benchmarking Fine-Grained Error Detection in Multimodal Reasoning. 44672-44702 - Runyang You, Yongqi Li, Meng Liu, Wenjie Wang, Liqiang Nie, Wenjie Li:

Parallel Test-Time Scaling for Latent Reasoning Models. 44703-44717 - Ziyu Chen, Yilun Zhao, Chengye Wang, Rilyn Han, Manasi Patwardhan, Arman Cohan:

SciMDR: Advancing Scientific Multimodal Document Reasoning. 44718-44742 - Jianzhe Chai, Zhe Yu, Jun Sakuma:

When Benchmarks Leak: Inference-Time Decontamination for LLMs. 44743-44760 - Qiang Xia, Zijian Zhang, Ao Wang, Wenhan Wang, Xiangyu Wang, Jian Li:

HSGraphAgent: Knowledge-Graph-Guided Large Language Models for Harmonized System Code Classification. 44761-44773 - Hamed Damirchi, Imezadelajara, Ehsan Abbasnejad, Afshar Shamsi, Zhen Zhang, Javen Qinfeng Shi:

Truth as a Trajectory: What Internal Representations Reveal About Large Language Model Reasoning. 44774-44790 - Wenyi Xiao, Xinchi Xu, Leilei Gan:

VL-Calibration: Decoupled Confidence Calibration for Large Vision-Language Models Reasoning. 44791-44815 - Hao Huang, Jiatang Luo, Ruihua Zhou, Yunpeng Li, Yuling Liu:

Don't Corrupt the Fact: A Trustworthy RAG Watermarking Framework based on Dual Factual Shield. 44816-44826 - Jinghan Yu, Junhao Xiao

, Chenyu Zhu, Jiaming Li, Jia Li, HanMing Deng, Xirui Wang, Guoli Jia, Jianjun Li, Xiang Bai, Bowen Zhou, Zhiyuan Ma:
I2E: From Image Pixels to Actionable Interactive Environments for Text-Guided Image Editing. 44827-44850 - Qiancheng Xu, Yongqi Li, Fan Liu, Hongru Wang, Min Yang, Wenjie Li:

TInR: Exploring Tool-Internalized Reasoning in Large Language Models. 44851-44865 - Ryoma Kumon, Hitomi Yanaka:

Fine-Grained Analysis of Shared Syntactic Mechanisms in Language Models. 44866-44891 - Franziska Weeber, Vera Neplenbroek, Jan Batzner, Sebastian Padó:

One Persona, Many Cues, Different Results: How Sociodemographic Cues Impact LLM Personalization. 44892-44921 - Amr Mohamed, Yang Zhang, Michalis Vazirgiannis, Guokan Shang:

Lost in the Mix: Evaluating LLM Understanding of Code-Switched Text. 44922-44938 - Xingyu Wu, Yu Zhou, Kay Chen Tan:

Building LLMs Like LEGO: Two-dimensional Architecture Reassembly of Large Language Models. 44939-44956 - Minzhu Tu, Shiyu Ni, Keping Bi:

How Long Reasoning Chains Influence LLMs' Judgment of Answer Factuality. 44957-44972 - Yang Shi, Yifeng Xie, Minzhe Guo, Liangsi Lu, Mingxuan Huang, Jingchao Wang, Zhihong Zhu, Boyan Xu, Zhiqi Huang:

MMErroR: A Benchmark for Erroneous Reasoning in Vision-Language Models. 44973-44986 - Derong Xu, Shuochen Liu, Pengfei Luo, Pengyue Jia, Yingyi Zhang, Yi Wen, Yimin Deng, Wenlin Zhang, Enhong Chen, Xiangyu Zhao, Tong Xu:

Learning How and What to Memorize: Cognition-Inspired Two-Stage Optimization for Evolving Memory. 44987-45011 - Yifei Zhu:

PolitNuggets: Benchmarking Agentic Discovery of Long-Tail Political Facts. 45012-45035 - Gewen Liang, Mufan Xu, Kehai Chen, Wei Wang, Yuwei Wang, Muyun Yang, Tiejun Zhao, Min Zhang:

Diagnosing and Remedying Representation Deficiencies for Deterministic Reasoning in KGQA. 45036-45054 - Qihua Dong, Yitian Zhang, Huimin Zeng, Yizhou Wang, Jianglin Lu, Kuo Yang

, Yun Fu:
Revealing the Seen, Imagining the Beyond: A Survey of Image-Grounded Chain-of-Thought Reasoning in Multimodal LLMs. 45055-45070 - Gunjan Balde, Soumyadeep Roy, Mainack Mondal, Niloy Ganguly:

Learning Faster with Better Tokens: Parameter-Efficient Vocabulary Adaptation for Specialized Text Summarization. 45071-45086 - Junfan Chen, Sizhe Wu, Richong Zhang, Chunming Hu:

Adversarial Metric Learning for Fine-Grained Emotion Classification. 45087-45099 - Qiguang Chen, Chengyu Luan, Jiajun Wu, Qiming Yu, Yi Yang, Yizhuo Li, Jingqi Tong, Xiachong Feng, Libo Qin, Wanxiang Che:

OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Models. 45100-45135 - Lucio La Cava, Dominik Macko, Róbert Móro, Ivan Srba, Andrea Tagarelli:

Authorship Attribution in Multilingual Machine-Generated Texts. 45136-45152 - Cuong Pham, Dung Anh Hoang, Cuong C. Nguyen, Trung Le, Gustavo Carneiro, Thanh-Toan Do:

Layer-Wise High-Impact Parameter Ratio Optimization in Post-Training Quantization for Large Language Models. 45153-45166 - Guozheng Li, Peng Wang, Zijie Xu, Jing Zhou, Jiajun Liu, Ziyu Shang:

On the Role of Discriminative Models in Generative Relation Extraction. 45167-45183 - Hyunjong Ok, Suho Yoo, Jaeho Lee:

Speculative End-Turn Detector for Efficient Speech Chatbot Assistant. 45184-45197 - Fuqiang Niu, Zini Chen, Zhiyu Xie, Hu Huang, Qing Liao, Qianlong Wang, Genan Dai, Bowen Zhang:

TwiUSD: A Benchmark Dataset and Structure-Aware LLM Framework for User Stance Detection. 45198-45212 - Minzheng Wang, Run Luo, Yanbo Wang, Zichen Liu, Yuqiao Tan, Tao Tan, Nan Xu, Lu Wang, Wenji Mao:

Breaking the Impasse: Dual-Scale Evolutionary Policy Training for Social Language Agents. 45213-45235 - Yifan Wang, Shiyu Li, Peiming Li, Xiaochen Yang, Zheng Wei, Yang Tang:

Render-of-Thought: Rendering Textual Chain-of-Thought as Images for Visual Latent Reasoning. 45236-45253 - Yi Feng, Chuanyi Li, Vincent Ng:

Legal Judgment Prediction: A Reflection on the State of the Art. 45254-45273 - Youngwon Lee, Seung-won Hwang, Zhewei Yao, Yuxiong He:

GRAD: Generalizing RAG Adaptation with Decoding. 45274-45290 - Yingjie Xue, Xingyou Xia, Jun Zhang, Yunbo Cao, Dengpan Ye, Guotong Geng, Fei Li:

SHARP: Self-adaptive Harmful Category-aware Prompt Generation for Black-box Jailbreaking. 45291-45303 - Sugyeong Eo, Heuiseok Lim:

Unveiling the Limits of Large Language Models in Inferring Pragmatic Meaning from Non-Verbal Responses. 45304-45316 - Minghe Shen, Zhuo Zhi, Chonghan Liu, Shuo Xing, Zhengzhong Tu, Che Liu:

Does RLVR Extend Reasoning Boundaries? Investigating Capability Expansion in Vision-Language Models. 45317-45331 - Yakun Cui, Peng Qi, Fushuo Huo, Hang Du, Weijie Shi, Juntao Dai, Zhenghao Zhu, Sirui Han:

Perception, Understanding and Reasoning: A Multimodal Benchmark for Video Fake News Detection. 45332-45363 - Yejin Lee, Hyeseon An, Yo-Sub Han:

RV-HATE: Reinforced Multi-Module Voting for Implicit Hate Speech Detection. 45364-45383 - Shengjie Li, Vincent Ng:

Cross-Prompt Automated Essay Scoring of Multiple Traits: Making Sense of the State of the Art. 45384-45406 - Ada Chen, Yongjiang Wu, Junyuan Zhang, Jingyu Xiao, Shu Yang, Jen-tse Huang, Kun Wang, Wenxuan Wang, Shuai Wang:

JARVIS or Ultron? A Survey on the Safety and Security Threats of Computer-Using Agents. 45407-45441 - Le Zhou, Feng Yao, Fengcai Qiao, Bo Xu, Fangyuan Wang, Boyan Xu:

Rose-SQL: Role-State Evolution Guided Structured Reasoning for Multi-Turn Text-to-SQL. 45442-45459 - Zijing Wang, Xingle Xu, Yongkang Liu, Yiqun Zhang, Peiqin Lin, Shi Feng, Daling Wang, Xiaocui Yang, Hinrich Schütze:

Why Do More Experts Fail? A Theoretical Analysis of Model Merging. 45460-45482 - Vipul Kumar Rathore, Malik Hammad Faisal, Parag Singla, Mausam:

Combining Distantly Supervised Models with In Context Learning for Monolingual and Cross-Lingual Relation Extraction. 45483-45509 - Jingyi Sun, Greta Warren, Irina Shklovski, Isabelle Augenstein:

Explaining Sources of Uncertainty in Automated Fact-Checking. 45510-45534 - Yixuan Jiang, Tiancheng Hu, José Hernández-Orallo, David Stillwell, Luning Sun:

TRACE: A Corpus of Team Creative Discussions. 45535-45552 - Kyubyung Chae, Je Won Yeom, Jeongjae Park, Seunghyun Bae, Ijun Jang, Hyunbin Jin, Jinkwan Jang, Taesup Kim:

Evaluating Structure-Aware Retrieval and Safety in Statute-Centric Legal QA. 45553-45573 - Prajwal Vijay Kajare, Priyanshu Priya, Bikash Santra, Asif Ekbal:

PRISMA: Preference-Reinforced Self-Training Approach for Interpretable Emotionally Intelligent Negotiation Dialogues. 45574-45596 - Marek Suppa, Andrej Ridzik, Daniel Hládek, Natália Knazeková, Viktoria Ondrejova:

SkMTEB: Slovak Massive Text Embedding Benchmark and Model Adaptation. 45597-45628 - Shinwoo Park, Hyejin Park, Hyeseon An, Yo-Sub Han:

A Linguistics-Aware LLM Watermarking via Syntactic Predictability. 45629-45647 - Changhao Lai, Rui Zhao, Xuewen Zhong, Jinsong Su, Yidong Chen:

Selective Contrastive Learning For Gloss Free Sign Language Translation. 45648-45660 - Yiyang Gu, Junwei Yang, Junyu Luo, Ye Yuan, Bin Feng, Yingce Xia, Shufang Xie, Kaili Liu, Bohan Wu, Qi Shi, Haoran Li, Beier Xiao, Zhiping Xiao, Xiao Luo, Weizhi Zhang, Philip S. Yu, Zequn Liu, Ming Zhang:

SciCustom: A Framework for Custom Evaluation of Scientific Capabilities in Large Language Models. 45661-45678 - Delip Rao, Weiqiu You, Eric Wong, Chris Callison-Burch:

NSF-SciFy: Mining the NSF Awards Database for Scientific Claims. 45679-45697 - Sijie Mai, Shiqin Han:

Learning Invariant Modality Representation for Robust Multimodal Learning from a Causal Inference Perspective. 45698-45721 - Dou Hu, Lingwei Wei, Hongjiang Xiao, Songlin Hu, Yuan Zhang:

Multi-Task Representation Alignment on Language Understanding: A Mutual Information Perspective. 45722-45740 - Mukai Li, Linfeng Song, Zhenwen Liang, Jiahao Xu, Shansan Gong, Qi Liu, Haitao Mi, Dong Yu:

EconProver: Towards More Economical Test-Time Scaling for Automated Theorem Proving. 45741-45753 - Siyuan Gan, Jiaheng Liu, Boyan Wang, Tianpei Yang, Runqing Miao, Yuyao Zhang, Fanyu Meng, Junlan Feng, Linjian Meng, Jing Huo, Yang Gao:

Thinking-Based Non-Thinking: Solving the Reward Hacking Problem in Training Hybrid Reasoning Models via Reinforcement Learning. 45754-45771 - Zonghai Yao, Hong Yu:

LLM-Based Multi-Agent Systems for Clinical Workflows: A Survey of AI Hospitals. 45772-45793 - Rohit Sinha, Aditya Sanjiv Kanade, Sai Srinivas Kancheti, Vineeth N. Balasubramanian, Tanuja Ganu:

Mind's Eye: A Benchmark of Visual Abstraction, Transformation and Composition for Multimodal LLMs. 45794-45835 - Chuanrui Hu, Xingze Gao, Zuyi Zhou, Dannong Xu, Yi Bai, Xintong Li, Hui Zhang, Tong Li, Chong Zhang, Lidong Bing, Yafeng Deng:

EverMemOS: A Self-Organizing Memory Operating System for Structured Long-Horizon Reasoning. 45836-45853 - Bruno Gatti, Giuliano Martinelli, Roberto Navigli:

Interpretable Coreference Resolution Evaluation Using Explicit Semantics. 45854-45872 - Lingdi Kong, Xuanang Chen, Ben He, Le Sun:

SURE or Not? Investigating Semantic Understanding in Dense Retrieval Models. 45873-45887 - Guilherme Fonseca, Gabriel Prenassi, Washington Cunha, Leonardo Chaves Dutra da Rocha, Marcos André Gonçalves:

When High Accuracy Hides Poor Calibration: Rethinking Confidence Evaluation in Transformer-Based Text Classification with Balanced Brier Score. 45888-45900 - Yuanlei Zheng, Pei Fu, Hang Li, Ziyang Wang, Yuyi Zhang, Wenyu Ruan, Xiaojin Zhang, Zhongyu Wei, Zhenbo Luo, Jian Luan, Wei Chen, Xiang Bai:

Doc-V^*: Coarse-to-Fine Interactive Visual Reasoning for Multi-Page Document VQA. 45901-45923 - Zheng Hui, Yijiang River Dong, Sanhanat Sivapiromrat, Ehsan Shareghi, Nigel Collier:

Privacy-R1: Privacy-Aware Multi-LLM Agent Collaboration via Reinforcement Learning. 45924-45937 - Yijia Fan, Jing Yang, Mingyu Liu, Kaitong Cai, Jian Wang, Keze Wang, Jusheng Zhang:

Reinforcement Learning for Diffusion LLMs via Energy-Based Gibbs Alignment. 45938-45948 - Miyu Oba, Saku Sugawara:

CxMP: A Linguistic Minimal-Pair Benchmark for Evaluating Constructional Understanding in Language Models. 45949-45963 - Yash Kumar Atri, Steven L. Johnson, Thomas Hartvigsen:

Evaluating Temporal Consistency in Multi-Turn Language Models. 45964-45982 - Vahid Rahimzadeh, Erfan Moosavi Monazzah, Mohammad Taher Pilehvar, Yadollah Yaghoobzadeh:

Synthia: Scalable Grounded Persona Generation from Social Media Data. 45983-46006 - Yandi Wang, Libin Zhan, Ziwei Huang, Tiancheng Luo, Yuxuan Jiang, Wang Dong, Leilei Gan, Jun Chen:

From Recognition to Reasoning: Benchmarking and Enhancing MLLMs on Real-World Receipt Document Understanding. 46007-46024 - Syed Md. Mukit Rashid, Abdullah Al Ishtiaq, Kai Tu, Yilu Dong, Tianwei Wu, Ali Ranjbar, Tianchang Yang, Najrin Sultana, Shagufta Mehnaz, Syed Rafiul Hussain:

LogicEval: A Systematic Framework for Evaluating Automated Repair Techniques for Logical Vulnerabilities in Real-World Software. 46025-46049 - Deepak Kumar, Baban Gain, Asif Ekbal:

Mind the Pause: Disfluency-Aware Objective Tuning for Multilingual Speech Correction with LLMs. 46050-46070 - Xin Gao, Ruiyi Zhang, Meixi Du, Peijia Qin, Pengtao Xie:

BioTool: A Comprehensive Tool-Calling Dataset for Enhancing Biomedical Capabilities of Large Language Models. 46071-46086 - Dasol Choi, DongGeon Lee, Brigitta Jesica Kartono, Helena Berndt, Taeyoun Kwon, Joonwon Jang, Haon Park, Hwanjo Yu, Minsuk Kahng:

COMPASS: A Framework for Evaluating Organization-Specific Policy Alignment in LLMs. 46087-46133 - Qianli Ma, Chang Guo, Zhiheng Tian, Siyu Wang, Jipeng Xiao, Yuanhao Yue, Zhipeng Zhang:

Paper2Rebuttal: A Multi-Agent Framework for Transparent Author Response Assistance. 46134-46166 - Erle Zhu, Dazhi Jiang, Yuan Wang, Xujun Li, Jiale Cheng, Yuxian Gu, Yilin Niu, Aohan Zeng, Jie Tang, Minlie Huang, Hongning Wang:

Data Efficient RLVR via Off-Policy Influence Guidance. 46167-46192 - Ashish Mishra, Tarun Kumar, Arpit Shah, Suparna Bhattacharya, Martin Foltin:

CEBC: Conformal Evidence-Bounded Control for Low-Hallucination Vision-Language Generation. 46193-46206 - Tatsuki Kuribayashi, Alex Warstadt, Yohei Oseki, Ethan Gotlieb Wilcox:

Dual Alignment Between Language Model Layers and Human Sentence Processing. 46207-46223 - Tingyu Song, Yanzhao Zhang, Mingxin Li, Zhuoning Guo, Dingkun Long, Pengjun Xie, Siyue Zhang, Yilun Zhao, Shu Wu:

Rethinking Composed Image Retrieval Evaluation: A Fine-Grained Benchmark from Image Editing. 46224-46242 - Longkai Cheng

, Ximing Wang, Jiangcai Zhu, Kailai Shao, Chao Chen, Haixiang Hu:
EDSD: Entropy-Driven Design for Faster Speculative Decoding. 46243-46260 - Souvik Rana, Ashish Kulkarni, Arul Menezes, Chandra Khatri, Shubham Agarwal:

MUTANT: A Recipe for Multilingual Tokenizer Design. 46261-46277 - Javier Carnerero-Cano, Massimiliano Pronesti, Radu Marinescu, Tigran T. Tchrakian, James Barry, Jasmina Gajcin, Yufang Hou, Alessandra Pascale, Elizabeth M. Daly:

FactCorrector: A Graph-Inspired Approach to Long-Form Factuality Correction of Large Language Models. 46278-46307 - Raunak Agarwal, Markus A. Wenzel, Simon Baur, Jonas Zimmer, George Harvey, Jackie Ma:

MADE: A Living Benchmark for Multi-Label Text Classification with Uncertainty Quantification of Medical Device Adverse Events. 46308-46328 - Arthur Amalvy, Vincent Labatut, Xavier Bost, Hen-Hsen Huang:

Overcoming Copyright Barriers in Corpus Distribution Through Non-Reversible Hashing. 46329-46345 - Yuanyuan Wang, Dongchao Yang, Yayue Deng, Zhiyong Wu, Steven Y. Guo, Helen M. Meng, Xixin Wu:

UniSRM: A Unified Speech Reward Model for Reasoning-Based Fine-grained Assessment. 46346-46366 - JunShuo Zhang, Chengrui Huang, Feng Guo, Zihan Li, Ke Shi, Menghua Jiang, Jiguo Yu, Shuo Shang, Shen Gao:

DPEPO: Diverse Parallel Exploration Policy Optimization for LLM-based Agents. 46367-46389 - Xingyu Sui, Yanyan Zhao, Yulin Hu, Jiahe Guo, Weixiang Zhao, Bing Qin:

TEA-Bench: A Systematic Benchmarking of Tool-enhanced Emotional Support Dialogue Agent. 46390-46416 - Mai Phan Quoc Hung, Khanh Nguyen Quoc, Doàn Minh Luong, Duong Thu Ngan, Duong Thi Phuong Thao, Tuan Do:

An Information-Theoretic Foundation for the Subregular Hierarchy. 46417-46429 - Chaoyu Li, Yogesh Kulkarni, Pooyan Fazli:

ReGATE: Learning Faster and Better with Fewer Tokens in MLLMs. 46430-46446 - Yizhou Wang, Mang Tik Chiu, Lingzhi Zhang, Xuan Shen, Sohrab Amirghodsi, Yun Fu:

From Words to Pixels: A Comprehensive Survey on Large Language Models in Visual Segmentation. 46447-46461 - Christos Ziakas, Nicholas Loo, Nishita Jain, Alessandra Russo:

Red-Bandit: Test-Time Adaptation for LLM Red-Teaming via Bandit-Guided LoRA Experts. 46462-46478 - Joseph Suh, Suhong Moon, Serina Chang:

Graph-Based Alternatives to LLMs for Human Simulation. 46479-46506 - Dezhao Tang, Meihan Liu, Yulai Tong, Guan Yuan, Qiuyan Yan:

Minimal Free Resolution Guided Adaptive Tree Reasoning. 46507-46522 - Duy Nguyen, Archiki Prasad, Elias Stengel-Eskin, Mohit Bansal:

GrAInS: Gradient-based Attribution for Inference-Time Steering of LLMs and VLMs. 46523-46543 - Witold Sosnowski, Arkadiusz Modzelewski, Kinga Skorupska, Adam Wierzbicki:

DiNO: Disinformation Narrative Observer. 46544-46574 - Aniket Rege, Arka Sadhu, Yuliang Li, Kejie Li, Ramya Korlakai Vinayak, Yuning Chai, Yong Jae Lee, Hyo Jin Kim:

Agentic Very Long Video Understanding. 46575-46602 - Juhyun Oh, Haneul Yoo, Faiz Ghifari Haznitrama, Alice Oh:

OLA: Output Language Alignment in Code-Switched LLM Interactions. 46603-46624 - Lillian Sun, Martin Pawelczyk, Zhenting Qi, Aounon Kumar, Himabindu Lakkaraju:

Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models. 46625-46647 - Mohit Chandra, Siddharth Sriraman, Harneet Singh Khanuja, Yiqiao Jin, Munmun De Choudhury:

Reasoning Is Not All You Need: Examining LLMs for Multi-Turn Mental Health Conversations. 46648-46682 - Yue Wang, Ruotian Ma, Xingyu Chen, Zhengliang Shi, Morunliu Yang, Wanshun Chen, Huang Liu, Jiadi Yao, Xin He, Qu Yang, Qingxuan Jiang, Fanghua Ye, Juntao Li, Zhaopeng Tu, Xiaolong Li, Liefeng Bo, Min Zhang:

BatonVoice: An Operationalist Framework for Enhancing Controllable Speech Synthesis with Linguistic Intelligence from LLMs. 46683-46697 - Pedro Calais, Janderson Santos, Anísio Lacerda, Wagner Meira Jr.:

Monotonic Scaffolding as a Diagnostic Lens for Legal Reasoning in LLMs. 46698-46719 - Kai Hu, Abhinav Aggarwal, Mehran Khodabandeh, David Zhang, Eric Hsin, Li Chen, Ankit Jain, Matt Fredrikson, Akash Bharadwaj:

Jailbreak-Zero: A Path to Pareto Optimal Red Teaming for Large Language Models. 46720-46746 - Hail Hochman, Natalie Shapira, Yoav Goldberg:

Factual Retrieval in LLMs Is a Redundant, Distributed and Non-Contiguous Process. 46747-46768 - Arka Dutta

, Sujan Dutta, Rijul Magu, Soumyajit Datta, Munmun De Choudhury, Ashiqur R. KhudaBukhsh:
What About the Scene With the Hitler Reference? HAUNT: A Framework to Probe LLMs' Self-consistency in Closed Domains Via Adversarial Nudge. 46769-46791 - Diganta Misra, Nizar Islah, Victor May, Brice Rauby, Zihan Wang, Justine Gehring, Antonio Orvieto, Muawiz Sajjad Chaudhary, Eilif B. Muller, Irina Rish, Samira Ebrahimi Kahou, Massimo Caccia:

GitChameleon 2.0: Evaluating AI Code Generation Against Python Library Version Incompatibilities. 46792-46831 - Michael Hardy, Yunsung Kim:

Knowledge without Wisdom: Measuring Misalignment between LLMs and Intended Impact. 46832-46876 - Alejandro Hernández-Cano, Alexander Hägele, Allen Hao Huang, Angelika Romanou, Antoni-Joan Solergibert i Llaquet, Barna Pásztor, Bettina Messmer, Dhia Garbaya, Eduard Frank Durech, Ido Hakimi, Juan Garcia Giraldo, Mete Ismayilzada, Negar Foroutan, Skander Moalla, Tiancheng Chen, Vinko Sabolcec, Yixuan Even Xu, Michael Aerni, Badr AlKhamissi, Ines Altemir Marinas, Mohammad Hossein Amani, Matin Ansaripour, Ilia Badanin, Harold Benoit, Emanuela Boros, Nicholas John Browning, Fabian Bösch, Maximilian Böther, Niklas Canova, Camille Challier, Clément Charmillot, Jonathan Coles, Jan Milan Deriu

, Arnout Devos, Lukas Drescher, Daniil Dzenhaliou, Maud Ehrmann, Dongyang Fan, Simin Fan, Silin Gao, Miguel Gila, María Grandury, Diba Hashemi, Alexander Miserlis Hoyle, Jiaming Jiang, Mark Klein, Andrei Kucharavy, Anastasiia Kucherenko, Frederike Lübeck, Roman Machacek, Theofilos Ioannis Manitaras, Andreas Marfurt, Kyle Matoba, Simon Matrenok, Henrique Mendonça, Fawzi Roberto Mohamed, Syrielle Montariol, Luca Mouchel, Sven Najem-Meyer, Jingwei Ni, Gennaro Oliva, Matteo Pagliardini, Elia Palme, Andrei Panferov, Léo Paoletti, Marco Passerini, Ivan Pavlov, Auguste Poiroux, Kaustubh Ponkshe, Nathan Ranchin, Javier Rando, Mathieu Sauser, Jakhongir Saydaliev, Mukhammadali Sayfiddinov, Marian Schneider, Stefano Schuppli, Marco Scialanga, Andrei Semenov, Kumar Shridhar, Raghav Singhal, Anna Sotnikova, Alexander Sternfeld, Ayush Kumar Tarun, Paul Teiletche, Jannis Vamvas, Xiaozhe Yao, Hao Zhao, Alexander Ilic, Ana Klimovic, Andreas Krause, Caglar Gulcehre, David Rosenthal, Elliott Ash, Florian Tramèr, Joost VandeVondele, Livio Veraldi, Martin Rajman, Thomas C. Schulthess, Torsten Hoefler, Antoine Bosselut, Martin Jaggi, Imanol Schlag:
Apertus: Democratizing Open and Compliant LLMs for Global Language Environments. 46877-46955 - Jin Zhao, Jiayi Yao, Xinrui Hu, Nianwen Xue:

Reframing Responsibility: Framing-Aware Event Causality Identification. 46956-46977 - Jesse Zymet, Andy Luo, Swapnil Shinde, Sahil Wadhwa, Emily Chen:

Adaptive Instruction Composition for Automated LLM Red-Teaming. 46978-46996 - Xiangjue Dong, Cong Wang, Maria Teleki, Millennium Bismay, Ruihong Huang, James Caverlee:

CHOIR: Harmonizing Structured Persona Diversity for Robust Collaborative LLM Reasoning. 46997-47014 - Tejas Anvekar, Junha Park, Aparna Garimella, Vivek Gupta:

TabReX: Tabular Referenceless eXplainable Evaluation. 47015-47030 - Zining Liu, Yunhai Hu, Tianhua Xia, B. O. Bao, Eric Sather, Vithursan Thangarasa, Sai Qian Zhang:

DREAM-S: Speculative Decoding with Searchable Drafting and Target-Aware Refinement for Multimodal Generation. 47031-47045 - Yuto Nishida, Naoki Shikoda, Yosuke Kishinami, Ryo Fujii

, Makoto Morishita, Hidetaka Kamigaito, Taro Watanabe:
Revisiting Non-Verbatim Memorization in Large Language Models: The Role of Entity Surface Forms. 47046-47061 - Lanlan Qiu, Sophia Xiao Pu, Yeqi Feng, Wenchang Gao, Tianxing He:

ChatAnime: Towards User-Centered Emotional Support in LLM-based Virtual Character Chat. 47062-47078 - Shuyu Zhang, Yifan Wei, Jialuo Yuan, Xinru Wang, Yanmin Zhu, Yujie Liu, Bin Li:

DyBBT: Dynamic Balance via Bandit-inspired Targeting for Dialog Policy with Cognitive Dual Systems. 47079-47111 - Yiwei Qin, Zhen Huang, Tiantian Mi, Weiye Si, Qipeng Guo, Siyuan Feng, Pengfei Liu:

SciPedia: Unlocking the Value of Scientific Data for Pre-training. 47112-47159 - Adithya V. Ganesan, Vasudha Varadarajan, Oscar N. E. Kjell, Whitney Ringwald, Scott M. Feltman, Benjamin J. Luft, Roman Kotov, Ryan L. Boyd, H. Andrew Schwartz:

From Word Sequences to Behavioral Sequences: Adapting Modeling and Evaluation Paradigms for Longitudinal NLP. 47160-47179 - Tomomasa Hara, Hiroto Kurita, Masaaki Imaizumi, Kentaro Inui, Sho Yokoi:

Why Mean Pooling Works: Quantifying Second-Order Collapse in Text Embeddings. 47180-47201 - Ning Wang, Zhanyang Liu, Taotao Zhou, Xinrui Zhang, Zongru Shao, Haojie Zhou:

Self-Guided Alignment: Adaptive Preference Sensing for Multi-Objective Generation. 47202-47220 - Peizhuo Lv, Ruihua Zhou, Yunpeng Li, Ruigang Liang, Xingshuo Han, XiaoFeng Wang, Wei Dong, Yuling Liu:

ReasMark: A Robust Watermark for Attributing LLM Reasoning Under Knowledge Distillation Attacks. 47221-47241 - Hiroyuki Deguchi, Katsuki Chousa, Yusuke Sakai:

One Single Hub Text Breaks CLIP: Identifying Vulnerabilities in Cross-Modal Encoders via Hubness. 47242-47256 - Wentao Hu, Yanbo Zhai, Xiaohui Hu, Mingkuan Zhao, Shanhong Yu, Xue Liu, Kaidong Yu, Shuangyong Song, Xuelong Li:

Awakening Dormant Experts: Counterfactual Routing to Mitigate MoE Hallucinations. 47257-47271 - Nicholas Deas, Iván Ernesto Pérez Mejía, Ellie Yang, Kathleen McKeown:

Characterizing and Evaluating Working Emotion Vocabularies in Multilingual Large Language Models. 47272-47294 - Yusuke Sakai, Hidetaka Kamigaito, Taro Watanabe:

HalluCitation Matters: Revealing the Impact of Hallucinated References with 300 Hallucinated Papers in ACL Conferences. 47295-47376 - Jianyuan Zhong, Zeju Li, Zhijian Xu, Xiangyu Wen, Kezhi Li, Qiang Xu:

Solve-Detect-Verify: Inference-Time Scaling with Flexible Generative Verifier. 47377-47401 - Xuyang Zhi, Peilun Zhou, Chengqiang Lu, Hang Lv, Yiwei Liang, Rongyang Zhang, Yan Gao, Yi Wu, Yao Hu, Hongchao Gu, Defu Lian, Hao Wang, Enhong Chen:

SPARD: Self-Paced Curriculum for RL Alignment via Integrating Reward Dynamics and Data Utility. 47402-47422 - Preethi Seshadri, Samuel Cahyawijaya, Ayomide Odumakinde, Sameer Singh, Seraphina Goldfarb-Tarrant:

Lost in Simulation: LLM-Simulated Users are Unreliable Proxies for Human Users in Agentic Evaluations. 47423-47439 - Alla Rozovskaya, Dan Roth:

Toward Robust Evaluation for Multilingual Grammatical Error Correction: Can Large Language Models Replace Human References? 47440-47463 - Qin Dai, Benjamin Heinzerling, Kentaro Inui:

Cell-Based Representation of Relational Binding in Language Models. 47464-47524 - Zekun Wang, Jingjie Zeng, Yingxu Li, Hongfei Lin, Liang Yang:

LOTUS: Evolving Multimodal Unlearning via Hyperbolic Entailment and Lorentz Transport. 47525-47538 - Xueqiao Sun, Xiao Liu, Bowen Lv, Hanchen Zhang, Bohao Jing, Zehan Qi, Yifan Xu, Yuxiao Dong, Jie Tang:

KARL: Reinforcement Learning for LLM Agents on Multi-Turn Knowledge-Intensive Agentic Tasks. 47539-47558 - Nishit Anand, Ashish Seth, Sreyan Ghosh, Dinesh Manocha, Ramani Duraiswami:

FIGMA: Towards FIne-Grained Music retrievAl. 47559-47572 - Yuandong Wang, Yao Cui, Yuxin Zhao, Zhen Yang, Yangfu Zhu, Zhenzhou Shao:

MathSight: A Benchmark Exploring Have Vision-Language Models Really Seen in University-Level Mathematical Reasoning? 47573-47604 - Yinxi Li, Yuntian Deng, Pengyu Nie:

TokDrift: When LLM Speaks in Subwords but Code Speaks in Grammar. 47605-47629 - Fulin Shi, Wenyi Xiao, Bin Chen, Liang Ding, Leilei Gan:

REVEALER: Reinforcement-Guided Visual Reasoning for Element-Level Text-Image Alignment Evaluation. 47630-47649 - Junyao Yang, Chen Qian, Wen Shen, Yong Liu, Jing Shao, Dongrui Liu:

ReasonAny: Incorporating Reasoning Capability to Any Model via Simple and Effective Model Merging. 47650-47675 - Anvesh Rao Vijjini, Sagar Manjunath, Snigdha Chaturvedi:

Do LLM Agents Mirror Socio-Cognitive Effects in Power-Asymmetric Conversations? 47676-47701 - Ming-Bin Chen, Jey Han Lau, Lea Frermann:

CIG: Measuring Conversational Information Gain in Deliberative Dialogues with Semantic Memory Dynamics. 47702-47725 - Masahiro Kaneko, Danushka Bollegala

, Timothy Baldwin:
A Multilingual Social Bias Benchmark Incorporating Thinking Processes. 47726-47741 - Weixu Zhang, Ye Yuan, Changjiang Han, Yuxing Tian, Zipeng Sun, Linfeng Du, Jikun Kang, Hong Kang, Xue Liu, Haolun Wu:

Preference Heads in Large Language Models: A Mechanistic Framework for Interpretable Personalization. 47742-47754 - Yifan Gong, Jing Yao, Xiting Wang, Xunlong Wang, Xiaoyuan Yi, Xing Xie:

Influence-based Online Experience Selection for Effective RLHF. 47755-47771 - Zihan Zheng, Tianle Cui, Taoran Wang, Fengtao Wang, Jiahui Pan, Lewei He, Qianglong Chen:

NaturalGAIA: A Verifiable Benchmark and Hierarchical Framework for Long-Horizon GUI Tasks. 47772-47799 - Yongkang Liu, Xingle Xu, Ercong Nie, Zijing Wang, Shi Feng, Daling Wang, Qian Li, Hinrich Schütze:

Look Within or Beyond? A Theoretical Comparison Between Parameter-Efficient and Full Fine-Tuning. 47800-47820 - Minjing Shi, Junling Wang, Jingwei Ni, Sankalan Pal Chowdhury, Mrinmaya Sachan:

Tackling the Root of Misinformation by Teaching Laypeople about Logical Fallacies via Socratic Questioning and Critical Argumentation. 47821-47868 - Sitong Wu, Haoru Tan, Xichen Zhang, Bin Xia, Wenhu Zhang, Xiaojuan Qi, Bei Yu, Jiaya Jia:

TRAC: Teacher-Guided Token Reward with Adaptive Calibration for Robust Policy Optimization. 47869-47884 - Alaa Elsetohy, Sama Hadhoud, Haryo Akbarianto Wibowo, Chenxi Whitehouse, Genta Indra Winata, Fajri Koto, Alham Fikri Aji:

Macaron: Controlled, Human-Written Benchmark for Multilingual and Multicultural Reasoning via Template-Filling. 47885-47906 - Kutay Acar, Gülsen Eryigit:

Typology-Aware Multilingual Morphosyntactic Parsing with Joint Abstract Node Modeling. 47907-47920 - Jeongin Yun, Jaeri Lee, Jongjin Kim, Minjun Kim, Jinho Song, U Kang:

SharVeT: Similarity-aware Parameter Sharing with Vector-based Tuning for Efficient LLM Compression. 47921-47937 - Ibne Farabi Shihab, Sanjeda Akter, Anuj Sharma:

Beyond Variance: Knowledge-Aware LLM Compression via Fisher-Aligned Subspace Diagnostics. 47938-47954 - Liran Cohen, Yaniv Nemcovsky, Avi Mendelson:

REMIND: Memorization and Unlearning in LLMs Through the Lens of Input Loss Landscapes. 47955-47993 - Ziqi Zhao, Zhaochun Ren, Jiahong Zou, Liu Yang, Zhiwei Xu, Xuri Ge, Zhumin Chen, Xinyu Ma, Daiting Shi, Shuaiqiang Wang, Dawei Yin, Xin Xin:

Reinforced Efficient Reasoning via Semantically Diverse Exploration. 47994-48007 - Kerem Zaman, Shashank Srivastava:

Is Chain-of-Thought Really Not Explainability? Chain-of-Thought Can Be Faithful without Hint Verbalization. 48008-48030 - Chi-Hsiang Hsiao, Yi-Cheng Wang, Tzung-Sheng Lin, Yi-Ren Yeh, Chu-Song Chen:

MegaRAG: Multimodal Knowledge Graph-Based Retrieval Augmented Generation. 48031-48059 - Xin Tong, Weidong Zhang, Jiaang Li, Haibin Chen, Shilei Liu, Langming Liu, Kangtao Lv, Yujin Yuan, Wenbo Su, Bo Zheng:

SELECting over Tokens: Curating Pre-training Data at Scale via Token Classification. 48060-48085 - Xiqiao Xiong, Ouxiang Li, Zhuo Liu, Moxin Li, Wentao Shi, Fengbin Zhu, Qifan Wang, Fuli Feng:

TROJail: Trajectory-Level Optimization for Multi-Turn Large Language Model Jailbreaks with Process Rewards. 48086-48109 - Yo Ehara:

Accurate and Efficient Statistical Testing for Word Semantic Breadth. 48110-48125 - Puzhen Zhang, Xuyang Chen, Yu Feng, Yuhan Jiang, Liqiu Meng:

Constructing coherent spatial memory in LLM agents through graph rectification. 48126-48146

manage site settings
To protect your privacy, all features that rely on external API calls from your browser are turned off by default. You need to opt-in for them to become active. All settings here will be stored as cookies with your web browser. For more information see our F.A.Q.


Google
Google Scholar
Semantic Scholar
Internet Archive Scholar
CiteSeerX
ORCID













