


default search action
WACV 2026: Tucson, AZ, USA
- IEEE/CVF Winter Conference on Applications of Computer Vision, WACV 2026, Tucson, AZ, USA, March 6-10, 2026. IEEE 2026, ISBN 979-8-3315-5511-5

- Edoardo A. Dominici, Jozef Hladky, Floor Verhoeven, Lukas Radl, Thomas Deixelberger, Stefan Ainetter, Philipp Drescher, Stefan Hauswiesner, Arno Coomans, Giacomo Nazzaro, Konstantinos Vardis

, Markus Steinberger:
DreamAnywhere: Object-Centric Panoramic 3D Scene Generation. 1-11 - Sibo Dong, Ismail Shaheen, Maggie Shen, Rupayan Mallick, Sarah Adel Bargal:

ViSTA: Visual Storytelling using Multi-modal Adapters for Text-to-Image Diffusion Models. 12-21 - Siddharth Khandelwal, Sridhar Kamath, Arjun Jain:

Odo: Depth-Guided Diffusion for Identity-Preserving Body Reshaping. 22-31 - Seong-Eun Hong, Soobin Lim, Juyeong Hwang, Minwook Chang, Hyeongyeop Kang:

BiPO: Bidirectional Partial Occlusion Network for Text-to-Motion Synthesis. 32-42 - Haochen You, Baojing Liu, Hongyang He:

Reinforcement Learning-based Adaptive Control of Classifier-Free Guidance and Timestep Embeddings in Diffusion Models. 43-53 - Kohei Matsuzaki, Keisuke Nonaka:

TS-PCI: Point Cloud Frame Interpolation with Time-Aware Point Cloud Sampling and Self-Supervised Learning Strategy. 54-65 - Isaac Aguirre, Ivan Sipiran:

Enhanced Back-Projection of Vision Features for 3D Symmetry Detection. 66-76 - Atakan Topaloglu, Kunyi Li, Michael Niemeyer, Nassir Navab, A. Murat Tekalp, Federico Tombari:

OracleGS: Grounding Generative Priors for Sparse-View Gaussian Splatting. 77-87 - Heyang Gao, Kazuto Ichimaru, Takafumi Iwaguchi, Hiroshi Kawasaki:

UnderWater SLAM with Laser-light sectioning method using ST-GAT. 88-96 - Kshitij Kale, Hrishikesh U, V. Sreenidhe, Shylaja S. S:

Leveraging Pretrained Representations for Cross-Modal Point Cloud Completion. 97-105 - Yilmaz Korkmaz, Jay N. Paranjape, Celso M. de Melo, Vishal M. Patel:

Referring Change Detection in Remote Sensing Imagery. 106-116 - Shaoxiang Wang, Shihong Zhang, Christen Millerdurai, Rüdiger Westermann, Didier Stricker, Alain Pagani:

Inpaint360GS: Efficient Object-Aware 3D Inpainting via Gaussian Splatting for 360° Scenes. 117-127 - Wafa Al Ghallabi, Muhammad Zaigham Zaheer, Ritesh Thawkar, Omkar Thawakar, Salman Khan, Fahad Shahbaz Khan:

A Multi-Agent Diffusion Approach for MRI Anomaly Segmentation via Modality-Specific LoRA Specialization. 128-137 - Zekun Li, Rui Zhou, Rahul Sajnani, Xiaoyan Cong, Daniel Ritchie, Srinath Sridhar:

GenHSI: Controllable Generation of Human-Scene Interaction Videos. 138-149 - Lyuzhou Ye, Thanh Dat Le, Yan Huang:

SymNet: A Multi-Task Network for Joint Radio Map Reconstruction and Transmitter Localization. 150-159 - Jie Li, Kwan-Yee K. Wong, Kai Han:

LooC: Effective Low-Dimensional Codebook for Compositional Vector Quantization. 160-170 - AmirHossein Zamani, Tianhao Xie, Amir G. Aghdam, Tiberiu Popa, Eugene Belilovsky:

End-to-End Fine-Tuning of 3D Texture Generation using Differentiable Rewards. 171-180 - Johannes Meier, Florian Günther, Riccardo Marin, Oussema Dhaouadi, Jacques Kaiser, Daniel Cremers:

IDEAL-M3D: Instance Diversity-Enriched Active Learning for Monocular 3D Detection. 181-191 - P. Rajith Bhargav, Gaurab Bhattacharya, Vivek B. S., Jayavardhana Gubbi:

FAE-Net: Fashion Attribute Editing via Disentangled Latent Conditioning in Diffusion Models. 192-201 - Qi Li, Shuwen Qiu, Kee Kiat Koo, Julien Han, Karim Bouyarmane:

DiT-VTON: Diffusion Transformer Framework for Unified Multi-Category Virtual Try-On and Virtual Try-All with Integrated Image Editing. 202-211 - Antoine Labatie, Michael Vaccaro, Nina Lardiere, Anatol Garioud, Nicolas Gonthier:

MAESTRO: Masked AutoEncoders for Multimodal, Multitemporal, and Multispectral Earth Observation Data. 212-224 - Wei-Yuan Cheng, Kai-Po Chang, Chi-Pin Huang, Fu-En Yang, Yu-Chiang Frank Wang:

TA-Prompting: Enhancing Video Large Language Models for Dense Video Captioning via Temporal Anchors. 225-235 - Francesco Milano, Jen Jen Chung, Lionel Ott, Roland Siegwart:

Towards Fast and Scalable Normal Integration using Continuous Components. 236-244 - Marco Mezzina, Tom Vercauteren

, Tinne Tuytelaars, Matthew B. Blaschko:
A Framework for Real-Time Surgical Phase Recognition with Application to Robot-Assisted Partial Nephrectomy. 245-254 - Rahul Nair, Bhanu Tokas, Hannah Kerner:

A Woman with a Knife or A Knife with a Woman? Measuring Directional Bias Amplification in Image Captions. 255-264 - Arjun Ramesh Kaushik, Naresh Kumar Devulapally, Vishnu Suresh Lokhande, Nalini K. Ratha, Venu Govindaraju:

Forget Less by Learning Together through Concept Consolidation. 265-275 - Stephane Da Silva Martins, Emanuel Aldea, Sylvie Le Hégarat-Mascle:

VISTA: A Vision and Intent-Aware Social Attention Framework for Multi-Agent Trajectory Prediction. 287-296 - Zijie Tan, Yuxin Yue, Bahador Rashidi:

ChameleonTuner: Automatic ISP Color Tuning in Subjective Scenarios. 297-307 - Jiaojiao Zhao:

ART: Actor-Related Tubelet for Detecting Complex-shaped Action Tubes. 308-317 - Yijie Li, Ce Zheng, Yijie He, Joel Julin, Ryosuke Ichikari, Satoki Ogiso, Satoshi Nakae, Akihiro Sato, Takeshi Kurata, László A. Jeni:

Training-free Multi-view 4D Human Motion Reconstruction Virtual Reality System. 318-327 - Liangwei Jiang, Ruida Li, Zhifeng Zhang, Shuo Fang, Chenguang Ma:

EmojiDiff: Advanced Facial Expression Control with High Identity Preservation in Portrait Generation. 328-338 - Sunoh Lee, Minsik Jeon, Jihong Min, Junwon Seo:

OW-Rep: Open World Object Detection with Instance Representation Learning. 339-349 - Seongyun Seo, Sungmin Han, Jeonghyun Lee, Sangkyun Lee:

Cluster-Guided Adversarial Perturbations for Robust Contrastive Learning. 350-359 - Jiahe Qian, Peisong Wang, Zhengyang Zhuge, Qinghao Hu, Jian Cheng:

A Universal Self-Attention Enhancement for Bridging Low-bit Quantization and Vision Transformers. 360-370 - Yihao Wu, Di Zhao, Yuzhuo Li

, Matthew Alajas, Alistair S. Glen, Jingfeng Zhang, Gillian Dobbie, Daniel Wilson, Yun Sing Koh
:
Overcoming Fine-Grained Visual Challenges in Animal Re-Identification via Semantic Feature Alignment. 371-381 - Hongyu Wang, Jiayu Xu, Senwei Xie, Ruiping Wang, Jialin Li, Zhaojie Xie, Bin Zhang, Chuyan Xiong, Xilin Chen:

M4U: Evaluating Multilingual Understanding and Reasoning for Large Multimodal Models. 382-392 - Mosam Dabhi, Simon Lucey, László A. Jeni:

RAT4D: Rig and Animate Objects without Surface Templates in 4D. 393-401 - Pinrui Yu, Yiming Xie, Longtian Ye, Geng Yuan, Ningfang Mi, Xue Lin:

AFL-PRF: Adaptive Federated Learning for Low-Quality Data: Enhancing Performance, Robustness, and Fairness. 402-411 - Fanis Mathioulakis, Gorjan Radevski, Tinne Tuytelaars:

Eff-GRot: Efficient and Generalizable Rotation Estimation with Transformers. 412-421 - Geon Yeong Park, Inhwa Han, Serin Yang, Yeobin Hong, Seongmin Jeong, Heechan Jeon, Myeongjin Goh, Sung Won Yi, Jin Nam, Jong Chul Ye:

DreamMakeup: Face Makeup Customization using Latent Diffusion Models. 422-430 - Seyedehanita Madani, Vishal Patel:

Morphing Through Time: Diffusion-Based Bridging of Temporal Gaps for Robust Alignment in Change Detection. 431-439 - Mustafa Munir, Md Mostafijur Rahman, Radu Marculescu:

AdaptViG: Adaptive Vision GNN with Exponential Decay Gating. 440-450 - Rasmus G. K. Christiansen

, Toan Van Nguyen, Lasse Rose Malskær, Leon Bodenhagen
, Dirk Kraft
:
MooTrack360: A Novel Fisheye Camera Dataset for Robust Multi Dairy Cow Detection and Tracking. 451-460 - Fadlullah Raji, John Murray-Bruce:

MDUNet: Multimodal Decoding UNet for Passive Occluder-Aided Non-line-of-sight 3D Imaging. 461-471 - Kaizhi Zheng, Xuehai He, Xin Eric Wang:

Interleaved Vision-and-Language Generation via Generative Voken. 472-482 - Yohan Jang, In-Seok Song, Seungjun Baek:

Root Completion from Intraoral Scans of Tooth Crowns using Diffusion with Patch Perturbation. 483-492 - Nicolas Göller, Martin Steinebach:

Systematic Analysis of the Unintentional CSAM-Generation-Potential of Text-to-Image Models. 493-502 - Andreas Lolos, Stergios Christodoulidis, Aris L. Moustakas, Jose Dolz, Maria Vakalopoulou:

SGPMIL: Sparse Gaussian Process Multiple Instance Learning. 503-513 - Chaitanya Roygaga, Aparna Bharati:

Understanding Human-Like Biases in VLMs via Subjective Face Analytics. 514-526 - Ju-Hsuan Weng, Jia-Wei Liao, Cheng-Fu Chou, Jun-Cheng Chen:

M-ErasureBench: A Comprehensive Multimodal Evaluation Benchmark for Concept Erasure in Diffusion Models. 527-536 - Moslem Yazdanpanah, Ali Bahri, Mehrdad Noori, Sahar Dastani, Samuel Barbeau, David Osowiechi, Gustavo Adolfo Vargas Hakim, Ismail Ben Ayed, Christian Desrosiers:

Revisiting Layer Normalization for Point Cloud Test Time Adaptation. 537-546 - Haoxin Li, Yingchen Yu, Qilong Wu, Hanwang Zhang, Song Bai, Boyang Li:

Learning to Animate Images from A Few Videos to Portray Delicate Human Actions. 547-559 - Luke Meyers, Josué A. Rodríguez-Cordero, Rémi Mégret:

One-Shot Fine-Grained Re-Identification of Paint Marked Honey Bees using Vision Foundation Models. 560-569 - Jeongho Min, Dongyoung Kim, Jaehyup Lee:

From Street to Orbit: Training-Free Cross-View Retrieval via Location Semantics and LLM Guidance. 570-579 - Guanhong Tao, Siyuan Cheng, Guangyu Shen, Yingqi Liu, Shengwei An, Zhuo Zhang, Zhenting Wang, Hanxi Guo, Xiangyu Zhang:

Mitigating Backdoor Attacks via Trigger Reconstruction and Model Hardening. 580-590 - Akshaya Athwale, Ola Ahmad, Jean-François Lalonde:

Network-agnostic distortion-robust projections for wide-angle image understanding. 591-601 - Shanshan Zhong, Jiawei Peng, Zehan Zheng, Zhongzhan Huang, Wufei Ma, Guofeng Zhang, Qihao Liu, Alan L. Yuille, Jieneng Chen:

4D-Animal: Freely Reconstructing Animatable 3D Animals from Videos. 602-612 - Pin-Yen Chiu

, I-Sheng Fang, Jun-Cheng Chen:
Text Slider: Efficient and Plug-and-Play Continuous Concept Control for Image/Video Synthesis via LoRA Adapters. 613-622 - Qingju Guo, Shuang Li, Jing Geng, Binhui Xie, Jiawei Shan, Wei Li:

Cluster-based Pseudo-labeling for Semi-Supervised LiDAR Semantic Segmentation. 623-634 - Fabien Delattre, Tsung-Wei Huang, Guan-Ming Su, Erik G. Learned-Miller:

Human Pose Aggregation for Multi-View Temporal Video Alignment. 635-646 - Shiwei Ding, Xiaoyong Yuan, Zhenlin Wang, Lan Emily Zhang, Giuseppe Ateniese

:
Marshaled Learning: Bridging Large Neural Networks with Memory-Constrained Trusted Execution Environments in Federated Learning. 647-656 - Tayssir Bouraffa, Ziyuan Wang, Daniel Strüber:

Feature-Disentangling RGB-NIR Fusion Network for Remote Driver Physiological Measurement. 657-666 - Xiwen Chen, Wenhui Zhu, Peijie Qiu, Hao Wang, Huayu Li, Haiyu Wu, Aristeidis Sotiras, Yalin Wang, Abolfazl Razi:

Prompt-OT: An Optimal Transport Regularization Paradigm for Knowledge Preservation in Vision-Language Model Adaptation. 667-676 - Tuomas Varanka, Juan Luis Gonzalez, Hyeongwoo Kim, Pablo Garrido, Xu Yao:

Zero-Shot Video Deraining with Video Diffusion Models. 677-687 - Zeji Hui, Amirali Khodadadian Gostar, Weiqin Chuah, Alireza Bab-Hadiashar, Ruwan B. Tennakoon:

Joint Modeling of Corruption-Driven and Information-Limited Uncertainty for Robust 3D Gaussian Splatting. 688-697 - Erh-Chung Chen, Pin-Yu Chen, I-Hsin Chung, Che-Rung Lee:

Data-Driven Lipschitz Continuity: A Cost-Effective Approach to Improve Adversarial Robustness. 698-707 - Satoshi Hashimoto, Tatsuya Konishi, Tomoya Kaichi, Kazunori Matsumoto, Mori Kurokawa:

CADE: Continual Weakly-supervised Video Anomaly Detection with Ensembles. 708-717 - Pietro Caforio, Isabella Poles, Marco D. Santambrogio:

PaRaChute: Pathology-Radiology Cross-Modal Fusion for Missing-Modality-Robust Survival Prediction. 718-728 - Matthew Gwilliam, Roy Zhang, Namitha Padmanabhan, Hongyang Du, Abhinav Shrivastava:

How to Design and Train Your Implicit Neural Representation for Video Compression. 729-739 - Annika Mütze, Sadia Ilyas, Christian Dörpelkus, Matthias Rottmann:

Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes? 740-750 - Imanol G. Estepa, Jesús M. Rodríguez-de-Vera, Ignacio Sarasúa, Bhalaji Nagarajan, Petia Radeva:

Conjuring Positive Pairs for Efficient Unification of Representation Learning and Image Synthesis. 751-761 - Xiaoxiao He, Quan Dao, Ligong Han, Song Wen, Minhao Bai, Di Liu, Han Zhang, Felix Juefei-Xu, Chaowei Tan, Bo Liu, Martin Renqiang Min, Kang Li, Faez Ahmed, Akash Srivastava, Hongdong Li, Junzhou Huang, Dimitris N. Metaxas:

DICE: Discrete Inversion Enabling Controllable Editing for Masked Generative Models. 762-772 - Andrii Yermakov, Jan Cech, Jiri Matas, Mario Fritz:

Deepfake Detection that Generalizes Across Benchmarks. 773-783 - Kijung Lee, Youngwan Jo, Sunghyun Ahn, Sanghyun Park:

Unified Video Anomaly Detection Model for Detecting Different Anomaly Types. 784-794 - Ziwei Chen, Ziling Liu, Zitong Huang, Mingqi Gao, Feng Zheng:

SCORP: Scene-Consistent Object Refinement via Proxy Generation and Tuning. 795-805 - Giacomo Pacini, Lorenzo Bianchi, Luca Ciampi

, Nicola Messina, Giuseppe Amato, Fabrizio Falchi
:
CountingDINO A Training-free Pipeline for Class-Agnostic Counting using Unsupervised Backbones. 806-815 - Congjia Chen, Shen Yan, Yufu Qu:

ViGG: Robust RGB-D Point Cloud Registration using Visual-Geometric Mutual Guidance. 816-826 - Sachin Shah, Anustup Choudhury, Guan-Ming Su, Jaclyn Pytlarz, Christopher A. Metzler, Trisha Mittal:

Gaussian Representations for Video. 827-837 - Tong Shen, Di Wang, José M. F. Moura:

MSRTrack: LLM-Powered Object Tracking with Motion and Semantic Reasoning. 838-848 - Debabrata Mandal, Zhihan Peng, Yujie Wang, Praneeth Chakravarthula:

Enabling High-Quality In-the-Wild Imaging from Severely Aberrated Metalens Bursts. 849-859 - Phuc Pham, Nhu Pham, Ngoc Quoc Ly:

Boosting Medical Vision-Language Pretraining via Momentum Self-Distillation under Limited Computing Resources. 860-868 - Haoming Lu, David Kocharian, Humphrey Shi:

Beyond Realism: Learning the Art of Expressive Composition with StickerNet. 869-878 - Fatima Alderazi, Motaz Alfarraj:

Analysis of Text Accuracy and Visual Alignment in Vision-Language Models for Artistic Text Generation. 879-887 - Dween Rabius Sanny, Vinay Kumar Verma, Prateek Sircar, Deepak Gupta:

MEDAL: multi-modal MEta-space Distillation and ALignment for Visual Compatibility Learning. 888-897 - Hong-Xuan Yen, Chiamin Chen, Yanqing Wang, Yu-Lun Liu, Min Sun:

PS3: Part level instance segmentation in 3D. 898-906 - Aleksandr Gordeev, Vladimir Dokholyan, Irina Tolstykh, Maksim Kuprashevich:

Saliency-Guided DETR for Moment Retrieval and Highlight Detection. 907-916 - Sangyoon Lee, Shubuendu Mishra, Yoichi Watanabe

:
Accelerated Dose Generation in Gamma Knife Radiosurgery Using a Wavelet Diffusion Model for Sparse Representation. 917-926 - Hongjin Zhao, Weihao Li, Zhenyue Qin, Ge-Peng Ji, Yang Liu, Tom Gedeon, Nick Barnes:

DermEVAL: A Dermatologist-Reviewed Benchmark for Multimodal Large Language Models. 927-937 - Jinsub Yim, Hyungtae Lee, Sungmin Eum, Yi-Ting Shen, Yan Zhang, Heesung Kwon, Shuvra S. Bhattacharyya:

SynPlay: Large-Scale Synthetic Human Data with Real-World Diversity for Aerial-View Perception. 938-947 - Saman Motamed, Laura Culp, Kevin Swersky, Priyank Jaini, Robert Geirhos:

Do generative video models understand physical principles? 948-958 - ZongHan Hsieh, ShengJing Yang, Tzer-Jen Wei:

ZonUI-3B: Competitive GUI Grounding with a 3B VLM Trained on a Single Consumer GPU. 959-966 - Girolamo Macaluso

, Lorenzo Mandelli, Mirko Bicchierai
, Stefano Berretti, Andrew D. Bagdanov:
No MoCap Needed: Post-Training Motion Diffusion Models with Reinforcement Learning using Only Textual Prompts. 967-976 - Xintong Liu, Dongliang Chang, Yujun Tong, Zhanyu Ma:

MIX-based Foreground and Background Patch Augmentation Guided by Physics and Material Properties for X-ray Detection. 977-987 - Han-Wei Kung, Tuomas Varanka, Nicu Sebe

:
Reverse Personalization. 988-999 - Sébastien Quetin, Tapotosh Ghosh, Farhad Maleki:

Beyond the Encoder: Joint Encoder-Decoder Contrastive Pre-Training Improves Dense Prediction. 1000-1010 - Mijeong Kim, Namgi Kim, Bohyung Han:

HyperPose: Hyper-pose Embeddings for 3D-Aware Generative Models with Self-Supervised Disentangling of Pose and Scene. 1011-1021 - Hyeongseok Oh, Joonki Paik:

Learning Mask-Aware Offsets: Two-branch Deformable Attention Networks for Inpainting with Masked Region Avoidance. 1022-1031 - Runfeng Qu, Ole Hall, Pia Bideau, Julie Ouerfelli-Ethier, Martin Rolfs, Klaus Obermayer, Olaf Hellwich:

Salience-SGG: Enhancing Unbiased Scene Graph Generation with Iterative Salience Estimation. 1032-1042 - Tianye Qi, Weihao Li, Nick Barnes:

SmokeBench: Evaluating Multimodal Large Language Models for Wildfire Smoke Detection. 1043-1053 - Arindam Dutta, Sarosij Bose, Rohit Kundu, Calvin-Khang Ta, Saketh Bachu, Konstantinos Karydis, Amit K. Roy-Chowdhury:

Visibility guided Self-Supervised Occlusion-Resilient Human Pose Estimation. 1054-1063 - ShuangMing Mao, Haixiang Zhu:

Diverse Sketch Colorization with Content-Enhanced Style Representation and Recolorization Distillation. 1064-1073 - Yu Wang, Juhyung Ha, Frangil M. Ramirez, Yuchen Wang, David J. Crandall:

GateFusion: Hierarchical Gated Cross-Modal Fusion for Active Speaker Detection. 1074-1083 - Seunghoon Han, Hyewon Lee, Soyoung Park, Jong-Ryul Lee, Sungsu Lim:

MR-Pruner: Training-free Multi-resolution Visual Token Pruning for Multi-modal Large Language Models. 1084-1093 - Md Tanvir Islam

, Inzamamul Alam, Sambit Bakshi, Khan Muhammad, Javier Del Ser, Sangtae Ahn:
SpikeRain: Towards Energy-Efficient Single Image Deraining with Spiking Neural Networks. 1094-1105 - Byungkwan Chae, Youngjae Choi, Heewon Kim:

MBTI: Metric-Based Textual Inversion for Fine-Grained Image Generation. 1106-1116 - Ji-yoon Kim, Eunsu Baek, Hyung-Sin Kim:

ImageNet-sES: A First Systematic Study of Sensor-Environment Simulation Anchored by Real Recaptures. 1117-1126 - Seojeong Park

, Jiho Choi, Kyungjune Baek, Hyunjung Shim:
MomentMix Augmentation with Length-Aware DETR for Temporally Robust Moment Retrieval. 1127-1136 - Radib Bin Kabir, Tawsif Tashwar Dipto, Mehedi Ahamed, Sabbir Ahmed, Md. Hasanul Kabir:

From Lightweight CNNs to SpikeNets: Benchmarking Accuracy-Energy Tradeoffs with Pruned Spiking SqueezeNet. 1137-1146 - Neeraj Anand, Rishabh Jain, Sohan Patnaik, Balaji Krishnamurthy, Mausoom Sarkar:

AFRAgent : An Adaptive Feature Renormalization Based High Resolution Aware GUI agent. 1147-1158 - Md Fahim, Md Sakib Ul Rahman Sourove, Akm Moshiur Rahman, Md Farhan Ishmam, Md Tasmim Rahman Adib, Fariha Tanjim Shifat, Fabiha Haider, Farhad Alam Bhuiyan:

BanglaProtha: Evaluating Vision Language Models in Underrepresented Long-tail Cultural Contexts. 1159-1169 - Joe Barrow:

CommonForms: A Large, Diverse Dataset for Form Field Detection. 1170-1179 - Jawad Ibn Ahad, Maisha Rahman, Amrijit Biswas, Muhammad Rafsan Kabir, Robin Krambroeckers, Sifat Momen, Nabeel Mohammed, Shafin Rahman:

Beyond Real Weights: Hypercomplex Representations for Stable Quantization. 1180-1190 - Kyeong Seon Kim, Seong-Eun Baek, JungMok Lee, Tae-Hyun Oh:

mEOL: Training-Free Instruction-Guided Multimodal Embedder for Vector Graphics and Image Retrieval. 1191-1200 - Anh Mai Vu, Tuan L. Vo, Ngoc Lam Quang Bui, Nam N. B. Le, Akash Awasthi

, Huy Quoc Vo, Thanh-Huy Nguyen, Zhu Han, Chandra Mohan, Hien Van Nguyen:
Contrastive Integrated Gradients: A Feature Attribution-Based Method for Explaining Whole Slide Image Classification. 1201-1210 - Sharon Peled, Yosef E. Maruvka, Moti Freiman:

PSA-MIL: A Probabilistic Spatial Attention-Based Multiple Instance Learning for Whole Slide Image Classification. 1211-1220 - Korada Sri Vardhana, Shrikrishna Lolla, Soma Biswas:

Fully Unsupervised Self-debiasing of Text-to-Image Diffusion Models. 1221-1230 - Yu Mitsuzumi, Akisato Kimura, Hisashi Kashima:

Model-free Domain Adaptation for Concealed Multimodal Large-Language Models. 1231-1241 - Mehrdad Fazli, Bowen Wei, Ahmet Sari, Ziwei Zhu:

CAAC: Confidence-Aware Attention Calibration to Reduce Hallucinations in Large Vision-Language Models. 1242-1251 - Siyu Chen, Ting Han, Changshe Zhang, Xin Luo, Huan Chen, Meiliu Wu, Guorong Cai, Jinhe Su:

LiDAR-DHMT: LiDAR-Adaptive Dual Hierarchical Mask Transformer for Robust Freespace Detection and Semantic Segmentation. 1252-1261 - Siyi Hu, Diego Martín Arroyo, Stephanie Debats, Fabian Manhardt, Luca Carlone, Federico Tombari:

Mixed Diffusion for 3D Indoor Scene Synthesis. 1262-1272 - Zilu Guo, Hongbin Lin, Zhihao Yuan, Chaoda Zheng, Pengshuo Qiu, Dongzhi Jiang, Renrui Zhang, Chun-Mei Feng, Zhen Li:

PiSA: A Self-Augmented Data Engine and Training Strategy for 3D Understanding with Large Models. 1273-1283 - Nico Catalano, Stefano Samele, Paolo Pertino, Matteo Matteucci:

MARS: a Multimodal Alignment and Ranking System for Few-Shot Segmentation. 1284-1293 - Balagopal Unnikrishnan, Michael Brudno, Chris McIntosh

:
SilverLining: Data-First Mitigation of Spatial and Spectral Shortcuts Without Introducing New Confounders. 1294-1303 - Rohit Gandikota, David Bau:

Distilling Diversity and Control in Diffusion Models. 1304-1313 - Aashish Chandra K, Aashutosh A V, Abhijit Das:

Narrating For You: Prompt-guided Audio-visual Narrating Face Generation Employing Multi-entangled Latent Space. 1314-1323 - Mizanur Rahman Jewel, Mohamed Elmahallawy, Sanjay Madria, Samuel Frimpong:

Explaining the Unseen: Multimodal Vision-Language Reasoning for Situational Awareness in Underground Mining Disasters. 1324-1333 - Carlos Plou, Cesar Borja, Ruben Martinez-Cantin, Ana C. Murillo:

FALCONEye: Finding Answers and Localizing Content in ONE-hour-long videos with multi-modal LLMs. 1334-1344 - Ismail Bencheikh, Max Dunitz, Marie d'Autume, Enric Meinhardt-Llopis, Marc Pic, Gabriele Facciolo, Pablo Musé:

Autocorrelation-based Fiducial Markers for Traceability. 1345-1354 - Oussema Dhaouadi, Johannes Meier, Jacques Kaiser, Daniel Cremers:

GrounDiff: Diffusion-Based Ground Surface Generation from Digital Surface Models. 1355-1364 - Chenhui Xu, Fuxun Yu, Jinjun Xiong, Xiang Chen:

QuadraNet V2: Efficient and Sustainable Training of High-Order Neural Networks with Quadratic Adaptation. 1365-1373 - Nuwan Sriyantha Bandara, Thivya Kandappu, Archan Misra:

SaccadeX: Directed Acyclic Graph-based Semi-Supervised Learning of Continuous Ocular Dynamics from Sparse Neuromorphic Streams. 1384-1394 - Mayank Kumar Kundalwal, Mamta, Deepak Mishra, Asif Ekbal:

Federated Model Synchronization for Diagnostic Redefinition through a Novel Selective Parameter Unlearning. 1395-1404 - Aupendu Kar, Prabir Kumar Biswas:

A Fast, Simple, and Flexible Scale Informative Feature Transform Module for Arbitrary Scale Image Super-Resolution. 1405-1414 - Miaosen Zhang, Qi Dai, Yifan Yang, Jianmin Bao, Dongdong Chen, Kai Qiu, Chong Luo, Xin Geng, Baining Guo:

MageBench: Bridging Large Multimodal Models to Agents. 1415-1427 - Logan Lawrence, Oindrila Saha, Megan Wei, Chen Sun, Subhransu Maji, Grant Van Horn:

You May Speak Freely: Improving the Fine-Grained Visual Recognition Capabilities of Multimodal Large Language Models with Answer Extraction. 1428-1437 - Sreehari Rajan, Kunal Bhosikar, Charu Sharma:

InteracTalker: Prompt-Based Human-Object Interaction with Co-Speech Gesture Generation. 1438-1447 - Tien-Huy Nguyen, Huu-Loc Tran, Thanh Duc Ngo:

ITSELF: Attention Guided Fine-Grained Alignment for Vision-Language Retrieval. 1448-1458 - Yuk-Kwan Wong, Tuan-An To, Jipeng Zhang, Ziqiang Zheng, Sai-Kit Yeung:

MarineEval: Assessing the Marine Intelligence of Vision-Language Models. 1459-1470 - Radim Spetlík, Jan Hlavsa, Jana Cechová, Petra Pojmanová, Jirí Matas, Stepán Urban:

Identity Verification from Human Scent using Channel Representation of 2D Gas Chromatography-Mass Spectrometry Data. 1471-1480 - Niraj Prakash Kini, Shiau-Rung Tsai, Guan-Hsun Lin, Wen-Hsiao Peng, Ching-Wen Ma, Jenq-Neng Hwang:

milliMamba: Specular-Aware Human Pose Estimation via Dual mmWave Radar with Multi-Frame Mamba Fusion. 1481-1490 - Omkar Prabhune, Younghyun Kim:

OpenCowID: Zero-Shot Visual Identification of Dairy Cows. 1491-1500 - Duc-Phuong Doan-Ngo, Thanh-Dang Diep, Thanh Nguyen-Duc, Thanh-Sach Le, Nam Thoai:

QCFace: Image Quality Control for boosting Face Representation & Recognition. 1501-1511 - Kaen Kogashi, Anoop Cherian, Meng-Yu Jennifer Kuo:

MMHOI: Modeling Complex 3D Multi-Human Multi-Object Interactions. 1512-1521 - Shreshth Saini, Bowen Chen, Yilin Wang, Neil Birkbeck, Balu Adsumilli, Alan C. Bovik:

BrightRate: Quality Assessment for User-Generated HDR Videos. 1522-1532 - Azin Jahedi, Marc Rivinius, Noah Berenguel Senn, Andrés Bruhn:

Reviving Unsupervised Optical Flow: Concept Reevaluation, Multi-Scale Advances and Full Open-Source Release. 1533-1542 - Debabrata Mandal, Soumitri Chattopadhyay, Guansen Tong, Praneeth Chakravarthula:

UniCoRN: Latent Diffusion-based Unified Controllable Image Restoration Network across Multiple Degradations. 1543-1553 - Xuecheng Bai, Yuxiang Wang, Boyu Hu, Qinyuan Jie, Chuanzhi Xu

, Kechen Li, Hongru Xiao, Vera Chung:
DRWKV: Focusing on Object Edges for Low-Light Image Enhancement. 1554-1564 - Md Sohag Mia, Muhammad Abdullah Adnan:

Layout Anything: One Transformer for Universal Room Layout Estimation. 1565-1574 - Boris Meden

, Asma Brazi, Fabrice Mayran de Chamisso, Steve Bourgeois, Vincent Lepetit:
BOP-Distrib: Revisiting 6D Pose Estimation Benchmarks for Better Evaluation under Visual Ambiguities. 1575-1585 - Luke Moffett, Frank Willard, Maximillian Machado, Emmanuel Mokel, Jon Donnelly, Zhicheng Guo, Adam Costarino, Julia Yang, Giyoung Kim, Alina Jade Barnett, Cynthia Rudin:

Cosine Similarity is Almost All You Need (for Prototypical-Part Models). 1586-1596 - Yuk-Kwan Wong, Haixin Liang, Zeyu Ma, Yiwei Chen, Ziqiang Zheng, Rinaldi Gotama

, Pascal Sebastian, Lauren D. Sparks, Sai-Kit Yeung:
ORCA: Object Recognition and Comprehension for Archiving Marine Species. 1597-1609 - Yunhao Liu, Suyang Xi, Shiqi Liu, Hong Ding, Chicheng Jin, Chong Zhong, Junjun He, Catherine C. Liu, Yiqing Shen:

Multimodal Medical Image Binding via Shared Text Embeddings. 1610-1620 - Mario Alfonso-Arsuaga, Henar Dominguez-Elvira, Jorge Casas-Guerrero, Andrea Castiella-Aguirrezabala, Lorenzo Costabile-Dominguez, Jorge García-González

, Maria Naranjo-Almeida, Marc Comino-Trinidad, Jorge Lopez-Moreno:
PHYSPLAT: A Framework for Photorealistic Hybrid Simulation of Real and Synthetic Elements using 3D Gaussian Splatting. 1621-1631 - Peizhi Yan, Rabab Ward, Qiang Tang, Shan Du:

ArchitectHead: Continuous Level of Detail Control for 3D Gaussian Head Avatars. 1632-1642 - Madhav Gupta, Vishak Prasad, Ganesh Ramakrishnan:

Uncertainty-Aware Subset Selection for Robust Visual Explainability under Distribution Shifts. 1643-1652 - Tejas Anvekar, Fenil Denish Bardoliya, Pavan K. Turaga, Chitta Baral, Vivek Gupta:

The Perceptual Observatory Characterizing Robustness and Grounding in MLLMs. 1653-1663 - Haochen Zhang, Nirav Savaliya, Faizan Siddiqui, Enna Sachdeva:

FAST-EQA: Efficient Embodied Question Answering with Global and Local Region Relevancy. 1664-1673 - Seungwook Kim, Yichun Shi, Kejie Li, Minsu Cho, Peng Wang:

RapidMV: Leveraging Spatio-Angular Latent Space for Efficient and Consistent Text-to-Multi-View Synthesis. 1674-1684 - Bolutife Atoki, Iuliia Tkachenko, Bertrand Kerautret, Carlos Crispim-Junior:

Diffusion-Based Authentication of Copy Detection Patterns: A Multimodal Framework with Printer Signature Conditioning. 1685-1694 - Ishan Sahu, Somnath Hazra, Somak Aditya, Soumyajit Dey:

AD2 : Analysis and Detection of Adversarial Threats in Visual Perception for End-to-End Autonomous Driving Systems. 1695-1704 - Elifnur Sunger, Tales Imbiriba, J. Peter Campbell, Deniz Erdogmus, Stratis Ioannidis, Jennifer G. Dy:

SSplain: Sparse and Smooth Explainer for Retinopathy of Prematurity Classification. 1705-1715 - Marta Hasny, Maxime Di Folco, Keno Bressem, Julia A. Schnabel

:
Tables Guide Vision: Learning to See the Heart through Tabular Data. 1716-1725 - Jiayang Liu, Daniel Tso, Yiming Bu, Qinru Qiu:

SAFER-AiD: Saccade-Assisted Foveal-peripheral vision Enhanced Reconstruction for Adversarial Defense. 1726-1735 - Roy Uziel, Oded Bialer:

Enhancing Object Detection Training via Joint Image-Annotation Generation. 1736-1745 - Jintang Xue, Ganning Zhao, Jie-En Yao, Hong-En Chen, Yue Hu, Meida Chen, Suya You, C.-C. Jay Kuo:

Descrip3D: Enhancing Large Language Model-based 3D Scene Understanding with Object-Level Text Descriptions. 1746-1756 - Shivanshu Agnihotri, Snehashis Majhi, Deepak Ranjan Nayak, Debesh Jha:

From SAM to DINOv2: Towards Distilling Foundation Models to Lightweight Baselines for Generalized Polyp Segmentation. 1757-1766 - Sangjune Park, Inhyeok Choi, Donghyeon Soon, Youngwoo Jeon, Kyungdon Joo:

Not Like Transformers: Drop the Beat Representation for Dance Generation with Mamba-Based Diffusion Model. 1767-1776 - Juil Koo, Wei-Tung Lin, Chanho Park, Chanhyeok Park, Minhyuk Sung:

BoxSplitGen: A Generative Model for 3D Part Bounding Boxes in Varying Granularity. 1777-1787 - Jim James, Benjamin Wilson, Simon Lucey, James Hays:

3D Gaussian Point Encoders. 1788-1797 - Xufu Liu, Yifan Yang, Zhengxin Zhang:

HumanGuideNet: Adapter-Based Alignment of Deep Neural Networks with Human Similarity Judgments. 1798-1808 - Taha Mustapha Nehdi, Nairouz Mrabah, Atif Belal, Marco Pedersoli, Eric Granger:

Low-Rank Expert Merging for Multi-Source Domain Adaptation in Person Re-Identification. 1809-1819 - Kai Hsiang Hsieh, Monyneath Yim, Wen-Hsiao Peng, Jui-Chiu Chiang:

MEGA-PCC: A Mamba-based Efficient Approach for Joint Geometry and Attribute Point Cloud Compression. 1820-1830 - Joy Dhar, Manish Kumar Pandey, Debashis Das Chakladar, Maryam Haghighat

, Azadeh Alavi, Sajib Mistry, Nayyar Zaidi:
HyPCA-Net: Advancing Multimodal Fusion in Medical Image Analysis. 1831-1840 - Mengdi Wang, Efe Bozkir, Enkelejda Kasneci:

CycleSL: Server-Client Cyclical Update Driven Scalable Split Learning. 1841-1851 - Ziyang Yan, Yihua Shao, Minwen Liao, Siyu Chen, Nan Wang, Muyuan Lin, Jenq-Neng Hwang, Hao Zhao, Fabio Remondino, Lei Li:

3DSceneEditor: Controllable 3D Scene Editing with Gaussian Splatting. 1852-1863 - Aditi Agarwal, Anjali Jain, Nikita Saxena, Ishan Deshpande, Michal Kazmierski, Abigail Annkah, Nadav Sherman, Karthikeyan Shanmugam, Alok Talekar, Vaibhav Rajan:

Segmentation-Aware Latent Diffusion for Satellite Image Super-Resolution: Enabling Smallholder Farm Boundary Delineation. 1864-1874 - Mahathir Monjur, Shahriar Nirjon:

mmWEAVER: Environment-Specific mmWave Signal Synthesis from a Photo and Activity Description. 1875-1884 - Oz Zafar, Yuval Cohen, Lior Wolf, Idan Schwartz:

Detection-Driven Object Count Optimization for Text-to-Image Diffusion Models. 1885-1894 - Yechi Ma, Wei Hua, Yanan Li, Shu Kong:

Roadside Monocular 3D Detection Prompted by 2D Detection. 1895-1905 - Shu Han, Xubo Zhu, Ji Wu, Ximeng Cai, Wen Yang, Huai Yu, Gui-Song Xia:

UniCalib: Targetless LiDAR-camera Calibration via Probabilistic Flow on Unified Depth Representations. 1906-1915 - Shay Shomer Chai, Wenxuan Peng, Bharath Hariharan, Hadar Averbuch-Elor:

Color Bind: Exploring Color Perception in Text-to-Image Models. 1916-1925 - Amirhossein Alamdar, Hossein Jafarinia, Mahdi Noori, Mohammad Hossein Rohban:

ASC: Learning Augmentation Severity-Consistent Representations Improves Generalization via Augmentation Search. 1926-1936 - Quang-Huy Nguyen, Jin Peng Zhou, Zhenzhen Liu, Khanh-Huyen Bui, Kilian Q. Weinberger, Wei-Lun Chao, Dung D. Le:

Detecting Out-of-Distribution Objects through Class-Conditioned Inpainting. 1937-1947 - Eric Ming Chen, Di Liu, Sizhuo Ma, Michael Vasilkovsky, Bing Zhou, Qiang Gao, Wenzhou Wang, Jiahao Luo, Dimitris N. Metaxas, Vincent Sitzmann, Jian Wang:

Snapmoji: Instant Generation of Animatable Dual-Stylized Avatars. 1948-1958 - Utsav Panchal, Yuchen Liu, Luigi Palmieri, Ilche Georgievski, Marco Aiello:

Seeing is Believing (and Predicting): Context-Aware Multi-Human Behavior Prediction with Vision Language Models. 1959-1968 - Hongjin Zhao, Weihao Li

, Ge-Peng Ji, Nick Barnes:
False Alarm Rectification for Early Smoke Segmentation. 1969-1978 - Ren Nakagawa, Yang Yang, Risa Shinoda, Hiroaki Santo, Kenji Oyama, Fumio Okura, Takenao Ohkawa:

Interaction-via-Actions: Cattle Interaction Detection with Joint Learning of Action-Interaction Latent Space. 1979-1988 - Erik Wallin, Fredrik Kahl, Lars Hammarstrand:

Semi-Supervised Hierarchical Open-Set Classification. 1989-1998 - Nikolas Adaloglou, Diana Petrusheva, Mohamed Asker, Felix Michels, Markus Kollmann:

ClusterMine: Robust Label-Free Visual Out-Of-Distribution Detection via Concept Mining from Text Corpora. 1999-2010 - Sai Madhusudan Gunda, Tathagata Ghosh, Simran Singh Sandral, Ravi Kiran Sarvadevabhatla:

CURIO: Curvature-Aligned and Efficient OCR for Low-Resource Historical Manuscripts. 2011-2021 - Ninad Joshi, Vivek Srivastava, Shirish S. Karande:

DoTA: Latent Distribution Conditioned Data Attribution for Diffusion Models. 2022-2031 - Yi-Zhen Wang, Hong-Han Shuai:

Learnable Query-Enhanced Pose Transformation. 2032-2041 - Xinyi Wang, Angeliki Katsenou, Junxiao Shen, David Bull:

CAMP-VQA: Caption-Embedded Multimodal Perception for No-Reference Quality Assessment of Compressed Video. 2042-2051 - Jaywon Koo, Jefferson Hernandez, Moayed Haji-Ali, Ziyan Yang, Vicente Ordonez:

Evaluating Text-to-Image and Text-to-Video Synthesis with a Conditional Fréchet Distance. 2052-2062 - Satyaki Roy Chowdhury, Aswathnarayan Radhakrishnan, Hari Subramoni:

From Bands to Depth: Understanding Bathymetry Decisions on Sentinel-2. 2063-2072 - Tushar Prakash, Onkar Susladkar, Inderjit S. Dhillon, Sparsh Mittal:

Pyramidal Spectrum: Frequency-based Hierarchically Vector Quantized VAE for Videos. 2073-2082 - Oishee Bintey Hoque, Nibir Chandra Mandal, Kyle Luong, Amanda Wilson, Samarth Swarup, Madhav V. Marathe, Abhijin Adiga:

PRISM-CAFO: Prior-conditioned Remote-sensing Infrastructure Segmentation and Mapping for CAFOs. 2083-2093 - Gayatri Deshmukh, Somsubhra De, Chirag Sehgal, Jishu Sen Gupta, Sparsh Mittal:

Dressing the Imagination: A Dataset for AI-Powered Translation of Text into Fashion Outfits and A Novel NeRA Adapter for Enhanced Feature Adaptation. 2094-2103 - MyoungGon Kim, JeongHyeon Ahn, Seohyeon Park, Hyemi Kim, Seunghyun Park, Jung Ho Hwang, JungHyun Han:

EllipssianNet: Image-guided Sampling of 2D Gaussians for Gaussian Splatting. 2104-2113 - Brent A. Griffin, Jacob Marks, Jason J. Corso:

Zero-Shot Coreset Selection via Iterative Subspace Sampling. 2114-2124 - Aqsa Yousaf, Sint Sint Win, Megan Coffee, Habeeb Olufowobi

:
MorphXAI: An Explainable Framework for Morphological Analysis of Parasites in Blood Smear Images. 2125-2134 - Ching-Heng Cheng, Jen-Wei Lee, Chia-Ming Lee, Chih-Chung Hsu

:
WWE-UIE: A Wavelet & White Balance Efficient Network for Underwater Image Enhancement. 2135-2145 - Seungchan Kwon, Gyuil Lim, Youngjoon Han:

SPAR-Det: Segmentation-guided and Prior-Aided Routing for Small Object Detection. 2146-2155 - Mubarak Olaoluwa, Heni Loukil, Arafet Sbei, Hassen Drira:

GeoHSAF: Geometric Hippocampus Shape Analysis Framework for Longitudinal Alzheimer's Disease Classification. 2156-2167 - Thomas Klassert, Adrian Ulges, Biying Fu:

BAFIS: Dataset + Framework to assess occupational Bias and Human Preference in modern Text-to-image Models. 2168-2177 - Nurit Spingarn, Tomer Michaeli:

Imitating the Functionality of Image-to-Image Models Using a Single Example. 2178-2187 - Jaehun Bang, Moon Ye-Bin, Tae-Hyun Oh, Kyungdon Joo:

Beyond the Highlights: Video Retrieval with Salient and Surrounding Contexts. 2188-2197 - Bowen Yuan

, Yuxia Fu, Zijian Wang
, Yadan Luo
, Zi Huang
:
SCORE: Soft Label Compression-Centric Dataset Condensation via Coding Rate Optimization. 2198-2208 - Faizan Farooq Khan, Eslam Abdelrahman, Davide Morelli, Marcella Cornia, Rita Cucchiara, Mohamed Elhoseiny:

Sketch2Stitch: GANs for Abstract Sketch-Based Dress Synthesis. 2209-2219 - Yongjun Choi, Seungoh Han, Soomin Kim, Sumin Son, Mohsen Rohani, Edgar Maucourant, Dongbo Min, Kyungdon Joo:

AnyBald: Toward Realistic Diffusion-Based Hair Removal In-The-Wild. 2220-2230 - Brandon Collins, Mohammad Reza Taesiri, Logan Bolton, Viet Dac Lai, Franck Dernoncourt, Trung Bui, Anh Totti Nguyen:

Understanding Generative AI Capabilities in Everyday Image Editing Tasks. 2231-2241 - Wesley Khademi, Jogendra Kundu, Yatong An, Alexander Fix, David Colmenares:

Reconstructing Realistic and Relightable Eyes. 2242-2252 - Alessio Quercia, Zhuo Cao, Arya Bangun, Richard D. Paul, Abigail Morrison, Ira Assent

, Hanno Scharr:
1LoRa: Summation Compression for Very Low-Rank Adaptation. 2253-2262 - S. M. A. Sharif, Abdur Rehman, Zain Ul Abidin

, Fayaz Ali Dharejo, Radu Timofte, Rizwan Ali Naqvi:
Illuminating Darkness: Learning to Enhance Low-light Images In-the-Wild. 2263-2272 - Changgyoon Oh, Hyeonseong Kim, Daehyun We, Jongoh Jeong, Yujeong Chae, Kuk-Jin Yoon:

DOODLE: Diffusion-based Out-of-Distribution Learning for Open-set LiDAR Semantic Segmentation. 2273-2283 - Ashish Bastola, Nishant Luitel, Hao Wang, Danda Pani Paudel, Roshni Poudel, Abolfazl Razi:

RobustFormer: Noise-Robust Pre-training for Images and Videos. 2284-2294 - Zeyuan Chen, Xiang Zhang, Haiyang Xu, Jianwen Xie, Zhuowen Tu:

CVP: Central-Peripheral Vision-Inspired Multimodal Model for Spatial Reasoning. 2295-2305 - Anurag Pandey, Aditya Nigam, Arnav Bhavsar, Ashutosh Sharma, Basu Verma, Divya Acharya, Mohd Amir:

Trajectory Tactics: When Transformers Learn Exploration to Generate Online Signature. 2306-2315 - Parul Gupta, Varun Khurana, Yaman Kumar Singla, Balaji Krishnamurthy, Abhinav Dhall:

BrandFusion: Aligning Image Generation with Brand Styles. 2316-2326 - Zhenxiang Lin, Maryam Haghighat

, Will Browne, Dimity Miller
:
Intra-Class Probabilistic Embeddings for Uncertainty Estimation in Vision-Language Models. 2327-2337 - Xue Li, Aiwen Jiang, Hongqian Yu, Yang Xiao:

FARF-Net: Frequency-guided Adaptive Receptive Field Network for Edge-enhanced Polyp Segmentation. 2338-2347 - Minh Tran, Maksim Siniukov, Zhangyu Jin, Mohammad Soleymani:

Discrete Facial Encoding: A Framework for Data-driven Facial Display Discovery. 2348-2358 - Jun Li, Che Liu, Wenjia Bai, Mingxuan Liu, Rossella Arcucci, Cosmin I. Bercea, Julia A. Schnabel

:
Knowledge to Sight: Reasoning over Visual Attributes via Knowledge Decomposition for Abnormality Grounding. 2359-2369 - Marius Dähling, Sebastian Krebs, J. Marius Zöllner:

DenseBEV: Transforming BEV Grid Cells into 3D Objects. 2370-2379 - Ayan Banerjee, Kuntal Thakur, Sandeep K. S. Gupta:

Human knowledge integrated multi-modal learning for single source domain generalization. 2380-2391 - Patrick Kwon, Chen Chen, Hanbyul Joo:

GraspDiffusion: Synthesizing Realistic Whole-body Hand-Object Interaction. 2392-2403 - Kaushik Vishwakarma, Aditya Nigam:

ScoliGaitX: A Deep Multi-Modal Fusion Network for Scoliosis Assessment via Gait Video Analysis. 2404-2413 - JaeHyuk Son, Young-Seok Choi:

Non-Contact Blood Pressure Estimation from Face Videos via Physiology-Aware Contrastive Learning. 2414-2423 - Nha Tran, Dat Ly, Phi Ta, Hung Nguyen, Hien D. Nguyen:

Ordinal-Aware Multimodal Engagement Recognition for Collaborative Learning. 2424-2433 - Runfa Blark Li, Mahdi Shaghaghi, Keito Suzuki, Xinshuang Liu, Varun Moparthi, Bang Du, Walker Curtis, Martin Renschler, Ki Myung Brian Lee, Nikolay Atanasov, Truong Q. Nguyen:

DynaGSLAM: Real-Time Gaussian-Splatting SLAM for Online Rendering, Tracking, Motion Predictions of Moving Objects in Dynamic Scenes. 2434-2444 - Jayant Mahawar, Angshuman Paul:

Test-Time Adaptation through Semantically-guided Feature Decomposition for Few-shot Chest X-ray Diagnosis. 2445-2454 - Reeshoon Sayera, Akash Kumar, Sirshapan Mitra, Prudvi Kamtam, Yogesh S. Rawat:

RobustGait: Robustness Analysis for Appearance Based Gait Recognition. 2451-2552 - Yan Zheng, Yi Yang, Lanqing Guo, Zhangyang Wang:

FlowMorph: Revealing an Optimizable Flow Latent Space for Controlled Image Morphing. 2455-2464 - Leo Fillioux, Enzo Ferrante, Paul-Henry Cournède, Maria Vakalopoulou, Stergios Christodoulidis:

PVeRA: Probabilistic Vector-Based Random Matrix Adaptation. 2465-2474 - Tz-Ying Wu, Sharath Nittur Sridhar, Subarna Tripathi:

Harnessing Object Grounding for Time-Sensitive Video Understanding. 2475-2484 - Maximilian von Klinski, Maximilian Schall:

TaxonRL: Reinforcement Learning with Intermediate Rewards for Interpretable Fine-Grained Visual Reasoning. 2485-2498 - Simone Mosco, Daniel Fusaro, Wanmeng Li, Alberto Pretto:

Revisiting Retentive Networks for Fast Range-View 3D LiDAR Semantic Segmentation. 2499-2509 - Junhao Xing, Ryohei Miyakawa, Yang Yang, Xinpeng Liu

, Risa Shinoda, Hiroaki Santo, Yosuke Toda, Fumio Okura:
Zero-shot Hierarchical Plant Segmentation via Foundation Segmentation Models and Text-to-image Attention. 2510-2519 - Seungryong Lee, Woojeong Baek, Younghyun Kim, Eunwoo Kim, Haru Moon, Donggon Yoo, Eunbyung Park:

Moiré Zero: An Efficient and High-Performance Neural Architecture for Moiré Removal. 2520-2530 - Manjushree B. Aithal, Rosaura G. VidalMata, Manikandtan Kartha, Gong Chen, Eashan Adhikarla, Lucas N. Kristen, Zhicheng Fu, Nikhil A. Madusudhana, Joe Nasti:

LENVIZ: A High-Resolution Low-Exposure Night Vision Benchmark Dataset. 2531-2540 - Ashutosh Anshul, Eng Siong Chng, Deepu Rajan:

A-V Representation Learning via Audio Shift Prediction for Multimodal Deepfake Detection and Temporal Localization. 2553-2563 - Ayan Banerjee, Nityanand Mathur, Josep Lladós, Umapada Pal, Anjan Dutta:

CraftSVG: Multi-Object Text-to-SVG Synthesis via Layout Guided Diffusion. 2564-2574 - Quentin Gabot, Teck-Yian Lim, Jérémy Fix, Joana Frontera-Pons, Chengfang Ren, Jean Philippe Ovarlez:

Shift-Equivariant Complex-Valued Convolutional Neural Networks. 2575-2584 - Siddharth Katageri, Sanjana Sinha, Sourav Ghosh, Soumyadip Maity, Brojeshwar Bhowmick:

ObjectMeshDeform : Towards recovering precise 3D geometry of real objects via image-guided mesh deformation of 3D generative priors. 2585-2595 - Uday Kamal, Saibal Mukhopadhyay:

Memory-Augmented Representation for Efficient Event-based Visuomotor Policy Learning with Adaptive Perception and Control. 2596-2605 - Trung Kien Pham, Hoang Minh Vu, Anh Duc Chu, Dac Thai Nguyen, Trung Thanh Nguyen, Thao Nguyen Truong, Hong Son Mai, Phi Le Nguyen:

PADM: A Physics-aware Diffusion Model for Attenuation Correction. 2606-2615 - Yunheon Lee, Juncheol Ye, Jaehong Kim, Dongsu Han:

NerVast: Compression-Efficient Scaling of Implicit Neural Video Representations via Scene-based Parameter-sharing. 2616-2625 - Quynh Phung, Long Mai, Fabian David Caba Heilbron, Feng Liu, Jia-Bin Huang, Cusuh Ham:

CineVerse: Consistent Keyframe Synthesis for Cinematic Scene Composition. 2626-2636 - Kyotaro Tokoro, Hiromu Taketsugu, Norimichi Ukita:

MMCM: Multimodality-aware Metric using Clustering-based Modes for Probabilistic Human Motion Prediction. 2637-2647 - Ashutosh Chaubey, Xulang Guan, Mohammad Soleymani:

Face-LLaVA: Facial Expression and Attribute Understanding through Instruction Tuning. 2648-2660 - Abbas Haider, David Wright

, Ruth E. Hogg
, Hui Wang
, Tunde Peto
, Richard Gault
:
ConsensusXAI: A framework to examine class-wise agreement in medical imaging. 2661-2669 - Tomoki Uchiyama, Yukinobu Sakata, Ryusuke Hirai, Hitoshi Ishikawa, Shinichiro Mori:

Real-Time Tracking of Flexible Markers in Low-Contrast Fluoroscopy Using a Deep Neural Network Trained Solely on Synthetic Data. 2670-2679 - Ryoto Miyamoto, Xin Fan, Fuyuko Kido, Tsuneo Matsumoto, Hayato Yamana:

OpenLVLM-MIA: A Controlled Benchmark Revealing the Limits of Membership Inference Attacks on Large Vision-Language Models. 2680-2689 - Paul R. Hill, Zhiming Liu, Alin Achim, David Bull

, Nantheera Anantrasirichai
:
DMAT: An End-to-End Framework for Joint Atmospheric Turbulence Mitigation and Object Detection. 2690-2699 - Anh-Tuan Mai, Cam-Van Thi Nguyen, Duc-Trong Le

:
Divide and Refine: Enhancing Multimodal Representation and Explainability for Emotion Recognition in Conversation. 2700-2709 - Abdulwahab Felemban

, Nussair Hroub, Jian Ding, Eslam Abdelrahman, Xiaoqian Shen
, Abduallah A. Mohamed, Mohamed Elhoseiny
:
iMotion-LLM: Instruction-Conditioned Trajectory Generation. 2710-2720 - Hu Cui, Wenqiang Hua, Renjing Huang, Shurui Jia, Tessai Hayama:

SasMamba: A Lightweight Structure-Aware Stride State Space Model for 3D Human Pose Estimation. 2721-2730 - Dung Thuy Nguyen, Quang Nguyen, Preston K. Robinette, Eli Jiang, Taylor T. Johnson, Kevin Leach:

SUGAR: A Sweeter Spot for Generative Unlearning of Many Identities. 2731-2740 - Yimu Wang, Evelien Riddell, Adrian Chow, Sean Sedwards, Krzysztof Czarnecki:

Mitigating the Modality Gap: Few-Shot Out-of-Distribution Detection with Multi-modal Prototypes and Image Bias Estimation. 2741-2751 - Yusuke Marumo, Kazuhiko Kawamoto, Satomi Tanaka, Shigenobu Hirano, Hiroshi Kera:

Matching Semantically Similar Non-Identical Objects. 2752-2764 - Nhat-Tuong Do-Tran, Ngoc-Hoang-Lam Le, Ching-Chun Huang:

UI-Styler: Ultrasound Image Style Transfer with Class-Aware Prompts for Cross-Device Diagnosis Using a Frozen Black-Box Inference Network. 2765-2774 - Jahanvi Rajput, Dhruv Kudale, Saikiran Kasturi, Utkarsh Verma, Ganesh Ramakrishnan:

Tables Decoded: DELTA for Structure, TarQA for Understanding. 2775-2785 - Daechul Ahn, Yura Choi, Hyeonbeom Choi, Seongwon Cho, San Kim, Jonghyun Choi:

What Happens When: Learning Temporal Orders of Events in Videos. 2786-2796 - Huy Le, Nhat Chung, Tung Kieu, Jingkang Yang, Ngan Le:

UNO: Unifying One-stage Video Scene Graph Generation via Object-Centric Visual Representation Learning. 2797-2807 - Sourasekhar Banerjee, Vengateswaran Subramaniam, Debaditya Roy, Vigneshwaran Subbaraju

, Monowar Bhuyan:
Personalized Image Privacy Advisors via Federated Daisy-Chaining. 2808-2817 - Saumyaranjan Mohanty, Aravind Reddy, Konda Reddy Mopuri:

DiRe: Diversity-promoting Regularization for Dataset Condensation. 2818-2827 - Siddhant Gole, Akash Pal, Ankit Jha, Subhasis Chaudhuri, Biplab Banerjee:

Vision-informed Semantic Text Alignment for Open-set Recognition in Remote Sensing. 2828-2837 - Difei Gu, Yunhe Gao, Mu Zhou, Dimitris N. Metaxas:

Anatomy-VLM: A Fine-grained Vision-Language Model for Medical Interpretation. 2838-2847 - Vignesh Gopinathan, Urs Zimmermann, Michael Arnold, Matthias Rottmann:

Temporal Object Captioning for Street Scene Videos from LiDAR Tracks. 2848-2857 - Soroush Mehraban, Mohammad Javad Rajabi, Andrea Iaboni, Babak Taati:

STARS: Self-supervised Tuning for 3D Action Recognition in Skeleton Sequences. 2858-2868 - Sameer Malik, Ayush Singh, Moyuru Yamada, Dishank Aggarwal:

RAVU: Retrieval Augmented Video Understanding with Compositional Reasoning over Graph. 2869-2878 - Taewook Kim, Ze Wang, Zhengyuan Yang, Jiang Wang, Lijuan Wang, Zicheng Liu, Qiang Qiu:

Conditional Text-to-Image Generation with Reference Guidance. 2879-2889 - Saad Lahrichi, Jake Bova, Jesse Johnson, Jordan M. Malof:

Improved Wildfire Spread Prediction with Time-Series Data and the WSTS+ Benchmark. 2890-2900 - Juan Jesús Losada Del Olmo, Emilio Pardo Ballesteros

, Pedro E. López-de-Teruel, Alberto Ruiz:
From Few-Shot to Zero-Shot Pallet Load Recognition: A Deployed Embedding-Based Vision System for Industrial Logistics. 2901-2911 - Dong-Hoon Kang, Seung-Yeop Baek, Jong-Ok Kim:

Graph-Based Spectral Attention with Multi-Spectral Images for Illuminant Estimation. 2912-2922 - Saarthak Kapse, Robin Betz, Srinivasan Sivanandan:

Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing. 2923-2933 - Changlin Song, Yunzhong Hou, Michael Randall Barnes, Rahul Shome, Dylan Campbell:

Extreme Amodal Face Detection. 2934-2943 - A. Q. M. Sazzad Sayyed, Nathaniel D. Bastian, Francesco Restuccia:

ENCORE: A Neural Collapse Perspective on Out-of-Distribution Detection in Deep Neural Networks. 2944-2953 - Misgina Tsighe Hagos, Claes Lundström:

Performance of Conformal Prediction in Capturing Aleatoric Uncertainty. 2954-2963 - Ziqiang Shi, Rujie Liu, Shanshan Yu, Satoshi Munakata, Koichi Shirahata:

Scalpel: Fine-Grained Alignment of Attention Activation Manifolds via Mixture Gaussian Bridges to Mitigate Multimodal Hallucination. 2964-2973 - Sabbir Ahmed, Mamshad Nayeem Rizve, Abdullah Al Arafat, Jacqueline Tiffany Liu, Rahim Hossain, Mohaiminul Al Nahian, Adnan Siraj Rakin:

Unified Alignment Protocol: Making Sense of the Unlabeled Data in New Domains. 2974-2983 - Arani Roy, Marco Paul E. Apolinario, Shristi Das Biswas, Kaushik Roy:

Feedback Alignment Meets Low-Rank Manifolds: A Structured Recipe for Local Learning. 2984-2992 - Taki Hasan Rafi, Amit Agarwal, Hitesh Laxmichand Patel, Dong-Kyu Chae:

Learning from Unknown for Open-Set Test-Time Adaptation. 2993-3004 - Alexander Prutsch, David Schinagl, Horst Possegger:

Streaming Real-Time Trajectory Prediction Using Endpoint-Aware Modeling. 3005-3014 - Diogo J. Paulo

, João Martins, Hugo Proença, João C. Neves:
StreetView-Waste: A Multi-Task Dataset for Urban Waste Management. 3015-3025 - Sunghyun Ahn, Youngwan Jo, Kijung Lee, Sein Kwon, Inpyo Hong, Sanghyun Park:

AnyAnomaly: Zero-Shot Customizable Video Anomaly Detection with LVLM. 3026-3035 - Laura Bragagnolo, Leonardo Barcellona, Stefano Ghidoni:

SkelSplat: Robust Multi-view 3D Human Pose Estimation with Differentiable Gaussian Rendering. 3036-3046 - Huaying Zhang, Atsushi Hashimoto, Tosho Hirasawa:

Evaluating the Capability of Video Question Generation for Expert Knowledge Elicitation. 3047-3056 - Meng-Ting Jhong, Tai-Ming Huang, Shung-Fu Chen, Wen-Huang Cheng, Kai-Lung Hua:

Dragonite: Single-Step Drag-based Image Editing with Geometric-Semantic Guidance. 3057-3066 - Michael Tomadakis, Rebecca Borissova, Yuxuan Zhang, Sanjeev J. Koppal:

Augmenting with NeRFs: Fast Relocalization on Densified Datasets. 3067-3076 - William Ljungbergh, Adam Lilja, Adam Tonderski, Arvid Laveno Ling, Carl Lindström, Willem Verbeke, Junsheng Fu, Christoffer Petersson, Lars Hammarstrand, Michael Felsberg:

GASP: Unifying Geometric and Semantic Self-Supervised Pre-training for Autonomous Driving. 3077-3087 - Gilhyun Nam, Taewon Kim, Joonhyun Jeong, Eunho Yang:

Towards Reliable Test-Time Adaptation: Style Invariance as a Correctness Likelihood. 3088-3097 - Alireza Javanmardi, Pragati Jaiswal, Tewodros Amberbir Habtegebrial, Christen Millerdurai, Shaoxiang Wang, Alain Pagani, Didier Stricker:

TalkingPose: Efficient Face and Gesture Animation with Feedback-guided Diffusion Model. 3098-3108 - Sen Zhang, Xiaoxiao He, Di Liu, Zhaoyang Xia, Mingyu Zhao, Chaowei Tan, Vivian Li, Bo Liu, Dimitris N. Metaxas, Mubbasir Kapadia:

Large Sign Language Models: Toward 3D American Sign Language Translation. 3109-3119 - Mohammad Mahdi Moradi, Sudhir Mudur:

Crafting Descriptive Information for a Zero-shot Method to Improve Knowledge-Based Visual Question Answering Performance. 3120-3128 - Arjun Ramesh Kaushik, Nalini K. Ratha, Venu Govindaraju:

Learning Action Hierarchies via Hybrid Geometric Diffusion. 3129-3139 - Farhana Hossain Swarnali, Miaomiao Zhang, Tonmoy Hossain:

Learning Group Actions In Disentangled Latent Image Representations. 3140-3149 - Vida Adeli, Soroush Mehraban, Majid Mirmehdi, Alan L. Whone, Benjamin Filtjens

, Amirhossein Dadashzadeh, Alfonso Fasano, Andrea Iaboni, Babak Taati:
GAITGen: Disentangled Motion-Pathology Impaired Gait Generative Model - Bringing Motion Generation to the Clinical Domain. 3150-3161 - Rahul Shenoy, Zhihong Pan, Kaushik Balakrishnan, Qisen Cheng, Yongmoon Jeon, Heejune Yang, Jaewon Kim:

Gradient-Free Classifier Guidance for Diffusion Model Sampling. 3162-3171 - Kai-Po Chang, Wei-Yuan Cheng, Chi-Pin Huang, Fu-En Yang, Yu-Chiang Frank Wang:

Mitigating Object and Action Hallucinations in Multimodal LLMs via Self-Augmented Contrastive Alignment. 3172-3181 - Junyi Zhu, Ruicong Yao, Taha Ceritli, Savas Özkan, Matthew B. Blaschko, Eunchung Noh, Jeongwon Min, Cho Jung Min, Mete Ozay:

Guided Model Merging for Hybrid Data Learning: Leveraging Centralized Data to Refine Decentralized Models. 3182-3192 - Yue-Gao Lu, Hong-Jie Xing, Chun-Guo Li:

Fused Similarity Measure Based Alignment with Dual-Scale Adaptive Selection for Weakly Supervised Video Anomaly Detection. 3193-3202 - Yunze Liu, Zifan Wang, Peiran Wu, Jiayang Ao:

PointNet4D: A Lightweight 4D Point Cloud Video Backbone for Online and Offline Perception in Robotic Applications. 3203-3212 - Sungheon Jeong, Hanning Chen, Sanggeon Yun, Suhyeon Cho, Wenjun Huang, Xiangjian Liu, Mohsen Imani:

Cross-Modal Event Encoder: Bridging Image-Text Knowledge to Event Streams. 3213-3222 - Hala Djeghim, Céline Loscos, Désiré Sidibé:

SAIL: Self-supervised Learning of Lighting-Invariant Representations from Real Images with Latent Diffusion. 3223-3232 - Dingbang Huang, Wenbo Li, Yifei Zhao, Xinyu Pan, Yanhong Zeng, Bo Dai:

PSDiffusion: Harmonized Multi-Layer Image Generation via Layout and Appearance Alignment. 3233-3242 - Kunal Mahatha, Jose Dolz, Christian Desrosiers:

Nerve: Neighbourhood & Entropy-guided Random-walk for training free open-Vocabulary sEgmentation. 3243-3253 - Mohammad Fahes, Tuan-Hung Vu, Andrei Bursuc, Patrick Pérez, Raoul de Charette:

CLIP's Visual Embedding Projector is a Few-shot Cornucopia. 3254-3264 - Yuhao Su, Ehsan Elhamifar:

RegionAligner: Bridging Ego-Exo Views for Object Correspondence via Unified Text-Visual Learning. 3265-3274 - Mellon M. Zhang, Glen Chou, Saibal Mukhopadhyay:

Towards Streaming LiDAR Object Detection with Point Clouds as Egocentric Sequences. 3275-3284 - Yujiang Pu, Zhanbo Huang, Vishnu Boddeti, Yu Kong:

Show Me: Unifying Instructional Image and Video Generation with Diffusion Models. 3285-3296 - Chi-Yao Huang, Zeel Bhatt, Yezhou Yang:

VOCAL: Visual Odometry via ContrAstive Learning. 3297-3309 - Seonghee Han, Minchang Chung, Gyeongsu Cho, Kyungdon Joo, Taehwan Kim:

Pose-Diverse Multi-View Virtual Try-on from a Single Frontal Image via Diffusion Transformer. 3310-3319 - Esha Dasgupta, Boeun Kim, Sang Hoon Yeo, Hyung Jin Chang:

SimForce: Force and Surface Electromyography from Full Body Video with Graph Neural Nets. 3320-3329 - Brian Cheong, Letian Wang, Sandro Papais, Steven L. Waslander:

SCATR: Mitigating New Instance Suppression in LiDAR-based Tracking-by-Attention via Second Chance Assignment and Track Query Dropout. 3330-3339 - Zhiyun Deng, Austin Case, Luis Sentis:

AirLock+: Scaling UAV-to-Satellite Image Registration for Target Geolocalization and Geospatial Augmented Reality. 3340-3349 - Chia-Hern Lai, I-Hsuan Lo, Yen-Ku Yeh, Thanh-Nguyen Truong, Ching-Chun Huang:

Blur2Sharp: Human Novel Pose and View Synthesis with Generative Prior Refinement. 3350-3359 - Tuan-Anh Vu, Hai Nguyen-Truong, Ziqiang Zheng, Binh-Son Hua, Qing Guo, Ivor W. Tsang, Sai-Kit Yeung:

Power of Boundary and Reflection: Semantic Transparent Object Segmentation using Pyramid Vision Transformer with Transparent Cues. 3360-3369 - Minjun Kim, Minje Kim:

HEART-PFL: Stable Personalized Federated Learning under Heterogeneity with Hierarchical Directional Alignment and Adversarial Knowledge Transfer. 3370-3379 - Vengateswaran Subramaniam, Vigneshwaran Subbaraju

, Debaditya Roy, Pramath Krishna, Thivya Kandappu, Qianli Xu:
Detecting Social Engagement of Elderly From Lifelog Image-streams to Identify Effective Cues for Autobiographic Recall. 3380-3389 - Mayur Mallya, Ali Khajegili Mirabadi, Hossein Farahani, Ali Bashashati:

HistoMILKD: A Multiple Instance Learning based Multi-Teacher Knowledge Distillation Framework for Whole Slide Image Classification. 3390-3400 - Xinyue Zhang, Haolong Li, Jiawei Ma, Chen Ye:

Stroke Modeling Enables Vectorized Character Generation with Large Vectorized Glyph Model. 3401-3410 - Mishan Aliev, Dmitry Baranchuk, Kirill Struminsky:

CasTex: Cascaded Text-to-Texture Synthesis via Explicit Texture Maps and Physically-Based Shading. 3411-3420 - Julian Strohmayer, Rafael Sterzinger, Matthias Wödlinger, Martin Kampel:

DATTA: Domain-Adversarial Test-Time Adaptation for Cross-Domain WiFi-Based Human Activity Recognition. 3421-3430 - Mahdi Alehdaghi, Rajarshi Bhattacharya, Pourya Shamsolmoali, Rafael M. O. Cruz, Eric Granger:

MixER: From Cross-Modal to Mixed-Modal Visible-Infrared Re-Identification. 3431-3440 - Seungoh Han, Jaehoon Jang, Hyunsu Kim, Jaeheung Surh, Junhyung Kwak, Hyowon Ha, Kyungdon Joo:

LighthouseGS: Indoor Structure-aware 3D Gaussian Splatting for Panorama-Style Mobile Captures. 3441-3450 - Bin Yang, Alexandru Paul Condurache:

⚡FLARES⚡: Fast and Accurate LiDAR Multi-Range Semantic Segmentation. 3451-3461 - Roy H. Jennings, Genady Paikin, Roy Shaul, Evgeny Soloveichik:

Language Integration in Fine-Tuning Multimodal Large Language Models for Image-Based Regression. 3462-3471 - Suhas Srinath, Hemang Jamadagni, Aditya Chandrasekar, Prathosh A. P.:

MANTA: Physics-Informed Generalized Underwater Object Tracking. 3472-3482 - Wenke E, Yixin Sun, Jiaxu Liu, Hubert P. H. Shum, Amir Atapour-Abarghouei, Toby P. Breckon:

KD360-VoxelBEV: LiDAR and 360-degree Camera Cross Modality Knowledge Distillation for Bird's-Eye-View Segmentation. 3483-3493 - Mohammad Areeb Qazi, Munachiso S. Nwadike, Ibrahim Almakky, Mohammad Yaqub, Numan Saeed:

MAFM3: Modular Adaptation of Foundation Models for Multi-Modal Medical AI. 3494-3503 - Priyanka Mandikal, Tushar Nagarajan, Alex Stoken, Zihui Xue, Kristen Grauman:

SPOC: Spatially-Progressing Object State Change Segmentation in Video. 3504-3513 - Xi Xiao, Zhuxuanzi Wang, Mingqiao Mo, Chen Liu, Chenrui Ma, Yanshu Li, Smita Krishnaswamy, Xiao Wang, Tianyang Wang:

Self-Supervised Visual Prompting for Cross-Domain Road Damage Detection. 3514-3524 - Sapir Esther Yiflach, Yuval Atzmon, Gal Chechik

:
Data-Driven Loss Functions for Inference-Time Optimization in Text-to-Image. 3525-3535 - Marc Peral, Guillem Capellera, Luis Ferraz, Antonio Rubio, Antonio Agudo:

Multi-Modal Soccer Scene Analysis with Masked Pre-Training. 3536-3545 - Qizhen Lan, Jung Im Choi, Qing Tian

:
Visual Detector Compression via Location-Aware Discriminant Analysis. 3546-3555 - Faezeh Zakeri, Lukas Ruppert, Raphael Braun, Hendrik P. A. Lensch:

Latent Uncertainty-Aware Multi-View SDF Scan Completion. 3556-3566 - Hanwen Liang, Dejia Xu, Neel P. Bhatt, Hezhen Hu, Hanxue Liang, Konstantinos N. Plataniotis:

Comp4D: Compositional 4D Scene Generation. 3567-3577 - Shanaka Liyanaarachchi, Chathurya Wijethunga, Shihab Aaqil Ahamed, Akthas Absar, Ranga Rodrigo:

SENCA-st: Integrating Spatial Transcriptomics and Histopathology with Cross Attention Shared Encoder for Region Identification in Cancer Pathology. 3578-3787 - Kin Ching Lydia Chau, Zhi Yu, Ruowei Jiang:

Towards High-Fidelity, Identity-Preserving Real-Time Makeup Transfer: Decoupling Style Generation. 3588-3597 - Eduard Allakhverdov, Dmitrii Tarasov, Elizaveta Goncharova, Andrey Kuznetsov:

Feature Inversion as a Lens on Vision Encoders. 3598-3605 - Muhammad Osama Zeeshan

, Natacha Gillet, Alessandro Lameiras Koerich, Marco Pedersoli, François Brémond, Eric Granger:
MuSACo: Multimodal Subject-Specific Selection and Adaptation for Expression Recognition with Co-Training. 3606-3616 - E. Zhixuan Zeng, Yuhao Chen, Alexander Wong:

SCALEX: Scalable Concept and Latent Exploration for Diffusion Models. 3617-3627 - Ahmed Hasssan, Jian Meng, Yuanbo Xiangli, Jae-sun Seo:

DCSHARP: 3D Gaussian Splatting with Direction Cosine Spherical Harmonics and Shape-Aware Pruning. 3628-3637 - Shreya Biswas, Zhaozheng Yin:

DOTGraph: CLIP-Driven Feature Disentanglement and Optimal Transport based Graph Learning for Few-Shot Segmentation. 3638-3647 - Mohamad Zamini, Diksha Shukla:

Delta-LLaVA: Base-then-Specialize Alignment for Token-Efficient Vision-Language Models. 3648-3657 - Tianhao Xie, Noam Aigerman, Eugene Belilovsky, Tiberiu Popa:

Sketch-guided Cage-based 3D Gaussian Splatting Deformation. 3658-3667 - Carmine Zaccagnino

, Fabio Quattrini, Vittorio Pippi, Silvia Cascianelli
, Alessio Tonioni, Rita Cucchiara:
Autoregressive Styled Text Image Generation, but Make it Reliable. 3668-3678 - Ondrej Týbl, Lukás Neumann:

Universal Neural Architecture Space: Covering ConvNets, Transformers and Everything in Between. 3679-3688 - Xiao Guo, Zhimin Chen, Carlos D. Castillo, Hongcheng Wang, Xiaoming Liu:

Sea-CLIP: Mining Semantic-Aware Representations for Few-Shot Anomaly Detection with CLIP. 3689-3699 - Banafsheh Karimian, Giulia Avanzato, Soufiane Belharbi, Alexis Guichemerre, Luke McCaffrey, Mohammadhadi Shateri, Eric Granger:

CLIP-IT: CLIP-based Pairing of Histology Images with Privileged Textual Information. 3700-3709 - Heena Patel, Anirban Chowdhury, Pooja Jigar Choksy, Samiksha Pradeep Pachade, Ajinkya Puar:

LightGazeNet: A Lightweight GNN-based Architecture for Gaze Estimation. 3710-3719 - Runhua Deng, Aiwen Jiang, Long Peng, Qiuhai Yan:

Codebook Knowledge with Mamba-Transformer For Low-Light Image Enhancement. 3720-3729 - Leeje Jang, Yijun Lin, Yao-Yi Chiang

, Jerod J. Weinman:
TICLS: Tightly Coupled Language Text Spotter. 3730-3740 - Yang Cheng, Ziteng Cui, Lin Gu, Shenghan Su, Zenghui Zhang:

Perception-Inspired Color Space Design for Photo White Balance Editing. 3741-3749 - A. Q. M. Sazzad Sayyed, Nathaniel D. Bastian, Michael J. De Lucia, Ananthram Swami, Francesco Restuccia:

CLUE: Bringing Machine Unlearning to Mobile Devices. 3750-3759 - Dian Jia, Pei Yu, Wei Tang:

FairScene: Learning Class-Disentangled 2D/3D Representations for Semantic Scene Completion. 3760-3770 - Mingliang Liang

, Martha A. Larson:
Frequency Is What You Need: Considering Word Frequency When Text Masking Benefits Vision-Language Model Pre-training. 3771-3780 - Aayush Atul Verma, Arpitsinh Vaghela, Bharatesh Chakravarthi, Kaustav Chanda, Yezhou Yang:

Event-based Graph Representation with Spatial and Motion Vectors for Asynchronous Object Detection. 3781-3791 - Qinyi Cao, Jianan Fan, Tom Weidong Cai:

ART-ASyn: Anatomy-aware Realistic Texture-based Anomaly Synthesis Framework for Chest X-Rays. 3792-3802 - Masih Aminbeidokhti, Heitor Rapela Medeiros, Srikanth Muralidharan, Eric Granger, Marco Pedersoli:

High-Rate Mixout: Revisiting Mixout for Robust Domain Generalization. 3803-3812 - Zhikang Dong, Weituo Hao, Ju-Chiang Wang, Peng Zhang, Pawel Polak:

MuseDance: A Diffusion-based Music-Driven Image Animation System. 3813-3824 - Bulat Khaertdinov, Mirela Popa, Nava Tintarev:

A Little More Like This: Text-to-Image Retrieval with Vision-Language Models Using Relevance Feedback. 3825-3834 - Jinyung Hong

, Yearim Kim, Keun Hee Park, Sangyu Han, Nojun Kwak, Theodore P. Pavlic:
Bi-ICE: An Inner Interpretable Framework for Image Classification via Bi-directional Interactions between Concept and Input Embeddings. 3835-3845 - Ashutosh Kulkarni, Prashant W. Patil, Santosh Kumar Vipparthi, Subrahmanyam Murala, Balasubramanian Raman:

DTMIR-Pro: Domain Translation with Prompt-based Latent-Space Generalization for Multi-Weather Image Restoration. 3846-3856 - Matic Fucka, Vitjan Zavrtanik, Danijel Skocaj:

ObjectCore - Efficient Few-shot Logical Anomaly Detection using Object Representations. 3857-3867 - Antonio Scardace, Lemuel Puglisi, Francesco Guarnera, Sebastiano Battiato, Daniele Ravì:

A Novel Metric for Detecting Memorization in Generative Models for Brain MRI Synthesis. 3868-3877 - Raül Pérez-Gonzalo, Riccardo Magro, Andreas Espersen, Antonio Agudo:

Unsupervised Modular Adaptive Region Growing and RegionMix Classification for Wind Turbine Segmentation. 3878-3888 - Hao Yu, Rupayan Mallick, Margrit Betke, Sarah Adel Bargal:

Gen-AFFECT: Generation of Avatar Fine-grained Facial Expressions with Consistent identiTy. 3889-3899 - Georges Le Bellier, Nicolas Audebert:

FlowEO: Generative Unsupervised Domain Adaptation for Earth Observation. 3900-3907 - Yuki Ichikawa, Masato Motomura, Thiem Van Chu, Daichi Fujiki:

Efficient Vision Transformers via Token Merging with Head-Wise Attention Correction. 3908-3917 - Yibang Wu, Tzung-Dau Wang, Shang-Hong Lai:

2S-CEDiff: A Two-Stage Diffusion Framework for Generating High-Fidelity Contrast-Enhanced CT Images from Non-Contrast Scans. 3918-3927 - Chengyang Yan, Mitch Bryson, Donald G. Dansereau:

JOCA: Task-Driven Joint Optimisation of Camera Hardware and Adaptive Camera Control Algorithms. 3928-3938 - Fevziye Irem Eyiokur, Dogucan Yaman, Hazim Kemal Ekenel, Alexander Waibel:

CAPE: A CLIP-Aware Pointing Ensemble of Complementary Heatmap Cues for Embodied Reference Understanding. 3939-3950 - Zaira Manigrasso, Matteo Dunnhofer, Antonino Furnari, Moritz Nottebaum, Antonio Finocchiaro, Davide Marana, Rosario Forte, Giovanni Maria Farinella, Christian Micheloni:

Online Episodic Memory Visual Query Localization with Egocentric Streaming Object Memory. 3951-3960 - Bosung Kim, Kyuhwan Lee, Isu Jeong, Jungmin Cheon, Yeojin Lee, Seulki Lee:

Mobile-Oriented Video Diffusion: Enabling Text-to-Video Generation on Mobile Devices Without Retraining, Compression, or Pruning. 3961-3971 - Shounak Sural, Nishad Sahu, Ragunathan Raj Rajkumar:

WorkZone3D: A Multimodal Dataset for 3D Work Zone Perception in Autonomous Driving. 3972-3981 - Prin Phunyaphibarn, Phillip Y. Lee, Jaihoon Kim, Minhyuk Sung:

Unconditional Priors Matter! Improving Conditional Generation of Fine-Tuned Diffusion Models. 3982-3992 - Jonathan Brokman, Oren Rachmil, Omer Hofman, Roy Betser, Amit Giloni, Roman Vainshtein, Hisashi Kojima:

Training-free Detection of Text-to-video Generations via Over-coherence. 3993-4003 - Junming Liu, Yifei Sun, Weihua Cheng, Yujin Kang, Yirong Chen, Ding Wang, Guosun Zeng:

ReBrain: Brain MRI Reconstruction from Sparse CT Slice via Retrieval-Augmented Diffusion. 4004-4014 - Aryan Das, Koushik Biswas, Swalpa Kumar Roy, Badri Narayana Patro, Vinay Kumar Verma:

Efficient Text-Guided Convolutional Adapter for the Diffusion Model. 4015-4024 - Md. Rayhan Ahmed, Patricia Lasserre:

FLoMo-Net: A Novel Task-Adaptive Mixture of Experts Routing Framework with Frequency and Uncertainty Correction for Medical Image Segmentation. 4025-4035 - Shijia Feng, Michael Wray

, Walterio W. Mayol-Cuevas
:
From Detection to Anticipation: Online Understanding of Struggles across Various Tasks and Activities. 4036-4045 - Madhavi Kondapally, K. Naveen Kumar, C. Krishna Mohan, Sobhan Babu:

CaRS: A Causal Intervention Segmentation Framework and Benchmark Dataset for Autonomous Driving under Transitional Weather Conditions. 4046-4056 - Nikhil Reddy

, Chetan Arora, Mahsa Baktashmotlagh:
Domain Generalizing DINO for Visual Regression via Latent Distractor Subspace Consistency. 4057-4066 - Sajjad Pakdamansavoji, Yintao Ma, Amir Rasouli, Tongtong Cao:

WALDO: Where Unseen Model-based 6D Pose Estimation Meets Occlusion. 4067-4076 - Inbal Cohen, Boaz Meivar, Peihan Tu, Shai Avidan, Gal Oren:

Decoupling Shape and Texture in SAM-2 via Controlled Texture Replacement. 4077-4086 - Anubhooti Jain, Mayank Vatsa, Richa Singh:

HumanBench: Two Heads, No Legs, But Mostly Human, the State of Generative Capabilities in T2I Models. 4087-4096 - Huiyu Gao, Jiahao Ma, David Ahmedt-Aristizabal, Chuong Nguyen, Miaomiao Liu:

SOAF: Scene Occlusion-aware Neural Acoustic Field. 4097-4107 - M. Yashwanth, Sampath Koti, Arunabh Singh, Shyam Marjit, Anirban Chakraborty:

FedSCAl: Leveraging Server and Client Alignment for Unsupervised Federated Source-Free Domain Adaptation. 4108-4117 - Qiming Huang, Hao Ai, Jianbo Jiao:

Structure-Aware Feature Rectification with Region Adjacency Graphs for Training-Free Open-Vocabulary Semantic Segmentation. 4118-4127 - Gerhard Krumpl, Henning Avenhaus, Horst Possegger:

One Model, Many Behaviors: Training-Induced Effects on Out-of-Distribution Detection. 4128-4138 - Xinqi Xiong, Prakrut Patel, Qingyuan Fan, Amisha Wadhwa, Sarathy Selvam, Xiao Guo, Luchao Qi, Xiaoming Liu, Roni Sengupta:

TalkingHeadBench: A Multi-Modal Benchmark & Analysis of Talking-Head DeepFake Detection. 4139-4149 - Siyuan Wang, Xi Yang, Zihao Zhou, Huiru Shao, Rui Zhang, Qiufeng Wang, Guangliang Cheng, Kaizhu Huang:

Rethinking Real Image Editing: Unleashing Diverse Editing Operators via Multi-Objective Optimization. 4150-4159 - Jingna Qiu, Frauke Wilm, Mathias Öttl, Jonas Utz, Maja Schlereth, Moritz Schillinger, Marc Aubreville, Katharina Breininger:

Decomposition Sampling for Efficient Region Annotations in Active Learning. 4160-4169 - Tsai-Ling Huang, Nhat-Tuong Do-Tran, Ngoc-Hoang-Lam Le, Hong-Han Shuai, Ching-Chun Huang:

DNA: Dual-branch Network with Adaptation for Open-Set Online Handwriting Generation. 4170-4179 - Gulfam Ahmed Saju

, Anton Spirkin, Felipe Marcelino, Yuchou Chang:
STEG-AIW: Spatio-Temporal Gating and Adaptive-Timestep Inference for Efficient Spiking Neural Networks. 4180-4189 - Ce Zhang, Yale Song, Ruta Desai, Michael Louis Iuzzolino, Joseph Tighe, Gedas Bertasius, Satwik Kottur:

Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction. 4190-4200 - Rongsheng Qian, Chi Xu, Xiaoqiang Ma, Hao Fang, Yili Jin, William I. Atlas, Jiangchuan Liu:

Self-Supervised Compression and Artifact Correction for Streaming Underwater Imaging Sonar. 4201-4211 - Yunxiang Zhang, Sai Harsha Mupparaju, Kenneth Chen, Jenna Kang, Xinyu Zhang, Maito Omori, Kazuyuki Arimatsu, Qi Sun:

Perceptually Guided 3DGS Streaming and Rendering for Mixed Reality. 4212-4222 - Shu Zou, Xinyu Tian, Lukas Wesemann, Fabian Waschkowski, Zhaoyuan Yang, Jing Zhang:

Unlocking Vision-Language Models for Video Anomaly Detection via Fine-Grained Prompting. 4223-4233 - Sree Bhattacharyya, Yaman Kumar Singla, Sudhir Yarram, Somesh Singh, Harini S. I, James Z. Wang:

Unsupervised Memorability Modeling from Tip-of-the-Tongue Retrieval Queries. 4234-4241 - Yuxiao Chen, Jue Wang, Zhikang Zhang, Jingru Yi, Xu Zhang, Yang Zou, Zhaowei Cai, Jianbo Yuan, Xinyu Li, Hao Yang, Davide Modolo:

Learning Compact Video Representations for Efficient Long-form Video Understanding in Large Multimodal Models. 4242-4252 - Bishal Ranjan Swain, Kyung Joo Cheoi, Jaepil Ko:

Guided Texture Segmentation via Coordinate-Aware Class-Ratio Mapping. 4253-4261 - Dongjie Chen, Kartik Patwari, Zhengfeng Lai, Xiaoguang Zhu, Sen-Ching S. Cheung, Chen-Nee Chuah:

Empowering Source-Free Domain Adaptation via MLLM-Guided Reliability-Based Curriculum Learning. 4262-4272 - Vlad Hondru, Eduard Hogea, Darian M. Onchis, Radu Tudor Ionescu:

ExDDV: A New Dataset for Explainable Deepfake Detection in Video. 4273-4284 - Ziyuan Gao:

AGENet: Adaptive Edge-aware Geodesic Distance Learning for Few-Shot Medical Image Segmentation. 4285-4294 - Anh-Duy Le

, Van-Linh Pham, Thanh-Nam Vo, Xuan Toan Mai, Tuan Anh Tran:
CONSTANT: Towards High-Quality One-Shot Handwriting Generation with Patch Contrastive Enhancement and Style-Aware Quantization. 4295-4304 - Jaewoo Song, Jooyoung Choi, Kanghyun Baek, Sangyub Lee, Daemin Park, Sungroh Yoon:

DCText: Scheduled Attention Masking for Visual Text Generation via Divide-and-Conquer Strategy. 4305-4314 - Sanoojan Baliah, Yohan Abeysinghe, Rusiru Thushara, Khan Muhammad, Abhinav Dhall, Karthik Nandakumar, Muhammad Haris Khan:

VFace: A Training-Free Approach for Diffusion-Based Video Face Swapping. 4315-4324 - Donglin Huang, Yongyuan Li, Tianhang Liu, Junming Huang, Xiaoda Yang, Chi Wang, Weiwei Xu:

VividAnimator: An End-to-End Audio and Pose-driven Half-Body Human Animation Framework. 4325-4334 - Ayush Shrivastava, Connelly Barnes, Xuaner Zhang, Lingzhi Zhang, Andrew Owens, Sohrab Amirghodsi, Eli Shechtman:

Fine-grained Defocus Blur Control for Generative Image Models. 4335-4344 - Filippo D'Addeo, Lorenzo Cipelli, Adriano Cardace, Emanuele Ghelfi, Andrea Zinelli, Massimo Bertozzi:

CalibBEV: LiDAR-Camera Calibration via BEV Alignment. 4345-4354 - Shabnam Choudhury, Yash Salunkhe, Vaibhav Rajan, Subhasis Chaudhuri, Biplab Banerjee:

X-JEPA: A Novel Joint Learning Cross-Modal Predictive Alignment Framework for Remote Sensing Image Retrieval. 4355-4364 - Anuvab Sen, Mir Sayeed Mohammad, Saibal Mukhopadhyay:

SSMRadNet : A Sample-wise State-Space Framework for Efficient and Ultra-Light Radar Segmentation and Object Detection. 4365-4374 - Tom Burgert, Leonard W. Hackel, Paolo Rota, Begüm Demir:

Rank-based Geographical Regularization: Revisiting Contrastive Self-Supervised Learning for Multispectral Remote Sensing Imagery. 4375-4385 - Yuhang Cao, Haojun Yan, Danya Yao:

OMeGa: Joint Optimization of Explicit Meshes and Gaussian Splats for Robust Scene-Level Surface Reconstruction. 4386-4395 - Onkar Susladkar, Rohit Pawar, Chirag Sehgal, Samaksh Ujjawal, Sparsh Mittal:

Confidence Through Parallel Attention for Depth and Uncertainty Estimation in Dynamic Environments. 4396-4406 - Zhongwen Wang, Han Ling, Weihao Zhang, Yinghui Sun, Quansen Sun:

BiNAR: A Bi-Modal Framework for Non-Aligned RGB-IR 3D Reconstruction via Gaussian Splatting. 4407-4416 - Georgios Kouros, Minye Wu, Tinne Tuytelaars:

Spec-Gloss Surfels and Normal-Diffuse Priors for Relightable Glossy Objects. 4417-4426 - Lintao Xu, Yinghao Wang, Chaohui Wang:

Occlusion Boundary and Depth: Mutual Enhancement via Multi-Task Learning. 4427-4437 - Francesco Ragusa, Michele Mazzamuto, Rosario Forte, Irene D'Ambra, James Fort, Jakob J. Engel, Antonino Furnari, Giovanni Maria Farinella:

Ego-EXTRA: video-language Egocentric Dataset for EXpert-TRAinee assistance. 4438-4450 - Yuliang Huang, Pengxu Wei, Zhicheng Dong, Liang Lin:

Similarity-aware Probabilistic Embeddings Modeling for Video-Text Retrieval. 4451-4460 - Zhangyu Jin, Andrew Feng, Ankur Chemburkar, Celso Miguel de Melo:

PromptGAR: Flexible Promptive Group Activity Recognition. 4461-4471 - Zitian Tang, Rohan Myer Krishnan, Zhiqiu Yu, Chen Sun:

Spacewalk-18: A Benchmark for Multimodal and Long-form Procedural Video Understanding in Novel Domains. 4472-4482 - Yin May Oo, Yewon Hwang, Muhammad Amrulloh Robbani, Vanyi Chao, Ankhzaya Jamsrandorj, Hoang Quoc Nguyen, Kyung-Ryoul Mun, Jinwook Kim:

Broadcast2Pitch: Game State Reconstruction from Unconstrained Soccer Videos. 4483-4493 - Xin Hu, Taotao Jing, Renran Tian

, Zhengming Ding:
VLMs Guided Interpretable Decision Making for Autonomous Driving*. 4494-4503 - Hashiru Pramuditha, Vinasirajan Viruthshaan, Vishagar Arunan, Saeedha Nazar, Sameera Ramasinghe, Simon Lucey, Ranga Rodrigo:

DARB-Splatting: Generalizing Splatting with Decaying Anisotropic Radial Basis Functions. 4504-4514 - Idris O. Sunmola, Zhenjun Zhao, Samuel Schmidgall, Yumeng Wang, Paul Maria Scheikl, Viet Pham, Axel Krieger:

Surgical Gaussian Surfels: Highly Accurate Real-time Surgical Scene Rendering using Gaussian Surfels. 4515-4524 - Jinho Kim, Kuk-Jin Yoon:

Gated Temporal Fusion Transformers for Robust Multi-Object Tracking. 4525-4534 - Niaz Ahmad, Saif Ullah, Youngmoon Lee, Guanghui Wang:

SIAM: Synchronous Interaction Attention for Human Mesh Recovery. 4535-4545 - Phyo Thet Yee, Dimitrios Kollias, Sudeepta Mishra, Abhinav Dhall:

SynchroRaMa : Lip-Synchronized and Emotion-Aware Talking Face Generation via Multi-Modal Emotion Embedding. 4546-4555 - Melanie Wille, Tobias Fischer

, Scarlett Raine
:
Are All Marine Species Created Equal? Performance Disparities in Underwater Object Detection. 4556-4565 - Xianhang Li, Hongru Zhu, Sucheng Ren, Linjie Yang, Peng Wang, Heng Wang, Xiaohui Shen, Qing Liu, Cihang Xie:

LVM-Lite: Training Large Vision Models with Efficient Sequential Modeling. 4566-4576 - Sebin Lee, Heewon Kim:

HiGlassRM: Learning to Remove High-prescription Glasses via Synthetic Dataset Generation. 4577-4586 - Leif Van Holland, Domenic Zingsheim, Mana Takhsha, Hannah Dröge, Patrick Stotko, Markus Plack, Reinhard Klein

:
Transformer-Based Inpainting for Real-Time 3D Streaming in Sparse Multi-Camera Setups. 4587-4598 - Franziska Denk, Christian Rankl, Shaban Almouahed, David Moser, Robert Sablatnig:

SeaClips: A Video Dataset for Maritime Object Detection. 4599-4610 - Yuzhen Hu, Saurabh Prasad:

UniDiff: Parameter-Efficient Adaptation of Diffusion Models for Land Cover Classification with Multi-Modal Remotely Sensed Imagery and Sparse Annotations. 4611-4620 - Chen-Che Huang, Tzuhsuan Huang, Jun-Cheng Chen:

CropAT: Leveraging Diffusion-Generated Target-Like Cropped Objects for Pseudo-Label Refinement in Domain-Adaptive Object Detection. 4621-4630 - Sahngmin Yoo, Sangwon Lee, Seongin Jo:

Beyond Faces: A Multimodal Person Clustering for Unconstrained Environments. 4631-4640 - Sooyeon Go, Kyungmook Choi, Minjung Shin, Youngjung Uh:

Eye-for-an-eye: Appearance Transfer with Dense Semantic Correspondence in Diffusion Models. 4641-4650 - Ruikai Zhou, Yating Liu, Yi Xu:

Towards Photorealistic Style Transfer with Multimodal Guidance and Robustness to Content Images in Arbitrary Styles. 4651-4660 - Sameer Ambekar, Marta Hasny, Laura Daza, Daniel Lang, Julia A. Schnabel

:
Hierarchical Adaptive networks with Task vectors for Test-Time Adaptation. 4661-4672 - Abdullah Al Ahad Khan, Md Shariful Islam, Lin Li, Lai Jiang, Noushin Ghaffari:

Automated Pore Detection from In-Situ FDM 3D Printing Video: A Comparative Evaluation of Modern Segmentation Models. 4673-4681 - Moreno D'Incà, Elia Peruzzo, Xingqian Xu, Humphrey Shi, Nicu Sebe

, Massimiliano Mancini
:
Safe Vision-Language Models via Unsafe Weights Manipulation. 4682-4692 - Junyi Cao, Evangelos Kalogerakis:

SOPHY: Generating Simulation-Ready Objects with PHYsical Materials. 4693-4704 - Kassymzhomart Aitbek, Seungjoon Yang:

Generalization of Real World Video Deblurring by Image-to-image Translation. 4705-4714 - Rohan Sarkar, Avinash C. Kak:

A Dataset and Framework for Learning State-invariant Object Representations. 4715-4723 - Dasol Choi, Seunghyun Lee, Youngsook Song:

Better Safe Than Sorry? Overreaction Problem of Vision Language Models in Visual Emergency Recognition. 4724-4732 - Chengzhi Yu, Yifan Xu, Yifan Chen

, Wenyi Zhang:
Optimizing LVLMs with On-Policy Data for Effective Hallucination Mitigation. 4733-4743 - Seulgi Kim, Kiran Kokilepersaud, Mohit Prabhushankar, Ghassan AlRegib:

Countering Multi-modal Representation Collapse through Rank-targeted Fusion. 4744-4754 - Shristi Das Biswas, Efstathia Soufleri, Arani Roy, Kaushik Roy:

Learning Unified Spatio-temporal Representations for Efficient Compressed Video Understanding. 4755-4765 - Wanhao Yu, Zheng Wang, Shuteng Niu, Sen Lin, Li Yang:

More Than Memory Savings: Zeroth-Order Optimization Mitigates Forgetting in Continual Learning. 4766-4776 - Sergei Solonets, Daniil Sinitsyn, Daniel Cremers:

Global Focal and Radial Distortion Averaging from Radial Fundamental Matrices for Robust Self-Calibration. 4777-4786 - Arnav Aditya, Nitin Kumar, Saurabh J. Shigwan:

UCDSC: Open Set UnCertainty aware Deep Simplex Classifier for Medical Image Datasets. 4787-4796 - Shuai Xiang, Pieter M. Blok, James Burridge, Haozhou Wang, Wei Guo:

DODA: Adapting Object Detectors to Dynamic Agricultural Environments in Real-Time with Diffusion. 4797-4807 - Xin Gu, Congcong Li, Xinyao Wang, Dexiang Hong, Libo Zhang, Tiejian Luo, Longyin Wen, Heng Fan

:
Structured Context Learning for Generic Event Boundary Detection. 4808-4817 - Sydney Dolan

, Alessandro Golkar:
Sun-E: Dataset and Benchmark for Event-Based Sun Sensing. 4818-4826 - Seonghyeon Moon, Haein Kong, Muhammad Haris Khan, Mubbasir Kapadia, Yuewei Lin:

FCC: Fully Connected Correlation for One-Shot Segmentation. 4827-4837 - Dongki Jung, Jaehoon Choi, Yonghan Lee, Sungmin Eum, Heesung Kwon, Dinesh Manocha:

MoRe: Monocular Geometry Refinement via Graph Optimization for Cross-View Consistency. 4838-4848 - Michele Mazzamuto, Daniele Di Mauro, Gianpiero Francesca, Giovanni Maria Farinella, Antonino Furnari:

ProSkill: Segment-Level Skill Assessment in Procedural Videos. 4849-4858 - Doanh C. Bui, Ba Hung Ngo, Hoai Luan Pham, Khang Nguyen, Maï K. Nguyen, Yasuhiko Nakashima:

MergeSlide: Continual Model Merging and Task-to-Class Prompt-Aligned Inference for Lifelong Learning on Whole Slide Images. 4859-4868 - Yusuke Sekikawa, Jun Nagata, Itsumi Araki, Andreu Girbau:

CoL2A: Convolution-free Local Linear Attention for SpatioTemporal Event Processing. 4869-4880 - Thu Tran, Harold Abraham Joseph, Kichang Lee, Kenny Tsu Wei Choo, Dong Ma, Shaohui Foong, Thivya Kandappu, Jeonggil Ko, Rajesh Balan:

Dronaquatics: Real-time Swimming Analytics Using Drone Captured Imagery. 4881-4889 - Mehrdad Noori, Gustavo Adolfo Vargas Hakim, David Osowiechi, Fereshteh Shakeri, Ali Bahri, Moslem Yazdanpanah, Sahar Dastani, Ismail Ben Ayed, Christian Desrosiers:

Histopath-C: Towards Realistic Domain Shifts for Histopathology Vision-Language Adaptation. 4890-4900 - Ryo Miyoshi, Mayu Otani, Yuki Okafuji:

Robust Multimodal Emotion Recognition from Incomplete Modalities via Query-Based Unimodal and Cross-Modal Learning. 4901-4911 - Heitor Rapela Medeiros, Atif Belal, Masih Aminbeidokhti, Eric Granger, Marco Pedersoli:

WiSE-OD: Benchmarking Robustness in Infrared Object Detection. 4912-4921 - Won-Seok Choi, Sohwi Lim, Nam Hyeon-Woo, Moon Ye-Bin, Dong-Ju Jeong, Jinyoung Hwang, Tae-Hyun Oh:

Patch-wise Retrieval: A Bag of Practical Techniques for Instance-level Matching. 4922-4931 - Hongru Yan, Xiang Zhang, Zeyuan Chen, Fangyin Wei, Zhuowen Tu:

Gaussian Swaying ⚑: Surface-Based Framework for Aerodynamic Simulation with 3D Gaussians. 4932-4942 - Arnela Hadzic, Franz Thaler, Lea Bogensperger, Simon Johannes Joham, Martin Urschler

:
Restora-Flow: Mask-Guided Image Restoration with Flow Matching. 4943-4952 - Wooseok Shin, Hyun Joon Park, Jin Sob Kim, Juan Yun, Se Hong Park, Sung Won Han:

PrevMatch: Revisiting and Maximizing Temporal Knowledge in Semi-Supervised Semantic Segmentation. 4953-4963 - Xinrui Wang, Zilin Guo, Zhuoru Li, Jinze Yu, Heng Zhang, Yusuke Iwasawa, Yutaka Matsuo, Jiaxian Guo:

One-shot Portrait Stylization via Geometric Alignment. 4964-4973 - Eliott Thomas, Mickaël Coustaty, Aurélie Joseph, Tri-Cong Pham, Gaspar Deloin, Elodie Carel, Vincent Poulain D'Andecy, Jean-Marc Ogier:

Zero-Shot Table Extraction in Business Documents: A Unified Benchmark with Error Taxonomy and Ecological Analysis. 4974-4983 - Janaksinh Ven, Charu Sharma, Syed Azeemuddin:

SegMango: Early Deep Mango Yield Prediction based on Flower Segmentation and Weather Data. 4984-4993 - Mai Tsujimoto, Junjue Wang, Weihao Xuan, Naoto Yokoya:

Geo3DVQA: Evaluating Vision-Language Models for 3D Geospatial Reasoning from Aerial Imagery. 4994-5003 - Ju Shen, Chen Chen, Tam V. Nguyen, Vijayan K. Asari:

PoseGaussian: Pose-Driven Novel View Synthesis for Robust 3D Human Reconstruction. 5004-5015 - Tieqiao Wang, Sinisa Todorovic:

Timestamp Query Transformer for Temporal Action Segmentation. 5016-5025 - Olivier Stocker, Reza Mahmoudi Kouhi, Omid Reisi Gahrouei, Thierry Badard, Éric Guilbert:

QC-SF: Improving Computer Vision for Airborne LiDAR Point Clouds of Boreal Forests with Quebec Simulated Forest Dataset. 5026-5036 - Eashan Adhikarla, Brian D. Davison:

RemEdit: Efficient Diffusion Editing with Riemannian Geometry. 5037-5046 - Hyunju Lee, Youngmin Oh, Jeimin Jeon, Donghyeon Baek, Bumsub Ham:

GrowTAS: Progressive Expansion from Small to Large Subnets for Efficient ViT Architecture Search. 5047-5056 - Zeeshan Hayder, Ali Cheraghian, Lars Petersson, Mehrtash Harandi:

Subspace-Guided Knowledge Distillation for Efficient Model Transfer. 5057-5066 - Xizi Wang, Feng Cheng, Ziyang Wang, Huiyu Wang, Md Mohaiminul Islam, Lorenzo Torresani, Mohit Bansal, Gedas Bertasius, David Crandall:

TimeRefine: Temporal Grounding with Time Refining Video LLM. 5067-5078 - Jai Bardhan, Ramya Hebbalaguppe, Aravind Udupa:

Curve Skeletonization in Continuous domain for Meshes and Point Clouds. 5079-5089 - Yaxuan Song, Jianan Fan, Hang Chang, Tom Weidong Cai:

Gene-DML: Dual-Pathway Multi-Level Discrimination for Gene Expression Prediction from Histopathology Images. 5090-5099 - Aleksi Suonsivu, Lauri Salmela, Lassi Helin, Leevi Uosukainen, Giacomo Boracchi:

Color Preserving CMOS-SPAD Fusion for Multi-Frame HDR. 5100-5109 - Daniela Ivanova, Marco Aversa, Paul Henderson, John Williamson:

Unsupervised Segmentation by Diffusing, Walking and Cutting. 5110-5120 - Alexandre Personnic, Mihai Bâce:

Learning spatio-temporal feature representations for video-based gaze estimation. 5121-5130 - Danae Sánchez Villegas, Ingo Ziegler

, Desmond Elliott
:
ImageChain: Advancing Sequential Image-to-Text Reasoning in Multimodal Large Language Models. 5131-5141 - Minsu Gong, Nuri Ryu, Jungseul Ok, Sunghyun Cho:

Edge-Aware Image Manipulation via Diffusion Models with a Novel Structure-Preservation Loss. 5142-5153 - Daniel MacSwayne, Ales Leonardis, Jianbo Jiao:

3D Superquadric Splatting. 5154-5163 - Eunjong Lee, Eunhee Kim, Sanghoon Hong, Eunho Jung, Jihoon Kim:

Controllable Long-term Motion Generation with Extended Joint Targets. 5164-5173 - Peiran Wu, Yunze Liu, Miao Liu, Junxiao Shen:

ST-Think: How Multimodal Large Language Models Reason About 4D Worlds from Ego-Centric Videos. 5174-5183 - Youngwan Jin, Incheol Park, Yagiz Nalçakan

, Hyeongjin Ju, Sanghyeop Yeo, Shiho Kim:
RPT-SR: Regional Prior attention Transformer for infrared image Super-Resolution. 5184-5193 - Jian Park, Hyunseon Won, JeeEun Kim, Joon Seo Hwang, Jeong Mo Han, Ji In Park, Daniel Duck-Jin Hwang, Jinyoung Han:

LASOR: Towards Clinically Transparent and Explainable Ophthalmic Report Generation via Lesion-Aware Segmentation. 5194-5204 - Yixin Zhang, Nicholas Konz, Kevin Kramer, Maciej A. Mazurowski:

Quantifying the Limits of Segmentation Foundation Models: Modeling Challenges in Segmenting Tree-Like and Low-Contrast Objects. 5205-5215 - Zahid Hasan, Masud Ahmed, Nirmalya Roy:

Lorentz Entailment Cone for Semantic Segmentation. 5216-5225 - Sadra Safadoust, Fabio Tosi, Fatma Güney, Matteo Poggi:

WarpRF: Multi-View Consistency for Training-Free Uncertainty Quantification and Applications in Radiance Fields. 5226-5235 - Ron Campos, Ashmal Vayani, Parth Parag Kulkarni, Rohit Gupta, Aizan Zafar, Aritra Dutta, Mubarak Shah:

GAEA: A Geolocation Aware Conversational Assistant. 5236-5246 - Krzysztof Galus, Piotr Syga, Piotr Kawa:

WSSSP-Net: Weakly Supervised Semantic Segmentation Plugin Network for Face Anti-Spoofing. 5247-5257 - Jianyang Gu, Haonan Wang, Ruoxi Jia, Saeed Vahidian, Vyacheslav Kungurtsev, Wei Jiang, Yiran Chen:

Concord: Concept-Informed Diffusion for Dataset Distillation. 5258-5268 - Alexander Politowicz, Sahisnu Mazumder, Bing Liu:

Improving Out-of-Distribution Detection using Segmented Images and Cross-View Attention Fusion. 5269-5279 - Eugênio Dias Ribeiro Neto, Marc Chaumont, Gérard Subsol, Michel De Garine-Wichatitsky, Hélène Guis:

An improved architecture for part-based animal re-identification through semantic segmentation distillation. 5280-5289 - Jinwei Li, Huan-ang Gao, Wenyi Li, Haohan Chi, Chenyu Liu, Chenxi Du, Yiqian Liu, Mingju Gao, Guiyu Zhang, Zongzheng Zhang, Li Yi, Yao Yao, Jingwei Zhao, Hongyang Li, Yikai Wang, Hao Zhao:

FB-4D: Spatial-Temporal Coherent Dynamic 3D Content Generation with Feature Banks. 5290-5301 - Cheng-You Lu

, Zhuoli Zhuang, Nguyen Thanh Trung Le, Da Xiao, Yu-Cheng Fred Chang, Thomas Do, Srinath Sridhar, Chin-Teng Lin
:
Hestia: Voxel-Face-Aware Hierarchical Next-Best-View Acquisition for Efficient 3D Reconstruction. 5302-5312 - Nate Rothschild, Moshe Kimhi, Avi Mendelson, Chaim Baskin:

R3: Reconstruction, Raw, and Rain: Deraining Directly in the Bayer Domain. 5313-5321 - Sajed Almorsy, Ayman Khalafallah, Marwan Torki:

An Efficient Multi-Rater Setup Towards Personalized and Diversified Medical Image Segmentation. 5322-5331 - Soojin Hwang, Jaeyoon Sim, Won Hwa Kim:

HiMix : Hierarchical Visual-Textual Mixing Network for Lesion Segmentation. 5332-5341 - Shubham Trehan, Udhav Ramachandran, Akash Rao, Ruth Scimeca, Sathyanarayanan N. Aakur:

FSP-DETR: Few-Shot Prototypical Parasitic Ova Detection. 5342-5351 - Yifan Zhou, Takehiko Ohkawa, Guwenxiao Zhou, Kanoko Goto, Takumi Hirose, Yusuke Sekikawa, Nakamasa Inoue:

DF-Mamba: Deformable State Space Modeling for 3D Hand Pose Estimation in Interactions. 5352-5363 - Tao Sun, Yun Jiang, Yarong Jin, Huanting Guo, Zequn Zhang:

Context-Preserving Dermoscopic Editing: Mask-Guided Lesion-Aware Diffusion for Attribute Modification. 5364-5373 - Nathan Roos, Ekaterina Iakovleva, Ani Gjergji, Vito Paolo Pastore, Enzo Tartaglione:

How I Met Your Bias: Investigating Bias Amplification in Diffusion Models. 5374-5383 - Tianle Li, Yongming Rao, Winston Hu, Yu Cheng:

BREEN: Bridge Data-Efficient Encoder-Free Multimodal Learning with Learnable Queries. 5384-5395 - Martin Blanchard, Christophe Ducottet, Damien Muselet, Olivier Delézay:

ProtoGMVAE: A Variational Auto-Encoder with True Gaussian Mixture Prior for Prototypical-based Self-Explainability. 5396-5405 - Muhammad Shahid Muneer, Simon S. Woo:

AEON: Adaptive Embedding Optimized Noise for Robust Watermarking in Diffusion Models. 5406-5415 - Ankit Yadav, Ta Duc Huy, Lingqiao Liu:

Revisiting Vision-Language Foundations for No-Reference Image Quality Assessment. 5416-5425 - Dexuan Zhang, Thomas Westfechtel, Tatsuya Harada:

Semi-supervised Domain Adaptation via Mutual Alignment through Joint Error. 5426-5436 - Maurya Goyal, Anuj Singh, Hadi Jamali Rad:

Unified Control for Inference-Time Guidance of Denoising Diffusion Models. 5437-5446 - Bayu Adhi Tama, Jianwu Wang, Vandana Pursnani Janeja, Mostafa Cham:

Learning Subglacial Bed Topography from Sparse Radar with Physics-Guided Residuals. 5447-5456 - Yuxiang Wei, Yanteng Zhang, Xi Xiao, Tianyang Wang, Xiao Wang, Vince D. Calhoun:

4D Multimodal Co-attention Fusion Network with Latent Contrastive Alignment for Alzheimer's Diagnosis. 5457-5466 - Deepak Ghimire, Dayoung Kil, Seonghwan Jeong, Jaesik Park, Seong-Heum Kim:

One-Cycle Structured Pruning via Stability-Driven Subnetwork Search. 5467-5476 - Bo Lang, Nirav Savaliya, Zhihao Zheng, Jinglun Feng, Zheng-Hang Yeh, Mooi Choo Chuah:

PredMapNet: Future and Historical Reasoning for Consistent Online HD Vectorized Map Construction. 5477-5487 - Kota Nishihara, Ryo Furukawa, Ryusuke Sagawa, Hiroshi Kawasaki:

Multi-view stereo with multiple projectors for oneshot entire shape scan based on Neural SDF and DSSS demultiplexing. 5488-5497 - Teng-Fang Hsiao, Bo-Kai Ruan, Sung-Lin Tsai, Yi-Lun Wu, Hong-Han Shuai:

FreeCond: Free Lunch in the Input Conditions of Text-Guided Inpainting. 5498-5508 - Yixuan Hu, Yuxuan Xue, Simon Klenk, Daniel Cremers, Gerard Pons-Moll:

ControlEvents: Controllable Synthesis of Event Camera Data with Foundational Prior from Image Diffusion Models. 5509-5519 - Haorui Ji, Taojun Lin, Hongdong Li:

DPBridge: Latent Diffusion Bridge for Dense Prediction. 5520-5530 - Po-Han Huang, Jeng-Lin Li, Po-Hsuan Huang, Ming-Ching Chang, Wei-Chao Chen:

PatchEAD: Unifying Industrial Visual Prompting Frameworks for Patch-Exclusive Anomaly Detection. 5531-5540 - Jackson Borchardt, Saul Kato:

SurfDist: Interpretable Three-Dimensional Instance Segmentation Using Curved Surface Patches. 5541-5549 - HyungWoo Kang, Seonyoung Jang, YeoJun Yoon, Byung Tae Oh:

CRISP: Cylindrical Rendering for In-Stream Point Clouds. 5550-5559 - Omar Elezabi, Marcos V. Conde, Zongwei Wu, Radu Timofte:

INRetouch: Context Aware Implicit Neural Representation for Photography Retouching. 5560-5569 - Xuan Zhu, Miao Cao, Fang-Lue Zhang, Yu-Kun Lai, Paul L. Rosin:

Line Art Colorization with Offset Prior-based Diffusion Model. 5570-5580 - Xinyue Pan, Yuhao Chen, Jiangpeng He, Fengqing Zhu:

Food Image Generation on Multi-Noun Categories. 5581-5590 - Tasneem Shaffee, Sherief Reda:

RobuMTL: Enhancing Multi-Task Learning Robustness Against Weather Conditions. 5592-5600 - John J. Han, Jie Ying Wu:

EndoPBR: Photorealistic Synthetic Data for Surgical 3D Vision via Physically-based Rendering. 5601-5611 - Maciej Lewandowski, Piotr Dudek:

Inpainting of Sparse Depth Maps from Monocular Depth-from-Focus on Pixel Processor Arrays. 5612-5622 - Aayushma Pant, Lakpa Dorje Tamang, Tsz-Kwan Lee, Sunil Aryal:

DMS2F-HAD: A Dual-branch Mamba-based Spatial-Spectral Fusion Network for Hyperspectral Anomaly Detection. 5623-5632 - Jay N. Paranjape, Celso M. de Melo, Vishal M. Patel:

F-ViTA: Foundation Model Guided Visible-to-Infrared Translation. 5633-5642 - Zongyao Li, Kengo Ishida

, Satoshi Yamazaki, Xiaotong Ji, Jianquan Liu:
KFS-Bench: Comprehensive Evaluation of Key Frame Sampling in Long Video Understanding. 5643-5652 - Bryce Bible, Nehal Hasnaeen, Hairong Qi:

FujiView: Multimodal Late-Fusion for Predicting Scenic Visibility. 5653-5661 - Medhashree Parhy, Shaan Chanchani, Claire Kim, Josh Mansky, Zian Pan, Parth Thakre, Haoyu Chen, Amy R. Reibman:

Improving Animal Pose Estimation through Species Similarity Measures and Rigorous Label Definition. 5662-5671 - Shaunak Halbe, Junjiao Tian, K. J. Joseph, James Seale Smith, Katherine Stevo, Vineeth N. Balasubramanian, Zsolt Kira:

Grounding Descriptions in Images informs Zero-Shot Visual Recognition. 5672-5681 - Seok-Hwan Oh, Hyeon-Jik Lee, Guil Jung, Myeong-Gee Kim, Young-Min Kim, Hyuksool Kwon, Hyeon-Min Bae:

Semi-supervised Key-Point Estimation for Echocardiography Video. 5682-5692 - Alberto Mario Ceballos-Arroyo, Jisoo Kim, Chu-Hsuan Lin, Lei Qin, Geoffrey S. Young, Huaizu Jiang:

Anatomically-guided masked autoencoder pre-training for aneurysm detection. 5693-5694 - Jooyoung Choi, Chaehun Shin, Yeongtak Oh, Heeseung Kim, Jungbeom Lee, Sungroh Yoon:

Style-Friendly SNR Sampler for Style-Driven Generation. 5703-5713 - Vito Paolo Pastore, Massimiliano Ciranni, Vittorio Murino:

Lose Your Self (LoYS): an adversarial entropy-based unsupervised approach for model debiasing. 5714-5723 - Ruiyuan Gao, Kai Chen, Zhihao Li, Lanqing Hong, Zhenguo Li, Qiang Xu:

MagicDrive3D: Controllable 3D Generation for Any-View Rendering in Street Scenes. 5724-5733 - Muhammad Kamran Janjua, Amirhosein Ghasemabadi, Kunlin Zhang, Mohammad Salameh, Chao Gao, Di Niu:

Grounding Degradations in Natural Language for All-In-One Video Restoration. 5734-5743 - Ryota Okumura, Kaede Shiohara, Toshihiko Yamasaki:

ControlVP: Interactive Geometric Refinement of AI-Generated Images with Consistent Vanishing Points. 5744-5753 - Sameer Shafayet Latif, Sadab Shiper, K. M. Rahiduzzaman Kiran, Md Farhan Ishmam, Md Azam Hossain, Abu Raihan Mostofa Kamal, Md. Hamjajul Ashmafee:

Enhancing Vision Language Corruption Robustness using Cross-Distribution & Prompted Denoisers. 5754-5765 - Ajinkya Khoche, Gergo László Nagy, Maciej Wozniak, Thomas Gustafsson, Patric Jensfelt:

BlendCLIP: Bridging Synthetic and Real Domains for Zero-Shot 3D Object Classification with Multimodal Pretraining. 5766-5775 - Wiktor Mucha, Michael Wray, Martin Kampel:

Towards Egocentric 3D Hand Pose Estimation in Unseen Domains. 5776-5786 - Parsa Esmaeilkhani, Longin Jan Latecki:

Direct Visual Grounding by Directing Attention of Visual Tokens. 5787-5797 - Yen Pham, Xiaohui Yuan, Chengyuan Zhuang:

Motion-Aware Graph Fusion Network for 3D Human Pose Estimation. 5798-5808 - Jiawei Qin, Xucong Zhang, Yusuke Sugano:

UniGaze: Towards Universal Gaze Estimation via Large-scale Pre-Training. 5809-5820 - Fan Yang, Quanting Xie, Atsunori Moteki, Shoichi Masui, Shan Jiang, Kanji Uchino, Yonatan Bisk, Graham Neubig:

Unsupervised Discovery of Long-Term Spatiotemporal Periodic Workflows in Human Activities. 5821-5832 - Hammad Khan, Rakesh Kumar Giri, Kamalakar Vijay Thakare, Heeseung Choi, Hyungjoo Jung, Debi Prosad Dogra, Ig-Jae Kim:

VAST-ReID: A Low-Light Benchmark Dataset for Person Re-Identification with Visual and Attribute-Rich Semantic Tracking. 5833-5841 - Kaustubh Kundu, Hrishav Bakul Barua, Lucy M. Robertson-Bell, Zhixi Cai, Kalin Stefanov:

DexAvatar: 3D Sign Language Reconstruction with Hand and Body Pose Priors. 5842-5852 - Evelyn Chee, Mong-Li Lee, Wynne Hsu:

DREAM: Dynamic Prompts and GuidedMix for Efficient Continual Adaptation of Visual-Language Models. 5853-5863 - Maxime Kayser, Maksim Gridnev, Wanting Wang, Max Bain, Aneesh Rangnekar, Avijit Chatterjee, Aleksandr Petrov, Harini Veeraraghavan, Nathaniel C. Swinburne:

brat : Aligned Multi-View Embeddings for Brain MRI Analysis. 5864-5874 - Eman Ali, Sathira Silva, Chetan Arora, Muhammad Haris Khan:

Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score. 5875-5885 - Liu He, Xiao Zeng, Yizhi Song, Albert Y. C. Chen, Lu Xia, Shashwat Verma, Sankalp Dayal, Min Sun, Cheng-Hao Kuo, Daniel G. Aliaga:

Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation. 5886-5897 - Ben Vardi, Oron Nir, Ariel Shamir:

CLIP-UP: CLIP-Based Unanswerable Problem Detection for Visual Question Answering. 5898-5908 - Peter El-Jiz, Matthias Kümmerer, Matthias Tangemann, Matthias Bethge, Andreas M. Bartels, Michael M. Bannert:

Isolating the Role of Temporal Information in Video Saliency: A Controlled Experimental Analysis. 5909-5918 - Rogério Guimarães

, Frank Xiao, Pietro Perona, Markus Marks:
Diffusion-Based Action Recognition Generalizes to Untrained Domains. 5919-5933 - Prantik Howlader, Hoang Nguyen-Canh, Srijan Das, Jingyi Xu, Hieu Le, Dimitris Samaras:

CORA: Consistency-Guided Semi-Supervised Framework for Reasoning Segmentation. 5934-5944 - Neelima Prasad, Jarek Reynolds, Neel Karsanbhai, Tanusree Sharma, Lotus Zhang, Abigale Stangl, Yang Wang, Leah Findlater, Danna Gurari:

Hierarchical Instance Tracking to Balance Privacy Preservation with Accessible Information. 5945-5955 - Nathan Drenkow, William Paul, Chris Ribaudo, Mathias Unberath:

Causality-Driven Audits of Model Robustness. 5956-5966 - Thilina Mendis, Farah I. Kandah, Sathyanarayanan N. Aakur:

BAFLE-DCT: Bypassing Adversarial Filters via Frequency-Selective Embedding in the DCT Domain. 5967-5976 - Thilina Weerasinghe, Ruwan B. Tennakoon, Weiqin Chuah, Alireza Bab-Hadiashar:

Logit-Adjusted Test-Time Adaptation under Partial Class Imbalance. 5977-5985 - Paria Mehrbod, Pedro Vianna, Géraldin Nanfack, Guy Wolf, Eugene Belilovsky:

Test Time Adaptation Using Adaptive Quantile Recalibration. 5986-5995 - Masud An Nur Islam Fahim, Nazmus Saqib, Joon-Min Gil:

OSEG: Improving Diffusion sampling through Orthogonal Smoothed Energy Guidance. 5996-6005 - Sy Dat Tran, Jin-Kyu Gahm:

Hymavi : A Hybrid Mamba-Attention Network in Multi-View Framework for Volumetric Medical Image Segmentation. 6006-6015 - Xi Xiao, Yunbei Zhang, Janet Wang, Lin Zhao, Yuxiang Wei, Hengjia Li, Yanshu Li, Xiao Wang, Swalpa Kumar Roy, Hao Xu, Tianyang Wang:

RoadBench: A Vision-Language Foundation Model and Benchmark for Road Damage Understanding. 6016-6026 - Shashank Mishra, Karan Patil, Didier Stricker, Jason R. Rambach:

IMKD: Intensity-Aware Multi-Level Knowledge Distillation for Camera-Radar Fusion. 6027-6038 - Deepika Vemuri, Gautham Bellamkonda, Aditya Pola, Vineeth N. Balasubramanian:

LogicCBMs: Logic-Enhanced Concept-Based Learning. 6039-6048 - Sungheon Jeong, Yoojeong Song, Hyungjoon Kim:

Understanding the Visual Projection Space of Multimodal LLMs. 6049-6058 - Maksim Kuprashevich, Grigorii Alekseenko, Irina Tolstykh, Georgii Fedorov, Bulat Suleimanov, Vladimir Dokholyan, Aleksandr Gordeev:

NoHumansRequired: Autonomous High-Quality Image Editing Triplet Mining. 6059-6068 - Muhammad Umar Farooq, Abd Ur Rehman, Azka Rehman, Muhammad Usman, Dong-Kyu Chae:

SSMT-Net: A Semi-Supervised Multitask Transformer-Based Network for Thyroid Nodule Segmentation in Ultrasound Images. 6069-6079 - Hugo Leblond, Gilles Simon, Renato Martins, Cédric Demonceaux, Marie-Odile Berger:

Gaussian Splatting Map Registration with Orthographic Bird's-Eye-View Renderings. 6080-6089 - Sungmin Cho, Sungbum Park, Insoo Oh:

MUSE: Model-based Uncertainty-aware Similarity Estimation for zero-shot 2D Object Detection and Segmentation. 6090-6100 - Saad Lahlali, Alexandre Fournier-Montgieux, Nicolas Granger, Hervé Le Borgne, Quoc-Cuong Pham:

MVAT: Multi-View Aware Teacher for Weakly Supervised 3D Object Detection. 6101-6110 - Denis A. Gudovskiy, Wenzhao Zheng, Tomoyuki Okuno, Yohei Nakata, Kurt Keutzer:

ODEt(ODEl): Shortcutting the Time and the Length in Diffusion and Flow Models for Faster Sampling. 6111-6120 - Woo Joo Hahm, Seungwoo Jang, Hyeon Tak Kim, Daeun Lee, Kwangsu Kim:

TM-Adapter: Temporal Merge Adapter for Efficient Global Temporal Modeling. 6121-6131 - Sungrae Hong, Sol Lee, Jisu Shin, Jiwon Jeong, Mun Yong Yi:

Diagnose Like A REAL Pathologist: An Uncertainty-Focused Approach for Trustworthy Multi-Resolution Multiple Instance Learning. 6132-6141 - Jiacheng Zhang, Jie Wu, Weifeng Chen, Yatai Ji, Xuefeng Xiao, Weilin Huang, Kai Han:

Align Video Diffusion Model with Online Video-Centric Preference Optimization. 6142-6152 - Keita Otani, Tatsuya Harada:

SceneProp: Combining Neural Network and Markov Random Field for Scene-Graph Grounding. 6153-6162 - Vibashan VS, Nadine Chang, Jenny Schmalfuss, Vishal M. Patel, Zhiding Yu, José M. Álvarez:

GHOST: Getting to the Bottom of Hallucinations with A Multi-round Consistency Benchmark. 6163-6173 - Jenna Kang, Maria Beatriz Silva, Patsorn Sangkloy, Kenneth Chen, Niall L. Williams, Qi Sun:

GeneVA: A Dataset of Human Annotations for Generative Text to Video Artifacts. 6174-6183 - Tingrui Qiao, Di Zhao, Caroline Walker, Chris Cunningham, Yun Sing Koh

:
Zero-Shot Domain Generalisation via Prompt-Driven Feature Refinement. 6184-6193 - Soumyaroop Nandi, Prem Natarajan:

Can Image Splicing and Copy-Move Forgery Be Detected by the Same Model? Forensim: An Attention-Based State-Space Approach. 6194-6204 - Deep Anil Patel, Yasunori Babazaki, Yasuto Nagase, Iain Melvin, Martin Renqiang Min:

Distilling Offline Action Detection Models into Real-Time Streaming Models. 6205-6214 - Guangyu Shen, Zhihua Li, Xiang Xu, Tianchen Zhao, Zheng Zhang, Dongsheng An, Zhuowen Tu, Yifan Xing, Qin Zhang:

AuthGuard: Generalizable Deepfake Detection via Language Guidance. 6215-6225 - Meijia Huang, Ruida Li, Bing Ma, Liangwei Jiang, Shuo Fang, Chenguang Ma:

GroupPortrait: Multi-ID Portrait Generation with High Identity Preservation and Fine-Grained Control. 6226-6235 - Hichem Felouat, Hanrui Wang, Isao Echizen:

GFT-GCN: Privacy-Preserving 3D Face Mesh Recognition with Spectral Diffusion. 6236-6245 - Quentin Mérilleau, Snehashis Majhi, Antitza Dantcheva, Quan Kong, Lorenzo Garattoni, Gianpiero Francesca, François Brémond:

Denoise, Divide, Distill, and Predict D3P: Towards Forecasting Long-horizon Real-world Anomaly from Normalcy. 6246-6255 - Adam Beauchaine, Craig A. Shue:

See, Record, Do: Automated Generation of UI Workflows from Tutorial Videos. 6256-6265 - Jason Armitage, Rico Sennrich:

Video and Language Alignment in 2D Systems for 3D Multi-object Scenes with Multi-Information Derivative-Free Control. 6266-6276 - Dereje Shenkut, Vijayakumar Bhagavatula

:
FocalComm: Hard Instance-Aware Multi-Agent Perception. 6277-6286 - Oren Shrout, Ayellet Tal:

SFMNet: Sparse Focal Modulation for 3D Object Detection. 6287-6297 - Zhiyuan Zhang, Lingqiao Liu:

MoSCo: Real-time and Efficient Text-to-Motion Synthesis via Delta Training. 6298-6308 - Samet Hicsonmez, Abd El Rahman Shabayek, Djamila Aouada:

VLMDiff: Leveraging Vision-Language Models for Multi-Class Anomaly Detection with Diffusion. 6309-6319 - Ivan Sviridov, Maria Boyko

, Maksim Sharaev
:
Predicting Task fMRI Contrasts from Resting-State fMRI Using Sparse 3D Convolutions. 6320-6329 - Chun-Jung Lin, Tat-Jun Chin, Sourav Garg, Feras Dayoub:

SceneEdited: A City-Scale Benchmark for 3D HD Map Updating via Image-Guided Change Detection. 6330-6339 - Liyang Song, Hardik Bishnoi, Sai Kumar Reddy Manne, Sarah Ostadabbas, Briana J. Taylor, Michael Wan:

Overcoming Small Data Limitations in Video-Based Infant Respiration Estimation. 6340-6349 - Abhijay Ghildyal, Rajesh Sureddi, Nabajeet Barman, Saman Zadtootaghaj, Alan C. Bovik:

Non-Aligned Reference Image Quality Assessment for Novel View Synthesis. 6350-6359 - Thang-Anh-Quan Nguyen, Laurent Caraffa, Jean-Philippe Tarel, Roland Brémond:

Pointmap-Conditioned Diffusion for Consistent Novel View Synthesis. 6360-6370 - Cheng-Yuan Ho, Hebi Yang, Jui-Chiu Chiang, Yu-Lun Liu, Wen-Hsiao Peng:

TED-4DGS: Temporally Activated and Embedding-based Deformation for 4DGS Compression. 6371-6380 - Wenfang Sun, Yingjun Du, Gaowen Liu, Yefeng Zheng, Cees G. M. Snoek:

QUOTA: Quantifying Objects with Text-to-Image Models for Any Domain. 6381-6390 - Chanung Park, Joo Chan Lee, Jong Hwan Ko:

Single-step Diffusion for Image Compression at Ultra-Low Bitrates. 6391-6400 - Paul Henderson:

Virtually Unrolling the Herculaneum Papyri by Diffeomorphic Spiral Fitting. 6401-6411 - Ren Ohkubo, Rintaro Yanagi, Hirokatsu Kataoka, Yutaka Satoh:

Diffusion Noise Optimization for Synthetic VLM Training. 6412-6421 - Abhinav Attri, Rajeev Ranjan Dwivedi, Samiran Das, Vinod Kumar Kurmi:

Histogram Assisted Quality Aware Generative Model for Resolution Invariant NIR Image Colorization. 6422-6431 - Saeid Ghafouri, Mohsen Fayyaz, Xiangchen Li, Deepu John

, Bo Ji, Dimitrios S. Nikolopoulos, Hans Vandierendonck:
Polymorph: Energy-Efficient Multi-Label Classification for Video Streams on Embedded Devices. 6432-6441 - Chenxi Yang, Suyang Xi, Hong Ding, Yiqing Shen, Yunhao Liu:

A Unified Diffusion-Based Framework for Multi-Agent Trajectory Prediction Integrating Structured Multi-Modal Representations. 6442-6452 - Shamanthak Hegde, Pooyan Fazli, Hasti Seifi:

ChartQA-X: Generating Explanations for Visual Chart Reasoning. 6453-6463 - Satoshi Suzuki, Shin'ya Yamaguchi, Shoichiro Takeda, Takuhiro Kaneko, Shota Orihashi, Ryo Masumura:

Distribution Highlighted Reference-based Label Distribution Learning for Facial Age Estimation. 6464-6473 - Yubin Chen, Xuyang Guo, Zhenmei Shi, Zhao Song, Jiahao Zhang:

T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation. 6474-6485 - Ajoy Mondal, Saumya Mundra, Avijit Dasgupta, C. V. Jawahar:

UniTabBank: A Large Scale Multi-Lingual, Multi-Layout, Multi-Type, Multi-Format Dataset for Table Detection. 6486-6495 - Md Fahim, Md Farhan Ishmam, Mir Sazzat Hossain

, M. Ashraful Amin, Amin Ahsan Ali, AKM Mahbubur Rahman:
R-MMA: Enhancing Vision-Language Models with Recurrent Adapters for Few-Shot and Cross-Domain Generalization. 6496-6506 - Woo Suk Choi, Youwon Jang, Minsu Lee, Byoung-Tak Zhang:

Hybrid State Representation for Video Procedure Planning. 6507-6516 - Euihyun Yoon, Taejin Park, Jaekoo Lee:

Training-Free Few-Shot Segmentation via Vision-Language Guided Prompting. 6517-6526 - Mahdi Bonyani, Maryam Soleymani, Chao Wang:

High-Level Semantics and Low-Level Features Fusion for Multi-Scale Object Detection in Dynamic Construction Environments. 6527-6536 - Vikas Thamizharasan, Nikitas Chatzis, Iliyan Georgiev, Matthew Fisher, Evangelos Kalogerakis, Difan Liu, Nanxuan Zhao, Michal Lukác:

Mean-Shift Distillation for Diffusion Mode Seeking. 6537-6546 - Liang Fan, Xiaoqian Liu, Zhi Chen

, Lingkai Yang:
TacticalCalib: End-to-End 6-DoF Camera Pose Regression for Tactical Camera Calibration. 6547-6556 - Sai Karthikeya Vemuri, Tim Büchner, Joachim Denzler:

F-INR: Functional Tensor Decomposition for Implicit Neural Representations. 6557-6568 - Yanfei Li

, Yi Gong, Yuan Zeng:
V2XScene: Multi-View Consistent 3D Scene Simulation for Collaborative Perception. 6569-6579 - Oren Shrout, Ori Nizan, Yizhak Ben-Shabat, Ayellet Tal:

WiSAR3D - Aerial LiDAR dataset for 3D object detection. 6580-6589 - Dennis Grießer

, Bastian Goldluecke, Matthias O. Franz, Georg Umlauf:
A Deep Network for Object Detection on Inland Waters. 6590-6599 - Junkyu Jang:

CoreCaption: Core Caption based Text-to-Video Retrieval. 6600-6610 - Elia Bonetto, Aamir Ahmad:

ZebraPose: Zebra Detection and Pose Estimation using only Synthetic Data. 6611-6620 - Artem Moroz, Vít Zeman, Martin Miksík, Elizaveta Isianova, Miroslav David, Pavel Burget, Varun Burde:

OPFormer: Object Pose Estimation leveraging foundation model with geometric encoding. 6621-6632 - Arya Fayyazi, Mehdi Kamal, Massoud Pedram:

FAIR-SIGHT: Fairness Assurance in Image Recognition via Simultaneous Conformal Thresholding and Dynamic Output Repair. 6633-6642 - Yongsung Kim, Jooyoung Choi, Sungroh Yoon:

GDoFS: Gaussian DoF Separation for Plausible 3D Geometry in Sparse-View 3DGS. 6643-6652 - Shree Mitra, Ajoy Mondal, C. V. Jawahar:

Learning Beyond Labels: Self-Supervised Handwritten Text Recognition. 6653-6663 - Sangha Park, Eunji Kim, Yeongtak Oh, Jooyoung Choi, Sungroh Yoon:

Guiding What Not to Generate: Automated Negative Prompting for Text-Image Alignment. 6664-6675 - Xiang Gao, Yuanpeng Liu, Jiazhi Li, Xinmu Wang, Minghao Guo, Yu Guo, Xiyun Song, Heather Yu, Zhiqiang Lao, Xianfeng David Gu:

Neural Geometry Image-Based Representations with Optimal Transport (OT). 6676-6686 - Arun Kumar Sivapuram, Pranav R. T. Peddinti, Harish Puppala, Komuravelli Prashanth, Jaladi Sri Harsha, Rama Krishna Sai S. Gorthi:

RealDroneVision: Dataset and Architecture Advancements for Small-Object Drone Detection. 6687-6695 - Minsung Kim:

PerVL-Bench: Benchmarking Multimodal Personalization for Large Vision-Language Models. 6696-6704 - Wonho Lee, Jisu Lee, Hyunsik Na, Sohee Park, Daeseon Choi:

TRACE: Confounder-free Adversarial Fine-tuning for Robust Object Detection. 6705-6714 - Ahmed El-Sayed, Marwan Torki:

Zero-LEAD: Source-Free Universal Domain Adaptation for Abdominal Multi-Organ Segmentation. 6715-6723 - Alexandre Justo Miro, Ludvig af Klinteberg, Bogdan Timus, Aron Asefaw, Ajinkya Khoche, Thomas Gustafsson, Sina Sharif Mansouri, Masoud Daneshtalab:

Correcting and Quantifying Systematic Errors in 3D Box Annotations for Autonomous Driving. 6724-6732 - Soroush Mehraban, Andrea Iaboni, Babak Taati:

FastHMR: Accelerating Human Mesh Recovery via Token and Layer Merging with Diffusion Decoding. 6733-6743 - Hyunsoo Lee, Daeum Jeon, Hyeokjae Oh:

Point2Pose: A Generative Framework for 3D Human Pose Estimation with Multi-View Point Cloud Dataset. 6744-6753 - Lan Chen, Yuchao Gu, Qi Mao:

UniVid: Unifying Vision Tasks with Pre-trained Video Generation Models. 6754-6763 - Marian Lupascu, Mihai-Sorin Stupariu:

Optimal Transport for Rectified Flow Image Editing: Unifying Inversion-Based and Direct Methods. 6764-6774 - Prajwal Singh, Kuldeep Kulkarni, Shanmuganathan Raman, Harsh Rangwani:

Synthesizing Compositional Videos from Text Description. 6775-6784 - Denys Iliash, Hanxiao Jiang, Yiming Zhang, Manolis Savva, Angel X. Chang:

S2O: Static to Openable Enhancement for Articulated 3D Objects. 6785-6795 - Akis Nousias, Stavros Nousias:

HodgeFormer: Transformers for Learnable Operators on Triangular Meshes through Data-Driven Hodge Matrices. 6796-6805 - Ivo Bueno, Ruikun Hou, Babette Bühler, Tim Fütterer, James Drimalla, Jonathan K. Foster, Peter A. Youngs, Peter Gerjets, Ulrich Trautwein, Enkelejda Kasneci:

Exploring Automated Recognition of Instructional Activity and Discourse from Multimodal Classroom Data. 6806-6817 - Parmida Atighehchian, Henry Wang, Andrei Kapustin, Boris Lerner, Tiancheng Jiang, Taylor Jensen, Negin Sokhandan:

From Prompt to Production: Automating Brand-Safe Marketing Imagery with Text-to-Image Models. 6818-6826 - Chenxu Wu, Qingpeng Kong, Peiang Zhao, Wendi Yang, Wenxin Ma, Fenghe Tang, Zihang Jiang, S. Kevin Zhou:

Equivariant Sampling for Improving Diffusion Model-based Image Restoration. 6827-6839 - Muhammad Saif Ullah Khan, Didier Stricker:

PoseAdapt: Sustainable Human Pose Estimation via Continual Learning Benchmarks and Toolkit. 6840-6850 - Suzanne Stathatos, Michael Hobley, Pietro Perona, Markus Marks:

SAVeD: Learning to Denoise Low-SNR Video for Improved Downstream Performance. 6851-6861 - Ke Han, Yueming Lyu, Weichen Yu, Nicu Sebe

:
ATM: Enhanced Alignment for Text-to-Motion Generation. 6862-6872 - Praful Mathur, Mohsin Iftekhar, Aman Sharma, Sarvesh Tiwari, Meghali Deka, Sathish Cherukuri, Roopa Sheshadri, Rakesh Valusa:

Memoire: Learning User Personas from Gallery Tags for Personalized Photo Curation. 6873-6882 - Yu-Jen Tseng, Chia-Hao Kao, Jing-Zhong Chen, Alessandro Gnutti, Shao-Yuan Lo, Yen-Yu Lin, Wen-Hsiao Peng:

CSGaussian: Progressive Rate-Distortion Compression and Segmentation for 3D Gaussian Splatting. 6883-6892 - Zahidul Islam, Sujoy Paul, Mrigank Rochan:

Test-Time Adaptation for Video Highlight Detection Using Meta-Auxiliary Learning and Cross-Modality Hallucinations. 6893-6902 - Ebtisaam Alharbi, Abdulrahman Kerim, Leandro Soriano Marcolino, Qiang Ni:

SD-CSFL: A Synthetic Data-Driven Conformity Scoring Framework for Robust Federated Learning. 6903-6912 - Hyeonbin Ji, Juyeob Lee, Eunil Park:

Alignment and Distillation: A Robust Framework for Multimodal Domain Generalizable Human Action Recognition. 6913-6924 - Syed Ahmed Mahmood, Ali Shah Ali, Umer Ahmed, Fawad Javed Fateh, M. Zeeshan Zia, Quoc-Huy Tran:

Procedure Learning via Regularized Gromov-Wasserstein Optimal Transport. 6925-6935 - Mahdi Bonyani, Maryam Soleymani, Chao Wang:

Clear Sights on Site: A Spatial-Adaptive Channel Network for Deblurring Construction Site Images. 6936-6945 - Bowen Dang, Lin Wu, Xiaohang Yang, Zheng Yuan, Zhixiang Chen:

SegMo: Segment-aligned Text to 3D Human Motion Generation. 6946-6955 - Eashan Adhikarla, Kai Zhang, Gong Chen, John W. Nicholson, Brian D. Davison:

From Darkness to Detail: Frequency-Aware SSMs for Low-Light Vision. 6956-6967 - Futa Waseda, Antonio Tejero-de-Pablos, Isao Echizen:

Multimodal Adversarial Defense for Vision-Language Models by Leveraging One-To-Many Relationships. 6968-6977 - Wongi Park

, Myeongseok Nam, Siwon Kim, Sangwoo Jo, Soomok Lee:
ForestSplats: Deformable transient field for Gaussian Splatting in the Wild. 6978-6987 - Loveneet Saini, Hasan Tercan, Tobias Meisen:

Graph Query Networks for Object Detection with Automotive Radar. 6988-6997 - Chang Won Lee, Selina Leveugle, Paul Grouchy, Chris Langley, Svetlana Stolpner, Jonathan Kelly, Steven L. Waslander:

FlowCLAS: Enhancing Normalizing Flow-Based Anomaly Segmentation Via Contrastive Learning. 6998-7007 - Bahador Rashidi, Kiarash Aghakasiri, Shupei Zhang, Amirmohsen Sattarifard, Yue Zhang, Chao Gao:

ScoreNet: Netting Lightweight Quality Scores for Better Visual Assessment with Large Multi-Modality Models. 7008-7018 - Daniel Cher, Brian Wei

, Srikumar Sastry, Nathan Jacobs:
VectorSynth: Fine-Grained Satellite Image Synthesis with Structured Semantics. 7019-7029 - Maryna Veksler, Kemal Akkaya, A. Selcuk Uluagac:

Digital Forensic AI You Can Explain: A Case Study on Video Source Camera Identification. 7030-7039 - Hyeonjeong Park, Peixi Xiong, Pei Yu, Wei Tang:

Modeling and Learning Multiple Hypotheses for Monocular 3D Object Detection. 7040-7050 - Yixuan Dong, Fang-Yi Su, Jung-Hsien Chiang:

SGD-Mix: Enhancing Domain-Specific Image Classification with Label-Preserving Data Augmentation. 7051-7061 - Jungwon Lee, Changhun Lee, Eunhyeok Park:

DreamCatcher: Efficient Multi-Concept Customization via Representation Finetuning. 7062-7072 - Giorgos Karvounas, Nikolaos Kyriazis, Iason Oikonomidis, Georgios Pavlakos, Antonis A. Argyros:

Enhancing Monocular 3D Hand Reconstruction with Learned Texture Priors. 7073-7083 - Yunqian Cheng, Benjamin Princen, Roberto Manduchi:

PALMS+: Modular Image-Based Floor Plan Localization Leveraging Depth Foundation Model. 7084-7093 - Shogo Sato, Takuhiro Kaneko, Shoichiro Takeda, Tomoyasu Shimada, Kazuhiko Murasaki, Taiga Yoshida, Ryuichi Tanida, Akisato Kimura:

IPCD: Intrinsic Point-Cloud Decomposition. 7094-7103 - Santosh V. Patapati, Trisanth Srinivasan:

Multimodal Graph Representation Learning over Arbitrary Sets of Modalities. 7104-7115 - Ruochen Chen, Thuy Tran, Shaifali Parashar:

FNOpt: Resolution-Agnostic, Self-Supervised Cloth Simulation using Meta-Optimization with Fourier Neural Operators. 7116-7125 - Alik Pramanick, Soumajit Roy, Arijit Sur:

D2Mamba: Dual Domain Guided Informed Search in State Space Model for Underwater Image Enhancement. 7126-7136 - Minseung Lee, Seokha Moon, Seung Joon Lee, Reza Mahjourian, Jinkyu Kim:

Image-Guided Semantic Pseudo-LiDAR Point Generation for 3D Object Detection. 7137-7147 - Mohan Ramesh, Mark Azer, Fabian Flohr:

HABIT: Human Action Benchmark for Interactive Traffic in CARLA. 7148-7157 - Wenhui Zhu, Xiwen Chen, Zhipeng Wang, Shao Tang, Sayan Ghosh, Xuanzhao Dong, Rajat Koner, Yalin Wang:

EVTP-IVS: Effective Visual Token Pruning For Unifying Instruction Visual Segmentation In Multi-Modal Large Language Models. 7158-7167 - Christos Koutlis, Symeon Papadopoulos:

AuViRe: Audio-visual Speech Representation Reconstruction for Deepfake Temporal Localization. 7168-7177 - Aritra Dey, Chandranath Adak, Kumari Priya, Soumi Chattopadhyay, Sukalpa Chanda:

Exploring the Boundaries of Diffusion Models for Offline Writer Identification with Sparse and Intra-Variable Data. 7178-7187 - Qizhen Lan

, Qing Tian
:
CLoCKDistill: Consistent Location and Context aware Knowledge Distillation for DETRs. 7188-7197 - Pengyi Li, Irina Abdullaeva, Alexander Gambashidze, Andrey Kuznetsov, Ivan V. Oseledets:

MaxInfo: A Training-Free Key-Frame Selection Method Using Maximum Volume for Enhanced Video Understanding. 7198-7207 - Sebastian Stricker, Christoph Karg, Lisa Hutschenreiter, Bogdan Savchynskyy, Dagmar Kainmueller:

Cycle-Consistent Multi-Graph Matching for Self-Supervised Annotation of C. Elegans. 7208-7217 - Atharva Sunil Deo, Ujjwal Pasupulety, Nicholas Matsumoto, Jay Moran, Cherine Yang, Jeanine Kim, Rafal Dariusz Kocielnik, Aurash Naser-Tavakolian, Andrew J. Hung:

Automated Suturing Skill Assessment in Robot-assisted Surgery from Endoscopic Videos using Clinically-guided Evaluation Criteria. 7218-7228 - Yael Elkin, Gal Ben-Arie, Tammy Riklin-Raviv:

Deep Image Decomposition for Medical Imaging Anonymization and Curation. 7229-7238 - Minheng Chen

, Youyong Kong:
Intraoperative 2D/3D Registration via Spherical Similarity Learning and Differentiable Levenberg-Marquardt Optimization. 7239-7249 - Shahzad Ahmad, Divya Mishra, Sania Bano, Sukalpa Chanda, Yogesh Singh Rawat:

ACuRE: Accurate Continuity-Regularized SpO2 Estimation Using Liquid Time-Constant Networks. 7250-7259 - Jin Bai, Gregory D. Hager:

CAST: Evaluating Multi-Object Trackers with Context-Aware Switch and Transfer Scores. 7260-7268 - Karol Wojtulewicz, Minxing Liu, Niklas Carlsson:

Advancing Player Identification and Tracking with Global ID Fusion (GIF). 7269-7280 - Sainithin Artham, Avijit Dasgupta, Shankar Gangisetty, C. V. Jawahar:

Distilling What and Why: Enhancing Driver Intention Prediction with MLLMs. 7281-7290 - Le Thien Phuc Nguyen, Zhuoran Yu, Yong Jae Lee:

LASER: Lip Landmark Assisted Speaker Detection for Robustness. 7291-7300 - Ying Cheng, Yu-Ho Lin, Min-Hung Chen, Fu-En Yang, Shang-Hong Lai:

VADER: Towards Causal Video Anomaly Understanding with Relation-Aware Large Language Models. 7301-7311 - Luan Thanh Trinh:

SCAdapter: Content-Style Disentanglement for Diffusion Style Transfer. 7312-7321 - Soyoung Yoon, Namhyuk Ahn, In Kyu Park:

T2LF: LLM-Guided Multimodal Diffusion for Text-to-Light Field Synthesis. 7322-7332 - Huining Li, Bangzhen Liu, Rui Yang, Yang Zhou, Chenshu Xu, Xufang Pang, Shengfeng He:

VideoSketcher: A Training-Free Approach for Coherent Video Sketch Transfer. 7333-7343 - Yan-Bo Lin, Kevin Lin, Zhengyuan Yang, Linjie Li, Jianfeng Wang, Chung-Ching Lin, Xiaofei Wang, Gedas Bertasius, Lijuan Wang:

Zero-Shot Audio-Visual Editing via Cross-Modal Delta Denoising. 7344-7354 - Hou In Ivan Tam, Hou In Derek Pun, Austin T. Wang, Angel X. Chang, Manolis Savva:

SceneEval: Evaluating Semantic Coherence in Text-Conditioned 3D Indoor Scene Synthesis. 7355-7365 - Gihwan Kim, Jemin Lee, Hyungshin Kim:

IPTQ-ViT: Post-Training Quantization of Non-linear Functions for Integer-only Vision Transformers. 7366-7375 - Siarhei Sheludzko, Dhimitrios Duka, Bernt Schiele, Hilde Kuehne, Anna Kukleva:

MM-TS: Multi-Modal Temperature and Margin Schedules for Contrastive Learning with Long-Tail Data. 7376-7386 - Kaixuan Lu, Mehmet Onurcan Kaya, Dim P. Papadopoulos

:
Boosting Unsupervised Video Instance Segmentation with Automatic Quality-Guided Self-Training. 7387-7397 - Niklas Penzel, Joachim Denzler:

Locally Explaining Prediction Behavior via Gradual Interventions and Measuring Property Gradients. 7398-7408 - Tristan Amadei, Enric Meinhardt-Llopis, Benedicte Bascle, Corentin Abgrall, Gabriele Facciolo:

Beyond Paired Data: Self-Supervised UAV Geo-Localization from Reference Imagery Alone. 7409-7419 - Maria Bulychev, Neil G. Marchant, Benjamin I. P. Rubinstein:

Where is the Watermark? Interpretable Watermark Detection at the Block Level. 7420-7429 - Rhodri Guerrier, Adam W. Harley, Dima Damen:

PointSt3R: Point Tracking through 3D Grounded Correspondence. 7430-7439 - Daniel Kienzle, Katja Ludwig, Julian Lorenz, Shin'ichi Satoh, Rainer Lienhart:

Uplifting Table Tennis: A Robust, Real-World Application for 3D Trajectory and Spin Estimation. 7440-7449 - Motiur Rahman, Saeka Rahman, Smriti Bhatt, Miad Faezipour:

FairVLM: Enhancing Fairness and Prompt Sensitivity in Vision Language Models for Medical Image Segmentation. 7450-7460 - Anay Majee, Rishabh Iyer:

SHaSaM: Submodular Hard Sample Mining for Fair Facial Attribute Recognition. 7461-7471 - Cong Guan, Jiacheng Ying, Yuya Ieiri, Osamu Yoshie:

DM3Net: Dual-Camera Super-Resolution via Domain Modulation and Multi-scale Matching. 7472-7481 - Rangel Daroya, Subhransu Maji:

SuperRivolution: Fine-Scale Rivers from Coarse Temporal Satellite Imagery. 7482-7492 - Hiroto Honda:

Adversarial Pseudo-replay for Exemplar-free Class-incremental Learning. 7493-7502 - Seyedehanita Madani, Rama Chellappa, Vishal M. Patel:

DiffRegCD: Integrated Registration and Change Detection with Diffusion Features. 7503-7512 - Yo-Tin Lin, Su-Kai Chen, Hou-Ning Hu, Yen-Yu Lin, Yu-Lun Liu:

HDR Reconstruction Boosting with Training-Free and Exposure-Consistent Diffusion. 7513-7523 - Shamik Basu, Luc Van Gool, Christos Sakaridis:

Optimizing against Infeasible Inclusions from Data for Semantic Segmentation through Morphology. 7524-7533 - Peter Chen, Bryan Chang, Olivia Annette Creasey, Julie Beth Sneddon, Zev J. Gartner, Yining Liu:

3D Cell Oversegmentation Correction via Geo-Wasserstein Divergence. 7534-7543 - Anirban Ghosh, Iliya Kulbaka, Ian Dahlin, Ayan Dutta:

TopoRec: Point Cloud Recognition Using Topological Data Analysis. 7544-7553 - Vineet Bhat, Naman Patel, Prashanth Krishnamurthy, Ramesh Karri, Farshad Khorrami:

MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping. 7554-7564 - Shikuan Wang

, Yuangong Chen
, Jianzhou Gong, Lingyi Meng
, Mengquan Wu, Longxing Liu, Haiwei Yuan, Mingbin Guo:
Remote Sensing Forestry Similarity Convolution. 7565-7575 - Malik Muhammad Asim, Claire B. Smallwood, Abdullah Tariq, Johnny Lo, Syed Zulqarnain Gilani:

RampWatch: An In-the-Wild Dataset and Text-Guided Detection Framework for Recreational Vessels. 7576-7585 - Heechul Lim, Min-Soo Kim, Hyun-Boo Lee, Suk-Ju Kang, Kang-Wook Chon, Haeyun Lee:

Enhancing Reverse Distillation with Core Exemplar Learning for Unified Multi-Class Anomaly Detection. 7586-7595 - Maximilian Andreas Hoefler, Karsten Müller, Wojciech Samek:

Leveraging Sparsity for Privacy in Collaborative Inference. 7596-7604 - Ujjwal Mishra, Vinita Shukla, Praful Hambarde, Amit Shukla:

Improvise, Adapt, Overcome - Telescopic Adapters for Efficient Fine-tuning of Vision Language Models in Medical Imaging. 7605-7615 - Tsung-Shan Yang, Tianyu Zhang, Feng Qian, Bing Yan, C.-C. Jay Kuo:

SVD-Det: A Lightweight Framework for Video Forgery Detection Using Semantic and Visual Defect Cues. 7616-7625 - Youta Noboru, Yuko Ozasa, Masayuki Tanaka:

Joint Optimization of Camera Model and Deep Neural Network for Image Recognition. 7626-7635 - Masayuki Kawarada, Kosuke Yamada, Antonio Tejero-de-Pablos, Naoto Inoue:

Training-free Conditional Image Embedding Framework Leveraging Large Vision Language Models. 7636-7646 - Jeongwan Shin, Chan Hur, Seongmin Cho, Jaeho Choi, Hyeyoung Park:

ReFineVQA: Iterative Refinement of Video Description via Feedback Generation for Video Question Answering. 7647-7657 - Saumya Mundra, Ajoy Mondal, C. V. Jawahar:

MIST: Multilingual Incidental Dataset for Scene Text Detection. 7658-7667 - Mingwei Tang, Jiahao Nie, Guang Yang, Ziqing Cui, Jie Li:

Multi-Grained Text-Guided Image Fusion for Multi-Exposure and Multi-Focus Scenarios. 7668-7678 - Akshit Sharma, Prashant W. Patil:

MemeTAG: Keyword-Driven Meme Classification through Tag Embedding Reconstruction. 7679-7688 - Héctor Laria Mantecon, Alexandra Gomez-Villa, Jiang Qin, Muhammad Atif Butt, Bogdan Raducanu, Javier Vazquez-Corral, Joost van de Weijer, Kai Wang:

Leveraging Semantic Attribute Binding for Free-Lunch Color Control in Diffusion Models. 7689-7698 - Ziyuan Gao, Philippe Morel:

MedPEFT-CL: Dual-Phase Parameter-Efficient Continual Learning with Medical Semantic Adapter and Bidirectional Memory Consolidation. 7699-7708 - Bryan Heryanto, Tackgeun You, Chanwoo Kim, Hwasup Lim:

Splatter Layout: Geometry-embedded 3D Reconstruction via Surface Unfolding. 7709-7718 - Xiaoyun Hu, Xiaohan Yan, Nan Wang, Gang Wei, Zhicheng Wang:

HOLO: Holistic Lightweight Optimization for Scene Understanding with Auto-Annotation and Multimodal Learning. 7719-7729 - Ying-Kun Wu, Yi Shen, Tzuhsuan Huang, I-Sheng Fang, Jun-Cheng Chen:

KMOPS: Keypoint-Driven Method for Multi-Object Pose and Metric Size Estimation from Stereo Images. 7730-7739 - Osman Tursun

, Sinan Kalkan, Simon Denman, Clinton Fookes:
PDV: Prompt Directional Vectors for Zero-shot Composed Image Retrieval. 7740-7749 - Jung In Jang, Kyong Hwan Jin:

GRAPE (Gaussian Rendering for Accelerated Pixel Enhancement) Brings Fast and Lightweight Arbitrary Super-Resolution. 7750-7758 - Jiyang Lee, Woori Bae, U.-Geun Ji, Hanyeol Yang, Jong-Min Lee:

Fetal and Neonatal Cortical Surface Reconstruction with Anatomical Normal-guidance and Perceptual Enhancements. 7759-7768 - Trung Thanh Nguyen, Yasutomo Kawanishi, Vijay John, Takahiro Komamizu, Ichiro Ide:

View-aware Cross-modal Distillation for Multi-view Action Recognition. 7769-7778 - Shruti Agarwal, Élie Michel, Vishal Asnani, Tania Mathern, John P. Collomosse:

NRGMark: Localized Watermarking for Energy Transparency in Images. 7779-7788 - Shih-Han Chou, Shivam Chandhok, James J. Little, Leonid Sigal:

Test-Time Consistency in Vision Language Models. 7789-7798 - Toby Chong, Ryota Nakajima:

Revisiting an Old Perspective Projection for Monocular 3D Morphable Models Regression. 7799-7808 - Roy Betser, Omer Hofman, Roman Vainshtein, Guy Gilboa:

General and Domain-Specific Zero-shot Detection of Generated Images via Conditional Likelihood. 7809-7820 - Amirhossein Dadashzadeh, Parsa Esmati, Majid Mirmehdi:

Co-STAR: Collaborative Curriculum Self-Training with Adaptive Regularization for Source-Free Video Domain Adaptation. 7821-7831 - Prachi, Sumit Bhatia, Srikanta Bedathur:

Being Positive about Negative Queries: Exclusion Aware Multimodal Retrieval using Disentangled Representations. 7832-7841 - Jibril El Hassani, Thomas Verelst:

DualRes: Production-ready Dynamic Object Detection. 7842-7851 - Huantao Ren, Hesham M. Eraqi, ABM Musa, Mohamed N. Moustafa:

Semantic Map Guided Bird's-Eye View Learning for Online HD Map Construction. 7852-7861 - Raul Balmez, Alexandru Brateanu, Ciprian Orhei, Codruta O. Ancuti, Cosmin Ancuti:

ISALux: Illumination and Semantics-Aware Transformer Employing Mixture of Experts for Low Light Image Enhancement. 7862-7872 - Pierre Ancey, Andrew Lawrence Price, Saqib Javed, Mathieu Salzmann:

FastPose-ViT: A Vision Transformer for Real-Time Spacecraft Pose Estimation. 7873-7882 - Shashank Bayal, Rushikesh Govind Dawane, Komal, Santosh Kumar Vipparthi, Subrahmanyam Murala:

QuEENet: Quantum-Enhanced Expressive Network for Image Classification. 7883-7892 - Shaharyar Ahmed Khan Tareen, Lei Fan, Xiaojing Yuan, Qin Lin, Bin Hu:

SOLAR: Switchable Output Layer for Accuracy and Robustness in Once-for-All Training. 7893-7902 - Alessia Saporita, Vittorio Pipoli, Federico Bolelli, Lorenzo Baraldi, Andrea Acquaviva, Elisa Ficarra:

FG-Tracer: Tracing Information Flow in Multimodal Large Language Models in Free-Form Generation. 7903-7912 - Anton Frolov, Volker Rodehorst:

Patch Your Matcher: Correspondence-Aware Image-to-Image Translation Unlocks Cross-Modal Matching via Single-Modality Priors. 7913-7924 - Arpita Nema, Hanwei Zhu, Xi Zhang, Weisi Lin:

Diversity Preserving Coresets for Image Quality Assessment. 7925-7934 - Sangha Park, Seungryong Yoo, Jisoo Mok, Sungroh Yoon:

SAVE: Sparse Autoencoder-Driven Visual Information Enhancement for Mitigating Object Hallucination. 7935-7944 - Thomas Monninger, Zihan Zhang, Steffen Staab

, Sihao Ding:
NavMapFusion: Diffusion-based Fusion of Navigation Maps for Online Vectorized HD Map Construction. 7945-7954 - Manish Dhakal, Venkat R. Dasari, Rajshekhar Sunderraman, Yi Ding:

GFT: Graph Feature Tuning for Efficient Point Cloud Analysis. 7955-7964 - Pranay Meshram, Yash Turkar, Kartikeya Singh, Praveen Raj Masilamani, Charuvahan Adhivarahan, Karthik Dantu:

QAL: A Loss for Recall-Precision Balance in 3D Reconstruction. 7965-7974 - Deukryeol Yoon, Seonghak Kim, Young Hwa Sung, Jinho Jung:

Meta-YOLO: Metadata-Guided Real-Time Object Detector in Aerial Imagery. 7975-7984 - Francesco Dalmonte, Emirhan Bayar, Emre Akbas, Mariana-Iuliana Georgescu:

Q-Former Autoencoder: A Modern Framework for Medical Anomaly Detection. 7985-7995 - Weihao Li, Hongjin Zhao, Gao Zhu, Ge-Peng Ji, Nicholas Wilson, Marta Yebra, Nick Barnes:

AusSmoke meets MultiNatSmoke: a fully-labelled diverse smoke segmentation dataset. 7996-8006 - Ilhwan Kim

, Sangwoo Yun, Dongheon Lee, Seongsu Kim, Joonki Paik:
NAPP: Noise-Adaptive Prototype Perturbation for Few-Shot Learning. 8007-8016 - Madhav Agarwal, Mingtian Zhang, Laura Sevilla-Lara, Steven McDonagh:

GaussianHeadTalk: Wobble-Free 3D Talking Heads with Audio Driven Gaussian Splatting. 8017-8027 - Hao-Jen Chien, Yi-Chuan Huang, Chung-Ho Wu, Wei-Lun Chao, Yu-Lun Liu:

Splannequin: Freezing Monocular Mannequin-Challenge Footage with Dual-Detection Splatting. 8028-8040 - Raphael Du Sablon, David Hart:

Optimization-Free Style Transfer for 3D Gaussian Splats. 8041-8051 - Sejuti Majumder, Saarthak Kapse, Moinak Bhattacharya, Xuan Xu, Alisa Yurovsky, Prateek Prasanna:

PEaRL: Pathway-Enhanced Representation Learning for Gene and Pathway Expression Prediction from Histology. 8052-8062 - Sun Han Neo, Sachith Seneviratne, Herath Mudiyanselage Viraj Vidura Herath, Abhishek Saha, Sanka Rasnayaka, Lucy Amanda Marshall:

Flood-LDM: Generalizable Latent Diffusion Models for rapid and accurate zero-shot High-Resolution Flood Mapping. 8063-8072 - Longyun Liao, Rong Zheng:

LangPose: Language-Aligned Motion for Robust 3D Human Pose Estimation. 8073-8083 - Salamata Konate, Hassan Hamidi, Elham Dolatabadi, Frank Rudzicz, Laleh Seyyed-Kalantari:

SphereEdit: Spherical Semantic Editing in Diffusion Models. 8084-8093 - Seunghun Yu, Jin-Hyun Ahn, Joonhyuk Kang:

FedEFC: Federated Learning Using Enhanced Forward Correction Against Noisy Labels. 8094-8102 - Jakub Paplhám, Vojtech Franc:

Photo Dating by Facial Age Aggregation. 8103-8112 - Zeyun Zhong

, Manuel Martin, David Schneider
, David J. Lerch, Chengzhi Wu, Frederik Diederichs, Juergen Gall, Jürgen Beyerer:
Scalable Video Action Anticipation with Cross Linear Attentive Memory. 8113-8123 - Beomseok Kang, Niluthpol Chowdhury Mithun, Abhinav Rajvanshi, Han-Pang Chiu, Supun Samarasekera:

DUDA: Distilled Unsupervised Domain Adaptation for Lightweight Semantic Segmentation. 8124-8135 - Arushi Rai, Adriana Kovashka:

Generalizing Sports Feedback Generation by Watching Competitions and Reading Books: A Rock Climbing Case Study. 8136-8145 - Zhuoming Liu, Xiaofeng Gao, Feiyang Niu, Qiaozi Gao, Liu Liu, Robinson Piramuthu:

START: Spatial and Textual Learning for Chart Understanding. 8146-8156 - Ketul Shah, Pankaj Nathani, Rama Chellappa, Fabian Caba Heilbron:

VRAgent: Self-Refining Agent for Zero-Shot Multimodal Video Retrieval. 8157-8167 - Sharat Bhat, Harshita Khandelwal, Tushar Kataria, Vivek Gupta:

MapVerse: A Benchmark for Geospatial Question Answering on Diverse Real-World Maps. 8168-8178 - Akshat Rampuria, Kamakshya Prasad Nayak, Kamalakar Vijay Thakare, Tushar Joshi, Aditya Dhananjay Singh, Haesol Park, Heeseung Choi, Hyungjoo Jung, Debi Prosad Dogra, Ig-Jae Kim:

IMPACT: Interpretable Most Important Person Analysis and Classification using Transformer-based Models. 8179-8187 - Jiajun Cheng, Xianwu Zhao, Sainan Liu, Xiaofan Yu, Ravi Prakash, Patrick J. Codd, Jonathan Elliott Katz, Shan Lin:

SurgXBench: Explainable Vision-Language Model Benchmark for Surgery. 8188-8198 - Yu-Shun Huang, Jing-Ming Guo, Yi-Xiang Yang:

SeqFeedNet: Sequential Feature Feedback Network for Background Subtraction. 8199-8208 - Son Tung Nguyen, Alejandro Fontán

, Michael Milford
, Tobias Fischer
:
Robust Scene Coordinate Regression via Geometrically-Consistent Global Descriptors. 8209-8219 - Kailai Feng, Yabo Zhang, Haodong Yu, Zhilong Ji, Jinfeng Bai, Hongzhi Zhang, Wangmeng Zuo:

VitaGlyph: Vitalizing Artistic Typography with Flexible Dual-branch Diffusion Models. 8220-8230 - Ruisheng Han, Kanglei Zhou, Shuang Chen, Amir Atapour-Abarghouei, Hubert P. H. Shum:

CaFlow: Enhancing Long-Term Action Quality Assessment with Causal Counterfactual Flow. 8231-8241 - Yuxuan Ou, Ning Bi, Jiazheng Pan, Jiancheng Yang, Boliang Yu, Usama Zidan, Regent Lee, Vicente Grau:

AortaDiff: A Unified Multitask Diffusion Framework for Contrast-Free AAA Imaging. 8242-8251 - Sheng-Hao Liao, Shang-Fu Chen, Tai-Ming Huang, Wen-Huang Cheng, Kai-Lung Hua:

DirectDrag: High-Fidelity, Mask-Free, Prompt-Free Drag-based Image Editing via Readout-Guided Feature Alignment. 8252-8261 - Aveen Dayal, Peketi Divya, Nidhi Tiwari, Linga Reddy Cenkeramaddi, C. Krishna Mohan, Abhinav Kumar:

Bridging the Domain Gap in Small Multimodal Models: A Dual-level Alignment Perspective. 8262-8271 - Václav Divis, Jessica Giovagnola, Khalil Ben Chikha, Marek Hrúz:

Crash2DocAI: Automated Integration of Post-Crash Car Part Images into Technical Reports. 8272-8281 - Haochen Zhang, Animesh Sinha, Felix Juefei-Xu, Haoyu Ma, Kunpeng Li, Zhipeng Fan, Xiaoliang Dai, Tingbo Hou, Peizhao Zhang, Zecheng He:

Conversational Image Generation: Towards Multi-Round Personalized Generation with Multi-Modal Language Models. 8282-8291 - Chae-Yeon Heo, Yeong-Jun Cho:

CSF-Net: Context-Semantic Fusion Network for Large Mask Inpainting. 8292-8301 - Xuqian Ren, Wenjia Wang, Mai Ngoc Nguyen, Juho Kannala, Esa Rahtu:

SceneShine: Illumination-aware Human Scene Gaussian Re-Splatting from Mobile Device Video. 8302-8312 - Sourabh Sharma

, Sonam Gupta
, Sadbhawna:
See, Think, Learn: A Self-Taught Multimodal Reasoner. 8313-8322 - Zhenyu Jin, Wenjie Li, Zhanyu Ma, Heng Guo:

SpecGen: Neural Spectral BRDF Generation via Spectral-Spatial Tri-plane Aggregation. 8323-8332 - Srikanth Muralidharan, Heitor Rapela Medeiros, Masih Aminbeidokhti, Eric Granger, Marco Pedersoli:

Pretraining Helps When Capacity Allows: Evidence from Ultra-Small ConvNets. 8333-8342 - Sinan Mutlu, Georgios-Fotios Angelis, Savas Özkan, Paul Wisbey, Anastasios Drosou, Mete Ozay:

Mem-MLP: Real-Time 3D Human Motion Generation from Sparse Inputs. 8343-8352 - Bingyin Zhao, Yingjie Lao:

UltraClean: A Simple Framework to Train Robust Neural Networks against Backdoor Attacks. 8353-8363 - Maximilian Schall, Felix Leonard Knöfel, Noah Elias König, Jan Jonas Kubeler, Maximilian von Klinski, Joan Wilhelm Linnemann, Xiaoshi Liu, Iven Jelle Schlegelmilch, Ole Woyciniuk, Alexandra Schild, Dante Wasmuht

, Magdalena Bermejo Espinet, German Illera Basas, Gerard de Melo:
GorillaWatch: An Automated System for In-the-Wild Gorilla Re-Identification and Population Monitoring. 8364-8375 - Wenjie Ai, Cuong C. Nguyen

, Adrian Hilton
, Gustavo Carneiro
:
Reciprocal Teaching: Dynamic Multi-Model Teacher-Student Learning for Multiple Noisy Annotations. 8376-8385 - Numan Saeed, Tausifa Jan Saleem, Fadillah A. Maani, Muhammad Ridzuan, Hu Wang, Mohammad Yaqub:

DuPLUS: Dual-Prompt Vision-Language Framework for Universal Medical Image Segmentation and Prognosis. 8386-8395 - Quan Tran, Tuan Dang:

TriaGS: Differentiable Triangulation-Guided Geometric Consistency for 3D Gaussian Splatting. 8396-8405 - Nico Leuze, Maximilian Hoh, Samed Dogan, Nicolas R.-Peña, Alfred Schöttl:

SDT-6D: Fully Sparse Depth-Transformer for Staged End-to-End 6D Pose Estimation in Industrial Multi-View Bin Picking. 8406-8415 - Minseok Kim, Jiyong Boo, Kuk-Jin Yoon:

Generalized Category Discovery for LiDAR Semantic Segmentation. 8416-8426 - Gerhard Krumpl, Henning Avenhaus, Horst Possegger:

ICONIC-444: A 3.1-Million-Image Dataset for OOD Detection Research. 8427-8436 - Thomas E. Huang, Siyuan Li, Martin Danelljan, Henghui Ding, Luc Van Gool, Fisher Yu:

Any Detector Can Detect Anything. 8437-8447 - Alexander Wollam, Kyle Ashley, Maxim Shugaev, Oliver Arend, Ilya Semenov, Hadis Dashtestani, Sumved Ravi, Nathan Jacobs:

Towards Unconstrained Cross-View Pose Estimation. 8448-8457 - Sümeyye Meryem Tasyürek, Tugçe Kiziltepe, Hacer Yalim Keles:

Disentangle and Regularize: Sign Language Production with Articulator-Based Disentanglement and Channel-Aware Regularization. 8458-8467 - Mustafa Munir, Sophia Zalewski, Shiqiu Liu, David Tarjan, Sushmitha Belede, Anjul Patney, Radu Marculescu:

SmoothDiffusion-VE: Real-time Generative Video Editing Using Adaptive Feature Cache. 8468-8478 - Yongjae Lee, Zhaoliang Zhang, Deliang Fan:

SafeguardGS: 3D Gaussian Primitive Pruning While Avoiding Catastrophic Scene Destruction. 8479-8489 - Aryan Das, Tanishq Rachamalla, Koushik Biswas, Swalpa Kumar Roy, Vinay Kumar Verma:

Uncertainty-Aware Vision-Language Segmentation for Medical Imaging. 8490-8499 - Hyunho Kook, Byeongho Yu

, Jeong Min Oh, Eunhyeok Park:
Stabilizing Direct Training of Spiking Neural Networks: Membrane Potential Initialization and Threshold-robust Surrogate Gradient. 8500-8510 - Matteo Marulli, Marco Bertini:

DocWaveDiff: A Predict-and-Refine approach for Document Image Enhancement with Wavelet U-Nets and Diffusion models. 8511-8520 - Rishikesh Bhyri, Brian R. Quaranto, Junsong Yuan, Peter C. W. Kim, Nan Xi:

Chain-of-Look Spatial Reasoning for Dense Surgical Instrument Counting. 8521-8530 - Fangzhou Yi, Zhicheng Gong, Hui Zeng:

Rethinking Latent Variable in Learned Image Compression. 8531-8540 - Thomas Monninger, Md Zafar Anwar, Stanislaw Antol, Steffen Staab

, Sihao Ding:
AugMapNet: Improving Spatial Latent Structure via BEV Grid Augmentation for Enhanced Vectorized Online HD Map Construction. 8541-8550 - Guanyu Hu, Dimitrios Kollias, Xinyu Yang:

From Cognitive Priors to Instance Semantics: A Unified Framework for Multi-task Affective Computing. 8551-8562 - Ilke Demir, Umur Aybars Ciftci:

FuLLaMa: Training-free Diffusion-based Object Removal with Context Preservation. 8563-8573 - Abhinav Raundhal, Gaurav Behera, P. J. Narayanan, Ravi Kiran Sarvadevabhatla, Makarand Tapaswi:

STRinGS: Selective Text Refinement in Gaussian Splatting. 8574-8583 - Vivek Madhavaram, Vartika Sengar, Arkadipta De, Charu Sharma:

VIZOR: Viewpoint-Invariant Zero-Shot Scene Graph Generation for 3D Scene Reasoning. 8584-8595 - Jongha Kim, Byungoh Ko, Jeehye Na, Jinsung Yoon, Hyunwoo J. Kim:

Relevance-aware Multi-context Contrastive Decoding for Retrieval-augmented Visual Question Answering. 8596-8605 - Shizhe Sun, Wataru Ohyama:

CanKD: Cross-Attention-based Non-local operation for Feature-based Knowledge Distillation. 8606-8616 - Hassaan Farooq, Marvin Brenner, Peter Stütz:

FlyPose: Towards Robust Human Pose Estimation From Aerial Views. 8617-8627 - Tooba Tehreem Sheikh, Jean Lahoud, Rao Muhammad Anwer, Fahad Shahbaz Khan, Salman Khan, Hisham Cholakkal:

MedROV: Towards Real-Time Open-Vocabulary Detection Across Diverse Medical Imaging Modalities. 8628-8638 - Weiyi Wu, Xinwen Xu, Chongyang Gao, Xingjian Diao, Siting Li, Jiang Gui:

Exploiting Label-Independent Regularization from Spatial Patterns for Whole Slide Image Analysis. 8639-8649 - Khaled M. Seyam, Julian Wiederer, Markus Braun, Bin Yang:

SVS-GAN for Semantic Synthesis of Traffic Videos for Autonomous Driving. 8650-8659 - Pengfei Gu, Huimin Li, Haoteng Tang, Dongkuan Xu

, Erik Enriquez, DongChul Kim, Bin Fu, Danny Z. Chen:
Integrating Multi-scale and Multi-filtration Topological Features for Medical Image Classification*. 8660-8669 - Wenwei Li, Mingwei Liao, Lingyi Cai, Anan Li:

NeuroBridge: Few-Shot Cross-Modal Neuron Re-identification via Dual-Channel Deep Metric Learning. 8670-8679 - Mritunjoy Halder, Shivam Ashok Shukla, Lokender Tiwari, Raghav Mittal, Brojeshwar Bhowmick:

Sketch3R: Rapid and Realistic 3D VR Sketch Creation to Shape Retrieval. 8680-8689 - K. M. Megha Mariam, Aditya Arun

, Zakaria Laskar, C. V. Jawahar:
PhyEduVideo: A Benchmark for Evaluating Text-to-Video Models for Physics Education. 8690-8699 - Ke Nan, Maggie Samaan, Benjamin Burns, Xia Ning, Yuchi Han, Yuan Xue:

Dual-Domain Multimodal Hyperbolic Fusion for Cardiopulmonary Disease Diagnosis in Emergency Care. 8700-8710

manage site settings
To protect your privacy, all features that rely on external API calls from your browser are turned off by default. You need to opt-in for them to become active. All settings here will be stored as cookies with your web browser. For more information see our F.A.Q.


Google
Google Scholar
Semantic Scholar
Internet Archive Scholar
CiteSeerX
ORCID













