


default search action
17th APPT 2026: Brussels, Belgium
- Lieven Eeckhout, Chao Li

, Zhibin Yu, Avi Mendelson:
Advanced Parallel Processing Technologies - 17th International Symposium, APPT 2026, Brussels, Belgium, July 27, 2026, Proceedings. Lecture Notes in Computer Science 16693, Springer 2027, ISBN 978-981-92-4804-9
Featured Articles
- Lang Yuan, Linbo Qiao, Yu Tang, Mingxiang Zhu, Wei Shang, Dongsheng Li:

ZIPPer: A Fine-Grained Co-design of ZeRO-DP and Pipeline Parallelism for LLM Training on Heterogeneous GPUs. 3-17 - Yunqian Luo

, Mingyu Gao
:
obliv-clang: Real-World Oblivious Programming in C++. 18-33 - Danni Wang, Hao Yu

, Zili Zhou, Sizhao Li
, Guisheng Yin
, Donghui Guo
:
Uni-Winograd: A Massively Resource-Efficient and Unified Radix-4 NTT Architecture for PQC Algorithms. 34-48 - Yuxuan Liu

, Yeh-Ching Chung
, Shuang Chen
:
Barbell: An Extensible Generator of On-demand Loads for Interactive Cloud Services. 49-63
LLM Inference
- Hao Zhang, Xiaoli Gong

, Haoran Li, Huayou Su, Qingxia Chen, Jin Zhang
:
JSQKV: Joint Sparsification and Quantization for KV-Cache Compression and Decode Acceleration. 67-81 - Chengwei Li, Guangda Liu, Jieru Zhao

, Quan Chen
, Minyi Guo
:
LocalKV: Leveraging Sparse Attention Locality for Efficient Long-Context LLM Inference. 82-96 - Zichuan Wang, Huizheng Wang, Yuheng Xiao, Haonan Zuo, Taiquan Wei, Jinyi Deng, Chao Li, Yang Hu, Shouyi Yin:

MOCAP: Wafer-Scale-Chip-Oriented Memory-Orchestrated Chunked Pipelining Framework for Prefill-Only LLM Inference. 97-111 - Fengrui Zuo, Zhiwei Ke

, Yiming Liu, Cheng Tang, Wenqi Lou
, Teng Wang
, Lei Gong
, Chao Wang
, Xuehai Zhou
:
Window-Diffusion: Accelerating Diffusion Language Model Inference with Windowed Token Pruning and Caching. 112-125
Serving Systems
- Zhuohang Bian, Feiyang Wu, Zhuoran Li, Yibo Zhao

, Junchi Wu
, Xuxiao Yang, Youwei Zhuo
:
TokenSimV2: Accurate and Fast LLM Inference on GPUs via Dynamic Graph Modeling. 129-141 - Chang Liu, Jiacheng Liu

, Xiaofeng Hou
, Minyi Guo
:
TierServe: Revenue-Maximizing LLM Inference Scheduling Across Multiple Subscription Tiers. 142-156 - Weitao Wan

, Huanchen Zhang
, Mingyu Gao
:
Identifying Iso-Cost Sweet Spot Configurations for Cloud OLAP Queries. 157-171
LLM Workflows
- Rongyu Luo, Lingxiao Zhao, Yuezhi Che

:
Characterizing and Mitigating Context Redundancy in LLM Agent Workflows. 175-188 - Yiming Li

, Yichi Chen
, Laiping Zhao
, Wenyu Qu:
Do Not Let Sandboxes Sit Idle: Cross-Agent Sandbox Re-allocation for LLM Agents. 189-202 - Yapeng Li, Hu Zhang, Jibin Wang, Jing Chen, Lijuan Xu:

CGR: A Budget-Aware Closed-Loop Framework for Efficient Knowledge Graph Question Answering. 203-218
AI Design Automation
- Jian Zuo, Junzhe Liu, Xianyong Wang, Chen Liang, Navya Goli, Umamaheswara Rao Tida

, Zhenge Jia
, Zhaoyan Shen
, Mengying Zhao
:
SysVCoder: An LLM-Driven Framework for Systematic Generation of System-Level Design. 221-237 - Bingjie Liu, Zhongchun Zheng, Xianwei Zhang:

TensorAgent: Multi-agent Framework for Automated Tensor Core Code Generation. 238-252 - Junyu Yue, Chongxi Wang, Jinpeng Ye, Jianan Xie, Ziyang Liu, Wenqing Li, Chao Yang, Longbing Zhang, Fuxin Zhang, Jian Wang:

CUTE-XS: Bottleneck Analysis and Collaborative Optimization for Integrating CUTE Into XiangShan. 253-266
Scalable Computing
- Yonghua Huang, Baodong Wu, Shigang Li

, Jiahao Ding, Rongtian Fu, Qingping Li, Boxun Li, Zhenhua Zhu, Yu Wang:
C3FT: Computation-Centric Checkpointing for Distributed Large Model Training. 269-281 - Zihan Liu, Yizhen Wang, Rui Wang, Youhui Bai, Sai Wu:

FlexUSFL: A Scalable and Memory-Efficient U-Shaped Split Federated Learning Framework for Large Language Model Fine-Tuning. 282-297 - Siyue Chen, Junshi Chen

, Yang Zhao
, Yunchi Deng, Yi Zhang
, Hong An
, Juchun Ding
:
SAW3D: A Performance-Portable Solver for Compressible Turbulence at the 풪(1010)-Cell Scale on Heterogeneous Supercomputers. 298-310
AI Accelerators
- Zixuan Zeng, Chen Zhang, Zhe Liu, Peng Li:

BitFly: A Low-Bit Mixed-Precision Acceleration Framework for Edge RISC-V Vector Processors. 313-329 - Qiyan Fang, Yifan Wang, Yongwei Zhao

, Yi Chen, Zetao Guo
:
Fold-FP4: Folding for Energy Efficient FP4 Matrix Multiplication. 330-342 - Yanwei Wang, Jun Liu, Wei Huang, Qun Li, Tianle Mai, Keqiu Li:

Helios: Scalable Multi-accelerator FPGA Architecture for Efficient Inference of Transformer-Based Models. 343-358 - Xuchang Liu, Chang Liu, Jun Wang, Li Shen:

A Hierarchical Adaptive Posit-CIM Architecture for Edge Transformer Inference. 359-371
Kernel Acceleration
- Shengwei Li, Zhiquan Lai, Shuai Xu, Shun Ouyang, Han Xiao, Zhaoning Zhang, Menghan Jia, Huayou Su, Dongsheng Li:

DOA: Dataflow Optimization for Attention on Multi-core DSPs with Three-Level Memory Hierarchy. 375-389 - Yuxiang Zhang, Jianhua Gao

, Weixing Ji
:
ARROW: Adaptive Row Reorganization for Warp-Balanced SpMV. 390-403 - Qian Xiong

, Weiliang Ma
, Ligang He
, Yufan Bai, Yao Chen
, Hai Jin
, Xuanhua Shi
:
HieraNTT: A Memory Hierarchy-Aware Data Access Architecture for Efficient Number Theoretic Transform on GPU. 404-419
Streaming Accelerators
- Xuzhuo Hu, Jianyang Ding, Bowen Jiang, Huachen Zhang

, Tianshuo Lu
, Zhilei Chai
:
A Configurable Streaming Accelerator for LUT-Based Super-Resolution on FPGA. 423-435 - Hai Cao, Puguang Liu

, Zhang Luo, Yuan Li, Jihang Wang, Xingyun Qi, Mingche Lai:
TL-Sort: A Fully Pipelined Hardware Architecture for Sorting Without Run-Drain Stalls. 436-449 - Jingrui Yuan

, Qinggang Wang
, Haoran Zhu, Jin Zhao
, Xiaofei Liao
:
Hardware-Accelerated Streaming Graph Processing with Fast Refinement. 450-463
Secure Systems
- Chang Liu

, Xin Zhang
, Dapeng Ju, Yongqiang Lyu
, Dongsheng Wang
:
Pitfall: Uncovering and Exploiting the Store Forwarding Predictor on Intel CPUs. 467-482 - Xinyao Zheng

, Husheng Han
, Shangyi Shi
, Qiyan Fang, Zidong Du
, Xing Hu
, Qi Guo
:
InputSnatch: Stealing Input in LLM Services via Cache-Sharing Timing Side-Channel Attacks. 483-497 - Yunpeng Xu

, Yuchen Fan
, Yu Jin
, Shuangjie Yao, Jia Zhang, Teng Ma
, Shuwen Deng
:
TArCS: Trusted and Attack-Resilient Clock Source with TEE and RDMA. 498-512
Data Efficiency
- Han Xu

, Ziyang Liu
, Weitong Wang
, Yuyangheng Wang, Fuxin Zhang
:
CRAFT: Exploiting Precharge Cost Asymmetry for Adaptive DRAM Row Buffer Management. 515-530 - Zhichao Yang, Xiangyu Zou, Wen Xia, Boou Jiang:

Improving Compression Ratio of Lossy Compression for HPC via Modeling-Based Arithmetic Coding. 531-546 - Husheng Han

, Di Huang
, Tianyun Ma
, Xinyao Zheng
, Jianan Mu
, Zidong Du
, Xing Hu
, Qi Guo
:
VecTEE: Compact TEE Metadata Caching for Efficient Secure Vector Computing. 547-561
Poster Papers
- Zitong An, Kangkang Chen

, Huayou Su
, Jinwei Xu
, Xi Yang
:
AMXStencil: Boosting the Performance of Stencil Computations on AMX-Powered CPUs via Fusion. 565-571 - Sizhao Li, Zili Zhou, Wei Li, Chenyu Zhai, Bingrui Guo, Donghui Guo:

S2M: Spatiotemporal-Cooperative Symbiotic Memory for Heterogeneous PQC Acceleration. 572-578 - Zheng Xu

, Jiaxin Liu, Dehao Kong, Jiamu Fu, Xu Dai
, Lei Wang, Jian Weng
, Jinyi Deng
, Yang Hu
, Shouyi Yin
:
WaferSim: A Simulation Infrastructure for LLM Service on Wafer-Scale Chips. 579-585 - Han Yang, Xiaofeng Hou, Jiacheng Liu, Xiaozhi Zhu, Chao Li:

OrbitGuard: Hierarchical Orbit-Aware Runtime for Spaceborne LLM Inference. 586-591 - Xiangtao Guan, Shuyao Cheng, Rui Zhang, Zidong Du:

MV-BSD: Multi-variable Speculation Diagrams for Compact Automated Logic Design. 592-598 - Ninghui Shang, Ying Liu, Zecheng Zhou, Jiyong Hu, Zhiqiang Guo, Zhiyuan Chen, Wentao Zhao, Guoxiang Li, Peiyu Chen, Yufei Ma, Le Ye:

RV-CIM: Energy-Delay Optimized Mapping and Architecture Co-Design for a RISC-V Multi-core SoC with Configurable DCIM Cluster. 599-606 - Shuai Yuan

, Zhou Liang, Yuanbo Wen
, En Shao
, Guangming Tan
:
LLM-SYCL: Automated SYCL Generation from CUDA via Search-Driven LLM Translation. 607-612 - Qin Zhu, Fanzi Zeng, Kenli Li, Hai Tan, Mengyuan Zhang, Haoran Kong, Longbao Dai, Wenlong Liu, Xiang Zhu:

Characterizing and Mitigating I/O Bottlenecks in LLM Inference on Disaggregated HPC Systems. 613-618 - Jinfei Hu

, Liqiong Yang, Jingyi Wang, Jian Wang:
A Bottom-Up Approach for Die-to-Die Interconnect Optimization: From PHY Latency Reduction to System-Level Design Implications. 619-624 - Ao Zhou

, Bo Dai, Le Yu, Xingyu Liu, Zeyu Hao, Lingkun Long
, Chunming Hu
, Jianlei Yang
:
EcoVLA: Energy-Efficient Device-Edge Co-inference for Vision-Language-Action Models Under Real-Time Constraints. 625-631 - Ruiyang Xia, Yifan Hao

, Yuming Zhao, Liu Yang
, Yongwei Zhao
, Zidong Du
, Xing Hu
, Li Wei, Qi Guo
:
COMET: An FP32 Matrix Multiplication Accelerator by Extending INT8-Based Arrays. 632-637

manage site settings
To protect your privacy, all features that rely on external API calls from your browser are turned off by default. You need to opt-in for them to become active. All settings here will be stored as cookies with your web browser. For more information see our F.A.Q.


Google
Google Scholar
Semantic Scholar
Internet Archive Scholar
CiteSeerX
ORCID













