Euro-Par 2026 Accepted Papers

Euro-Par 2026 website: https://2026.euro-par.org/

Titles and author lists reflect the final camera-ready versions included in the proceedings.

  1. Static Scheduling of DAG Workflows on Homogeneous Parallel Platforms Using Longest Betweenness Centrality
    Niek Damink, Alberto Garcia-Robledo and Mahboobeh Zangiabady
  2. An Event-based Causality Model for Mobile Multiagent Systems
    Ajay D. Kshemkalyani and Anshuman Misra
  3. Hierarchical Recursive Precision for Accelerating Symmetric Linear Solves on MXUs
    Vicki Carrica, Rabab Alomairy, Evelyne Ringoot and Alan Edelman
  4. Thunder: Efficient Multi-Node FHE Acceleration Framework via In-Transit Computation
    Kai Li, Lutan Zhao, Qingyun Niu, Yinhang Zheng, Zhengbang Yang, Boyan Zhao, Lu Gao and Rui Hou
  5. Characterizing Needleman-Wunsch Sequence Alignment on the Graphcore IPU: Memory Trade-offs and Optimization Strategies
    S.-Kazem Shekofteh, Nils Kochendörfer and Holger Fröning
  6. Constella: A Novel Framework for Cost-Efficient Distributed AI Inference in LEO Space Data Centers
    Andrija Stanisic, Milos Gravara, Juan Luis Herrera and Stefan Nastic
  7. Adaptive Fault Tolerance in Time-Sensitive Networking
    Wei Quan, Qian Yang, Wenliang Ma, Gang Sun, Hui Yang, Tao Li and Zhigang Sun
  8. Constraint Driven Global Data Layout Optimization for Tensor Expressions
    Yi Miao and Stephen Jarvis
  9. TAIN: Scalable Tensor-Aware Acceleration for Quantum Chemistry on Heterogeneous Architectures
    Wenhao Liang, Lianhua He, Runfeng Jin, Yingqi Tian, Yidong Chen, Yingjin Ma and Zhong Jin
  10. ApproxRAG: A Systematic Framework for Mitigating I/O Overheads in Retrieval-Augmented Generation
    Danying Ge, Qizhi Jiang, Jianhua Gao, Jianjun Shi and Weixing Ji
  11. Evaluating the Parallelization Capabilities of State-of-the-art Agentic Large Language Models
    Peter Thoman and Philipp Gschwandtner
  12. MoProteus: LLM-Driven Multi-Version Operator Generation for Energy-Aware Scheduling in Heterogeneous Cloud-Edge Environments
    Yiwen Liu, Haotian Wang, Junshuang Ma, Zicong Wang, Wangdong Yang and Kenli Li
  13. Efficient Parallel Algorithms for Hypergraph Matching
    Henrik Reinstädtler, Christian Schulz, Nodari Sitchinava and Fabian Walliser
  14. Velvet: Parallel Divide-and-Conquer in Safe Rust
    Badia Liokouras, Ben van Werkhoven and Rob V. van Nieuwpoort
  15. Harmonia: QoS-Aware and High-Throughput Generative Inference with a Single GPU
    Sowoong Kim, Youngsam Shin, Yeongon Cho and Woongki Baek
  16. Coordinated Resource Management for Energy-Efficient DNN Inference on Heterogeneous Edge Devices
    Yuening Wang, Juan Fang, Ran Zhai, Qi Ming, Nan He and Anca Jurcut
  17. Backend Code Generation for Graph DSLs Targeting Diverse Accelerator Platforms
    Ashwina Kumar, M. Venkata Krishna, Prasanna Bartakke, Mathew Thomas, Rahul Kumar, Rajesh Pandian M, Nibedita Behera and Rupesh Nasre
  18. MARS: Multi-model Aware Real-time Scheduler for NPU-coordinated DLI Tasks
    Qing Li, Zhan Zhang, Yuzhou Huo, Decheng Zuo and Yanjun Shu
  19. Frenzy: A Memory-Aware Serverless LLM Training System for Heterogeneous GPU Clusters
    Zihan Chang, Sheng Xiao, Shuibing He, Xuechen Zhang, Siling Yang, Zhenxin Li, Zhe Pan and Weijian Chen
  20. SMEAtten: Fast and Memory-Efficient Outer Product-based Attention on ARMv9 CPUs with SME
    Tengyang Zheng, Han Huang, Junru Chen, Xianwei Zhang and Yutong Lu
  21. RWIP: Region-Level Write-Intensity Prediction for GPU L2 Cache based on Hybrid-Retention STT-MRAM
    Yujie Pu, Chen Zhao, Jianfeng An, Wenzhe Zhao and Pengju Ren
  22. RAGNN: A Resource-Aware System for Graph Neural Network Training at Scale
    Phivos Dadamis, Dimitrios Tomaras, Vana Kalogeraki and Dimitrios Gunopulos
  23. Two-Stage Hierarchy-Aware Learning with Gradient Conflict Mitigation for HLS Latency and Resource Prediction
    Zhiwei Ke, Yiming Liu, Fengrui Zuo, Wenqi Lou, Chao Wang and Xuehai Zhou
  24. Performance evaluation of a CPU-GPU coprocessing-based simulation software on converged computing architectures
    Romain Gallé, Jonathan Rouzaud-Cornabas and Thierry Gautier
  25. AtSpMV: Model-Guided Adaptive Tiling and Load Balancing for SpMV on GPUs
    Jiajun Cheng, Junshi Chen, Qi Li, Longsheng Song, Yang Zhao, Jun Shi, Xiaoyu Hao and Hong An
  26. Communication Offloading on SmartNIC DPUs: A Quantitative Approach
    Jacob Wahlgren, Andong Hu, Roger Pearce, Maya Gokhale and Ivy Peng
  27. HGNNMap: Heterogeneous Graph Neural Network-Based Mapping for Spatial Accelerators
    Shengzhong Tang, Zhihua Fan, Tianyu Liu, Xuejun An, Xiaochun Ye and Wenming Li
  28. MemBridge: Bridging the Static-Dynamic Semantic Gap in Memory Profiling via Variable-Centric Instrumentation
    Wentao Feng, Shaowen Li, Ziyi Song, Shizhe Shang, Kuiying Ban, Zhongyu Yu, Jiaxing Qi, Zhongzhi Luan, Hailong Yang and Depei Qian
  29. Dodoor: Efficient Randomized Decentralized Scheduling with Load Caching for Heterogeneous Tasks and Clusters
    Wei Da and Evangelia Kalyvianaki
  30. Minimizing Communication Costs in Inner Product Toom-Cook Algorithms
    Roy Nissim and Yuval Spiizer
  31. Characterizing GPU Warm-Up Beyond Data Transfers
    Julien Tixier, Dominique Houzet and Virginie Burnaz-Fresse
  32. Asynchronous Checkpoint for Eventually Consistent Databases
    Raaghav Ravishankar, Sandeep Kulkarni and Nitin H. Vaidya
  33. X-BQSR: Holistic acceleration of Base Quality Recalibration for Scalable Genomic Analysis
    Eugenio Marinelli, Ivan Donchev Kabadzhov and Raja Appuswamy
  34. Hierarchical Parallel Computing for Optimal Qubit Mapping in NISQ Systems
    Jean-Philippe Valois, Guillaume Helbecque and Nouredine Melab
  35. G-STAR: GPU-Accelerated Statistical Static Timing Analysis using Level-by-level Replication
    Boyang Zhang, Chih-Chun Chang, Yi-Hua Chung, Che Chang, Cheng-Hsiang Chiu, Aditya Das Sarma and Tsung-Wei Huang
  36. How much slack is in a multiprocessor schedule?
    Alexander Pullen, Maxwell Ferguson and Oliver Sinnen
  37. DACOS: Dependency-Aware Cross-Kernel Overlapping for Optimizing Short-Sequence Workloads in LLM Applications
    Zhaoyang Hao, Guangli Li, Fan Luo, Hao Qian, Xueying Wang, Jiacheng Zhao, Xiaobing Feng, Huimin Cui and Jingling Xue
  38. A Task Parallel Algorithm For Fast Hybridized PDE Solvers
    Joseph McLaughlin, Brittany Erickson and Jee Choi
  39. TBF: A Tunable Blocking-and-Fusion Algorithm for Efficient GPU Symmetric Rank-2K Updates
    Lijuan Hu, Xinzhe Chen, Haowei Li, Hongyaoxing Gu, Wenjing Ma, Fangfang Liu, Cui Wang and Yuwen Zhao
  40. GWBP: Accelerating Weighted Back-Projection for Image Reconstruction via Efficient GPU Parallel Optimization
    Hongbo Miao and Haodong Bian
  41. Repurposing the Cross-Segment Space on Sunway SW26010Pro for MC-Balanced Bigshare Execution
    Qixin Chang, Lifeng Yan, Hailong Liu, Weiguo Liu and Xiaohui Duan
  42. SparX: Cache-Aware Sparse Matrix Multiplication Kernels on AMX-based CPUs
    Ziqi Wang, Dongsheng Li and Huayou Su
  43. Understanding Power Limiting Mechanisms in Modern Processors: A Deep Dive into Intel RAPL and Turbo Boost Dynamics
    Romial Menra, Guillaume Rosinosky, Remous-Aris Koutsiamanis, Sébastien Bolle and Jean-Marc Menaud
  44. PeakLife: Proactive VM Management via Joint Forecasting
    Bowen Sun, Christos D. Antonopoulos, Evgenia Smirni, Bin Ren, Nikolaos Bellas and Spyros Lalis
  45. Taking the Leap: Efficient and Reliable Fine-Grained NUMA Migration in User-space
    Felix Schuhknecht and Nick Rassau
  46. NeuroRing: Scaling Spiking Neural Networks via Multi-FPGA Bidirectional Ring Topologies and Stream-Dataflow Architectures
    Muhammad Ihsan Al Hafiz and Artur Podobas
  47. Abstraction at What Cost? Evaluating Python DSLs for Transformer GPU Kernel Primitives on Nvidia Blackwell
    Tanmay Nandanikar and Bartosz Sawicki
  48. Engineering Scalable Distributed List Ranking
    Peter Sanders, Matthias Schimek, Tim Niklas Uhl and Thomas Weidmann
  49. Sufficiency in Data Centers: Energy Aware Resource Recommendation System
    Eyvaz Ahmadzada, Patricia Stolf, Jean-Marc Pierson and Laurent Lefevre
  50. Lyapunov-Guided KV Cache Control for Multi-Tenant Edge LLM Servicing
    Haishuo Yu, Winston K.G. Seah, Gang Xu and Xiaodong Xu
  51. CASTM: An API for Accelerating Zero-Knowledge Proof Kernels on CGRA Architectures
    Cristian Campos Ferrer, Angeles G. Navarro and Sonia Gonzalez-Navarro
  52. JAX vs Kokkos Performance Comparison: A Magnetohydrodynamic Solver Case Study
    Thierry Antoun, Rémi Bourgeois, Pascal Tremblin, Samuel Kokh and Jérôme Bobin
  53. MatrixFold: Unleashing Manycore CPUs with Outer-Product Units for Mixed-Precision AlphaFold Inference
    Shaokang Du, Hailong Yang, Tao Lu, Xin You, Baojian Zhou and Depei Qian
  54. A Novel Parallel Strategy for Monte Carlo Simulations in Heterogeneous Distributed Systems
    Fernanda G. O. Passos, Bernardo Lopo Silva, Diego Passos and Vinod E. F. Rebello
  55. SISA: A Scale-In Systolic Array for GEMM Acceleration
    Luigi Altamura, Alessio Cicero, Mateo Vázquez Maceiras, Mohammad Ali Maleki and Pedro Trancoso
  56. Accelerating Sharded Data Parallelism at Scale with Federated Learning
    Gianluca Mittone and Marco Aldinucci
  57. Fast Checkpointing in Disaggregated Persistent Memory
    Ivane Adam, Thomas Ropars and Noël De Palma
  58. QSplit: A Workflow-Oriented Hybrid Quantum-Classical Optimization Framework
    Mario Bifulco, Francesco Medina, Doriana Medić, Luca Roversi and Marco Aldinucci
  59. Throughput Optimization for Multi-level Speculative Decoding
    Anne Benoit, Loris Marchal and Adrien Obrecht
  60. SuperSFL: Resource-Heterogeneous Federated Split Learning with Weight-Sharing Supernet
    Abdullah Al Asif, Sixing Yu, Juan Pablo Muñoz, Arya Mazaheri and Ali Jannesari
  61. Closer in the Gap: Towards Portable Performance on RISC-V Vector Processors
    Ruimin Shi, Maya Gokhale, Pei-Hung Lin, Xavier Teruel and Ivy Peng
  62. SET: Stream-Event-Triggered Scheduling for Efficient CUDA Graph Pipelines
    Zhengxiong Li, Tsung-Wei Huang and Umit Ogras
  63. PTStore (Prefix Tensor Store): Distributed Prefix Caching and Replication for High Throughput Inference Serving
    Meghana Maghyastha, Robert Underwood, Randal Burns and Bogdan Nicolae
  64. Performance Portable BLAS3 Micro-kernel Generator
    Stepan Nassyr, Daniel Seibel, Prateek Chawla, Jayesh Badwaik, Andreas Herten and Dirk Pleiter
  65. CoDA: Constraint-Based Distance Adjustment Optimization for Distance-Based ISAs
    Shu Sugita, Masumi Aoki, Junichiro Kadomoto and Hidetsugu Irie
  66. Sparsh: Breaking the Communication Bottleneck in Sequence Parallel Video Diffusion Inference with Predictive Sparse Communication
    Huimin Liu, Haozhe Li, Zhenyi Zheng, Jiangsu Du and Nong Xiao
  67. Assessing the Performance Impact of Data Layouts: a Benchmarking Approach
    Jolly Chen, Ana Lucia Varbanescu and Axel Naumann
  68. Moirai: Dependency-Impact-Based Communication Scheduling for Multi-Job Distributed Deep Learning Cluster
    Jingbin Yang, Ting Liu, Jinglei Pei, Qinghua Wu and Hongtao Guan
  69. Realizable N:M Sparse Transformer Inference via Search–Kernel Co-Design
    Yiming Liu, Wenqi Lou, Zhiguang Wang, Zhiwei Ke, Fengrui Zuo, Chao Wang and Xuehai Zhou
  70. Carbon-Aware Mapping and Scheduling for Deadline-Constrained Workflows
    Dominik Schweisgut, Anne Benoit, Yves Robert and Henning Meyerhenke
  71. FlowGPU: Transparent and Efficient GPU Checkpointing and Restore
    Zehua Yang, Xiao Zheng, Yonghao Zou, Junyang Zhang, Zhisheng Ye, Feng Xie, Xiaolin Wang, Yingwei Luo, Zhenlin Wang and Diyu Zhou
  72. Performance Analysis of Hardware-Accelerated Compressed Memory Swap
    Eunyeong Sim and Woongki Baek
  73. Adaptive Data Augmentation with Bayesian Optimization for Basic Block Throughput Prediction
    Xiabing Hu, Xuezheng Xu, Deheng Yang, Bowen Liu, Chun Huang and Qiong Li
  74. Performance Characterization and Optimization of LLM Inference on Tenstorrent AI Accelerators
    Jangho Lim, Dongin Shin, Uichan Kim, Jinhyeok Choi, Kyung Min Kim, Sangwon Shin, Sangwoo Park, Gunjae Koo and Taeweon Suh
  75. When Faster Kernels Do Not Mean Faster Applications in Exascale GPU Systems
    Mariana T. Costa, Antigoni Georgiadou, James B. White III, Woong Shin, Bruno V. Alvarez, Jordà Polo, Karl Schulz, Philippe Navaux, Bronson Messer and Arthur Lorenzon
  76. A Compiler-Assisted Workflow for Efficiency-Guided Selective Tracing
    Sebastian Kreutzer, Valentin Seitz, Joan Vinyals, Tim Heldmann, Christian Iwainsky, Marta Garcia, Jesus Labarta and Christian Bischof
  77. Efficient Parallel Enumeration of Disjoint Minimal Failure-Inducing Subsets
    E. Tchaleu Ngankeu, Q. Delamea, J. Gurhem, W. Kirschenmann, F. Lemaitre and B. Lathuilière
  78. DAG-P: Efficient Fine-Grained Partitioning of Open-Source Transformer Models via Dependency-Aligned Planning
    Chenke Yi, Zhiquan Lai, Shengwei Li, Wei Wang, Yu Tang, Weijie Liu and Dongsheng Li
  79. Layer-wise CPU-GPU Scheduling for LLM Inference on Memory-Limited Consumer GPUs
    Naoto Sugiura, Yuta Tokusashi and Hiroki Matsutani
  80. Optimizing SpMV Kernel for Banded Matrices on FPGAs Using High-Level Synthesis
    Federico Favaro, Ernesto Dufrechou, Juan P. Oliver and Pablo Ezzatti
  81. How efficient are the efficient cores? — An experimental evaluation of energy efficiency in asymmetric multicore processors
    Hana Shatri Ahmeti, Matthias Korch, Tim Werner and Thomas Rauber
  82. Privacy-Preserving Data Center Demand Response using Multi-Party Computation
    Seyda Nur Guzelhan, Fatih Acun, Can Hankendi, Ayse K. Coskun and Ajay Joshi
  83. S-CQR: Stratified Calibration for Runtime Prediction in HPC Backfill Scheduling
    Jiheon Choi and Sangyoon Oh
  84. Accelerating Multi-Agent Reinforcement Learning on Heterogeneous Platforms
    Samuel Wiggins, Grace Zgheib, Mahesh A. Iyer and Viktor Prasanna
  85. Machine Learning-Enhanced Resource Optimization for Bioinformatics Workflows in the Cloud
    Robert Nica, Fabian Jetzinger, Stefan Götz and Germán Moltó
  86. OmniZK: A Versatile Accelerator Architecture for Zero-Knowledge Proofs
    Zhengbang Yang, Lutan Zhao, Han Liu, Kai Li and Rui Hou
  87. CCGS: A Cross-Modal Collaborative Gradient Sparsification for Accelerating Distributed Multimodal Model Training
    Shenghui Lu, Waixi Liu, Jinhuang Huang, Jiantao Fu and Qingchun Chen