Euro-Par 2026 Accepted Papers
Euro-Par 2026 website:
https://2026.euro-par.org/
Titles and author lists reflect the final camera-ready versions included in the proceedings.
- Static Scheduling of DAG Workflows on Homogeneous Parallel Platforms Using Longest Betweenness Centrality
Niek Damink, Alberto Garcia-Robledo and Mahboobeh Zangiabady
- An Event-based Causality Model for Mobile Multiagent Systems
Ajay D. Kshemkalyani and Anshuman Misra
- Hierarchical Recursive Precision for Accelerating Symmetric Linear Solves on MXUs
Vicki Carrica, Rabab Alomairy, Evelyne Ringoot and Alan Edelman
- Thunder: Efficient Multi-Node FHE Acceleration Framework via In-Transit Computation
Kai Li, Lutan Zhao, Qingyun Niu, Yinhang Zheng, Zhengbang Yang, Boyan Zhao, Lu Gao and Rui Hou
- Characterizing Needleman-Wunsch Sequence Alignment on the Graphcore IPU: Memory Trade-offs and Optimization Strategies
S.-Kazem Shekofteh, Nils Kochendörfer and Holger Fröning
- Constella: A Novel Framework for Cost-Efficient Distributed AI Inference in LEO Space Data Centers
Andrija Stanisic, Milos Gravara, Juan Luis Herrera and Stefan Nastic
- Adaptive Fault Tolerance in Time-Sensitive Networking
Wei Quan, Qian Yang, Wenliang Ma, Gang Sun, Hui Yang, Tao Li and Zhigang Sun
- Constraint Driven Global Data Layout Optimization for Tensor Expressions
Yi Miao and Stephen Jarvis
- TAIN: Scalable Tensor-Aware Acceleration for Quantum Chemistry on Heterogeneous Architectures
Wenhao Liang, Lianhua He, Runfeng Jin, Yingqi Tian, Yidong Chen, Yingjin Ma and Zhong Jin
- ApproxRAG: A Systematic Framework for Mitigating I/O Overheads in Retrieval-Augmented Generation
Danying Ge, Qizhi Jiang, Jianhua Gao, Jianjun Shi and Weixing Ji
- Evaluating the Parallelization Capabilities of State-of-the-art Agentic Large Language Models
Peter Thoman and Philipp Gschwandtner
- MoProteus: LLM-Driven Multi-Version Operator Generation for Energy-Aware Scheduling in Heterogeneous Cloud-Edge Environments
Yiwen Liu, Haotian Wang, Junshuang Ma, Zicong Wang, Wangdong Yang and Kenli Li
- Efficient Parallel Algorithms for Hypergraph Matching
Henrik Reinstädtler, Christian Schulz, Nodari Sitchinava and Fabian Walliser
- Velvet: Parallel Divide-and-Conquer in Safe Rust
Badia Liokouras, Ben van Werkhoven and Rob V. van Nieuwpoort
- Harmonia: QoS-Aware and High-Throughput Generative Inference with a Single GPU
Sowoong Kim, Youngsam Shin, Yeongon Cho and Woongki Baek
- Coordinated Resource Management for Energy-Efficient DNN Inference on Heterogeneous Edge Devices
Yuening Wang, Juan Fang, Ran Zhai, Qi Ming, Nan He and Anca Jurcut
- Backend Code Generation for Graph DSLs Targeting Diverse Accelerator Platforms
Ashwina Kumar, M. Venkata Krishna, Prasanna Bartakke, Mathew Thomas, Rahul Kumar, Rajesh Pandian M, Nibedita Behera and Rupesh Nasre
- MARS: Multi-model Aware Real-time Scheduler for NPU-coordinated DLI Tasks
Qing Li, Zhan Zhang, Yuzhou Huo, Decheng Zuo and Yanjun Shu
- Frenzy: A Memory-Aware Serverless LLM Training System for Heterogeneous GPU Clusters
Zihan Chang, Sheng Xiao, Shuibing He, Xuechen Zhang, Siling Yang, Zhenxin Li, Zhe Pan and Weijian Chen
- SMEAtten: Fast and Memory-Efficient Outer Product-based Attention on ARMv9 CPUs with SME
Tengyang Zheng, Han Huang, Junru Chen, Xianwei Zhang and Yutong Lu
- RWIP: Region-Level Write-Intensity Prediction for GPU L2 Cache based on Hybrid-Retention STT-MRAM
Yujie Pu, Chen Zhao, Jianfeng An, Wenzhe Zhao and Pengju Ren
- RAGNN: A Resource-Aware System for Graph Neural Network Training at Scale
Phivos Dadamis, Dimitrios Tomaras, Vana Kalogeraki and Dimitrios Gunopulos
- Two-Stage Hierarchy-Aware Learning with Gradient Conflict Mitigation for HLS Latency and Resource Prediction
Zhiwei Ke, Yiming Liu, Fengrui Zuo, Wenqi Lou, Chao Wang and Xuehai Zhou
- Performance evaluation of a CPU-GPU coprocessing-based simulation software on converged computing architectures
Romain Gallé, Jonathan Rouzaud-Cornabas and Thierry Gautier
- AtSpMV: Model-Guided Adaptive Tiling and Load Balancing for SpMV on GPUs
Jiajun Cheng, Junshi Chen, Qi Li, Longsheng Song, Yang Zhao, Jun Shi, Xiaoyu Hao and Hong An
- Communication Offloading on SmartNIC DPUs: A Quantitative Approach
Jacob Wahlgren, Andong Hu, Roger Pearce, Maya Gokhale and Ivy Peng
- HGNNMap: Heterogeneous Graph Neural Network-Based Mapping for Spatial Accelerators
Shengzhong Tang, Zhihua Fan, Tianyu Liu, Xuejun An, Xiaochun Ye and Wenming Li
- MemBridge: Bridging the Static-Dynamic Semantic Gap in Memory Profiling via Variable-Centric Instrumentation
Wentao Feng, Shaowen Li, Ziyi Song, Shizhe Shang, Kuiying Ban, Zhongyu Yu, Jiaxing Qi, Zhongzhi Luan, Hailong Yang and Depei Qian
- Dodoor: Efficient Randomized Decentralized Scheduling with Load Caching for Heterogeneous Tasks and Clusters
Wei Da and Evangelia Kalyvianaki
- Minimizing Communication Costs in Inner Product Toom-Cook Algorithms
Roy Nissim and Yuval Spiizer
- Characterizing GPU Warm-Up Beyond Data Transfers
Julien Tixier, Dominique Houzet and Virginie Burnaz-Fresse
- Asynchronous Checkpoint for Eventually Consistent Databases
Raaghav Ravishankar, Sandeep Kulkarni and Nitin H. Vaidya
- X-BQSR: Holistic acceleration of Base Quality Recalibration for Scalable Genomic Analysis
Eugenio Marinelli, Ivan Donchev Kabadzhov and Raja Appuswamy
- Hierarchical Parallel Computing for Optimal Qubit Mapping in NISQ Systems
Jean-Philippe Valois, Guillaume Helbecque and Nouredine Melab
- G-STAR: GPU-Accelerated Statistical Static Timing Analysis using Level-by-level Replication
Boyang Zhang, Chih-Chun Chang, Yi-Hua Chung, Che Chang, Cheng-Hsiang Chiu, Aditya Das Sarma and Tsung-Wei Huang
- How much slack is in a multiprocessor schedule?
Alexander Pullen, Maxwell Ferguson and Oliver Sinnen
- DACOS: Dependency-Aware Cross-Kernel Overlapping for Optimizing Short-Sequence Workloads in LLM Applications
Zhaoyang Hao, Guangli Li, Fan Luo, Hao Qian, Xueying Wang, Jiacheng Zhao, Xiaobing Feng, Huimin Cui and Jingling Xue
- A Task Parallel Algorithm For Fast Hybridized PDE Solvers
Joseph McLaughlin, Brittany Erickson and Jee Choi
- TBF: A Tunable Blocking-and-Fusion Algorithm for Efficient GPU Symmetric Rank-2K Updates
Lijuan Hu, Xinzhe Chen, Haowei Li, Hongyaoxing Gu, Wenjing Ma, Fangfang Liu, Cui Wang and Yuwen Zhao
- GWBP: Accelerating Weighted Back-Projection for Image Reconstruction via Efficient GPU Parallel Optimization
Hongbo Miao and Haodong Bian
- Repurposing the Cross-Segment Space on Sunway SW26010Pro for MC-Balanced Bigshare Execution
Qixin Chang, Lifeng Yan, Hailong Liu, Weiguo Liu and Xiaohui Duan
- SparX: Cache-Aware Sparse Matrix Multiplication Kernels on AMX-based CPUs
Ziqi Wang, Dongsheng Li and Huayou Su
- Understanding Power Limiting Mechanisms in Modern Processors: A Deep Dive into Intel RAPL and Turbo Boost Dynamics
Romial Menra, Guillaume Rosinosky, Remous-Aris Koutsiamanis, Sébastien Bolle and Jean-Marc Menaud
- PeakLife: Proactive VM Management via Joint Forecasting
Bowen Sun, Christos D. Antonopoulos, Evgenia Smirni, Bin Ren, Nikolaos Bellas and Spyros Lalis
- Taking the Leap: Efficient and Reliable Fine-Grained NUMA Migration in User-space
Felix Schuhknecht and Nick Rassau
- NeuroRing: Scaling Spiking Neural Networks via Multi-FPGA Bidirectional Ring Topologies and Stream-Dataflow Architectures
Muhammad Ihsan Al Hafiz and Artur Podobas
- Abstraction at What Cost? Evaluating Python DSLs for Transformer GPU Kernel Primitives on Nvidia Blackwell
Tanmay Nandanikar and Bartosz Sawicki
- Engineering Scalable Distributed List Ranking
Peter Sanders, Matthias Schimek, Tim Niklas Uhl and Thomas Weidmann
- Sufficiency in Data Centers: Energy Aware Resource Recommendation System
Eyvaz Ahmadzada, Patricia Stolf, Jean-Marc Pierson and Laurent Lefevre
- Lyapunov-Guided KV Cache Control for Multi-Tenant Edge LLM Servicing
Haishuo Yu, Winston K.G. Seah, Gang Xu and Xiaodong Xu
- CASTM: An API for Accelerating Zero-Knowledge Proof Kernels on CGRA Architectures
Cristian Campos Ferrer, Angeles G. Navarro and Sonia Gonzalez-Navarro
- JAX vs Kokkos Performance Comparison: A Magnetohydrodynamic Solver Case Study
Thierry Antoun, Rémi Bourgeois, Pascal Tremblin, Samuel Kokh and Jérôme Bobin
- MatrixFold: Unleashing Manycore CPUs with Outer-Product Units for Mixed-Precision AlphaFold Inference
Shaokang Du, Hailong Yang, Tao Lu, Xin You, Baojian Zhou and Depei Qian
- A Novel Parallel Strategy for Monte Carlo Simulations in Heterogeneous Distributed Systems
Fernanda G. O. Passos, Bernardo Lopo Silva, Diego Passos and Vinod E. F. Rebello
- SISA: A Scale-In Systolic Array for GEMM Acceleration
Luigi Altamura, Alessio Cicero, Mateo Vázquez Maceiras, Mohammad Ali Maleki and Pedro Trancoso
- Accelerating Sharded Data Parallelism at Scale with Federated Learning
Gianluca Mittone and Marco Aldinucci
- Fast Checkpointing in Disaggregated Persistent Memory
Ivane Adam, Thomas Ropars and Noël De Palma
- QSplit: A Workflow-Oriented Hybrid Quantum-Classical Optimization Framework
Mario Bifulco, Francesco Medina, Doriana Medić, Luca Roversi and Marco Aldinucci
- Throughput Optimization for Multi-level Speculative Decoding
Anne Benoit, Loris Marchal and Adrien Obrecht
- SuperSFL: Resource-Heterogeneous Federated Split Learning with Weight-Sharing Supernet
Abdullah Al Asif, Sixing Yu, Juan Pablo Muñoz, Arya Mazaheri and Ali Jannesari
- Closer in the Gap: Towards Portable Performance on RISC-V Vector Processors
Ruimin Shi, Maya Gokhale, Pei-Hung Lin, Xavier Teruel and Ivy Peng
- SET: Stream-Event-Triggered Scheduling for Efficient CUDA Graph Pipelines
Zhengxiong Li, Tsung-Wei Huang and Umit Ogras
- PTStore (Prefix Tensor Store): Distributed Prefix Caching and Replication for High Throughput Inference Serving
Meghana Maghyastha, Robert Underwood, Randal Burns and Bogdan Nicolae
- Performance Portable BLAS3 Micro-kernel Generator
Stepan Nassyr, Daniel Seibel, Prateek Chawla, Jayesh Badwaik, Andreas Herten and Dirk Pleiter
- CoDA: Constraint-Based Distance Adjustment Optimization for Distance-Based ISAs
Shu Sugita, Masumi Aoki, Junichiro Kadomoto and Hidetsugu Irie
- Sparsh: Breaking the Communication Bottleneck in Sequence Parallel Video Diffusion Inference with Predictive Sparse Communication
Huimin Liu, Haozhe Li, Zhenyi Zheng, Jiangsu Du and Nong Xiao
- Assessing the Performance Impact of Data Layouts: a Benchmarking Approach
Jolly Chen, Ana Lucia Varbanescu and Axel Naumann
- Moirai: Dependency-Impact-Based Communication Scheduling for Multi-Job Distributed Deep Learning Cluster
Jingbin Yang, Ting Liu, Jinglei Pei, Qinghua Wu and Hongtao Guan
- Realizable N:M Sparse Transformer Inference via Search–Kernel Co-Design
Yiming Liu, Wenqi Lou, Zhiguang Wang, Zhiwei Ke, Fengrui Zuo, Chao Wang and Xuehai Zhou
- Carbon-Aware Mapping and Scheduling for Deadline-Constrained Workflows
Dominik Schweisgut, Anne Benoit, Yves Robert and Henning Meyerhenke
- FlowGPU: Transparent and Efficient GPU Checkpointing and Restore
Zehua Yang, Xiao Zheng, Yonghao Zou, Junyang Zhang, Zhisheng Ye, Feng Xie, Xiaolin Wang, Yingwei Luo, Zhenlin Wang and Diyu Zhou
- Performance Analysis of Hardware-Accelerated Compressed Memory Swap
Eunyeong Sim and Woongki Baek
- Adaptive Data Augmentation with Bayesian Optimization for Basic Block Throughput Prediction
Xiabing Hu, Xuezheng Xu, Deheng Yang, Bowen Liu, Chun Huang and Qiong Li
- Performance Characterization and Optimization of LLM Inference on Tenstorrent AI Accelerators
Jangho Lim, Dongin Shin, Uichan Kim, Jinhyeok Choi, Kyung Min Kim, Sangwon Shin, Sangwoo Park, Gunjae Koo and Taeweon Suh
- When Faster Kernels Do Not Mean Faster Applications in Exascale GPU Systems
Mariana T. Costa, Antigoni Georgiadou, James B. White III, Woong Shin, Bruno V. Alvarez, Jordà Polo, Karl Schulz, Philippe Navaux, Bronson Messer and Arthur Lorenzon
- A Compiler-Assisted Workflow for Efficiency-Guided Selective Tracing
Sebastian Kreutzer, Valentin Seitz, Joan Vinyals, Tim Heldmann, Christian Iwainsky, Marta Garcia, Jesus Labarta and Christian Bischof
- Efficient Parallel Enumeration of Disjoint Minimal Failure-Inducing Subsets
E. Tchaleu Ngankeu, Q. Delamea, J. Gurhem, W. Kirschenmann, F. Lemaitre and B. Lathuilière
- DAG-P: Efficient Fine-Grained Partitioning of Open-Source Transformer Models via Dependency-Aligned Planning
Chenke Yi, Zhiquan Lai, Shengwei Li, Wei Wang, Yu Tang, Weijie Liu and Dongsheng Li
- Layer-wise CPU-GPU Scheduling for LLM Inference on Memory-Limited Consumer GPUs
Naoto Sugiura, Yuta Tokusashi and Hiroki Matsutani
- Optimizing SpMV Kernel for Banded Matrices on FPGAs Using High-Level Synthesis
Federico Favaro, Ernesto Dufrechou, Juan P. Oliver and Pablo Ezzatti
- How efficient are the efficient cores? — An experimental evaluation of energy efficiency in asymmetric multicore processors
Hana Shatri Ahmeti, Matthias Korch, Tim Werner and Thomas Rauber
- Privacy-Preserving Data Center Demand Response using Multi-Party Computation
Seyda Nur Guzelhan, Fatih Acun, Can Hankendi, Ayse K. Coskun and Ajay Joshi
- S-CQR: Stratified Calibration for Runtime Prediction in HPC Backfill Scheduling
Jiheon Choi and Sangyoon Oh
- Accelerating Multi-Agent Reinforcement Learning on Heterogeneous Platforms
Samuel Wiggins, Grace Zgheib, Mahesh A. Iyer and Viktor Prasanna
- Machine Learning-Enhanced Resource Optimization for Bioinformatics Workflows in the Cloud
Robert Nica, Fabian Jetzinger, Stefan Götz and Germán Moltó
- OmniZK: A Versatile Accelerator Architecture for Zero-Knowledge Proofs
Zhengbang Yang, Lutan Zhao, Han Liu, Kai Li and Rui Hou
- CCGS: A Cross-Modal Collaborative Gradient Sparsification for Accelerating Distributed Multimodal Model Training
Shenghui Lu, Waixi Liu, Jinhuang Huang, Jiantao Fu and Qingchun Chen