


default search action
FORGE@ICSE 2026: Rio de Janeiro, Brazil
- Proceedings of the 2026 IEEE/ACM Third International Conference on AI Foundation Models and Software Engineering, FORGE 2026, Rio de Janeiro, Brazil, April 12-13, 2026. ACM 2026, ISBN 979-8-4007-2477-0

Research Track
- Gabriel Vitor Klaumann Gubert, Stefan Kugele, Munir Georges:

A Hybrid LLM-Guided Approach to Code Migration Using API-Derived Rules. 1-5 - Zhili Zeng, Kimya Khakzad Shahandashti, Alvine Boaye Belle, Song Wang, Zhen Ming (Jack) Jiang:

An Experience Report on LLM-Based Agentic Translation from Android to iOS: Pitfalls and Insights. 6-16 - Laboni Sarker, Mara Downing, Achintya Desai, Tevfik Bultan:

Assessing, Exploiting, and Mitigating Syntactic Robustness Failures in LLM-Based Code Generation. 17-28 - Ragib Shahariar Ayon, Shibbir Ahmed:

AutoReSpec: A Framework for Generating Specification using Large Language Models. 29-39 - Pankaj Manoharlal Thakur, Kyle Thomson, Wesley Klewerton Guez Assunção, Bowen Xu:

Backporting in Robot Operating System: Identifying Commit Purpose and Propagation Need with Large Language Models. 40-50 - Markus Borg, Nadim Hagatulah, Adam Tornhill, Emma Söderberg:

Code for Machines, Not Just Humans: Quantifying AI-Friendliness with Code Health Metrics. 51-61 - Sai Sanjna Chintakunta, Nathalia Nascimento, Everton Guimarães:

CodeViz: Collaborative Multi-Agent System for Analytical and Visualization Tasks in Data Science. 62-66 - Mert Tiftikci, Amir Molzam Sharifloo, Mira Mezini:

Deep Graph-Language Fusion for Structure-Aware Code Generation. 67-71 - Dipin Khati, Daniel Rodríguez-Cárdenas, Paul Pantzer, Denys Poshyvanyk:

Detecting and Correcting Hallucinations in LLM-Generated Code via Deterministic AST Analysis. 72-76 - Houcine Abdelkader Cherief, Florent Avellaneda, Naouel Moha:

DynamicsLLM: a Dynamic Analysis-based Tool for Generating Intelligent Execution Traces Using LLMs to Detect Android Behavioural Code Smells. 77-87 - Saurabh Bodhe, Sanjukta De, Subhayan Roy, Jaydip Pokiya, Indira Vats, Sehajpreet Kaur, Xuemeng Li, Lejin Varghese, Yonas Bedasso, Max Kiehn:

Execution-free Agentic Program Repair for Enterprise-Scale Development. 88-98 - Pablo Valle, Shaukat Ali, Aitor Arrieta:

Exploring the Potential of Large Language Models in Simulink-Stateflow Mutant Generation. 99-109 - Chengyan Ma, Jieke Shi, Ruidong Han, Ye Liu, Yuqing Niu, David Lo:

Finding Missing Input Validation in TEEs via LLM-Assisted Symbolic Execution. 110-115 - Alessandro Midolo, Emiliano Tramontana, Massimiliano Di Penta:

From Human to Machine Refactoring: Assessing GPT-4's Impact on Python Class Quality and Readability. 116-127 - Rafael Tomaz, Paloma Guenes, Allysson Allex Araújo, Maria Teresa Baldassarre, Marcos Kalinowski:

Impacts of Generative AI on Agile Teams' Productivity: A Multi-Case Longitudinal Study. 128-138 - Songrui Li, Hanmo You, Jiajun Jiang:

Jailbreaking Large Language Models via Multi-Task Embedding-based Prompt. 139-143 - Eduard Andrei Cristea, Petter Molnes, Jingyue Li:

MalCVE: Malware Detection and CVE Association Using Large Language Models. 144-154 - Ye Liu, Ruidong Han, Chengyan Ma, Yuqing Niu, David Lo:

PatchGPT: Multi-Agent Patch Backporting without Model Fine-Tuning. 155-159 - Kerui Huang, Xian Zhan, Xin Xia:

PIChecker: Automatic Privacy Detector for Third Party Libraries in Android Apps. 160-171 - Evelien Riddell, James Riddell, Gengyi Sun, Michal Antkiewicz, Krzysztof Czarnecki:

Stalled, Biased, and Confused: Uncovering Reasoning Failures in LLMs for Cloud-Based Root Cause Analysis. 172-183 - Alexander Korn, Lea Zaruchas, Chetan Arora, Andreas Metzger, Sven Smolka, Fanyu Wang, Andreas Vogelsang:

Reporting LLM Prompting in Automated Software Engineering: A Guideline Based on Current Practices and Expectations. 184-194 - Luis Filipe Fernandes Gomes, Xin Zhou, David Lo, Rui Abreu:

Visual Loop: Bridging the Cognitive Gap in Software Development Through Visual-AI Collaboration. 195-200 - Saumendu Roy, Banani Roy, Chanchal Roy, Richard Bassey:

XMENTOR: A Rank-Aware Aggregation Approach for Human-Centered Explainable AI in Just-in-Time Software Defect Prediction. 201-212
Data and Benchmarking Track
- James Meaden, Markus Borg:

COMPASS: A Psychometrics-Guided Multi-Dimensional Benchmark for Code Generation Evaluation. 213-217 - Matheus Barbosa, Pedro Baptista, João Eduardo Montandon:

MiG.4: A Curated Dataset of Library Migrations in Java and Python. 218-222 - Sebastian Siedler, Karim Elish:

MIRROR: A Dataset of Structural Metrics for Repackaged Android Apps. 223-227 - Jiaxuan Liang, Shide Zhou, Kailong Wang:

OmniBench-RAG: A Multi-Domain Evaluation Platform for Retrieval-Augmented Generation Tools. 228-232 - Rafael Araujo Magesty, João Eduardo A Montandon:

PromiseAwait: A Dataset of JavaScript Migrations from Promises to Async/Await. 233-237 - Alexandra González, Xavier Franch, Silverio Martínez-Fernández:

SEMODS: A Validated Dataset of Open-Source Software Engineering Models. 238-242 - Daniel Rodríguez-Cárdenas, Xiaochang Li, Marcos Macedo, Antonio Mastropaolo, Dipin Khati, Yuan Tian, Huajie Shao, Denys Poshyvanyk:

Towards Comprehensive Benchmarking Infrastructure for LLMs In Software Engineering. 243-248 - Cole Granger, Dipin Khati, Daniel Rodríguez-Cárdenas, Denys Poshyvanyk:

Tricky²: Towards a Benchmark for Evaluating Human and LLM Error Interactions. 249-253 - Patrik Drazic, Benaoumeur Senouci, Boualem Benatallah:

VHDL-Instruct: Training Open Dataset for LLMs Benchmarking and HDL Code Generation. 254-258

manage site settings
To protect your privacy, all features that rely on external API calls from your browser are turned off by default. You need to opt-in for them to become active. All settings here will be stored as cookies with your web browser. For more information see our F.A.Q.


Google
Google Scholar
Semantic Scholar
Internet Archive Scholar
CiteSeerX
ORCID













