Publications

Full list, newest first. † denotes equal contribution.

2026
  1. Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models

    Chun-Yi Kuan, Siwon Kim, Byeonggeun Kim, Suyoun Kim, Bo-Ru Lu, Qingming Tang, Ankur Gandhe, Hung-yi Lee, Chieh-Chi Kao, Chao Wang

    Interspeech 2026

    TL;DRUses fine-grained feedback from audio-aware LLMs to make text-to-audio models follow instructions more faithfully.

  2. AQUA-Bench: Beyond Finding Answers to Knowing When There Are None in Audio Question Answering

    Chun-Yi Kuan, Hung-yi Lee

    ICASSP 2026

    TL;DRA benchmark that tests whether audio QA models know when a question has no answer, not just when they can find one.

  3. Game-Time: Evaluating Temporal Dynamics in Spoken Language Models

    Kai-Wei Chang†, En-Pei Hu†, Chun-Yi Kuan, Wenze Ren, Wei-Chih Chen, Guan-Ting Lin, Yu Tsao, Shao-Hua Sun, Hung-yi Lee, James Glass

    ICASSP 2026

    TL;DRBenchmarks whether spoken language models can handle timing, tempo, and synchronized speech in real-time conversation.

  4. AQAScore: Evaluating Semantic Alignment in Text-to-Audio Generation via Audio Question Answering

    Chun-Yi Kuan, Kai-Wei Chang, Hung-yi Lee

    arXiv preprint · 2026

    TL;DRScores text-to-audio alignment from an audio-aware LLM's confidence in answering 'Yes' to targeted questions, catching fine-grained mismatches that similarity metrics like CLAPScore miss.

  5. Walking Through Uncertainty: An Empirical Study of Uncertainty Estimation for Audio-Aware Large Language Models

    Chun-Yi Kuan, Wei-Ping Huang, Hung-yi Lee

    arXiv preprint · 2026

    TL;DRThe systematic study of uncertainty estimation for audio-aware LLMs, finding that semantic and verification-based methods win on general reasoning but their advantage breaks down on hallucination and unanswerable-question benchmarks.

2025
  1. From Alignment to Advancement: Bootstrapping Audio-Language Alignment with Synthetic Data

    Chun-Yi Kuan, Hung-yi Lee

    IEEE TASLP · 2025

    TL;DRBootstraps audio–language alignment with synthetic data to push audio-aware LLMs from basic alignment toward stronger reasoning.

  2. Teaching Audio-Aware Large Language Models What Does Not Hear: Mitigating Hallucinations through Synthesized Negative Samples

    Chun-Yi Kuan, Hung-yi Lee

    Interspeech 2025

    TL;DRCurbs hallucinations in audio-aware LLMs by teaching them what is NOT in the audio using synthesized negative samples.

  3. Gender Bias in Instruction-Guided Speech Synthesis Models

    Chun-Yi Kuan, Hung-yi Lee

    NAACL 2025

    TL;DRAudits and quantifies gender bias in instruction-guided speech synthesis models.

  4. Can Large Audio-Language Models Truly Hear? Tackling Hallucinations with Multi-Task Assessment and Stepwise Audio Reasoning

    Chun-Yi Kuan, Hung-yi Lee

    ICASSP 2025

    TL;DRProbes whether audio-LLMs truly 'hear' via multi-task assessment and stepwise audio reasoning to reduce hallucinations.

  5. Dynamic-SUPERB Phase-2: A Collaboratively Expanding Benchmark for Measuring the Capabilities of Spoken Language Models with 180 Tasks

    Chien-yu Huang, Wei-Chih Chen, Shu-wen Yang, Andy T. Liu, Chen-An Li, Yu-Xiang Lin, Wei-Cheng Tseng, Anuj Diwan, Yi-Jen Shih, Jiatong Shi, Chun-Yi Kuan, et al.

    ICLR 2025

    TL;DRThe largest collaboratively-built benchmark for instruction-following speech models—180 community-contributed tasks across speech, music, and audio, expanding beyond classification to generation and regression.

  6. Speech-IFEval: Evaluating Instruction-Following and Quantifying Catastrophic Forgetting in Speech-Aware Language Models

    Ke-Han Lu, Chun-Yi Kuan, Hung-yi Lee

    Interspeech 2025

    TL;DREvaluates whether speech-aware language models can follow textual instructions without forgetting core language abilities.

2024
  1. Speech-Copilot: Leveraging Large Language Models for Speech Processing via Task Decomposition, Modularization, and Program Generation

    Chun-Yi Kuan†, Chih-Kai Yang†, Wei-Ping Huang, Ke-Han Lu, Hung-yi Lee

    SLT 2024

    TL;DRSpeech-Copilot lets an LLM solve speech tasks by decomposing them into modular, callable programs.

  2. Understanding Sounds, Missing the Questions: The Challenge of Object Hallucination in Large Audio-Language Models

    Chun-Yi Kuan, Wei-Ping Huang, Hung-yi Lee

    Interspeech 2024

    TL;DRShows large audio-language models often hallucinate objects/sounds, and frames the object-hallucination problem.

  3. Dynamic-SUPERB: Towards a Dynamic, Collaborative, and Comprehensive Instruction-Tuning Benchmark for Speech

    Chien-yu Huang, Ke-Han Lu, Shih-Heng Wang, Chi-Yuan Hsiao†, Chun-Yi Kuan†, Haibin Wu†, Siddhant Arora, Kai-Wei Chang, Jiatong Shi, Yifan Peng, Roshan Sharma, Shinji Watanabe, Bhiksha Ramakrishnan, Shady Shehata, Hung-yi Lee

    ICASSP 2024

    TL;DRIntroduces a collaborative benchmark for testing whether speech models can follow instructions across diverse speech tasks.

  4. Large Language Model as an Assignment Evaluator: Insights, Feedback, and Challenges in a 1000+ Student Course

    Cheng-Han Chiang, Wei-Chih Chen†, Chun-Yi Kuan†, Chienchou Yang, Hung-yi Lee

    EMNLP 2024

    TL;DRStudies how GPT-4 works as an assignment evaluator in a 1000+ student classroom, revealing both usefulness and risks.

  5. Listen and Speak Fairly: A Study on Semantic Gender Bias in Speech Integrated Large Language Models

    Yi-Cheng Lin, Tzu-Quan Lin, Chih-Kai Yang, Ke-Han Lu, Wei-Chih Chen, Chun-Yi Kuan, Hung-yi Lee

    SLT 2024

    TL;DRIntroduces spoken bias evaluation tasks to measure semantic gender bias in speech-integrated large language models.

  6. Investigating Zero-Shot Generalizability on Mandarin-English Code-Switched ASR and Speech-to-Text Translation of Recent Foundation Models with Self-Supervision and Weak Supervision

    Chih-Kai Yang, Kuan-Po Huang, Ke-Han Lu, Chun-Yi Kuan, Chi-Yuan Hsiao, Hung-yi Lee

    ICASSP Workshops 2024

    TL;DRTests how well recent foundation models generalize zero-shot to Mandarin-English code-switched ASR and speech translation.

  7. Building a Taiwanese Mandarin Spoken Language Model: A First Attempt

    Chih-Kai Yang, Yu-Kuan Fu, Chen-An Li, Yi-Cheng Lin, Yu-Xiang Lin, Wei-Chih Chen, Ho-Lam Chung, Chun-Yi Kuan, Wei-Ping Huang, Ke-Han Lu, et al.

    arXiv preprint · 2024

    TL;DRPresents an initial attempt to build a real-time Taiwanese Mandarin spoken language model for multi-turn speech interaction.

2023
  1. Towards General-Purpose Text-Instruction-Guided Voice Conversion

    Chun-Yi Kuan, Chen-An Li, Tsu-Yuan Hsu, Tse-Yang Lin, Ho-Lam Chung, Kai-Wei Chang, Shuo-Yiin Chang, Hung-yi Lee

    ASRU 2023

    TL;DRA first step toward general-purpose voice conversion controlled by free-form text instructions.