← 返回论文检索
ACM Multimedia 2025Demos and Videos

KDTalker++: Controllable Talking Portrait Generation with Audio, Text, and Expression Editing

Chaolong Yang, Yinuo Guo, Kai Yao, Yuyao Yan, Jie Sun 0024, Kaizhu Huang

PDF 由论文原始站点提供,PaperCompass 不保存论文文件。DOI 10.1145/3746027.3754462 ↗

摘要

This work presents KDTalker++, a real-time system for generating talking portrait videos from a single image using audio or text input. Built on a keypoint-based spatiotemporal diffusion model, it adds voice cloning, background editing, and fine-grained expression control. The demo is available at https://kdtalker.com. A live presentation video is available at https://drive.google.com/file/d/1N4Ggu0Y32DTsV3mbKhXS4kGY6l2ZYKSp/view.