声音 · 音乐 · 计算 — 巴塞罗那  Yuhang Wu

吴昱杭 (Johann)

我对音乐科技感兴趣。庞培法布拉大学 Sound & Music Computing 硕士在读;BMAT Music Innovation 研发实习生。

论文发表于 ISMIR 2024 · ACL 2024 · IEEE ICETCI 2024

01

关于我

我来自海南海口,现居巴塞罗那。本科在北邮期间从计算机视觉起步 —— 做遥感影像的深度学习语义分割 —— 后来一步步走向我现在最关心的问题:机器能真正理解音乐吗?

在 M.A.P,我带领 ChatMusician(ACL 2024)的 benchmark 团队,整理了 1000+ 道乐理问答(后被收入 MMLU 多模态子集),并合著了一篇 ISMIR 2024 论文,评测大语言模型的音乐理解与生成能力。

目前我在 BMAT 做研发实习,积极探索学术与工业的交叉点。

02

论文发表

IEEE ICETCI 2024 · 长春

Research on Fire Detection Based on the YOLOv9 Algorithm

L. Song, Y. Wu, W. Zhang

03

经历

2026.03 — 至今 · 巴塞罗那

BMAT Music Innovation — 研发实习生

研发实习中,积极探索学术与工业的交叉点。

2024.08 — 2025.07 · 北京

中国科学院自动化研究所 — 科研助理 · 音频水印

面向 TTS / 音乐生成系统的水印研究:调研现有水印系统的不足并在组内分享,复现经典基线、构建完整工作流。

2023.08 — 2024.05 · 线上(香港)

Multimodal Art Projection (M.A.P) — Benchmark 组长 → LLM 音乐评测组员

主导构建 MusicTheoryBenchmark —— 1000+ 道按严格学术标准整理的乐理问答,后被收入 MMLU 多模态子集;随后在约 3000 条样本上评测 GPT-4、Llama、Qwen、Gemma 的音乐理解与生成能力,贡献了 ISMIR 2024 论文 80% 以上的客观实验数据。

2023.11 — 2024.03 · 北京

北京邮电大学 — 科研助理 · 视唱自动评分

基于深度学习的视唱自动评分算法;开发数据合成方法生成无限训练样本,降低对固定数据集的依赖。

2023.03 — 2023.08 · 北京

中国科学院空天信息创新研究院 — 科研助理 · 计算机视觉

遥感影像语义分割:复现经典论文中的前沿方法,调整网络结构以适配遥感任务,并在 10+ 个开源与私有数据集上验证。

04

教育与技能

2025 — 2027(预计) · 巴塞罗那

庞培法布拉大学 (UPF)

Sound and Music Computing 硕士 —— 音乐信息检索、面向音乐的机器学习、生成算法、计算音乐学。

2021 — 2025 · 北京

伦敦玛丽女王大学 & 北京邮电大学

物联网工程学士(联合培养)—— 一等荣誉学位,GPA 90/100,专业排名前 8%(15/186)。

编程

PythonC / C++ JavaSQL LaTeX

机器学习与 AI

PyTorchOpenMMLab LLM / 提示工程计算机视觉 语义分割

音频与音乐

MIR信号处理 Pure DataSonic Visualiser MuseScore

工具

GitDocker LinuxJupyter
05

写作

视觉的由来 | Receptive Fields, Binocular Interaction and Functional Architecture in the Cat's Visual Cortex Transformer | Attention Is All You Need
全部文章 →