2026-09-04

AI Research Brief · 2026-09-04

本周共选 6 项:音乐/音频 3 项,通用 AI 3 项。音频侧仍没有足够强的新长时音乐生成或音乐 DiT 架构,但 conditioning 数据、可控风格生成与层级建模出现了值得借鉴的结果;通用 AI 侧则有两项能直接迁移到你的 flow/DiT 与长序列研究。

Track A:音乐与音频生成

1. SonicCaps: Large-Scale Diverse and Fine-Grained Captioning for Improved Audio-Retrieval

2. Scalable Direction-Following TTS via Voice Impression-Guided Pseudo Triplet Construction

3. Understanding Automatic Mixing: A Subtask-Oriented Analysis of Two-Stage Mixing System

Track B:LLM / Deep Learning / 通用 AI

4. CAT-Flow: Curvature-Adaptive sTeps for Flow Matching

5. CRISP: Cliff-awaRe Input-adaptive Sparse Prefilling with Structural-Mass-Motivated Routing

6. Scalable Kronecker-Fisher Approximation: Efficient Hessian Analysis for Billion-Parameter Language Models Compression

本周最值得读

  1. CAT-Flow:可直接在现有 flow/DiT sampler 上做小规模对照,潜在收益明确。
  2. CRISP:对长序列计算最有架构启发,尤其是 input/head-adaptive sparse pattern。
  3. SonicCaps:对音乐生成 conditioning 的数据设计价值,可能高于继续扩大 text encoder。

本周没有真正值得精读的新长时音乐生成、vocal music generation、neural audio codec 或音乐 DiT 论文;因此没有用弱项填充这些类别。