Using a frozen music foundation model and need to pick a layer? Each cell gives the three-layer band to probe first for that model and task family, from our full per-layer evaluations. The single best layer is task- and seed-sensitive; a top-3 band is the robust recommendation. Hover any cell for the per-task best layers.
| Model | Paradigm | Layers | Tonal | Rhythm | Timbre | Semantic | Similarity |
|---|---|---|---|---|---|---|---|
| MERT-v1-95M | Masked | 13 | L2 · L4 · L8best L4 · 33% depth | L6–8best L7 · 58% depth | L4 · L6 · L7best L4 · 33% depth | L5–7best L6 · 50% depth | L2–4best L2 · 17% depth |
| MERT-v1-330M | Masked | 25 | L4 · L6 · L8best L4 · 17% depth | L7–9best L9 · 38% depth | L7 · L8 · L12best L7 · 29% depth | L6 · L7 · L10best L10 · 42% depth | L5–7best L7 · 29% depth |
| MusicFM (MSD) | Masked | 13 | L3 · L4 · L6best L3 · 25% depth | L6 · L8 · L10best L10 · 83% depth | L2 · L3 · L5best L3 · 25% depth | L6–8best L7 · 58% depth | L1–3best L2 · 17% depth |
| MuQ (iter) | Masked | 13 | L1–3best L2 · 17% depth | L10–12best L12 · 100% depth | L2 · L5 · L6best L5 · 42% depth | L5 · L9 · L10best L10 · 83% depth | L0–2best L0 · 0% depth |
| OMAR-RQ (multifeature) | Masked | 24 | L2 · L4 · L5best L5 · 22% depth | L14 · L15 · L18best L14 · 61% depth | L9 · L11 · L15best L9 · 39% depth | L14–16best L16 · 70% depth | L7 · L13 · L14best L14 · 61% depth |
| OMAR-RQ (base)+ | Masked | 24 | L2 · L4 · L5best L5 · 22% depth | L14 · L16 · L18best L14 · 61% depth | L4 · L11 · L14best L14 · 61% depth | L7–9best L9 · 39% depth | L1–3best L3 · 13% depth |
| MusicGen-S | Autoregressive | 25 | L13 · L18 · L19best L19 · 79% depth | L11 · L12 · L14best L11 · 46% depth | — | L9 · L14 · L16best L9 · 38% depth | L13 · L15 · L17best L17 · 71% depth |
| MusicGen-M | Autoregressive | 49 | L0 · L1 · L42best L0 · 0% depth | L28 · L32 · L34best L32 · 67% depth | L2 · L17 · L21best L17 · 35% depth | L30 · L32 · L33best L33 · 69% depth | L0–2best L1 · 2% depth |
| MusicGen-L | Autoregressive | 49 | L41 · L43 · L44best L43 · 90% depth | L33–35best L33 · 69% depth | L29 · L32 · L40best L32 · 67% depth | L33–35best L35 · 73% depth | L0 · L1 · L33best L1 · 2% depth |
| YuE-s1-0.5B | Autoregressive | 25 | L22–24best L24 · 100% depth | L11 · L12 · L15best L12 · 50% depth | — | L11 · L12 · L14best L11 · 46% depth | L6 · L15 · L16best L6 · 25% depth |
| YuE-s1-7B | Autoregressive | 33 | L0 · L2 · L32best L32 · 100% depth | L9 · L10 · L12best L9 · 28% depth | — | L7 · L12 · L32best L7 · 22% depth | L2 · L3 · L21best L2 · 6% depth |
| LAION-CLAP | Contrastive | 22 | L6–8best L6 · 29% depth | — | L13 · L15 · L20best L15 · 71% depth | L18 · L20 · L21best L21 · 100% depth | L9 · L11 · L12best L11 · 52% depth |
| Myna-Base | Contrastive | 13 | L6 · L7 · L12best L6 · 50% depth | — | L6 · L8 · L12best L12 · 100% depth | L8 · L10 · L12best L12 · 100% depth | L6 · L7 · L12best L12 · 100% depth |
| MT2+ | Contrastive | 13 | L3–5best L4 · 33% depth | — | — | L9 · L10 · L12best L9 · 75% depth | — |
| Qwen2-Audio-Instruct+ | Audio-Language | 33 | L0–2best L1 · 3% depth | — | — | L24 · L27 · L28best L28 · 88% depth | L4 · L5 · L12best L5 · 16% depth |
| Music-Flamingo+ | Audio-Language | 32 | L28–30best L29 · 94% depth | L19 · L20 · L23best L20 · 65% depth | — | L27–29best L29 · 94% depth | L2 · L4 · L5best L4 · 13% depth |
| MAEST+ | Supervised | 12 | L1–3best L2 · 18% depth | — | L4 · L5 · L9best L5 · 45% depth | L4–6best L5 · 45% depth | L4–6best L6 · 55% depth |