Layer Cheat Sheet

Using a frozen music foundation model and need to pick a layer? Each cell gives the three-layer band to probe first for that model and task family, from our full per-layer evaluations. The single best layer is task- and seed-sensitive; a top-3 band is the robust recommendation. Hover any cell for the per-task best layers.

← Results table · Layer explorer · Selection & fusion · Correlations · Paper · results as of 2026-08-04

Don’t default to the last layer

7% of model×task pairs have their best layer at the top of the network. Everywhere else, the default choice leaves performance behind.

The middle is the workhorse

43% of best layers sit in the middle third of the network (33–67% depth).

Depth habits differ by paradigm

Median depth of the best layer: Masked 42%  ·  Autoregressive 58%  ·  Contrastive 86%  ·  Audio-Language 87%  ·  Supervised 45%.
ModelParadigm Layers TonalRhythmTimbreSemanticSimilarity
MERT-v1-95MMasked13L2 · L4 · L8best L4 · 33% depthL6–8best L7 · 58% depthL4 · L6 · L7best L4 · 33% depthL5–7best L6 · 50% depthL2–4best L2 · 17% depth
MERT-v1-330MMasked25L4 · L6 · L8best L4 · 17% depthL7–9best L9 · 38% depthL7 · L8 · L12best L7 · 29% depthL6 · L7 · L10best L10 · 42% depthL5–7best L7 · 29% depth
MusicFM (MSD)Masked13L3 · L4 · L6best L3 · 25% depthL6 · L8 · L10best L10 · 83% depthL2 · L3 · L5best L3 · 25% depthL6–8best L7 · 58% depthL1–3best L2 · 17% depth
MuQ (iter)Masked13L1–3best L2 · 17% depthL10–12best L12 · 100% depthL2 · L5 · L6best L5 · 42% depthL5 · L9 · L10best L10 · 83% depthL0–2best L0 · 0% depth
OMAR-RQ (multifeature)Masked24L2 · L4 · L5best L5 · 22% depthL14 · L15 · L18best L14 · 61% depthL9 · L11 · L15best L9 · 39% depthL14–16best L16 · 70% depthL7 · L13 · L14best L14 · 61% depth
OMAR-RQ (base)+Masked24L2 · L4 · L5best L5 · 22% depthL14 · L16 · L18best L14 · 61% depthL4 · L11 · L14best L14 · 61% depthL7–9best L9 · 39% depthL1–3best L3 · 13% depth
MusicGen-SAutoregressive25L13 · L18 · L19best L19 · 79% depthL11 · L12 · L14best L11 · 46% depthL9 · L14 · L16best L9 · 38% depthL13 · L15 · L17best L17 · 71% depth
MusicGen-MAutoregressive49L0 · L1 · L42best L0 · 0% depthL28 · L32 · L34best L32 · 67% depthL2 · L17 · L21best L17 · 35% depthL30 · L32 · L33best L33 · 69% depthL0–2best L1 · 2% depth
MusicGen-LAutoregressive49L41 · L43 · L44best L43 · 90% depthL33–35best L33 · 69% depthL29 · L32 · L40best L32 · 67% depthL33–35best L35 · 73% depthL0 · L1 · L33best L1 · 2% depth
YuE-s1-0.5BAutoregressive25L22–24best L24 · 100% depthL11 · L12 · L15best L12 · 50% depthL11 · L12 · L14best L11 · 46% depthL6 · L15 · L16best L6 · 25% depth
YuE-s1-7BAutoregressive33L0 · L2 · L32best L32 · 100% depthL9 · L10 · L12best L9 · 28% depthL7 · L12 · L32best L7 · 22% depthL2 · L3 · L21best L2 · 6% depth
LAION-CLAPContrastive22L6–8best L6 · 29% depthL13 · L15 · L20best L15 · 71% depthL18 · L20 · L21best L21 · 100% depthL9 · L11 · L12best L11 · 52% depth
Myna-BaseContrastive13L6 · L7 · L12best L6 · 50% depthL6 · L8 · L12best L12 · 100% depthL8 · L10 · L12best L12 · 100% depthL6 · L7 · L12best L12 · 100% depth
MT2+Contrastive13L3–5best L4 · 33% depthL9 · L10 · L12best L9 · 75% depth
Qwen2-Audio-Instruct+Audio-Language33L0–2best L1 · 3% depthL24 · L27 · L28best L28 · 88% depthL4 · L5 · L12best L5 · 16% depth
Music-Flamingo+Audio-Language32L28–30best L29 · 94% depthL19 · L20 · L23best L20 · 65% depthL27–29best L29 · 94% depthL2 · L4 · L5best L4 · 13% depth
MAEST+Supervised12L1–3best L2 · 18% depthL4 · L5 · L9best L5 · 45% depthL4–6best L5 · 45% depthL4–6best L6 · 55% depth