Layer Cheat Sheet

The three layers to probe first for each model and task family, from the full per-layer evaluations. The single best layer depends on the task and the seed, so the top three are the more reliable recommendation. Hover a cell for the per-task best layers.

Results as of 2026-08-04

Last layer

7% of model×task pairs have their best layer at the top of the network.

Middle third

43% of best layers sit in the middle third of the network (33–67% depth).

Depth by paradigm

Median depth of the best layer:
Masked 42%
Autoregressive 58%
Contrastive 86%
Audio-Language 87%
Supervised 45%
ModelParadigm Layers TonalRhythmTimbreSemanticSimilarity
MERT-v1-95MMasked13L2 · L4 · L8best L4 · 33% depthL6–8best L7 · 58% depthL4 · L6 · L7best L4 · 33% depthL5–7best L6 · 50% depthL2–4best L2 · 17% depth
MERT-v1-330MMasked25L4 · L6 · L8best L4 · 17% depthL7–9best L9 · 38% depthL7 · L8 · L12best L7 · 29% depthL6 · L7 · L10best L10 · 42% depthL5–7best L7 · 29% depth
MusicFM (MSD)Masked13L3 · L4 · L6best L3 · 25% depthL6 · L8 · L10best L10 · 83% depthL2 · L3 · L5best L3 · 25% depthL6–8best L7 · 58% depthL1–3best L2 · 17% depth
MuQ (iter)Masked13L1–3best L2 · 17% depthL10–12best L12 · 100% depthL2 · L5 · L6best L5 · 42% depthL5 · L9 · L10best L10 · 83% depthL0–2best L0 · 0% depth
OMAR-RQ (multifeature)Masked24L2 · L4 · L5best L5 · 22% depthL14 · L15 · L18best L14 · 61% depthL9 · L11 · L15best L9 · 39% depthL14–16best L16 · 70% depthL7 · L13 · L14best L14 · 61% depth
OMAR-RQ (base)+Masked24L2 · L4 · L5best L5 · 22% depthL14 · L16 · L18best L14 · 61% depthL4 · L11 · L14best L14 · 61% depthL7–9best L9 · 39% depthL1–3best L3 · 13% depth
MusicGen-SAutoregressive25L13 · L18 · L19best L19 · 79% depthL11 · L12 · L14best L11 · 46% depth—L9 · L14 · L16best L9 · 38% depthL13 · L15 · L17best L17 · 71% depth
MusicGen-MAutoregressive49L0 · L1 · L42best L0 · 0% depthL28 · L32 · L34best L32 · 67% depthL2 · L17 · L21best L17 · 35% depthL30 · L32 · L33best L33 · 69% depthL0–2best L1 · 2% depth
MusicGen-LAutoregressive49L41 · L43 · L44best L43 · 90% depthL33–35best L33 · 69% depthL29 · L32 · L40best L32 · 67% depthL33–35best L35 · 73% depthL0 · L1 · L33best L1 · 2% depth
YuE-s1-0.5BAutoregressive25L22–24best L24 · 100% depthL11 · L12 · L15best L12 · 50% depth—L11 · L12 · L14best L11 · 46% depthL6 · L15 · L16best L6 · 25% depth
YuE-s1-7BAutoregressive33L0 · L2 · L32best L32 · 100% depthL9 · L10 · L12best L9 · 28% depth—L7 · L12 · L32best L7 · 22% depthL2 · L3 · L21best L2 · 6% depth
LAION-CLAPContrastive22L6–8best L6 · 29% depth—L13 · L15 · L20best L15 · 71% depthL18 · L20 · L21best L21 · 100% depthL9 · L11 · L12best L11 · 52% depth
Myna-BaseContrastive13L6 · L7 · L12best L6 · 50% depth—L6 · L8 · L12best L12 · 100% depthL8 · L10 · L12best L12 · 100% depthL6 · L7 · L12best L12 · 100% depth
MT2+Contrastive13L3–5best L4 · 33% depth——L9 · L10 · L12best L9 · 75% depth—
Qwen2-Audio-Instruct+Audio-Language33L0–2best L1 · 3% depth——L24 · L27 · L28best L28 · 88% depthL4 · L5 · L12best L5 · 16% depth
Music-Flamingo+Audio-Language32L28–30best L29 · 94% depthL19 · L20 · L23best L20 · 65% depth—L27–29best L29 · 94% depthL2 · L4 · L5best L4 · 13% depth
MAEST+Supervised12L1–3best L2 · 18% depth—L4 · L5 · L9best L5 · 45% depthL4–6best L5 · 45% depthL4–6best L6 · 55% depth