DTW Audio Comparison — User Guide

Dynamic Time Warping analysis comparing recordings of different lengths/tempos, measuring MFCC similarity, tempo-aligned loudness, and melodic interval accuracy with automatic quality assessment.

Author: Shai Cohen Affiliation: Department of Music, Bar-Ilan University, Israel

What this does

This script uses Dynamic Time Warping (DTW) to compare two audio recordings that may have different durations or tempos. Unlike basic comparison tools, DTW intelligently aligns sequences to handle timing variations, making it ideal for comparing performances with different speeds, rhythmic variations, or duration mismatches. Analyzes MFCC features (timbre), loudness, and melodic intervals with tempo-aware alignment.

What is DTW? Dynamic Time Warping is an algorithm that finds optimal alignment between two time sequences. Think of it like stretching/compressing a rubber band to match two patterns. It's widely used in speech recognition, gesture recognition, and music analysis to compare signals that don't line up perfectly in time.

Quick start

  1. In Praat, select exactly two Sound objects (Shift+click to select both).
  2. Run script… → Load this DTW comparison script.
  3. Click OK — processing completes in 10-30 seconds (depends on duration).
  4. Check Info window for detailed results.
  5. Check Objects window for "dtw_analysis_results" table.
  6. Optional: Save table as CSV (Select table → Save → Save as comma-separated values file).
Key advantage: Works with different-length recordings! Teacher recording can be 10s, student 12s — DTW handles it. Ideal for comparing performances at different tempos (student slower/faster than teacher).

Three-Dimensional Analysis

🎨 DTW MFCC Similarity (Timbre)

What it measures: Spectral/timbral similarity using Mel-Frequency Cepstral Coefficients

Interpretation:

  • Normalized DTW distance <2: Excellent (very similar timbre)
  • 2-5: Good (comparable tone quality)
  • 5-10: Moderate (noticeable timbral differences)
  • >10: Needs work (significantly different tone)

Use: Assesses tone quality, articulation, vowel shape (voice), instrument timbre matching

🔊 DTW Loudness Match (Dynamics)

What it measures: Tempo-aligned intensity comparison

Interpretation:

  • Aligned dB difference <4: Excellent (similar dynamic control)
  • 4-8 dB: Good (comparable loudness patterns)
  • 8-15 dB: Moderate (noticeable dynamic differences)
  • >15 dB: Needs work (different dynamic approach)

Use: Evaluates dynamic expression, loudness control matching

🎵 DTW Pitch Accuracy (Melody)

What it measures: Tempo-aligned melodic interval comparison

Interpretation:

  • Aligned interval difference <0.3 semitones: Excellent
  • 0.3-0.7 semitones: Very good
  • 0.7-1.5 semitones: Good
  • 1.5-3.0 semitones: Moderate
  • >3.0 semitones: Needs work

Additional metrics:

  • Contour accuracy: Percentage of matched melodic direction (up/down/stable)
  • Transposition: Overall pitch difference (e.g., singing in wrong key)

DTW Advantages

Handles tempo variations:

Timing flexibility:

vs. Standard comparison:

Important: DTW works best when recordings have similar content (same piece/exercise). Comparing completely different material gives meaningless results. Recordings should start at approximately the same point (beginning of phrase/piece).

Output Files

Info window displays:

Results Table (dtw_analysis_results):

ColumnDescription
parameterFeature type (MFCC_DTW, LOUDNESS_DTW, PITCH_DTW)
metricSpecific measurement name
valueNumeric result
assessmentQuality rating (EXCELLENT/GOOD/MODERATE/NEEDS_WORK)
teacher_fileReference recording name
student_fileTest recording name
duration_diffDuration difference (seconds)
tempo_ratioSpeed ratio (student/teacher)

To save results: Select "dtw_analysis_results" table → Save → Save as comma-separated values file → Choose location

Parameters

MFCC Parameters (timbre analysis):

ParameterValueDescription
number_of_filters24Mel filter bank size
fmin/fmax100-5000 HzFrequency range for analysis
number_of_coefficients13MFCC features (C0-C12, using C1-C12)

DTW Parameters:

ParameterValueDescription
dtw_radius3Search radius for alignment
dtw_min_size5Minimum sequence length for FastDTW

Pitch Parameters:

ParameterValueDescription
pitch_floor/ceiling75-600 HzRange for F0 detection

Note: All parameters hardcoded in script, optimized for speech/singing analysis.

Applications

Music pedagogy:

Language learning:

Performance analysis:

Limitations

  • Processing time: 10-30 seconds for typical recordings (DTW computationally intensive)
  • Similar content required: Recordings must be same piece/exercise (not random material)
  • Approximate alignment: Uses FastDTW approximation for long sequences (sampling every 3rd frame)
  • Start point matters: Recordings should begin at approximately same musical point
  • Monophonic preferred: Pitch analysis works best with single melodic line
  • Large tempo differences: Ratio >2.0× may reduce accuracy

Interpreting Results

Example 1: Excellent match

Example 2: Needs work

Example 3: Mixed results (common)