Capacity bucket: 64 vs 160 frames, same phrase
Historical QNN reference comparison, not a product sizing or speech gate.
Device: Galaxy S23 (SM8550, Hexagon V73), QAIRT 2.46.0.260424, burst vote, 8 MB VTCM, fp16. Phrase: "həlˈoʊ." (af_heart), 56 valid frames, 33,600 samples (1.40 s). Same inputs for both buckets. Candidates: a local build directory (front_c64, gen_c64 native InstanceNorm + gb); 160 = frozen baseline contexts. CPU check (masked design vs full-length PyTorch at 64): 19.84 dB SNR, 0.735 dB log-mel.
=== bucket64
FrontMs=22.6 GenMs=342.5
NonFinite=0 AudioSnrDb=18.43
PlayState=Playing WrittenFrames=33600 PlaybackFrames=33600 PlaybackComplete=True
BenchFront N=20 MeanMs=5.6 P50Ms=5.6 P95Ms=5.7 MinMs=5.6 MaxMs=6.1
BenchGen N=20 MeanMs=342.7 P50Ms=342.4 P95Ms=344.0 MinMs=340.5 MaxMs=345.1
Passed=True
=== bucket160
FrontMs=31.4 GenMs=1344.0
NonFinite=0 AudioSnrDb=18.71
PlayState=Playing WrittenFrames=33600 PlaybackFrames=33600 PlaybackComplete=True
BenchFront N=20 MeanMs=14.9 P50Ms=14.4 P95Ms=16.9 MinMs=13.9 MaxMs=19.5
BenchGen N=20 MeanMs=1368.6 P50Ms=1367.9 P95Ms=1371.5 MinMs=1361.5 MaxMs=1372.1
Passed=True
Generator RTF: 64-frame bucket 0.3427 / 1.40 = 0.245; 160-frame bucket 1.3686 / 1.40 = 0.978. Speedup on the same phrase: 4.0x (frame ratio 2.5x).