Skip to content

use f32 for f16 in npy - #2590

Merged
kali merged 1 commit into
mainfrom
feat/cli-npz-f16-npyz
Aug 6, 2026
Merged

use f32 for f16 in npy#2590
kali merged 1 commit into
mainfrom
feat/cli-npz-f16-npyz

Conversation

@kali

@kali kali commented Aug 5, 2026

Copy link
Copy Markdown
Collaborator

ndarray-npy cannot decode float16 arrays, so npz bundles holding f16 (and the writer stored f16 as f32). Switch the CLI npz reader and writer to npyz, which supports every numpy scalar dtype tract has a Datum for, so f16 bundles round trip natively.

@kali

kali commented Aug 5, 2026

Copy link
Copy Markdown
Collaborator Author

/ci full

@kali

kali commented Aug 5, 2026

Copy link
Copy Markdown
Collaborator Author

/ci examples

@kali

kali commented Aug 5, 2026

Copy link
Copy Markdown
Collaborator Author

/ci llm

@github-actions

github-actions Bot commented Aug 5, 2026

Copy link
Copy Markdown

✅ CI / full: success

  • old-harness: success
  • cli-tests: success
  • onnx-tests: success
  • tflite: success
  • some-tests-with-paranoid-asserts: success
  • without-default-features: success
  • complexes: success
  • check-all-targets: success
  • C: success
  • python: success

View workflow run

@kali
kali force-pushed the feat/cli-npz-f16-npyz branch from 13d8fd4 to 6aeb0b7 Compare August 5, 2026 08:40
@github-actions

github-actions Bot commented Aug 5, 2026

Copy link
Copy Markdown

⚠️ Bench vs main — no speed regressions · 2 secondary regression(s)

Reference: 2026-08-05 morning nightly run (0d old) · full report → run

Speed — evaltime · prefill · decode

no inference-speed regressions

⚠️ 2 secondary regression(s)
Δ metric device main → PR
⚠️ +26.2% arm_ml_kws_cnn_m
load · pass
cortex-a9 84 ms → 106 ms
⚠️ +19.2% arm_ml_kws_cnn_m
load+optimize · pass
cortex-a9 130 ms → 155 ms

@kali kali changed the title cli: read and write npz with f16 (swap ndarray-npy for npyz) use f32 for f16 in npy Aug 5, 2026
@github-actions

github-actions Bot commented Aug 5, 2026

Copy link
Copy Markdown

✅ CI / examples: success

  • examples: success
  • example: success
  • build-tract-cli: success
  • build-tract-cli-macos: success
  • gpu-examples: success
  • gpu-example: success
  • gpu-example-metal: success

View workflow run

@github-actions

github-actions Bot commented Aug 5, 2026

Copy link
Copy Markdown

🔴 Bench vs main — 1 speed regression(s) · ⚠️ 11 secondary

Reference: 2026-08-05 morning nightly run (0d old) · full report → run

Speed — evaltime · prefill · decode

Δ metric device main → PR
🔴 +15.9% arm_ml_kws_cnn_m
evaltime · pass
cortex-a9 9.25 ms → 10.7 ms
⚠️ 11 secondary regression(s)
Δ metric device main → PR
⚠️ +41.7% arm_ml_kws_cnn_m
load · pass
cortex-a9 84 ms → 119 ms
⚠️ +33.8% arm_ml_kws_cnn_m
load+optimize · pass
cortex-a9 130 ms → 174 ms
⚠️ +20.8% hey_snips_v1
load · 400ms
cortex-a9 77 ms → 93 ms
⚠️ +17.0% hey_snips_v1
load+optimize · 400ms
cortex-a9 147 ms → 172 ms
⚠️ +14.9% arm_ml_kws_cnn_m
load · pass
cortex-a53 47 ms → 54 ms
⚠️ +12.3% arm_ml_kws_cnn_m
load+optimize · pass
cortex-a53 73 ms → 82 ms
⚠️ +11.2% hey_snips_v4_model17
load+optimize · 2sec
cortex-a7 5.12 s → 5.69 s
⚠️ +10.7% mobilenet_v1_1
RSS @ ready · pass
cortex-a53 48.1 MB → 53.2 MB
⚠️ +10.1% hey_snips_v4_model17
load · 2sec
cortex-a7 4.39 s → 4.83 s
⚠️ +8.2% mobilenet_v1_1
load · pass
cortex-a9 2.09 s → 2.26 s
⚠️ +7.6% mobilenet_v1_1
load+optimize · pass
cortex-a9 2.37 s → 2.56 s

@github-actions

github-actions Bot commented Aug 5, 2026

Copy link
Copy Markdown

✅ CI / large-models: success

  • cli: success
  • foundation-llms: success
  • foundation-llm: success
  • parakeet-tdt-600m-v3: success
  • nemotron-speech-streaming-en-06b: success

View workflow run

@kali

kali commented Aug 5, 2026

Copy link
Copy Markdown
Collaborator Author

/ci full

@kali

kali commented Aug 5, 2026

Copy link
Copy Markdown
Collaborator Author

/ci llm

The io.npz bundles held f16 arrays, which the CLI cannot read (ndarray-npy
has no f16 support and the writer stores f16 as f32). Up-cast the bundles to
f32 and pass --allow-float-casts so the f16 graph boundary reconciles.
@kali

kali commented Aug 6, 2026

Copy link
Copy Markdown
Collaborator Author

⚠️⚠️⚠️ Just rebased! ⚠️⚠️⚠️

@kali
kali force-pushed the feat/cli-npz-f16-npyz branch from 6aeb0b7 to b4b36ae Compare August 6, 2026 12:40
@kali

kali commented Aug 6, 2026

Copy link
Copy Markdown
Collaborator Author

/ci full

@github-actions

github-actions Bot commented Aug 6, 2026

Copy link
Copy Markdown

🔴 Bench vs main — 1 speed regression(s) · ⚠️ 13 secondary

Reference: 2026-08-06 morning nightly run (0d old) · full report → run

Speed — evaltime · prefill · decode

Δ metric device main → PR
🔴 +18.6% hey_snips_v31
evaltime · 400ms
cortex-a9 4.08 ms → 4.84 ms
⚠️ 13 secondary regression(s)
Δ metric device main → PR
⚠️ +18.5% hey_snips_v31
load · 400ms
cortex-a9 298 ms → 353 ms
⚠️ +18.4% hey_snips_v31
load+optimize · 400ms
cortex-a9 343 ms → 406 ms
⚠️ +16.9% arm_ml_kws_cnn_m
load · pass
cortex-a9 83 ms → 97 ms
⚠️ +11.5% hey_snips_v4_model17
load · 2sec
cortex-a9 3.81 s → 4.25 s
⚠️ +10.9% arm_ml_kws_cnn_m
load+optimize · pass
cortex-a9 129 ms → 143 ms
⚠️ +10.8% hey_snips_v4_model17
load · 2sec
cortex-a7 4.31 s → 4.78 s
⚠️ +10.5% hey_snips_v31
load · 400ms
cortex-a7 334 ms → 369 ms
⚠️ +10.0% hey_snips_v4_model17
load+optimize · 2sec
cortex-a9 4.39 s → 4.83 s
⚠️ +10.0% hey_snips_v31
load+optimize · 400ms
cortex-a7 381 ms → 419 ms
⚠️ +9.4% hey_snips_v4_model17_nnef
load · pulse8
cortex-a55 382 ms → 418 ms
⚠️ +9.3% hey_snips_v4_model17
load+optimize · 2sec
cortex-a7 5.04 s → 5.51 s
⚠️ +7.3% en_tdnn_15M_nnef
load · pulse_240ms
cortex-a53 452 ms → 485 ms
⚠️ +6.6% hey_snips_v4_model17_nnef
load · pulse8
cortex-a53 471 ms → 502 ms

@kali
kali merged commit 876a029 into main Aug 6, 2026
59 checks passed
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

1 participant