From 55ac24d688f77d16c0c4676eac10c00a85b5586d Mon Sep 17 00:00:00 2001 From: vidushi8 Date: Mon, 20 Jul 2026 22:14:07 +0000 Subject: [PATCH] update MI355 yaml for v26.5 --- .../megatron/configs/MI355X/gpt_oss_20B-BF16-pretrain.yaml | 2 +- .../megatron/configs/MI355X/gpt_oss_20B-FP8-pretrain.yaml | 7 ++++--- .../megatron/configs/MI355X/llama3.1_70B-FP8-pretrain.yaml | 4 ++-- .../configs/MI355X/qwen3_30B_A3B-BF16-pretrain.yaml | 2 +- .../configs/MI355X/qwen3_30B_A3B-FP8-pretrain.yaml | 6 +++--- .../gpt_oss_20b/config_MI355X_1x8x1_tp1pp1ep1_gbs32.sh | 2 +- .../configs/MI355/gpt_oss_20B-FP8-mlperf-pretrain.yaml | 4 ++-- .../configs/MI355X/deepseek_v3_16b-BF16-pretrain.yaml | 2 +- 8 files changed, 15 insertions(+), 14 deletions(-) diff --git a/examples/megatron/configs/MI355X/gpt_oss_20B-BF16-pretrain.yaml b/examples/megatron/configs/MI355X/gpt_oss_20B-BF16-pretrain.yaml index 72baa5d20..731bf6fde 100644 --- a/examples/megatron/configs/MI355X/gpt_oss_20B-BF16-pretrain.yaml +++ b/examples/megatron/configs/MI355X/gpt_oss_20B-BF16-pretrain.yaml @@ -46,7 +46,7 @@ modules: profile_step_start: 6 # hyper parameters - train_iters: 10 + train_iters: 50 micro_batch_size: 8 global_batch_size: 512 seq_length: ${PRIMUS_SEQ_LENGTH:4096} diff --git a/examples/megatron/configs/MI355X/gpt_oss_20B-FP8-pretrain.yaml b/examples/megatron/configs/MI355X/gpt_oss_20B-FP8-pretrain.yaml index 9315ccc55..8d614c817 100644 --- a/examples/megatron/configs/MI355X/gpt_oss_20B-FP8-pretrain.yaml +++ b/examples/megatron/configs/MI355X/gpt_oss_20B-FP8-pretrain.yaml @@ -46,9 +46,9 @@ modules: profile_step_start: 6 # hyper parameters - train_iters: 10 - micro_batch_size: 8 - global_batch_size: 512 + train_iters: 50 + micro_batch_size: 6 + global_batch_size: 48 seq_length: ${PRIMUS_SEQ_LENGTH:4096} max_position_embeddings: ${PRIMUS_MAX_POSITION_EMBEDDINGS:4096} lr: 1.0e-5 @@ -106,6 +106,7 @@ modules: eval_iters: 0 cross_entropy_loss_fusion: true + cross_entropy_fusion_impl: "te" fp8: hybrid # enable_primus_turbo: true diff --git a/examples/megatron/configs/MI355X/llama3.1_70B-FP8-pretrain.yaml b/examples/megatron/configs/MI355X/llama3.1_70B-FP8-pretrain.yaml index 9975256f7..2c2fa0b68 100644 --- a/examples/megatron/configs/MI355X/llama3.1_70B-FP8-pretrain.yaml +++ b/examples/megatron/configs/MI355X/llama3.1_70B-FP8-pretrain.yaml @@ -17,8 +17,8 @@ modules: log_avg_reset_interval: 50 train_iters: 50 - micro_batch_size: 4 - global_batch_size: 32 + micro_batch_size: 3 + global_batch_size: 24 seq_length: 8192 max_position_embeddings: 8192 diff --git a/examples/megatron/configs/MI355X/qwen3_30B_A3B-BF16-pretrain.yaml b/examples/megatron/configs/MI355X/qwen3_30B_A3B-BF16-pretrain.yaml index a9c45a614..1510d90f1 100644 --- a/examples/megatron/configs/MI355X/qwen3_30B_A3B-BF16-pretrain.yaml +++ b/examples/megatron/configs/MI355X/qwen3_30B_A3B-BF16-pretrain.yaml @@ -21,7 +21,7 @@ modules: log_avg_reset_interval: 50 # hyper parameters - train_iters: 10 + train_iters: 50 micro_batch_size: 8 global_batch_size: 512 seq_length: ${PRIMUS_SEQ_LENGTH:4096} diff --git a/examples/megatron/configs/MI355X/qwen3_30B_A3B-FP8-pretrain.yaml b/examples/megatron/configs/MI355X/qwen3_30B_A3B-FP8-pretrain.yaml index ef8965ae6..057fb0b6c 100644 --- a/examples/megatron/configs/MI355X/qwen3_30B_A3B-FP8-pretrain.yaml +++ b/examples/megatron/configs/MI355X/qwen3_30B_A3B-FP8-pretrain.yaml @@ -21,9 +21,9 @@ modules: log_avg_reset_interval: 50 # hyper parameters - train_iters: 10 - micro_batch_size: 8 - global_batch_size: 512 + train_iters: 50 + micro_batch_size: 6 + global_batch_size: 48 seq_length: ${PRIMUS_SEQ_LENGTH:4096} max_position_embeddings: ${PRIMUS_MAX_POSITION_EMBEDDINGS:4096} lr: 1.0e-5 diff --git a/examples/mlperf/gpt_oss_20b/config_MI355X_1x8x1_tp1pp1ep1_gbs32.sh b/examples/mlperf/gpt_oss_20b/config_MI355X_1x8x1_tp1pp1ep1_gbs32.sh index b3c64add3..4309dbd4e 100644 --- a/examples/mlperf/gpt_oss_20b/config_MI355X_1x8x1_tp1pp1ep1_gbs32.sh +++ b/examples/mlperf/gpt_oss_20b/config_MI355X_1x8x1_tp1pp1ep1_gbs32.sh @@ -61,7 +61,7 @@ export HSA_FORCE_FINE_GRAIN_PCIE=1 export HSA_KERNARG_POOL_SIZE=12582912 export TORCH_NCCL_HIGH_PRIORITY=1 export ENABLE_NUMA_BINDING=1 -export PYTORCH_ALLOC_CONF=expandable_segments:True +export PYTORCH_ALLOC_CONF=expandable_segments:False export HSA_NO_SCRATCH_RECLAIM=1 export HSA_ENABLE_SDMA=1 export HSA_ENABLE_INTERRUPT=0 diff --git a/examples/mlperf/gpt_oss_20b/configs/MI355/gpt_oss_20B-FP8-mlperf-pretrain.yaml b/examples/mlperf/gpt_oss_20b/configs/MI355/gpt_oss_20B-FP8-mlperf-pretrain.yaml index 0e714040b..9074e4419 100644 --- a/examples/mlperf/gpt_oss_20b/configs/MI355/gpt_oss_20B-FP8-mlperf-pretrain.yaml +++ b/examples/mlperf/gpt_oss_20b/configs/MI355/gpt_oss_20B-FP8-mlperf-pretrain.yaml @@ -47,8 +47,8 @@ modules: # log_avg_reset_interval: 50 # profile - profile: ${PRIMUS_PROFILE:false} - use_pytorch_profiler: ${PRIMUS_PROFILE:false} + profile: ${PRIMUS_PROFILE:False} + use_pytorch_profiler: ${PRIMUS_PROFILE:False} profile_step_end: ${PRIMUS_PROFILE_STEP_END:32} profile_step_start: ${PRIMUS_PROFILE_STEP_START:16} profile_ranks: [0,1,2,3,4,5,6,7] diff --git a/examples/torchtitan/configs/MI355X/deepseek_v3_16b-BF16-pretrain.yaml b/examples/torchtitan/configs/MI355X/deepseek_v3_16b-BF16-pretrain.yaml index d25fbc830..01e1d3047 100644 --- a/examples/torchtitan/configs/MI355X/deepseek_v3_16b-BF16-pretrain.yaml +++ b/examples/torchtitan/configs/MI355X/deepseek_v3_16b-BF16-pretrain.yaml @@ -39,7 +39,7 @@ modules: training: debug_moe_force_load_balance: true - local_batch_size: 13 + local_batch_size: 9 seq_len: 4096 max_norm: 1.0 # grad norm clipping steps: 50