From 5cc31e23e603268d6e388e1e90677fa92379e088 Mon Sep 17 00:00:00 2001 From: wozeparrot Date: Thu, 9 Jul 2026 23:50:20 -0400 Subject: [PATCH] gptoss: scripts (#16962) --- .../tinybox_8xMI350X/dev_beam.sh | 44 +++++++++++++++++++ .../tinybox_8xMI350X/dev_run.sh | 39 ++++++++++++++++ 2 files changed, 83 insertions(+) create mode 100755 examples/mlperf/training_submission_v6.0/tinycorp/benchmarks/gpt_oss/implementations/tinybox_8xMI350X/dev_beam.sh create mode 100755 examples/mlperf/training_submission_v6.0/tinycorp/benchmarks/gpt_oss/implementations/tinybox_8xMI350X/dev_run.sh diff --git a/examples/mlperf/training_submission_v6.0/tinycorp/benchmarks/gpt_oss/implementations/tinybox_8xMI350X/dev_beam.sh b/examples/mlperf/training_submission_v6.0/tinycorp/benchmarks/gpt_oss/implementations/tinybox_8xMI350X/dev_beam.sh new file mode 100755 index 0000000000..aa3c67acfc --- /dev/null +++ b/examples/mlperf/training_submission_v6.0/tinycorp/benchmarks/gpt_oss/implementations/tinybox_8xMI350X/dev_beam.sh @@ -0,0 +1,44 @@ +#!/usr/bin/env bash + +export PYTHONPATH="." +export PATH="/opt/rocm-7.1.1/bin:$PATH" +export ROCM_PATH="/opt/rocm-7.1.1" +export DEV=${DEV:-AMD} +export CHECK_OOB=0 +export REWRITE_STACK_LIMIT=5000000 HCQDEV_WAIT_TIMEOUT_MS=240000 +export DEVICE_IN_FUNCTION_BUG=1 + +export DEBUG=${DEBUG:-2} +export HK_FLASH_ATTENTION=${HK_FLASH_ATTENTION:-1} +export ALL2ALL=${ALL2ALL:-1} +export LATE_ALLREDUCE=${LATE_ALLREDUCE:-0} +export ALLREDUCE_CAST=${ALLREDUCE_CAST:-1} +export USE_ATOMICS=${USE_ATOMICS:-1} +export MASTER_WEIGHTS=${MASTER_WEIGHTS:-1} +export MXFP8=${MXFP8:-1} +export ZERO_OPTIM=${ZERO_OPTIM:-1} +export OFFLOAD_OPTIM=${OFFLOAD_OPTIM:-0} + +export DEFAULT_FLOAT="bfloat16" OPTIM_DTYPE="bfloat16" +export DP=${DP:-8} BS=${BS:-16} EVAL_BS=${EVAL_BS:-8} GRADIENT_ACC_STEPS=${GRADIENT_ACC_STEPS:-2} +export GBS=$((BS * GRADIENT_ACC_STEPS)) + +export MODEL="gptoss" +export BASEDIR="/raid/datasets/c4-8b/" +export EVAL_TARGET=3.34 EVAL_FREQ=12288 +export END_LR="4e-5" WARMUP_STEPS=128 MAX_STEPS=1200000 +export SAMPLES=$((MAX_STEPS * GBS)) +export SEQLEN=${SEQLEN:-8192} + +export SEED=${SEED:-5760} +export DATA_SEED=${DATA_SEED:-5760} + +export JITBEAM=${JITBEAM:-3} +export BEAM_UOPS_MAX=6000 BEAM_UPCAST_MAX=256 BEAM_LOCAL_MAX=1024 BEAM_MIN_PROGRESS=5 BEAM_PADTO=1 + +export FAKEDATA=${FAKEDATA:-1} BENCHMARK=${BENCHMARK:-10} +if [ -z "$FULL_LAYERS" ]; then + export LAYERS=${LAYERS:-2} +fi + +python3 examples/mlperf/model_train.py diff --git a/examples/mlperf/training_submission_v6.0/tinycorp/benchmarks/gpt_oss/implementations/tinybox_8xMI350X/dev_run.sh b/examples/mlperf/training_submission_v6.0/tinycorp/benchmarks/gpt_oss/implementations/tinybox_8xMI350X/dev_run.sh new file mode 100755 index 0000000000..62daa7ec1e --- /dev/null +++ b/examples/mlperf/training_submission_v6.0/tinycorp/benchmarks/gpt_oss/implementations/tinybox_8xMI350X/dev_run.sh @@ -0,0 +1,39 @@ +#!/usr/bin/env bash + +export PYTHONPATH="." +export PATH="/opt/rocm-7.1.1/bin:$PATH" +export ROCM_PATH="/opt/rocm-7.1.1" +export DEV=${DEV:-AMD} +export CHECK_OOB=0 +export REWRITE_STACK_LIMIT=5000000 HCQDEV_WAIT_TIMEOUT_MS=240000 +export DEVICE_IN_FUNCTION_BUG=1 + +export DEBUG=${DEBUG:-0} +export HK_FLASH_ATTENTION=${HK_FLASH_ATTENTION:-1} +export ALL2ALL=${ALL2ALL:-1} +export LATE_ALLREDUCE=${LATE_ALLREDUCE:-0} +export ALLREDUCE_CAST=${ALLREDUCE_CAST:-1} +export USE_ATOMICS=${USE_ATOMICS:-1} +export MASTER_WEIGHTS=${MASTER_WEIGHTS:-1} +export MXFP8=${MXFP8:-1} +export ZERO_OPTIM=${ZERO_OPTIM:-1} +export OFFLOAD_OPTIM=${OFFLOAD_OPTIM:-0} + +export DEFAULT_FLOAT="bfloat16" OPTIM_DTYPE="bfloat16" +export DP=${DP:-8} BS=${BS:-16} EVAL_BS=${EVAL_BS:-8} GRADIENT_ACC_STEPS=${GRADIENT_ACC_STEPS:-2} +export GBS=$((BS * GRADIENT_ACC_STEPS)) + +export MODEL="gptoss" +export BASEDIR="/raid/datasets/c4-8b/" +export EVAL_TARGET=3.34 EVAL_FREQ=12288 +export END_LR="4e-5" WARMUP_STEPS=128 MAX_STEPS=1200000 +export SAMPLES=$((MAX_STEPS * GBS)) +export SEQLEN=${SEQLEN:-8192} + +export SEED=${SEED:-$RANDOM} +export DATA_SEED=${DATA_SEED:-5760} + +export JITBEAM=${JITBEAM:-3} +export BEAM_UOPS_MAX=6000 BEAM_UPCAST_MAX=256 BEAM_LOCAL_MAX=1024 BEAM_MIN_PROGRESS=5 BEAM_PADTO=1 + +python3 examples/mlperf/model_train.py