Skip to content
Open
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension


Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
660 changes: 222 additions & 438 deletions extract_wandb_results.py

Large diffs are not rendered by default.

2 changes: 1 addition & 1 deletion requirements.txt
Original file line number Diff line number Diff line change
Expand Up @@ -7,7 +7,7 @@ peft==0.16.0
datasets==2.19.0

# Data science
numpy==1.24.4
numpy==1.26.4
pandas==2.2.3
matplotlib==3.9.3
seaborn==0.13.2
Expand Down
Original file line number Diff line number Diff line change
Expand Up @@ -20,6 +20,5 @@ do
--eval_strategy epoch \
--save_strategy no \
--ft_strategy Full \
--dtype bfloat16 \
--wandb
done
24 changes: 24 additions & 0 deletions scripts/glue/precond/deberta_full_adam_sania.sh
Original file line number Diff line number Diff line change
@@ -0,0 +1,24 @@
clear

# datasets=(cola mnli mrpc qnli qqp rte sst2 stsb)
datasets=(cola rte)
lrs=(3e-4 1e-3 2e-5)

for dataset in "${datasets[@]}"; do
for lr in "${lrs[@]}"; do
CUDA_VISIBLE_DEVICES=0 python ./src/run_experiment.py \
--dataset $dataset \
--model distilbert/distilbert-base-uncased \
--optimizer adam_sania \
--batch_size 16 \
--gradient_accumulation_steps 2 \
--lr $lr \
--lr_scheduler_type linear \
--warmup_ratio 0.1 \
--max_train_steps 10000 \
--eval_strategy epoch \
--save_strategy no \
--ft_strategy Full \
--wandb
done
done
25 changes: 25 additions & 0 deletions scripts/glue/precond/deberta_full_adamuon_ns.sh
Original file line number Diff line number Diff line change
@@ -0,0 +1,25 @@
clear

datasets=(cola mnli mrpc qnli qqp rte sst2 stsb)
lrs=(3e-4 1e-3 2e-5)

for dataset in "${datasets[@]}"; do
for lr in "${lrs[@]}"; do
CUDA_VISIBLE_DEVICES=0 python ./src/run_experiment.py \
--dataset $dataset \
--model distilbert/distilbert-base-uncased \
--optimizer adamuon \
--ns_steps 6 \
--batch_size 32 \
--gradient_accumulation_steps 2 \
--lr $lr \
--weight_decay 0.1 \
--lr_scheduler_type linear \
--warmup_ratio 0.1 \
--max_train_steps 10000 \
--eval_strategy epoch \
--save_strategy no \
--ft_strategy Full \
--wandb
done
done
25 changes: 25 additions & 0 deletions scripts/glue/precond/deberta_full_adamuon_pe.sh
Original file line number Diff line number Diff line change
@@ -0,0 +1,25 @@
clear

datasets=(cola mnli mrpc qnli qqp rte sst2 stsb)
lrs=(3e-4 1e-3 2e-5)

for dataset in "${datasets[@]}"; do
for lr in "${lrs[@]}"; do
CUDA_VISIBLE_DEVICES=1 python ./src/run_experiment.py \
--dataset $dataset \
--model distilbert/distilbert-base-uncased \
--optimizer adamuon \
--ns_steps 6 \
--batch_size 32 \
--gradient_accumulation_steps 2 \
--lr $lr \
--weight_decay 0.1 \
--lr_scheduler_type linear \
--warmup_ratio 0.1 \
--max_train_steps 10000 \
--eval_strategy epoch \
--save_strategy no \
--ft_strategy Full \
--wandb
done
done
Original file line number Diff line number Diff line change
Expand Up @@ -19,7 +19,6 @@ for dataset in "${datasets[@]}"; do
--eval_strategy epoch \
--save_strategy no \
--ft_strategy Full \
--dtype bfloat16 \
--wandb
done
done
Original file line number Diff line number Diff line change
Expand Up @@ -22,7 +22,6 @@ for dataset in "${datasets[@]}"; do
--eval_strategy epoch \
--save_strategy no \
--ft_strategy Full \
--dtype bfloat16 \
--wandb
done
done
26 changes: 26 additions & 0 deletions scripts/glue/precond/deberta_full_madam_pe.sh
Original file line number Diff line number Diff line change
@@ -0,0 +1,26 @@
clear

datasets=(cola mnli mrpc qnli qqp rte sst2 stsb)
lrs=(3e-4 1e-3 2e-5)

for dataset in "${datasets[@]}"; do
for lr in "${lrs[@]}"; do
CUDA_VISIBLE_DEVICES=1 python ./src/run_experiment.py \
--dataset $dataset \
--model distilbert/distilbert-base-uncased \
--optimizer rmsspectral \
--rms_power 0.25 \
--ns_steps 6 \
--batch_size 32 \
--gradient_accumulation_steps 2 \
--lr $lr \
--weight_decay 0.1 \
--lr_scheduler_type linear \
--warmup_ratio 0.1 \
--max_train_steps 10000 \
--eval_strategy epoch \
--save_strategy no \
--ft_strategy Full \
--wandb
done
done
Original file line number Diff line number Diff line change
Expand Up @@ -19,7 +19,6 @@ for dataset in "${datasets[@]}"; do
--eval_strategy epoch \
--save_strategy no \
--ft_strategy Full \
--dtype bfloat16 \
--wandb
done
done
25 changes: 25 additions & 0 deletions scripts/glue/precond/deberta_full_muon_pe.sh
Original file line number Diff line number Diff line change
@@ -0,0 +1,25 @@
clear

datasets=(cola mnli mrpc qnli qqp rte sst2 stsb)
# datasets=(cola rte)
lrs=(3e-4 1e-3 2e-5)

for dataset in "${datasets[@]}"; do
for lr in "${lrs[@]}"; do
CUDA_VISIBLE_DEVICES=2 python ./src/run_experiment.py \
--dataset $dataset \
--model distilbert/distilbert-base-uncased \
--optimizer muon \
--batch_size 32 \
--gradient_accumulation_steps 2 \
--lr $lr \
--lr_scheduler_type linear \
--warmup_ratio 0.1 \
--max_train_steps 10000 \
--eval_strategy epoch \
--save_strategy no \
--ft_strategy Full \
--orth_algo ns \
--wandb
done
done
26 changes: 26 additions & 0 deletions scripts/glue/precond/deberta_full_rmsspectral_ns.sh
Original file line number Diff line number Diff line change
@@ -0,0 +1,26 @@
clear

datasets=(cola mnli mrpc qnli qqp rte sst2 stsb)
lrs=(3e-4 1e-3 2e-5)

for dataset in "${datasets[@]}"; do
for lr in "${lrs[@]}"; do
CUDA_VISIBLE_DEVICES=0 python ./src/run_experiment.py \
--dataset $dataset \
--model distilbert/distilbert-base-uncased \
--optimizer rmsspectral \
--rms_power 0.25 \
--ns_steps 6 \
--batch_size 32 \
--gradient_accumulation_steps 2 \
--lr $lr \
--weight_decay 0.1 \
--lr_scheduler_type linear \
--warmup_ratio 0.1 \
--max_train_steps 10000 \
--eval_strategy epoch \
--save_strategy no \
--ft_strategy Full \
--wandb
done
done
26 changes: 26 additions & 0 deletions scripts/glue/precond/deberta_full_rmsspectral_sania_ns.sh
Original file line number Diff line number Diff line change
@@ -0,0 +1,26 @@
clear

datasets=(cola mnli mrpc qnli qqp rte sst2 stsb)
lrs=(3e-4 1e-3 2e-5)

for dataset in "${datasets[@]}"; do
for lr in "${lrs[@]}"; do
CUDA_VISIBLE_DEVICES=0 python ./src/run_experiment.py \
--dataset $dataset \
--model distilbert/distilbert-base-uncased \
--optimizer rmsspectral_sania \
--rms_power 0.5 \
--ns_steps 6 \
--batch_size 32 \
--gradient_accumulation_steps 2 \
--lr $lr \
--weight_decay 0.1 \
--lr_scheduler_type linear \
--warmup_ratio 0.1 \
--max_train_steps 10000 \
--eval_strategy epoch \
--save_strategy no \
--ft_strategy Full \
--wandb
done
done
26 changes: 26 additions & 0 deletions scripts/glue/precond/deberta_full_rmsspectral_sania_pe.sh
Original file line number Diff line number Diff line change
@@ -0,0 +1,26 @@
clear

datasets=(cola mnli mrpc qnli qqp rte sst2 stsb)
lrs=(3e-4 1e-3 2e-5)

for dataset in "${datasets[@]}"; do
for lr in "${lrs[@]}"; do
CUDA_VISIBLE_DEVICES=1 python ./src/run_experiment.py \
--dataset $dataset \
--model distilbert/distilbert-base-uncased \
--optimizer rmsspectral_sania \
--rms_power 0.5 \
--ns_steps 6 \
--batch_size 32 \
--gradient_accumulation_steps 2 \
--lr $lr \
--weight_decay 0.1 \
--lr_scheduler_type linear \
--warmup_ratio 0.1 \
--max_train_steps 10000 \
--eval_strategy epoch \
--save_strategy no \
--ft_strategy Full \
--wandb
done
done
27 changes: 27 additions & 0 deletions scripts/glue/precond/deberta_lora_adam_sania.sh
Original file line number Diff line number Diff line change
@@ -0,0 +1,27 @@
clear

# datasets=(cola mnli mrpc qnli qqp rte sst2 stsb)
datasets=(cola rte)
lrs=(3e-4 1e-3 2e-5)

for dataset in "${datasets[@]}"; do
for lr in "${lrs[@]}"; do
CUDA_VISIBLE_DEVICES=0 python ./src/run_experiment.py \
--dataset $dataset \
--model distilbert/distilbert-base-uncased \
--optimizer adam_sania \
--batch_size 16 \
--gradient_accumulation_steps 2 \
--lr $lr \
--lr_scheduler_type linear \
--warmup_ratio 0.1 \
--max_train_steps 10000 \
--eval_strategy epoch \
--save_strategy no \
--ft_strategy LoRA \
--lora_r 4 \
--lora_alpha 32 \
--lora_dropout 0.05 \
--wandb
done
done
28 changes: 28 additions & 0 deletions scripts/glue/precond/deberta_lora_adamuon_ns.sh
Original file line number Diff line number Diff line change
@@ -0,0 +1,28 @@
clear

datasets=(cola mnli mrpc qnli qqp rte sst2 stsb)
lrs=(3e-4 1e-3 2e-5 1e-4)

for dataset in "${datasets[@]}"; do
for lr in "${lrs[@]}"; do
CUDA_VISIBLE_DEVICES=0 python ./src/run_experiment.py \
--dataset $dataset \
--model distilbert/distilbert-base-uncased \
--optimizer adamuon \
--ns_steps 6 \
--batch_size 16 \
--gradient_accumulation_steps 2 \
--lr $lr \
--weight_decay 0.1 \
--lr_scheduler_type linear \
--warmup_ratio 0.1 \
--max_train_steps 10000 \
--eval_strategy epoch \
--save_strategy no \
--ft_strategy LoRA \
--lora_r 4 \
--lora_alpha 32 \
--lora_dropout 0.1 \
--wandb
done
done
Original file line number Diff line number Diff line change
Expand Up @@ -19,7 +19,6 @@ for dataset in "${datasets[@]}"; do
--eval_strategy epoch \
--save_strategy no \
--ft_strategy LoRA \
--dtype bfloat16 \
--lora_r 4 \
--lora_alpha 32 \
--lora_dropout 0.05 \
Expand Down
Original file line number Diff line number Diff line change
Expand Up @@ -22,7 +22,6 @@ for dataset in "${datasets[@]}"; do
--eval_strategy epoch \
--save_strategy no \
--ft_strategy LoRA \
--dtype bfloat16 \
--lora_r 4 \
--lora_alpha 32 \
--lora_dropout 0.05 \
Expand Down
31 changes: 31 additions & 0 deletions scripts/glue/precond/deberta_lora_madam_pe.sh
Original file line number Diff line number Diff line change
@@ -0,0 +1,31 @@
clear

datasets=(cola mnli mrpc qnli qqp rte sst2 stsb)
# datasets=(cola rte)
lrs=(3e-4 1e-3 2e-5 1e-4)

for dataset in "${datasets[@]}"; do
for lr in "${lrs[@]}"; do
CUDA_VISIBLE_DEVICES=0 python ./src/run_experiment.py \
--dataset $dataset \
--model distilbert/distilbert-base-uncased \
--optimizer taia \
--lmo spectral \
--precondition_type adam \
--init eps \
--batch_size 32 \
--gradient_accumulation_steps 2 \
--lr $lr \
--lr_scheduler_type linear \
--warmup_ratio 0.1 \
--max_train_steps 10000 \
--eval_strategy epoch \
--save_strategy no \
--ft_strategy LoRA \
--lora_r 4 \
--lora_alpha 32 \
--lora_dropout 0.1 \
--orth_algo polar \
--wandb
done
done
Original file line number Diff line number Diff line change
Expand Up @@ -19,7 +19,6 @@ for dataset in "${datasets[@]}"; do
--eval_strategy epoch \
--save_strategy no \
--ft_strategy LoRA \
--dtype bfloat16 \
--lora_r 4 \
--lora_alpha 32 \
--lora_dropout 0.05 \
Expand Down
Loading