Skip to content

add gtest for conv gpu SAME_UPPER autopad - #35

Merged
sanjibansg merged 1 commit into
ML4EP:gpu/alpakafrom
harz05:feat/conv-autopad-upper-test
Aug 13, 2026
Merged

add gtest for conv gpu SAME_UPPER autopad#35
sanjibansg merged 1 commit into
ML4EP:gpu/alpakafrom
harz05:feat/conv-autopad-upper-test

Conversation

@harz05

@harz05 harz05 commented Jun 9, 2026

Copy link
Copy Markdown
Contributor

Closes #33.

Adds a GPU test for the SAME_UPPER autopad branch, which the alpaka tests didn't cover (only SAME_LOWER was tested).

SAME_UPPER and SAME_LOWER only differ when the total padding is odd, so the test uses x[1,1,4,4], kernel 3, stride 2 (total pad 1): SAME_UPPER puts the extra pad at the end (begin 0), SAME_LOWER at the start (begin 1). The output differs from what SAME_LOWER gives, and the generated im2col confirms the begin pad (- 0 vs - 1), so the test actually exercises the upper split rather than just the code path.

Tested on Colab T4: ConvWithAutopadSameUpper passes and all existing Conv tests still pass.

@harz05

harz05 commented Jun 9, 2026

Copy link
Copy Markdown
Contributor Author

While working on this PR, I noticed SAME_UPPER and SAME_LOWER only differ when the total padding is odd and for even padding they resolve to the same pads. ROOT's SameUpper model (input 5, k3, s1) is an even case, so it's effectively identical to SameLower.

The odd case would something be like having a 3x3 stride-2 conv on an even-sized input(this gives odd padding) and the TF/Keras "SAME" maps to SAME_UPPER. So it kinda seemed worth covering to me.

Does this odd-split path actually come up in the models SOFIE targets or is the even case all we really need here? Any thoughts or guidance would be helpful. @sanjibansg

@harz05
harz05 force-pushed the feat/conv-autopad-upper-test branch from e432fd9 to d39a038 Compare August 13, 2026 00:54
@harz05

harz05 commented Aug 13, 2026

Copy link
Copy Markdown
Contributor Author

rebased the pr; pls review, thanks
@sanjibansg

@sanjibansg

Copy link
Copy Markdown
Member

/runci

@github-actions

Copy link
Copy Markdown

/runci: GPU Unit Tests ❌ failed — view run

@sanjibansg

Copy link
Copy Markdown
Member

/runci

@github-actions

Copy link
Copy Markdown

/runci: GPU Unit Tests ❌ failed — view run

@harz05
harz05 force-pushed the feat/conv-autopad-upper-test branch from d39a038 to 005e940 Compare August 13, 2026 10:29
@sanjibansg

Copy link
Copy Markdown
Member

/runci

@github-actions

Copy link
Copy Markdown

/runci: GPU Unit Tests ❌ failed — view run

@ML4EP ML4EP deleted a comment from github-actions Bot Aug 13, 2026
@sanjibansg

Copy link
Copy Markdown
Member

/runtest

1 similar comment
@sanjibansg

Copy link
Copy Markdown
Member

/runtest

@sanjibansg

Copy link
Copy Markdown
Member

/runtest h100-47gb

@github-actions

Copy link
Copy Markdown

/runtest (h100-47gb): GPU Unit Tests ❌ failed — view run

@harz05
harz05 force-pushed the feat/conv-autopad-upper-test branch from 005e940 to ee85673 Compare August 13, 2026 15:08
@sanjibansg

Copy link
Copy Markdown
Member

/runtest h100-47gb

@github-actions

Copy link
Copy Markdown

/runtest: triggered — view run

@github-actions

Copy link
Copy Markdown

/runtest (h100-47gb): GPU Unit Tests ✅ passed — view run

@sanjibansg

Copy link
Copy Markdown
Member

/runbenchmark h100-47gb

@github-actions

Copy link
Copy Markdown

/runbenchmark: triggered — view run

@github-actions

Copy link
Copy Markdown

Benchmark results (h100-47gb)

Comparing against gpu/alpaka

── PR ──────────────────────────────────────────────────────────────
=== SOFIE Alpaka Benchmark ===
Backend: CUDA  |  Warmup: 5  |  Iterations: 100

Model                                        infer(ms)     in_xfer(ms)     out_xfer(ms)  Throughput(inf/s)    SM%(avg)    SM%(pk)  MemBw%(avg)
--------------------------------------------------------------------------------------------------------------------------------------------
GNN_model                                       0.4447          0.0659           0.0128            2248.5         N/A        N/A          N/A
gnn_h32_k2_n10000_e50000                        1.4238          0.1622           0.0212             702.3         N/A        N/A          N/A
gnn_h32_k2_n1000_e5000                          0.3390          0.0256           0.0089            2949.7         N/A        N/A          N/A
gnn_h32_k2_n100_e500                            0.2379          0.0109           0.0069            4203.2         N/A        N/A          N/A
gnn_h32_k2_n3000_e15000                         0.5608          0.0520           0.0114            1783.0         N/A        N/A          N/A
gnn_h32_k2_n300_e1500                           0.2636          0.0180           0.0084            3793.7         N/A        N/A          N/A
gnn_h64_k4_n10000_e50000                        5.2285          0.1629           0.0214             191.3         N/A        N/A          N/A
gnn_h64_k4_n1000_e5000                          0.8042          0.0242           0.0084            1243.4         N/A        N/A          N/A
gnn_h64_k4_n100_e500                            0.4069          0.0120           0.0074            2457.3         N/A        N/A          N/A
gnn_h64_k4_n3000_e15000                         1.7474          0.0509           0.0114             572.3         N/A        N/A          N/A
gnn_h64_k4_n300_e1500                           0.5092          0.0149           0.0077            1964.0         N/A        N/A          N/A
punet_h32_k2_heads4_layers2_n100_e500           0.4619          0.0119           0.0077            2165.2         N/A        N/A          N/A
punet_h32_k2_heads4_layers2_n300_e1500          0.5342          0.0152           0.0078            1872.1         N/A        N/A          N/A
simple_transformer                              0.1570          0.0080           0.0072            6369.8         N/A        N/A          N/A
simple_transformer_300                          0.1682          0.0096           0.0070            5945.2         N/A        N/A          N/A
transformer_L1000_B1                            0.2623          0.0140           0.0072            3812.5         N/A        N/A          N/A
transformer_d32_h2_L6_ff32_n10_s10              1.3618          0.0078           0.0079             734.3         N/A        N/A          N/A
transformer_d32_h2_L6_ff32_n20_s20              1.3426          0.0080           0.0084             744.8         N/A        N/A          N/A
transformer_d32_h2_L6_ff32_n30_s30              1.3764          0.0080           0.0090             726.5         N/A        N/A          N/A
transformer_d32_h2_L6_ff32_n40_s40              1.3624          0.0080           0.0091             734.0         N/A        N/A          N/A
transformer_d32_h2_L6_ff32_n50_s50              1.3949          0.0081           0.0095             716.9         N/A        N/A          N/A

── gpu/alpaka ──────────────────────────────────────────────
=== SOFIE Alpaka Benchmark ===
Backend: CUDA  |  Warmup: 5  |  Iterations: 100

Model                                        infer(ms)     in_xfer(ms)     out_xfer(ms)  Throughput(inf/s)    SM%(avg)    SM%(pk)  MemBw%(avg)
--------------------------------------------------------------------------------------------------------------------------------------------
GNN_model                                       0.4446          0.0664           0.0128            2249.3         N/A        N/A          N/A
gnn_h32_k2_n10000_e50000                        1.4242          0.1638           0.0216             702.1         N/A        N/A          N/A
gnn_h32_k2_n1000_e5000                          0.3369          0.0241           0.0084            2968.1         N/A        N/A          N/A
gnn_h32_k2_n100_e500                            0.2486          0.0119           0.0074            4022.6         N/A        N/A          N/A
gnn_h32_k2_n3000_e15000                         0.5595          0.0515           0.0113            1787.3         N/A        N/A          N/A
gnn_h32_k2_n300_e1500                           0.2619          0.0154           0.0079            3817.7         N/A        N/A          N/A
gnn_h64_k4_n10000_e50000                        5.2281          0.1635           0.0213             191.3         N/A        N/A          N/A
gnn_h64_k4_n1000_e5000                          0.8071          0.0256           0.0089            1239.0         N/A        N/A          N/A
gnn_h64_k4_n100_e500                            0.4081          0.0121           0.0072            2450.3         N/A        N/A          N/A
gnn_h64_k4_n3000_e15000                         1.7475          0.0505           0.0115             572.3         N/A        N/A          N/A
gnn_h64_k4_n300_e1500                           0.5100          0.0151           0.0079            1960.8         N/A        N/A          N/A
punet_h32_k2_heads4_layers2_n100_e500           0.4606          0.0119           0.0074            2171.1         N/A        N/A          N/A
punet_h32_k2_heads4_layers2_n300_e1500          0.5330          0.0152           0.0078            1876.2         N/A        N/A          N/A
simple_transformer                              0.1654          0.0083           0.0071            6045.7         N/A        N/A          N/A
simple_transformer_300                          0.1675          0.0095           0.0070            5971.7         N/A        N/A          N/A
transformer_L1000_B1                            0.2627          0.0139           0.0072            3807.1         N/A        N/A          N/A
transformer_d32_h2_L6_ff32_n10_s10              1.2587          0.0071           0.0073             794.5         N/A        N/A          N/A
transformer_d32_h2_L6_ff32_n20_s20              1.3502          0.0080           0.0083             740.6         N/A        N/A          N/A
transformer_d32_h2_L6_ff32_n30_s30              1.2624          0.0070           0.0083             792.1         N/A        N/A          N/A
transformer_d32_h2_L6_ff32_n40_s40              1.3739          0.0079           0.0090             727.9         N/A        N/A          N/A
transformer_d32_h2_L6_ff32_n50_s50              1.3545          0.0080           0.0095             738.3         N/A        N/A          N/A

@github-actions

Copy link
Copy Markdown

/runbenchmark (h100-47gb): Benchmark ✅ completed — results updated above. view run

@sanjibansg sanjibansg left a comment

Copy link
Copy Markdown
Member

Choose a reason for hiding this comment

The reason will be displayed to describe this comment to others. Learn more.

LGTM! Thanks for this implementation.

@sanjibansg
sanjibansg merged commit 552c556 into ML4EP:gpu/alpaka Aug 13, 2026
2 of 3 checks passed
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

Add GTest for Conv GPU SAME_UPPER autopad

2 participants