[llvm] 0037a63 - [SLP][NFC]Add extra test for add/shl transformation opportunity in reductions, NFC

via llvm-commits llvm-commits at lists.llvm.org
Tue Apr 14 07:52:52 PDT 2026


Author: Alexey Bataev
Date: 2026-04-14T10:52:48-04:00
New Revision: 0037a636fde9d9a426a18e8963a5bab016187a6c

URL: https://github.com/llvm/llvm-project/commit/0037a636fde9d9a426a18e8963a5bab016187a6c
DIFF: https://github.com/llvm/llvm-project/commit/0037a636fde9d9a426a18e8963a5bab016187a6c.diff

LOG: [SLP][NFC]Add extra test for add/shl transformation opportunity in reductions, NFC



Reviewers: 

Pull Request: https://github.com/llvm/llvm-project/pull/192072

Added: 
    llvm/test/Transforms/SLPVectorizer/X86/reduction-shl1-add-merge.ll

Modified: 
    

Removed: 
    


################################################################################
diff  --git a/llvm/test/Transforms/SLPVectorizer/X86/reduction-shl1-add-merge.ll b/llvm/test/Transforms/SLPVectorizer/X86/reduction-shl1-add-merge.ll
new file mode 100644
index 0000000000000..94f4f806b6687
--- /dev/null
+++ b/llvm/test/Transforms/SLPVectorizer/X86/reduction-shl1-add-merge.ll
@@ -0,0 +1,90 @@
+; NOTE: Assertions have been autogenerated by utils/update_test_checks.py UTC_ARGS: --version 6
+; RUN: opt -S --passes=slp-vectorizer -mtriple=x86_64-unknown-linux-gnu < %s | FileCheck %s
+
+define i32 @reduce_add_sub_shl(ptr %p, ptr %q, ptr %out) {
+; CHECK-LABEL: define i32 @reduce_add_sub_shl(
+; CHECK-SAME: ptr [[P:%.*]], ptr [[Q:%.*]], ptr [[OUT:%.*]]) {
+; CHECK-NEXT:  [[ENTRY:.*:]]
+; CHECK-NEXT:    [[GP0:%.*]] = getelementptr i32, ptr [[P]], i64 0
+; CHECK-NEXT:    [[GP4:%.*]] = getelementptr i32, ptr [[P]], i64 4
+; CHECK-NEXT:    [[GP5:%.*]] = getelementptr i32, ptr [[P]], i64 5
+; CHECK-NEXT:    [[GP6:%.*]] = getelementptr i32, ptr [[P]], i64 6
+; CHECK-NEXT:    [[GP7:%.*]] = getelementptr i32, ptr [[P]], i64 7
+; CHECK-NEXT:    [[GQ0:%.*]] = getelementptr i32, ptr [[Q]], i64 0
+; CHECK-NEXT:    [[LP4:%.*]] = load i32, ptr [[GP4]], align 4
+; CHECK-NEXT:    [[LP5:%.*]] = load i32, ptr [[GP5]], align 4
+; CHECK-NEXT:    [[TMP11:%.*]] = load i32, ptr [[GP6]], align 4
+; CHECK-NEXT:    [[LP7:%.*]] = load i32, ptr [[GP7]], align 4
+; CHECK-NEXT:    [[TMP0:%.*]] = load <4 x i32>, ptr [[GP0]], align 4
+; CHECK-NEXT:    [[TMP1:%.*]] = load <4 x i32>, ptr [[GQ0]], align 4
+; CHECK-NEXT:    [[TMP2:%.*]] = add <4 x i32> [[TMP0]], [[TMP1]]
+; CHECK-NEXT:    [[TMP3:%.*]] = extractelement <4 x i32> [[TMP2]], i32 0
+; CHECK-NEXT:    store volatile i32 [[TMP3]], ptr [[OUT]], align 4
+; CHECK-NEXT:    [[TMP4:%.*]] = extractelement <4 x i32> [[TMP2]], i32 1
+; CHECK-NEXT:    store volatile i32 [[TMP4]], ptr [[OUT]], align 4
+; CHECK-NEXT:    [[TMP5:%.*]] = extractelement <4 x i32> [[TMP2]], i32 2
+; CHECK-NEXT:    store volatile i32 [[TMP5]], ptr [[OUT]], align 4
+; CHECK-NEXT:    [[TMP6:%.*]] = extractelement <4 x i32> [[TMP2]], i32 3
+; CHECK-NEXT:    store volatile i32 [[TMP6]], ptr [[OUT]], align 4
+; CHECK-NEXT:    [[SHL1:%.*]] = shl i32 [[LP4]], 1
+; CHECK-NEXT:    [[SHL2:%.*]] = shl i32 [[LP5]], 1
+; CHECK-NEXT:    [[TMP12:%.*]] = call i32 @llvm.vector.reduce.add.v4i32(<4 x i32> [[TMP2]])
+; CHECK-NEXT:    [[OP_RDX4:%.*]] = add i32 [[TMP12]], [[TMP11]]
+; CHECK-NEXT:    [[OP_RDX1:%.*]] = add i32 [[LP7]], [[SHL1]]
+; CHECK-NEXT:    [[OP_RDX2:%.*]] = add i32 [[OP_RDX4]], [[OP_RDX1]]
+; CHECK-NEXT:    [[OP_RDX3:%.*]] = add i32 [[OP_RDX2]], [[SHL2]]
+; CHECK-NEXT:    ret i32 [[OP_RDX3]]
+;
+entry:
+  %gp0 = getelementptr i32, ptr %p, i64 0
+  %gp1 = getelementptr i32, ptr %p, i64 1
+  %gp2 = getelementptr i32, ptr %p, i64 2
+  %gp3 = getelementptr i32, ptr %p, i64 3
+  %gp4 = getelementptr i32, ptr %p, i64 4
+  %gp5 = getelementptr i32, ptr %p, i64 5
+  %gp6 = getelementptr i32, ptr %p, i64 6
+  %gp7 = getelementptr i32, ptr %p, i64 7
+
+  %gq0 = getelementptr i32, ptr %q, i64 0
+  %gq1 = getelementptr i32, ptr %q, i64 1
+  %gq2 = getelementptr i32, ptr %q, i64 2
+  %gq3 = getelementptr i32, ptr %q, i64 3
+
+  %lp0 = load i32, ptr %gp0, align 4
+  %lp1 = load i32, ptr %gp1, align 4
+  %lp2 = load i32, ptr %gp2, align 4
+  %lp3 = load i32, ptr %gp3, align 4
+  %lp4 = load i32, ptr %gp4, align 4
+  %lp5 = load i32, ptr %gp5, align 4
+  %lp6 = load i32, ptr %gp6, align 4
+  %lp7 = load i32, ptr %gp7, align 4
+
+  %lq0 = load i32, ptr %gq0, align 4
+  %lq1 = load i32, ptr %gq1, align 4
+  %lq2 = load i32, ptr %gq2, align 4
+  %lq3 = load i32, ptr %gq3, align 4
+
+  ; 4 adds (volatile stores give multi-use, prevent store vectorization)
+  %add1 = add i32 %lp0, %lq0
+  %add2 = add i32 %lp1, %lq1
+  %add3 = add i32 %lp2, %lq2
+  %add4 = add i32 %lp3, %lq3
+  store volatile i32 %add1, ptr %out, align 4
+  store volatile i32 %add2, ptr %out, align 4
+  store volatile i32 %add3, ptr %out, align 4
+  store volatile i32 %add4, ptr %out, align 4
+
+  ; 2 shls (natural leaves)
+  %shl1 = shl i32 %lp4, 1
+  %shl2 = shl i32 %lp5, 1
+
+  ; add reduction chain over all 8 values
+  %r1 = add i32 %add1, %add2
+  %r2 = add i32 %r1, %add3
+  %r3 = add i32 %r2, %add4
+  %r4 = add i32 %r3, %shl1
+  %r5 = add i32 %r4, %shl2
+  %r6 = add i32 %r5, %lp6
+  %result = add i32 %r6, %lp7
+  ret i32 %result
+}


        


More information about the llvm-commits mailing list