[llvm] 0037a63 - [SLP][NFC]Add extra test for add/shl transformation opportunity in reductions, NFC
via llvm-commits
llvm-commits at lists.llvm.org
Tue Apr 14 07:52:52 PDT 2026
Author: Alexey Bataev
Date: 2026-04-14T10:52:48-04:00
New Revision: 0037a636fde9d9a426a18e8963a5bab016187a6c
URL: https://github.com/llvm/llvm-project/commit/0037a636fde9d9a426a18e8963a5bab016187a6c
DIFF: https://github.com/llvm/llvm-project/commit/0037a636fde9d9a426a18e8963a5bab016187a6c.diff
LOG: [SLP][NFC]Add extra test for add/shl transformation opportunity in reductions, NFC
Reviewers:
Pull Request: https://github.com/llvm/llvm-project/pull/192072
Added:
llvm/test/Transforms/SLPVectorizer/X86/reduction-shl1-add-merge.ll
Modified:
Removed:
################################################################################
diff --git a/llvm/test/Transforms/SLPVectorizer/X86/reduction-shl1-add-merge.ll b/llvm/test/Transforms/SLPVectorizer/X86/reduction-shl1-add-merge.ll
new file mode 100644
index 0000000000000..94f4f806b6687
--- /dev/null
+++ b/llvm/test/Transforms/SLPVectorizer/X86/reduction-shl1-add-merge.ll
@@ -0,0 +1,90 @@
+; NOTE: Assertions have been autogenerated by utils/update_test_checks.py UTC_ARGS: --version 6
+; RUN: opt -S --passes=slp-vectorizer -mtriple=x86_64-unknown-linux-gnu < %s | FileCheck %s
+
+define i32 @reduce_add_sub_shl(ptr %p, ptr %q, ptr %out) {
+; CHECK-LABEL: define i32 @reduce_add_sub_shl(
+; CHECK-SAME: ptr [[P:%.*]], ptr [[Q:%.*]], ptr [[OUT:%.*]]) {
+; CHECK-NEXT: [[ENTRY:.*:]]
+; CHECK-NEXT: [[GP0:%.*]] = getelementptr i32, ptr [[P]], i64 0
+; CHECK-NEXT: [[GP4:%.*]] = getelementptr i32, ptr [[P]], i64 4
+; CHECK-NEXT: [[GP5:%.*]] = getelementptr i32, ptr [[P]], i64 5
+; CHECK-NEXT: [[GP6:%.*]] = getelementptr i32, ptr [[P]], i64 6
+; CHECK-NEXT: [[GP7:%.*]] = getelementptr i32, ptr [[P]], i64 7
+; CHECK-NEXT: [[GQ0:%.*]] = getelementptr i32, ptr [[Q]], i64 0
+; CHECK-NEXT: [[LP4:%.*]] = load i32, ptr [[GP4]], align 4
+; CHECK-NEXT: [[LP5:%.*]] = load i32, ptr [[GP5]], align 4
+; CHECK-NEXT: [[TMP11:%.*]] = load i32, ptr [[GP6]], align 4
+; CHECK-NEXT: [[LP7:%.*]] = load i32, ptr [[GP7]], align 4
+; CHECK-NEXT: [[TMP0:%.*]] = load <4 x i32>, ptr [[GP0]], align 4
+; CHECK-NEXT: [[TMP1:%.*]] = load <4 x i32>, ptr [[GQ0]], align 4
+; CHECK-NEXT: [[TMP2:%.*]] = add <4 x i32> [[TMP0]], [[TMP1]]
+; CHECK-NEXT: [[TMP3:%.*]] = extractelement <4 x i32> [[TMP2]], i32 0
+; CHECK-NEXT: store volatile i32 [[TMP3]], ptr [[OUT]], align 4
+; CHECK-NEXT: [[TMP4:%.*]] = extractelement <4 x i32> [[TMP2]], i32 1
+; CHECK-NEXT: store volatile i32 [[TMP4]], ptr [[OUT]], align 4
+; CHECK-NEXT: [[TMP5:%.*]] = extractelement <4 x i32> [[TMP2]], i32 2
+; CHECK-NEXT: store volatile i32 [[TMP5]], ptr [[OUT]], align 4
+; CHECK-NEXT: [[TMP6:%.*]] = extractelement <4 x i32> [[TMP2]], i32 3
+; CHECK-NEXT: store volatile i32 [[TMP6]], ptr [[OUT]], align 4
+; CHECK-NEXT: [[SHL1:%.*]] = shl i32 [[LP4]], 1
+; CHECK-NEXT: [[SHL2:%.*]] = shl i32 [[LP5]], 1
+; CHECK-NEXT: [[TMP12:%.*]] = call i32 @llvm.vector.reduce.add.v4i32(<4 x i32> [[TMP2]])
+; CHECK-NEXT: [[OP_RDX4:%.*]] = add i32 [[TMP12]], [[TMP11]]
+; CHECK-NEXT: [[OP_RDX1:%.*]] = add i32 [[LP7]], [[SHL1]]
+; CHECK-NEXT: [[OP_RDX2:%.*]] = add i32 [[OP_RDX4]], [[OP_RDX1]]
+; CHECK-NEXT: [[OP_RDX3:%.*]] = add i32 [[OP_RDX2]], [[SHL2]]
+; CHECK-NEXT: ret i32 [[OP_RDX3]]
+;
+entry:
+ %gp0 = getelementptr i32, ptr %p, i64 0
+ %gp1 = getelementptr i32, ptr %p, i64 1
+ %gp2 = getelementptr i32, ptr %p, i64 2
+ %gp3 = getelementptr i32, ptr %p, i64 3
+ %gp4 = getelementptr i32, ptr %p, i64 4
+ %gp5 = getelementptr i32, ptr %p, i64 5
+ %gp6 = getelementptr i32, ptr %p, i64 6
+ %gp7 = getelementptr i32, ptr %p, i64 7
+
+ %gq0 = getelementptr i32, ptr %q, i64 0
+ %gq1 = getelementptr i32, ptr %q, i64 1
+ %gq2 = getelementptr i32, ptr %q, i64 2
+ %gq3 = getelementptr i32, ptr %q, i64 3
+
+ %lp0 = load i32, ptr %gp0, align 4
+ %lp1 = load i32, ptr %gp1, align 4
+ %lp2 = load i32, ptr %gp2, align 4
+ %lp3 = load i32, ptr %gp3, align 4
+ %lp4 = load i32, ptr %gp4, align 4
+ %lp5 = load i32, ptr %gp5, align 4
+ %lp6 = load i32, ptr %gp6, align 4
+ %lp7 = load i32, ptr %gp7, align 4
+
+ %lq0 = load i32, ptr %gq0, align 4
+ %lq1 = load i32, ptr %gq1, align 4
+ %lq2 = load i32, ptr %gq2, align 4
+ %lq3 = load i32, ptr %gq3, align 4
+
+ ; 4 adds (volatile stores give multi-use, prevent store vectorization)
+ %add1 = add i32 %lp0, %lq0
+ %add2 = add i32 %lp1, %lq1
+ %add3 = add i32 %lp2, %lq2
+ %add4 = add i32 %lp3, %lq3
+ store volatile i32 %add1, ptr %out, align 4
+ store volatile i32 %add2, ptr %out, align 4
+ store volatile i32 %add3, ptr %out, align 4
+ store volatile i32 %add4, ptr %out, align 4
+
+ ; 2 shls (natural leaves)
+ %shl1 = shl i32 %lp4, 1
+ %shl2 = shl i32 %lp5, 1
+
+ ; add reduction chain over all 8 values
+ %r1 = add i32 %add1, %add2
+ %r2 = add i32 %r1, %add3
+ %r3 = add i32 %r2, %add4
+ %r4 = add i32 %r3, %shl1
+ %r5 = add i32 %r4, %shl2
+ %r6 = add i32 %r5, %lp6
+ %result = add i32 %r6, %lp7
+ ret i32 %result
+}
More information about the llvm-commits
mailing list