[llvm] [SCEV] - Add positive-stride predicate for backedge-taken count. (PR #222261)

Pawan Nirpal via llvm-commits llvm-commits at lists.llvm.org
Mon Sep 21 00:02:19 PDT 2026


https://github.com/pawan-nirpal-031 updated https://github.com/llvm/llvm-project/pull/222261

>From 94512d9cbfefe89c66297f333b561004b431ce27 Mon Sep 17 00:00:00 2001
From: Pawan Nirpal <pnirpal at qti.qualcomm.com>
Date: Wed, 9 Sep 2026 00:56:38 -0700
Subject: [PATCH 1/4] [SCEV] -  Add positive-stride predicate for
 backedge-taken count.

---
 llvm/lib/Analysis/ScalarEvolution.cpp         | 17 ++++-
 .../trip-count-variable-stride-predicate.ll   | 53 +++++++++++++
 .../RISCV/scev-variable-stride-predicate.ll   | 75 +++++++++++++++++++
 3 files changed, 142 insertions(+), 3 deletions(-)
 create mode 100644 llvm/test/Analysis/ScalarEvolution/trip-count-variable-stride-predicate.ll
 create mode 100644 llvm/test/Transforms/LoopVectorize/RISCV/scev-variable-stride-predicate.ll

diff --git a/llvm/lib/Analysis/ScalarEvolution.cpp b/llvm/lib/Analysis/ScalarEvolution.cpp
index 9211b3d60b6ed..0fd5033a50e46 100644
--- a/llvm/lib/Analysis/ScalarEvolution.cpp
+++ b/llvm/lib/Analysis/ScalarEvolution.cpp
@@ -13467,11 +13467,22 @@ ScalarEvolution::howManyLessThans(const SCEV *LHS, const SCEV *RHS,
     // The positive stride case is the same as isKnownPositive(Stride) returning
     // true (original behavior of the function).
     //
-    if (PredicatedIV || !NoWrap || !loopIsFiniteByAssumption(L) ||
-        !loopHasNoAbnormalExits(L))
+    if (PredicatedIV || !NoWrap || !loopHasNoAbnormalExits(L))
       return getCouldNotCompute();
 
-    if (!isKnownNonZero(Stride)) {
+    if (!loopIsFiniteByAssumption(L)) {
+      // If we cannot prove the loop is finite but predicates are allowed,
+      // we can add a predicate that the stride is positive. This ensures
+      // the loop makes forward progress and the BTC formula is correct.
+      // The predicate will be emitted as a runtime check by the consumer
+      // (e.g., the loop vectorizer), guarding the optimized loop version.
+      if (!AllowPredicates || !isLoopInvariant(Stride, L))
+        return getCouldNotCompute();
+
+      const SCEV *Zero = getZero(Stride->getType());
+      auto *P = getComparePredicate(ICmpInst::ICMP_SGT, Stride, Zero);
+      Predicates.push_back(P);
+    } else if (!isKnownNonZero(Stride)) {
       // If we have a step of zero, and RHS isn't invariant in L, we don't know
       // if it might eventually be greater than start and if so, on which
       // iteration.  We can't even produce a useful upper bound.
diff --git a/llvm/test/Analysis/ScalarEvolution/trip-count-variable-stride-predicate.ll b/llvm/test/Analysis/ScalarEvolution/trip-count-variable-stride-predicate.ll
new file mode 100644
index 0000000000000..9a986261de40f
--- /dev/null
+++ b/llvm/test/Analysis/ScalarEvolution/trip-count-variable-stride-predicate.ll
@@ -0,0 +1,53 @@
+; NOTE: Assertions have been autogenerated by utils/update_analyze_test_checks.py UTC_ARGS: --version 4
+; RUN: opt < %s -disable-output "-passes=print<scalar-evolution>" -scalar-evolution-classify-expressions=0 2>&1 | FileCheck %s
+
+define void @variable_stride_predicated_scev(i32 %n, ptr noalias %a, ptr noalias %b, ptr noalias %c, i32 %inc) #0 {
+; CHECK-LABEL: 'variable_stride_predicated_scev'
+; CHECK-NEXT:  Determining loop execution counts for: @variable_stride_predicated_scev
+; CHECK-NEXT:  Loop %if.end: Unpredictable backedge-taken count.
+; CHECK-NEXT:  Loop %if.end: Unpredictable constant max backedge-taken count.
+; CHECK-NEXT:  Loop %if.end: Unpredictable symbolic max backedge-taken count.
+; CHECK-NEXT:  Loop %if.end: Predicated backedge-taken count is ((-1 + ((zext i32 %n to i64) smax (sext i32 %inc to i64)))<nsw> /u (sext i32 %inc to i64))
+; CHECK-NEXT:   Predicates:
+; CHECK-NEXT:      Compare predicate: (sext i32 %inc to i64) sgt) 0
+; CHECK-NEXT:  Loop %if.end: Predicated constant max backedge-taken count is i64 6442450943
+; CHECK-NEXT:   Predicates:
+; CHECK-NEXT:      Compare predicate: (sext i32 %inc to i64) sgt) 0
+; CHECK-NEXT:  Loop %if.end: Predicated symbolic max backedge-taken count is ((-1 + ((zext i32 %n to i64) smax (sext i32 %inc to i64)))<nsw> /u (sext i32 %inc to i64))
+; CHECK-NEXT:   Predicates:
+; CHECK-NEXT:      Compare predicate: (sext i32 %inc to i64) sgt) 0
+;
+entry:
+  %cmp.not14 = icmp sgt i32 %n, 0
+  br i1 %cmp.not14, label %if.end.preheader, label %L20
+
+if.end.preheader:                                 ; preds = %entry
+  %0 = sext i32 %inc to i64
+  %1 = zext nneg i32 %n to i64
+  br label %if.end
+
+if.end:                                           ; preds = %if.end.preheader, %if.end
+  %indvars.iv = phi i64 [ 0, %if.end.preheader ], [ %indvars.iv.next, %if.end ]
+  %arrayidx = getelementptr inbounds [4 x i8], ptr %a, i64 %indvars.iv
+  %2 = load i32, ptr %arrayidx, align 4, !tbaa !13
+  %arrayidx2 = getelementptr inbounds [4 x i8], ptr %b, i64 %indvars.iv
+  %3 = load i32, ptr %arrayidx2, align 4, !tbaa !13
+  %arrayidx4 = getelementptr inbounds [4 x i8], ptr %c, i64 %indvars.iv
+  %4 = load i32, ptr %arrayidx4, align 4, !tbaa !13
+  %mul = mul nsw i32 %4, %3
+  %add = add nsw i32 %mul, %2
+  store i32 %add, ptr %arrayidx, align 4, !tbaa !13
+  %indvars.iv.next = add nsw i64 %indvars.iv, %0
+  %cmp.not = icmp slt i64 %indvars.iv.next, %1
+  br i1 %cmp.not, label %if.end, label %L20
+
+L20:                                              ; preds = %if.end, %entry
+  ret void
+}
+
+attributes #0 = { nofree norecurse nosync nounwind memory(argmem: readwrite) uwtable vscale_range(4,1024) "no-trapping-math"="true" "stack-protector-buffer-size"="8" "target-cpu"="spacemit-x60" "target-features"="+64bit,+v" }
+
+!10 = !{!"int", !11, i64 0}
+!11 = !{!"omnipotent char", !12, i64 0}
+!12 = !{!"Simple C/C++ TBAA"}
+!13 = !{!10, !10, i64 0}
diff --git a/llvm/test/Transforms/LoopVectorize/RISCV/scev-variable-stride-predicate.ll b/llvm/test/Transforms/LoopVectorize/RISCV/scev-variable-stride-predicate.ll
new file mode 100644
index 0000000000000..e68784e3388f3
--- /dev/null
+++ b/llvm/test/Transforms/LoopVectorize/RISCV/scev-variable-stride-predicate.ll
@@ -0,0 +1,75 @@
+; NOTE: Assertions have been autogenerated by utils/update_test_checks.py UTC_ARGS: --check-globals none --filter-out-after "scalar.ph:" --version 5
+; RUN: opt -passes=loop-vectorize -mtriple=riscv64 -S %s | FileCheck %s
+
+define void @variable_stride_predicated_vectorize(i32 %n, ptr noalias %a, ptr noalias %b, ptr noalias %c, i32 %inc) #0 {
+; CHECK-LABEL: define void @variable_stride_predicated_vectorize(
+; CHECK-SAME: i32 [[N:%.*]], ptr noalias [[A:%.*]], ptr noalias [[B:%.*]], ptr noalias [[C:%.*]], i32 [[INC:%.*]]) #[[ATTR0:[0-9]+]] {
+; CHECK-NEXT:  [[ENTRY:.*:]]
+; CHECK-NEXT:    [[CMP_NOT14:%.*]] = icmp sgt i32 [[N]], 0
+; CHECK-NEXT:    br i1 [[CMP_NOT14]], label %[[IF_END_PREHEADER:.*]], [[L20:label %.*]]
+; CHECK:       [[IF_END_PREHEADER]]:
+; CHECK-NEXT:    [[TMP0:%.*]] = sext i32 [[INC]] to i64
+; CHECK-NEXT:    [[TMP1:%.*]] = zext nneg i32 [[N]] to i64
+; CHECK-NEXT:    [[TMP2:%.*]] = call i64 @llvm.smax.i64(i64 [[TMP1]], i64 1)
+; CHECK-NEXT:    br label %[[VECTOR_SCEVCHECK:.*]]
+; CHECK:       [[VECTOR_SCEVCHECK]]:
+; CHECK-NEXT:    [[IDENT_CHECK2:%.*]] = icmp ne i32 [[INC]], 1
+; CHECK-NEXT:    br i1 [[IDENT_CHECK2]], label %[[SCALAR_PH:.*]], label %[[VECTOR_PH:.*]]
+; CHECK:       [[VECTOR_PH]]:
+; CHECK-NEXT:    br label %[[VECTOR_BODY:.*]]
+; CHECK:       [[VECTOR_BODY]]:
+; CHECK-NEXT:    [[INDEX:%.*]] = phi i64 [ 0, %[[VECTOR_PH]] ], [ [[CURRENT_ITERATION_NEXT:%.*]], %[[VECTOR_BODY]] ]
+; CHECK-NEXT:    [[AVL:%.*]] = phi i64 [ [[TMP2]], %[[VECTOR_PH]] ], [ [[AVL_NEXT:%.*]], %[[VECTOR_BODY]] ]
+; CHECK-NEXT:    [[TMP3:%.*]] = call i32 @llvm.experimental.get.vector.length.i64(i64 [[AVL]], i32 4, i1 true)
+; CHECK-NEXT:    [[TMP4:%.*]] = getelementptr inbounds [4 x i8], ptr [[A]], i64 [[INDEX]]
+; CHECK-NEXT:    [[VP_OP_LOAD:%.*]] = call <vscale x 4 x i32> @llvm.vp.load.nxv4i32.p0(ptr align 4 [[TMP4]], <vscale x 4 x i1> splat (i1 true), i32 [[TMP3]]), !tbaa [[TBAA0:![0-9]+]]
+; CHECK-NEXT:    [[TMP5:%.*]] = getelementptr inbounds [4 x i8], ptr [[B]], i64 [[INDEX]]
+; CHECK-NEXT:    [[VP_OP_LOAD4:%.*]] = call <vscale x 4 x i32> @llvm.vp.load.nxv4i32.p0(ptr align 4 [[TMP5]], <vscale x 4 x i1> splat (i1 true), i32 [[TMP3]]), !tbaa [[TBAA0]]
+; CHECK-NEXT:    [[TMP6:%.*]] = getelementptr inbounds [4 x i8], ptr [[C]], i64 [[INDEX]]
+; CHECK-NEXT:    [[VP_OP_LOAD5:%.*]] = call <vscale x 4 x i32> @llvm.vp.load.nxv4i32.p0(ptr align 4 [[TMP6]], <vscale x 4 x i1> splat (i1 true), i32 [[TMP3]]), !tbaa [[TBAA0]]
+; CHECK-NEXT:    [[TMP7:%.*]] = mul nsw <vscale x 4 x i32> [[VP_OP_LOAD5]], [[VP_OP_LOAD4]]
+; CHECK-NEXT:    [[TMP8:%.*]] = add nsw <vscale x 4 x i32> [[TMP7]], [[VP_OP_LOAD]]
+; CHECK-NEXT:    call void @llvm.vp.store.nxv4i32.p0(<vscale x 4 x i32> [[TMP8]], ptr align 4 [[TMP4]], <vscale x 4 x i1> splat (i1 true), i32 [[TMP3]]), !tbaa [[TBAA0]]
+; CHECK-NEXT:    [[TMP9:%.*]] = zext i32 [[TMP3]] to i64
+; CHECK-NEXT:    [[CURRENT_ITERATION_NEXT]] = add i64 [[TMP9]], [[INDEX]]
+; CHECK-NEXT:    [[AVL_NEXT]] = sub nuw i64 [[AVL]], [[TMP9]]
+; CHECK-NEXT:    [[TMP10:%.*]] = icmp eq i64 [[AVL_NEXT]], 0
+; CHECK-NEXT:    br i1 [[TMP10]], label %[[MIDDLE_BLOCK:.*]], label %[[VECTOR_BODY]], !llvm.loop [[LOOP4:![0-9]+]]
+; CHECK:       [[MIDDLE_BLOCK]]:
+; CHECK-NEXT:    br [[L20_LOOPEXIT:label %.*]]
+; CHECK:       [[SCALAR_PH]]:
+;
+entry:
+  %cmp.not14 = icmp sgt i32 %n, 0
+  br i1 %cmp.not14, label %if.end.preheader, label %L20
+
+if.end.preheader:                                 ; preds = %entry
+  %0 = sext i32 %inc to i64
+  %1 = zext nneg i32 %n to i64
+  br label %if.end
+
+if.end:                                           ; preds = %if.end.preheader, %if.end
+  %indvars.iv = phi i64 [ 0, %if.end.preheader ], [ %indvars.iv.next, %if.end ]
+  %arrayidx = getelementptr inbounds [4 x i8], ptr %a, i64 %indvars.iv
+  %2 = load i32, ptr %arrayidx, align 4, !tbaa !13
+  %arrayidx2 = getelementptr inbounds [4 x i8], ptr %b, i64 %indvars.iv
+  %3 = load i32, ptr %arrayidx2, align 4, !tbaa !13
+  %arrayidx4 = getelementptr inbounds [4 x i8], ptr %c, i64 %indvars.iv
+  %4 = load i32, ptr %arrayidx4, align 4, !tbaa !13
+  %mul = mul nsw i32 %4, %3
+  %add = add nsw i32 %mul, %2
+  store i32 %add, ptr %arrayidx, align 4, !tbaa !13
+  %indvars.iv.next = add nsw i64 %indvars.iv, %0
+  %cmp.not = icmp slt i64 %indvars.iv.next, %1
+  br i1 %cmp.not, label %if.end, label %L20
+
+L20:                                              ; preds = %if.end, %entry
+  ret void
+}
+
+attributes #0 = { nofree norecurse nosync nounwind memory(argmem: readwrite) vscale_range(4,1024) "target-cpu"="generic-rv64" "target-features"="+64bit,+d,+f,+m,+v,+zicsr,+zve32f,+zve32x,+zve64d,+zve64f,+zve64x,+zvl128b,+zvl32b,+zvl64b" }
+
+!10 = !{!"int", !11, i64 0}
+!11 = !{!"omnipotent char", !12, i64 0}
+!12 = !{!"Simple C/C++ TBAA"}
+!13 = !{!10, !10, i64 0}

>From ae63064ae124efb636b330aaeb710db10fbfd10d Mon Sep 17 00:00:00 2001
From: Pawan Nirpal <pnirpal at qti.qualcomm.com>
Date: Wed, 9 Sep 2026 06:58:49 -0700
Subject: [PATCH 2/4] reduce tests and general clean-up

---
 .../trip-count-variable-stride-predicate.ll   | 62 +++++----------
 .../RISCV/scev-variable-stride-predicate.ll   | 75 -------------------
 .../scev-variable-stride-predicate.ll         | 51 +++++++++++++
 3 files changed, 71 insertions(+), 117 deletions(-)
 delete mode 100644 llvm/test/Transforms/LoopVectorize/RISCV/scev-variable-stride-predicate.ll
 create mode 100644 llvm/test/Transforms/LoopVectorize/scev-variable-stride-predicate.ll

diff --git a/llvm/test/Analysis/ScalarEvolution/trip-count-variable-stride-predicate.ll b/llvm/test/Analysis/ScalarEvolution/trip-count-variable-stride-predicate.ll
index 9a986261de40f..80c85103f288d 100644
--- a/llvm/test/Analysis/ScalarEvolution/trip-count-variable-stride-predicate.ll
+++ b/llvm/test/Analysis/ScalarEvolution/trip-count-variable-stride-predicate.ll
@@ -1,53 +1,31 @@
-; NOTE: Assertions have been autogenerated by utils/update_analyze_test_checks.py UTC_ARGS: --version 4
+; NOTE: Assertions have been autogenerated by utils/update_analyze_test_checks.py UTC_ARGS: --version 6
 ; RUN: opt < %s -disable-output "-passes=print<scalar-evolution>" -scalar-evolution-classify-expressions=0 2>&1 | FileCheck %s
 
-define void @variable_stride_predicated_scev(i32 %n, ptr noalias %a, ptr noalias %b, ptr noalias %c, i32 %inc) #0 {
-; CHECK-LABEL: 'variable_stride_predicated_scev'
-; CHECK-NEXT:  Determining loop execution counts for: @variable_stride_predicated_scev
-; CHECK-NEXT:  Loop %if.end: Unpredictable backedge-taken count.
-; CHECK-NEXT:  Loop %if.end: Unpredictable constant max backedge-taken count.
-; CHECK-NEXT:  Loop %if.end: Unpredictable symbolic max backedge-taken count.
-; CHECK-NEXT:  Loop %if.end: Predicated backedge-taken count is ((-1 + ((zext i32 %n to i64) smax (sext i32 %inc to i64)))<nsw> /u (sext i32 %inc to i64))
+define void @variable_stride_no_mustprogress(i64 %n, i64 %stride) {
+; CHECK-LABEL: 'variable_stride_no_mustprogress'
+; CHECK-NEXT:  Determining loop execution counts for: @variable_stride_no_mustprogress
+; CHECK-NEXT:  Loop %loop: Unpredictable backedge-taken count.
+; CHECK-NEXT:  Loop %loop: Unpredictable constant max backedge-taken count.
+; CHECK-NEXT:  Loop %loop: Unpredictable symbolic max backedge-taken count.
+; CHECK-NEXT:  Loop %loop: Predicated backedge-taken count is ((-1 + (%n smax %stride)) /u %stride)
 ; CHECK-NEXT:   Predicates:
-; CHECK-NEXT:      Compare predicate: (sext i32 %inc to i64) sgt) 0
-; CHECK-NEXT:  Loop %if.end: Predicated constant max backedge-taken count is i64 6442450943
+; CHECK-NEXT:      Compare predicate: %stride sgt) 0
+; CHECK-NEXT:  Loop %loop: Predicated constant max backedge-taken count is i64 -1
 ; CHECK-NEXT:   Predicates:
-; CHECK-NEXT:      Compare predicate: (sext i32 %inc to i64) sgt) 0
-; CHECK-NEXT:  Loop %if.end: Predicated symbolic max backedge-taken count is ((-1 + ((zext i32 %n to i64) smax (sext i32 %inc to i64)))<nsw> /u (sext i32 %inc to i64))
+; CHECK-NEXT:      Compare predicate: %stride sgt) 0
+; CHECK-NEXT:  Loop %loop: Predicated symbolic max backedge-taken count is ((-1 + (%n smax %stride)) /u %stride)
 ; CHECK-NEXT:   Predicates:
-; CHECK-NEXT:      Compare predicate: (sext i32 %inc to i64) sgt) 0
+; CHECK-NEXT:      Compare predicate: %stride sgt) 0
 ;
 entry:
-  %cmp.not14 = icmp sgt i32 %n, 0
-  br i1 %cmp.not14, label %if.end.preheader, label %L20
+  br label %loop
 
-if.end.preheader:                                 ; preds = %entry
-  %0 = sext i32 %inc to i64
-  %1 = zext nneg i32 %n to i64
-  br label %if.end
+loop:
+  %iv = phi i64 [ 0, %entry ], [ %iv.next, %loop ]
+  %iv.next = add nsw i64 %iv, %stride
+  %cmp = icmp slt i64 %iv.next, %n
+  br i1 %cmp, label %loop, label %exit
 
-if.end:                                           ; preds = %if.end.preheader, %if.end
-  %indvars.iv = phi i64 [ 0, %if.end.preheader ], [ %indvars.iv.next, %if.end ]
-  %arrayidx = getelementptr inbounds [4 x i8], ptr %a, i64 %indvars.iv
-  %2 = load i32, ptr %arrayidx, align 4, !tbaa !13
-  %arrayidx2 = getelementptr inbounds [4 x i8], ptr %b, i64 %indvars.iv
-  %3 = load i32, ptr %arrayidx2, align 4, !tbaa !13
-  %arrayidx4 = getelementptr inbounds [4 x i8], ptr %c, i64 %indvars.iv
-  %4 = load i32, ptr %arrayidx4, align 4, !tbaa !13
-  %mul = mul nsw i32 %4, %3
-  %add = add nsw i32 %mul, %2
-  store i32 %add, ptr %arrayidx, align 4, !tbaa !13
-  %indvars.iv.next = add nsw i64 %indvars.iv, %0
-  %cmp.not = icmp slt i64 %indvars.iv.next, %1
-  br i1 %cmp.not, label %if.end, label %L20
-
-L20:                                              ; preds = %if.end, %entry
+exit:
   ret void
 }
-
-attributes #0 = { nofree norecurse nosync nounwind memory(argmem: readwrite) uwtable vscale_range(4,1024) "no-trapping-math"="true" "stack-protector-buffer-size"="8" "target-cpu"="spacemit-x60" "target-features"="+64bit,+v" }
-
-!10 = !{!"int", !11, i64 0}
-!11 = !{!"omnipotent char", !12, i64 0}
-!12 = !{!"Simple C/C++ TBAA"}
-!13 = !{!10, !10, i64 0}
diff --git a/llvm/test/Transforms/LoopVectorize/RISCV/scev-variable-stride-predicate.ll b/llvm/test/Transforms/LoopVectorize/RISCV/scev-variable-stride-predicate.ll
deleted file mode 100644
index e68784e3388f3..0000000000000
--- a/llvm/test/Transforms/LoopVectorize/RISCV/scev-variable-stride-predicate.ll
+++ /dev/null
@@ -1,75 +0,0 @@
-; NOTE: Assertions have been autogenerated by utils/update_test_checks.py UTC_ARGS: --check-globals none --filter-out-after "scalar.ph:" --version 5
-; RUN: opt -passes=loop-vectorize -mtriple=riscv64 -S %s | FileCheck %s
-
-define void @variable_stride_predicated_vectorize(i32 %n, ptr noalias %a, ptr noalias %b, ptr noalias %c, i32 %inc) #0 {
-; CHECK-LABEL: define void @variable_stride_predicated_vectorize(
-; CHECK-SAME: i32 [[N:%.*]], ptr noalias [[A:%.*]], ptr noalias [[B:%.*]], ptr noalias [[C:%.*]], i32 [[INC:%.*]]) #[[ATTR0:[0-9]+]] {
-; CHECK-NEXT:  [[ENTRY:.*:]]
-; CHECK-NEXT:    [[CMP_NOT14:%.*]] = icmp sgt i32 [[N]], 0
-; CHECK-NEXT:    br i1 [[CMP_NOT14]], label %[[IF_END_PREHEADER:.*]], [[L20:label %.*]]
-; CHECK:       [[IF_END_PREHEADER]]:
-; CHECK-NEXT:    [[TMP0:%.*]] = sext i32 [[INC]] to i64
-; CHECK-NEXT:    [[TMP1:%.*]] = zext nneg i32 [[N]] to i64
-; CHECK-NEXT:    [[TMP2:%.*]] = call i64 @llvm.smax.i64(i64 [[TMP1]], i64 1)
-; CHECK-NEXT:    br label %[[VECTOR_SCEVCHECK:.*]]
-; CHECK:       [[VECTOR_SCEVCHECK]]:
-; CHECK-NEXT:    [[IDENT_CHECK2:%.*]] = icmp ne i32 [[INC]], 1
-; CHECK-NEXT:    br i1 [[IDENT_CHECK2]], label %[[SCALAR_PH:.*]], label %[[VECTOR_PH:.*]]
-; CHECK:       [[VECTOR_PH]]:
-; CHECK-NEXT:    br label %[[VECTOR_BODY:.*]]
-; CHECK:       [[VECTOR_BODY]]:
-; CHECK-NEXT:    [[INDEX:%.*]] = phi i64 [ 0, %[[VECTOR_PH]] ], [ [[CURRENT_ITERATION_NEXT:%.*]], %[[VECTOR_BODY]] ]
-; CHECK-NEXT:    [[AVL:%.*]] = phi i64 [ [[TMP2]], %[[VECTOR_PH]] ], [ [[AVL_NEXT:%.*]], %[[VECTOR_BODY]] ]
-; CHECK-NEXT:    [[TMP3:%.*]] = call i32 @llvm.experimental.get.vector.length.i64(i64 [[AVL]], i32 4, i1 true)
-; CHECK-NEXT:    [[TMP4:%.*]] = getelementptr inbounds [4 x i8], ptr [[A]], i64 [[INDEX]]
-; CHECK-NEXT:    [[VP_OP_LOAD:%.*]] = call <vscale x 4 x i32> @llvm.vp.load.nxv4i32.p0(ptr align 4 [[TMP4]], <vscale x 4 x i1> splat (i1 true), i32 [[TMP3]]), !tbaa [[TBAA0:![0-9]+]]
-; CHECK-NEXT:    [[TMP5:%.*]] = getelementptr inbounds [4 x i8], ptr [[B]], i64 [[INDEX]]
-; CHECK-NEXT:    [[VP_OP_LOAD4:%.*]] = call <vscale x 4 x i32> @llvm.vp.load.nxv4i32.p0(ptr align 4 [[TMP5]], <vscale x 4 x i1> splat (i1 true), i32 [[TMP3]]), !tbaa [[TBAA0]]
-; CHECK-NEXT:    [[TMP6:%.*]] = getelementptr inbounds [4 x i8], ptr [[C]], i64 [[INDEX]]
-; CHECK-NEXT:    [[VP_OP_LOAD5:%.*]] = call <vscale x 4 x i32> @llvm.vp.load.nxv4i32.p0(ptr align 4 [[TMP6]], <vscale x 4 x i1> splat (i1 true), i32 [[TMP3]]), !tbaa [[TBAA0]]
-; CHECK-NEXT:    [[TMP7:%.*]] = mul nsw <vscale x 4 x i32> [[VP_OP_LOAD5]], [[VP_OP_LOAD4]]
-; CHECK-NEXT:    [[TMP8:%.*]] = add nsw <vscale x 4 x i32> [[TMP7]], [[VP_OP_LOAD]]
-; CHECK-NEXT:    call void @llvm.vp.store.nxv4i32.p0(<vscale x 4 x i32> [[TMP8]], ptr align 4 [[TMP4]], <vscale x 4 x i1> splat (i1 true), i32 [[TMP3]]), !tbaa [[TBAA0]]
-; CHECK-NEXT:    [[TMP9:%.*]] = zext i32 [[TMP3]] to i64
-; CHECK-NEXT:    [[CURRENT_ITERATION_NEXT]] = add i64 [[TMP9]], [[INDEX]]
-; CHECK-NEXT:    [[AVL_NEXT]] = sub nuw i64 [[AVL]], [[TMP9]]
-; CHECK-NEXT:    [[TMP10:%.*]] = icmp eq i64 [[AVL_NEXT]], 0
-; CHECK-NEXT:    br i1 [[TMP10]], label %[[MIDDLE_BLOCK:.*]], label %[[VECTOR_BODY]], !llvm.loop [[LOOP4:![0-9]+]]
-; CHECK:       [[MIDDLE_BLOCK]]:
-; CHECK-NEXT:    br [[L20_LOOPEXIT:label %.*]]
-; CHECK:       [[SCALAR_PH]]:
-;
-entry:
-  %cmp.not14 = icmp sgt i32 %n, 0
-  br i1 %cmp.not14, label %if.end.preheader, label %L20
-
-if.end.preheader:                                 ; preds = %entry
-  %0 = sext i32 %inc to i64
-  %1 = zext nneg i32 %n to i64
-  br label %if.end
-
-if.end:                                           ; preds = %if.end.preheader, %if.end
-  %indvars.iv = phi i64 [ 0, %if.end.preheader ], [ %indvars.iv.next, %if.end ]
-  %arrayidx = getelementptr inbounds [4 x i8], ptr %a, i64 %indvars.iv
-  %2 = load i32, ptr %arrayidx, align 4, !tbaa !13
-  %arrayidx2 = getelementptr inbounds [4 x i8], ptr %b, i64 %indvars.iv
-  %3 = load i32, ptr %arrayidx2, align 4, !tbaa !13
-  %arrayidx4 = getelementptr inbounds [4 x i8], ptr %c, i64 %indvars.iv
-  %4 = load i32, ptr %arrayidx4, align 4, !tbaa !13
-  %mul = mul nsw i32 %4, %3
-  %add = add nsw i32 %mul, %2
-  store i32 %add, ptr %arrayidx, align 4, !tbaa !13
-  %indvars.iv.next = add nsw i64 %indvars.iv, %0
-  %cmp.not = icmp slt i64 %indvars.iv.next, %1
-  br i1 %cmp.not, label %if.end, label %L20
-
-L20:                                              ; preds = %if.end, %entry
-  ret void
-}
-
-attributes #0 = { nofree norecurse nosync nounwind memory(argmem: readwrite) vscale_range(4,1024) "target-cpu"="generic-rv64" "target-features"="+64bit,+d,+f,+m,+v,+zicsr,+zve32f,+zve32x,+zve64d,+zve64f,+zve64x,+zvl128b,+zvl32b,+zvl64b" }
-
-!10 = !{!"int", !11, i64 0}
-!11 = !{!"omnipotent char", !12, i64 0}
-!12 = !{!"Simple C/C++ TBAA"}
-!13 = !{!10, !10, i64 0}
diff --git a/llvm/test/Transforms/LoopVectorize/scev-variable-stride-predicate.ll b/llvm/test/Transforms/LoopVectorize/scev-variable-stride-predicate.ll
new file mode 100644
index 0000000000000..72f078ff22f6d
--- /dev/null
+++ b/llvm/test/Transforms/LoopVectorize/scev-variable-stride-predicate.ll
@@ -0,0 +1,51 @@
+; NOTE: Assertions have been autogenerated by utils/update_test_checks.py UTC_ARGS: --check-globals none --filter-out-after "scalar.ph:" --version 6
+; RUN: opt -passes=loop-vectorize -force-vector-width=4 -force-vector-interleave=1 -S %s | FileCheck %s
+
+define void @variable_stride_predicate(i64 %n, ptr noalias %a, ptr noalias %b, i64 %stride) {
+; CHECK-LABEL: define void @variable_stride_predicate(
+; CHECK-SAME: i64 [[N:%.*]], ptr noalias [[A:%.*]], ptr noalias [[B:%.*]], i64 [[STRIDE:%.*]]) {
+; CHECK-NEXT:  [[ENTRY:.*:]]
+; CHECK-NEXT:    [[TMP0:%.*]] = call i64 @llvm.smax.i64(i64 [[N]], i64 1)
+; CHECK-NEXT:    [[MIN_ITERS_CHECK:%.*]] = icmp ult i64 [[TMP0]], 4
+; CHECK-NEXT:    br i1 [[MIN_ITERS_CHECK]], label %[[SCALAR_PH:.*]], label %[[VECTOR_SCEVCHECK:.*]]
+; CHECK:       [[VECTOR_SCEVCHECK]]:
+; CHECK-NEXT:    [[IDENT_CHECK2:%.*]] = icmp ne i64 [[STRIDE]], 1
+; CHECK-NEXT:    br i1 [[IDENT_CHECK2]], label %[[SCALAR_PH]], label %[[VECTOR_PH:.*]]
+; CHECK:       [[VECTOR_PH]]:
+; CHECK-NEXT:    [[TMP1:%.*]] = and i64 [[TMP0]], 3
+; CHECK-NEXT:    [[N_VEC:%.*]] = sub i64 [[TMP0]], [[TMP1]]
+; CHECK-NEXT:    br label %[[VECTOR_BODY:.*]]
+; CHECK:       [[VECTOR_BODY]]:
+; CHECK-NEXT:    [[INDEX:%.*]] = phi i64 [ 0, %[[VECTOR_PH]] ], [ [[INDEX_NEXT:%.*]], %[[VECTOR_BODY]] ]
+; CHECK-NEXT:    [[TMP2:%.*]] = getelementptr inbounds i32, ptr [[A]], i64 [[INDEX]]
+; CHECK-NEXT:    [[WIDE_LOAD:%.*]] = load <4 x i32>, ptr [[TMP2]], align 4
+; CHECK-NEXT:    [[TMP3:%.*]] = getelementptr inbounds i32, ptr [[B]], i64 [[INDEX]]
+; CHECK-NEXT:    [[WIDE_LOAD4:%.*]] = load <4 x i32>, ptr [[TMP3]], align 4
+; CHECK-NEXT:    [[TMP4:%.*]] = add nsw <4 x i32> [[WIDE_LOAD]], [[WIDE_LOAD4]]
+; CHECK-NEXT:    store <4 x i32> [[TMP4]], ptr [[TMP2]], align 4
+; CHECK-NEXT:    [[INDEX_NEXT]] = add nuw i64 [[INDEX]], 4
+; CHECK-NEXT:    [[TMP5:%.*]] = icmp eq i64 [[INDEX_NEXT]], [[N_VEC]]
+; CHECK-NEXT:    br i1 [[TMP5]], label %[[MIDDLE_BLOCK:.*]], label %[[VECTOR_BODY]], !llvm.loop [[LOOP0:![0-9]+]]
+; CHECK:       [[MIDDLE_BLOCK]]:
+; CHECK-NEXT:    [[CMP_N:%.*]] = icmp eq i64 [[TMP0]], [[N_VEC]]
+; CHECK-NEXT:    br i1 [[CMP_N]], [[EXIT:label %.*]], label %[[SCALAR_PH]]
+; CHECK:       [[SCALAR_PH]]:
+;
+entry:
+  br label %loop
+
+loop:
+  %iv = phi i64 [ 0, %entry ], [ %iv.next, %loop ]
+  %gep.a = getelementptr inbounds i32, ptr %a, i64 %iv
+  %load.a = load i32, ptr %gep.a, align 4
+  %gep.b = getelementptr inbounds i32, ptr %b, i64 %iv
+  %load.b = load i32, ptr %gep.b, align 4
+  %add = add nsw i32 %load.a, %load.b
+  store i32 %add, ptr %gep.a, align 4
+  %iv.next = add nsw i64 %iv, %stride
+  %cmp = icmp slt i64 %iv.next, %n
+  br i1 %cmp, label %loop, label %exit
+
+exit:
+  ret void
+}

>From 8a605d6b974d4ef3543180731717685eee3792e4 Mon Sep 17 00:00:00 2001
From: Pawan Nirpal <pawannirpal at gmail.com>
Date: Fri, 18 Sep 2026 13:29:47 +0530
Subject: [PATCH 3/4] Update llvm/lib/Analysis/ScalarEvolution.cpp

Co-authored-by: Florian Hahn <flo at fhahn.com>
---
 llvm/lib/Analysis/ScalarEvolution.cpp | 6 +-----
 1 file changed, 1 insertion(+), 5 deletions(-)

diff --git a/llvm/lib/Analysis/ScalarEvolution.cpp b/llvm/lib/Analysis/ScalarEvolution.cpp
index 0fd5033a50e46..b994d8f297ae1 100644
--- a/llvm/lib/Analysis/ScalarEvolution.cpp
+++ b/llvm/lib/Analysis/ScalarEvolution.cpp
@@ -13471,11 +13471,7 @@ ScalarEvolution::howManyLessThans(const SCEV *LHS, const SCEV *RHS,
       return getCouldNotCompute();
 
     if (!loopIsFiniteByAssumption(L)) {
-      // If we cannot prove the loop is finite but predicates are allowed,
-      // we can add a predicate that the stride is positive. This ensures
-      // the loop makes forward progress and the BTC formula is correct.
-      // The predicate will be emitted as a runtime check by the consumer
-      // (e.g., the loop vectorizer), guarding the optimized loop version.
+      // If the loop may be infinite, add a predicate ensuring Stride is positive, to guarantee forward progress.
       if (!AllowPredicates || !isLoopInvariant(Stride, L))
         return getCouldNotCompute();
 

>From bccabbe84ab554a1dd6483f3ee43fc0008bba285 Mon Sep 17 00:00:00 2001
From: Pawan Nirpal <pnirpal at qti.qualcomm.com>
Date: Wed, 9 Sep 2026 06:58:49 -0700
Subject: [PATCH 4/4] reduce tests and general clean-up

---
 llvm/lib/Analysis/ScalarEvolution.cpp         |  6 ++-
 .../trip-count-variable-stride-predicate.ll   |  4 +-
 .../scev-variable-stride-predicate.ll         | 51 +++++++++++++++++++
 3 files changed, 58 insertions(+), 3 deletions(-)

diff --git a/llvm/lib/Analysis/ScalarEvolution.cpp b/llvm/lib/Analysis/ScalarEvolution.cpp
index b994d8f297ae1..b4f9bb04ffc92 100644
--- a/llvm/lib/Analysis/ScalarEvolution.cpp
+++ b/llvm/lib/Analysis/ScalarEvolution.cpp
@@ -13471,13 +13471,17 @@ ScalarEvolution::howManyLessThans(const SCEV *LHS, const SCEV *RHS,
       return getCouldNotCompute();
 
     if (!loopIsFiniteByAssumption(L)) {
-      // If the loop may be infinite, add a predicate ensuring Stride is positive, to guarantee forward progress.
+      // If the loop may be infinite, add a predicate ensuring Stride is
+      // positive, to guarantee forward progress.
       if (!AllowPredicates || !isLoopInvariant(Stride, L))
         return getCouldNotCompute();
 
       const SCEV *Zero = getZero(Stride->getType());
       auto *P = getComparePredicate(ICmpInst::ICMP_SGT, Stride, Zero);
       Predicates.push_back(P);
+      // When the predicate holds (Stride > 0), umax(Stride, 1) == Stride,
+      // so the result is unchanged. To prevent div by zero.
+      Stride = getUMaxExpr(Stride, getOne(Stride->getType()));
     } else if (!isKnownNonZero(Stride)) {
       // If we have a step of zero, and RHS isn't invariant in L, we don't know
       // if it might eventually be greater than start and if so, on which
diff --git a/llvm/test/Analysis/ScalarEvolution/trip-count-variable-stride-predicate.ll b/llvm/test/Analysis/ScalarEvolution/trip-count-variable-stride-predicate.ll
index 80c85103f288d..42a91320182de 100644
--- a/llvm/test/Analysis/ScalarEvolution/trip-count-variable-stride-predicate.ll
+++ b/llvm/test/Analysis/ScalarEvolution/trip-count-variable-stride-predicate.ll
@@ -7,13 +7,13 @@ define void @variable_stride_no_mustprogress(i64 %n, i64 %stride) {
 ; CHECK-NEXT:  Loop %loop: Unpredictable backedge-taken count.
 ; CHECK-NEXT:  Loop %loop: Unpredictable constant max backedge-taken count.
 ; CHECK-NEXT:  Loop %loop: Unpredictable symbolic max backedge-taken count.
-; CHECK-NEXT:  Loop %loop: Predicated backedge-taken count is ((-1 + (%n smax %stride)) /u %stride)
+; CHECK-NEXT:  Loop %loop: Predicated backedge-taken count is ((((-1 * (1 umin ((-1 * %stride) + (%n smax %stride))))<nuw><nsw> + (-1 * %stride) + (%n smax %stride)) /u (1 umax %stride)) + (1 umin ((-1 * %stride) + (%n smax %stride))))
 ; CHECK-NEXT:   Predicates:
 ; CHECK-NEXT:      Compare predicate: %stride sgt) 0
 ; CHECK-NEXT:  Loop %loop: Predicated constant max backedge-taken count is i64 -1
 ; CHECK-NEXT:   Predicates:
 ; CHECK-NEXT:      Compare predicate: %stride sgt) 0
-; CHECK-NEXT:  Loop %loop: Predicated symbolic max backedge-taken count is ((-1 + (%n smax %stride)) /u %stride)
+; CHECK-NEXT:  Loop %loop: Predicated symbolic max backedge-taken count is ((((-1 * (1 umin ((-1 * %stride) + (%n smax %stride))))<nuw><nsw> + (-1 * %stride) + (%n smax %stride)) /u (1 umax %stride)) + (1 umin ((-1 * %stride) + (%n smax %stride))))
 ; CHECK-NEXT:   Predicates:
 ; CHECK-NEXT:      Compare predicate: %stride sgt) 0
 ;
diff --git a/llvm/test/Transforms/LoopVectorize/scev-variable-stride-predicate.ll b/llvm/test/Transforms/LoopVectorize/scev-variable-stride-predicate.ll
index 72f078ff22f6d..2d532aacc8070 100644
--- a/llvm/test/Transforms/LoopVectorize/scev-variable-stride-predicate.ll
+++ b/llvm/test/Transforms/LoopVectorize/scev-variable-stride-predicate.ll
@@ -49,3 +49,54 @@ loop:
 exit:
   ret void
 }
+
+define void @variable_stride_separate_iv(ptr %a, i64 %n, i64 %stride) {
+; CHECK-LABEL: define void @variable_stride_separate_iv(
+; CHECK-SAME: ptr [[A:%.*]], i64 [[N:%.*]], i64 [[STRIDE:%.*]]) {
+; CHECK-NEXT:  [[ENTRY:.*:]]
+; CHECK-NEXT:    [[TMP0:%.*]] = call i64 @llvm.smax.i64(i64 [[STRIDE]], i64 [[N]])
+; CHECK-NEXT:    [[TMP1:%.*]] = sub i64 [[TMP0]], [[STRIDE]]
+; CHECK-NEXT:    [[TMP2:%.*]] = call i64 @llvm.umin.i64(i64 [[TMP1]], i64 1)
+; CHECK-NEXT:    [[TMP3:%.*]] = sub i64 [[TMP1]], [[TMP2]]
+; CHECK-NEXT:    [[TMP4:%.*]] = call i64 @llvm.umax.i64(i64 [[STRIDE]], i64 1)
+; CHECK-NEXT:    [[TMP5:%.*]] = udiv i64 [[TMP3]], [[TMP4]]
+; CHECK-NEXT:    [[TMP6:%.*]] = add i64 [[TMP2]], [[TMP5]]
+; CHECK-NEXT:    [[TMP7:%.*]] = add i64 [[TMP6]], 1
+; CHECK-NEXT:    [[MIN_ITERS_CHECK:%.*]] = icmp ult i64 [[TMP7]], 4
+; CHECK-NEXT:    br i1 [[MIN_ITERS_CHECK]], label %[[SCALAR_PH:.*]], label %[[VECTOR_SCEVCHECK:.*]]
+; CHECK:       [[VECTOR_SCEVCHECK]]:
+; CHECK-NEXT:    [[IDENT_CHECK:%.*]] = icmp sle i64 [[STRIDE]], 0
+; CHECK-NEXT:    br i1 [[IDENT_CHECK]], label %[[SCALAR_PH]], label %[[VECTOR_PH:.*]]
+; CHECK:       [[VECTOR_PH]]:
+; CHECK-NEXT:    [[TMP8:%.*]] = and i64 [[TMP7]], 3
+; CHECK-NEXT:    [[N_VEC:%.*]] = sub i64 [[TMP7]], [[TMP8]]
+; CHECK-NEXT:    [[TMP9:%.*]] = mul i64 [[N_VEC]], [[STRIDE]]
+; CHECK-NEXT:    br label %[[VECTOR_BODY:.*]]
+; CHECK:       [[VECTOR_BODY]]:
+; CHECK-NEXT:    [[INDEX:%.*]] = phi i64 [ 0, %[[VECTOR_PH]] ], [ [[INDEX_NEXT:%.*]], %[[VECTOR_BODY]] ]
+; CHECK-NEXT:    [[TMP10:%.*]] = getelementptr inbounds i32, ptr [[A]], i64 [[INDEX]]
+; CHECK-NEXT:    store <4 x i32> splat (i32 7), ptr [[TMP10]], align 4
+; CHECK-NEXT:    [[INDEX_NEXT]] = add nuw i64 [[INDEX]], 4
+; CHECK-NEXT:    [[TMP11:%.*]] = icmp eq i64 [[INDEX_NEXT]], [[N_VEC]]
+; CHECK-NEXT:    br i1 [[TMP11]], label %[[MIDDLE_BLOCK:.*]], label %[[VECTOR_BODY]], !llvm.loop [[LOOP4:![0-9]+]]
+; CHECK:       [[MIDDLE_BLOCK]]:
+; CHECK-NEXT:    [[CMP_N:%.*]] = icmp eq i64 [[TMP7]], [[N_VEC]]
+; CHECK-NEXT:    br i1 [[CMP_N]], [[EXIT:label %.*]], label %[[SCALAR_PH]]
+; CHECK:       [[SCALAR_PH]]:
+;
+entry:
+  br label %loop
+
+loop:
+  %iv = phi i64 [ 0, %entry ], [ %iv.next, %loop ]
+  %j = phi i64 [ 0, %entry ], [ %j.next, %loop ]
+  %gep = getelementptr inbounds i32, ptr %a, i64 %j
+  store i32 7, ptr %gep, align 4
+  %j.next = add nuw nsw i64 %j, 1
+  %iv.next = add nsw i64 %iv, %stride
+  %cmp = icmp slt i64 %iv.next, %n
+  br i1 %cmp, label %loop, label %exit
+
+exit:
+  ret void
+}



More information about the llvm-commits mailing list