[llvm] [LoopFlatten] Invalidate SCEV on unflattening bail (PR #211819)
Arda Serdar Pektezol via llvm-commits
llvm-commits at lists.llvm.org
Thu Aug 6 13:48:55 PDT 2026
https://github.com/pektezol updated https://github.com/llvm/llvm-project/pull/211819
>From 1ea09eccc7346d6a611fde03314e777f1f6e4f3c Mon Sep 17 00:00:00 2001
From: Arda Serdar Pektezol <arda at pektezol.dev>
Date: Fri, 24 Jul 2026 17:56:13 +0300
Subject: [PATCH 1/3] [LoopFlatten] Invalidate SCEV on unflattening bail
---
llvm/lib/Transforms/Scalar/LoopFlatten.cpp | 5 +-
.../LoopFlatten/invalidate-scev-pr203176.ll | 118 ++++++++++++++++++
2 files changed, 122 insertions(+), 1 deletion(-)
create mode 100644 llvm/test/Transforms/LoopFlatten/invalidate-scev-pr203176.ll
diff --git a/llvm/lib/Transforms/Scalar/LoopFlatten.cpp b/llvm/lib/Transforms/Scalar/LoopFlatten.cpp
index e48c47f1b4b89..da2e81aab3cbd 100644
--- a/llvm/lib/Transforms/Scalar/LoopFlatten.cpp
+++ b/llvm/lib/Transforms/Scalar/LoopFlatten.cpp
@@ -929,8 +929,11 @@ static bool FlattenLoopPair(FlattenInfo &FI, DominatorTree *DT, LoopInfo *LI,
// 'RepeatedInstructionThreshold' is set to only 2, which can probably be
// relaxed. Because this is making a code change (the IV widening, but not
// the flattening), we return true here.
- if (FI.Widened && !CanFlatten)
+ if (FI.Widened && !CanFlatten) {
+ SE->forgetLoop(FI.OuterLoop);
+ SE->forgetBlockAndLoopDispositions();
return true;
+ }
// If we have widened and can perform the transformation, do that here.
if (CanFlatten)
diff --git a/llvm/test/Transforms/LoopFlatten/invalidate-scev-pr203176.ll b/llvm/test/Transforms/LoopFlatten/invalidate-scev-pr203176.ll
new file mode 100644
index 0000000000000..e76736fe96194
--- /dev/null
+++ b/llvm/test/Transforms/LoopFlatten/invalidate-scev-pr203176.ll
@@ -0,0 +1,118 @@
+; NOTE: Assertions have been autogenerated by utils/update_test_checks.py UTC_ARGS: --version 6
+; RUN: opt < %s -S -passes='loop(loop-flatten),loop-vectorize' | FileCheck %s
+
+define i64 @f() {
+; CHECK-LABEL: define i64 @f() {
+; CHECK-NEXT: [[ENTRY:.*:]]
+; CHECK-NEXT: br label %[[VECTOR_PH:.*]]
+; CHECK: [[VECTOR_PH]]:
+; CHECK-NEXT: br label %[[VECTOR_BODY:.*]]
+; CHECK: [[VECTOR_BODY]]:
+; CHECK-NEXT: [[INDEX:%.*]] = phi i32 [ 0, %[[VECTOR_PH]] ], [ [[INDEX_NEXT:%.*]], %[[VECTOR_BODY]] ]
+; CHECK-NEXT: [[VEC_PHI:%.*]] = phi <2 x i16> [ zeroinitializer, %[[VECTOR_PH]] ], [ [[VEC_PHI]], %[[VECTOR_BODY]] ]
+; CHECK-NEXT: [[INDEX_NEXT]] = add nuw i32 [[INDEX]], 2
+; CHECK-NEXT: [[TMP0:%.*]] = icmp eq i32 [[INDEX_NEXT]], 65536
+; CHECK-NEXT: br i1 [[TMP0]], label %[[MIDDLE_BLOCK:.*]], label %[[VECTOR_BODY]], !llvm.loop [[LOOP0:![0-9]+]]
+; CHECK: [[MIDDLE_BLOCK]]:
+; CHECK-NEXT: [[TMP1:%.*]] = call i16 @llvm.vector.reduce.or.v2i16(<2 x i16> [[VEC_PHI]])
+; CHECK-NEXT: br label %[[FOR_COND_CLEANUP3_I:.*]]
+; CHECK: [[FOR_COND_CLEANUP3_I]]:
+; CHECK-NEXT: [[SEED_1_I:%.*]] = zext i16 [[TMP1]] to i64
+; CHECK-NEXT: [[FLOW_MIX_I:%.*]] = xor i64 [[SEED_1_I]], 1
+; CHECK-NEXT: br label %[[LOOP_HEADER:.*]]
+; CHECK: [[LOOP_HEADER]]:
+; CHECK-NEXT: [[I:%.*]] = phi i64 [ 0, %[[FOR_COND_CLEANUP3_I]] ], [ [[I_NEXT:%.*]], %[[TEST1_EXIT:.*]] ]
+; CHECK-NEXT: [[TRIP_COUNT:%.*]] = add i64 [[FLOW_MIX_I]], 1
+; CHECK-NEXT: [[LOOP_COND:%.*]] = icmp ult i64 [[I]], [[TRIP_COUNT]]
+; CHECK-NEXT: br i1 [[LOOP_COND]], label %[[LOOP_BODY:.*]], label %[[LOOP_EXIT:.*]]
+; CHECK: [[LOOP_BODY]]:
+; CHECK-NEXT: [[LOOPINJECT_1:%.*]] = trunc i64 [[I]] to i32
+; CHECK-NEXT: br i1 false, label %[[FOR_INNER_PREHEADER_I_PREHEADER:.*]], label %[[TEST1_EXIT]]
+; CHECK: [[FOR_INNER_PREHEADER_I_PREHEADER]]:
+; CHECK-NEXT: [[FLATTEN_TRIPCOUNT:%.*]] = mul i32 [[LOOPINJECT_1]], 0
+; CHECK-NEXT: br label %[[FOR_INNER_PREHEADER_I:.*]]
+; CHECK: [[FOR_INNER_PREHEADER_I]]:
+; CHECK-NEXT: [[I_I:%.*]] = phi i32 [ [[INC2_I:%.*]], %[[FOR_OUTER_I:.*]] ], [ 0, %[[FOR_INNER_PREHEADER_I_PREHEADER]] ]
+; CHECK-NEXT: [[FLATTEN_ARRAYIDX_I2:%.*]] = getelementptr i32, ptr null, i32 [[I_I]]
+; CHECK-NEXT: br label %[[FOR_INNER_I:.*]]
+; CHECK: [[FOR_INNER_I]]:
+; CHECK-NEXT: [[J_I:%.*]] = phi i32 [ 0, %[[FOR_INNER_PREHEADER_I]] ]
+; CHECK-NEXT: [[MUL_I1:%.*]] = mul i32 [[I_I]], [[LOOPINJECT_1]]
+; CHECK-NEXT: [[GEP_I:%.*]] = getelementptr i32, ptr null, i32 [[MUL_I1]]
+; CHECK-NEXT: [[ARRAYIDX_I2:%.*]] = getelementptr i32, ptr [[GEP_I]], i32 [[J_I]]
+; CHECK-NEXT: store i32 0, ptr [[GEP_I]], align 4
+; CHECK-NEXT: [[INC1_I:%.*]] = add i32 [[J_I]], 1
+; CHECK-NEXT: [[CMP2_I:%.*]] = icmp ult i32 [[INC1_I]], [[LOOPINJECT_1]]
+; CHECK-NEXT: br label %[[FOR_OUTER_I]]
+; CHECK: [[FOR_OUTER_I]]:
+; CHECK-NEXT: [[INC2_I]] = add i32 [[I_I]], 1
+; CHECK-NEXT: [[CMP1_I:%.*]] = icmp ult i32 [[INC2_I]], [[FLATTEN_TRIPCOUNT]]
+; CHECK-NEXT: br i1 [[CMP1_I]], label %[[FOR_INNER_PREHEADER_I]], label %[[TEST1_EXIT_LOOPEXIT:.*]]
+; CHECK: [[TEST1_EXIT_LOOPEXIT]]:
+; CHECK-NEXT: br label %[[TEST1_EXIT]]
+; CHECK: [[TEST1_EXIT]]:
+; CHECK-NEXT: [[I_NEXT]] = add i64 [[I]], 1
+; CHECK-NEXT: br label %[[LOOP_HEADER]]
+; CHECK: [[LOOP_EXIT]]:
+; CHECK-NEXT: ret i64 0
+;
+entry:
+ br label %for.body4.i
+
+for.cond.cleanup3.i: ; preds = %for.body4.i
+ %seed.1.i = zext i16 %add5.i to i64
+ %flow.mix.i = xor i64 %seed.1.i, 1
+ br label %loop.header
+
+for.body4.i: ; preds = %for.body4.i, %entry
+ %j.011.i = phi i16 [ 0, %entry ], [ %inc.i, %for.body4.i ]
+ %sum.110.i = phi i16 [ 0, %entry ], [ %add5.i, %for.body4.i ]
+ %add5.i = or i16 0, %sum.110.i
+ %inc.i = add i16 %j.011.i, 1
+ %exitcond.not.i = icmp eq i16 %inc.i, 0
+ br i1 %exitcond.not.i, label %for.cond.cleanup3.i, label %for.body4.i
+
+loop.header: ; preds = %test1.exit, %for.cond.cleanup3.i
+ %i = phi i64 [ 0, %for.cond.cleanup3.i ], [ %i.next, %test1.exit ]
+ %trip.count = add i64 %flow.mix.i, 1
+ %loop.cond = icmp ult i64 %i, %trip.count
+ br i1 %loop.cond, label %loop.body, label %loop.exit
+
+loop.body: ; preds = %loop.header
+ %loopinject.1 = trunc i64 %i to i32
+ br i1 false, label %for.inner.preheader.i, label %test1.exit
+
+for.inner.preheader.i: ; preds = %for.outer.i, %loop.body
+ %i.i = phi i32 [ %inc2.i, %for.outer.i ], [ 0, %loop.body ]
+ br label %for.inner.i
+
+for.inner.i: ; preds = %for.inner.i, %for.inner.preheader.i
+ %j.i = phi i32 [ 0, %for.inner.preheader.i ], [ %inc1.i, %for.inner.i ]
+ %mul.i1 = mul i32 %i.i, %loopinject.1
+ %gep.i = getelementptr i32, ptr null, i32 %mul.i1
+ %arrayidx.i2 = getelementptr i32, ptr %gep.i, i32 %j.i
+ store i32 0, ptr %gep.i, align 4
+ %inc1.i = add i32 %j.i, 1
+ %cmp2.i = icmp ult i32 %inc1.i, %loopinject.1
+ br i1 %cmp2.i, label %for.inner.i, label %for.outer.i
+
+for.outer.i: ; preds = %for.inner.i
+ %inc2.i = add i32 %i.i, 1
+ %cmp1.i = icmp ult i32 %inc2.i, 0
+ br i1 %cmp1.i, label %for.inner.preheader.i, label %test1.exit
+
+test1.exit: ; preds = %for.outer.i, %loop.body
+ %i.next = add i64 %i, 1
+ br label %loop.header
+
+loop.exit: ; preds = %loop.header
+ ret i64 0
+
+; uselistorder directives
+ uselistorder i16 %add5.i, { 1, 0 }
+}
+;.
+; CHECK: [[LOOP0]] = distinct !{[[LOOP0]], [[META1:![0-9]+]], [[META2:![0-9]+]]}
+; CHECK: [[META1]] = !{!"llvm.loop.isvectorized", i32 1}
+; CHECK: [[META2]] = !{!"llvm.loop.unroll.runtime.disable"}
+;.
>From 11331ac44cd39929c6f8f7dbd300f5a733ada043 Mon Sep 17 00:00:00 2001
From: Arda Serdar Pektezol <arda at pektezol.dev>
Date: Thu, 6 Aug 2026 23:47:43 +0300
Subject: [PATCH 2/3] update for review
---
llvm/lib/Transforms/Scalar/LoopFlatten.cpp | 4 +--
.../LoopFlatten/invalidate-scev-pr203176.ll | 33 ++++++++++++-------
2 files changed, 23 insertions(+), 14 deletions(-)
diff --git a/llvm/lib/Transforms/Scalar/LoopFlatten.cpp b/llvm/lib/Transforms/Scalar/LoopFlatten.cpp
index da2e81aab3cbd..4d639bd69382e 100644
--- a/llvm/lib/Transforms/Scalar/LoopFlatten.cpp
+++ b/llvm/lib/Transforms/Scalar/LoopFlatten.cpp
@@ -871,6 +871,8 @@ static bool CanWidenIV(FlattenInfo &FI, DominatorTree *DT, LoopInfo *LI,
PHINode *WidePhi =
createWideIV(WideIV, LI, SE, Rewriter, DT, DeadInsts, ElimExt, Widened,
true /* HasGuards */, true /* UsePostIncrementRanges */);
+ SE->forgetLoop(FI.OuterLoop);
+ SE->forgetBlockAndLoopDispositions();
if (!WidePhi)
return false;
LLVM_DEBUG(dbgs() << "Created wide phi: "; WidePhi->dump());
@@ -930,8 +932,6 @@ static bool FlattenLoopPair(FlattenInfo &FI, DominatorTree *DT, LoopInfo *LI,
// relaxed. Because this is making a code change (the IV widening, but not
// the flattening), we return true here.
if (FI.Widened && !CanFlatten) {
- SE->forgetLoop(FI.OuterLoop);
- SE->forgetBlockAndLoopDispositions();
return true;
}
diff --git a/llvm/test/Transforms/LoopFlatten/invalidate-scev-pr203176.ll b/llvm/test/Transforms/LoopFlatten/invalidate-scev-pr203176.ll
index e76736fe96194..86a06bac27db3 100644
--- a/llvm/test/Transforms/LoopFlatten/invalidate-scev-pr203176.ll
+++ b/llvm/test/Transforms/LoopFlatten/invalidate-scev-pr203176.ll
@@ -1,6 +1,8 @@
; NOTE: Assertions have been autogenerated by utils/update_test_checks.py UTC_ARGS: --version 6
; RUN: opt < %s -S -passes='loop(loop-flatten),loop-vectorize' | FileCheck %s
+target triple = "x86_64-unknown-linux-gnu"
+
define i64 @f() {
; CHECK-LABEL: define i64 @f() {
; CHECK-NEXT: [[ENTRY:.*:]]
@@ -9,12 +11,14 @@ define i64 @f() {
; CHECK-NEXT: br label %[[VECTOR_BODY:.*]]
; CHECK: [[VECTOR_BODY]]:
; CHECK-NEXT: [[INDEX:%.*]] = phi i32 [ 0, %[[VECTOR_PH]] ], [ [[INDEX_NEXT:%.*]], %[[VECTOR_BODY]] ]
-; CHECK-NEXT: [[VEC_PHI:%.*]] = phi <2 x i16> [ zeroinitializer, %[[VECTOR_PH]] ], [ [[VEC_PHI]], %[[VECTOR_BODY]] ]
-; CHECK-NEXT: [[INDEX_NEXT]] = add nuw i32 [[INDEX]], 2
+; CHECK-NEXT: [[VEC_PHI:%.*]] = phi <8 x i16> [ zeroinitializer, %[[VECTOR_PH]] ], [ [[VEC_PHI]], %[[VECTOR_BODY]] ]
+; CHECK-NEXT: [[VEC_PHI4:%.*]] = phi <8 x i16> [ zeroinitializer, %[[VECTOR_PH]] ], [ [[VEC_PHI4]], %[[VECTOR_BODY]] ]
+; CHECK-NEXT: [[INDEX_NEXT]] = add nuw i32 [[INDEX]], 16
; CHECK-NEXT: [[TMP0:%.*]] = icmp eq i32 [[INDEX_NEXT]], 65536
; CHECK-NEXT: br i1 [[TMP0]], label %[[MIDDLE_BLOCK:.*]], label %[[VECTOR_BODY]], !llvm.loop [[LOOP0:![0-9]+]]
; CHECK: [[MIDDLE_BLOCK]]:
-; CHECK-NEXT: [[TMP1:%.*]] = call i16 @llvm.vector.reduce.or.v2i16(<2 x i16> [[VEC_PHI]])
+; CHECK-NEXT: [[BIN_RDX:%.*]] = or <8 x i16> [[VEC_PHI4]], [[VEC_PHI]]
+; CHECK-NEXT: [[TMP1:%.*]] = call i16 @llvm.vector.reduce.or.v8i16(<8 x i16> [[BIN_RDX]])
; CHECK-NEXT: br label %[[FOR_COND_CLEANUP3_I:.*]]
; CHECK: [[FOR_COND_CLEANUP3_I]]:
; CHECK-NEXT: [[SEED_1_I:%.*]] = zext i16 [[TMP1]] to i64
@@ -29,24 +33,29 @@ define i64 @f() {
; CHECK-NEXT: [[LOOPINJECT_1:%.*]] = trunc i64 [[I]] to i32
; CHECK-NEXT: br i1 false, label %[[FOR_INNER_PREHEADER_I_PREHEADER:.*]], label %[[TEST1_EXIT]]
; CHECK: [[FOR_INNER_PREHEADER_I_PREHEADER]]:
-; CHECK-NEXT: [[FLATTEN_TRIPCOUNT:%.*]] = mul i32 [[LOOPINJECT_1]], 0
+; CHECK-NEXT: [[TMP2:%.*]] = zext i32 [[LOOPINJECT_1]] to i64
+; CHECK-NEXT: [[TMP3:%.*]] = zext i32 [[LOOPINJECT_1]] to i64
; CHECK-NEXT: br label %[[FOR_INNER_PREHEADER_I:.*]]
; CHECK: [[FOR_INNER_PREHEADER_I]]:
-; CHECK-NEXT: [[I_I:%.*]] = phi i32 [ [[INC2_I:%.*]], %[[FOR_OUTER_I:.*]] ], [ 0, %[[FOR_INNER_PREHEADER_I_PREHEADER]] ]
-; CHECK-NEXT: [[FLATTEN_ARRAYIDX_I2:%.*]] = getelementptr i32, ptr null, i32 [[I_I]]
+; CHECK-NEXT: [[INDVAR1:%.*]] = phi i64 [ 0, %[[FOR_INNER_PREHEADER_I_PREHEADER]] ], [ [[INDVAR_NEXT2:%.*]], %[[FOR_OUTER_I:.*]] ]
+; CHECK-NEXT: [[I_I:%.*]] = phi i32 [ [[INC2_I:%.*]], %[[FOR_OUTER_I]] ], [ 0, %[[FOR_INNER_PREHEADER_I_PREHEADER]] ]
; CHECK-NEXT: br label %[[FOR_INNER_I:.*]]
; CHECK: [[FOR_INNER_I]]:
-; CHECK-NEXT: [[J_I:%.*]] = phi i32 [ 0, %[[FOR_INNER_PREHEADER_I]] ]
+; CHECK-NEXT: [[INDVAR:%.*]] = phi i64 [ [[INDVAR_NEXT:%.*]], %[[FOR_INNER_I]] ], [ 0, %[[FOR_INNER_PREHEADER_I]] ]
+; CHECK-NEXT: [[TMP4:%.*]] = mul i64 [[INDVAR1]], [[TMP3]]
; CHECK-NEXT: [[MUL_I1:%.*]] = mul i32 [[I_I]], [[LOOPINJECT_1]]
-; CHECK-NEXT: [[GEP_I:%.*]] = getelementptr i32, ptr null, i32 [[MUL_I1]]
+; CHECK-NEXT: [[TMP5:%.*]] = trunc nuw nsw i64 [[TMP4]] to i32
+; CHECK-NEXT: [[GEP_I:%.*]] = getelementptr i32, ptr null, i32 [[TMP5]]
+; CHECK-NEXT: [[J_I:%.*]] = trunc nuw nsw i64 [[INDVAR]] to i32
; CHECK-NEXT: [[ARRAYIDX_I2:%.*]] = getelementptr i32, ptr [[GEP_I]], i32 [[J_I]]
; CHECK-NEXT: store i32 0, ptr [[GEP_I]], align 4
-; CHECK-NEXT: [[INC1_I:%.*]] = add i32 [[J_I]], 1
-; CHECK-NEXT: [[CMP2_I:%.*]] = icmp ult i32 [[INC1_I]], [[LOOPINJECT_1]]
-; CHECK-NEXT: br label %[[FOR_OUTER_I]]
+; CHECK-NEXT: [[INDVAR_NEXT]] = add i64 [[INDVAR]], 1
+; CHECK-NEXT: [[CMP2_I:%.*]] = icmp ult i64 [[INDVAR_NEXT]], [[TMP2]]
+; CHECK-NEXT: br i1 [[CMP2_I]], label %[[FOR_INNER_I]], label %[[FOR_OUTER_I]]
; CHECK: [[FOR_OUTER_I]]:
+; CHECK-NEXT: [[INDVAR_NEXT2]] = add i64 [[INDVAR1]], 1
; CHECK-NEXT: [[INC2_I]] = add i32 [[I_I]], 1
-; CHECK-NEXT: [[CMP1_I:%.*]] = icmp ult i32 [[INC2_I]], [[FLATTEN_TRIPCOUNT]]
+; CHECK-NEXT: [[CMP1_I:%.*]] = icmp ult i64 [[INDVAR_NEXT2]], 0
; CHECK-NEXT: br i1 [[CMP1_I]], label %[[FOR_INNER_PREHEADER_I]], label %[[TEST1_EXIT_LOOPEXIT:.*]]
; CHECK: [[TEST1_EXIT_LOOPEXIT]]:
; CHECK-NEXT: br label %[[TEST1_EXIT]]
>From f5214bd51bdeb7d09765b029b54b186970fe2e2a Mon Sep 17 00:00:00 2001
From: Arda Serdar Pektezol <arda at pektezol.dev>
Date: Thu, 6 Aug 2026 23:48:37 +0300
Subject: [PATCH 3/3] formatting
---
llvm/lib/Transforms/Scalar/LoopFlatten.cpp | 3 +--
1 file changed, 1 insertion(+), 2 deletions(-)
diff --git a/llvm/lib/Transforms/Scalar/LoopFlatten.cpp b/llvm/lib/Transforms/Scalar/LoopFlatten.cpp
index 4d639bd69382e..5528b7230a851 100644
--- a/llvm/lib/Transforms/Scalar/LoopFlatten.cpp
+++ b/llvm/lib/Transforms/Scalar/LoopFlatten.cpp
@@ -931,9 +931,8 @@ static bool FlattenLoopPair(FlattenInfo &FI, DominatorTree *DT, LoopInfo *LI,
// 'RepeatedInstructionThreshold' is set to only 2, which can probably be
// relaxed. Because this is making a code change (the IV widening, but not
// the flattening), we return true here.
- if (FI.Widened && !CanFlatten) {
+ if (FI.Widened && !CanFlatten)
return true;
- }
// If we have widened and can perform the transformation, do that here.
if (CanFlatten)
More information about the llvm-commits
mailing list