[llvm] a9a899d - [X86] vector-reduce-* - add 32-bit test coverage to the minmax tests (#195617)
via llvm-commits
llvm-commits at lists.llvm.org
Mon May 4 02:43:56 PDT 2026
Author: Simon Pilgrim
Date: 2026-05-04T09:43:49Z
New Revision: a9a899db3e7c6a625a1f8a336b30735926271c0a
URL: https://github.com/llvm/llvm-project/commit/a9a899db3e7c6a625a1f8a336b30735926271c0a
DIFF: https://github.com/llvm/llvm-project/commit/a9a899db3e7c6a625a1f8a336b30735926271c0a.diff
LOG: [X86] vector-reduce-* - add 32-bit test coverage to the minmax tests (#195617)
The horizontal-reduce-* tests already have 32-bit coverage but they will be retired soon.
Added:
Modified:
llvm/test/CodeGen/X86/vector-reduce-smax.ll
llvm/test/CodeGen/X86/vector-reduce-smin.ll
llvm/test/CodeGen/X86/vector-reduce-umax.ll
llvm/test/CodeGen/X86/vector-reduce-umin.ll
Removed:
################################################################################
diff --git a/llvm/test/CodeGen/X86/vector-reduce-smax.ll b/llvm/test/CodeGen/X86/vector-reduce-smax.ll
index 90482207108d6..a302649decee8 100644
--- a/llvm/test/CodeGen/X86/vector-reduce-smax.ll
+++ b/llvm/test/CodeGen/X86/vector-reduce-smax.ll
@@ -1,62 +1,130 @@
; NOTE: Assertions have been autogenerated by utils/update_llc_test_checks.py
-; RUN: llc < %s -mtriple=x86_64-unknown-unknown -mattr=+sse2 | FileCheck %s --check-prefixes=SSE,SSE2
-; RUN: llc < %s -mtriple=x86_64-unknown-unknown -mattr=+sse4.1 | FileCheck %s --check-prefixes=SSE,SSE4,SSE41
-; RUN: llc < %s -mtriple=x86_64-unknown-unknown -mattr=+sse4.2 | FileCheck %s --check-prefixes=SSE,SSE4,SSE42
-; RUN: llc < %s -mtriple=x86_64-unknown-unknown -mattr=+avx | FileCheck %s --check-prefixes=AVX,AVX1
-; RUN: llc < %s -mtriple=x86_64-unknown-unknown -mattr=+avx2 | FileCheck %s --check-prefixes=AVX,AVX2
-; RUN: llc < %s -mtriple=x86_64-unknown-unknown -mattr=+avx512f,+avx512bw | FileCheck %s --check-prefixes=AVX512,AVX512BW
-; RUN: llc < %s -mtriple=x86_64-unknown-unknown -mattr=+avx512f,+avx512bw,+avx512vl | FileCheck %s --check-prefixes=AVX512,AVX512VL
+; RUN: llc < %s -mtriple=i686-- -mattr=+sse2 | FileCheck %s --check-prefixes=SSE,SSE2,X86-SSE2
+; RUN: llc < %s -mtriple=x86_64-- -mattr=+sse2 | FileCheck %s --check-prefixes=SSE,SSE2,X64-SSE2
+; RUN: llc < %s -mtriple=i686-- -mattr=+sse4.1 | FileCheck %s --check-prefixes=SSE,SSE4,X86-SSE4,X86-SSE41
+; RUN: llc < %s -mtriple=x86_64-- -mattr=+sse4.1 | FileCheck %s --check-prefixes=SSE,SSE4,X64-SSE4,X64-SSE41
+; RUN: llc < %s -mtriple=i686-- -mattr=+sse4.2 | FileCheck %s --check-prefixes=SSE,SSE4,X86-SSE4,X86-SSE42
+; RUN: llc < %s -mtriple=x86_64-- -mattr=+sse4.2 | FileCheck %s --check-prefixes=SSE,SSE4,X64-SSE4,X64-SSE42
+; RUN: llc < %s -mtriple=i686-- -mattr=+avx | FileCheck %s --check-prefixes=AVX,AVX1,X86-AVX,X86-AVX1
+; RUN: llc < %s -mtriple=x86_64-- -mattr=+avx | FileCheck %s --check-prefixes=AVX,AVX1,X64-AVX,X64-AVX1
+; RUN: llc < %s -mtriple=i686-- -mattr=+avx2 | FileCheck %s --check-prefixes=AVX,AVX2,X86-AVX,X86-AVX2
+; RUN: llc < %s -mtriple=x86_64-- -mattr=+avx2 | FileCheck %s --check-prefixes=AVX,AVX2,X64-AVX,X64-AVX2
+; RUN: llc < %s -mtriple=x86_64-- -mattr=+avx512f,+avx512bw | FileCheck %s --check-prefixes=AVX,AVX512,AVX512BW
+; RUN: llc < %s -mtriple=x86_64-- -mattr=+avx512f,+avx512bw,+avx512dq,+avx512vl | FileCheck %s --check-prefixes=AVX,AVX512,AVX512VL
;
; vXi64
;
-define i64 @test_v2i64(<2 x i64> %a0) {
-; SSE2-LABEL: test_v2i64:
-; SSE2: # %bb.0:
-; SSE2-NEXT: movq %xmm0, %rcx
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm0[2,3,2,3]
-; SSE2-NEXT: movq %xmm0, %rax
-; SSE2-NEXT: cmpq %rax, %rcx
-; SSE2-NEXT: cmovgq %rcx, %rax
-; SSE2-NEXT: retq
-;
-; SSE41-LABEL: test_v2i64:
-; SSE41: # %bb.0:
-; SSE41-NEXT: movdqa %xmm0, %xmm1
-; SSE41-NEXT: pmovzxdq {{.*#+}} xmm0 = [2147483648,2147483648]
-; SSE41-NEXT: movdqa %xmm1, %xmm2
-; SSE41-NEXT: pxor %xmm0, %xmm2
-; SSE41-NEXT: pshufd {{.*#+}} xmm3 = xmm1[2,3,2,3]
-; SSE41-NEXT: pxor %xmm3, %xmm0
-; SSE41-NEXT: movdqa %xmm2, %xmm4
-; SSE41-NEXT: pcmpgtd %xmm0, %xmm4
-; SSE41-NEXT: pmovsxdq %xmm4, %xmm5
-; SSE41-NEXT: pcmpeqd %xmm2, %xmm0
-; SSE41-NEXT: pshufd {{.*#+}} xmm2 = xmm0[1,1,3,3]
-; SSE41-NEXT: pand %xmm5, %xmm2
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm4[1,1,3,3]
-; SSE41-NEXT: por %xmm2, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm1, %xmm3
-; SSE41-NEXT: movq %xmm3, %rax
-; SSE41-NEXT: retq
-;
-; SSE42-LABEL: test_v2i64:
-; SSE42: # %bb.0:
-; SSE42-NEXT: movdqa %xmm0, %xmm1
-; SSE42-NEXT: pshufd {{.*#+}} xmm2 = xmm0[2,3,2,3]
-; SSE42-NEXT: pcmpgtq %xmm2, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm1, %xmm2
-; SSE42-NEXT: movq %xmm2, %rax
-; SSE42-NEXT: retq
-;
-; AVX-LABEL: test_v2i64:
-; AVX: # %bb.0:
-; AVX-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
-; AVX-NEXT: vpcmpgtq %xmm1, %xmm0, %xmm2
-; AVX-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
-; AVX-NEXT: vmovq %xmm0, %rax
-; AVX-NEXT: retq
+define i64 @test_v2i64(<2 x i64> %a0) nounwind {
+; X86-SSE2-LABEL: test_v2i64:
+; X86-SSE2: # %bb.0:
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-SSE2-NEXT: movdqa {{.*#+}} xmm2 = [2147483648,0,2147483648,0]
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm3
+; X86-SSE2-NEXT: pxor %xmm2, %xmm3
+; X86-SSE2-NEXT: pxor %xmm1, %xmm2
+; X86-SSE2-NEXT: movdqa %xmm3, %xmm4
+; X86-SSE2-NEXT: pcmpgtd %xmm2, %xmm4
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm5 = xmm4[0,0,2,2]
+; X86-SSE2-NEXT: pcmpeqd %xmm3, %xmm2
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm2[1,1,3,3]
+; X86-SSE2-NEXT: pand %xmm5, %xmm2
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm3 = xmm4[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm2, %xmm3
+; X86-SSE2-NEXT: pand %xmm3, %xmm0
+; X86-SSE2-NEXT: pandn %xmm1, %xmm3
+; X86-SSE2-NEXT: por %xmm0, %xmm3
+; X86-SSE2-NEXT: movd %xmm3, %eax
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm3[1,1,1,1]
+; X86-SSE2-NEXT: movd %xmm0, %edx
+; X86-SSE2-NEXT: retl
+;
+; X64-SSE2-LABEL: test_v2i64:
+; X64-SSE2: # %bb.0:
+; X64-SSE2-NEXT: movq %xmm0, %rcx
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm0[2,3,2,3]
+; X64-SSE2-NEXT: movq %xmm0, %rax
+; X64-SSE2-NEXT: cmpq %rax, %rcx
+; X64-SSE2-NEXT: cmovgq %rcx, %rax
+; X64-SSE2-NEXT: retq
+;
+; X86-SSE41-LABEL: test_v2i64:
+; X86-SSE41: # %bb.0:
+; X86-SSE41-NEXT: movdqa %xmm0, %xmm1
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm2 = xmm0[2,3,2,3]
+; X86-SSE41-NEXT: pmovzxdq {{.*#+}} xmm0 = [2147483648,2147483648]
+; X86-SSE41-NEXT: movdqa %xmm1, %xmm3
+; X86-SSE41-NEXT: pxor %xmm0, %xmm3
+; X86-SSE41-NEXT: pxor %xmm2, %xmm0
+; X86-SSE41-NEXT: movdqa %xmm3, %xmm4
+; X86-SSE41-NEXT: pcmpgtd %xmm0, %xmm4
+; X86-SSE41-NEXT: pmovsxdq %xmm4, %xmm5
+; X86-SSE41-NEXT: pcmpeqd %xmm3, %xmm0
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm3 = xmm0[1,1,3,3]
+; X86-SSE41-NEXT: pand %xmm5, %xmm3
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm4[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm3, %xmm0
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm1, %xmm2
+; X86-SSE41-NEXT: movd %xmm2, %eax
+; X86-SSE41-NEXT: pextrd $1, %xmm2, %edx
+; X86-SSE41-NEXT: retl
+;
+; X64-SSE41-LABEL: test_v2i64:
+; X64-SSE41: # %bb.0:
+; X64-SSE41-NEXT: movdqa %xmm0, %xmm1
+; X64-SSE41-NEXT: pmovzxdq {{.*#+}} xmm0 = [2147483648,2147483648]
+; X64-SSE41-NEXT: movdqa %xmm1, %xmm2
+; X64-SSE41-NEXT: pxor %xmm0, %xmm2
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm3 = xmm1[2,3,2,3]
+; X64-SSE41-NEXT: pxor %xmm3, %xmm0
+; X64-SSE41-NEXT: movdqa %xmm2, %xmm4
+; X64-SSE41-NEXT: pcmpgtd %xmm0, %xmm4
+; X64-SSE41-NEXT: pmovsxdq %xmm4, %xmm5
+; X64-SSE41-NEXT: pcmpeqd %xmm2, %xmm0
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm2 = xmm0[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm5, %xmm2
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm4[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm2, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm1, %xmm3
+; X64-SSE41-NEXT: movq %xmm3, %rax
+; X64-SSE41-NEXT: retq
+;
+; X86-SSE42-LABEL: test_v2i64:
+; X86-SSE42: # %bb.0:
+; X86-SSE42-NEXT: movdqa %xmm0, %xmm1
+; X86-SSE42-NEXT: pshufd {{.*#+}} xmm2 = xmm0[2,3,2,3]
+; X86-SSE42-NEXT: pcmpgtq %xmm2, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm1, %xmm2
+; X86-SSE42-NEXT: movd %xmm2, %eax
+; X86-SSE42-NEXT: pextrd $1, %xmm2, %edx
+; X86-SSE42-NEXT: retl
+;
+; X64-SSE42-LABEL: test_v2i64:
+; X64-SSE42: # %bb.0:
+; X64-SSE42-NEXT: movdqa %xmm0, %xmm1
+; X64-SSE42-NEXT: pshufd {{.*#+}} xmm2 = xmm0[2,3,2,3]
+; X64-SSE42-NEXT: pcmpgtq %xmm2, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm1, %xmm2
+; X64-SSE42-NEXT: movq %xmm2, %rax
+; X64-SSE42-NEXT: retq
+;
+; X86-AVX-LABEL: test_v2i64:
+; X86-AVX: # %bb.0:
+; X86-AVX-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-AVX-NEXT: vpcmpgtq %xmm1, %xmm0, %xmm2
+; X86-AVX-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X86-AVX-NEXT: vmovd %xmm0, %eax
+; X86-AVX-NEXT: vpextrd $1, %xmm0, %edx
+; X86-AVX-NEXT: retl
+;
+; X64-AVX-LABEL: test_v2i64:
+; X64-AVX: # %bb.0:
+; X64-AVX-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X64-AVX-NEXT: vpcmpgtq %xmm1, %xmm0, %xmm2
+; X64-AVX-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X64-AVX-NEXT: vmovq %xmm0, %rax
+; X64-AVX-NEXT: retq
;
; AVX512BW-LABEL: test_v2i64:
; AVX512BW: # %bb.0:
@@ -77,99 +145,210 @@ define i64 @test_v2i64(<2 x i64> %a0) {
ret i64 %1
}
-define i64 @test_v4i64(<4 x i64> %a0) {
-; SSE2-LABEL: test_v4i64:
-; SSE2: # %bb.0:
-; SSE2-NEXT: movdqa {{.*#+}} xmm2 = [2147483648,2147483648]
-; SSE2-NEXT: movdqa %xmm1, %xmm3
-; SSE2-NEXT: pxor %xmm2, %xmm3
-; SSE2-NEXT: pxor %xmm0, %xmm2
-; SSE2-NEXT: movdqa %xmm2, %xmm4
-; SSE2-NEXT: pcmpgtd %xmm3, %xmm4
-; SSE2-NEXT: pshufd {{.*#+}} xmm5 = xmm4[0,0,2,2]
-; SSE2-NEXT: pcmpeqd %xmm3, %xmm2
-; SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm2[1,1,3,3]
-; SSE2-NEXT: pand %xmm5, %xmm2
-; SSE2-NEXT: pshufd {{.*#+}} xmm3 = xmm4[1,1,3,3]
-; SSE2-NEXT: por %xmm2, %xmm3
-; SSE2-NEXT: pand %xmm3, %xmm0
-; SSE2-NEXT: pandn %xmm1, %xmm3
-; SSE2-NEXT: por %xmm0, %xmm3
-; SSE2-NEXT: movq %xmm3, %rcx
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm3[2,3,2,3]
-; SSE2-NEXT: movq %xmm0, %rax
-; SSE2-NEXT: cmpq %rax, %rcx
-; SSE2-NEXT: cmovgq %rcx, %rax
-; SSE2-NEXT: retq
-;
-; SSE41-LABEL: test_v4i64:
-; SSE41: # %bb.0:
-; SSE41-NEXT: movdqa %xmm0, %xmm2
-; SSE41-NEXT: pmovzxdq {{.*#+}} xmm3 = [2147483648,2147483648]
-; SSE41-NEXT: movdqa %xmm1, %xmm0
-; SSE41-NEXT: pxor %xmm3, %xmm0
-; SSE41-NEXT: movdqa %xmm2, %xmm4
-; SSE41-NEXT: pxor %xmm3, %xmm4
-; SSE41-NEXT: movdqa %xmm4, %xmm5
-; SSE41-NEXT: pcmpgtd %xmm0, %xmm5
-; SSE41-NEXT: pshufd {{.*#+}} xmm6 = xmm5[0,0,2,2]
-; SSE41-NEXT: pcmpeqd %xmm0, %xmm4
-; SSE41-NEXT: pshufd {{.*#+}} xmm4 = xmm4[1,1,3,3]
-; SSE41-NEXT: pand %xmm6, %xmm4
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm5[1,1,3,3]
-; SSE41-NEXT: por %xmm4, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm2, %xmm1
-; SSE41-NEXT: movapd %xmm1, %xmm0
-; SSE41-NEXT: xorpd %xmm3, %xmm0
-; SSE41-NEXT: pshufd {{.*#+}} xmm2 = xmm1[2,3,2,3]
-; SSE41-NEXT: pxor %xmm2, %xmm3
-; SSE41-NEXT: movapd %xmm0, %xmm4
-; SSE41-NEXT: pcmpgtd %xmm3, %xmm4
-; SSE41-NEXT: pmovsxdq %xmm4, %xmm5
-; SSE41-NEXT: pcmpeqd %xmm0, %xmm3
-; SSE41-NEXT: pshufd {{.*#+}} xmm3 = xmm3[1,1,3,3]
-; SSE41-NEXT: pand %xmm5, %xmm3
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm4[1,1,3,3]
-; SSE41-NEXT: por %xmm3, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm1, %xmm2
-; SSE41-NEXT: movq %xmm2, %rax
-; SSE41-NEXT: retq
-;
-; SSE42-LABEL: test_v4i64:
-; SSE42: # %bb.0:
-; SSE42-NEXT: movdqa %xmm0, %xmm2
-; SSE42-NEXT: pcmpgtq %xmm1, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm2, %xmm1
-; SSE42-NEXT: pshufd {{.*#+}} xmm2 = xmm1[2,3,2,3]
-; SSE42-NEXT: movdqa %xmm1, %xmm0
-; SSE42-NEXT: pcmpgtq %xmm2, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm1, %xmm2
-; SSE42-NEXT: movq %xmm2, %rax
-; SSE42-NEXT: retq
-;
-; AVX1-LABEL: test_v4i64:
-; AVX1: # %bb.0:
-; AVX1-NEXT: vextractf128 $1, %ymm0, %xmm1
-; AVX1-NEXT: vpcmpgtq %xmm1, %xmm0, %xmm2
-; AVX1-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
-; AVX1-NEXT: vshufps {{.*#+}} xmm1 = xmm0[2,3,2,3]
-; AVX1-NEXT: vpcmpgtq %xmm1, %xmm0, %xmm2
-; AVX1-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
-; AVX1-NEXT: vmovq %xmm0, %rax
-; AVX1-NEXT: vzeroupper
-; AVX1-NEXT: retq
-;
-; AVX2-LABEL: test_v4i64:
-; AVX2: # %bb.0:
-; AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
-; AVX2-NEXT: vpcmpgtq %xmm1, %xmm0, %xmm2
-; AVX2-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
-; AVX2-NEXT: vshufps {{.*#+}} xmm1 = xmm0[2,3,2,3]
-; AVX2-NEXT: vpcmpgtq %xmm1, %xmm0, %xmm2
-; AVX2-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
-; AVX2-NEXT: vmovq %xmm0, %rax
-; AVX2-NEXT: vzeroupper
-; AVX2-NEXT: retq
+define i64 @test_v4i64(<4 x i64> %a0) nounwind {
+; X86-SSE2-LABEL: test_v4i64:
+; X86-SSE2: # %bb.0:
+; X86-SSE2-NEXT: movdqa {{.*#+}} xmm2 = [2147483648,0,2147483648,0]
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm3
+; X86-SSE2-NEXT: pxor %xmm2, %xmm3
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm4
+; X86-SSE2-NEXT: pxor %xmm2, %xmm4
+; X86-SSE2-NEXT: movdqa %xmm4, %xmm5
+; X86-SSE2-NEXT: pcmpgtd %xmm3, %xmm5
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm6 = xmm5[0,0,2,2]
+; X86-SSE2-NEXT: pcmpeqd %xmm3, %xmm4
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm4 = xmm4[1,1,3,3]
+; X86-SSE2-NEXT: pand %xmm6, %xmm4
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm3 = xmm5[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm4, %xmm3
+; X86-SSE2-NEXT: pand %xmm3, %xmm0
+; X86-SSE2-NEXT: pandn %xmm1, %xmm3
+; X86-SSE2-NEXT: por %xmm0, %xmm3
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm3[2,3,2,3]
+; X86-SSE2-NEXT: movdqa %xmm3, %xmm1
+; X86-SSE2-NEXT: pxor %xmm2, %xmm1
+; X86-SSE2-NEXT: pxor %xmm0, %xmm2
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm4
+; X86-SSE2-NEXT: pcmpgtd %xmm2, %xmm4
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm5 = xmm4[0,0,2,2]
+; X86-SSE2-NEXT: pcmpeqd %xmm1, %xmm2
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm2[1,1,3,3]
+; X86-SSE2-NEXT: pand %xmm5, %xmm1
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm4[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm1, %xmm2
+; X86-SSE2-NEXT: pand %xmm2, %xmm3
+; X86-SSE2-NEXT: pandn %xmm0, %xmm2
+; X86-SSE2-NEXT: por %xmm3, %xmm2
+; X86-SSE2-NEXT: movd %xmm2, %eax
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,1,1]
+; X86-SSE2-NEXT: movd %xmm0, %edx
+; X86-SSE2-NEXT: retl
+;
+; X64-SSE2-LABEL: test_v4i64:
+; X64-SSE2: # %bb.0:
+; X64-SSE2-NEXT: movdqa {{.*#+}} xmm2 = [2147483648,2147483648]
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm3
+; X64-SSE2-NEXT: pxor %xmm2, %xmm3
+; X64-SSE2-NEXT: pxor %xmm0, %xmm2
+; X64-SSE2-NEXT: movdqa %xmm2, %xmm4
+; X64-SSE2-NEXT: pcmpgtd %xmm3, %xmm4
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm5 = xmm4[0,0,2,2]
+; X64-SSE2-NEXT: pcmpeqd %xmm3, %xmm2
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm2[1,1,3,3]
+; X64-SSE2-NEXT: pand %xmm5, %xmm2
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm3 = xmm4[1,1,3,3]
+; X64-SSE2-NEXT: por %xmm2, %xmm3
+; X64-SSE2-NEXT: pand %xmm3, %xmm0
+; X64-SSE2-NEXT: pandn %xmm1, %xmm3
+; X64-SSE2-NEXT: por %xmm0, %xmm3
+; X64-SSE2-NEXT: movq %xmm3, %rcx
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm3[2,3,2,3]
+; X64-SSE2-NEXT: movq %xmm0, %rax
+; X64-SSE2-NEXT: cmpq %rax, %rcx
+; X64-SSE2-NEXT: cmovgq %rcx, %rax
+; X64-SSE2-NEXT: retq
+;
+; X86-SSE41-LABEL: test_v4i64:
+; X86-SSE41: # %bb.0:
+; X86-SSE41-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE41-NEXT: pmovzxdq {{.*#+}} xmm3 = [2147483648,2147483648]
+; X86-SSE41-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE41-NEXT: pxor %xmm3, %xmm0
+; X86-SSE41-NEXT: movdqa %xmm2, %xmm4
+; X86-SSE41-NEXT: pxor %xmm3, %xmm4
+; X86-SSE41-NEXT: movdqa %xmm4, %xmm5
+; X86-SSE41-NEXT: pcmpgtd %xmm0, %xmm5
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm6 = xmm5[0,0,2,2]
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm4
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm4 = xmm4[1,1,3,3]
+; X86-SSE41-NEXT: pand %xmm6, %xmm4
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm5[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm4, %xmm0
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm2, %xmm1
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm2 = xmm1[2,3,2,3]
+; X86-SSE41-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE41-NEXT: pxor %xmm3, %xmm0
+; X86-SSE41-NEXT: pxor %xmm2, %xmm3
+; X86-SSE41-NEXT: movdqa %xmm0, %xmm4
+; X86-SSE41-NEXT: pcmpgtd %xmm3, %xmm4
+; X86-SSE41-NEXT: pmovsxdq %xmm4, %xmm5
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm3
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm3 = xmm3[1,1,3,3]
+; X86-SSE41-NEXT: pand %xmm5, %xmm3
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm4[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm3, %xmm0
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm1, %xmm2
+; X86-SSE41-NEXT: movd %xmm2, %eax
+; X86-SSE41-NEXT: pextrd $1, %xmm2, %edx
+; X86-SSE41-NEXT: retl
+;
+; X64-SSE41-LABEL: test_v4i64:
+; X64-SSE41: # %bb.0:
+; X64-SSE41-NEXT: movdqa %xmm0, %xmm2
+; X64-SSE41-NEXT: pmovzxdq {{.*#+}} xmm3 = [2147483648,2147483648]
+; X64-SSE41-NEXT: movdqa %xmm1, %xmm0
+; X64-SSE41-NEXT: pxor %xmm3, %xmm0
+; X64-SSE41-NEXT: movdqa %xmm2, %xmm4
+; X64-SSE41-NEXT: pxor %xmm3, %xmm4
+; X64-SSE41-NEXT: movdqa %xmm4, %xmm5
+; X64-SSE41-NEXT: pcmpgtd %xmm0, %xmm5
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm6 = xmm5[0,0,2,2]
+; X64-SSE41-NEXT: pcmpeqd %xmm0, %xmm4
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm4 = xmm4[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm6, %xmm4
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm5[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm4, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm2, %xmm1
+; X64-SSE41-NEXT: movapd %xmm1, %xmm0
+; X64-SSE41-NEXT: xorpd %xmm3, %xmm0
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm2 = xmm1[2,3,2,3]
+; X64-SSE41-NEXT: pxor %xmm2, %xmm3
+; X64-SSE41-NEXT: movapd %xmm0, %xmm4
+; X64-SSE41-NEXT: pcmpgtd %xmm3, %xmm4
+; X64-SSE41-NEXT: pmovsxdq %xmm4, %xmm5
+; X64-SSE41-NEXT: pcmpeqd %xmm0, %xmm3
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm3 = xmm3[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm5, %xmm3
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm4[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm3, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm1, %xmm2
+; X64-SSE41-NEXT: movq %xmm2, %rax
+; X64-SSE41-NEXT: retq
+;
+; X86-SSE42-LABEL: test_v4i64:
+; X86-SSE42: # %bb.0:
+; X86-SSE42-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE42-NEXT: pcmpgtq %xmm1, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm2, %xmm1
+; X86-SSE42-NEXT: pshufd {{.*#+}} xmm2 = xmm1[2,3,2,3]
+; X86-SSE42-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE42-NEXT: pcmpgtq %xmm2, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm1, %xmm2
+; X86-SSE42-NEXT: movd %xmm2, %eax
+; X86-SSE42-NEXT: pextrd $1, %xmm2, %edx
+; X86-SSE42-NEXT: retl
+;
+; X64-SSE42-LABEL: test_v4i64:
+; X64-SSE42: # %bb.0:
+; X64-SSE42-NEXT: movdqa %xmm0, %xmm2
+; X64-SSE42-NEXT: pcmpgtq %xmm1, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm2, %xmm1
+; X64-SSE42-NEXT: pshufd {{.*#+}} xmm2 = xmm1[2,3,2,3]
+; X64-SSE42-NEXT: movdqa %xmm1, %xmm0
+; X64-SSE42-NEXT: pcmpgtq %xmm2, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm1, %xmm2
+; X64-SSE42-NEXT: movq %xmm2, %rax
+; X64-SSE42-NEXT: retq
+;
+; X86-AVX1-LABEL: test_v4i64:
+; X86-AVX1: # %bb.0:
+; X86-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm1
+; X86-AVX1-NEXT: vpcmpgtq %xmm1, %xmm0, %xmm2
+; X86-AVX1-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X86-AVX1-NEXT: vshufps {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-AVX1-NEXT: vpcmpgtq %xmm1, %xmm0, %xmm2
+; X86-AVX1-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X86-AVX1-NEXT: vmovd %xmm0, %eax
+; X86-AVX1-NEXT: vpextrd $1, %xmm0, %edx
+; X86-AVX1-NEXT: vzeroupper
+; X86-AVX1-NEXT: retl
+;
+; X64-AVX1-LABEL: test_v4i64:
+; X64-AVX1: # %bb.0:
+; X64-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm1
+; X64-AVX1-NEXT: vpcmpgtq %xmm1, %xmm0, %xmm2
+; X64-AVX1-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X64-AVX1-NEXT: vshufps {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X64-AVX1-NEXT: vpcmpgtq %xmm1, %xmm0, %xmm2
+; X64-AVX1-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X64-AVX1-NEXT: vmovq %xmm0, %rax
+; X64-AVX1-NEXT: vzeroupper
+; X64-AVX1-NEXT: retq
+;
+; X86-AVX2-LABEL: test_v4i64:
+; X86-AVX2: # %bb.0:
+; X86-AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
+; X86-AVX2-NEXT: vpcmpgtq %xmm1, %xmm0, %xmm2
+; X86-AVX2-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X86-AVX2-NEXT: vshufps {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-AVX2-NEXT: vpcmpgtq %xmm1, %xmm0, %xmm2
+; X86-AVX2-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X86-AVX2-NEXT: vmovd %xmm0, %eax
+; X86-AVX2-NEXT: vpextrd $1, %xmm0, %edx
+; X86-AVX2-NEXT: vzeroupper
+; X86-AVX2-NEXT: retl
+;
+; X64-AVX2-LABEL: test_v4i64:
+; X64-AVX2: # %bb.0:
+; X64-AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
+; X64-AVX2-NEXT: vpcmpgtq %xmm1, %xmm0, %xmm2
+; X64-AVX2-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X64-AVX2-NEXT: vshufps {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X64-AVX2-NEXT: vpcmpgtq %xmm1, %xmm0, %xmm2
+; X64-AVX2-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X64-AVX2-NEXT: vmovq %xmm0, %rax
+; X64-AVX2-NEXT: vzeroupper
+; X64-AVX2-NEXT: retq
;
; AVX512BW-LABEL: test_v4i64:
; AVX512BW: # %bb.0:
@@ -195,169 +374,371 @@ define i64 @test_v4i64(<4 x i64> %a0) {
ret i64 %1
}
-define i64 @test_v8i64(<8 x i64> %a0) {
-; SSE2-LABEL: test_v8i64:
-; SSE2: # %bb.0:
-; SSE2-NEXT: movdqa {{.*#+}} xmm4 = [2147483648,2147483648]
-; SSE2-NEXT: movdqa %xmm3, %xmm5
-; SSE2-NEXT: pxor %xmm4, %xmm5
-; SSE2-NEXT: movdqa %xmm1, %xmm6
-; SSE2-NEXT: pxor %xmm4, %xmm6
-; SSE2-NEXT: movdqa %xmm6, %xmm7
-; SSE2-NEXT: pcmpgtd %xmm5, %xmm7
-; SSE2-NEXT: pshufd {{.*#+}} xmm8 = xmm7[0,0,2,2]
-; SSE2-NEXT: pcmpeqd %xmm5, %xmm6
-; SSE2-NEXT: pshufd {{.*#+}} xmm6 = xmm6[1,1,3,3]
-; SSE2-NEXT: pand %xmm8, %xmm6
-; SSE2-NEXT: pshufd {{.*#+}} xmm5 = xmm7[1,1,3,3]
-; SSE2-NEXT: por %xmm6, %xmm5
-; SSE2-NEXT: pand %xmm5, %xmm1
-; SSE2-NEXT: pandn %xmm3, %xmm5
-; SSE2-NEXT: por %xmm1, %xmm5
-; SSE2-NEXT: movdqa %xmm5, %xmm1
-; SSE2-NEXT: pxor %xmm4, %xmm1
-; SSE2-NEXT: movdqa %xmm2, %xmm3
-; SSE2-NEXT: pxor %xmm4, %xmm3
-; SSE2-NEXT: movdqa %xmm0, %xmm6
-; SSE2-NEXT: pxor %xmm4, %xmm6
-; SSE2-NEXT: movdqa %xmm6, %xmm7
-; SSE2-NEXT: pcmpgtd %xmm3, %xmm7
-; SSE2-NEXT: pshufd {{.*#+}} xmm8 = xmm7[0,0,2,2]
-; SSE2-NEXT: pcmpeqd %xmm3, %xmm6
-; SSE2-NEXT: pshufd {{.*#+}} xmm3 = xmm6[1,1,3,3]
-; SSE2-NEXT: pand %xmm8, %xmm3
-; SSE2-NEXT: pshufd {{.*#+}} xmm6 = xmm7[1,1,3,3]
-; SSE2-NEXT: por %xmm3, %xmm6
-; SSE2-NEXT: pand %xmm6, %xmm0
-; SSE2-NEXT: pandn %xmm2, %xmm6
-; SSE2-NEXT: por %xmm0, %xmm6
-; SSE2-NEXT: pxor %xmm6, %xmm4
-; SSE2-NEXT: movdqa %xmm4, %xmm0
-; SSE2-NEXT: pcmpgtd %xmm1, %xmm0
-; SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm0[0,0,2,2]
-; SSE2-NEXT: pcmpeqd %xmm1, %xmm4
-; SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm4[1,1,3,3]
-; SSE2-NEXT: pand %xmm2, %xmm1
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm0[1,1,3,3]
-; SSE2-NEXT: por %xmm1, %xmm0
-; SSE2-NEXT: pand %xmm0, %xmm6
-; SSE2-NEXT: pandn %xmm5, %xmm0
-; SSE2-NEXT: por %xmm6, %xmm0
-; SSE2-NEXT: movq %xmm0, %rcx
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm0[2,3,2,3]
-; SSE2-NEXT: movq %xmm0, %rax
-; SSE2-NEXT: cmpq %rax, %rcx
-; SSE2-NEXT: cmovgq %rcx, %rax
-; SSE2-NEXT: retq
-;
-; SSE41-LABEL: test_v8i64:
-; SSE41: # %bb.0:
-; SSE41-NEXT: movdqa %xmm0, %xmm4
-; SSE41-NEXT: pmovzxdq {{.*#+}} xmm5 = [2147483648,2147483648]
-; SSE41-NEXT: movdqa %xmm3, %xmm0
-; SSE41-NEXT: pxor %xmm5, %xmm0
-; SSE41-NEXT: movdqa %xmm1, %xmm6
-; SSE41-NEXT: pxor %xmm5, %xmm6
-; SSE41-NEXT: movdqa %xmm6, %xmm7
-; SSE41-NEXT: pcmpgtd %xmm0, %xmm7
-; SSE41-NEXT: pshufd {{.*#+}} xmm8 = xmm7[0,0,2,2]
-; SSE41-NEXT: pcmpeqd %xmm0, %xmm6
-; SSE41-NEXT: pshufd {{.*#+}} xmm6 = xmm6[1,1,3,3]
-; SSE41-NEXT: pand %xmm8, %xmm6
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm7[1,1,3,3]
-; SSE41-NEXT: por %xmm6, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm1, %xmm3
-; SSE41-NEXT: movapd %xmm3, %xmm1
-; SSE41-NEXT: xorpd %xmm5, %xmm1
-; SSE41-NEXT: movdqa %xmm2, %xmm0
-; SSE41-NEXT: pxor %xmm5, %xmm0
-; SSE41-NEXT: movdqa %xmm4, %xmm6
-; SSE41-NEXT: pxor %xmm5, %xmm6
-; SSE41-NEXT: movdqa %xmm6, %xmm7
-; SSE41-NEXT: pcmpgtd %xmm0, %xmm7
-; SSE41-NEXT: pshufd {{.*#+}} xmm8 = xmm7[0,0,2,2]
-; SSE41-NEXT: pcmpeqd %xmm0, %xmm6
-; SSE41-NEXT: pshufd {{.*#+}} xmm6 = xmm6[1,1,3,3]
-; SSE41-NEXT: pand %xmm8, %xmm6
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm7[1,1,3,3]
-; SSE41-NEXT: por %xmm6, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm4, %xmm2
-; SSE41-NEXT: movapd %xmm2, %xmm0
-; SSE41-NEXT: xorpd %xmm5, %xmm0
-; SSE41-NEXT: movapd %xmm0, %xmm4
-; SSE41-NEXT: pcmpgtd %xmm1, %xmm4
-; SSE41-NEXT: pshufd {{.*#+}} xmm6 = xmm4[0,0,2,2]
-; SSE41-NEXT: pcmpeqd %xmm1, %xmm0
-; SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,3,3]
-; SSE41-NEXT: pand %xmm6, %xmm1
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm4[1,1,3,3]
-; SSE41-NEXT: por %xmm1, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm2, %xmm3
-; SSE41-NEXT: movapd %xmm3, %xmm0
-; SSE41-NEXT: xorpd %xmm5, %xmm0
-; SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm3[2,3,2,3]
-; SSE41-NEXT: pxor %xmm1, %xmm5
-; SSE41-NEXT: movapd %xmm0, %xmm2
-; SSE41-NEXT: pcmpgtd %xmm5, %xmm2
-; SSE41-NEXT: pmovsxdq %xmm2, %xmm4
-; SSE41-NEXT: pcmpeqd %xmm0, %xmm5
-; SSE41-NEXT: pshufd {{.*#+}} xmm5 = xmm5[1,1,3,3]
-; SSE41-NEXT: pand %xmm4, %xmm5
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,3,3]
-; SSE41-NEXT: por %xmm5, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm3, %xmm1
-; SSE41-NEXT: movq %xmm1, %rax
-; SSE41-NEXT: retq
-;
-; SSE42-LABEL: test_v8i64:
-; SSE42: # %bb.0:
-; SSE42-NEXT: movdqa %xmm0, %xmm4
-; SSE42-NEXT: movdqa %xmm1, %xmm0
-; SSE42-NEXT: pcmpgtq %xmm3, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm1, %xmm3
-; SSE42-NEXT: movdqa %xmm4, %xmm0
-; SSE42-NEXT: pcmpgtq %xmm2, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm4, %xmm2
-; SSE42-NEXT: movapd %xmm2, %xmm0
-; SSE42-NEXT: pcmpgtq %xmm3, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm2, %xmm3
-; SSE42-NEXT: pshufd {{.*#+}} xmm1 = xmm3[2,3,2,3]
-; SSE42-NEXT: movdqa %xmm3, %xmm0
-; SSE42-NEXT: pcmpgtq %xmm1, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm3, %xmm1
-; SSE42-NEXT: movq %xmm1, %rax
-; SSE42-NEXT: retq
-;
-; AVX1-LABEL: test_v8i64:
-; AVX1: # %bb.0:
-; AVX1-NEXT: vextractf128 $1, %ymm1, %xmm2
-; AVX1-NEXT: vextractf128 $1, %ymm0, %xmm3
-; AVX1-NEXT: vpcmpgtq %xmm2, %xmm3, %xmm4
-; AVX1-NEXT: vblendvpd %xmm4, %xmm3, %xmm2, %xmm2
-; AVX1-NEXT: vpcmpgtq %xmm1, %xmm0, %xmm3
-; AVX1-NEXT: vblendvpd %xmm3, %xmm0, %xmm1, %xmm0
-; AVX1-NEXT: vpcmpgtq %xmm2, %xmm0, %xmm1
-; AVX1-NEXT: vblendvpd %xmm1, %xmm0, %xmm2, %xmm0
-; AVX1-NEXT: vshufps {{.*#+}} xmm1 = xmm0[2,3,2,3]
-; AVX1-NEXT: vpcmpgtq %xmm1, %xmm0, %xmm2
-; AVX1-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
-; AVX1-NEXT: vmovq %xmm0, %rax
-; AVX1-NEXT: vzeroupper
-; AVX1-NEXT: retq
-;
-; AVX2-LABEL: test_v8i64:
-; AVX2: # %bb.0:
-; AVX2-NEXT: vpcmpgtq %ymm1, %ymm0, %ymm2
-; AVX2-NEXT: vblendvpd %ymm2, %ymm0, %ymm1, %ymm0
-; AVX2-NEXT: vextractf128 $1, %ymm0, %xmm1
-; AVX2-NEXT: vpcmpgtq %xmm1, %xmm0, %xmm2
-; AVX2-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
-; AVX2-NEXT: vshufps {{.*#+}} xmm1 = xmm0[2,3,2,3]
-; AVX2-NEXT: vpcmpgtq %xmm1, %xmm0, %xmm2
-; AVX2-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
-; AVX2-NEXT: vmovq %xmm0, %rax
-; AVX2-NEXT: vzeroupper
-; AVX2-NEXT: retq
+define i64 @test_v8i64(<8 x i64> %a0) nounwind {
+; X86-SSE2-LABEL: test_v8i64:
+; X86-SSE2: # %bb.0:
+; X86-SSE2-NEXT: pushl %ebp
+; X86-SSE2-NEXT: movl %esp, %ebp
+; X86-SSE2-NEXT: andl $-16, %esp
+; X86-SSE2-NEXT: subl $16, %esp
+; X86-SSE2-NEXT: movdqa {{.*#+}} xmm3 = [2147483648,0,2147483648,0]
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm4
+; X86-SSE2-NEXT: pxor %xmm3, %xmm4
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm5
+; X86-SSE2-NEXT: pxor %xmm3, %xmm5
+; X86-SSE2-NEXT: movdqa %xmm5, %xmm6
+; X86-SSE2-NEXT: pcmpgtd %xmm4, %xmm6
+; X86-SSE2-NEXT: pcmpeqd %xmm4, %xmm5
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm4 = xmm6[0,0,2,2]
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm7 = xmm5[1,1,3,3]
+; X86-SSE2-NEXT: pand %xmm4, %xmm7
+; X86-SSE2-NEXT: movdqa 8(%ebp), %xmm5
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm4 = xmm6[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm7, %xmm4
+; X86-SSE2-NEXT: pand %xmm4, %xmm0
+; X86-SSE2-NEXT: pandn %xmm2, %xmm4
+; X86-SSE2-NEXT: por %xmm0, %xmm4
+; X86-SSE2-NEXT: movdqa %xmm5, %xmm0
+; X86-SSE2-NEXT: pxor %xmm3, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm2
+; X86-SSE2-NEXT: pxor %xmm3, %xmm2
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm6
+; X86-SSE2-NEXT: pcmpgtd %xmm0, %xmm6
+; X86-SSE2-NEXT: pcmpeqd %xmm0, %xmm2
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm6[0,0,2,2]
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm7 = xmm2[1,1,3,3]
+; X86-SSE2-NEXT: pand %xmm0, %xmm7
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm6[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm7, %xmm2
+; X86-SSE2-NEXT: pand %xmm2, %xmm1
+; X86-SSE2-NEXT: pandn %xmm5, %xmm2
+; X86-SSE2-NEXT: por %xmm1, %xmm2
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm0
+; X86-SSE2-NEXT: pxor %xmm3, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm4, %xmm1
+; X86-SSE2-NEXT: pxor %xmm3, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm5
+; X86-SSE2-NEXT: pcmpgtd %xmm0, %xmm5
+; X86-SSE2-NEXT: pcmpeqd %xmm0, %xmm1
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm5[0,0,2,2]
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm1[1,1,3,3]
+; X86-SSE2-NEXT: pand %xmm0, %xmm1
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm5[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm1, %xmm0
+; X86-SSE2-NEXT: pand %xmm0, %xmm4
+; X86-SSE2-NEXT: pandn %xmm2, %xmm0
+; X86-SSE2-NEXT: por %xmm4, %xmm0
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE2-NEXT: pxor %xmm3, %xmm2
+; X86-SSE2-NEXT: pxor %xmm1, %xmm3
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm4
+; X86-SSE2-NEXT: pcmpgtd %xmm3, %xmm4
+; X86-SSE2-NEXT: pcmpeqd %xmm2, %xmm3
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm4[0,0,2,2]
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm3 = xmm3[1,1,3,3]
+; X86-SSE2-NEXT: pand %xmm2, %xmm3
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm4[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm3, %xmm2
+; X86-SSE2-NEXT: pand %xmm2, %xmm0
+; X86-SSE2-NEXT: pandn %xmm1, %xmm2
+; X86-SSE2-NEXT: por %xmm0, %xmm2
+; X86-SSE2-NEXT: movd %xmm2, %eax
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,1,1]
+; X86-SSE2-NEXT: movd %xmm0, %edx
+; X86-SSE2-NEXT: movl %ebp, %esp
+; X86-SSE2-NEXT: popl %ebp
+; X86-SSE2-NEXT: retl
+;
+; X64-SSE2-LABEL: test_v8i64:
+; X64-SSE2: # %bb.0:
+; X64-SSE2-NEXT: movdqa {{.*#+}} xmm4 = [2147483648,2147483648]
+; X64-SSE2-NEXT: movdqa %xmm3, %xmm5
+; X64-SSE2-NEXT: pxor %xmm4, %xmm5
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm6
+; X64-SSE2-NEXT: pxor %xmm4, %xmm6
+; X64-SSE2-NEXT: movdqa %xmm6, %xmm7
+; X64-SSE2-NEXT: pcmpgtd %xmm5, %xmm7
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm8 = xmm7[0,0,2,2]
+; X64-SSE2-NEXT: pcmpeqd %xmm5, %xmm6
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm6 = xmm6[1,1,3,3]
+; X64-SSE2-NEXT: pand %xmm8, %xmm6
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm5 = xmm7[1,1,3,3]
+; X64-SSE2-NEXT: por %xmm6, %xmm5
+; X64-SSE2-NEXT: pand %xmm5, %xmm1
+; X64-SSE2-NEXT: pandn %xmm3, %xmm5
+; X64-SSE2-NEXT: por %xmm1, %xmm5
+; X64-SSE2-NEXT: movdqa %xmm5, %xmm1
+; X64-SSE2-NEXT: pxor %xmm4, %xmm1
+; X64-SSE2-NEXT: movdqa %xmm2, %xmm3
+; X64-SSE2-NEXT: pxor %xmm4, %xmm3
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm6
+; X64-SSE2-NEXT: pxor %xmm4, %xmm6
+; X64-SSE2-NEXT: movdqa %xmm6, %xmm7
+; X64-SSE2-NEXT: pcmpgtd %xmm3, %xmm7
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm8 = xmm7[0,0,2,2]
+; X64-SSE2-NEXT: pcmpeqd %xmm3, %xmm6
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm3 = xmm6[1,1,3,3]
+; X64-SSE2-NEXT: pand %xmm8, %xmm3
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm6 = xmm7[1,1,3,3]
+; X64-SSE2-NEXT: por %xmm3, %xmm6
+; X64-SSE2-NEXT: pand %xmm6, %xmm0
+; X64-SSE2-NEXT: pandn %xmm2, %xmm6
+; X64-SSE2-NEXT: por %xmm0, %xmm6
+; X64-SSE2-NEXT: pxor %xmm6, %xmm4
+; X64-SSE2-NEXT: movdqa %xmm4, %xmm0
+; X64-SSE2-NEXT: pcmpgtd %xmm1, %xmm0
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm0[0,0,2,2]
+; X64-SSE2-NEXT: pcmpeqd %xmm1, %xmm4
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm4[1,1,3,3]
+; X64-SSE2-NEXT: pand %xmm2, %xmm1
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm0[1,1,3,3]
+; X64-SSE2-NEXT: por %xmm1, %xmm0
+; X64-SSE2-NEXT: pand %xmm0, %xmm6
+; X64-SSE2-NEXT: pandn %xmm5, %xmm0
+; X64-SSE2-NEXT: por %xmm6, %xmm0
+; X64-SSE2-NEXT: movq %xmm0, %rcx
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm0[2,3,2,3]
+; X64-SSE2-NEXT: movq %xmm0, %rax
+; X64-SSE2-NEXT: cmpq %rax, %rcx
+; X64-SSE2-NEXT: cmovgq %rcx, %rax
+; X64-SSE2-NEXT: retq
+;
+; X86-SSE41-LABEL: test_v8i64:
+; X86-SSE41: # %bb.0:
+; X86-SSE41-NEXT: pushl %ebp
+; X86-SSE41-NEXT: movl %esp, %ebp
+; X86-SSE41-NEXT: andl $-16, %esp
+; X86-SSE41-NEXT: subl $16, %esp
+; X86-SSE41-NEXT: movdqa %xmm0, %xmm3
+; X86-SSE41-NEXT: pmovzxdq {{.*#+}} xmm4 = [2147483648,2147483648]
+; X86-SSE41-NEXT: movdqa %xmm2, %xmm0
+; X86-SSE41-NEXT: pxor %xmm4, %xmm0
+; X86-SSE41-NEXT: movdqa %xmm3, %xmm5
+; X86-SSE41-NEXT: pxor %xmm4, %xmm5
+; X86-SSE41-NEXT: movdqa %xmm5, %xmm6
+; X86-SSE41-NEXT: pcmpgtd %xmm0, %xmm6
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm5
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm6[0,0,2,2]
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm7 = xmm5[1,1,3,3]
+; X86-SSE41-NEXT: pand %xmm0, %xmm7
+; X86-SSE41-NEXT: movdqa 8(%ebp), %xmm5
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm6[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm7, %xmm0
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm3, %xmm2
+; X86-SSE41-NEXT: movdqa %xmm5, %xmm0
+; X86-SSE41-NEXT: pxor %xmm4, %xmm0
+; X86-SSE41-NEXT: movdqa %xmm1, %xmm3
+; X86-SSE41-NEXT: pxor %xmm4, %xmm3
+; X86-SSE41-NEXT: movdqa %xmm3, %xmm6
+; X86-SSE41-NEXT: pcmpgtd %xmm0, %xmm6
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm3
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm6[0,0,2,2]
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm3 = xmm3[1,1,3,3]
+; X86-SSE41-NEXT: pand %xmm0, %xmm3
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm6[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm3, %xmm0
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm1, %xmm5
+; X86-SSE41-NEXT: movapd %xmm5, %xmm0
+; X86-SSE41-NEXT: xorpd %xmm4, %xmm0
+; X86-SSE41-NEXT: movapd %xmm2, %xmm1
+; X86-SSE41-NEXT: xorpd %xmm4, %xmm1
+; X86-SSE41-NEXT: movapd %xmm1, %xmm3
+; X86-SSE41-NEXT: pcmpgtd %xmm0, %xmm3
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm1
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm3[0,0,2,2]
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm1[1,1,3,3]
+; X86-SSE41-NEXT: pand %xmm0, %xmm1
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm3[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm1, %xmm0
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm2, %xmm5
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm5[2,3,2,3]
+; X86-SSE41-NEXT: movdqa %xmm5, %xmm0
+; X86-SSE41-NEXT: pxor %xmm4, %xmm0
+; X86-SSE41-NEXT: pxor %xmm1, %xmm4
+; X86-SSE41-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE41-NEXT: pcmpgtd %xmm4, %xmm2
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm4
+; X86-SSE41-NEXT: pmovsxdq %xmm2, %xmm0
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm3 = xmm4[1,1,3,3]
+; X86-SSE41-NEXT: pand %xmm0, %xmm3
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm3, %xmm0
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm5, %xmm1
+; X86-SSE41-NEXT: movd %xmm1, %eax
+; X86-SSE41-NEXT: pextrd $1, %xmm1, %edx
+; X86-SSE41-NEXT: movl %ebp, %esp
+; X86-SSE41-NEXT: popl %ebp
+; X86-SSE41-NEXT: retl
+;
+; X64-SSE41-LABEL: test_v8i64:
+; X64-SSE41: # %bb.0:
+; X64-SSE41-NEXT: movdqa %xmm0, %xmm4
+; X64-SSE41-NEXT: pmovzxdq {{.*#+}} xmm5 = [2147483648,2147483648]
+; X64-SSE41-NEXT: movdqa %xmm3, %xmm0
+; X64-SSE41-NEXT: pxor %xmm5, %xmm0
+; X64-SSE41-NEXT: movdqa %xmm1, %xmm6
+; X64-SSE41-NEXT: pxor %xmm5, %xmm6
+; X64-SSE41-NEXT: movdqa %xmm6, %xmm7
+; X64-SSE41-NEXT: pcmpgtd %xmm0, %xmm7
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm8 = xmm7[0,0,2,2]
+; X64-SSE41-NEXT: pcmpeqd %xmm0, %xmm6
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm6 = xmm6[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm8, %xmm6
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm7[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm6, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm1, %xmm3
+; X64-SSE41-NEXT: movapd %xmm3, %xmm1
+; X64-SSE41-NEXT: xorpd %xmm5, %xmm1
+; X64-SSE41-NEXT: movdqa %xmm2, %xmm0
+; X64-SSE41-NEXT: pxor %xmm5, %xmm0
+; X64-SSE41-NEXT: movdqa %xmm4, %xmm6
+; X64-SSE41-NEXT: pxor %xmm5, %xmm6
+; X64-SSE41-NEXT: movdqa %xmm6, %xmm7
+; X64-SSE41-NEXT: pcmpgtd %xmm0, %xmm7
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm8 = xmm7[0,0,2,2]
+; X64-SSE41-NEXT: pcmpeqd %xmm0, %xmm6
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm6 = xmm6[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm8, %xmm6
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm7[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm6, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm4, %xmm2
+; X64-SSE41-NEXT: movapd %xmm2, %xmm0
+; X64-SSE41-NEXT: xorpd %xmm5, %xmm0
+; X64-SSE41-NEXT: movapd %xmm0, %xmm4
+; X64-SSE41-NEXT: pcmpgtd %xmm1, %xmm4
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm6 = xmm4[0,0,2,2]
+; X64-SSE41-NEXT: pcmpeqd %xmm1, %xmm0
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm6, %xmm1
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm4[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm1, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm2, %xmm3
+; X64-SSE41-NEXT: movapd %xmm3, %xmm0
+; X64-SSE41-NEXT: xorpd %xmm5, %xmm0
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm3[2,3,2,3]
+; X64-SSE41-NEXT: pxor %xmm1, %xmm5
+; X64-SSE41-NEXT: movapd %xmm0, %xmm2
+; X64-SSE41-NEXT: pcmpgtd %xmm5, %xmm2
+; X64-SSE41-NEXT: pmovsxdq %xmm2, %xmm4
+; X64-SSE41-NEXT: pcmpeqd %xmm0, %xmm5
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm5 = xmm5[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm4, %xmm5
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm5, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm3, %xmm1
+; X64-SSE41-NEXT: movq %xmm1, %rax
+; X64-SSE41-NEXT: retq
+;
+; X86-SSE42-LABEL: test_v8i64:
+; X86-SSE42: # %bb.0:
+; X86-SSE42-NEXT: pushl %ebp
+; X86-SSE42-NEXT: movl %esp, %ebp
+; X86-SSE42-NEXT: andl $-16, %esp
+; X86-SSE42-NEXT: subl $16, %esp
+; X86-SSE42-NEXT: movdqa %xmm0, %xmm3
+; X86-SSE42-NEXT: movdqa 8(%ebp), %xmm4
+; X86-SSE42-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE42-NEXT: pcmpgtq %xmm4, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm1, %xmm4
+; X86-SSE42-NEXT: movdqa %xmm3, %xmm0
+; X86-SSE42-NEXT: pcmpgtq %xmm2, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm3, %xmm2
+; X86-SSE42-NEXT: movapd %xmm2, %xmm0
+; X86-SSE42-NEXT: pcmpgtq %xmm4, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm2, %xmm4
+; X86-SSE42-NEXT: pshufd {{.*#+}} xmm1 = xmm4[2,3,2,3]
+; X86-SSE42-NEXT: movdqa %xmm4, %xmm0
+; X86-SSE42-NEXT: pcmpgtq %xmm1, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm4, %xmm1
+; X86-SSE42-NEXT: movd %xmm1, %eax
+; X86-SSE42-NEXT: pextrd $1, %xmm1, %edx
+; X86-SSE42-NEXT: movl %ebp, %esp
+; X86-SSE42-NEXT: popl %ebp
+; X86-SSE42-NEXT: retl
+;
+; X64-SSE42-LABEL: test_v8i64:
+; X64-SSE42: # %bb.0:
+; X64-SSE42-NEXT: movdqa %xmm0, %xmm4
+; X64-SSE42-NEXT: movdqa %xmm1, %xmm0
+; X64-SSE42-NEXT: pcmpgtq %xmm3, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm1, %xmm3
+; X64-SSE42-NEXT: movdqa %xmm4, %xmm0
+; X64-SSE42-NEXT: pcmpgtq %xmm2, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm4, %xmm2
+; X64-SSE42-NEXT: movapd %xmm2, %xmm0
+; X64-SSE42-NEXT: pcmpgtq %xmm3, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm2, %xmm3
+; X64-SSE42-NEXT: pshufd {{.*#+}} xmm1 = xmm3[2,3,2,3]
+; X64-SSE42-NEXT: movdqa %xmm3, %xmm0
+; X64-SSE42-NEXT: pcmpgtq %xmm1, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm3, %xmm1
+; X64-SSE42-NEXT: movq %xmm1, %rax
+; X64-SSE42-NEXT: retq
+;
+; X86-AVX1-LABEL: test_v8i64:
+; X86-AVX1: # %bb.0:
+; X86-AVX1-NEXT: vextractf128 $1, %ymm1, %xmm2
+; X86-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm3
+; X86-AVX1-NEXT: vpcmpgtq %xmm2, %xmm3, %xmm4
+; X86-AVX1-NEXT: vblendvpd %xmm4, %xmm3, %xmm2, %xmm2
+; X86-AVX1-NEXT: vpcmpgtq %xmm1, %xmm0, %xmm3
+; X86-AVX1-NEXT: vblendvpd %xmm3, %xmm0, %xmm1, %xmm0
+; X86-AVX1-NEXT: vpcmpgtq %xmm2, %xmm0, %xmm1
+; X86-AVX1-NEXT: vblendvpd %xmm1, %xmm0, %xmm2, %xmm0
+; X86-AVX1-NEXT: vshufps {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-AVX1-NEXT: vpcmpgtq %xmm1, %xmm0, %xmm2
+; X86-AVX1-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X86-AVX1-NEXT: vmovd %xmm0, %eax
+; X86-AVX1-NEXT: vpextrd $1, %xmm0, %edx
+; X86-AVX1-NEXT: vzeroupper
+; X86-AVX1-NEXT: retl
+;
+; X64-AVX1-LABEL: test_v8i64:
+; X64-AVX1: # %bb.0:
+; X64-AVX1-NEXT: vextractf128 $1, %ymm1, %xmm2
+; X64-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm3
+; X64-AVX1-NEXT: vpcmpgtq %xmm2, %xmm3, %xmm4
+; X64-AVX1-NEXT: vblendvpd %xmm4, %xmm3, %xmm2, %xmm2
+; X64-AVX1-NEXT: vpcmpgtq %xmm1, %xmm0, %xmm3
+; X64-AVX1-NEXT: vblendvpd %xmm3, %xmm0, %xmm1, %xmm0
+; X64-AVX1-NEXT: vpcmpgtq %xmm2, %xmm0, %xmm1
+; X64-AVX1-NEXT: vblendvpd %xmm1, %xmm0, %xmm2, %xmm0
+; X64-AVX1-NEXT: vshufps {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X64-AVX1-NEXT: vpcmpgtq %xmm1, %xmm0, %xmm2
+; X64-AVX1-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X64-AVX1-NEXT: vmovq %xmm0, %rax
+; X64-AVX1-NEXT: vzeroupper
+; X64-AVX1-NEXT: retq
+;
+; X86-AVX2-LABEL: test_v8i64:
+; X86-AVX2: # %bb.0:
+; X86-AVX2-NEXT: vpcmpgtq %ymm1, %ymm0, %ymm2
+; X86-AVX2-NEXT: vblendvpd %ymm2, %ymm0, %ymm1, %ymm0
+; X86-AVX2-NEXT: vextractf128 $1, %ymm0, %xmm1
+; X86-AVX2-NEXT: vpcmpgtq %xmm1, %xmm0, %xmm2
+; X86-AVX2-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X86-AVX2-NEXT: vshufps {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-AVX2-NEXT: vpcmpgtq %xmm1, %xmm0, %xmm2
+; X86-AVX2-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X86-AVX2-NEXT: vmovd %xmm0, %eax
+; X86-AVX2-NEXT: vpextrd $1, %xmm0, %edx
+; X86-AVX2-NEXT: vzeroupper
+; X86-AVX2-NEXT: retl
+;
+; X64-AVX2-LABEL: test_v8i64:
+; X64-AVX2: # %bb.0:
+; X64-AVX2-NEXT: vpcmpgtq %ymm1, %ymm0, %ymm2
+; X64-AVX2-NEXT: vblendvpd %ymm2, %ymm0, %ymm1, %ymm0
+; X64-AVX2-NEXT: vextractf128 $1, %ymm0, %xmm1
+; X64-AVX2-NEXT: vpcmpgtq %xmm1, %xmm0, %xmm2
+; X64-AVX2-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X64-AVX2-NEXT: vshufps {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X64-AVX2-NEXT: vpcmpgtq %xmm1, %xmm0, %xmm2
+; X64-AVX2-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X64-AVX2-NEXT: vmovq %xmm0, %rax
+; X64-AVX2-NEXT: vzeroupper
+; X64-AVX2-NEXT: retq
;
; AVX512BW-LABEL: test_v8i64:
; AVX512BW: # %bb.0:
@@ -386,307 +767,681 @@ define i64 @test_v8i64(<8 x i64> %a0) {
ret i64 %1
}
-define i64 @test_v16i64(<16 x i64> %a0) {
-; SSE2-LABEL: test_v16i64:
-; SSE2: # %bb.0:
-; SSE2-NEXT: movdqa {{.*#+}} xmm8 = [2147483648,2147483648]
-; SSE2-NEXT: movdqa %xmm7, %xmm9
-; SSE2-NEXT: pxor %xmm8, %xmm9
-; SSE2-NEXT: movdqa %xmm3, %xmm10
-; SSE2-NEXT: pxor %xmm8, %xmm10
-; SSE2-NEXT: movdqa %xmm10, %xmm11
-; SSE2-NEXT: pcmpgtd %xmm9, %xmm11
-; SSE2-NEXT: pshufd {{.*#+}} xmm12 = xmm11[0,0,2,2]
-; SSE2-NEXT: pcmpeqd %xmm9, %xmm10
-; SSE2-NEXT: pshufd {{.*#+}} xmm10 = xmm10[1,1,3,3]
-; SSE2-NEXT: pand %xmm12, %xmm10
-; SSE2-NEXT: pshufd {{.*#+}} xmm9 = xmm11[1,1,3,3]
-; SSE2-NEXT: por %xmm10, %xmm9
-; SSE2-NEXT: pand %xmm9, %xmm3
-; SSE2-NEXT: pandn %xmm7, %xmm9
-; SSE2-NEXT: por %xmm3, %xmm9
-; SSE2-NEXT: movdqa %xmm9, %xmm3
-; SSE2-NEXT: pxor %xmm8, %xmm3
-; SSE2-NEXT: movdqa %xmm5, %xmm7
-; SSE2-NEXT: pxor %xmm8, %xmm7
-; SSE2-NEXT: movdqa %xmm1, %xmm10
-; SSE2-NEXT: pxor %xmm8, %xmm10
-; SSE2-NEXT: movdqa %xmm10, %xmm11
-; SSE2-NEXT: pcmpgtd %xmm7, %xmm11
-; SSE2-NEXT: pshufd {{.*#+}} xmm12 = xmm11[0,0,2,2]
-; SSE2-NEXT: pcmpeqd %xmm7, %xmm10
-; SSE2-NEXT: pshufd {{.*#+}} xmm7 = xmm10[1,1,3,3]
-; SSE2-NEXT: pand %xmm12, %xmm7
-; SSE2-NEXT: pshufd {{.*#+}} xmm10 = xmm11[1,1,3,3]
-; SSE2-NEXT: por %xmm7, %xmm10
-; SSE2-NEXT: pand %xmm10, %xmm1
-; SSE2-NEXT: pandn %xmm5, %xmm10
-; SSE2-NEXT: por %xmm1, %xmm10
-; SSE2-NEXT: movdqa %xmm10, %xmm1
-; SSE2-NEXT: pxor %xmm8, %xmm1
-; SSE2-NEXT: movdqa %xmm1, %xmm5
-; SSE2-NEXT: pcmpgtd %xmm3, %xmm5
-; SSE2-NEXT: pshufd {{.*#+}} xmm7 = xmm5[0,0,2,2]
-; SSE2-NEXT: pcmpeqd %xmm3, %xmm1
-; SSE2-NEXT: pshufd {{.*#+}} xmm3 = xmm1[1,1,3,3]
-; SSE2-NEXT: pand %xmm7, %xmm3
-; SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm5[1,1,3,3]
-; SSE2-NEXT: por %xmm3, %xmm1
-; SSE2-NEXT: pand %xmm1, %xmm10
-; SSE2-NEXT: pandn %xmm9, %xmm1
-; SSE2-NEXT: por %xmm10, %xmm1
-; SSE2-NEXT: movdqa %xmm1, %xmm3
-; SSE2-NEXT: pxor %xmm8, %xmm3
-; SSE2-NEXT: movdqa %xmm6, %xmm5
-; SSE2-NEXT: pxor %xmm8, %xmm5
-; SSE2-NEXT: movdqa %xmm2, %xmm7
-; SSE2-NEXT: pxor %xmm8, %xmm7
-; SSE2-NEXT: movdqa %xmm7, %xmm9
-; SSE2-NEXT: pcmpgtd %xmm5, %xmm9
-; SSE2-NEXT: pshufd {{.*#+}} xmm10 = xmm9[0,0,2,2]
-; SSE2-NEXT: pcmpeqd %xmm5, %xmm7
-; SSE2-NEXT: pshufd {{.*#+}} xmm7 = xmm7[1,1,3,3]
-; SSE2-NEXT: pand %xmm10, %xmm7
-; SSE2-NEXT: pshufd {{.*#+}} xmm5 = xmm9[1,1,3,3]
-; SSE2-NEXT: por %xmm7, %xmm5
-; SSE2-NEXT: pand %xmm5, %xmm2
-; SSE2-NEXT: pandn %xmm6, %xmm5
-; SSE2-NEXT: por %xmm2, %xmm5
-; SSE2-NEXT: movdqa %xmm5, %xmm2
-; SSE2-NEXT: pxor %xmm8, %xmm2
-; SSE2-NEXT: movdqa %xmm4, %xmm6
-; SSE2-NEXT: pxor %xmm8, %xmm6
-; SSE2-NEXT: movdqa %xmm0, %xmm7
-; SSE2-NEXT: pxor %xmm8, %xmm7
-; SSE2-NEXT: movdqa %xmm7, %xmm9
-; SSE2-NEXT: pcmpgtd %xmm6, %xmm9
-; SSE2-NEXT: pshufd {{.*#+}} xmm10 = xmm9[0,0,2,2]
-; SSE2-NEXT: pcmpeqd %xmm6, %xmm7
-; SSE2-NEXT: pshufd {{.*#+}} xmm6 = xmm7[1,1,3,3]
-; SSE2-NEXT: pand %xmm10, %xmm6
-; SSE2-NEXT: pshufd {{.*#+}} xmm7 = xmm9[1,1,3,3]
-; SSE2-NEXT: por %xmm6, %xmm7
-; SSE2-NEXT: pand %xmm7, %xmm0
-; SSE2-NEXT: pandn %xmm4, %xmm7
-; SSE2-NEXT: por %xmm0, %xmm7
-; SSE2-NEXT: movdqa %xmm7, %xmm0
-; SSE2-NEXT: pxor %xmm8, %xmm0
-; SSE2-NEXT: movdqa %xmm0, %xmm4
-; SSE2-NEXT: pcmpgtd %xmm2, %xmm4
-; SSE2-NEXT: pshufd {{.*#+}} xmm6 = xmm4[0,0,2,2]
-; SSE2-NEXT: pcmpeqd %xmm2, %xmm0
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm0[1,1,3,3]
-; SSE2-NEXT: pand %xmm6, %xmm0
-; SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm4[1,1,3,3]
-; SSE2-NEXT: por %xmm0, %xmm2
-; SSE2-NEXT: pand %xmm2, %xmm7
-; SSE2-NEXT: pandn %xmm5, %xmm2
-; SSE2-NEXT: por %xmm7, %xmm2
-; SSE2-NEXT: pxor %xmm2, %xmm8
-; SSE2-NEXT: movdqa %xmm8, %xmm0
-; SSE2-NEXT: pcmpgtd %xmm3, %xmm0
-; SSE2-NEXT: pshufd {{.*#+}} xmm4 = xmm0[0,0,2,2]
-; SSE2-NEXT: pcmpeqd %xmm3, %xmm8
-; SSE2-NEXT: pshufd {{.*#+}} xmm3 = xmm8[1,1,3,3]
-; SSE2-NEXT: pand %xmm4, %xmm3
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm0[1,1,3,3]
-; SSE2-NEXT: por %xmm3, %xmm0
-; SSE2-NEXT: pand %xmm0, %xmm2
-; SSE2-NEXT: pandn %xmm1, %xmm0
-; SSE2-NEXT: por %xmm2, %xmm0
-; SSE2-NEXT: movq %xmm0, %rcx
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm0[2,3,2,3]
-; SSE2-NEXT: movq %xmm0, %rax
-; SSE2-NEXT: cmpq %rax, %rcx
-; SSE2-NEXT: cmovgq %rcx, %rax
-; SSE2-NEXT: retq
-;
-; SSE41-LABEL: test_v16i64:
-; SSE41: # %bb.0:
-; SSE41-NEXT: movdqa %xmm0, %xmm8
-; SSE41-NEXT: pmovzxdq {{.*#+}} xmm9 = [2147483648,2147483648]
-; SSE41-NEXT: movdqa %xmm7, %xmm0
-; SSE41-NEXT: pxor %xmm9, %xmm0
-; SSE41-NEXT: movdqa %xmm3, %xmm10
-; SSE41-NEXT: pxor %xmm9, %xmm10
-; SSE41-NEXT: movdqa %xmm10, %xmm11
-; SSE41-NEXT: pcmpgtd %xmm0, %xmm11
-; SSE41-NEXT: pshufd {{.*#+}} xmm12 = xmm11[0,0,2,2]
-; SSE41-NEXT: pcmpeqd %xmm0, %xmm10
-; SSE41-NEXT: pshufd {{.*#+}} xmm10 = xmm10[1,1,3,3]
-; SSE41-NEXT: pand %xmm12, %xmm10
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm11[1,1,3,3]
-; SSE41-NEXT: por %xmm10, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm3, %xmm7
-; SSE41-NEXT: movapd %xmm7, %xmm3
-; SSE41-NEXT: xorpd %xmm9, %xmm3
-; SSE41-NEXT: movdqa %xmm5, %xmm0
-; SSE41-NEXT: pxor %xmm9, %xmm0
-; SSE41-NEXT: movdqa %xmm1, %xmm10
-; SSE41-NEXT: pxor %xmm9, %xmm10
-; SSE41-NEXT: movdqa %xmm10, %xmm11
-; SSE41-NEXT: pcmpgtd %xmm0, %xmm11
-; SSE41-NEXT: pshufd {{.*#+}} xmm12 = xmm11[0,0,2,2]
-; SSE41-NEXT: pcmpeqd %xmm0, %xmm10
-; SSE41-NEXT: pshufd {{.*#+}} xmm10 = xmm10[1,1,3,3]
-; SSE41-NEXT: pand %xmm12, %xmm10
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm11[1,1,3,3]
-; SSE41-NEXT: por %xmm10, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm1, %xmm5
-; SSE41-NEXT: movapd %xmm5, %xmm0
-; SSE41-NEXT: xorpd %xmm9, %xmm0
-; SSE41-NEXT: movapd %xmm0, %xmm1
-; SSE41-NEXT: pcmpgtd %xmm3, %xmm1
-; SSE41-NEXT: pshufd {{.*#+}} xmm10 = xmm1[0,0,2,2]
-; SSE41-NEXT: pcmpeqd %xmm3, %xmm0
-; SSE41-NEXT: pshufd {{.*#+}} xmm3 = xmm0[1,1,3,3]
-; SSE41-NEXT: pand %xmm10, %xmm3
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,3,3]
-; SSE41-NEXT: por %xmm3, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm5, %xmm7
-; SSE41-NEXT: movapd %xmm7, %xmm1
-; SSE41-NEXT: xorpd %xmm9, %xmm1
-; SSE41-NEXT: movdqa %xmm6, %xmm0
-; SSE41-NEXT: pxor %xmm9, %xmm0
-; SSE41-NEXT: movdqa %xmm2, %xmm3
-; SSE41-NEXT: pxor %xmm9, %xmm3
-; SSE41-NEXT: movdqa %xmm3, %xmm5
-; SSE41-NEXT: pcmpgtd %xmm0, %xmm5
-; SSE41-NEXT: pshufd {{.*#+}} xmm10 = xmm5[0,0,2,2]
-; SSE41-NEXT: pcmpeqd %xmm0, %xmm3
-; SSE41-NEXT: pshufd {{.*#+}} xmm3 = xmm3[1,1,3,3]
-; SSE41-NEXT: pand %xmm10, %xmm3
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm5[1,1,3,3]
-; SSE41-NEXT: por %xmm3, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm2, %xmm6
-; SSE41-NEXT: movapd %xmm6, %xmm2
-; SSE41-NEXT: xorpd %xmm9, %xmm2
-; SSE41-NEXT: movdqa %xmm4, %xmm0
-; SSE41-NEXT: pxor %xmm9, %xmm0
-; SSE41-NEXT: movdqa %xmm8, %xmm3
-; SSE41-NEXT: pxor %xmm9, %xmm3
-; SSE41-NEXT: movdqa %xmm3, %xmm5
-; SSE41-NEXT: pcmpgtd %xmm0, %xmm5
-; SSE41-NEXT: pshufd {{.*#+}} xmm10 = xmm5[0,0,2,2]
-; SSE41-NEXT: pcmpeqd %xmm0, %xmm3
-; SSE41-NEXT: pshufd {{.*#+}} xmm3 = xmm3[1,1,3,3]
-; SSE41-NEXT: pand %xmm10, %xmm3
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm5[1,1,3,3]
-; SSE41-NEXT: por %xmm3, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm8, %xmm4
-; SSE41-NEXT: movapd %xmm4, %xmm0
-; SSE41-NEXT: xorpd %xmm9, %xmm0
-; SSE41-NEXT: movapd %xmm0, %xmm3
-; SSE41-NEXT: pcmpgtd %xmm2, %xmm3
-; SSE41-NEXT: pshufd {{.*#+}} xmm5 = xmm3[0,0,2,2]
-; SSE41-NEXT: pcmpeqd %xmm2, %xmm0
-; SSE41-NEXT: pshufd {{.*#+}} xmm2 = xmm0[1,1,3,3]
-; SSE41-NEXT: pand %xmm5, %xmm2
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm3[1,1,3,3]
-; SSE41-NEXT: por %xmm2, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm4, %xmm6
-; SSE41-NEXT: movapd %xmm6, %xmm0
-; SSE41-NEXT: xorpd %xmm9, %xmm0
-; SSE41-NEXT: movapd %xmm0, %xmm2
-; SSE41-NEXT: pcmpgtd %xmm1, %xmm2
-; SSE41-NEXT: pshufd {{.*#+}} xmm3 = xmm2[0,0,2,2]
-; SSE41-NEXT: pcmpeqd %xmm1, %xmm0
-; SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,3,3]
-; SSE41-NEXT: pand %xmm3, %xmm1
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,3,3]
-; SSE41-NEXT: por %xmm1, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm6, %xmm7
-; SSE41-NEXT: movapd %xmm7, %xmm0
-; SSE41-NEXT: xorpd %xmm9, %xmm0
-; SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm7[2,3,2,3]
-; SSE41-NEXT: pxor %xmm1, %xmm9
-; SSE41-NEXT: movapd %xmm0, %xmm2
-; SSE41-NEXT: pcmpgtd %xmm9, %xmm2
-; SSE41-NEXT: pmovsxdq %xmm2, %xmm3
-; SSE41-NEXT: pcmpeqd %xmm0, %xmm9
-; SSE41-NEXT: pshufd {{.*#+}} xmm4 = xmm9[1,1,3,3]
-; SSE41-NEXT: pand %xmm3, %xmm4
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,3,3]
-; SSE41-NEXT: por %xmm4, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm7, %xmm1
-; SSE41-NEXT: movq %xmm1, %rax
-; SSE41-NEXT: retq
-;
-; SSE42-LABEL: test_v16i64:
-; SSE42: # %bb.0:
-; SSE42-NEXT: movdqa %xmm0, %xmm8
-; SSE42-NEXT: movdqa %xmm3, %xmm0
-; SSE42-NEXT: pcmpgtq %xmm7, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm3, %xmm7
-; SSE42-NEXT: movdqa %xmm1, %xmm0
-; SSE42-NEXT: pcmpgtq %xmm5, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm1, %xmm5
-; SSE42-NEXT: movapd %xmm5, %xmm0
-; SSE42-NEXT: pcmpgtq %xmm7, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm5, %xmm7
-; SSE42-NEXT: movdqa %xmm2, %xmm0
-; SSE42-NEXT: pcmpgtq %xmm6, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm2, %xmm6
-; SSE42-NEXT: movdqa %xmm8, %xmm0
-; SSE42-NEXT: pcmpgtq %xmm4, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm8, %xmm4
-; SSE42-NEXT: movapd %xmm4, %xmm0
-; SSE42-NEXT: pcmpgtq %xmm6, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm4, %xmm6
-; SSE42-NEXT: movapd %xmm6, %xmm0
-; SSE42-NEXT: pcmpgtq %xmm7, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm6, %xmm7
-; SSE42-NEXT: pshufd {{.*#+}} xmm1 = xmm7[2,3,2,3]
-; SSE42-NEXT: movdqa %xmm7, %xmm0
-; SSE42-NEXT: pcmpgtq %xmm1, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm7, %xmm1
-; SSE42-NEXT: movq %xmm1, %rax
-; SSE42-NEXT: retq
-;
-; AVX1-LABEL: test_v16i64:
-; AVX1: # %bb.0:
-; AVX1-NEXT: vextractf128 $1, %ymm3, %xmm4
-; AVX1-NEXT: vextractf128 $1, %ymm1, %xmm5
-; AVX1-NEXT: vpcmpgtq %xmm4, %xmm5, %xmm6
-; AVX1-NEXT: vblendvpd %xmm6, %xmm5, %xmm4, %xmm4
-; AVX1-NEXT: vextractf128 $1, %ymm2, %xmm5
-; AVX1-NEXT: vextractf128 $1, %ymm0, %xmm6
-; AVX1-NEXT: vpcmpgtq %xmm5, %xmm6, %xmm7
-; AVX1-NEXT: vblendvpd %xmm7, %xmm6, %xmm5, %xmm5
-; AVX1-NEXT: vpcmpgtq %xmm4, %xmm5, %xmm6
-; AVX1-NEXT: vblendvpd %xmm6, %xmm5, %xmm4, %xmm4
-; AVX1-NEXT: vpcmpgtq %xmm3, %xmm1, %xmm5
-; AVX1-NEXT: vblendvpd %xmm5, %xmm1, %xmm3, %xmm1
-; AVX1-NEXT: vpcmpgtq %xmm2, %xmm0, %xmm3
-; AVX1-NEXT: vblendvpd %xmm3, %xmm0, %xmm2, %xmm0
-; AVX1-NEXT: vpcmpgtq %xmm1, %xmm0, %xmm2
-; AVX1-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
-; AVX1-NEXT: vpcmpgtq %xmm4, %xmm0, %xmm1
-; AVX1-NEXT: vblendvpd %xmm1, %xmm0, %xmm4, %xmm0
-; AVX1-NEXT: vshufps {{.*#+}} xmm1 = xmm0[2,3,2,3]
-; AVX1-NEXT: vpcmpgtq %xmm1, %xmm0, %xmm2
-; AVX1-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
-; AVX1-NEXT: vmovq %xmm0, %rax
-; AVX1-NEXT: vzeroupper
-; AVX1-NEXT: retq
-;
-; AVX2-LABEL: test_v16i64:
-; AVX2: # %bb.0:
-; AVX2-NEXT: vpcmpgtq %ymm3, %ymm1, %ymm4
-; AVX2-NEXT: vblendvpd %ymm4, %ymm1, %ymm3, %ymm1
-; AVX2-NEXT: vpcmpgtq %ymm2, %ymm0, %ymm3
-; AVX2-NEXT: vblendvpd %ymm3, %ymm0, %ymm2, %ymm0
-; AVX2-NEXT: vpcmpgtq %ymm1, %ymm0, %ymm2
-; AVX2-NEXT: vblendvpd %ymm2, %ymm0, %ymm1, %ymm0
-; AVX2-NEXT: vextractf128 $1, %ymm0, %xmm1
-; AVX2-NEXT: vpcmpgtq %xmm1, %xmm0, %xmm2
-; AVX2-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
-; AVX2-NEXT: vshufps {{.*#+}} xmm1 = xmm0[2,3,2,3]
-; AVX2-NEXT: vpcmpgtq %xmm1, %xmm0, %xmm2
-; AVX2-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
-; AVX2-NEXT: vmovq %xmm0, %rax
-; AVX2-NEXT: vzeroupper
-; AVX2-NEXT: retq
+define i64 @test_v16i64(<16 x i64> %a0) nounwind {
+; X86-SSE2-LABEL: test_v16i64:
+; X86-SSE2: # %bb.0:
+; X86-SSE2-NEXT: pushl %ebp
+; X86-SSE2-NEXT: movl %esp, %ebp
+; X86-SSE2-NEXT: andl $-16, %esp
+; X86-SSE2-NEXT: subl $32, %esp
+; X86-SSE2-NEXT: movaps %xmm2, (%esp) # 16-byte Spill
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE2-NEXT: movdqa 40(%ebp), %xmm6
+; X86-SSE2-NEXT: movdqa {{.*#+}} xmm3 = [2147483648,0,2147483648,0]
+; X86-SSE2-NEXT: movdqa %xmm6, %xmm4
+; X86-SSE2-NEXT: pxor %xmm3, %xmm4
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm5
+; X86-SSE2-NEXT: pxor %xmm3, %xmm5
+; X86-SSE2-NEXT: movdqa %xmm5, %xmm7
+; X86-SSE2-NEXT: pcmpgtd %xmm4, %xmm7
+; X86-SSE2-NEXT: pcmpeqd %xmm4, %xmm5
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm4 = xmm7[0,0,2,2]
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm5[1,1,3,3]
+; X86-SSE2-NEXT: pand %xmm4, %xmm0
+; X86-SSE2-NEXT: movdqa 8(%ebp), %xmm5
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm4 = xmm7[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm0, %xmm4
+; X86-SSE2-NEXT: movdqa 72(%ebp), %xmm7
+; X86-SSE2-NEXT: pand %xmm4, %xmm1
+; X86-SSE2-NEXT: pandn %xmm6, %xmm4
+; X86-SSE2-NEXT: por %xmm1, %xmm4
+; X86-SSE2-NEXT: movdqa %xmm7, %xmm0
+; X86-SSE2-NEXT: pxor %xmm3, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm5, %xmm1
+; X86-SSE2-NEXT: pxor %xmm3, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm6
+; X86-SSE2-NEXT: pcmpgtd %xmm0, %xmm6
+; X86-SSE2-NEXT: pcmpeqd %xmm0, %xmm1
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,3,3]
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm6[0,0,2,2]
+; X86-SSE2-NEXT: pand %xmm1, %xmm0
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm6[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm0, %xmm1
+; X86-SSE2-NEXT: movdqa 24(%ebp), %xmm6
+; X86-SSE2-NEXT: pand %xmm1, %xmm5
+; X86-SSE2-NEXT: pandn %xmm7, %xmm1
+; X86-SSE2-NEXT: por %xmm5, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm6, %xmm0
+; X86-SSE2-NEXT: pxor %xmm3, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm5
+; X86-SSE2-NEXT: pxor %xmm3, %xmm5
+; X86-SSE2-NEXT: movdqa %xmm5, %xmm7
+; X86-SSE2-NEXT: pcmpgtd %xmm0, %xmm7
+; X86-SSE2-NEXT: pcmpeqd %xmm0, %xmm5
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm5[1,1,3,3]
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm5 = xmm7[0,0,2,2]
+; X86-SSE2-NEXT: pand %xmm5, %xmm0
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm5 = xmm7[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm0, %xmm5
+; X86-SSE2-NEXT: movdqa 56(%ebp), %xmm0
+; X86-SSE2-NEXT: pand %xmm5, %xmm2
+; X86-SSE2-NEXT: pandn %xmm6, %xmm5
+; X86-SSE2-NEXT: por %xmm2, %xmm5
+; X86-SSE2-NEXT: pxor %xmm3, %xmm0
+; X86-SSE2-NEXT: movdqa (%esp), %xmm7 # 16-byte Reload
+; X86-SSE2-NEXT: movdqa %xmm7, %xmm2
+; X86-SSE2-NEXT: pxor %xmm3, %xmm2
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm6
+; X86-SSE2-NEXT: pcmpgtd %xmm0, %xmm6
+; X86-SSE2-NEXT: pcmpeqd %xmm0, %xmm2
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,3,3]
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm6[0,0,2,2]
+; X86-SSE2-NEXT: pand %xmm2, %xmm0
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm6 = xmm6[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm0, %xmm6
+; X86-SSE2-NEXT: pand %xmm6, %xmm7
+; X86-SSE2-NEXT: movdqa 56(%ebp), %xmm2
+; X86-SSE2-NEXT: pandn %xmm2, %xmm6
+; X86-SSE2-NEXT: por %xmm7, %xmm6
+; X86-SSE2-NEXT: movdqa %xmm6, %xmm0
+; X86-SSE2-NEXT: pxor %xmm3, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm5, %xmm2
+; X86-SSE2-NEXT: pxor %xmm3, %xmm2
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm7
+; X86-SSE2-NEXT: pcmpgtd %xmm0, %xmm7
+; X86-SSE2-NEXT: pcmpeqd %xmm0, %xmm2
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm7[0,0,2,2]
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm2[1,1,3,3]
+; X86-SSE2-NEXT: pand %xmm0, %xmm2
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm7[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm2, %xmm0
+; X86-SSE2-NEXT: pand %xmm0, %xmm5
+; X86-SSE2-NEXT: pandn %xmm6, %xmm0
+; X86-SSE2-NEXT: por %xmm5, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm2
+; X86-SSE2-NEXT: pxor %xmm3, %xmm2
+; X86-SSE2-NEXT: movdqa %xmm4, %xmm5
+; X86-SSE2-NEXT: pxor %xmm3, %xmm5
+; X86-SSE2-NEXT: movdqa %xmm5, %xmm6
+; X86-SSE2-NEXT: pcmpgtd %xmm2, %xmm6
+; X86-SSE2-NEXT: pcmpeqd %xmm2, %xmm5
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm6[0,0,2,2]
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm5 = xmm5[1,1,3,3]
+; X86-SSE2-NEXT: pand %xmm2, %xmm5
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm6[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm5, %xmm2
+; X86-SSE2-NEXT: pand %xmm2, %xmm4
+; X86-SSE2-NEXT: pandn %xmm1, %xmm2
+; X86-SSE2-NEXT: por %xmm4, %xmm2
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm1
+; X86-SSE2-NEXT: pxor %xmm3, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm4
+; X86-SSE2-NEXT: pxor %xmm3, %xmm4
+; X86-SSE2-NEXT: movdqa %xmm4, %xmm5
+; X86-SSE2-NEXT: pcmpgtd %xmm1, %xmm5
+; X86-SSE2-NEXT: pcmpeqd %xmm1, %xmm4
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm5[0,0,2,2]
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm4 = xmm4[1,1,3,3]
+; X86-SSE2-NEXT: pand %xmm1, %xmm4
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm5[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm4, %xmm1
+; X86-SSE2-NEXT: pand %xmm1, %xmm0
+; X86-SSE2-NEXT: pandn %xmm2, %xmm1
+; X86-SSE2-NEXT: por %xmm0, %xmm1
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm2
+; X86-SSE2-NEXT: pxor %xmm3, %xmm2
+; X86-SSE2-NEXT: pxor %xmm0, %xmm3
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm4
+; X86-SSE2-NEXT: pcmpgtd %xmm3, %xmm4
+; X86-SSE2-NEXT: pcmpeqd %xmm2, %xmm3
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm4[0,0,2,2]
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm3 = xmm3[1,1,3,3]
+; X86-SSE2-NEXT: pand %xmm2, %xmm3
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm4[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm3, %xmm2
+; X86-SSE2-NEXT: pand %xmm2, %xmm1
+; X86-SSE2-NEXT: pandn %xmm0, %xmm2
+; X86-SSE2-NEXT: por %xmm1, %xmm2
+; X86-SSE2-NEXT: movd %xmm2, %eax
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,1,1]
+; X86-SSE2-NEXT: movd %xmm0, %edx
+; X86-SSE2-NEXT: movl %ebp, %esp
+; X86-SSE2-NEXT: popl %ebp
+; X86-SSE2-NEXT: retl
+;
+; X64-SSE2-LABEL: test_v16i64:
+; X64-SSE2: # %bb.0:
+; X64-SSE2-NEXT: movdqa {{.*#+}} xmm8 = [2147483648,2147483648]
+; X64-SSE2-NEXT: movdqa %xmm7, %xmm9
+; X64-SSE2-NEXT: pxor %xmm8, %xmm9
+; X64-SSE2-NEXT: movdqa %xmm3, %xmm10
+; X64-SSE2-NEXT: pxor %xmm8, %xmm10
+; X64-SSE2-NEXT: movdqa %xmm10, %xmm11
+; X64-SSE2-NEXT: pcmpgtd %xmm9, %xmm11
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm12 = xmm11[0,0,2,2]
+; X64-SSE2-NEXT: pcmpeqd %xmm9, %xmm10
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm10 = xmm10[1,1,3,3]
+; X64-SSE2-NEXT: pand %xmm12, %xmm10
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm9 = xmm11[1,1,3,3]
+; X64-SSE2-NEXT: por %xmm10, %xmm9
+; X64-SSE2-NEXT: pand %xmm9, %xmm3
+; X64-SSE2-NEXT: pandn %xmm7, %xmm9
+; X64-SSE2-NEXT: por %xmm3, %xmm9
+; X64-SSE2-NEXT: movdqa %xmm9, %xmm3
+; X64-SSE2-NEXT: pxor %xmm8, %xmm3
+; X64-SSE2-NEXT: movdqa %xmm5, %xmm7
+; X64-SSE2-NEXT: pxor %xmm8, %xmm7
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm10
+; X64-SSE2-NEXT: pxor %xmm8, %xmm10
+; X64-SSE2-NEXT: movdqa %xmm10, %xmm11
+; X64-SSE2-NEXT: pcmpgtd %xmm7, %xmm11
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm12 = xmm11[0,0,2,2]
+; X64-SSE2-NEXT: pcmpeqd %xmm7, %xmm10
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm7 = xmm10[1,1,3,3]
+; X64-SSE2-NEXT: pand %xmm12, %xmm7
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm10 = xmm11[1,1,3,3]
+; X64-SSE2-NEXT: por %xmm7, %xmm10
+; X64-SSE2-NEXT: pand %xmm10, %xmm1
+; X64-SSE2-NEXT: pandn %xmm5, %xmm10
+; X64-SSE2-NEXT: por %xmm1, %xmm10
+; X64-SSE2-NEXT: movdqa %xmm10, %xmm1
+; X64-SSE2-NEXT: pxor %xmm8, %xmm1
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm5
+; X64-SSE2-NEXT: pcmpgtd %xmm3, %xmm5
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm7 = xmm5[0,0,2,2]
+; X64-SSE2-NEXT: pcmpeqd %xmm3, %xmm1
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm3 = xmm1[1,1,3,3]
+; X64-SSE2-NEXT: pand %xmm7, %xmm3
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm5[1,1,3,3]
+; X64-SSE2-NEXT: por %xmm3, %xmm1
+; X64-SSE2-NEXT: pand %xmm1, %xmm10
+; X64-SSE2-NEXT: pandn %xmm9, %xmm1
+; X64-SSE2-NEXT: por %xmm10, %xmm1
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm3
+; X64-SSE2-NEXT: pxor %xmm8, %xmm3
+; X64-SSE2-NEXT: movdqa %xmm6, %xmm5
+; X64-SSE2-NEXT: pxor %xmm8, %xmm5
+; X64-SSE2-NEXT: movdqa %xmm2, %xmm7
+; X64-SSE2-NEXT: pxor %xmm8, %xmm7
+; X64-SSE2-NEXT: movdqa %xmm7, %xmm9
+; X64-SSE2-NEXT: pcmpgtd %xmm5, %xmm9
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm10 = xmm9[0,0,2,2]
+; X64-SSE2-NEXT: pcmpeqd %xmm5, %xmm7
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm7 = xmm7[1,1,3,3]
+; X64-SSE2-NEXT: pand %xmm10, %xmm7
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm5 = xmm9[1,1,3,3]
+; X64-SSE2-NEXT: por %xmm7, %xmm5
+; X64-SSE2-NEXT: pand %xmm5, %xmm2
+; X64-SSE2-NEXT: pandn %xmm6, %xmm5
+; X64-SSE2-NEXT: por %xmm2, %xmm5
+; X64-SSE2-NEXT: movdqa %xmm5, %xmm2
+; X64-SSE2-NEXT: pxor %xmm8, %xmm2
+; X64-SSE2-NEXT: movdqa %xmm4, %xmm6
+; X64-SSE2-NEXT: pxor %xmm8, %xmm6
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm7
+; X64-SSE2-NEXT: pxor %xmm8, %xmm7
+; X64-SSE2-NEXT: movdqa %xmm7, %xmm9
+; X64-SSE2-NEXT: pcmpgtd %xmm6, %xmm9
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm10 = xmm9[0,0,2,2]
+; X64-SSE2-NEXT: pcmpeqd %xmm6, %xmm7
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm6 = xmm7[1,1,3,3]
+; X64-SSE2-NEXT: pand %xmm10, %xmm6
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm7 = xmm9[1,1,3,3]
+; X64-SSE2-NEXT: por %xmm6, %xmm7
+; X64-SSE2-NEXT: pand %xmm7, %xmm0
+; X64-SSE2-NEXT: pandn %xmm4, %xmm7
+; X64-SSE2-NEXT: por %xmm0, %xmm7
+; X64-SSE2-NEXT: movdqa %xmm7, %xmm0
+; X64-SSE2-NEXT: pxor %xmm8, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm4
+; X64-SSE2-NEXT: pcmpgtd %xmm2, %xmm4
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm6 = xmm4[0,0,2,2]
+; X64-SSE2-NEXT: pcmpeqd %xmm2, %xmm0
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm0[1,1,3,3]
+; X64-SSE2-NEXT: pand %xmm6, %xmm0
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm4[1,1,3,3]
+; X64-SSE2-NEXT: por %xmm0, %xmm2
+; X64-SSE2-NEXT: pand %xmm2, %xmm7
+; X64-SSE2-NEXT: pandn %xmm5, %xmm2
+; X64-SSE2-NEXT: por %xmm7, %xmm2
+; X64-SSE2-NEXT: pxor %xmm2, %xmm8
+; X64-SSE2-NEXT: movdqa %xmm8, %xmm0
+; X64-SSE2-NEXT: pcmpgtd %xmm3, %xmm0
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm4 = xmm0[0,0,2,2]
+; X64-SSE2-NEXT: pcmpeqd %xmm3, %xmm8
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm3 = xmm8[1,1,3,3]
+; X64-SSE2-NEXT: pand %xmm4, %xmm3
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm0[1,1,3,3]
+; X64-SSE2-NEXT: por %xmm3, %xmm0
+; X64-SSE2-NEXT: pand %xmm0, %xmm2
+; X64-SSE2-NEXT: pandn %xmm1, %xmm0
+; X64-SSE2-NEXT: por %xmm2, %xmm0
+; X64-SSE2-NEXT: movq %xmm0, %rcx
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm0[2,3,2,3]
+; X64-SSE2-NEXT: movq %xmm0, %rax
+; X64-SSE2-NEXT: cmpq %rax, %rcx
+; X64-SSE2-NEXT: cmovgq %rcx, %rax
+; X64-SSE2-NEXT: retq
+;
+; X86-SSE41-LABEL: test_v16i64:
+; X86-SSE41: # %bb.0:
+; X86-SSE41-NEXT: pushl %ebp
+; X86-SSE41-NEXT: movl %esp, %ebp
+; X86-SSE41-NEXT: andl $-16, %esp
+; X86-SSE41-NEXT: subl $48, %esp
+; X86-SSE41-NEXT: movaps %xmm2, (%esp) # 16-byte Spill
+; X86-SSE41-NEXT: movdqa %xmm0, %xmm3
+; X86-SSE41-NEXT: movdqa 40(%ebp), %xmm2
+; X86-SSE41-NEXT: pmovzxdq {{.*#+}} xmm4 = [2147483648,2147483648]
+; X86-SSE41-NEXT: movdqa %xmm2, %xmm0
+; X86-SSE41-NEXT: movdqa %xmm2, %xmm6
+; X86-SSE41-NEXT: pxor %xmm4, %xmm0
+; X86-SSE41-NEXT: movdqa %xmm1, %xmm2
+; X86-SSE41-NEXT: pxor %xmm4, %xmm2
+; X86-SSE41-NEXT: movdqa %xmm2, %xmm5
+; X86-SSE41-NEXT: pcmpgtd %xmm0, %xmm5
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm2
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm5[0,0,2,2]
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm7 = xmm2[1,1,3,3]
+; X86-SSE41-NEXT: pand %xmm0, %xmm7
+; X86-SSE41-NEXT: movdqa 8(%ebp), %xmm2
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm5[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm7, %xmm0
+; X86-SSE41-NEXT: movdqa 72(%ebp), %xmm5
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm1, %xmm6
+; X86-SSE41-NEXT: movapd %xmm6, {{[-0-9]+}}(%e{{[sb]}}p) # 16-byte Spill
+; X86-SSE41-NEXT: movdqa %xmm5, %xmm0
+; X86-SSE41-NEXT: pxor %xmm4, %xmm0
+; X86-SSE41-NEXT: movdqa %xmm2, %xmm1
+; X86-SSE41-NEXT: pxor %xmm4, %xmm1
+; X86-SSE41-NEXT: movdqa %xmm1, %xmm7
+; X86-SSE41-NEXT: pcmpgtd %xmm0, %xmm7
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm1
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm1[1,1,3,3]
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm7[0,0,2,2]
+; X86-SSE41-NEXT: pand %xmm0, %xmm1
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm7[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm1, %xmm0
+; X86-SSE41-NEXT: movdqa 24(%ebp), %xmm7
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm2, %xmm5
+; X86-SSE41-NEXT: movdqa %xmm7, %xmm0
+; X86-SSE41-NEXT: pxor %xmm4, %xmm0
+; X86-SSE41-NEXT: movdqa %xmm3, %xmm1
+; X86-SSE41-NEXT: pxor %xmm4, %xmm1
+; X86-SSE41-NEXT: movdqa %xmm1, %xmm2
+; X86-SSE41-NEXT: pcmpgtd %xmm0, %xmm2
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm1
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm1[1,1,3,3]
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm2[0,0,2,2]
+; X86-SSE41-NEXT: pand %xmm0, %xmm1
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm1, %xmm0
+; X86-SSE41-NEXT: movdqa 56(%ebp), %xmm1
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm3, %xmm7
+; X86-SSE41-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE41-NEXT: pxor %xmm4, %xmm0
+; X86-SSE41-NEXT: movdqa (%esp), %xmm6 # 16-byte Reload
+; X86-SSE41-NEXT: movdqa %xmm6, %xmm2
+; X86-SSE41-NEXT: pxor %xmm4, %xmm2
+; X86-SSE41-NEXT: movdqa %xmm2, %xmm3
+; X86-SSE41-NEXT: pcmpgtd %xmm0, %xmm3
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm2
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm2 = xmm2[1,1,3,3]
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm3[0,0,2,2]
+; X86-SSE41-NEXT: pand %xmm0, %xmm2
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm3[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm2, %xmm0
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm6, %xmm1
+; X86-SSE41-NEXT: movapd %xmm1, %xmm0
+; X86-SSE41-NEXT: xorpd %xmm4, %xmm0
+; X86-SSE41-NEXT: movapd %xmm7, %xmm2
+; X86-SSE41-NEXT: xorpd %xmm4, %xmm2
+; X86-SSE41-NEXT: movapd %xmm2, %xmm3
+; X86-SSE41-NEXT: pcmpgtd %xmm0, %xmm3
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm2
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm3[0,0,2,2]
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm2 = xmm2[1,1,3,3]
+; X86-SSE41-NEXT: pand %xmm0, %xmm2
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm3[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm2, %xmm0
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm7, %xmm1
+; X86-SSE41-NEXT: movapd %xmm5, %xmm0
+; X86-SSE41-NEXT: xorpd %xmm4, %xmm0
+; X86-SSE41-NEXT: movdqa {{[-0-9]+}}(%e{{[sb]}}p), %xmm6 # 16-byte Reload
+; X86-SSE41-NEXT: movdqa %xmm6, %xmm2
+; X86-SSE41-NEXT: pxor %xmm4, %xmm2
+; X86-SSE41-NEXT: movdqa %xmm2, %xmm3
+; X86-SSE41-NEXT: pcmpgtd %xmm0, %xmm3
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm2
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm3[0,0,2,2]
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm2 = xmm2[1,1,3,3]
+; X86-SSE41-NEXT: pand %xmm0, %xmm2
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm3[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm2, %xmm0
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm6, %xmm5
+; X86-SSE41-NEXT: movapd %xmm5, %xmm0
+; X86-SSE41-NEXT: xorpd %xmm4, %xmm0
+; X86-SSE41-NEXT: movapd %xmm1, %xmm2
+; X86-SSE41-NEXT: xorpd %xmm4, %xmm2
+; X86-SSE41-NEXT: movapd %xmm2, %xmm3
+; X86-SSE41-NEXT: pcmpgtd %xmm0, %xmm3
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm2
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm3[0,0,2,2]
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm2 = xmm2[1,1,3,3]
+; X86-SSE41-NEXT: pand %xmm0, %xmm2
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm3[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm2, %xmm0
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm1, %xmm5
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm5[2,3,2,3]
+; X86-SSE41-NEXT: movdqa %xmm5, %xmm0
+; X86-SSE41-NEXT: pxor %xmm4, %xmm0
+; X86-SSE41-NEXT: pxor %xmm1, %xmm4
+; X86-SSE41-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE41-NEXT: pcmpgtd %xmm4, %xmm2
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm4
+; X86-SSE41-NEXT: pmovsxdq %xmm2, %xmm0
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm3 = xmm4[1,1,3,3]
+; X86-SSE41-NEXT: pand %xmm0, %xmm3
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm3, %xmm0
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm5, %xmm1
+; X86-SSE41-NEXT: movd %xmm1, %eax
+; X86-SSE41-NEXT: pextrd $1, %xmm1, %edx
+; X86-SSE41-NEXT: movl %ebp, %esp
+; X86-SSE41-NEXT: popl %ebp
+; X86-SSE41-NEXT: retl
+;
+; X64-SSE41-LABEL: test_v16i64:
+; X64-SSE41: # %bb.0:
+; X64-SSE41-NEXT: movdqa %xmm0, %xmm8
+; X64-SSE41-NEXT: pmovzxdq {{.*#+}} xmm9 = [2147483648,2147483648]
+; X64-SSE41-NEXT: movdqa %xmm7, %xmm0
+; X64-SSE41-NEXT: pxor %xmm9, %xmm0
+; X64-SSE41-NEXT: movdqa %xmm3, %xmm10
+; X64-SSE41-NEXT: pxor %xmm9, %xmm10
+; X64-SSE41-NEXT: movdqa %xmm10, %xmm11
+; X64-SSE41-NEXT: pcmpgtd %xmm0, %xmm11
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm12 = xmm11[0,0,2,2]
+; X64-SSE41-NEXT: pcmpeqd %xmm0, %xmm10
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm10 = xmm10[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm12, %xmm10
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm11[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm10, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm3, %xmm7
+; X64-SSE41-NEXT: movapd %xmm7, %xmm3
+; X64-SSE41-NEXT: xorpd %xmm9, %xmm3
+; X64-SSE41-NEXT: movdqa %xmm5, %xmm0
+; X64-SSE41-NEXT: pxor %xmm9, %xmm0
+; X64-SSE41-NEXT: movdqa %xmm1, %xmm10
+; X64-SSE41-NEXT: pxor %xmm9, %xmm10
+; X64-SSE41-NEXT: movdqa %xmm10, %xmm11
+; X64-SSE41-NEXT: pcmpgtd %xmm0, %xmm11
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm12 = xmm11[0,0,2,2]
+; X64-SSE41-NEXT: pcmpeqd %xmm0, %xmm10
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm10 = xmm10[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm12, %xmm10
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm11[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm10, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm1, %xmm5
+; X64-SSE41-NEXT: movapd %xmm5, %xmm0
+; X64-SSE41-NEXT: xorpd %xmm9, %xmm0
+; X64-SSE41-NEXT: movapd %xmm0, %xmm1
+; X64-SSE41-NEXT: pcmpgtd %xmm3, %xmm1
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm10 = xmm1[0,0,2,2]
+; X64-SSE41-NEXT: pcmpeqd %xmm3, %xmm0
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm3 = xmm0[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm10, %xmm3
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm3, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm5, %xmm7
+; X64-SSE41-NEXT: movapd %xmm7, %xmm1
+; X64-SSE41-NEXT: xorpd %xmm9, %xmm1
+; X64-SSE41-NEXT: movdqa %xmm6, %xmm0
+; X64-SSE41-NEXT: pxor %xmm9, %xmm0
+; X64-SSE41-NEXT: movdqa %xmm2, %xmm3
+; X64-SSE41-NEXT: pxor %xmm9, %xmm3
+; X64-SSE41-NEXT: movdqa %xmm3, %xmm5
+; X64-SSE41-NEXT: pcmpgtd %xmm0, %xmm5
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm10 = xmm5[0,0,2,2]
+; X64-SSE41-NEXT: pcmpeqd %xmm0, %xmm3
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm3 = xmm3[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm10, %xmm3
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm5[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm3, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm2, %xmm6
+; X64-SSE41-NEXT: movapd %xmm6, %xmm2
+; X64-SSE41-NEXT: xorpd %xmm9, %xmm2
+; X64-SSE41-NEXT: movdqa %xmm4, %xmm0
+; X64-SSE41-NEXT: pxor %xmm9, %xmm0
+; X64-SSE41-NEXT: movdqa %xmm8, %xmm3
+; X64-SSE41-NEXT: pxor %xmm9, %xmm3
+; X64-SSE41-NEXT: movdqa %xmm3, %xmm5
+; X64-SSE41-NEXT: pcmpgtd %xmm0, %xmm5
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm10 = xmm5[0,0,2,2]
+; X64-SSE41-NEXT: pcmpeqd %xmm0, %xmm3
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm3 = xmm3[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm10, %xmm3
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm5[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm3, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm8, %xmm4
+; X64-SSE41-NEXT: movapd %xmm4, %xmm0
+; X64-SSE41-NEXT: xorpd %xmm9, %xmm0
+; X64-SSE41-NEXT: movapd %xmm0, %xmm3
+; X64-SSE41-NEXT: pcmpgtd %xmm2, %xmm3
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm5 = xmm3[0,0,2,2]
+; X64-SSE41-NEXT: pcmpeqd %xmm2, %xmm0
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm2 = xmm0[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm5, %xmm2
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm3[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm2, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm4, %xmm6
+; X64-SSE41-NEXT: movapd %xmm6, %xmm0
+; X64-SSE41-NEXT: xorpd %xmm9, %xmm0
+; X64-SSE41-NEXT: movapd %xmm0, %xmm2
+; X64-SSE41-NEXT: pcmpgtd %xmm1, %xmm2
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm3 = xmm2[0,0,2,2]
+; X64-SSE41-NEXT: pcmpeqd %xmm1, %xmm0
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm3, %xmm1
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm1, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm6, %xmm7
+; X64-SSE41-NEXT: movapd %xmm7, %xmm0
+; X64-SSE41-NEXT: xorpd %xmm9, %xmm0
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm7[2,3,2,3]
+; X64-SSE41-NEXT: pxor %xmm1, %xmm9
+; X64-SSE41-NEXT: movapd %xmm0, %xmm2
+; X64-SSE41-NEXT: pcmpgtd %xmm9, %xmm2
+; X64-SSE41-NEXT: pmovsxdq %xmm2, %xmm3
+; X64-SSE41-NEXT: pcmpeqd %xmm0, %xmm9
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm4 = xmm9[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm3, %xmm4
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm4, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm7, %xmm1
+; X64-SSE41-NEXT: movq %xmm1, %rax
+; X64-SSE41-NEXT: retq
+;
+; X86-SSE42-LABEL: test_v16i64:
+; X86-SSE42: # %bb.0:
+; X86-SSE42-NEXT: pushl %ebp
+; X86-SSE42-NEXT: movl %esp, %ebp
+; X86-SSE42-NEXT: andl $-16, %esp
+; X86-SSE42-NEXT: subl $16, %esp
+; X86-SSE42-NEXT: movdqa %xmm0, %xmm3
+; X86-SSE42-NEXT: movdqa 72(%ebp), %xmm4
+; X86-SSE42-NEXT: movdqa 56(%ebp), %xmm5
+; X86-SSE42-NEXT: movdqa %xmm2, %xmm0
+; X86-SSE42-NEXT: pcmpgtq %xmm5, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm2, %xmm5
+; X86-SSE42-NEXT: movdqa 24(%ebp), %xmm2
+; X86-SSE42-NEXT: movdqa %xmm3, %xmm0
+; X86-SSE42-NEXT: pcmpgtq %xmm2, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm3, %xmm2
+; X86-SSE42-NEXT: movdqa 8(%ebp), %xmm3
+; X86-SSE42-NEXT: movdqa %xmm3, %xmm0
+; X86-SSE42-NEXT: pcmpgtq %xmm4, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm3, %xmm4
+; X86-SSE42-NEXT: movdqa 40(%ebp), %xmm3
+; X86-SSE42-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE42-NEXT: pcmpgtq %xmm3, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm1, %xmm3
+; X86-SSE42-NEXT: movapd %xmm3, %xmm0
+; X86-SSE42-NEXT: pcmpgtq %xmm4, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm3, %xmm4
+; X86-SSE42-NEXT: movapd %xmm2, %xmm0
+; X86-SSE42-NEXT: pcmpgtq %xmm5, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm2, %xmm5
+; X86-SSE42-NEXT: movapd %xmm5, %xmm0
+; X86-SSE42-NEXT: pcmpgtq %xmm4, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm5, %xmm4
+; X86-SSE42-NEXT: pshufd {{.*#+}} xmm1 = xmm4[2,3,2,3]
+; X86-SSE42-NEXT: movdqa %xmm4, %xmm0
+; X86-SSE42-NEXT: pcmpgtq %xmm1, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm4, %xmm1
+; X86-SSE42-NEXT: movd %xmm1, %eax
+; X86-SSE42-NEXT: pextrd $1, %xmm1, %edx
+; X86-SSE42-NEXT: movl %ebp, %esp
+; X86-SSE42-NEXT: popl %ebp
+; X86-SSE42-NEXT: retl
+;
+; X64-SSE42-LABEL: test_v16i64:
+; X64-SSE42: # %bb.0:
+; X64-SSE42-NEXT: movdqa %xmm0, %xmm8
+; X64-SSE42-NEXT: movdqa %xmm3, %xmm0
+; X64-SSE42-NEXT: pcmpgtq %xmm7, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm3, %xmm7
+; X64-SSE42-NEXT: movdqa %xmm1, %xmm0
+; X64-SSE42-NEXT: pcmpgtq %xmm5, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm1, %xmm5
+; X64-SSE42-NEXT: movapd %xmm5, %xmm0
+; X64-SSE42-NEXT: pcmpgtq %xmm7, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm5, %xmm7
+; X64-SSE42-NEXT: movdqa %xmm2, %xmm0
+; X64-SSE42-NEXT: pcmpgtq %xmm6, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm2, %xmm6
+; X64-SSE42-NEXT: movdqa %xmm8, %xmm0
+; X64-SSE42-NEXT: pcmpgtq %xmm4, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm8, %xmm4
+; X64-SSE42-NEXT: movapd %xmm4, %xmm0
+; X64-SSE42-NEXT: pcmpgtq %xmm6, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm4, %xmm6
+; X64-SSE42-NEXT: movapd %xmm6, %xmm0
+; X64-SSE42-NEXT: pcmpgtq %xmm7, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm6, %xmm7
+; X64-SSE42-NEXT: pshufd {{.*#+}} xmm1 = xmm7[2,3,2,3]
+; X64-SSE42-NEXT: movdqa %xmm7, %xmm0
+; X64-SSE42-NEXT: pcmpgtq %xmm1, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm7, %xmm1
+; X64-SSE42-NEXT: movq %xmm1, %rax
+; X64-SSE42-NEXT: retq
+;
+; X86-AVX1-LABEL: test_v16i64:
+; X86-AVX1: # %bb.0:
+; X86-AVX1-NEXT: pushl %ebp
+; X86-AVX1-NEXT: movl %esp, %ebp
+; X86-AVX1-NEXT: andl $-32, %esp
+; X86-AVX1-NEXT: subl $32, %esp
+; X86-AVX1-NEXT: vmovdqa 8(%ebp), %xmm3
+; X86-AVX1-NEXT: vmovdqa 24(%ebp), %xmm4
+; X86-AVX1-NEXT: vpcmpgtq %xmm3, %xmm1, %xmm5
+; X86-AVX1-NEXT: vblendvpd %xmm5, %xmm1, %xmm3, %xmm3
+; X86-AVX1-NEXT: vpcmpgtq %xmm2, %xmm0, %xmm5
+; X86-AVX1-NEXT: vblendvpd %xmm5, %xmm0, %xmm2, %xmm5
+; X86-AVX1-NEXT: vextractf128 $1, %ymm1, %xmm1
+; X86-AVX1-NEXT: vpcmpgtq %xmm4, %xmm1, %xmm6
+; X86-AVX1-NEXT: vblendvpd %xmm6, %xmm1, %xmm4, %xmm1
+; X86-AVX1-NEXT: vextractf128 $1, %ymm2, %xmm2
+; X86-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm0
+; X86-AVX1-NEXT: vpcmpgtq %xmm2, %xmm0, %xmm4
+; X86-AVX1-NEXT: vblendvpd %xmm4, %xmm0, %xmm2, %xmm0
+; X86-AVX1-NEXT: vpcmpgtq %xmm1, %xmm0, %xmm2
+; X86-AVX1-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X86-AVX1-NEXT: vpcmpgtq %xmm3, %xmm5, %xmm1
+; X86-AVX1-NEXT: vblendvpd %xmm1, %xmm5, %xmm3, %xmm1
+; X86-AVX1-NEXT: vpcmpgtq %xmm0, %xmm1, %xmm2
+; X86-AVX1-NEXT: vblendvpd %xmm2, %xmm1, %xmm0, %xmm0
+; X86-AVX1-NEXT: vshufps {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-AVX1-NEXT: vpcmpgtq %xmm1, %xmm0, %xmm2
+; X86-AVX1-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X86-AVX1-NEXT: vmovd %xmm0, %eax
+; X86-AVX1-NEXT: vpextrd $1, %xmm0, %edx
+; X86-AVX1-NEXT: movl %ebp, %esp
+; X86-AVX1-NEXT: popl %ebp
+; X86-AVX1-NEXT: vzeroupper
+; X86-AVX1-NEXT: retl
+;
+; X64-AVX1-LABEL: test_v16i64:
+; X64-AVX1: # %bb.0:
+; X64-AVX1-NEXT: vextractf128 $1, %ymm3, %xmm4
+; X64-AVX1-NEXT: vextractf128 $1, %ymm1, %xmm5
+; X64-AVX1-NEXT: vpcmpgtq %xmm4, %xmm5, %xmm6
+; X64-AVX1-NEXT: vblendvpd %xmm6, %xmm5, %xmm4, %xmm4
+; X64-AVX1-NEXT: vextractf128 $1, %ymm2, %xmm5
+; X64-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm6
+; X64-AVX1-NEXT: vpcmpgtq %xmm5, %xmm6, %xmm7
+; X64-AVX1-NEXT: vblendvpd %xmm7, %xmm6, %xmm5, %xmm5
+; X64-AVX1-NEXT: vpcmpgtq %xmm4, %xmm5, %xmm6
+; X64-AVX1-NEXT: vblendvpd %xmm6, %xmm5, %xmm4, %xmm4
+; X64-AVX1-NEXT: vpcmpgtq %xmm3, %xmm1, %xmm5
+; X64-AVX1-NEXT: vblendvpd %xmm5, %xmm1, %xmm3, %xmm1
+; X64-AVX1-NEXT: vpcmpgtq %xmm2, %xmm0, %xmm3
+; X64-AVX1-NEXT: vblendvpd %xmm3, %xmm0, %xmm2, %xmm0
+; X64-AVX1-NEXT: vpcmpgtq %xmm1, %xmm0, %xmm2
+; X64-AVX1-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X64-AVX1-NEXT: vpcmpgtq %xmm4, %xmm0, %xmm1
+; X64-AVX1-NEXT: vblendvpd %xmm1, %xmm0, %xmm4, %xmm0
+; X64-AVX1-NEXT: vshufps {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X64-AVX1-NEXT: vpcmpgtq %xmm1, %xmm0, %xmm2
+; X64-AVX1-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X64-AVX1-NEXT: vmovq %xmm0, %rax
+; X64-AVX1-NEXT: vzeroupper
+; X64-AVX1-NEXT: retq
+;
+; X86-AVX2-LABEL: test_v16i64:
+; X86-AVX2: # %bb.0:
+; X86-AVX2-NEXT: pushl %ebp
+; X86-AVX2-NEXT: movl %esp, %ebp
+; X86-AVX2-NEXT: andl $-32, %esp
+; X86-AVX2-NEXT: subl $32, %esp
+; X86-AVX2-NEXT: vmovdqa 8(%ebp), %ymm3
+; X86-AVX2-NEXT: vpcmpgtq %ymm3, %ymm1, %ymm4
+; X86-AVX2-NEXT: vblendvpd %ymm4, %ymm1, %ymm3, %ymm1
+; X86-AVX2-NEXT: vpcmpgtq %ymm2, %ymm0, %ymm3
+; X86-AVX2-NEXT: vblendvpd %ymm3, %ymm0, %ymm2, %ymm0
+; X86-AVX2-NEXT: vpcmpgtq %ymm1, %ymm0, %ymm2
+; X86-AVX2-NEXT: vblendvpd %ymm2, %ymm0, %ymm1, %ymm0
+; X86-AVX2-NEXT: vextractf128 $1, %ymm0, %xmm1
+; X86-AVX2-NEXT: vpcmpgtq %xmm1, %xmm0, %xmm2
+; X86-AVX2-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X86-AVX2-NEXT: vshufps {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-AVX2-NEXT: vpcmpgtq %xmm1, %xmm0, %xmm2
+; X86-AVX2-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X86-AVX2-NEXT: vmovd %xmm0, %eax
+; X86-AVX2-NEXT: vpextrd $1, %xmm0, %edx
+; X86-AVX2-NEXT: movl %ebp, %esp
+; X86-AVX2-NEXT: popl %ebp
+; X86-AVX2-NEXT: vzeroupper
+; X86-AVX2-NEXT: retl
+;
+; X64-AVX2-LABEL: test_v16i64:
+; X64-AVX2: # %bb.0:
+; X64-AVX2-NEXT: vpcmpgtq %ymm3, %ymm1, %ymm4
+; X64-AVX2-NEXT: vblendvpd %ymm4, %ymm1, %ymm3, %ymm1
+; X64-AVX2-NEXT: vpcmpgtq %ymm2, %ymm0, %ymm3
+; X64-AVX2-NEXT: vblendvpd %ymm3, %ymm0, %ymm2, %ymm0
+; X64-AVX2-NEXT: vpcmpgtq %ymm1, %ymm0, %ymm2
+; X64-AVX2-NEXT: vblendvpd %ymm2, %ymm0, %ymm1, %ymm0
+; X64-AVX2-NEXT: vextractf128 $1, %ymm0, %xmm1
+; X64-AVX2-NEXT: vpcmpgtq %xmm1, %xmm0, %xmm2
+; X64-AVX2-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X64-AVX2-NEXT: vshufps {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X64-AVX2-NEXT: vpcmpgtq %xmm1, %xmm0, %xmm2
+; X64-AVX2-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X64-AVX2-NEXT: vmovq %xmm0, %rax
+; X64-AVX2-NEXT: vzeroupper
+; X64-AVX2-NEXT: retq
;
; AVX512BW-LABEL: test_v16i64:
; AVX512BW: # %bb.0:
@@ -721,7 +1476,7 @@ define i64 @test_v16i64(<16 x i64> %a0) {
; vXi32
;
-define i32 @test_v2i32(<2 x i32> %a0) {
+define i32 @test_v2i32(<2 x i32> %a0) nounwind {
; SSE2-LABEL: test_v2i32:
; SSE2: # %bb.0:
; SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
@@ -731,33 +1486,26 @@ define i32 @test_v2i32(<2 x i32> %a0) {
; SSE2-NEXT: pandn %xmm1, %xmm2
; SSE2-NEXT: por %xmm0, %xmm2
; SSE2-NEXT: movd %xmm2, %eax
-; SSE2-NEXT: retq
+; SSE2-NEXT: ret{{[l|q]}}
;
; SSE4-LABEL: test_v2i32:
; SSE4: # %bb.0:
; SSE4-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
; SSE4-NEXT: pmaxsd %xmm0, %xmm1
; SSE4-NEXT: movd %xmm1, %eax
-; SSE4-NEXT: retq
+; SSE4-NEXT: ret{{[l|q]}}
;
; AVX-LABEL: test_v2i32:
; AVX: # %bb.0:
; AVX-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
; AVX-NEXT: vpmaxsd %xmm1, %xmm0, %xmm0
; AVX-NEXT: vmovd %xmm0, %eax
-; AVX-NEXT: retq
-;
-; AVX512-LABEL: test_v2i32:
-; AVX512: # %bb.0:
-; AVX512-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
-; AVX512-NEXT: vpmaxsd %xmm1, %xmm0, %xmm0
-; AVX512-NEXT: vmovd %xmm0, %eax
-; AVX512-NEXT: retq
+; AVX-NEXT: ret{{[l|q]}}
%1 = call i32 @llvm.vector.reduce.smax.v2i32(<2 x i32> %a0)
ret i32 %1
}
-define i32 @test_v4i32(<4 x i32> %a0) {
+define i32 @test_v4i32(<4 x i32> %a0) nounwind {
; SSE2-LABEL: test_v4i32:
; SSE2: # %bb.0:
; SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
@@ -771,7 +1519,7 @@ define i32 @test_v4i32(<4 x i32> %a0) {
; SSE2-NEXT: movd %xmm0, %eax
; SSE2-NEXT: cmpl %eax, %ecx
; SSE2-NEXT: cmovgl %ecx, %eax
-; SSE2-NEXT: retq
+; SSE2-NEXT: ret{{[l|q]}}
;
; SSE4-LABEL: test_v4i32:
; SSE4: # %bb.0:
@@ -780,7 +1528,7 @@ define i32 @test_v4i32(<4 x i32> %a0) {
; SSE4-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
; SSE4-NEXT: pmaxsd %xmm1, %xmm0
; SSE4-NEXT: movd %xmm0, %eax
-; SSE4-NEXT: retq
+; SSE4-NEXT: ret{{[l|q]}}
;
; AVX-LABEL: test_v4i32:
; AVX: # %bb.0:
@@ -789,21 +1537,12 @@ define i32 @test_v4i32(<4 x i32> %a0) {
; AVX-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
; AVX-NEXT: vpmaxsd %xmm1, %xmm0, %xmm0
; AVX-NEXT: vmovd %xmm0, %eax
-; AVX-NEXT: retq
-;
-; AVX512-LABEL: test_v4i32:
-; AVX512: # %bb.0:
-; AVX512-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
-; AVX512-NEXT: vpmaxsd %xmm1, %xmm0, %xmm0
-; AVX512-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
-; AVX512-NEXT: vpmaxsd %xmm1, %xmm0, %xmm0
-; AVX512-NEXT: vmovd %xmm0, %eax
-; AVX512-NEXT: retq
+; AVX-NEXT: ret{{[l|q]}}
%1 = call i32 @llvm.vector.reduce.smax.v4i32(<4 x i32> %a0)
ret i32 %1
}
-define i32 @test_v8i32(<8 x i32> %a0) {
+define i32 @test_v8i32(<8 x i32> %a0) nounwind {
; SSE2-LABEL: test_v8i32:
; SSE2: # %bb.0:
; SSE2-NEXT: movdqa %xmm0, %xmm2
@@ -822,7 +1561,7 @@ define i32 @test_v8i32(<8 x i32> %a0) {
; SSE2-NEXT: movd %xmm0, %eax
; SSE2-NEXT: cmpl %eax, %ecx
; SSE2-NEXT: cmovgl %ecx, %eax
-; SSE2-NEXT: retq
+; SSE2-NEXT: ret{{[l|q]}}
;
; SSE4-LABEL: test_v8i32:
; SSE4: # %bb.0:
@@ -832,7 +1571,7 @@ define i32 @test_v8i32(<8 x i32> %a0) {
; SSE4-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
; SSE4-NEXT: pmaxsd %xmm1, %xmm0
; SSE4-NEXT: movd %xmm0, %eax
-; SSE4-NEXT: retq
+; SSE4-NEXT: ret{{[l|q]}}
;
; AVX1-LABEL: test_v8i32:
; AVX1: # %bb.0:
@@ -844,7 +1583,7 @@ define i32 @test_v8i32(<8 x i32> %a0) {
; AVX1-NEXT: vpmaxsd %xmm1, %xmm0, %xmm0
; AVX1-NEXT: vmovd %xmm0, %eax
; AVX1-NEXT: vzeroupper
-; AVX1-NEXT: retq
+; AVX1-NEXT: ret{{[l|q]}}
;
; AVX2-LABEL: test_v8i32:
; AVX2: # %bb.0:
@@ -856,7 +1595,7 @@ define i32 @test_v8i32(<8 x i32> %a0) {
; AVX2-NEXT: vpmaxsd %xmm1, %xmm0, %xmm0
; AVX2-NEXT: vmovd %xmm0, %eax
; AVX2-NEXT: vzeroupper
-; AVX2-NEXT: retq
+; AVX2-NEXT: ret{{[l|q]}}
;
; AVX512-LABEL: test_v8i32:
; AVX512: # %bb.0:
@@ -873,48 +1612,103 @@ define i32 @test_v8i32(<8 x i32> %a0) {
ret i32 %1
}
-define i32 @test_v16i32(<16 x i32> %a0) {
-; SSE2-LABEL: test_v16i32:
-; SSE2: # %bb.0:
-; SSE2-NEXT: movdqa %xmm1, %xmm4
-; SSE2-NEXT: pcmpgtd %xmm3, %xmm4
-; SSE2-NEXT: pand %xmm4, %xmm1
-; SSE2-NEXT: pandn %xmm3, %xmm4
-; SSE2-NEXT: por %xmm1, %xmm4
-; SSE2-NEXT: movdqa %xmm0, %xmm1
-; SSE2-NEXT: pcmpgtd %xmm2, %xmm1
-; SSE2-NEXT: pand %xmm1, %xmm0
-; SSE2-NEXT: pandn %xmm2, %xmm1
-; SSE2-NEXT: por %xmm0, %xmm1
-; SSE2-NEXT: movdqa %xmm1, %xmm0
-; SSE2-NEXT: pcmpgtd %xmm4, %xmm0
-; SSE2-NEXT: pand %xmm0, %xmm1
-; SSE2-NEXT: pandn %xmm4, %xmm0
-; SSE2-NEXT: por %xmm1, %xmm0
-; SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
-; SSE2-NEXT: movdqa %xmm0, %xmm2
-; SSE2-NEXT: pcmpgtd %xmm1, %xmm2
-; SSE2-NEXT: pand %xmm2, %xmm0
-; SSE2-NEXT: pandn %xmm1, %xmm2
-; SSE2-NEXT: por %xmm0, %xmm2
-; SSE2-NEXT: movd %xmm2, %ecx
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,1,1]
-; SSE2-NEXT: movd %xmm0, %eax
-; SSE2-NEXT: cmpl %eax, %ecx
-; SSE2-NEXT: cmovgl %ecx, %eax
-; SSE2-NEXT: retq
-;
-; SSE4-LABEL: test_v16i32:
-; SSE4: # %bb.0:
-; SSE4-NEXT: pmaxsd %xmm3, %xmm1
-; SSE4-NEXT: pmaxsd %xmm2, %xmm0
-; SSE4-NEXT: pmaxsd %xmm1, %xmm0
-; SSE4-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
-; SSE4-NEXT: pmaxsd %xmm0, %xmm1
-; SSE4-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
-; SSE4-NEXT: pmaxsd %xmm1, %xmm0
-; SSE4-NEXT: movd %xmm0, %eax
-; SSE4-NEXT: retq
+define i32 @test_v16i32(<16 x i32> %a0) nounwind {
+; X86-SSE2-LABEL: test_v16i32:
+; X86-SSE2: # %bb.0:
+; X86-SSE2-NEXT: pushl %ebp
+; X86-SSE2-NEXT: movl %esp, %ebp
+; X86-SSE2-NEXT: andl $-16, %esp
+; X86-SSE2-NEXT: subl $16, %esp
+; X86-SSE2-NEXT: movdqa 8(%ebp), %xmm4
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm3
+; X86-SSE2-NEXT: pcmpgtd %xmm4, %xmm3
+; X86-SSE2-NEXT: pand %xmm3, %xmm1
+; X86-SSE2-NEXT: pandn %xmm4, %xmm3
+; X86-SSE2-NEXT: por %xmm1, %xmm3
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X86-SSE2-NEXT: pcmpgtd %xmm2, %xmm1
+; X86-SSE2-NEXT: pand %xmm1, %xmm0
+; X86-SSE2-NEXT: pandn %xmm2, %xmm1
+; X86-SSE2-NEXT: por %xmm0, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE2-NEXT: pcmpgtd %xmm3, %xmm0
+; X86-SSE2-NEXT: pand %xmm0, %xmm1
+; X86-SSE2-NEXT: pandn %xmm3, %xmm0
+; X86-SSE2-NEXT: por %xmm1, %xmm0
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE2-NEXT: pcmpgtd %xmm1, %xmm2
+; X86-SSE2-NEXT: pand %xmm2, %xmm0
+; X86-SSE2-NEXT: pandn %xmm1, %xmm2
+; X86-SSE2-NEXT: por %xmm0, %xmm2
+; X86-SSE2-NEXT: movd %xmm2, %ecx
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,1,1]
+; X86-SSE2-NEXT: movd %xmm0, %eax
+; X86-SSE2-NEXT: cmpl %eax, %ecx
+; X86-SSE2-NEXT: cmovgl %ecx, %eax
+; X86-SSE2-NEXT: movl %ebp, %esp
+; X86-SSE2-NEXT: popl %ebp
+; X86-SSE2-NEXT: retl
+;
+; X64-SSE2-LABEL: test_v16i32:
+; X64-SSE2: # %bb.0:
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm4
+; X64-SSE2-NEXT: pcmpgtd %xmm3, %xmm4
+; X64-SSE2-NEXT: pand %xmm4, %xmm1
+; X64-SSE2-NEXT: pandn %xmm3, %xmm4
+; X64-SSE2-NEXT: por %xmm1, %xmm4
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X64-SSE2-NEXT: pcmpgtd %xmm2, %xmm1
+; X64-SSE2-NEXT: pand %xmm1, %xmm0
+; X64-SSE2-NEXT: pandn %xmm2, %xmm1
+; X64-SSE2-NEXT: por %xmm0, %xmm1
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X64-SSE2-NEXT: pcmpgtd %xmm4, %xmm0
+; X64-SSE2-NEXT: pand %xmm0, %xmm1
+; X64-SSE2-NEXT: pandn %xmm4, %xmm0
+; X64-SSE2-NEXT: por %xmm1, %xmm0
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X64-SSE2-NEXT: pcmpgtd %xmm1, %xmm2
+; X64-SSE2-NEXT: pand %xmm2, %xmm0
+; X64-SSE2-NEXT: pandn %xmm1, %xmm2
+; X64-SSE2-NEXT: por %xmm0, %xmm2
+; X64-SSE2-NEXT: movd %xmm2, %ecx
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,1,1]
+; X64-SSE2-NEXT: movd %xmm0, %eax
+; X64-SSE2-NEXT: cmpl %eax, %ecx
+; X64-SSE2-NEXT: cmovgl %ecx, %eax
+; X64-SSE2-NEXT: retq
+;
+; X86-SSE4-LABEL: test_v16i32:
+; X86-SSE4: # %bb.0:
+; X86-SSE4-NEXT: pushl %ebp
+; X86-SSE4-NEXT: movl %esp, %ebp
+; X86-SSE4-NEXT: andl $-16, %esp
+; X86-SSE4-NEXT: subl $16, %esp
+; X86-SSE4-NEXT: pmaxsd %xmm2, %xmm0
+; X86-SSE4-NEXT: pmaxsd 8(%ebp), %xmm1
+; X86-SSE4-NEXT: pmaxsd %xmm0, %xmm1
+; X86-SSE4-NEXT: pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
+; X86-SSE4-NEXT: pmaxsd %xmm1, %xmm0
+; X86-SSE4-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; X86-SSE4-NEXT: pmaxsd %xmm0, %xmm1
+; X86-SSE4-NEXT: movd %xmm1, %eax
+; X86-SSE4-NEXT: movl %ebp, %esp
+; X86-SSE4-NEXT: popl %ebp
+; X86-SSE4-NEXT: retl
+;
+; X64-SSE4-LABEL: test_v16i32:
+; X64-SSE4: # %bb.0:
+; X64-SSE4-NEXT: pmaxsd %xmm3, %xmm1
+; X64-SSE4-NEXT: pmaxsd %xmm2, %xmm0
+; X64-SSE4-NEXT: pmaxsd %xmm1, %xmm0
+; X64-SSE4-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X64-SSE4-NEXT: pmaxsd %xmm0, %xmm1
+; X64-SSE4-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
+; X64-SSE4-NEXT: pmaxsd %xmm1, %xmm0
+; X64-SSE4-NEXT: movd %xmm0, %eax
+; X64-SSE4-NEXT: retq
;
; AVX1-LABEL: test_v16i32:
; AVX1: # %bb.0:
@@ -929,7 +1723,7 @@ define i32 @test_v16i32(<16 x i32> %a0) {
; AVX1-NEXT: vpmaxsd %xmm1, %xmm0, %xmm0
; AVX1-NEXT: vmovd %xmm0, %eax
; AVX1-NEXT: vzeroupper
-; AVX1-NEXT: retq
+; AVX1-NEXT: ret{{[l|q]}}
;
; AVX2-LABEL: test_v16i32:
; AVX2: # %bb.0:
@@ -942,7 +1736,7 @@ define i32 @test_v16i32(<16 x i32> %a0) {
; AVX2-NEXT: vpmaxsd %xmm1, %xmm0, %xmm0
; AVX2-NEXT: vmovd %xmm0, %eax
; AVX2-NEXT: vzeroupper
-; AVX2-NEXT: retq
+; AVX2-NEXT: ret{{[l|q]}}
;
; AVX512-LABEL: test_v16i32:
; AVX512: # %bb.0:
@@ -961,108 +1755,239 @@ define i32 @test_v16i32(<16 x i32> %a0) {
ret i32 %1
}
-define i32 @test_v32i32(<32 x i32> %a0) {
-; SSE2-LABEL: test_v32i32:
-; SSE2: # %bb.0:
-; SSE2-NEXT: movdqa %xmm3, %xmm8
-; SSE2-NEXT: pcmpgtd %xmm7, %xmm8
-; SSE2-NEXT: pand %xmm8, %xmm3
-; SSE2-NEXT: pandn %xmm7, %xmm8
-; SSE2-NEXT: por %xmm3, %xmm8
-; SSE2-NEXT: movdqa %xmm1, %xmm3
-; SSE2-NEXT: pcmpgtd %xmm5, %xmm3
-; SSE2-NEXT: pand %xmm3, %xmm1
-; SSE2-NEXT: pandn %xmm5, %xmm3
-; SSE2-NEXT: por %xmm1, %xmm3
-; SSE2-NEXT: movdqa %xmm3, %xmm1
-; SSE2-NEXT: pcmpgtd %xmm8, %xmm1
-; SSE2-NEXT: pand %xmm1, %xmm3
-; SSE2-NEXT: pandn %xmm8, %xmm1
-; SSE2-NEXT: por %xmm3, %xmm1
-; SSE2-NEXT: movdqa %xmm2, %xmm3
-; SSE2-NEXT: pcmpgtd %xmm6, %xmm3
-; SSE2-NEXT: pand %xmm3, %xmm2
-; SSE2-NEXT: pandn %xmm6, %xmm3
-; SSE2-NEXT: por %xmm2, %xmm3
-; SSE2-NEXT: movdqa %xmm0, %xmm2
-; SSE2-NEXT: pcmpgtd %xmm4, %xmm2
-; SSE2-NEXT: pand %xmm2, %xmm0
-; SSE2-NEXT: pandn %xmm4, %xmm2
-; SSE2-NEXT: por %xmm0, %xmm2
-; SSE2-NEXT: movdqa %xmm2, %xmm0
-; SSE2-NEXT: pcmpgtd %xmm3, %xmm0
-; SSE2-NEXT: pand %xmm0, %xmm2
-; SSE2-NEXT: pandn %xmm3, %xmm0
-; SSE2-NEXT: por %xmm2, %xmm0
-; SSE2-NEXT: movdqa %xmm0, %xmm2
-; SSE2-NEXT: pcmpgtd %xmm1, %xmm2
-; SSE2-NEXT: pand %xmm2, %xmm0
-; SSE2-NEXT: pandn %xmm1, %xmm2
-; SSE2-NEXT: por %xmm0, %xmm2
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm2[2,3,2,3]
-; SSE2-NEXT: movdqa %xmm2, %xmm1
-; SSE2-NEXT: pcmpgtd %xmm0, %xmm1
-; SSE2-NEXT: pand %xmm1, %xmm2
-; SSE2-NEXT: pandn %xmm0, %xmm1
-; SSE2-NEXT: por %xmm2, %xmm1
-; SSE2-NEXT: movd %xmm1, %ecx
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
-; SSE2-NEXT: movd %xmm0, %eax
-; SSE2-NEXT: cmpl %eax, %ecx
-; SSE2-NEXT: cmovgl %ecx, %eax
-; SSE2-NEXT: retq
-;
-; SSE4-LABEL: test_v32i32:
-; SSE4: # %bb.0:
-; SSE4-NEXT: pmaxsd %xmm7, %xmm3
-; SSE4-NEXT: pmaxsd %xmm5, %xmm1
-; SSE4-NEXT: pmaxsd %xmm3, %xmm1
-; SSE4-NEXT: pmaxsd %xmm6, %xmm2
-; SSE4-NEXT: pmaxsd %xmm4, %xmm0
-; SSE4-NEXT: pmaxsd %xmm2, %xmm0
-; SSE4-NEXT: pmaxsd %xmm1, %xmm0
-; SSE4-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
-; SSE4-NEXT: pmaxsd %xmm0, %xmm1
-; SSE4-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
-; SSE4-NEXT: pmaxsd %xmm1, %xmm0
-; SSE4-NEXT: movd %xmm0, %eax
-; SSE4-NEXT: retq
-;
-; AVX1-LABEL: test_v32i32:
-; AVX1: # %bb.0:
-; AVX1-NEXT: vextractf128 $1, %ymm3, %xmm4
-; AVX1-NEXT: vextractf128 $1, %ymm1, %xmm5
-; AVX1-NEXT: vpmaxsd %xmm4, %xmm5, %xmm4
-; AVX1-NEXT: vextractf128 $1, %ymm2, %xmm5
-; AVX1-NEXT: vextractf128 $1, %ymm0, %xmm6
-; AVX1-NEXT: vpmaxsd %xmm5, %xmm6, %xmm5
-; AVX1-NEXT: vpmaxsd %xmm4, %xmm5, %xmm4
-; AVX1-NEXT: vpmaxsd %xmm3, %xmm1, %xmm1
-; AVX1-NEXT: vpmaxsd %xmm2, %xmm0, %xmm0
-; AVX1-NEXT: vpmaxsd %xmm1, %xmm0, %xmm0
-; AVX1-NEXT: vpmaxsd %xmm4, %xmm0, %xmm0
-; AVX1-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
-; AVX1-NEXT: vpmaxsd %xmm1, %xmm0, %xmm0
-; AVX1-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
-; AVX1-NEXT: vpmaxsd %xmm1, %xmm0, %xmm0
-; AVX1-NEXT: vmovd %xmm0, %eax
-; AVX1-NEXT: vzeroupper
-; AVX1-NEXT: retq
-;
-; AVX2-LABEL: test_v32i32:
-; AVX2: # %bb.0:
-; AVX2-NEXT: vpmaxsd %ymm3, %ymm1, %ymm1
-; AVX2-NEXT: vpmaxsd %ymm2, %ymm0, %ymm0
-; AVX2-NEXT: vpmaxsd %ymm1, %ymm0, %ymm0
-; AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
-; AVX2-NEXT: vpmaxsd %xmm1, %xmm0, %xmm0
-; AVX2-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
-; AVX2-NEXT: vpmaxsd %xmm1, %xmm0, %xmm0
-; AVX2-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
-; AVX2-NEXT: vpmaxsd %xmm1, %xmm0, %xmm0
-; AVX2-NEXT: vmovd %xmm0, %eax
-; AVX2-NEXT: vzeroupper
-; AVX2-NEXT: retq
+define i32 @test_v32i32(<32 x i32> %a0) nounwind {
+; X86-SSE2-LABEL: test_v32i32:
+; X86-SSE2: # %bb.0:
+; X86-SSE2-NEXT: pushl %ebp
+; X86-SSE2-NEXT: movl %esp, %ebp
+; X86-SSE2-NEXT: andl $-16, %esp
+; X86-SSE2-NEXT: subl $16, %esp
+; X86-SSE2-NEXT: movdqa 72(%ebp), %xmm4
+; X86-SSE2-NEXT: movdqa 8(%ebp), %xmm5
+; X86-SSE2-NEXT: movdqa %xmm5, %xmm3
+; X86-SSE2-NEXT: pcmpgtd %xmm4, %xmm3
+; X86-SSE2-NEXT: pand %xmm3, %xmm5
+; X86-SSE2-NEXT: pandn %xmm4, %xmm3
+; X86-SSE2-NEXT: movdqa 40(%ebp), %xmm4
+; X86-SSE2-NEXT: por %xmm5, %xmm3
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm5
+; X86-SSE2-NEXT: pcmpgtd %xmm4, %xmm5
+; X86-SSE2-NEXT: pand %xmm5, %xmm1
+; X86-SSE2-NEXT: pandn %xmm4, %xmm5
+; X86-SSE2-NEXT: por %xmm1, %xmm5
+; X86-SSE2-NEXT: movdqa %xmm5, %xmm1
+; X86-SSE2-NEXT: pcmpgtd %xmm3, %xmm1
+; X86-SSE2-NEXT: pand %xmm1, %xmm5
+; X86-SSE2-NEXT: pandn %xmm3, %xmm1
+; X86-SSE2-NEXT: movdqa 56(%ebp), %xmm4
+; X86-SSE2-NEXT: por %xmm5, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm3
+; X86-SSE2-NEXT: pcmpgtd %xmm4, %xmm3
+; X86-SSE2-NEXT: pand %xmm3, %xmm2
+; X86-SSE2-NEXT: pandn %xmm4, %xmm3
+; X86-SSE2-NEXT: movdqa 24(%ebp), %xmm4
+; X86-SSE2-NEXT: por %xmm2, %xmm3
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE2-NEXT: pcmpgtd %xmm4, %xmm2
+; X86-SSE2-NEXT: pand %xmm2, %xmm0
+; X86-SSE2-NEXT: pandn %xmm4, %xmm2
+; X86-SSE2-NEXT: por %xmm0, %xmm2
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm0
+; X86-SSE2-NEXT: pcmpgtd %xmm3, %xmm0
+; X86-SSE2-NEXT: pand %xmm0, %xmm2
+; X86-SSE2-NEXT: pandn %xmm3, %xmm0
+; X86-SSE2-NEXT: por %xmm2, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE2-NEXT: pcmpgtd %xmm1, %xmm2
+; X86-SSE2-NEXT: pand %xmm2, %xmm0
+; X86-SSE2-NEXT: pandn %xmm1, %xmm2
+; X86-SSE2-NEXT: por %xmm0, %xmm2
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm2[2,3,2,3]
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm1
+; X86-SSE2-NEXT: pcmpgtd %xmm0, %xmm1
+; X86-SSE2-NEXT: pand %xmm1, %xmm2
+; X86-SSE2-NEXT: pandn %xmm0, %xmm1
+; X86-SSE2-NEXT: por %xmm2, %xmm1
+; X86-SSE2-NEXT: movd %xmm1, %ecx
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
+; X86-SSE2-NEXT: movd %xmm0, %eax
+; X86-SSE2-NEXT: cmpl %eax, %ecx
+; X86-SSE2-NEXT: cmovgl %ecx, %eax
+; X86-SSE2-NEXT: movl %ebp, %esp
+; X86-SSE2-NEXT: popl %ebp
+; X86-SSE2-NEXT: retl
+;
+; X64-SSE2-LABEL: test_v32i32:
+; X64-SSE2: # %bb.0:
+; X64-SSE2-NEXT: movdqa %xmm3, %xmm8
+; X64-SSE2-NEXT: pcmpgtd %xmm7, %xmm8
+; X64-SSE2-NEXT: pand %xmm8, %xmm3
+; X64-SSE2-NEXT: pandn %xmm7, %xmm8
+; X64-SSE2-NEXT: por %xmm3, %xmm8
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm3
+; X64-SSE2-NEXT: pcmpgtd %xmm5, %xmm3
+; X64-SSE2-NEXT: pand %xmm3, %xmm1
+; X64-SSE2-NEXT: pandn %xmm5, %xmm3
+; X64-SSE2-NEXT: por %xmm1, %xmm3
+; X64-SSE2-NEXT: movdqa %xmm3, %xmm1
+; X64-SSE2-NEXT: pcmpgtd %xmm8, %xmm1
+; X64-SSE2-NEXT: pand %xmm1, %xmm3
+; X64-SSE2-NEXT: pandn %xmm8, %xmm1
+; X64-SSE2-NEXT: por %xmm3, %xmm1
+; X64-SSE2-NEXT: movdqa %xmm2, %xmm3
+; X64-SSE2-NEXT: pcmpgtd %xmm6, %xmm3
+; X64-SSE2-NEXT: pand %xmm3, %xmm2
+; X64-SSE2-NEXT: pandn %xmm6, %xmm3
+; X64-SSE2-NEXT: por %xmm2, %xmm3
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X64-SSE2-NEXT: pcmpgtd %xmm4, %xmm2
+; X64-SSE2-NEXT: pand %xmm2, %xmm0
+; X64-SSE2-NEXT: pandn %xmm4, %xmm2
+; X64-SSE2-NEXT: por %xmm0, %xmm2
+; X64-SSE2-NEXT: movdqa %xmm2, %xmm0
+; X64-SSE2-NEXT: pcmpgtd %xmm3, %xmm0
+; X64-SSE2-NEXT: pand %xmm0, %xmm2
+; X64-SSE2-NEXT: pandn %xmm3, %xmm0
+; X64-SSE2-NEXT: por %xmm2, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X64-SSE2-NEXT: pcmpgtd %xmm1, %xmm2
+; X64-SSE2-NEXT: pand %xmm2, %xmm0
+; X64-SSE2-NEXT: pandn %xmm1, %xmm2
+; X64-SSE2-NEXT: por %xmm0, %xmm2
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm2[2,3,2,3]
+; X64-SSE2-NEXT: movdqa %xmm2, %xmm1
+; X64-SSE2-NEXT: pcmpgtd %xmm0, %xmm1
+; X64-SSE2-NEXT: pand %xmm1, %xmm2
+; X64-SSE2-NEXT: pandn %xmm0, %xmm1
+; X64-SSE2-NEXT: por %xmm2, %xmm1
+; X64-SSE2-NEXT: movd %xmm1, %ecx
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
+; X64-SSE2-NEXT: movd %xmm0, %eax
+; X64-SSE2-NEXT: cmpl %eax, %ecx
+; X64-SSE2-NEXT: cmovgl %ecx, %eax
+; X64-SSE2-NEXT: retq
+;
+; X86-SSE4-LABEL: test_v32i32:
+; X86-SSE4: # %bb.0:
+; X86-SSE4-NEXT: pushl %ebp
+; X86-SSE4-NEXT: movl %esp, %ebp
+; X86-SSE4-NEXT: andl $-16, %esp
+; X86-SSE4-NEXT: subl $16, %esp
+; X86-SSE4-NEXT: movdqa 8(%ebp), %xmm3
+; X86-SSE4-NEXT: pmaxsd 72(%ebp), %xmm3
+; X86-SSE4-NEXT: pmaxsd 40(%ebp), %xmm1
+; X86-SSE4-NEXT: pmaxsd %xmm3, %xmm1
+; X86-SSE4-NEXT: pmaxsd 56(%ebp), %xmm2
+; X86-SSE4-NEXT: pmaxsd 24(%ebp), %xmm0
+; X86-SSE4-NEXT: pmaxsd %xmm2, %xmm0
+; X86-SSE4-NEXT: pmaxsd %xmm1, %xmm0
+; X86-SSE4-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-SSE4-NEXT: pmaxsd %xmm0, %xmm1
+; X86-SSE4-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
+; X86-SSE4-NEXT: pmaxsd %xmm1, %xmm0
+; X86-SSE4-NEXT: movd %xmm0, %eax
+; X86-SSE4-NEXT: movl %ebp, %esp
+; X86-SSE4-NEXT: popl %ebp
+; X86-SSE4-NEXT: retl
+;
+; X64-SSE4-LABEL: test_v32i32:
+; X64-SSE4: # %bb.0:
+; X64-SSE4-NEXT: pmaxsd %xmm7, %xmm3
+; X64-SSE4-NEXT: pmaxsd %xmm5, %xmm1
+; X64-SSE4-NEXT: pmaxsd %xmm3, %xmm1
+; X64-SSE4-NEXT: pmaxsd %xmm6, %xmm2
+; X64-SSE4-NEXT: pmaxsd %xmm4, %xmm0
+; X64-SSE4-NEXT: pmaxsd %xmm2, %xmm0
+; X64-SSE4-NEXT: pmaxsd %xmm1, %xmm0
+; X64-SSE4-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X64-SSE4-NEXT: pmaxsd %xmm0, %xmm1
+; X64-SSE4-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
+; X64-SSE4-NEXT: pmaxsd %xmm1, %xmm0
+; X64-SSE4-NEXT: movd %xmm0, %eax
+; X64-SSE4-NEXT: retq
+;
+; X86-AVX1-LABEL: test_v32i32:
+; X86-AVX1: # %bb.0:
+; X86-AVX1-NEXT: pushl %ebp
+; X86-AVX1-NEXT: movl %esp, %ebp
+; X86-AVX1-NEXT: andl $-32, %esp
+; X86-AVX1-NEXT: subl $32, %esp
+; X86-AVX1-NEXT: vextractf128 $1, %ymm2, %xmm3
+; X86-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm4
+; X86-AVX1-NEXT: vpmaxsd %xmm3, %xmm4, %xmm3
+; X86-AVX1-NEXT: vextractf128 $1, %ymm1, %xmm4
+; X86-AVX1-NEXT: vpmaxsd 24(%ebp), %xmm4, %xmm4
+; X86-AVX1-NEXT: vpmaxsd %xmm4, %xmm3, %xmm3
+; X86-AVX1-NEXT: vpmaxsd %xmm2, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpmaxsd 8(%ebp), %xmm1, %xmm1
+; X86-AVX1-NEXT: vpmaxsd %xmm1, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpmaxsd %xmm3, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-AVX1-NEXT: vpmaxsd %xmm1, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; X86-AVX1-NEXT: vpmaxsd %xmm1, %xmm0, %xmm0
+; X86-AVX1-NEXT: vmovd %xmm0, %eax
+; X86-AVX1-NEXT: movl %ebp, %esp
+; X86-AVX1-NEXT: popl %ebp
+; X86-AVX1-NEXT: vzeroupper
+; X86-AVX1-NEXT: retl
+;
+; X64-AVX1-LABEL: test_v32i32:
+; X64-AVX1: # %bb.0:
+; X64-AVX1-NEXT: vextractf128 $1, %ymm3, %xmm4
+; X64-AVX1-NEXT: vextractf128 $1, %ymm1, %xmm5
+; X64-AVX1-NEXT: vpmaxsd %xmm4, %xmm5, %xmm4
+; X64-AVX1-NEXT: vextractf128 $1, %ymm2, %xmm5
+; X64-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm6
+; X64-AVX1-NEXT: vpmaxsd %xmm5, %xmm6, %xmm5
+; X64-AVX1-NEXT: vpmaxsd %xmm4, %xmm5, %xmm4
+; X64-AVX1-NEXT: vpmaxsd %xmm3, %xmm1, %xmm1
+; X64-AVX1-NEXT: vpmaxsd %xmm2, %xmm0, %xmm0
+; X64-AVX1-NEXT: vpmaxsd %xmm1, %xmm0, %xmm0
+; X64-AVX1-NEXT: vpmaxsd %xmm4, %xmm0, %xmm0
+; X64-AVX1-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X64-AVX1-NEXT: vpmaxsd %xmm1, %xmm0, %xmm0
+; X64-AVX1-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; X64-AVX1-NEXT: vpmaxsd %xmm1, %xmm0, %xmm0
+; X64-AVX1-NEXT: vmovd %xmm0, %eax
+; X64-AVX1-NEXT: vzeroupper
+; X64-AVX1-NEXT: retq
+;
+; X86-AVX2-LABEL: test_v32i32:
+; X86-AVX2: # %bb.0:
+; X86-AVX2-NEXT: pushl %ebp
+; X86-AVX2-NEXT: movl %esp, %ebp
+; X86-AVX2-NEXT: andl $-32, %esp
+; X86-AVX2-NEXT: subl $32, %esp
+; X86-AVX2-NEXT: vpmaxsd %ymm2, %ymm0, %ymm0
+; X86-AVX2-NEXT: vpmaxsd 8(%ebp), %ymm1, %ymm1
+; X86-AVX2-NEXT: vpmaxsd %ymm1, %ymm0, %ymm0
+; X86-AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
+; X86-AVX2-NEXT: vpmaxsd %xmm1, %xmm0, %xmm0
+; X86-AVX2-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-AVX2-NEXT: vpmaxsd %xmm1, %xmm0, %xmm0
+; X86-AVX2-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; X86-AVX2-NEXT: vpmaxsd %xmm1, %xmm0, %xmm0
+; X86-AVX2-NEXT: vmovd %xmm0, %eax
+; X86-AVX2-NEXT: movl %ebp, %esp
+; X86-AVX2-NEXT: popl %ebp
+; X86-AVX2-NEXT: vzeroupper
+; X86-AVX2-NEXT: retl
+;
+; X64-AVX2-LABEL: test_v32i32:
+; X64-AVX2: # %bb.0:
+; X64-AVX2-NEXT: vpmaxsd %ymm3, %ymm1, %ymm1
+; X64-AVX2-NEXT: vpmaxsd %ymm2, %ymm0, %ymm0
+; X64-AVX2-NEXT: vpmaxsd %ymm1, %ymm0, %ymm0
+; X64-AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
+; X64-AVX2-NEXT: vpmaxsd %xmm1, %xmm0, %xmm0
+; X64-AVX2-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X64-AVX2-NEXT: vpmaxsd %xmm1, %xmm0, %xmm0
+; X64-AVX2-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; X64-AVX2-NEXT: vpmaxsd %xmm1, %xmm0, %xmm0
+; X64-AVX2-NEXT: vmovd %xmm0, %eax
+; X64-AVX2-NEXT: vzeroupper
+; X64-AVX2-NEXT: retq
;
; AVX512-LABEL: test_v32i32:
; AVX512: # %bb.0:
@@ -1086,7 +2011,7 @@ define i32 @test_v32i32(<32 x i32> %a0) {
; vXi16
;
-define i16 @test_v2i16(<2 x i16> %a0) {
+define i16 @test_v2i16(<2 x i16> %a0) nounwind {
; SSE-LABEL: test_v2i16:
; SSE: # %bb.0:
; SSE-NEXT: movdqa %xmm0, %xmm1
@@ -1094,7 +2019,7 @@ define i16 @test_v2i16(<2 x i16> %a0) {
; SSE-NEXT: pmaxsw %xmm0, %xmm1
; SSE-NEXT: movd %xmm1, %eax
; SSE-NEXT: # kill: def $ax killed $ax killed $eax
-; SSE-NEXT: retq
+; SSE-NEXT: ret{{[l|q]}}
;
; AVX-LABEL: test_v2i16:
; AVX: # %bb.0:
@@ -1102,20 +2027,12 @@ define i16 @test_v2i16(<2 x i16> %a0) {
; AVX-NEXT: vpmaxsw %xmm1, %xmm0, %xmm0
; AVX-NEXT: vmovd %xmm0, %eax
; AVX-NEXT: # kill: def $ax killed $ax killed $eax
-; AVX-NEXT: retq
-;
-; AVX512-LABEL: test_v2i16:
-; AVX512: # %bb.0:
-; AVX512-NEXT: vpsrld $16, %xmm0, %xmm1
-; AVX512-NEXT: vpmaxsw %xmm1, %xmm0, %xmm0
-; AVX512-NEXT: vmovd %xmm0, %eax
-; AVX512-NEXT: # kill: def $ax killed $ax killed $eax
-; AVX512-NEXT: retq
+; AVX-NEXT: ret{{[l|q]}}
%1 = call i16 @llvm.vector.reduce.smax.v2i16(<2 x i16> %a0)
ret i16 %1
}
-define i16 @test_v4i16(<4 x i16> %a0) {
+define i16 @test_v4i16(<4 x i16> %a0) nounwind {
; SSE-LABEL: test_v4i16:
; SSE: # %bb.0:
; SSE-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
@@ -1125,7 +2042,7 @@ define i16 @test_v4i16(<4 x i16> %a0) {
; SSE-NEXT: pmaxsw %xmm1, %xmm0
; SSE-NEXT: movd %xmm0, %eax
; SSE-NEXT: # kill: def $ax killed $ax killed $eax
-; SSE-NEXT: retq
+; SSE-NEXT: ret{{[l|q]}}
;
; AVX-LABEL: test_v4i16:
; AVX: # %bb.0:
@@ -1135,22 +2052,12 @@ define i16 @test_v4i16(<4 x i16> %a0) {
; AVX-NEXT: vpmaxsw %xmm1, %xmm0, %xmm0
; AVX-NEXT: vmovd %xmm0, %eax
; AVX-NEXT: # kill: def $ax killed $ax killed $eax
-; AVX-NEXT: retq
-;
-; AVX512-LABEL: test_v4i16:
-; AVX512: # %bb.0:
-; AVX512-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
-; AVX512-NEXT: vpmaxsw %xmm1, %xmm0, %xmm0
-; AVX512-NEXT: vpsrld $16, %xmm0, %xmm1
-; AVX512-NEXT: vpmaxsw %xmm1, %xmm0, %xmm0
-; AVX512-NEXT: vmovd %xmm0, %eax
-; AVX512-NEXT: # kill: def $ax killed $ax killed $eax
-; AVX512-NEXT: retq
+; AVX-NEXT: ret{{[l|q]}}
%1 = call i16 @llvm.vector.reduce.smax.v4i16(<4 x i16> %a0)
ret i16 %1
}
-define i16 @test_v8i16(<8 x i16> %a0) {
+define i16 @test_v8i16(<8 x i16> %a0) nounwind {
; SSE2-LABEL: test_v8i16:
; SSE2: # %bb.0:
; SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
@@ -1162,25 +2069,43 @@ define i16 @test_v8i16(<8 x i16> %a0) {
; SSE2-NEXT: pmaxsw %xmm0, %xmm1
; SSE2-NEXT: movd %xmm1, %eax
; SSE2-NEXT: # kill: def $ax killed $ax killed $eax
-; SSE2-NEXT: retq
-;
-; SSE4-LABEL: test_v8i16:
-; SSE4: # %bb.0:
-; SSE4-NEXT: pxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0
-; SSE4-NEXT: phminposuw %xmm0, %xmm0
-; SSE4-NEXT: movd %xmm0, %eax
-; SSE4-NEXT: xorl $32767, %eax # imm = 0x7FFF
-; SSE4-NEXT: # kill: def $ax killed $ax killed $eax
-; SSE4-NEXT: retq
-;
-; AVX-LABEL: test_v8i16:
-; AVX: # %bb.0:
-; AVX-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
-; AVX-NEXT: vphminposuw %xmm0, %xmm0
-; AVX-NEXT: vmovd %xmm0, %eax
-; AVX-NEXT: xorl $32767, %eax # imm = 0x7FFF
-; AVX-NEXT: # kill: def $ax killed $ax killed $eax
-; AVX-NEXT: retq
+; SSE2-NEXT: ret{{[l|q]}}
+;
+; X86-SSE4-LABEL: test_v8i16:
+; X86-SSE4: # %bb.0:
+; X86-SSE4-NEXT: pxor {{\.?LCPI[0-9]+_[0-9]+}}, %xmm0
+; X86-SSE4-NEXT: phminposuw %xmm0, %xmm0
+; X86-SSE4-NEXT: movd %xmm0, %eax
+; X86-SSE4-NEXT: xorl $32767, %eax # imm = 0x7FFF
+; X86-SSE4-NEXT: # kill: def $ax killed $ax killed $eax
+; X86-SSE4-NEXT: retl
+;
+; X64-SSE4-LABEL: test_v8i16:
+; X64-SSE4: # %bb.0:
+; X64-SSE4-NEXT: pxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0
+; X64-SSE4-NEXT: phminposuw %xmm0, %xmm0
+; X64-SSE4-NEXT: movd %xmm0, %eax
+; X64-SSE4-NEXT: xorl $32767, %eax # imm = 0x7FFF
+; X64-SSE4-NEXT: # kill: def $ax killed $ax killed $eax
+; X64-SSE4-NEXT: retq
+;
+; X86-AVX-LABEL: test_v8i16:
+; X86-AVX: # %bb.0:
+; X86-AVX-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}, %xmm0, %xmm0
+; X86-AVX-NEXT: vphminposuw %xmm0, %xmm0
+; X86-AVX-NEXT: vmovd %xmm0, %eax
+; X86-AVX-NEXT: xorl $32767, %eax # imm = 0x7FFF
+; X86-AVX-NEXT: # kill: def $ax killed $ax killed $eax
+; X86-AVX-NEXT: retl
+;
+; X64-AVX-LABEL: test_v8i16:
+; X64-AVX: # %bb.0:
+; X64-AVX-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
+; X64-AVX-NEXT: vphminposuw %xmm0, %xmm0
+; X64-AVX-NEXT: vmovd %xmm0, %eax
+; X64-AVX-NEXT: xorl $32767, %eax # imm = 0x7FFF
+; X64-AVX-NEXT: # kill: def $ax killed $ax killed $eax
+; X64-AVX-NEXT: retq
;
; AVX512BW-LABEL: test_v8i16:
; AVX512BW: # %bb.0:
@@ -1203,7 +2128,7 @@ define i16 @test_v8i16(<8 x i16> %a0) {
ret i16 %1
}
-define i16 @test_v16i16(<16 x i16> %a0) {
+define i16 @test_v16i16(<16 x i16> %a0) nounwind {
; SSE2-LABEL: test_v16i16:
; SSE2: # %bb.0:
; SSE2-NEXT: pmaxsw %xmm1, %xmm0
@@ -1216,41 +2141,75 @@ define i16 @test_v16i16(<16 x i16> %a0) {
; SSE2-NEXT: pmaxsw %xmm0, %xmm1
; SSE2-NEXT: movd %xmm1, %eax
; SSE2-NEXT: # kill: def $ax killed $ax killed $eax
-; SSE2-NEXT: retq
-;
-; SSE4-LABEL: test_v16i16:
-; SSE4: # %bb.0:
-; SSE4-NEXT: pmaxsw %xmm1, %xmm0
-; SSE4-NEXT: pxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0
-; SSE4-NEXT: phminposuw %xmm0, %xmm0
-; SSE4-NEXT: movd %xmm0, %eax
-; SSE4-NEXT: xorl $32767, %eax # imm = 0x7FFF
-; SSE4-NEXT: # kill: def $ax killed $ax killed $eax
-; SSE4-NEXT: retq
-;
-; AVX1-LABEL: test_v16i16:
-; AVX1: # %bb.0:
-; AVX1-NEXT: vextractf128 $1, %ymm0, %xmm1
-; AVX1-NEXT: vpmaxsw %xmm1, %xmm0, %xmm0
-; AVX1-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
-; AVX1-NEXT: vphminposuw %xmm0, %xmm0
-; AVX1-NEXT: vmovd %xmm0, %eax
-; AVX1-NEXT: xorl $32767, %eax # imm = 0x7FFF
-; AVX1-NEXT: # kill: def $ax killed $ax killed $eax
-; AVX1-NEXT: vzeroupper
-; AVX1-NEXT: retq
-;
-; AVX2-LABEL: test_v16i16:
-; AVX2: # %bb.0:
-; AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
-; AVX2-NEXT: vpmaxsw %xmm1, %xmm0, %xmm0
-; AVX2-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
-; AVX2-NEXT: vphminposuw %xmm0, %xmm0
-; AVX2-NEXT: vmovd %xmm0, %eax
-; AVX2-NEXT: xorl $32767, %eax # imm = 0x7FFF
-; AVX2-NEXT: # kill: def $ax killed $ax killed $eax
-; AVX2-NEXT: vzeroupper
-; AVX2-NEXT: retq
+; SSE2-NEXT: ret{{[l|q]}}
+;
+; X86-SSE4-LABEL: test_v16i16:
+; X86-SSE4: # %bb.0:
+; X86-SSE4-NEXT: pmaxsw %xmm1, %xmm0
+; X86-SSE4-NEXT: pxor {{\.?LCPI[0-9]+_[0-9]+}}, %xmm0
+; X86-SSE4-NEXT: phminposuw %xmm0, %xmm0
+; X86-SSE4-NEXT: movd %xmm0, %eax
+; X86-SSE4-NEXT: xorl $32767, %eax # imm = 0x7FFF
+; X86-SSE4-NEXT: # kill: def $ax killed $ax killed $eax
+; X86-SSE4-NEXT: retl
+;
+; X64-SSE4-LABEL: test_v16i16:
+; X64-SSE4: # %bb.0:
+; X64-SSE4-NEXT: pmaxsw %xmm1, %xmm0
+; X64-SSE4-NEXT: pxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0
+; X64-SSE4-NEXT: phminposuw %xmm0, %xmm0
+; X64-SSE4-NEXT: movd %xmm0, %eax
+; X64-SSE4-NEXT: xorl $32767, %eax # imm = 0x7FFF
+; X64-SSE4-NEXT: # kill: def $ax killed $ax killed $eax
+; X64-SSE4-NEXT: retq
+;
+; X86-AVX1-LABEL: test_v16i16:
+; X86-AVX1: # %bb.0:
+; X86-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm1
+; X86-AVX1-NEXT: vpmaxsw %xmm1, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}, %xmm0, %xmm0
+; X86-AVX1-NEXT: vphminposuw %xmm0, %xmm0
+; X86-AVX1-NEXT: vmovd %xmm0, %eax
+; X86-AVX1-NEXT: xorl $32767, %eax # imm = 0x7FFF
+; X86-AVX1-NEXT: # kill: def $ax killed $ax killed $eax
+; X86-AVX1-NEXT: vzeroupper
+; X86-AVX1-NEXT: retl
+;
+; X64-AVX1-LABEL: test_v16i16:
+; X64-AVX1: # %bb.0:
+; X64-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm1
+; X64-AVX1-NEXT: vpmaxsw %xmm1, %xmm0, %xmm0
+; X64-AVX1-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
+; X64-AVX1-NEXT: vphminposuw %xmm0, %xmm0
+; X64-AVX1-NEXT: vmovd %xmm0, %eax
+; X64-AVX1-NEXT: xorl $32767, %eax # imm = 0x7FFF
+; X64-AVX1-NEXT: # kill: def $ax killed $ax killed $eax
+; X64-AVX1-NEXT: vzeroupper
+; X64-AVX1-NEXT: retq
+;
+; X86-AVX2-LABEL: test_v16i16:
+; X86-AVX2: # %bb.0:
+; X86-AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
+; X86-AVX2-NEXT: vpmaxsw %xmm1, %xmm0, %xmm0
+; X86-AVX2-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}, %xmm0, %xmm0
+; X86-AVX2-NEXT: vphminposuw %xmm0, %xmm0
+; X86-AVX2-NEXT: vmovd %xmm0, %eax
+; X86-AVX2-NEXT: xorl $32767, %eax # imm = 0x7FFF
+; X86-AVX2-NEXT: # kill: def $ax killed $ax killed $eax
+; X86-AVX2-NEXT: vzeroupper
+; X86-AVX2-NEXT: retl
+;
+; X64-AVX2-LABEL: test_v16i16:
+; X64-AVX2: # %bb.0:
+; X64-AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
+; X64-AVX2-NEXT: vpmaxsw %xmm1, %xmm0, %xmm0
+; X64-AVX2-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
+; X64-AVX2-NEXT: vphminposuw %xmm0, %xmm0
+; X64-AVX2-NEXT: vmovd %xmm0, %eax
+; X64-AVX2-NEXT: xorl $32767, %eax # imm = 0x7FFF
+; X64-AVX2-NEXT: # kill: def $ax killed $ax killed $eax
+; X64-AVX2-NEXT: vzeroupper
+; X64-AVX2-NEXT: retq
;
; AVX512BW-LABEL: test_v16i16:
; AVX512BW: # %bb.0:
@@ -1279,62 +2238,130 @@ define i16 @test_v16i16(<16 x i16> %a0) {
ret i16 %1
}
-define i16 @test_v32i16(<32 x i16> %a0) {
-; SSE2-LABEL: test_v32i16:
-; SSE2: # %bb.0:
-; SSE2-NEXT: pmaxsw %xmm3, %xmm1
-; SSE2-NEXT: pmaxsw %xmm2, %xmm0
-; SSE2-NEXT: pmaxsw %xmm1, %xmm0
-; SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
-; SSE2-NEXT: pmaxsw %xmm0, %xmm1
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
-; SSE2-NEXT: pmaxsw %xmm1, %xmm0
-; SSE2-NEXT: movdqa %xmm0, %xmm1
-; SSE2-NEXT: psrld $16, %xmm1
-; SSE2-NEXT: pmaxsw %xmm0, %xmm1
-; SSE2-NEXT: movd %xmm1, %eax
-; SSE2-NEXT: # kill: def $ax killed $ax killed $eax
-; SSE2-NEXT: retq
-;
-; SSE4-LABEL: test_v32i16:
-; SSE4: # %bb.0:
-; SSE4-NEXT: pmaxsw %xmm3, %xmm1
-; SSE4-NEXT: pmaxsw %xmm2, %xmm0
-; SSE4-NEXT: pmaxsw %xmm1, %xmm0
-; SSE4-NEXT: pxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0
-; SSE4-NEXT: phminposuw %xmm0, %xmm0
-; SSE4-NEXT: movd %xmm0, %eax
-; SSE4-NEXT: xorl $32767, %eax # imm = 0x7FFF
-; SSE4-NEXT: # kill: def $ax killed $ax killed $eax
-; SSE4-NEXT: retq
-;
-; AVX1-LABEL: test_v32i16:
-; AVX1: # %bb.0:
-; AVX1-NEXT: vextractf128 $1, %ymm1, %xmm2
-; AVX1-NEXT: vextractf128 $1, %ymm0, %xmm3
-; AVX1-NEXT: vpmaxsw %xmm2, %xmm3, %xmm2
-; AVX1-NEXT: vpmaxsw %xmm1, %xmm0, %xmm0
-; AVX1-NEXT: vpmaxsw %xmm2, %xmm0, %xmm0
-; AVX1-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
-; AVX1-NEXT: vphminposuw %xmm0, %xmm0
-; AVX1-NEXT: vmovd %xmm0, %eax
-; AVX1-NEXT: xorl $32767, %eax # imm = 0x7FFF
-; AVX1-NEXT: # kill: def $ax killed $ax killed $eax
-; AVX1-NEXT: vzeroupper
-; AVX1-NEXT: retq
-;
-; AVX2-LABEL: test_v32i16:
-; AVX2: # %bb.0:
-; AVX2-NEXT: vpmaxsw %ymm1, %ymm0, %ymm0
-; AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
-; AVX2-NEXT: vpmaxsw %xmm1, %xmm0, %xmm0
-; AVX2-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
-; AVX2-NEXT: vphminposuw %xmm0, %xmm0
-; AVX2-NEXT: vmovd %xmm0, %eax
-; AVX2-NEXT: xorl $32767, %eax # imm = 0x7FFF
-; AVX2-NEXT: # kill: def $ax killed $ax killed $eax
-; AVX2-NEXT: vzeroupper
-; AVX2-NEXT: retq
+define i16 @test_v32i16(<32 x i16> %a0) nounwind {
+; X86-SSE2-LABEL: test_v32i16:
+; X86-SSE2: # %bb.0:
+; X86-SSE2-NEXT: pushl %ebp
+; X86-SSE2-NEXT: movl %esp, %ebp
+; X86-SSE2-NEXT: andl $-16, %esp
+; X86-SSE2-NEXT: subl $16, %esp
+; X86-SSE2-NEXT: pmaxsw %xmm2, %xmm0
+; X86-SSE2-NEXT: pmaxsw 8(%ebp), %xmm1
+; X86-SSE2-NEXT: pmaxsw %xmm0, %xmm1
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
+; X86-SSE2-NEXT: pmaxsw %xmm1, %xmm0
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; X86-SSE2-NEXT: pmaxsw %xmm0, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE2-NEXT: psrld $16, %xmm0
+; X86-SSE2-NEXT: pmaxsw %xmm1, %xmm0
+; X86-SSE2-NEXT: movd %xmm0, %eax
+; X86-SSE2-NEXT: # kill: def $ax killed $ax killed $eax
+; X86-SSE2-NEXT: movl %ebp, %esp
+; X86-SSE2-NEXT: popl %ebp
+; X86-SSE2-NEXT: retl
+;
+; X64-SSE2-LABEL: test_v32i16:
+; X64-SSE2: # %bb.0:
+; X64-SSE2-NEXT: pmaxsw %xmm3, %xmm1
+; X64-SSE2-NEXT: pmaxsw %xmm2, %xmm0
+; X64-SSE2-NEXT: pmaxsw %xmm1, %xmm0
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X64-SSE2-NEXT: pmaxsw %xmm0, %xmm1
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
+; X64-SSE2-NEXT: pmaxsw %xmm1, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X64-SSE2-NEXT: psrld $16, %xmm1
+; X64-SSE2-NEXT: pmaxsw %xmm0, %xmm1
+; X64-SSE2-NEXT: movd %xmm1, %eax
+; X64-SSE2-NEXT: # kill: def $ax killed $ax killed $eax
+; X64-SSE2-NEXT: retq
+;
+; X86-SSE4-LABEL: test_v32i16:
+; X86-SSE4: # %bb.0:
+; X86-SSE4-NEXT: pushl %ebp
+; X86-SSE4-NEXT: movl %esp, %ebp
+; X86-SSE4-NEXT: andl $-16, %esp
+; X86-SSE4-NEXT: subl $16, %esp
+; X86-SSE4-NEXT: pmaxsw %xmm2, %xmm0
+; X86-SSE4-NEXT: pmaxsw 8(%ebp), %xmm1
+; X86-SSE4-NEXT: pmaxsw %xmm0, %xmm1
+; X86-SSE4-NEXT: pxor {{\.?LCPI[0-9]+_[0-9]+}}, %xmm1
+; X86-SSE4-NEXT: phminposuw %xmm1, %xmm0
+; X86-SSE4-NEXT: movd %xmm0, %eax
+; X86-SSE4-NEXT: xorl $32767, %eax # imm = 0x7FFF
+; X86-SSE4-NEXT: # kill: def $ax killed $ax killed $eax
+; X86-SSE4-NEXT: movl %ebp, %esp
+; X86-SSE4-NEXT: popl %ebp
+; X86-SSE4-NEXT: retl
+;
+; X64-SSE4-LABEL: test_v32i16:
+; X64-SSE4: # %bb.0:
+; X64-SSE4-NEXT: pmaxsw %xmm3, %xmm1
+; X64-SSE4-NEXT: pmaxsw %xmm2, %xmm0
+; X64-SSE4-NEXT: pmaxsw %xmm1, %xmm0
+; X64-SSE4-NEXT: pxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0
+; X64-SSE4-NEXT: phminposuw %xmm0, %xmm0
+; X64-SSE4-NEXT: movd %xmm0, %eax
+; X64-SSE4-NEXT: xorl $32767, %eax # imm = 0x7FFF
+; X64-SSE4-NEXT: # kill: def $ax killed $ax killed $eax
+; X64-SSE4-NEXT: retq
+;
+; X86-AVX1-LABEL: test_v32i16:
+; X86-AVX1: # %bb.0:
+; X86-AVX1-NEXT: vextractf128 $1, %ymm1, %xmm2
+; X86-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm3
+; X86-AVX1-NEXT: vpmaxsw %xmm2, %xmm3, %xmm2
+; X86-AVX1-NEXT: vpmaxsw %xmm1, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpmaxsw %xmm2, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}, %xmm0, %xmm0
+; X86-AVX1-NEXT: vphminposuw %xmm0, %xmm0
+; X86-AVX1-NEXT: vmovd %xmm0, %eax
+; X86-AVX1-NEXT: xorl $32767, %eax # imm = 0x7FFF
+; X86-AVX1-NEXT: # kill: def $ax killed $ax killed $eax
+; X86-AVX1-NEXT: vzeroupper
+; X86-AVX1-NEXT: retl
+;
+; X64-AVX1-LABEL: test_v32i16:
+; X64-AVX1: # %bb.0:
+; X64-AVX1-NEXT: vextractf128 $1, %ymm1, %xmm2
+; X64-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm3
+; X64-AVX1-NEXT: vpmaxsw %xmm2, %xmm3, %xmm2
+; X64-AVX1-NEXT: vpmaxsw %xmm1, %xmm0, %xmm0
+; X64-AVX1-NEXT: vpmaxsw %xmm2, %xmm0, %xmm0
+; X64-AVX1-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
+; X64-AVX1-NEXT: vphminposuw %xmm0, %xmm0
+; X64-AVX1-NEXT: vmovd %xmm0, %eax
+; X64-AVX1-NEXT: xorl $32767, %eax # imm = 0x7FFF
+; X64-AVX1-NEXT: # kill: def $ax killed $ax killed $eax
+; X64-AVX1-NEXT: vzeroupper
+; X64-AVX1-NEXT: retq
+;
+; X86-AVX2-LABEL: test_v32i16:
+; X86-AVX2: # %bb.0:
+; X86-AVX2-NEXT: vpmaxsw %ymm1, %ymm0, %ymm0
+; X86-AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
+; X86-AVX2-NEXT: vpmaxsw %xmm1, %xmm0, %xmm0
+; X86-AVX2-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}, %xmm0, %xmm0
+; X86-AVX2-NEXT: vphminposuw %xmm0, %xmm0
+; X86-AVX2-NEXT: vmovd %xmm0, %eax
+; X86-AVX2-NEXT: xorl $32767, %eax # imm = 0x7FFF
+; X86-AVX2-NEXT: # kill: def $ax killed $ax killed $eax
+; X86-AVX2-NEXT: vzeroupper
+; X86-AVX2-NEXT: retl
+;
+; X64-AVX2-LABEL: test_v32i16:
+; X64-AVX2: # %bb.0:
+; X64-AVX2-NEXT: vpmaxsw %ymm1, %ymm0, %ymm0
+; X64-AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
+; X64-AVX2-NEXT: vpmaxsw %xmm1, %xmm0, %xmm0
+; X64-AVX2-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
+; X64-AVX2-NEXT: vphminposuw %xmm0, %xmm0
+; X64-AVX2-NEXT: vmovd %xmm0, %eax
+; X64-AVX2-NEXT: xorl $32767, %eax # imm = 0x7FFF
+; X64-AVX2-NEXT: # kill: def $ax killed $ax killed $eax
+; X64-AVX2-NEXT: vzeroupper
+; X64-AVX2-NEXT: retq
;
; AVX512BW-LABEL: test_v32i16:
; AVX512BW: # %bb.0:
@@ -1367,78 +2394,175 @@ define i16 @test_v32i16(<32 x i16> %a0) {
ret i16 %1
}
-define i16 @test_v64i16(<64 x i16> %a0) {
-; SSE2-LABEL: test_v64i16:
-; SSE2: # %bb.0:
-; SSE2-NEXT: pmaxsw %xmm7, %xmm3
-; SSE2-NEXT: pmaxsw %xmm5, %xmm1
-; SSE2-NEXT: pmaxsw %xmm3, %xmm1
-; SSE2-NEXT: pmaxsw %xmm6, %xmm2
-; SSE2-NEXT: pmaxsw %xmm4, %xmm0
-; SSE2-NEXT: pmaxsw %xmm2, %xmm0
-; SSE2-NEXT: pmaxsw %xmm1, %xmm0
-; SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
-; SSE2-NEXT: pmaxsw %xmm0, %xmm1
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
-; SSE2-NEXT: pmaxsw %xmm1, %xmm0
-; SSE2-NEXT: movdqa %xmm0, %xmm1
-; SSE2-NEXT: psrld $16, %xmm1
-; SSE2-NEXT: pmaxsw %xmm0, %xmm1
-; SSE2-NEXT: movd %xmm1, %eax
-; SSE2-NEXT: # kill: def $ax killed $ax killed $eax
-; SSE2-NEXT: retq
-;
-; SSE4-LABEL: test_v64i16:
-; SSE4: # %bb.0:
-; SSE4-NEXT: pmaxsw %xmm7, %xmm3
-; SSE4-NEXT: pmaxsw %xmm5, %xmm1
-; SSE4-NEXT: pmaxsw %xmm3, %xmm1
-; SSE4-NEXT: pmaxsw %xmm6, %xmm2
-; SSE4-NEXT: pmaxsw %xmm4, %xmm0
-; SSE4-NEXT: pmaxsw %xmm2, %xmm0
-; SSE4-NEXT: pmaxsw %xmm1, %xmm0
-; SSE4-NEXT: pxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0
-; SSE4-NEXT: phminposuw %xmm0, %xmm0
-; SSE4-NEXT: movd %xmm0, %eax
-; SSE4-NEXT: xorl $32767, %eax # imm = 0x7FFF
-; SSE4-NEXT: # kill: def $ax killed $ax killed $eax
-; SSE4-NEXT: retq
-;
-; AVX1-LABEL: test_v64i16:
-; AVX1: # %bb.0:
-; AVX1-NEXT: vextractf128 $1, %ymm3, %xmm4
-; AVX1-NEXT: vextractf128 $1, %ymm1, %xmm5
-; AVX1-NEXT: vpmaxsw %xmm4, %xmm5, %xmm4
-; AVX1-NEXT: vextractf128 $1, %ymm2, %xmm5
-; AVX1-NEXT: vextractf128 $1, %ymm0, %xmm6
-; AVX1-NEXT: vpmaxsw %xmm5, %xmm6, %xmm5
-; AVX1-NEXT: vpmaxsw %xmm4, %xmm5, %xmm4
-; AVX1-NEXT: vpmaxsw %xmm3, %xmm1, %xmm1
-; AVX1-NEXT: vpmaxsw %xmm2, %xmm0, %xmm0
-; AVX1-NEXT: vpmaxsw %xmm1, %xmm0, %xmm0
-; AVX1-NEXT: vpmaxsw %xmm4, %xmm0, %xmm0
-; AVX1-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
-; AVX1-NEXT: vphminposuw %xmm0, %xmm0
-; AVX1-NEXT: vmovd %xmm0, %eax
-; AVX1-NEXT: xorl $32767, %eax # imm = 0x7FFF
-; AVX1-NEXT: # kill: def $ax killed $ax killed $eax
-; AVX1-NEXT: vzeroupper
-; AVX1-NEXT: retq
-;
-; AVX2-LABEL: test_v64i16:
-; AVX2: # %bb.0:
-; AVX2-NEXT: vpmaxsw %ymm3, %ymm1, %ymm1
-; AVX2-NEXT: vpmaxsw %ymm2, %ymm0, %ymm0
-; AVX2-NEXT: vpmaxsw %ymm1, %ymm0, %ymm0
-; AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
-; AVX2-NEXT: vpmaxsw %xmm1, %xmm0, %xmm0
-; AVX2-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
-; AVX2-NEXT: vphminposuw %xmm0, %xmm0
-; AVX2-NEXT: vmovd %xmm0, %eax
-; AVX2-NEXT: xorl $32767, %eax # imm = 0x7FFF
-; AVX2-NEXT: # kill: def $ax killed $ax killed $eax
-; AVX2-NEXT: vzeroupper
-; AVX2-NEXT: retq
+define i16 @test_v64i16(<64 x i16> %a0) nounwind {
+; X86-SSE2-LABEL: test_v64i16:
+; X86-SSE2: # %bb.0:
+; X86-SSE2-NEXT: pushl %ebp
+; X86-SSE2-NEXT: movl %esp, %ebp
+; X86-SSE2-NEXT: andl $-16, %esp
+; X86-SSE2-NEXT: subl $16, %esp
+; X86-SSE2-NEXT: movdqa 8(%ebp), %xmm3
+; X86-SSE2-NEXT: pmaxsw 72(%ebp), %xmm3
+; X86-SSE2-NEXT: pmaxsw 40(%ebp), %xmm1
+; X86-SSE2-NEXT: pmaxsw %xmm3, %xmm1
+; X86-SSE2-NEXT: pmaxsw 56(%ebp), %xmm2
+; X86-SSE2-NEXT: pmaxsw 24(%ebp), %xmm0
+; X86-SSE2-NEXT: pmaxsw %xmm2, %xmm0
+; X86-SSE2-NEXT: pmaxsw %xmm1, %xmm0
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-SSE2-NEXT: pmaxsw %xmm0, %xmm1
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
+; X86-SSE2-NEXT: pmaxsw %xmm1, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X86-SSE2-NEXT: psrld $16, %xmm1
+; X86-SSE2-NEXT: pmaxsw %xmm0, %xmm1
+; X86-SSE2-NEXT: movd %xmm1, %eax
+; X86-SSE2-NEXT: # kill: def $ax killed $ax killed $eax
+; X86-SSE2-NEXT: movl %ebp, %esp
+; X86-SSE2-NEXT: popl %ebp
+; X86-SSE2-NEXT: retl
+;
+; X64-SSE2-LABEL: test_v64i16:
+; X64-SSE2: # %bb.0:
+; X64-SSE2-NEXT: pmaxsw %xmm7, %xmm3
+; X64-SSE2-NEXT: pmaxsw %xmm5, %xmm1
+; X64-SSE2-NEXT: pmaxsw %xmm3, %xmm1
+; X64-SSE2-NEXT: pmaxsw %xmm6, %xmm2
+; X64-SSE2-NEXT: pmaxsw %xmm4, %xmm0
+; X64-SSE2-NEXT: pmaxsw %xmm2, %xmm0
+; X64-SSE2-NEXT: pmaxsw %xmm1, %xmm0
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X64-SSE2-NEXT: pmaxsw %xmm0, %xmm1
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
+; X64-SSE2-NEXT: pmaxsw %xmm1, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X64-SSE2-NEXT: psrld $16, %xmm1
+; X64-SSE2-NEXT: pmaxsw %xmm0, %xmm1
+; X64-SSE2-NEXT: movd %xmm1, %eax
+; X64-SSE2-NEXT: # kill: def $ax killed $ax killed $eax
+; X64-SSE2-NEXT: retq
+;
+; X86-SSE4-LABEL: test_v64i16:
+; X86-SSE4: # %bb.0:
+; X86-SSE4-NEXT: pushl %ebp
+; X86-SSE4-NEXT: movl %esp, %ebp
+; X86-SSE4-NEXT: andl $-16, %esp
+; X86-SSE4-NEXT: subl $16, %esp
+; X86-SSE4-NEXT: movdqa 8(%ebp), %xmm3
+; X86-SSE4-NEXT: pmaxsw 72(%ebp), %xmm3
+; X86-SSE4-NEXT: pmaxsw 40(%ebp), %xmm1
+; X86-SSE4-NEXT: pmaxsw %xmm3, %xmm1
+; X86-SSE4-NEXT: pmaxsw 56(%ebp), %xmm2
+; X86-SSE4-NEXT: pmaxsw 24(%ebp), %xmm0
+; X86-SSE4-NEXT: pmaxsw %xmm2, %xmm0
+; X86-SSE4-NEXT: pmaxsw %xmm1, %xmm0
+; X86-SSE4-NEXT: pxor {{\.?LCPI[0-9]+_[0-9]+}}, %xmm0
+; X86-SSE4-NEXT: phminposuw %xmm0, %xmm0
+; X86-SSE4-NEXT: movd %xmm0, %eax
+; X86-SSE4-NEXT: xorl $32767, %eax # imm = 0x7FFF
+; X86-SSE4-NEXT: # kill: def $ax killed $ax killed $eax
+; X86-SSE4-NEXT: movl %ebp, %esp
+; X86-SSE4-NEXT: popl %ebp
+; X86-SSE4-NEXT: retl
+;
+; X64-SSE4-LABEL: test_v64i16:
+; X64-SSE4: # %bb.0:
+; X64-SSE4-NEXT: pmaxsw %xmm7, %xmm3
+; X64-SSE4-NEXT: pmaxsw %xmm5, %xmm1
+; X64-SSE4-NEXT: pmaxsw %xmm3, %xmm1
+; X64-SSE4-NEXT: pmaxsw %xmm6, %xmm2
+; X64-SSE4-NEXT: pmaxsw %xmm4, %xmm0
+; X64-SSE4-NEXT: pmaxsw %xmm2, %xmm0
+; X64-SSE4-NEXT: pmaxsw %xmm1, %xmm0
+; X64-SSE4-NEXT: pxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0
+; X64-SSE4-NEXT: phminposuw %xmm0, %xmm0
+; X64-SSE4-NEXT: movd %xmm0, %eax
+; X64-SSE4-NEXT: xorl $32767, %eax # imm = 0x7FFF
+; X64-SSE4-NEXT: # kill: def $ax killed $ax killed $eax
+; X64-SSE4-NEXT: retq
+;
+; X86-AVX1-LABEL: test_v64i16:
+; X86-AVX1: # %bb.0:
+; X86-AVX1-NEXT: pushl %ebp
+; X86-AVX1-NEXT: movl %esp, %ebp
+; X86-AVX1-NEXT: andl $-32, %esp
+; X86-AVX1-NEXT: subl $32, %esp
+; X86-AVX1-NEXT: vextractf128 $1, %ymm2, %xmm3
+; X86-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm4
+; X86-AVX1-NEXT: vpmaxsw %xmm3, %xmm4, %xmm3
+; X86-AVX1-NEXT: vextractf128 $1, %ymm1, %xmm4
+; X86-AVX1-NEXT: vpmaxsw 24(%ebp), %xmm4, %xmm4
+; X86-AVX1-NEXT: vpmaxsw %xmm4, %xmm3, %xmm3
+; X86-AVX1-NEXT: vpmaxsw %xmm2, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpmaxsw 8(%ebp), %xmm1, %xmm1
+; X86-AVX1-NEXT: vpmaxsw %xmm1, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpmaxsw %xmm3, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}, %xmm0, %xmm0
+; X86-AVX1-NEXT: vphminposuw %xmm0, %xmm0
+; X86-AVX1-NEXT: vmovd %xmm0, %eax
+; X86-AVX1-NEXT: xorl $32767, %eax # imm = 0x7FFF
+; X86-AVX1-NEXT: # kill: def $ax killed $ax killed $eax
+; X86-AVX1-NEXT: movl %ebp, %esp
+; X86-AVX1-NEXT: popl %ebp
+; X86-AVX1-NEXT: vzeroupper
+; X86-AVX1-NEXT: retl
+;
+; X64-AVX1-LABEL: test_v64i16:
+; X64-AVX1: # %bb.0:
+; X64-AVX1-NEXT: vextractf128 $1, %ymm3, %xmm4
+; X64-AVX1-NEXT: vextractf128 $1, %ymm1, %xmm5
+; X64-AVX1-NEXT: vpmaxsw %xmm4, %xmm5, %xmm4
+; X64-AVX1-NEXT: vextractf128 $1, %ymm2, %xmm5
+; X64-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm6
+; X64-AVX1-NEXT: vpmaxsw %xmm5, %xmm6, %xmm5
+; X64-AVX1-NEXT: vpmaxsw %xmm4, %xmm5, %xmm4
+; X64-AVX1-NEXT: vpmaxsw %xmm3, %xmm1, %xmm1
+; X64-AVX1-NEXT: vpmaxsw %xmm2, %xmm0, %xmm0
+; X64-AVX1-NEXT: vpmaxsw %xmm1, %xmm0, %xmm0
+; X64-AVX1-NEXT: vpmaxsw %xmm4, %xmm0, %xmm0
+; X64-AVX1-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
+; X64-AVX1-NEXT: vphminposuw %xmm0, %xmm0
+; X64-AVX1-NEXT: vmovd %xmm0, %eax
+; X64-AVX1-NEXT: xorl $32767, %eax # imm = 0x7FFF
+; X64-AVX1-NEXT: # kill: def $ax killed $ax killed $eax
+; X64-AVX1-NEXT: vzeroupper
+; X64-AVX1-NEXT: retq
+;
+; X86-AVX2-LABEL: test_v64i16:
+; X86-AVX2: # %bb.0:
+; X86-AVX2-NEXT: pushl %ebp
+; X86-AVX2-NEXT: movl %esp, %ebp
+; X86-AVX2-NEXT: andl $-32, %esp
+; X86-AVX2-NEXT: subl $32, %esp
+; X86-AVX2-NEXT: vpmaxsw %ymm2, %ymm0, %ymm0
+; X86-AVX2-NEXT: vpmaxsw 8(%ebp), %ymm1, %ymm1
+; X86-AVX2-NEXT: vpmaxsw %ymm1, %ymm0, %ymm0
+; X86-AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
+; X86-AVX2-NEXT: vpmaxsw %xmm1, %xmm0, %xmm0
+; X86-AVX2-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}, %xmm0, %xmm0
+; X86-AVX2-NEXT: vphminposuw %xmm0, %xmm0
+; X86-AVX2-NEXT: vmovd %xmm0, %eax
+; X86-AVX2-NEXT: xorl $32767, %eax # imm = 0x7FFF
+; X86-AVX2-NEXT: # kill: def $ax killed $ax killed $eax
+; X86-AVX2-NEXT: movl %ebp, %esp
+; X86-AVX2-NEXT: popl %ebp
+; X86-AVX2-NEXT: vzeroupper
+; X86-AVX2-NEXT: retl
+;
+; X64-AVX2-LABEL: test_v64i16:
+; X64-AVX2: # %bb.0:
+; X64-AVX2-NEXT: vpmaxsw %ymm3, %ymm1, %ymm1
+; X64-AVX2-NEXT: vpmaxsw %ymm2, %ymm0, %ymm0
+; X64-AVX2-NEXT: vpmaxsw %ymm1, %ymm0, %ymm0
+; X64-AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
+; X64-AVX2-NEXT: vpmaxsw %xmm1, %xmm0, %xmm0
+; X64-AVX2-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
+; X64-AVX2-NEXT: vphminposuw %xmm0, %xmm0
+; X64-AVX2-NEXT: vmovd %xmm0, %eax
+; X64-AVX2-NEXT: xorl $32767, %eax # imm = 0x7FFF
+; X64-AVX2-NEXT: # kill: def $ax killed $ax killed $eax
+; X64-AVX2-NEXT: vzeroupper
+; X64-AVX2-NEXT: retq
;
; AVX512BW-LABEL: test_v64i16:
; AVX512BW: # %bb.0:
@@ -1477,7 +2601,7 @@ define i16 @test_v64i16(<64 x i16> %a0) {
; vXi8
;
-define i8 @test_v2i8(<2 x i8> %a0) {
+define i8 @test_v2i8(<2 x i8> %a0) nounwind {
; SSE2-LABEL: test_v2i8:
; SSE2: # %bb.0:
; SSE2-NEXT: movdqa %xmm0, %xmm1
@@ -1489,7 +2613,7 @@ define i8 @test_v2i8(<2 x i8> %a0) {
; SSE2-NEXT: por %xmm0, %xmm2
; SSE2-NEXT: movd %xmm2, %eax
; SSE2-NEXT: # kill: def $al killed $al killed $eax
-; SSE2-NEXT: retq
+; SSE2-NEXT: ret{{[l|q]}}
;
; SSE4-LABEL: test_v2i8:
; SSE4: # %bb.0:
@@ -1498,7 +2622,7 @@ define i8 @test_v2i8(<2 x i8> %a0) {
; SSE4-NEXT: pmaxsb %xmm0, %xmm1
; SSE4-NEXT: movd %xmm1, %eax
; SSE4-NEXT: # kill: def $al killed $al killed $eax
-; SSE4-NEXT: retq
+; SSE4-NEXT: ret{{[l|q]}}
;
; AVX-LABEL: test_v2i8:
; AVX: # %bb.0:
@@ -1506,39 +2630,51 @@ define i8 @test_v2i8(<2 x i8> %a0) {
; AVX-NEXT: vpmaxsb %xmm1, %xmm0, %xmm0
; AVX-NEXT: vmovd %xmm0, %eax
; AVX-NEXT: # kill: def $al killed $al killed $eax
-; AVX-NEXT: retq
-;
-; AVX512-LABEL: test_v2i8:
-; AVX512: # %bb.0:
-; AVX512-NEXT: vpsrlw $8, %xmm0, %xmm1
-; AVX512-NEXT: vpmaxsb %xmm1, %xmm0, %xmm0
-; AVX512-NEXT: vmovd %xmm0, %eax
-; AVX512-NEXT: # kill: def $al killed $al killed $eax
-; AVX512-NEXT: retq
+; AVX-NEXT: ret{{[l|q]}}
%1 = call i8 @llvm.vector.reduce.smax.v2i8(<2 x i8> %a0)
ret i8 %1
}
-define i8 @test_v4i8(<4 x i8> %a0) {
-; SSE2-LABEL: test_v4i8:
-; SSE2: # %bb.0:
-; SSE2-NEXT: movdqa %xmm0, %xmm1
-; SSE2-NEXT: psrld $16, %xmm1
-; SSE2-NEXT: movdqa %xmm0, %xmm2
-; SSE2-NEXT: pcmpgtb %xmm1, %xmm2
-; SSE2-NEXT: pand %xmm2, %xmm0
-; SSE2-NEXT: pandn %xmm1, %xmm2
-; SSE2-NEXT: por %xmm0, %xmm2
-; SSE2-NEXT: movdqa %xmm2, %xmm0
-; SSE2-NEXT: psrlw $8, %xmm0
-; SSE2-NEXT: movdqa %xmm2, %xmm1
-; SSE2-NEXT: pcmpgtb %xmm0, %xmm1
-; SSE2-NEXT: pand %xmm1, %xmm2
-; SSE2-NEXT: pandn %xmm0, %xmm1
-; SSE2-NEXT: por %xmm2, %xmm1
-; SSE2-NEXT: movd %xmm1, %eax
-; SSE2-NEXT: # kill: def $al killed $al killed $eax
-; SSE2-NEXT: retq
+define i8 @test_v4i8(<4 x i8> %a0) nounwind {
+; X86-SSE2-LABEL: test_v4i8:
+; X86-SSE2: # %bb.0:
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE2-NEXT: psrld $16, %xmm2
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X86-SSE2-NEXT: pcmpgtb %xmm2, %xmm1
+; X86-SSE2-NEXT: pand %xmm1, %xmm0
+; X86-SSE2-NEXT: pandn %xmm2, %xmm1
+; X86-SSE2-NEXT: por %xmm0, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE2-NEXT: psrlw $8, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm2
+; X86-SSE2-NEXT: pcmpgtb %xmm0, %xmm2
+; X86-SSE2-NEXT: pand %xmm2, %xmm1
+; X86-SSE2-NEXT: pandn %xmm0, %xmm2
+; X86-SSE2-NEXT: por %xmm1, %xmm2
+; X86-SSE2-NEXT: movd %xmm2, %eax
+; X86-SSE2-NEXT: # kill: def $al killed $al killed $eax
+; X86-SSE2-NEXT: retl
+;
+; X64-SSE2-LABEL: test_v4i8:
+; X64-SSE2: # %bb.0:
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X64-SSE2-NEXT: psrld $16, %xmm1
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X64-SSE2-NEXT: pcmpgtb %xmm1, %xmm2
+; X64-SSE2-NEXT: pand %xmm2, %xmm0
+; X64-SSE2-NEXT: pandn %xmm1, %xmm2
+; X64-SSE2-NEXT: por %xmm0, %xmm2
+; X64-SSE2-NEXT: movdqa %xmm2, %xmm0
+; X64-SSE2-NEXT: psrlw $8, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm2, %xmm1
+; X64-SSE2-NEXT: pcmpgtb %xmm0, %xmm1
+; X64-SSE2-NEXT: pand %xmm1, %xmm2
+; X64-SSE2-NEXT: pandn %xmm0, %xmm1
+; X64-SSE2-NEXT: por %xmm2, %xmm1
+; X64-SSE2-NEXT: movd %xmm1, %eax
+; X64-SSE2-NEXT: # kill: def $al killed $al killed $eax
+; X64-SSE2-NEXT: retq
;
; SSE4-LABEL: test_v4i8:
; SSE4: # %bb.0:
@@ -1550,7 +2686,7 @@ define i8 @test_v4i8(<4 x i8> %a0) {
; SSE4-NEXT: pmaxsb %xmm1, %xmm0
; SSE4-NEXT: movd %xmm0, %eax
; SSE4-NEXT: # kill: def $al killed $al killed $eax
-; SSE4-NEXT: retq
+; SSE4-NEXT: ret{{[l|q]}}
;
; AVX-LABEL: test_v4i8:
; AVX: # %bb.0:
@@ -1560,47 +2696,63 @@ define i8 @test_v4i8(<4 x i8> %a0) {
; AVX-NEXT: vpmaxsb %xmm1, %xmm0, %xmm0
; AVX-NEXT: vmovd %xmm0, %eax
; AVX-NEXT: # kill: def $al killed $al killed $eax
-; AVX-NEXT: retq
-;
-; AVX512-LABEL: test_v4i8:
-; AVX512: # %bb.0:
-; AVX512-NEXT: vpsrld $16, %xmm0, %xmm1
-; AVX512-NEXT: vpmaxsb %xmm1, %xmm0, %xmm0
-; AVX512-NEXT: vpsrlw $8, %xmm0, %xmm1
-; AVX512-NEXT: vpmaxsb %xmm1, %xmm0, %xmm0
-; AVX512-NEXT: vmovd %xmm0, %eax
-; AVX512-NEXT: # kill: def $al killed $al killed $eax
-; AVX512-NEXT: retq
+; AVX-NEXT: ret{{[l|q]}}
%1 = call i8 @llvm.vector.reduce.smax.v4i8(<4 x i8> %a0)
ret i8 %1
}
-define i8 @test_v8i8(<8 x i8> %a0) {
-; SSE2-LABEL: test_v8i8:
-; SSE2: # %bb.0:
-; SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
-; SSE2-NEXT: movdqa %xmm0, %xmm2
-; SSE2-NEXT: pcmpgtb %xmm1, %xmm2
-; SSE2-NEXT: pand %xmm2, %xmm0
-; SSE2-NEXT: pandn %xmm1, %xmm2
-; SSE2-NEXT: por %xmm0, %xmm2
-; SSE2-NEXT: movdqa %xmm2, %xmm0
-; SSE2-NEXT: psrld $16, %xmm0
-; SSE2-NEXT: movdqa %xmm2, %xmm1
-; SSE2-NEXT: pcmpgtb %xmm0, %xmm1
-; SSE2-NEXT: pand %xmm1, %xmm2
-; SSE2-NEXT: pandn %xmm0, %xmm1
-; SSE2-NEXT: por %xmm2, %xmm1
-; SSE2-NEXT: movdqa %xmm1, %xmm0
-; SSE2-NEXT: psrlw $8, %xmm0
-; SSE2-NEXT: movdqa %xmm1, %xmm2
-; SSE2-NEXT: pcmpgtb %xmm0, %xmm2
-; SSE2-NEXT: pand %xmm2, %xmm1
-; SSE2-NEXT: pandn %xmm0, %xmm2
-; SSE2-NEXT: por %xmm1, %xmm2
-; SSE2-NEXT: movd %xmm2, %eax
-; SSE2-NEXT: # kill: def $al killed $al killed $eax
-; SSE2-NEXT: retq
+define i8 @test_v8i8(<8 x i8> %a0) nounwind {
+; X86-SSE2-LABEL: test_v8i8:
+; X86-SSE2: # %bb.0:
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm0[1,1,1,1]
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X86-SSE2-NEXT: pcmpgtb %xmm2, %xmm1
+; X86-SSE2-NEXT: pand %xmm1, %xmm0
+; X86-SSE2-NEXT: pandn %xmm2, %xmm1
+; X86-SSE2-NEXT: por %xmm0, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm2
+; X86-SSE2-NEXT: psrld $16, %xmm2
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE2-NEXT: pcmpgtb %xmm2, %xmm0
+; X86-SSE2-NEXT: pand %xmm0, %xmm1
+; X86-SSE2-NEXT: pandn %xmm2, %xmm0
+; X86-SSE2-NEXT: por %xmm1, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X86-SSE2-NEXT: psrlw $8, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE2-NEXT: pcmpgtb %xmm1, %xmm2
+; X86-SSE2-NEXT: pand %xmm2, %xmm0
+; X86-SSE2-NEXT: pandn %xmm1, %xmm2
+; X86-SSE2-NEXT: por %xmm0, %xmm2
+; X86-SSE2-NEXT: movd %xmm2, %eax
+; X86-SSE2-NEXT: # kill: def $al killed $al killed $eax
+; X86-SSE2-NEXT: retl
+;
+; X64-SSE2-LABEL: test_v8i8:
+; X64-SSE2: # %bb.0:
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X64-SSE2-NEXT: pcmpgtb %xmm1, %xmm2
+; X64-SSE2-NEXT: pand %xmm2, %xmm0
+; X64-SSE2-NEXT: pandn %xmm1, %xmm2
+; X64-SSE2-NEXT: por %xmm0, %xmm2
+; X64-SSE2-NEXT: movdqa %xmm2, %xmm0
+; X64-SSE2-NEXT: psrld $16, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm2, %xmm1
+; X64-SSE2-NEXT: pcmpgtb %xmm0, %xmm1
+; X64-SSE2-NEXT: pand %xmm1, %xmm2
+; X64-SSE2-NEXT: pandn %xmm0, %xmm1
+; X64-SSE2-NEXT: por %xmm2, %xmm1
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X64-SSE2-NEXT: psrlw $8, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm2
+; X64-SSE2-NEXT: pcmpgtb %xmm0, %xmm2
+; X64-SSE2-NEXT: pand %xmm2, %xmm1
+; X64-SSE2-NEXT: pandn %xmm0, %xmm2
+; X64-SSE2-NEXT: por %xmm1, %xmm2
+; X64-SSE2-NEXT: movd %xmm2, %eax
+; X64-SSE2-NEXT: # kill: def $al killed $al killed $eax
+; X64-SSE2-NEXT: retq
;
; SSE4-LABEL: test_v8i8:
; SSE4: # %bb.0:
@@ -1614,7 +2766,7 @@ define i8 @test_v8i8(<8 x i8> %a0) {
; SSE4-NEXT: pmaxsb %xmm0, %xmm1
; SSE4-NEXT: movd %xmm1, %eax
; SSE4-NEXT: # kill: def $al killed $al killed $eax
-; SSE4-NEXT: retq
+; SSE4-NEXT: ret{{[l|q]}}
;
; AVX-LABEL: test_v8i8:
; AVX: # %bb.0:
@@ -1626,78 +2778,121 @@ define i8 @test_v8i8(<8 x i8> %a0) {
; AVX-NEXT: vpmaxsb %xmm1, %xmm0, %xmm0
; AVX-NEXT: vmovd %xmm0, %eax
; AVX-NEXT: # kill: def $al killed $al killed $eax
-; AVX-NEXT: retq
-;
-; AVX512-LABEL: test_v8i8:
-; AVX512: # %bb.0:
-; AVX512-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
-; AVX512-NEXT: vpmaxsb %xmm1, %xmm0, %xmm0
-; AVX512-NEXT: vpsrld $16, %xmm0, %xmm1
-; AVX512-NEXT: vpmaxsb %xmm1, %xmm0, %xmm0
-; AVX512-NEXT: vpsrlw $8, %xmm0, %xmm1
-; AVX512-NEXT: vpmaxsb %xmm1, %xmm0, %xmm0
-; AVX512-NEXT: vmovd %xmm0, %eax
-; AVX512-NEXT: # kill: def $al killed $al killed $eax
-; AVX512-NEXT: retq
+; AVX-NEXT: ret{{[l|q]}}
%1 = call i8 @llvm.vector.reduce.smax.v8i8(<8 x i8> %a0)
ret i8 %1
}
-define i8 @test_v16i8(<16 x i8> %a0) {
-; SSE2-LABEL: test_v16i8:
-; SSE2: # %bb.0:
-; SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
-; SSE2-NEXT: movdqa %xmm0, %xmm2
-; SSE2-NEXT: pcmpgtb %xmm1, %xmm2
-; SSE2-NEXT: pand %xmm2, %xmm0
-; SSE2-NEXT: pandn %xmm1, %xmm2
-; SSE2-NEXT: por %xmm0, %xmm2
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,1,1]
-; SSE2-NEXT: movdqa %xmm2, %xmm1
-; SSE2-NEXT: pcmpgtb %xmm0, %xmm1
-; SSE2-NEXT: pand %xmm1, %xmm2
-; SSE2-NEXT: pandn %xmm0, %xmm1
-; SSE2-NEXT: por %xmm2, %xmm1
-; SSE2-NEXT: movdqa %xmm1, %xmm0
-; SSE2-NEXT: psrld $16, %xmm0
-; SSE2-NEXT: movdqa %xmm1, %xmm2
-; SSE2-NEXT: pcmpgtb %xmm0, %xmm2
-; SSE2-NEXT: pand %xmm2, %xmm1
-; SSE2-NEXT: pandn %xmm0, %xmm2
-; SSE2-NEXT: por %xmm1, %xmm2
-; SSE2-NEXT: movdqa %xmm2, %xmm0
-; SSE2-NEXT: psrlw $8, %xmm0
-; SSE2-NEXT: movdqa %xmm2, %xmm1
-; SSE2-NEXT: pcmpgtb %xmm0, %xmm1
-; SSE2-NEXT: pand %xmm1, %xmm2
-; SSE2-NEXT: pandn %xmm0, %xmm1
-; SSE2-NEXT: por %xmm2, %xmm1
-; SSE2-NEXT: movd %xmm1, %eax
-; SSE2-NEXT: # kill: def $al killed $al killed $eax
-; SSE2-NEXT: retq
-;
-; SSE4-LABEL: test_v16i8:
-; SSE4: # %bb.0:
-; SSE4-NEXT: pxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0
-; SSE4-NEXT: movdqa %xmm0, %xmm1
-; SSE4-NEXT: psrlw $8, %xmm1
-; SSE4-NEXT: pminub %xmm0, %xmm1
-; SSE4-NEXT: phminposuw %xmm1, %xmm0
-; SSE4-NEXT: movd %xmm0, %eax
-; SSE4-NEXT: xorb $127, %al
-; SSE4-NEXT: # kill: def $al killed $al killed $eax
-; SSE4-NEXT: retq
-;
-; AVX-LABEL: test_v16i8:
-; AVX: # %bb.0:
-; AVX-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
-; AVX-NEXT: vpsrlw $8, %xmm0, %xmm1
-; AVX-NEXT: vpminub %xmm1, %xmm0, %xmm0
-; AVX-NEXT: vphminposuw %xmm0, %xmm0
-; AVX-NEXT: vmovd %xmm0, %eax
-; AVX-NEXT: xorb $127, %al
-; AVX-NEXT: # kill: def $al killed $al killed $eax
-; AVX-NEXT: retq
+define i8 @test_v16i8(<16 x i8> %a0) nounwind {
+; X86-SSE2-LABEL: test_v16i8:
+; X86-SSE2: # %bb.0:
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE2-NEXT: pcmpgtb %xmm1, %xmm2
+; X86-SSE2-NEXT: pand %xmm2, %xmm0
+; X86-SSE2-NEXT: pandn %xmm1, %xmm2
+; X86-SSE2-NEXT: por %xmm0, %xmm2
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm2[1,1,1,1]
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm0
+; X86-SSE2-NEXT: pcmpgtb %xmm1, %xmm0
+; X86-SSE2-NEXT: pand %xmm0, %xmm2
+; X86-SSE2-NEXT: pandn %xmm1, %xmm0
+; X86-SSE2-NEXT: por %xmm2, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE2-NEXT: psrld $16, %xmm2
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X86-SSE2-NEXT: pcmpgtb %xmm2, %xmm1
+; X86-SSE2-NEXT: pand %xmm1, %xmm0
+; X86-SSE2-NEXT: pandn %xmm2, %xmm1
+; X86-SSE2-NEXT: por %xmm0, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE2-NEXT: psrlw $8, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm2
+; X86-SSE2-NEXT: pcmpgtb %xmm0, %xmm2
+; X86-SSE2-NEXT: pand %xmm2, %xmm1
+; X86-SSE2-NEXT: pandn %xmm0, %xmm2
+; X86-SSE2-NEXT: por %xmm1, %xmm2
+; X86-SSE2-NEXT: movd %xmm2, %eax
+; X86-SSE2-NEXT: # kill: def $al killed $al killed $eax
+; X86-SSE2-NEXT: retl
+;
+; X64-SSE2-LABEL: test_v16i8:
+; X64-SSE2: # %bb.0:
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X64-SSE2-NEXT: pcmpgtb %xmm1, %xmm2
+; X64-SSE2-NEXT: pand %xmm2, %xmm0
+; X64-SSE2-NEXT: pandn %xmm1, %xmm2
+; X64-SSE2-NEXT: por %xmm0, %xmm2
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,1,1]
+; X64-SSE2-NEXT: movdqa %xmm2, %xmm1
+; X64-SSE2-NEXT: pcmpgtb %xmm0, %xmm1
+; X64-SSE2-NEXT: pand %xmm1, %xmm2
+; X64-SSE2-NEXT: pandn %xmm0, %xmm1
+; X64-SSE2-NEXT: por %xmm2, %xmm1
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X64-SSE2-NEXT: psrld $16, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm2
+; X64-SSE2-NEXT: pcmpgtb %xmm0, %xmm2
+; X64-SSE2-NEXT: pand %xmm2, %xmm1
+; X64-SSE2-NEXT: pandn %xmm0, %xmm2
+; X64-SSE2-NEXT: por %xmm1, %xmm2
+; X64-SSE2-NEXT: movdqa %xmm2, %xmm0
+; X64-SSE2-NEXT: psrlw $8, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm2, %xmm1
+; X64-SSE2-NEXT: pcmpgtb %xmm0, %xmm1
+; X64-SSE2-NEXT: pand %xmm1, %xmm2
+; X64-SSE2-NEXT: pandn %xmm0, %xmm1
+; X64-SSE2-NEXT: por %xmm2, %xmm1
+; X64-SSE2-NEXT: movd %xmm1, %eax
+; X64-SSE2-NEXT: # kill: def $al killed $al killed $eax
+; X64-SSE2-NEXT: retq
+;
+; X86-SSE4-LABEL: test_v16i8:
+; X86-SSE4: # %bb.0:
+; X86-SSE4-NEXT: pxor {{\.?LCPI[0-9]+_[0-9]+}}, %xmm0
+; X86-SSE4-NEXT: movdqa %xmm0, %xmm1
+; X86-SSE4-NEXT: psrlw $8, %xmm1
+; X86-SSE4-NEXT: pminub %xmm0, %xmm1
+; X86-SSE4-NEXT: phminposuw %xmm1, %xmm0
+; X86-SSE4-NEXT: movd %xmm0, %eax
+; X86-SSE4-NEXT: xorb $127, %al
+; X86-SSE4-NEXT: # kill: def $al killed $al killed $eax
+; X86-SSE4-NEXT: retl
+;
+; X64-SSE4-LABEL: test_v16i8:
+; X64-SSE4: # %bb.0:
+; X64-SSE4-NEXT: pxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0
+; X64-SSE4-NEXT: movdqa %xmm0, %xmm1
+; X64-SSE4-NEXT: psrlw $8, %xmm1
+; X64-SSE4-NEXT: pminub %xmm0, %xmm1
+; X64-SSE4-NEXT: phminposuw %xmm1, %xmm0
+; X64-SSE4-NEXT: movd %xmm0, %eax
+; X64-SSE4-NEXT: xorb $127, %al
+; X64-SSE4-NEXT: # kill: def $al killed $al killed $eax
+; X64-SSE4-NEXT: retq
+;
+; X86-AVX-LABEL: test_v16i8:
+; X86-AVX: # %bb.0:
+; X86-AVX-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}, %xmm0, %xmm0
+; X86-AVX-NEXT: vpsrlw $8, %xmm0, %xmm1
+; X86-AVX-NEXT: vpminub %xmm1, %xmm0, %xmm0
+; X86-AVX-NEXT: vphminposuw %xmm0, %xmm0
+; X86-AVX-NEXT: vmovd %xmm0, %eax
+; X86-AVX-NEXT: xorb $127, %al
+; X86-AVX-NEXT: # kill: def $al killed $al killed $eax
+; X86-AVX-NEXT: retl
+;
+; X64-AVX-LABEL: test_v16i8:
+; X64-AVX: # %bb.0:
+; X64-AVX-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
+; X64-AVX-NEXT: vpsrlw $8, %xmm0, %xmm1
+; X64-AVX-NEXT: vpminub %xmm1, %xmm0, %xmm0
+; X64-AVX-NEXT: vphminposuw %xmm0, %xmm0
+; X64-AVX-NEXT: vmovd %xmm0, %eax
+; X64-AVX-NEXT: xorb $127, %al
+; X64-AVX-NEXT: # kill: def $al killed $al killed $eax
+; X64-AVX-NEXT: retq
;
; AVX512BW-LABEL: test_v16i8:
; AVX512BW: # %bb.0:
@@ -1724,84 +2919,162 @@ define i8 @test_v16i8(<16 x i8> %a0) {
ret i8 %1
}
-define i8 @test_v32i8(<32 x i8> %a0) {
-; SSE2-LABEL: test_v32i8:
-; SSE2: # %bb.0:
-; SSE2-NEXT: movdqa %xmm0, %xmm2
-; SSE2-NEXT: pcmpgtb %xmm1, %xmm2
-; SSE2-NEXT: pand %xmm2, %xmm0
-; SSE2-NEXT: pandn %xmm1, %xmm2
-; SSE2-NEXT: por %xmm0, %xmm2
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm2[2,3,2,3]
-; SSE2-NEXT: movdqa %xmm2, %xmm1
-; SSE2-NEXT: pcmpgtb %xmm0, %xmm1
-; SSE2-NEXT: pand %xmm1, %xmm2
-; SSE2-NEXT: pandn %xmm0, %xmm1
-; SSE2-NEXT: por %xmm2, %xmm1
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
-; SSE2-NEXT: movdqa %xmm1, %xmm2
-; SSE2-NEXT: pcmpgtb %xmm0, %xmm2
-; SSE2-NEXT: pand %xmm2, %xmm1
-; SSE2-NEXT: pandn %xmm0, %xmm2
-; SSE2-NEXT: por %xmm1, %xmm2
-; SSE2-NEXT: movdqa %xmm2, %xmm0
-; SSE2-NEXT: psrld $16, %xmm0
-; SSE2-NEXT: movdqa %xmm2, %xmm1
-; SSE2-NEXT: pcmpgtb %xmm0, %xmm1
-; SSE2-NEXT: pand %xmm1, %xmm2
-; SSE2-NEXT: pandn %xmm0, %xmm1
-; SSE2-NEXT: por %xmm2, %xmm1
-; SSE2-NEXT: movdqa %xmm1, %xmm0
-; SSE2-NEXT: psrlw $8, %xmm0
-; SSE2-NEXT: movdqa %xmm1, %xmm2
-; SSE2-NEXT: pcmpgtb %xmm0, %xmm2
-; SSE2-NEXT: pand %xmm2, %xmm1
-; SSE2-NEXT: pandn %xmm0, %xmm2
-; SSE2-NEXT: por %xmm1, %xmm2
-; SSE2-NEXT: movd %xmm2, %eax
-; SSE2-NEXT: # kill: def $al killed $al killed $eax
-; SSE2-NEXT: retq
-;
-; SSE4-LABEL: test_v32i8:
-; SSE4: # %bb.0:
-; SSE4-NEXT: pmaxsb %xmm1, %xmm0
-; SSE4-NEXT: pxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0
-; SSE4-NEXT: movdqa %xmm0, %xmm1
-; SSE4-NEXT: psrlw $8, %xmm1
-; SSE4-NEXT: pminub %xmm0, %xmm1
-; SSE4-NEXT: phminposuw %xmm1, %xmm0
-; SSE4-NEXT: movd %xmm0, %eax
-; SSE4-NEXT: xorb $127, %al
-; SSE4-NEXT: # kill: def $al killed $al killed $eax
-; SSE4-NEXT: retq
-;
-; AVX1-LABEL: test_v32i8:
-; AVX1: # %bb.0:
-; AVX1-NEXT: vextractf128 $1, %ymm0, %xmm1
-; AVX1-NEXT: vpmaxsb %xmm1, %xmm0, %xmm0
-; AVX1-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
-; AVX1-NEXT: vpsrlw $8, %xmm0, %xmm1
-; AVX1-NEXT: vpminub %xmm1, %xmm0, %xmm0
-; AVX1-NEXT: vphminposuw %xmm0, %xmm0
-; AVX1-NEXT: vmovd %xmm0, %eax
-; AVX1-NEXT: xorb $127, %al
-; AVX1-NEXT: # kill: def $al killed $al killed $eax
-; AVX1-NEXT: vzeroupper
-; AVX1-NEXT: retq
-;
-; AVX2-LABEL: test_v32i8:
-; AVX2: # %bb.0:
-; AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
-; AVX2-NEXT: vpmaxsb %xmm1, %xmm0, %xmm0
-; AVX2-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
-; AVX2-NEXT: vpsrlw $8, %xmm0, %xmm1
-; AVX2-NEXT: vpminub %xmm1, %xmm0, %xmm0
-; AVX2-NEXT: vphminposuw %xmm0, %xmm0
-; AVX2-NEXT: vmovd %xmm0, %eax
-; AVX2-NEXT: xorb $127, %al
-; AVX2-NEXT: # kill: def $al killed $al killed $eax
-; AVX2-NEXT: vzeroupper
-; AVX2-NEXT: retq
+define i8 @test_v32i8(<32 x i8> %a0) nounwind {
+; X86-SSE2-LABEL: test_v32i8:
+; X86-SSE2: # %bb.0:
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE2-NEXT: pcmpgtb %xmm1, %xmm2
+; X86-SSE2-NEXT: pand %xmm2, %xmm0
+; X86-SSE2-NEXT: pandn %xmm1, %xmm2
+; X86-SSE2-NEXT: por %xmm0, %xmm2
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm2[2,3,2,3]
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm1
+; X86-SSE2-NEXT: pcmpgtb %xmm0, %xmm1
+; X86-SSE2-NEXT: pand %xmm1, %xmm2
+; X86-SSE2-NEXT: pandn %xmm0, %xmm1
+; X86-SSE2-NEXT: por %xmm2, %xmm1
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm1[1,1,1,1]
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE2-NEXT: pcmpgtb %xmm2, %xmm0
+; X86-SSE2-NEXT: pand %xmm0, %xmm1
+; X86-SSE2-NEXT: pandn %xmm2, %xmm0
+; X86-SSE2-NEXT: por %xmm1, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE2-NEXT: psrld $16, %xmm2
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X86-SSE2-NEXT: pcmpgtb %xmm2, %xmm1
+; X86-SSE2-NEXT: pand %xmm1, %xmm0
+; X86-SSE2-NEXT: pandn %xmm2, %xmm1
+; X86-SSE2-NEXT: por %xmm0, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE2-NEXT: psrlw $8, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm2
+; X86-SSE2-NEXT: pcmpgtb %xmm0, %xmm2
+; X86-SSE2-NEXT: pand %xmm2, %xmm1
+; X86-SSE2-NEXT: pandn %xmm0, %xmm2
+; X86-SSE2-NEXT: por %xmm1, %xmm2
+; X86-SSE2-NEXT: movd %xmm2, %eax
+; X86-SSE2-NEXT: # kill: def $al killed $al killed $eax
+; X86-SSE2-NEXT: retl
+;
+; X64-SSE2-LABEL: test_v32i8:
+; X64-SSE2: # %bb.0:
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X64-SSE2-NEXT: pcmpgtb %xmm1, %xmm2
+; X64-SSE2-NEXT: pand %xmm2, %xmm0
+; X64-SSE2-NEXT: pandn %xmm1, %xmm2
+; X64-SSE2-NEXT: por %xmm0, %xmm2
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm2[2,3,2,3]
+; X64-SSE2-NEXT: movdqa %xmm2, %xmm1
+; X64-SSE2-NEXT: pcmpgtb %xmm0, %xmm1
+; X64-SSE2-NEXT: pand %xmm1, %xmm2
+; X64-SSE2-NEXT: pandn %xmm0, %xmm1
+; X64-SSE2-NEXT: por %xmm2, %xmm1
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm2
+; X64-SSE2-NEXT: pcmpgtb %xmm0, %xmm2
+; X64-SSE2-NEXT: pand %xmm2, %xmm1
+; X64-SSE2-NEXT: pandn %xmm0, %xmm2
+; X64-SSE2-NEXT: por %xmm1, %xmm2
+; X64-SSE2-NEXT: movdqa %xmm2, %xmm0
+; X64-SSE2-NEXT: psrld $16, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm2, %xmm1
+; X64-SSE2-NEXT: pcmpgtb %xmm0, %xmm1
+; X64-SSE2-NEXT: pand %xmm1, %xmm2
+; X64-SSE2-NEXT: pandn %xmm0, %xmm1
+; X64-SSE2-NEXT: por %xmm2, %xmm1
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X64-SSE2-NEXT: psrlw $8, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm2
+; X64-SSE2-NEXT: pcmpgtb %xmm0, %xmm2
+; X64-SSE2-NEXT: pand %xmm2, %xmm1
+; X64-SSE2-NEXT: pandn %xmm0, %xmm2
+; X64-SSE2-NEXT: por %xmm1, %xmm2
+; X64-SSE2-NEXT: movd %xmm2, %eax
+; X64-SSE2-NEXT: # kill: def $al killed $al killed $eax
+; X64-SSE2-NEXT: retq
+;
+; X86-SSE4-LABEL: test_v32i8:
+; X86-SSE4: # %bb.0:
+; X86-SSE4-NEXT: pmaxsb %xmm1, %xmm0
+; X86-SSE4-NEXT: pxor {{\.?LCPI[0-9]+_[0-9]+}}, %xmm0
+; X86-SSE4-NEXT: movdqa %xmm0, %xmm1
+; X86-SSE4-NEXT: psrlw $8, %xmm1
+; X86-SSE4-NEXT: pminub %xmm0, %xmm1
+; X86-SSE4-NEXT: phminposuw %xmm1, %xmm0
+; X86-SSE4-NEXT: movd %xmm0, %eax
+; X86-SSE4-NEXT: xorb $127, %al
+; X86-SSE4-NEXT: # kill: def $al killed $al killed $eax
+; X86-SSE4-NEXT: retl
+;
+; X64-SSE4-LABEL: test_v32i8:
+; X64-SSE4: # %bb.0:
+; X64-SSE4-NEXT: pmaxsb %xmm1, %xmm0
+; X64-SSE4-NEXT: pxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0
+; X64-SSE4-NEXT: movdqa %xmm0, %xmm1
+; X64-SSE4-NEXT: psrlw $8, %xmm1
+; X64-SSE4-NEXT: pminub %xmm0, %xmm1
+; X64-SSE4-NEXT: phminposuw %xmm1, %xmm0
+; X64-SSE4-NEXT: movd %xmm0, %eax
+; X64-SSE4-NEXT: xorb $127, %al
+; X64-SSE4-NEXT: # kill: def $al killed $al killed $eax
+; X64-SSE4-NEXT: retq
+;
+; X86-AVX1-LABEL: test_v32i8:
+; X86-AVX1: # %bb.0:
+; X86-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm1
+; X86-AVX1-NEXT: vpmaxsb %xmm1, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpsrlw $8, %xmm0, %xmm1
+; X86-AVX1-NEXT: vpminub %xmm1, %xmm0, %xmm0
+; X86-AVX1-NEXT: vphminposuw %xmm0, %xmm0
+; X86-AVX1-NEXT: vmovd %xmm0, %eax
+; X86-AVX1-NEXT: xorb $127, %al
+; X86-AVX1-NEXT: # kill: def $al killed $al killed $eax
+; X86-AVX1-NEXT: vzeroupper
+; X86-AVX1-NEXT: retl
+;
+; X64-AVX1-LABEL: test_v32i8:
+; X64-AVX1: # %bb.0:
+; X64-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm1
+; X64-AVX1-NEXT: vpmaxsb %xmm1, %xmm0, %xmm0
+; X64-AVX1-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
+; X64-AVX1-NEXT: vpsrlw $8, %xmm0, %xmm1
+; X64-AVX1-NEXT: vpminub %xmm1, %xmm0, %xmm0
+; X64-AVX1-NEXT: vphminposuw %xmm0, %xmm0
+; X64-AVX1-NEXT: vmovd %xmm0, %eax
+; X64-AVX1-NEXT: xorb $127, %al
+; X64-AVX1-NEXT: # kill: def $al killed $al killed $eax
+; X64-AVX1-NEXT: vzeroupper
+; X64-AVX1-NEXT: retq
+;
+; X86-AVX2-LABEL: test_v32i8:
+; X86-AVX2: # %bb.0:
+; X86-AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
+; X86-AVX2-NEXT: vpmaxsb %xmm1, %xmm0, %xmm0
+; X86-AVX2-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}, %xmm0, %xmm0
+; X86-AVX2-NEXT: vpsrlw $8, %xmm0, %xmm1
+; X86-AVX2-NEXT: vpminub %xmm1, %xmm0, %xmm0
+; X86-AVX2-NEXT: vphminposuw %xmm0, %xmm0
+; X86-AVX2-NEXT: vmovd %xmm0, %eax
+; X86-AVX2-NEXT: xorb $127, %al
+; X86-AVX2-NEXT: # kill: def $al killed $al killed $eax
+; X86-AVX2-NEXT: vzeroupper
+; X86-AVX2-NEXT: retl
+;
+; X64-AVX2-LABEL: test_v32i8:
+; X64-AVX2: # %bb.0:
+; X64-AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
+; X64-AVX2-NEXT: vpmaxsb %xmm1, %xmm0, %xmm0
+; X64-AVX2-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
+; X64-AVX2-NEXT: vpsrlw $8, %xmm0, %xmm1
+; X64-AVX2-NEXT: vpminub %xmm1, %xmm0, %xmm0
+; X64-AVX2-NEXT: vphminposuw %xmm0, %xmm0
+; X64-AVX2-NEXT: vmovd %xmm0, %eax
+; X64-AVX2-NEXT: xorb $127, %al
+; X64-AVX2-NEXT: # kill: def $al killed $al killed $eax
+; X64-AVX2-NEXT: vzeroupper
+; X64-AVX2-NEXT: retq
;
; AVX512BW-LABEL: test_v32i8:
; AVX512BW: # %bb.0:
@@ -1834,100 +3107,207 @@ define i8 @test_v32i8(<32 x i8> %a0) {
ret i8 %1
}
-define i8 @test_v64i8(<64 x i8> %a0) {
-; SSE2-LABEL: test_v64i8:
-; SSE2: # %bb.0:
-; SSE2-NEXT: movdqa %xmm1, %xmm4
-; SSE2-NEXT: pcmpgtb %xmm3, %xmm4
-; SSE2-NEXT: pand %xmm4, %xmm1
-; SSE2-NEXT: pandn %xmm3, %xmm4
-; SSE2-NEXT: por %xmm1, %xmm4
-; SSE2-NEXT: movdqa %xmm0, %xmm1
-; SSE2-NEXT: pcmpgtb %xmm2, %xmm1
-; SSE2-NEXT: pand %xmm1, %xmm0
-; SSE2-NEXT: pandn %xmm2, %xmm1
-; SSE2-NEXT: por %xmm0, %xmm1
-; SSE2-NEXT: movdqa %xmm1, %xmm0
-; SSE2-NEXT: pcmpgtb %xmm4, %xmm0
-; SSE2-NEXT: pand %xmm0, %xmm1
-; SSE2-NEXT: pandn %xmm4, %xmm0
-; SSE2-NEXT: por %xmm1, %xmm0
-; SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
-; SSE2-NEXT: movdqa %xmm0, %xmm2
-; SSE2-NEXT: pcmpgtb %xmm1, %xmm2
-; SSE2-NEXT: pand %xmm2, %xmm0
-; SSE2-NEXT: pandn %xmm1, %xmm2
-; SSE2-NEXT: por %xmm0, %xmm2
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,1,1]
-; SSE2-NEXT: movdqa %xmm2, %xmm1
-; SSE2-NEXT: pcmpgtb %xmm0, %xmm1
-; SSE2-NEXT: pand %xmm1, %xmm2
-; SSE2-NEXT: pandn %xmm0, %xmm1
-; SSE2-NEXT: por %xmm2, %xmm1
-; SSE2-NEXT: movdqa %xmm1, %xmm0
-; SSE2-NEXT: psrld $16, %xmm0
-; SSE2-NEXT: movdqa %xmm1, %xmm2
-; SSE2-NEXT: pcmpgtb %xmm0, %xmm2
-; SSE2-NEXT: pand %xmm2, %xmm1
-; SSE2-NEXT: pandn %xmm0, %xmm2
-; SSE2-NEXT: por %xmm1, %xmm2
-; SSE2-NEXT: movdqa %xmm2, %xmm0
-; SSE2-NEXT: psrlw $8, %xmm0
-; SSE2-NEXT: movdqa %xmm2, %xmm1
-; SSE2-NEXT: pcmpgtb %xmm0, %xmm1
-; SSE2-NEXT: pand %xmm1, %xmm2
-; SSE2-NEXT: pandn %xmm0, %xmm1
-; SSE2-NEXT: por %xmm2, %xmm1
-; SSE2-NEXT: movd %xmm1, %eax
-; SSE2-NEXT: # kill: def $al killed $al killed $eax
-; SSE2-NEXT: retq
-;
-; SSE4-LABEL: test_v64i8:
-; SSE4: # %bb.0:
-; SSE4-NEXT: pmaxsb %xmm3, %xmm1
-; SSE4-NEXT: pmaxsb %xmm2, %xmm0
-; SSE4-NEXT: pmaxsb %xmm1, %xmm0
-; SSE4-NEXT: pxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0
-; SSE4-NEXT: movdqa %xmm0, %xmm1
-; SSE4-NEXT: psrlw $8, %xmm1
-; SSE4-NEXT: pminub %xmm0, %xmm1
-; SSE4-NEXT: phminposuw %xmm1, %xmm0
-; SSE4-NEXT: movd %xmm0, %eax
-; SSE4-NEXT: xorb $127, %al
-; SSE4-NEXT: # kill: def $al killed $al killed $eax
-; SSE4-NEXT: retq
-;
-; AVX1-LABEL: test_v64i8:
-; AVX1: # %bb.0:
-; AVX1-NEXT: vextractf128 $1, %ymm1, %xmm2
-; AVX1-NEXT: vextractf128 $1, %ymm0, %xmm3
-; AVX1-NEXT: vpmaxsb %xmm2, %xmm3, %xmm2
-; AVX1-NEXT: vpmaxsb %xmm1, %xmm0, %xmm0
-; AVX1-NEXT: vpmaxsb %xmm2, %xmm0, %xmm0
-; AVX1-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
-; AVX1-NEXT: vpsrlw $8, %xmm0, %xmm1
-; AVX1-NEXT: vpminub %xmm1, %xmm0, %xmm0
-; AVX1-NEXT: vphminposuw %xmm0, %xmm0
-; AVX1-NEXT: vmovd %xmm0, %eax
-; AVX1-NEXT: xorb $127, %al
-; AVX1-NEXT: # kill: def $al killed $al killed $eax
-; AVX1-NEXT: vzeroupper
-; AVX1-NEXT: retq
-;
-; AVX2-LABEL: test_v64i8:
-; AVX2: # %bb.0:
-; AVX2-NEXT: vpmaxsb %ymm1, %ymm0, %ymm0
-; AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
-; AVX2-NEXT: vpmaxsb %xmm1, %xmm0, %xmm0
-; AVX2-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
-; AVX2-NEXT: vpsrlw $8, %xmm0, %xmm1
-; AVX2-NEXT: vpminub %xmm1, %xmm0, %xmm0
-; AVX2-NEXT: vphminposuw %xmm0, %xmm0
-; AVX2-NEXT: vmovd %xmm0, %eax
-; AVX2-NEXT: xorb $127, %al
-; AVX2-NEXT: # kill: def $al killed $al killed $eax
-; AVX2-NEXT: vzeroupper
-; AVX2-NEXT: retq
+define i8 @test_v64i8(<64 x i8> %a0) nounwind {
+; X86-SSE2-LABEL: test_v64i8:
+; X86-SSE2: # %bb.0:
+; X86-SSE2-NEXT: pushl %ebp
+; X86-SSE2-NEXT: movl %esp, %ebp
+; X86-SSE2-NEXT: andl $-16, %esp
+; X86-SSE2-NEXT: subl $16, %esp
+; X86-SSE2-NEXT: movdqa 8(%ebp), %xmm4
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm3
+; X86-SSE2-NEXT: pcmpgtb %xmm4, %xmm3
+; X86-SSE2-NEXT: pand %xmm3, %xmm1
+; X86-SSE2-NEXT: pandn %xmm4, %xmm3
+; X86-SSE2-NEXT: por %xmm1, %xmm3
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X86-SSE2-NEXT: pcmpgtb %xmm2, %xmm1
+; X86-SSE2-NEXT: pand %xmm1, %xmm0
+; X86-SSE2-NEXT: pandn %xmm2, %xmm1
+; X86-SSE2-NEXT: por %xmm0, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE2-NEXT: pcmpgtb %xmm3, %xmm0
+; X86-SSE2-NEXT: pand %xmm0, %xmm1
+; X86-SSE2-NEXT: pandn %xmm3, %xmm0
+; X86-SSE2-NEXT: por %xmm1, %xmm0
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE2-NEXT: pcmpgtb %xmm1, %xmm2
+; X86-SSE2-NEXT: pand %xmm2, %xmm0
+; X86-SSE2-NEXT: pandn %xmm1, %xmm2
+; X86-SSE2-NEXT: por %xmm0, %xmm2
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm2[1,1,1,1]
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm0
+; X86-SSE2-NEXT: pcmpgtb %xmm1, %xmm0
+; X86-SSE2-NEXT: pand %xmm0, %xmm2
+; X86-SSE2-NEXT: pandn %xmm1, %xmm0
+; X86-SSE2-NEXT: por %xmm2, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE2-NEXT: psrld $16, %xmm2
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X86-SSE2-NEXT: pcmpgtb %xmm2, %xmm1
+; X86-SSE2-NEXT: pand %xmm1, %xmm0
+; X86-SSE2-NEXT: pandn %xmm2, %xmm1
+; X86-SSE2-NEXT: por %xmm0, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE2-NEXT: psrlw $8, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm2
+; X86-SSE2-NEXT: pcmpgtb %xmm0, %xmm2
+; X86-SSE2-NEXT: pand %xmm2, %xmm1
+; X86-SSE2-NEXT: pandn %xmm0, %xmm2
+; X86-SSE2-NEXT: por %xmm1, %xmm2
+; X86-SSE2-NEXT: movd %xmm2, %eax
+; X86-SSE2-NEXT: # kill: def $al killed $al killed $eax
+; X86-SSE2-NEXT: movl %ebp, %esp
+; X86-SSE2-NEXT: popl %ebp
+; X86-SSE2-NEXT: retl
+;
+; X64-SSE2-LABEL: test_v64i8:
+; X64-SSE2: # %bb.0:
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm4
+; X64-SSE2-NEXT: pcmpgtb %xmm3, %xmm4
+; X64-SSE2-NEXT: pand %xmm4, %xmm1
+; X64-SSE2-NEXT: pandn %xmm3, %xmm4
+; X64-SSE2-NEXT: por %xmm1, %xmm4
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X64-SSE2-NEXT: pcmpgtb %xmm2, %xmm1
+; X64-SSE2-NEXT: pand %xmm1, %xmm0
+; X64-SSE2-NEXT: pandn %xmm2, %xmm1
+; X64-SSE2-NEXT: por %xmm0, %xmm1
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X64-SSE2-NEXT: pcmpgtb %xmm4, %xmm0
+; X64-SSE2-NEXT: pand %xmm0, %xmm1
+; X64-SSE2-NEXT: pandn %xmm4, %xmm0
+; X64-SSE2-NEXT: por %xmm1, %xmm0
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X64-SSE2-NEXT: pcmpgtb %xmm1, %xmm2
+; X64-SSE2-NEXT: pand %xmm2, %xmm0
+; X64-SSE2-NEXT: pandn %xmm1, %xmm2
+; X64-SSE2-NEXT: por %xmm0, %xmm2
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,1,1]
+; X64-SSE2-NEXT: movdqa %xmm2, %xmm1
+; X64-SSE2-NEXT: pcmpgtb %xmm0, %xmm1
+; X64-SSE2-NEXT: pand %xmm1, %xmm2
+; X64-SSE2-NEXT: pandn %xmm0, %xmm1
+; X64-SSE2-NEXT: por %xmm2, %xmm1
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X64-SSE2-NEXT: psrld $16, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm2
+; X64-SSE2-NEXT: pcmpgtb %xmm0, %xmm2
+; X64-SSE2-NEXT: pand %xmm2, %xmm1
+; X64-SSE2-NEXT: pandn %xmm0, %xmm2
+; X64-SSE2-NEXT: por %xmm1, %xmm2
+; X64-SSE2-NEXT: movdqa %xmm2, %xmm0
+; X64-SSE2-NEXT: psrlw $8, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm2, %xmm1
+; X64-SSE2-NEXT: pcmpgtb %xmm0, %xmm1
+; X64-SSE2-NEXT: pand %xmm1, %xmm2
+; X64-SSE2-NEXT: pandn %xmm0, %xmm1
+; X64-SSE2-NEXT: por %xmm2, %xmm1
+; X64-SSE2-NEXT: movd %xmm1, %eax
+; X64-SSE2-NEXT: # kill: def $al killed $al killed $eax
+; X64-SSE2-NEXT: retq
+;
+; X86-SSE4-LABEL: test_v64i8:
+; X86-SSE4: # %bb.0:
+; X86-SSE4-NEXT: pushl %ebp
+; X86-SSE4-NEXT: movl %esp, %ebp
+; X86-SSE4-NEXT: andl $-16, %esp
+; X86-SSE4-NEXT: subl $16, %esp
+; X86-SSE4-NEXT: pmaxsb %xmm2, %xmm0
+; X86-SSE4-NEXT: pmaxsb 8(%ebp), %xmm1
+; X86-SSE4-NEXT: pmaxsb %xmm0, %xmm1
+; X86-SSE4-NEXT: pxor {{\.?LCPI[0-9]+_[0-9]+}}, %xmm1
+; X86-SSE4-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE4-NEXT: psrlw $8, %xmm0
+; X86-SSE4-NEXT: pminub %xmm1, %xmm0
+; X86-SSE4-NEXT: phminposuw %xmm0, %xmm0
+; X86-SSE4-NEXT: movd %xmm0, %eax
+; X86-SSE4-NEXT: xorb $127, %al
+; X86-SSE4-NEXT: # kill: def $al killed $al killed $eax
+; X86-SSE4-NEXT: movl %ebp, %esp
+; X86-SSE4-NEXT: popl %ebp
+; X86-SSE4-NEXT: retl
+;
+; X64-SSE4-LABEL: test_v64i8:
+; X64-SSE4: # %bb.0:
+; X64-SSE4-NEXT: pmaxsb %xmm3, %xmm1
+; X64-SSE4-NEXT: pmaxsb %xmm2, %xmm0
+; X64-SSE4-NEXT: pmaxsb %xmm1, %xmm0
+; X64-SSE4-NEXT: pxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0
+; X64-SSE4-NEXT: movdqa %xmm0, %xmm1
+; X64-SSE4-NEXT: psrlw $8, %xmm1
+; X64-SSE4-NEXT: pminub %xmm0, %xmm1
+; X64-SSE4-NEXT: phminposuw %xmm1, %xmm0
+; X64-SSE4-NEXT: movd %xmm0, %eax
+; X64-SSE4-NEXT: xorb $127, %al
+; X64-SSE4-NEXT: # kill: def $al killed $al killed $eax
+; X64-SSE4-NEXT: retq
+;
+; X86-AVX1-LABEL: test_v64i8:
+; X86-AVX1: # %bb.0:
+; X86-AVX1-NEXT: vextractf128 $1, %ymm1, %xmm2
+; X86-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm3
+; X86-AVX1-NEXT: vpmaxsb %xmm2, %xmm3, %xmm2
+; X86-AVX1-NEXT: vpmaxsb %xmm1, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpmaxsb %xmm2, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpsrlw $8, %xmm0, %xmm1
+; X86-AVX1-NEXT: vpminub %xmm1, %xmm0, %xmm0
+; X86-AVX1-NEXT: vphminposuw %xmm0, %xmm0
+; X86-AVX1-NEXT: vmovd %xmm0, %eax
+; X86-AVX1-NEXT: xorb $127, %al
+; X86-AVX1-NEXT: # kill: def $al killed $al killed $eax
+; X86-AVX1-NEXT: vzeroupper
+; X86-AVX1-NEXT: retl
+;
+; X64-AVX1-LABEL: test_v64i8:
+; X64-AVX1: # %bb.0:
+; X64-AVX1-NEXT: vextractf128 $1, %ymm1, %xmm2
+; X64-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm3
+; X64-AVX1-NEXT: vpmaxsb %xmm2, %xmm3, %xmm2
+; X64-AVX1-NEXT: vpmaxsb %xmm1, %xmm0, %xmm0
+; X64-AVX1-NEXT: vpmaxsb %xmm2, %xmm0, %xmm0
+; X64-AVX1-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
+; X64-AVX1-NEXT: vpsrlw $8, %xmm0, %xmm1
+; X64-AVX1-NEXT: vpminub %xmm1, %xmm0, %xmm0
+; X64-AVX1-NEXT: vphminposuw %xmm0, %xmm0
+; X64-AVX1-NEXT: vmovd %xmm0, %eax
+; X64-AVX1-NEXT: xorb $127, %al
+; X64-AVX1-NEXT: # kill: def $al killed $al killed $eax
+; X64-AVX1-NEXT: vzeroupper
+; X64-AVX1-NEXT: retq
+;
+; X86-AVX2-LABEL: test_v64i8:
+; X86-AVX2: # %bb.0:
+; X86-AVX2-NEXT: vpmaxsb %ymm1, %ymm0, %ymm0
+; X86-AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
+; X86-AVX2-NEXT: vpmaxsb %xmm1, %xmm0, %xmm0
+; X86-AVX2-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}, %xmm0, %xmm0
+; X86-AVX2-NEXT: vpsrlw $8, %xmm0, %xmm1
+; X86-AVX2-NEXT: vpminub %xmm1, %xmm0, %xmm0
+; X86-AVX2-NEXT: vphminposuw %xmm0, %xmm0
+; X86-AVX2-NEXT: vmovd %xmm0, %eax
+; X86-AVX2-NEXT: xorb $127, %al
+; X86-AVX2-NEXT: # kill: def $al killed $al killed $eax
+; X86-AVX2-NEXT: vzeroupper
+; X86-AVX2-NEXT: retl
+;
+; X64-AVX2-LABEL: test_v64i8:
+; X64-AVX2: # %bb.0:
+; X64-AVX2-NEXT: vpmaxsb %ymm1, %ymm0, %ymm0
+; X64-AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
+; X64-AVX2-NEXT: vpmaxsb %xmm1, %xmm0, %xmm0
+; X64-AVX2-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
+; X64-AVX2-NEXT: vpsrlw $8, %xmm0, %xmm1
+; X64-AVX2-NEXT: vpminub %xmm1, %xmm0, %xmm0
+; X64-AVX2-NEXT: vphminposuw %xmm0, %xmm0
+; X64-AVX2-NEXT: vmovd %xmm0, %eax
+; X64-AVX2-NEXT: xorb $127, %al
+; X64-AVX2-NEXT: # kill: def $al killed $al killed $eax
+; X64-AVX2-NEXT: vzeroupper
+; X64-AVX2-NEXT: retq
;
; AVX512BW-LABEL: test_v64i8:
; AVX512BW: # %bb.0:
@@ -1964,132 +3344,287 @@ define i8 @test_v64i8(<64 x i8> %a0) {
ret i8 %1
}
-define i8 @test_v128i8(<128 x i8> %a0) {
-; SSE2-LABEL: test_v128i8:
-; SSE2: # %bb.0:
-; SSE2-NEXT: movdqa %xmm3, %xmm8
-; SSE2-NEXT: pcmpgtb %xmm7, %xmm8
-; SSE2-NEXT: pand %xmm8, %xmm3
-; SSE2-NEXT: pandn %xmm7, %xmm8
-; SSE2-NEXT: por %xmm3, %xmm8
-; SSE2-NEXT: movdqa %xmm1, %xmm3
-; SSE2-NEXT: pcmpgtb %xmm5, %xmm3
-; SSE2-NEXT: pand %xmm3, %xmm1
-; SSE2-NEXT: pandn %xmm5, %xmm3
-; SSE2-NEXT: por %xmm1, %xmm3
-; SSE2-NEXT: movdqa %xmm3, %xmm1
-; SSE2-NEXT: pcmpgtb %xmm8, %xmm1
-; SSE2-NEXT: pand %xmm1, %xmm3
-; SSE2-NEXT: pandn %xmm8, %xmm1
-; SSE2-NEXT: por %xmm3, %xmm1
-; SSE2-NEXT: movdqa %xmm2, %xmm3
-; SSE2-NEXT: pcmpgtb %xmm6, %xmm3
-; SSE2-NEXT: pand %xmm3, %xmm2
-; SSE2-NEXT: pandn %xmm6, %xmm3
-; SSE2-NEXT: por %xmm2, %xmm3
-; SSE2-NEXT: movdqa %xmm0, %xmm2
-; SSE2-NEXT: pcmpgtb %xmm4, %xmm2
-; SSE2-NEXT: pand %xmm2, %xmm0
-; SSE2-NEXT: pandn %xmm4, %xmm2
-; SSE2-NEXT: por %xmm0, %xmm2
-; SSE2-NEXT: movdqa %xmm2, %xmm0
-; SSE2-NEXT: pcmpgtb %xmm3, %xmm0
-; SSE2-NEXT: pand %xmm0, %xmm2
-; SSE2-NEXT: pandn %xmm3, %xmm0
-; SSE2-NEXT: por %xmm2, %xmm0
-; SSE2-NEXT: movdqa %xmm0, %xmm2
-; SSE2-NEXT: pcmpgtb %xmm1, %xmm2
-; SSE2-NEXT: pand %xmm2, %xmm0
-; SSE2-NEXT: pandn %xmm1, %xmm2
-; SSE2-NEXT: por %xmm0, %xmm2
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm2[2,3,2,3]
-; SSE2-NEXT: movdqa %xmm2, %xmm1
-; SSE2-NEXT: pcmpgtb %xmm0, %xmm1
-; SSE2-NEXT: pand %xmm1, %xmm2
-; SSE2-NEXT: pandn %xmm0, %xmm1
-; SSE2-NEXT: por %xmm2, %xmm1
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
-; SSE2-NEXT: movdqa %xmm1, %xmm2
-; SSE2-NEXT: pcmpgtb %xmm0, %xmm2
-; SSE2-NEXT: pand %xmm2, %xmm1
-; SSE2-NEXT: pandn %xmm0, %xmm2
-; SSE2-NEXT: por %xmm1, %xmm2
-; SSE2-NEXT: movdqa %xmm2, %xmm0
-; SSE2-NEXT: psrld $16, %xmm0
-; SSE2-NEXT: movdqa %xmm2, %xmm1
-; SSE2-NEXT: pcmpgtb %xmm0, %xmm1
-; SSE2-NEXT: pand %xmm1, %xmm2
-; SSE2-NEXT: pandn %xmm0, %xmm1
-; SSE2-NEXT: por %xmm2, %xmm1
-; SSE2-NEXT: movdqa %xmm1, %xmm0
-; SSE2-NEXT: psrlw $8, %xmm0
-; SSE2-NEXT: movdqa %xmm1, %xmm2
-; SSE2-NEXT: pcmpgtb %xmm0, %xmm2
-; SSE2-NEXT: pand %xmm2, %xmm1
-; SSE2-NEXT: pandn %xmm0, %xmm2
-; SSE2-NEXT: por %xmm1, %xmm2
-; SSE2-NEXT: movd %xmm2, %eax
-; SSE2-NEXT: # kill: def $al killed $al killed $eax
-; SSE2-NEXT: retq
-;
-; SSE4-LABEL: test_v128i8:
-; SSE4: # %bb.0:
-; SSE4-NEXT: pmaxsb %xmm7, %xmm3
-; SSE4-NEXT: pmaxsb %xmm5, %xmm1
-; SSE4-NEXT: pmaxsb %xmm3, %xmm1
-; SSE4-NEXT: pmaxsb %xmm6, %xmm2
-; SSE4-NEXT: pmaxsb %xmm4, %xmm0
-; SSE4-NEXT: pmaxsb %xmm2, %xmm0
-; SSE4-NEXT: pmaxsb %xmm1, %xmm0
-; SSE4-NEXT: pxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0
-; SSE4-NEXT: movdqa %xmm0, %xmm1
-; SSE4-NEXT: psrlw $8, %xmm1
-; SSE4-NEXT: pminub %xmm0, %xmm1
-; SSE4-NEXT: phminposuw %xmm1, %xmm0
-; SSE4-NEXT: movd %xmm0, %eax
-; SSE4-NEXT: xorb $127, %al
-; SSE4-NEXT: # kill: def $al killed $al killed $eax
-; SSE4-NEXT: retq
-;
-; AVX1-LABEL: test_v128i8:
-; AVX1: # %bb.0:
-; AVX1-NEXT: vextractf128 $1, %ymm3, %xmm4
-; AVX1-NEXT: vextractf128 $1, %ymm1, %xmm5
-; AVX1-NEXT: vpmaxsb %xmm4, %xmm5, %xmm4
-; AVX1-NEXT: vextractf128 $1, %ymm2, %xmm5
-; AVX1-NEXT: vextractf128 $1, %ymm0, %xmm6
-; AVX1-NEXT: vpmaxsb %xmm5, %xmm6, %xmm5
-; AVX1-NEXT: vpmaxsb %xmm4, %xmm5, %xmm4
-; AVX1-NEXT: vpmaxsb %xmm3, %xmm1, %xmm1
-; AVX1-NEXT: vpmaxsb %xmm2, %xmm0, %xmm0
-; AVX1-NEXT: vpmaxsb %xmm1, %xmm0, %xmm0
-; AVX1-NEXT: vpmaxsb %xmm4, %xmm0, %xmm0
-; AVX1-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
-; AVX1-NEXT: vpsrlw $8, %xmm0, %xmm1
-; AVX1-NEXT: vpminub %xmm1, %xmm0, %xmm0
-; AVX1-NEXT: vphminposuw %xmm0, %xmm0
-; AVX1-NEXT: vmovd %xmm0, %eax
-; AVX1-NEXT: xorb $127, %al
-; AVX1-NEXT: # kill: def $al killed $al killed $eax
-; AVX1-NEXT: vzeroupper
-; AVX1-NEXT: retq
-;
-; AVX2-LABEL: test_v128i8:
-; AVX2: # %bb.0:
-; AVX2-NEXT: vpmaxsb %ymm3, %ymm1, %ymm1
-; AVX2-NEXT: vpmaxsb %ymm2, %ymm0, %ymm0
-; AVX2-NEXT: vpmaxsb %ymm1, %ymm0, %ymm0
-; AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
-; AVX2-NEXT: vpmaxsb %xmm1, %xmm0, %xmm0
-; AVX2-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
-; AVX2-NEXT: vpsrlw $8, %xmm0, %xmm1
-; AVX2-NEXT: vpminub %xmm1, %xmm0, %xmm0
-; AVX2-NEXT: vphminposuw %xmm0, %xmm0
-; AVX2-NEXT: vmovd %xmm0, %eax
-; AVX2-NEXT: xorb $127, %al
-; AVX2-NEXT: # kill: def $al killed $al killed $eax
-; AVX2-NEXT: vzeroupper
-; AVX2-NEXT: retq
+define i8 @test_v128i8(<128 x i8> %a0) nounwind {
+; X86-SSE2-LABEL: test_v128i8:
+; X86-SSE2: # %bb.0:
+; X86-SSE2-NEXT: pushl %ebp
+; X86-SSE2-NEXT: movl %esp, %ebp
+; X86-SSE2-NEXT: andl $-16, %esp
+; X86-SSE2-NEXT: subl $16, %esp
+; X86-SSE2-NEXT: movdqa 72(%ebp), %xmm4
+; X86-SSE2-NEXT: movdqa 8(%ebp), %xmm5
+; X86-SSE2-NEXT: movdqa %xmm5, %xmm3
+; X86-SSE2-NEXT: pcmpgtb %xmm4, %xmm3
+; X86-SSE2-NEXT: pand %xmm3, %xmm5
+; X86-SSE2-NEXT: pandn %xmm4, %xmm3
+; X86-SSE2-NEXT: movdqa 40(%ebp), %xmm4
+; X86-SSE2-NEXT: por %xmm5, %xmm3
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm5
+; X86-SSE2-NEXT: pcmpgtb %xmm4, %xmm5
+; X86-SSE2-NEXT: pand %xmm5, %xmm1
+; X86-SSE2-NEXT: pandn %xmm4, %xmm5
+; X86-SSE2-NEXT: por %xmm1, %xmm5
+; X86-SSE2-NEXT: movdqa %xmm5, %xmm1
+; X86-SSE2-NEXT: pcmpgtb %xmm3, %xmm1
+; X86-SSE2-NEXT: pand %xmm1, %xmm5
+; X86-SSE2-NEXT: pandn %xmm3, %xmm1
+; X86-SSE2-NEXT: movdqa 56(%ebp), %xmm4
+; X86-SSE2-NEXT: por %xmm5, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm3
+; X86-SSE2-NEXT: pcmpgtb %xmm4, %xmm3
+; X86-SSE2-NEXT: pand %xmm3, %xmm2
+; X86-SSE2-NEXT: pandn %xmm4, %xmm3
+; X86-SSE2-NEXT: movdqa 24(%ebp), %xmm4
+; X86-SSE2-NEXT: por %xmm2, %xmm3
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE2-NEXT: pcmpgtb %xmm4, %xmm2
+; X86-SSE2-NEXT: pand %xmm2, %xmm0
+; X86-SSE2-NEXT: pandn %xmm4, %xmm2
+; X86-SSE2-NEXT: por %xmm0, %xmm2
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm0
+; X86-SSE2-NEXT: pcmpgtb %xmm3, %xmm0
+; X86-SSE2-NEXT: pand %xmm0, %xmm2
+; X86-SSE2-NEXT: pandn %xmm3, %xmm0
+; X86-SSE2-NEXT: por %xmm2, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE2-NEXT: pcmpgtb %xmm1, %xmm2
+; X86-SSE2-NEXT: pand %xmm2, %xmm0
+; X86-SSE2-NEXT: pandn %xmm1, %xmm2
+; X86-SSE2-NEXT: por %xmm0, %xmm2
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm2[2,3,2,3]
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm1
+; X86-SSE2-NEXT: pcmpgtb %xmm0, %xmm1
+; X86-SSE2-NEXT: pand %xmm1, %xmm2
+; X86-SSE2-NEXT: pandn %xmm0, %xmm1
+; X86-SSE2-NEXT: por %xmm2, %xmm1
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm1[1,1,1,1]
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE2-NEXT: pcmpgtb %xmm2, %xmm0
+; X86-SSE2-NEXT: pand %xmm0, %xmm1
+; X86-SSE2-NEXT: pandn %xmm2, %xmm0
+; X86-SSE2-NEXT: por %xmm1, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE2-NEXT: psrld $16, %xmm2
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X86-SSE2-NEXT: pcmpgtb %xmm2, %xmm1
+; X86-SSE2-NEXT: pand %xmm1, %xmm0
+; X86-SSE2-NEXT: pandn %xmm2, %xmm1
+; X86-SSE2-NEXT: por %xmm0, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE2-NEXT: psrlw $8, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm2
+; X86-SSE2-NEXT: pcmpgtb %xmm0, %xmm2
+; X86-SSE2-NEXT: pand %xmm2, %xmm1
+; X86-SSE2-NEXT: pandn %xmm0, %xmm2
+; X86-SSE2-NEXT: por %xmm1, %xmm2
+; X86-SSE2-NEXT: movd %xmm2, %eax
+; X86-SSE2-NEXT: # kill: def $al killed $al killed $eax
+; X86-SSE2-NEXT: movl %ebp, %esp
+; X86-SSE2-NEXT: popl %ebp
+; X86-SSE2-NEXT: retl
+;
+; X64-SSE2-LABEL: test_v128i8:
+; X64-SSE2: # %bb.0:
+; X64-SSE2-NEXT: movdqa %xmm3, %xmm8
+; X64-SSE2-NEXT: pcmpgtb %xmm7, %xmm8
+; X64-SSE2-NEXT: pand %xmm8, %xmm3
+; X64-SSE2-NEXT: pandn %xmm7, %xmm8
+; X64-SSE2-NEXT: por %xmm3, %xmm8
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm3
+; X64-SSE2-NEXT: pcmpgtb %xmm5, %xmm3
+; X64-SSE2-NEXT: pand %xmm3, %xmm1
+; X64-SSE2-NEXT: pandn %xmm5, %xmm3
+; X64-SSE2-NEXT: por %xmm1, %xmm3
+; X64-SSE2-NEXT: movdqa %xmm3, %xmm1
+; X64-SSE2-NEXT: pcmpgtb %xmm8, %xmm1
+; X64-SSE2-NEXT: pand %xmm1, %xmm3
+; X64-SSE2-NEXT: pandn %xmm8, %xmm1
+; X64-SSE2-NEXT: por %xmm3, %xmm1
+; X64-SSE2-NEXT: movdqa %xmm2, %xmm3
+; X64-SSE2-NEXT: pcmpgtb %xmm6, %xmm3
+; X64-SSE2-NEXT: pand %xmm3, %xmm2
+; X64-SSE2-NEXT: pandn %xmm6, %xmm3
+; X64-SSE2-NEXT: por %xmm2, %xmm3
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X64-SSE2-NEXT: pcmpgtb %xmm4, %xmm2
+; X64-SSE2-NEXT: pand %xmm2, %xmm0
+; X64-SSE2-NEXT: pandn %xmm4, %xmm2
+; X64-SSE2-NEXT: por %xmm0, %xmm2
+; X64-SSE2-NEXT: movdqa %xmm2, %xmm0
+; X64-SSE2-NEXT: pcmpgtb %xmm3, %xmm0
+; X64-SSE2-NEXT: pand %xmm0, %xmm2
+; X64-SSE2-NEXT: pandn %xmm3, %xmm0
+; X64-SSE2-NEXT: por %xmm2, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X64-SSE2-NEXT: pcmpgtb %xmm1, %xmm2
+; X64-SSE2-NEXT: pand %xmm2, %xmm0
+; X64-SSE2-NEXT: pandn %xmm1, %xmm2
+; X64-SSE2-NEXT: por %xmm0, %xmm2
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm2[2,3,2,3]
+; X64-SSE2-NEXT: movdqa %xmm2, %xmm1
+; X64-SSE2-NEXT: pcmpgtb %xmm0, %xmm1
+; X64-SSE2-NEXT: pand %xmm1, %xmm2
+; X64-SSE2-NEXT: pandn %xmm0, %xmm1
+; X64-SSE2-NEXT: por %xmm2, %xmm1
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm2
+; X64-SSE2-NEXT: pcmpgtb %xmm0, %xmm2
+; X64-SSE2-NEXT: pand %xmm2, %xmm1
+; X64-SSE2-NEXT: pandn %xmm0, %xmm2
+; X64-SSE2-NEXT: por %xmm1, %xmm2
+; X64-SSE2-NEXT: movdqa %xmm2, %xmm0
+; X64-SSE2-NEXT: psrld $16, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm2, %xmm1
+; X64-SSE2-NEXT: pcmpgtb %xmm0, %xmm1
+; X64-SSE2-NEXT: pand %xmm1, %xmm2
+; X64-SSE2-NEXT: pandn %xmm0, %xmm1
+; X64-SSE2-NEXT: por %xmm2, %xmm1
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X64-SSE2-NEXT: psrlw $8, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm2
+; X64-SSE2-NEXT: pcmpgtb %xmm0, %xmm2
+; X64-SSE2-NEXT: pand %xmm2, %xmm1
+; X64-SSE2-NEXT: pandn %xmm0, %xmm2
+; X64-SSE2-NEXT: por %xmm1, %xmm2
+; X64-SSE2-NEXT: movd %xmm2, %eax
+; X64-SSE2-NEXT: # kill: def $al killed $al killed $eax
+; X64-SSE2-NEXT: retq
+;
+; X86-SSE4-LABEL: test_v128i8:
+; X86-SSE4: # %bb.0:
+; X86-SSE4-NEXT: pushl %ebp
+; X86-SSE4-NEXT: movl %esp, %ebp
+; X86-SSE4-NEXT: andl $-16, %esp
+; X86-SSE4-NEXT: subl $16, %esp
+; X86-SSE4-NEXT: movdqa 8(%ebp), %xmm3
+; X86-SSE4-NEXT: pmaxsb 72(%ebp), %xmm3
+; X86-SSE4-NEXT: pmaxsb 40(%ebp), %xmm1
+; X86-SSE4-NEXT: pmaxsb %xmm3, %xmm1
+; X86-SSE4-NEXT: pmaxsb 56(%ebp), %xmm2
+; X86-SSE4-NEXT: pmaxsb 24(%ebp), %xmm0
+; X86-SSE4-NEXT: pmaxsb %xmm2, %xmm0
+; X86-SSE4-NEXT: pmaxsb %xmm1, %xmm0
+; X86-SSE4-NEXT: pxor {{\.?LCPI[0-9]+_[0-9]+}}, %xmm0
+; X86-SSE4-NEXT: movdqa %xmm0, %xmm1
+; X86-SSE4-NEXT: psrlw $8, %xmm1
+; X86-SSE4-NEXT: pminub %xmm0, %xmm1
+; X86-SSE4-NEXT: phminposuw %xmm1, %xmm0
+; X86-SSE4-NEXT: movd %xmm0, %eax
+; X86-SSE4-NEXT: xorb $127, %al
+; X86-SSE4-NEXT: # kill: def $al killed $al killed $eax
+; X86-SSE4-NEXT: movl %ebp, %esp
+; X86-SSE4-NEXT: popl %ebp
+; X86-SSE4-NEXT: retl
+;
+; X64-SSE4-LABEL: test_v128i8:
+; X64-SSE4: # %bb.0:
+; X64-SSE4-NEXT: pmaxsb %xmm7, %xmm3
+; X64-SSE4-NEXT: pmaxsb %xmm5, %xmm1
+; X64-SSE4-NEXT: pmaxsb %xmm3, %xmm1
+; X64-SSE4-NEXT: pmaxsb %xmm6, %xmm2
+; X64-SSE4-NEXT: pmaxsb %xmm4, %xmm0
+; X64-SSE4-NEXT: pmaxsb %xmm2, %xmm0
+; X64-SSE4-NEXT: pmaxsb %xmm1, %xmm0
+; X64-SSE4-NEXT: pxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0
+; X64-SSE4-NEXT: movdqa %xmm0, %xmm1
+; X64-SSE4-NEXT: psrlw $8, %xmm1
+; X64-SSE4-NEXT: pminub %xmm0, %xmm1
+; X64-SSE4-NEXT: phminposuw %xmm1, %xmm0
+; X64-SSE4-NEXT: movd %xmm0, %eax
+; X64-SSE4-NEXT: xorb $127, %al
+; X64-SSE4-NEXT: # kill: def $al killed $al killed $eax
+; X64-SSE4-NEXT: retq
+;
+; X86-AVX1-LABEL: test_v128i8:
+; X86-AVX1: # %bb.0:
+; X86-AVX1-NEXT: pushl %ebp
+; X86-AVX1-NEXT: movl %esp, %ebp
+; X86-AVX1-NEXT: andl $-32, %esp
+; X86-AVX1-NEXT: subl $32, %esp
+; X86-AVX1-NEXT: vextractf128 $1, %ymm2, %xmm3
+; X86-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm4
+; X86-AVX1-NEXT: vpmaxsb %xmm3, %xmm4, %xmm3
+; X86-AVX1-NEXT: vextractf128 $1, %ymm1, %xmm4
+; X86-AVX1-NEXT: vpmaxsb 24(%ebp), %xmm4, %xmm4
+; X86-AVX1-NEXT: vpmaxsb %xmm4, %xmm3, %xmm3
+; X86-AVX1-NEXT: vpmaxsb %xmm2, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpmaxsb 8(%ebp), %xmm1, %xmm1
+; X86-AVX1-NEXT: vpmaxsb %xmm1, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpmaxsb %xmm3, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpsrlw $8, %xmm0, %xmm1
+; X86-AVX1-NEXT: vpminub %xmm1, %xmm0, %xmm0
+; X86-AVX1-NEXT: vphminposuw %xmm0, %xmm0
+; X86-AVX1-NEXT: vmovd %xmm0, %eax
+; X86-AVX1-NEXT: xorb $127, %al
+; X86-AVX1-NEXT: # kill: def $al killed $al killed $eax
+; X86-AVX1-NEXT: movl %ebp, %esp
+; X86-AVX1-NEXT: popl %ebp
+; X86-AVX1-NEXT: vzeroupper
+; X86-AVX1-NEXT: retl
+;
+; X64-AVX1-LABEL: test_v128i8:
+; X64-AVX1: # %bb.0:
+; X64-AVX1-NEXT: vextractf128 $1, %ymm3, %xmm4
+; X64-AVX1-NEXT: vextractf128 $1, %ymm1, %xmm5
+; X64-AVX1-NEXT: vpmaxsb %xmm4, %xmm5, %xmm4
+; X64-AVX1-NEXT: vextractf128 $1, %ymm2, %xmm5
+; X64-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm6
+; X64-AVX1-NEXT: vpmaxsb %xmm5, %xmm6, %xmm5
+; X64-AVX1-NEXT: vpmaxsb %xmm4, %xmm5, %xmm4
+; X64-AVX1-NEXT: vpmaxsb %xmm3, %xmm1, %xmm1
+; X64-AVX1-NEXT: vpmaxsb %xmm2, %xmm0, %xmm0
+; X64-AVX1-NEXT: vpmaxsb %xmm1, %xmm0, %xmm0
+; X64-AVX1-NEXT: vpmaxsb %xmm4, %xmm0, %xmm0
+; X64-AVX1-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
+; X64-AVX1-NEXT: vpsrlw $8, %xmm0, %xmm1
+; X64-AVX1-NEXT: vpminub %xmm1, %xmm0, %xmm0
+; X64-AVX1-NEXT: vphminposuw %xmm0, %xmm0
+; X64-AVX1-NEXT: vmovd %xmm0, %eax
+; X64-AVX1-NEXT: xorb $127, %al
+; X64-AVX1-NEXT: # kill: def $al killed $al killed $eax
+; X64-AVX1-NEXT: vzeroupper
+; X64-AVX1-NEXT: retq
+;
+; X86-AVX2-LABEL: test_v128i8:
+; X86-AVX2: # %bb.0:
+; X86-AVX2-NEXT: pushl %ebp
+; X86-AVX2-NEXT: movl %esp, %ebp
+; X86-AVX2-NEXT: andl $-32, %esp
+; X86-AVX2-NEXT: subl $32, %esp
+; X86-AVX2-NEXT: vpmaxsb %ymm2, %ymm0, %ymm0
+; X86-AVX2-NEXT: vpmaxsb 8(%ebp), %ymm1, %ymm1
+; X86-AVX2-NEXT: vpmaxsb %ymm1, %ymm0, %ymm0
+; X86-AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
+; X86-AVX2-NEXT: vpmaxsb %xmm1, %xmm0, %xmm0
+; X86-AVX2-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}, %xmm0, %xmm0
+; X86-AVX2-NEXT: vpsrlw $8, %xmm0, %xmm1
+; X86-AVX2-NEXT: vpminub %xmm1, %xmm0, %xmm0
+; X86-AVX2-NEXT: vphminposuw %xmm0, %xmm0
+; X86-AVX2-NEXT: vmovd %xmm0, %eax
+; X86-AVX2-NEXT: xorb $127, %al
+; X86-AVX2-NEXT: # kill: def $al killed $al killed $eax
+; X86-AVX2-NEXT: movl %ebp, %esp
+; X86-AVX2-NEXT: popl %ebp
+; X86-AVX2-NEXT: vzeroupper
+; X86-AVX2-NEXT: retl
+;
+; X64-AVX2-LABEL: test_v128i8:
+; X64-AVX2: # %bb.0:
+; X64-AVX2-NEXT: vpmaxsb %ymm3, %ymm1, %ymm1
+; X64-AVX2-NEXT: vpmaxsb %ymm2, %ymm0, %ymm0
+; X64-AVX2-NEXT: vpmaxsb %ymm1, %ymm0, %ymm0
+; X64-AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
+; X64-AVX2-NEXT: vpmaxsb %xmm1, %xmm0, %xmm0
+; X64-AVX2-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
+; X64-AVX2-NEXT: vpsrlw $8, %xmm0, %xmm1
+; X64-AVX2-NEXT: vpminub %xmm1, %xmm0, %xmm0
+; X64-AVX2-NEXT: vphminposuw %xmm0, %xmm0
+; X64-AVX2-NEXT: vmovd %xmm0, %eax
+; X64-AVX2-NEXT: xorb $127, %al
+; X64-AVX2-NEXT: # kill: def $al killed $al killed $eax
+; X64-AVX2-NEXT: vzeroupper
+; X64-AVX2-NEXT: retq
;
; AVX512BW-LABEL: test_v128i8:
; AVX512BW: # %bb.0:
diff --git a/llvm/test/CodeGen/X86/vector-reduce-smin.ll b/llvm/test/CodeGen/X86/vector-reduce-smin.ll
index 4caa269d8b1a3..c010290c0d60d 100644
--- a/llvm/test/CodeGen/X86/vector-reduce-smin.ll
+++ b/llvm/test/CodeGen/X86/vector-reduce-smin.ll
@@ -1,63 +1,132 @@
; NOTE: Assertions have been autogenerated by utils/update_llc_test_checks.py
-; RUN: llc < %s -mtriple=x86_64-unknown-unknown -mattr=+sse2 | FileCheck %s --check-prefixes=SSE,SSE2
-; RUN: llc < %s -mtriple=x86_64-unknown-unknown -mattr=+sse4.1 | FileCheck %s --check-prefixes=SSE,SSE4,SSE41
-; RUN: llc < %s -mtriple=x86_64-unknown-unknown -mattr=+sse4.2 | FileCheck %s --check-prefixes=SSE,SSE4,SSE42
-; RUN: llc < %s -mtriple=x86_64-unknown-unknown -mattr=+avx | FileCheck %s --check-prefixes=AVX,AVX1
-; RUN: llc < %s -mtriple=x86_64-unknown-unknown -mattr=+avx2 | FileCheck %s --check-prefixes=AVX,AVX2
-; RUN: llc < %s -mtriple=x86_64-unknown-unknown -mattr=+avx512f,+avx512bw | FileCheck %s --check-prefixes=AVX512,AVX512BW
-; RUN: llc < %s -mtriple=x86_64-unknown-unknown -mattr=+avx512f,+avx512bw,+avx512vl | FileCheck %s --check-prefixes=AVX512,AVX512VL
+; RUN: llc < %s -mtriple=i686-- -mattr=+sse2 | FileCheck %s --check-prefixes=SSE,SSE2,X86-SSE2
+; RUN: llc < %s -mtriple=x86_64-- -mattr=+sse2 | FileCheck %s --check-prefixes=SSE,SSE2,X64-SSE2
+; RUN: llc < %s -mtriple=i686-- -mattr=+sse4.1 | FileCheck %s --check-prefixes=SSE,SSE4,X86-SSE4,X86-SSE41
+; RUN: llc < %s -mtriple=x86_64-- -mattr=+sse4.1 | FileCheck %s --check-prefixes=SSE,SSE4,X64-SSE4,X64-SSE41
+; RUN: llc < %s -mtriple=i686-- -mattr=+sse4.2 | FileCheck %s --check-prefixes=SSE,SSE4,X86-SSE4,X86-SSE42
+; RUN: llc < %s -mtriple=x86_64-- -mattr=+sse4.2 | FileCheck %s --check-prefixes=SSE,SSE4,X64-SSE4,X64-SSE42
+; RUN: llc < %s -mtriple=i686-- -mattr=+avx | FileCheck %s --check-prefixes=AVX,AVX1,X86-AVX,X86-AVX1
+; RUN: llc < %s -mtriple=x86_64-- -mattr=+avx | FileCheck %s --check-prefixes=AVX,AVX1,X64-AVX,X64-AVX1
+; RUN: llc < %s -mtriple=i686-- -mattr=+avx2 | FileCheck %s --check-prefixes=AVX,AVX2,X86-AVX,X86-AVX2
+; RUN: llc < %s -mtriple=x86_64-- -mattr=+avx2 | FileCheck %s --check-prefixes=AVX,AVX2,X64-AVX,X64-AVX2
+; RUN: llc < %s -mtriple=x86_64-- -mattr=+avx512f,+avx512bw | FileCheck %s --check-prefixes=AVX,AVX512,AVX512BW
+; RUN: llc < %s -mtriple=x86_64-- -mattr=+avx512f,+avx512bw,+avx512dq,+avx512vl | FileCheck %s --check-prefixes=AVX,AVX512,AVX512VL
;
; vXi64
;
-define i64 @test_v2i64(<2 x i64> %a0) {
-; SSE2-LABEL: test_v2i64:
-; SSE2: # %bb.0:
-; SSE2-NEXT: movq %xmm0, %rcx
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm0[2,3,2,3]
-; SSE2-NEXT: movq %xmm0, %rax
-; SSE2-NEXT: cmpq %rax, %rcx
-; SSE2-NEXT: cmovlq %rcx, %rax
-; SSE2-NEXT: retq
-;
-; SSE41-LABEL: test_v2i64:
-; SSE41: # %bb.0:
-; SSE41-NEXT: movdqa %xmm0, %xmm1
-; SSE41-NEXT: pmovzxdq {{.*#+}} xmm0 = [2147483648,2147483648]
-; SSE41-NEXT: movdqa %xmm1, %xmm2
-; SSE41-NEXT: pxor %xmm0, %xmm2
-; SSE41-NEXT: pshufd {{.*#+}} xmm3 = xmm1[2,3,2,3]
-; SSE41-NEXT: pxor %xmm3, %xmm0
-; SSE41-NEXT: movdqa %xmm0, %xmm4
-; SSE41-NEXT: pcmpgtd %xmm2, %xmm4
-; SSE41-NEXT: pmovsxdq %xmm4, %xmm5
-; SSE41-NEXT: pcmpeqd %xmm2, %xmm0
-; SSE41-NEXT: pshufd {{.*#+}} xmm2 = xmm0[1,1,3,3]
-; SSE41-NEXT: pand %xmm5, %xmm2
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm4[1,1,3,3]
-; SSE41-NEXT: por %xmm2, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm1, %xmm3
-; SSE41-NEXT: movq %xmm3, %rax
-; SSE41-NEXT: retq
-;
-; SSE42-LABEL: test_v2i64:
-; SSE42: # %bb.0:
-; SSE42-NEXT: movdqa %xmm0, %xmm1
-; SSE42-NEXT: pshufd {{.*#+}} xmm2 = xmm0[2,3,2,3]
-; SSE42-NEXT: movdqa %xmm2, %xmm0
-; SSE42-NEXT: pcmpgtq %xmm1, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm1, %xmm2
-; SSE42-NEXT: movq %xmm2, %rax
-; SSE42-NEXT: retq
-;
-; AVX-LABEL: test_v2i64:
-; AVX: # %bb.0:
-; AVX-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
-; AVX-NEXT: vpcmpgtq %xmm0, %xmm1, %xmm2
-; AVX-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
-; AVX-NEXT: vmovq %xmm0, %rax
-; AVX-NEXT: retq
+define i64 @test_v2i64(<2 x i64> %a0) nounwind {
+; X86-SSE2-LABEL: test_v2i64:
+; X86-SSE2: # %bb.0:
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-SSE2-NEXT: movdqa {{.*#+}} xmm2 = [2147483648,0,2147483648,0]
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm3
+; X86-SSE2-NEXT: pxor %xmm2, %xmm3
+; X86-SSE2-NEXT: pxor %xmm1, %xmm2
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm4
+; X86-SSE2-NEXT: pcmpgtd %xmm3, %xmm4
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm5 = xmm4[0,0,2,2]
+; X86-SSE2-NEXT: pcmpeqd %xmm3, %xmm2
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm2[1,1,3,3]
+; X86-SSE2-NEXT: pand %xmm5, %xmm2
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm3 = xmm4[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm2, %xmm3
+; X86-SSE2-NEXT: pand %xmm3, %xmm0
+; X86-SSE2-NEXT: pandn %xmm1, %xmm3
+; X86-SSE2-NEXT: por %xmm0, %xmm3
+; X86-SSE2-NEXT: movd %xmm3, %eax
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm3[1,1,1,1]
+; X86-SSE2-NEXT: movd %xmm0, %edx
+; X86-SSE2-NEXT: retl
+;
+; X64-SSE2-LABEL: test_v2i64:
+; X64-SSE2: # %bb.0:
+; X64-SSE2-NEXT: movq %xmm0, %rcx
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm0[2,3,2,3]
+; X64-SSE2-NEXT: movq %xmm0, %rax
+; X64-SSE2-NEXT: cmpq %rax, %rcx
+; X64-SSE2-NEXT: cmovlq %rcx, %rax
+; X64-SSE2-NEXT: retq
+;
+; X86-SSE41-LABEL: test_v2i64:
+; X86-SSE41: # %bb.0:
+; X86-SSE41-NEXT: movdqa %xmm0, %xmm1
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm2 = xmm0[2,3,2,3]
+; X86-SSE41-NEXT: pmovzxdq {{.*#+}} xmm0 = [2147483648,2147483648]
+; X86-SSE41-NEXT: movdqa %xmm1, %xmm3
+; X86-SSE41-NEXT: pxor %xmm0, %xmm3
+; X86-SSE41-NEXT: pxor %xmm2, %xmm0
+; X86-SSE41-NEXT: movdqa %xmm0, %xmm4
+; X86-SSE41-NEXT: pcmpgtd %xmm3, %xmm4
+; X86-SSE41-NEXT: pmovsxdq %xmm4, %xmm5
+; X86-SSE41-NEXT: pcmpeqd %xmm3, %xmm0
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm3 = xmm0[1,1,3,3]
+; X86-SSE41-NEXT: pand %xmm5, %xmm3
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm4[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm3, %xmm0
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm1, %xmm2
+; X86-SSE41-NEXT: movd %xmm2, %eax
+; X86-SSE41-NEXT: pextrd $1, %xmm2, %edx
+; X86-SSE41-NEXT: retl
+;
+; X64-SSE41-LABEL: test_v2i64:
+; X64-SSE41: # %bb.0:
+; X64-SSE41-NEXT: movdqa %xmm0, %xmm1
+; X64-SSE41-NEXT: pmovzxdq {{.*#+}} xmm0 = [2147483648,2147483648]
+; X64-SSE41-NEXT: movdqa %xmm1, %xmm2
+; X64-SSE41-NEXT: pxor %xmm0, %xmm2
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm3 = xmm1[2,3,2,3]
+; X64-SSE41-NEXT: pxor %xmm3, %xmm0
+; X64-SSE41-NEXT: movdqa %xmm0, %xmm4
+; X64-SSE41-NEXT: pcmpgtd %xmm2, %xmm4
+; X64-SSE41-NEXT: pmovsxdq %xmm4, %xmm5
+; X64-SSE41-NEXT: pcmpeqd %xmm2, %xmm0
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm2 = xmm0[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm5, %xmm2
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm4[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm2, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm1, %xmm3
+; X64-SSE41-NEXT: movq %xmm3, %rax
+; X64-SSE41-NEXT: retq
+;
+; X86-SSE42-LABEL: test_v2i64:
+; X86-SSE42: # %bb.0:
+; X86-SSE42-NEXT: movdqa %xmm0, %xmm1
+; X86-SSE42-NEXT: pshufd {{.*#+}} xmm2 = xmm0[2,3,2,3]
+; X86-SSE42-NEXT: movdqa %xmm2, %xmm0
+; X86-SSE42-NEXT: pcmpgtq %xmm1, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm1, %xmm2
+; X86-SSE42-NEXT: movd %xmm2, %eax
+; X86-SSE42-NEXT: pextrd $1, %xmm2, %edx
+; X86-SSE42-NEXT: retl
+;
+; X64-SSE42-LABEL: test_v2i64:
+; X64-SSE42: # %bb.0:
+; X64-SSE42-NEXT: movdqa %xmm0, %xmm1
+; X64-SSE42-NEXT: pshufd {{.*#+}} xmm2 = xmm0[2,3,2,3]
+; X64-SSE42-NEXT: movdqa %xmm2, %xmm0
+; X64-SSE42-NEXT: pcmpgtq %xmm1, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm1, %xmm2
+; X64-SSE42-NEXT: movq %xmm2, %rax
+; X64-SSE42-NEXT: retq
+;
+; X86-AVX-LABEL: test_v2i64:
+; X86-AVX: # %bb.0:
+; X86-AVX-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-AVX-NEXT: vpcmpgtq %xmm0, %xmm1, %xmm2
+; X86-AVX-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X86-AVX-NEXT: vmovd %xmm0, %eax
+; X86-AVX-NEXT: vpextrd $1, %xmm0, %edx
+; X86-AVX-NEXT: retl
+;
+; X64-AVX-LABEL: test_v2i64:
+; X64-AVX: # %bb.0:
+; X64-AVX-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X64-AVX-NEXT: vpcmpgtq %xmm0, %xmm1, %xmm2
+; X64-AVX-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X64-AVX-NEXT: vmovq %xmm0, %rax
+; X64-AVX-NEXT: retq
;
; AVX512BW-LABEL: test_v2i64:
; AVX512BW: # %bb.0:
@@ -78,99 +147,210 @@ define i64 @test_v2i64(<2 x i64> %a0) {
ret i64 %1
}
-define i64 @test_v4i64(<4 x i64> %a0) {
-; SSE2-LABEL: test_v4i64:
-; SSE2: # %bb.0:
-; SSE2-NEXT: movdqa {{.*#+}} xmm2 = [2147483648,2147483648]
-; SSE2-NEXT: movdqa %xmm0, %xmm3
-; SSE2-NEXT: pxor %xmm2, %xmm3
-; SSE2-NEXT: pxor %xmm1, %xmm2
-; SSE2-NEXT: movdqa %xmm2, %xmm4
-; SSE2-NEXT: pcmpgtd %xmm3, %xmm4
-; SSE2-NEXT: pshufd {{.*#+}} xmm5 = xmm4[0,0,2,2]
-; SSE2-NEXT: pcmpeqd %xmm3, %xmm2
-; SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm2[1,1,3,3]
-; SSE2-NEXT: pand %xmm5, %xmm2
-; SSE2-NEXT: pshufd {{.*#+}} xmm3 = xmm4[1,1,3,3]
-; SSE2-NEXT: por %xmm2, %xmm3
-; SSE2-NEXT: pand %xmm3, %xmm0
-; SSE2-NEXT: pandn %xmm1, %xmm3
-; SSE2-NEXT: por %xmm0, %xmm3
-; SSE2-NEXT: movq %xmm3, %rcx
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm3[2,3,2,3]
-; SSE2-NEXT: movq %xmm0, %rax
-; SSE2-NEXT: cmpq %rax, %rcx
-; SSE2-NEXT: cmovlq %rcx, %rax
-; SSE2-NEXT: retq
-;
-; SSE41-LABEL: test_v4i64:
-; SSE41: # %bb.0:
-; SSE41-NEXT: movdqa %xmm0, %xmm2
-; SSE41-NEXT: pmovzxdq {{.*#+}} xmm3 = [2147483648,2147483648]
-; SSE41-NEXT: pxor %xmm3, %xmm0
-; SSE41-NEXT: movdqa %xmm1, %xmm4
-; SSE41-NEXT: pxor %xmm3, %xmm4
-; SSE41-NEXT: movdqa %xmm4, %xmm5
-; SSE41-NEXT: pcmpgtd %xmm0, %xmm5
-; SSE41-NEXT: pshufd {{.*#+}} xmm6 = xmm5[0,0,2,2]
-; SSE41-NEXT: pcmpeqd %xmm0, %xmm4
-; SSE41-NEXT: pshufd {{.*#+}} xmm4 = xmm4[1,1,3,3]
-; SSE41-NEXT: pand %xmm6, %xmm4
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm5[1,1,3,3]
-; SSE41-NEXT: por %xmm4, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm2, %xmm1
-; SSE41-NEXT: movapd %xmm1, %xmm0
-; SSE41-NEXT: xorpd %xmm3, %xmm0
-; SSE41-NEXT: pshufd {{.*#+}} xmm2 = xmm1[2,3,2,3]
-; SSE41-NEXT: pxor %xmm2, %xmm3
-; SSE41-NEXT: movdqa %xmm3, %xmm4
-; SSE41-NEXT: pcmpgtd %xmm0, %xmm4
-; SSE41-NEXT: pmovsxdq %xmm4, %xmm5
-; SSE41-NEXT: pcmpeqd %xmm0, %xmm3
-; SSE41-NEXT: pshufd {{.*#+}} xmm3 = xmm3[1,1,3,3]
-; SSE41-NEXT: pand %xmm5, %xmm3
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm4[1,1,3,3]
-; SSE41-NEXT: por %xmm3, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm1, %xmm2
-; SSE41-NEXT: movq %xmm2, %rax
-; SSE41-NEXT: retq
-;
-; SSE42-LABEL: test_v4i64:
-; SSE42: # %bb.0:
-; SSE42-NEXT: movdqa %xmm0, %xmm2
-; SSE42-NEXT: movdqa %xmm1, %xmm0
-; SSE42-NEXT: pcmpgtq %xmm2, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm2, %xmm1
-; SSE42-NEXT: pshufd {{.*#+}} xmm2 = xmm1[2,3,2,3]
-; SSE42-NEXT: movdqa %xmm2, %xmm0
-; SSE42-NEXT: pcmpgtq %xmm1, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm1, %xmm2
-; SSE42-NEXT: movq %xmm2, %rax
-; SSE42-NEXT: retq
-;
-; AVX1-LABEL: test_v4i64:
-; AVX1: # %bb.0:
-; AVX1-NEXT: vextractf128 $1, %ymm0, %xmm1
-; AVX1-NEXT: vpcmpgtq %xmm0, %xmm1, %xmm2
-; AVX1-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
-; AVX1-NEXT: vshufps {{.*#+}} xmm1 = xmm0[2,3,2,3]
-; AVX1-NEXT: vpcmpgtq %xmm0, %xmm1, %xmm2
-; AVX1-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
-; AVX1-NEXT: vmovq %xmm0, %rax
-; AVX1-NEXT: vzeroupper
-; AVX1-NEXT: retq
-;
-; AVX2-LABEL: test_v4i64:
-; AVX2: # %bb.0:
-; AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
-; AVX2-NEXT: vpcmpgtq %xmm0, %xmm1, %xmm2
-; AVX2-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
-; AVX2-NEXT: vshufps {{.*#+}} xmm1 = xmm0[2,3,2,3]
-; AVX2-NEXT: vpcmpgtq %xmm0, %xmm1, %xmm2
-; AVX2-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
-; AVX2-NEXT: vmovq %xmm0, %rax
-; AVX2-NEXT: vzeroupper
-; AVX2-NEXT: retq
+define i64 @test_v4i64(<4 x i64> %a0) nounwind {
+; X86-SSE2-LABEL: test_v4i64:
+; X86-SSE2: # %bb.0:
+; X86-SSE2-NEXT: movdqa {{.*#+}} xmm2 = [2147483648,0,2147483648,0]
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm3
+; X86-SSE2-NEXT: pxor %xmm2, %xmm3
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm4
+; X86-SSE2-NEXT: pxor %xmm2, %xmm4
+; X86-SSE2-NEXT: movdqa %xmm4, %xmm5
+; X86-SSE2-NEXT: pcmpgtd %xmm3, %xmm5
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm6 = xmm5[0,0,2,2]
+; X86-SSE2-NEXT: pcmpeqd %xmm3, %xmm4
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm4 = xmm4[1,1,3,3]
+; X86-SSE2-NEXT: pand %xmm6, %xmm4
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm3 = xmm5[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm4, %xmm3
+; X86-SSE2-NEXT: pand %xmm3, %xmm0
+; X86-SSE2-NEXT: pandn %xmm1, %xmm3
+; X86-SSE2-NEXT: por %xmm0, %xmm3
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm3[2,3,2,3]
+; X86-SSE2-NEXT: movdqa %xmm3, %xmm1
+; X86-SSE2-NEXT: pxor %xmm2, %xmm1
+; X86-SSE2-NEXT: pxor %xmm0, %xmm2
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm4
+; X86-SSE2-NEXT: pcmpgtd %xmm1, %xmm4
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm5 = xmm4[0,0,2,2]
+; X86-SSE2-NEXT: pcmpeqd %xmm1, %xmm2
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm2[1,1,3,3]
+; X86-SSE2-NEXT: pand %xmm5, %xmm1
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm4[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm1, %xmm2
+; X86-SSE2-NEXT: pand %xmm2, %xmm3
+; X86-SSE2-NEXT: pandn %xmm0, %xmm2
+; X86-SSE2-NEXT: por %xmm3, %xmm2
+; X86-SSE2-NEXT: movd %xmm2, %eax
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,1,1]
+; X86-SSE2-NEXT: movd %xmm0, %edx
+; X86-SSE2-NEXT: retl
+;
+; X64-SSE2-LABEL: test_v4i64:
+; X64-SSE2: # %bb.0:
+; X64-SSE2-NEXT: movdqa {{.*#+}} xmm2 = [2147483648,2147483648]
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm3
+; X64-SSE2-NEXT: pxor %xmm2, %xmm3
+; X64-SSE2-NEXT: pxor %xmm1, %xmm2
+; X64-SSE2-NEXT: movdqa %xmm2, %xmm4
+; X64-SSE2-NEXT: pcmpgtd %xmm3, %xmm4
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm5 = xmm4[0,0,2,2]
+; X64-SSE2-NEXT: pcmpeqd %xmm3, %xmm2
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm2[1,1,3,3]
+; X64-SSE2-NEXT: pand %xmm5, %xmm2
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm3 = xmm4[1,1,3,3]
+; X64-SSE2-NEXT: por %xmm2, %xmm3
+; X64-SSE2-NEXT: pand %xmm3, %xmm0
+; X64-SSE2-NEXT: pandn %xmm1, %xmm3
+; X64-SSE2-NEXT: por %xmm0, %xmm3
+; X64-SSE2-NEXT: movq %xmm3, %rcx
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm3[2,3,2,3]
+; X64-SSE2-NEXT: movq %xmm0, %rax
+; X64-SSE2-NEXT: cmpq %rax, %rcx
+; X64-SSE2-NEXT: cmovlq %rcx, %rax
+; X64-SSE2-NEXT: retq
+;
+; X86-SSE41-LABEL: test_v4i64:
+; X86-SSE41: # %bb.0:
+; X86-SSE41-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE41-NEXT: pmovzxdq {{.*#+}} xmm3 = [2147483648,2147483648]
+; X86-SSE41-NEXT: pxor %xmm3, %xmm0
+; X86-SSE41-NEXT: movdqa %xmm1, %xmm4
+; X86-SSE41-NEXT: pxor %xmm3, %xmm4
+; X86-SSE41-NEXT: movdqa %xmm4, %xmm5
+; X86-SSE41-NEXT: pcmpgtd %xmm0, %xmm5
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm6 = xmm5[0,0,2,2]
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm4
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm4 = xmm4[1,1,3,3]
+; X86-SSE41-NEXT: pand %xmm6, %xmm4
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm5[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm4, %xmm0
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm2, %xmm1
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm2 = xmm1[2,3,2,3]
+; X86-SSE41-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE41-NEXT: pxor %xmm3, %xmm0
+; X86-SSE41-NEXT: pxor %xmm2, %xmm3
+; X86-SSE41-NEXT: movdqa %xmm3, %xmm4
+; X86-SSE41-NEXT: pcmpgtd %xmm0, %xmm4
+; X86-SSE41-NEXT: pmovsxdq %xmm4, %xmm5
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm3
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm3 = xmm3[1,1,3,3]
+; X86-SSE41-NEXT: pand %xmm5, %xmm3
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm4[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm3, %xmm0
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm1, %xmm2
+; X86-SSE41-NEXT: movd %xmm2, %eax
+; X86-SSE41-NEXT: pextrd $1, %xmm2, %edx
+; X86-SSE41-NEXT: retl
+;
+; X64-SSE41-LABEL: test_v4i64:
+; X64-SSE41: # %bb.0:
+; X64-SSE41-NEXT: movdqa %xmm0, %xmm2
+; X64-SSE41-NEXT: pmovzxdq {{.*#+}} xmm3 = [2147483648,2147483648]
+; X64-SSE41-NEXT: pxor %xmm3, %xmm0
+; X64-SSE41-NEXT: movdqa %xmm1, %xmm4
+; X64-SSE41-NEXT: pxor %xmm3, %xmm4
+; X64-SSE41-NEXT: movdqa %xmm4, %xmm5
+; X64-SSE41-NEXT: pcmpgtd %xmm0, %xmm5
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm6 = xmm5[0,0,2,2]
+; X64-SSE41-NEXT: pcmpeqd %xmm0, %xmm4
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm4 = xmm4[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm6, %xmm4
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm5[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm4, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm2, %xmm1
+; X64-SSE41-NEXT: movapd %xmm1, %xmm0
+; X64-SSE41-NEXT: xorpd %xmm3, %xmm0
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm2 = xmm1[2,3,2,3]
+; X64-SSE41-NEXT: pxor %xmm2, %xmm3
+; X64-SSE41-NEXT: movdqa %xmm3, %xmm4
+; X64-SSE41-NEXT: pcmpgtd %xmm0, %xmm4
+; X64-SSE41-NEXT: pmovsxdq %xmm4, %xmm5
+; X64-SSE41-NEXT: pcmpeqd %xmm0, %xmm3
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm3 = xmm3[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm5, %xmm3
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm4[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm3, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm1, %xmm2
+; X64-SSE41-NEXT: movq %xmm2, %rax
+; X64-SSE41-NEXT: retq
+;
+; X86-SSE42-LABEL: test_v4i64:
+; X86-SSE42: # %bb.0:
+; X86-SSE42-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE42-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE42-NEXT: pcmpgtq %xmm2, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm2, %xmm1
+; X86-SSE42-NEXT: pshufd {{.*#+}} xmm2 = xmm1[2,3,2,3]
+; X86-SSE42-NEXT: movdqa %xmm2, %xmm0
+; X86-SSE42-NEXT: pcmpgtq %xmm1, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm1, %xmm2
+; X86-SSE42-NEXT: movd %xmm2, %eax
+; X86-SSE42-NEXT: pextrd $1, %xmm2, %edx
+; X86-SSE42-NEXT: retl
+;
+; X64-SSE42-LABEL: test_v4i64:
+; X64-SSE42: # %bb.0:
+; X64-SSE42-NEXT: movdqa %xmm0, %xmm2
+; X64-SSE42-NEXT: movdqa %xmm1, %xmm0
+; X64-SSE42-NEXT: pcmpgtq %xmm2, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm2, %xmm1
+; X64-SSE42-NEXT: pshufd {{.*#+}} xmm2 = xmm1[2,3,2,3]
+; X64-SSE42-NEXT: movdqa %xmm2, %xmm0
+; X64-SSE42-NEXT: pcmpgtq %xmm1, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm1, %xmm2
+; X64-SSE42-NEXT: movq %xmm2, %rax
+; X64-SSE42-NEXT: retq
+;
+; X86-AVX1-LABEL: test_v4i64:
+; X86-AVX1: # %bb.0:
+; X86-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm1
+; X86-AVX1-NEXT: vpcmpgtq %xmm0, %xmm1, %xmm2
+; X86-AVX1-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X86-AVX1-NEXT: vshufps {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-AVX1-NEXT: vpcmpgtq %xmm0, %xmm1, %xmm2
+; X86-AVX1-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X86-AVX1-NEXT: vmovd %xmm0, %eax
+; X86-AVX1-NEXT: vpextrd $1, %xmm0, %edx
+; X86-AVX1-NEXT: vzeroupper
+; X86-AVX1-NEXT: retl
+;
+; X64-AVX1-LABEL: test_v4i64:
+; X64-AVX1: # %bb.0:
+; X64-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm1
+; X64-AVX1-NEXT: vpcmpgtq %xmm0, %xmm1, %xmm2
+; X64-AVX1-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X64-AVX1-NEXT: vshufps {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X64-AVX1-NEXT: vpcmpgtq %xmm0, %xmm1, %xmm2
+; X64-AVX1-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X64-AVX1-NEXT: vmovq %xmm0, %rax
+; X64-AVX1-NEXT: vzeroupper
+; X64-AVX1-NEXT: retq
+;
+; X86-AVX2-LABEL: test_v4i64:
+; X86-AVX2: # %bb.0:
+; X86-AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
+; X86-AVX2-NEXT: vpcmpgtq %xmm0, %xmm1, %xmm2
+; X86-AVX2-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X86-AVX2-NEXT: vshufps {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-AVX2-NEXT: vpcmpgtq %xmm0, %xmm1, %xmm2
+; X86-AVX2-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X86-AVX2-NEXT: vmovd %xmm0, %eax
+; X86-AVX2-NEXT: vpextrd $1, %xmm0, %edx
+; X86-AVX2-NEXT: vzeroupper
+; X86-AVX2-NEXT: retl
+;
+; X64-AVX2-LABEL: test_v4i64:
+; X64-AVX2: # %bb.0:
+; X64-AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
+; X64-AVX2-NEXT: vpcmpgtq %xmm0, %xmm1, %xmm2
+; X64-AVX2-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X64-AVX2-NEXT: vshufps {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X64-AVX2-NEXT: vpcmpgtq %xmm0, %xmm1, %xmm2
+; X64-AVX2-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X64-AVX2-NEXT: vmovq %xmm0, %rax
+; X64-AVX2-NEXT: vzeroupper
+; X64-AVX2-NEXT: retq
;
; AVX512BW-LABEL: test_v4i64:
; AVX512BW: # %bb.0:
@@ -196,168 +376,370 @@ define i64 @test_v4i64(<4 x i64> %a0) {
ret i64 %1
}
-define i64 @test_v8i64(<8 x i64> %a0) {
-; SSE2-LABEL: test_v8i64:
-; SSE2: # %bb.0:
-; SSE2-NEXT: movdqa {{.*#+}} xmm4 = [2147483648,2147483648]
-; SSE2-NEXT: movdqa %xmm0, %xmm5
-; SSE2-NEXT: pxor %xmm4, %xmm5
-; SSE2-NEXT: movdqa %xmm2, %xmm6
-; SSE2-NEXT: pxor %xmm4, %xmm6
-; SSE2-NEXT: movdqa %xmm6, %xmm7
-; SSE2-NEXT: pcmpgtd %xmm5, %xmm7
-; SSE2-NEXT: pshufd {{.*#+}} xmm8 = xmm7[0,0,2,2]
-; SSE2-NEXT: pcmpeqd %xmm5, %xmm6
-; SSE2-NEXT: pshufd {{.*#+}} xmm6 = xmm6[1,1,3,3]
-; SSE2-NEXT: pand %xmm8, %xmm6
-; SSE2-NEXT: pshufd {{.*#+}} xmm5 = xmm7[1,1,3,3]
-; SSE2-NEXT: por %xmm6, %xmm5
-; SSE2-NEXT: pand %xmm5, %xmm0
-; SSE2-NEXT: pandn %xmm2, %xmm5
-; SSE2-NEXT: por %xmm0, %xmm5
-; SSE2-NEXT: movdqa %xmm5, %xmm0
-; SSE2-NEXT: pxor %xmm4, %xmm0
-; SSE2-NEXT: movdqa %xmm1, %xmm2
-; SSE2-NEXT: pxor %xmm4, %xmm2
-; SSE2-NEXT: movdqa %xmm3, %xmm6
-; SSE2-NEXT: pxor %xmm4, %xmm6
-; SSE2-NEXT: movdqa %xmm6, %xmm7
-; SSE2-NEXT: pcmpgtd %xmm2, %xmm7
-; SSE2-NEXT: pshufd {{.*#+}} xmm8 = xmm7[0,0,2,2]
-; SSE2-NEXT: pcmpeqd %xmm2, %xmm6
-; SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm6[1,1,3,3]
-; SSE2-NEXT: pand %xmm8, %xmm2
-; SSE2-NEXT: pshufd {{.*#+}} xmm6 = xmm7[1,1,3,3]
-; SSE2-NEXT: por %xmm2, %xmm6
-; SSE2-NEXT: pand %xmm6, %xmm1
-; SSE2-NEXT: pandn %xmm3, %xmm6
-; SSE2-NEXT: por %xmm1, %xmm6
-; SSE2-NEXT: pxor %xmm6, %xmm4
-; SSE2-NEXT: movdqa %xmm4, %xmm1
-; SSE2-NEXT: pcmpgtd %xmm0, %xmm1
-; SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm1[0,0,2,2]
-; SSE2-NEXT: pcmpeqd %xmm0, %xmm4
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm4[1,1,3,3]
-; SSE2-NEXT: pand %xmm2, %xmm0
-; SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm1[1,1,3,3]
-; SSE2-NEXT: por %xmm0, %xmm1
-; SSE2-NEXT: pand %xmm1, %xmm5
-; SSE2-NEXT: pandn %xmm6, %xmm1
-; SSE2-NEXT: por %xmm5, %xmm1
-; SSE2-NEXT: movq %xmm1, %rcx
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
-; SSE2-NEXT: movq %xmm0, %rax
-; SSE2-NEXT: cmpq %rax, %rcx
-; SSE2-NEXT: cmovlq %rcx, %rax
-; SSE2-NEXT: retq
-;
-; SSE41-LABEL: test_v8i64:
-; SSE41: # %bb.0:
-; SSE41-NEXT: movdqa %xmm0, %xmm4
-; SSE41-NEXT: pmovzxdq {{.*#+}} xmm5 = [2147483648,2147483648]
-; SSE41-NEXT: pxor %xmm5, %xmm0
-; SSE41-NEXT: movdqa %xmm2, %xmm6
-; SSE41-NEXT: pxor %xmm5, %xmm6
-; SSE41-NEXT: movdqa %xmm6, %xmm7
-; SSE41-NEXT: pcmpgtd %xmm0, %xmm7
-; SSE41-NEXT: pshufd {{.*#+}} xmm8 = xmm7[0,0,2,2]
-; SSE41-NEXT: pcmpeqd %xmm0, %xmm6
-; SSE41-NEXT: pshufd {{.*#+}} xmm6 = xmm6[1,1,3,3]
-; SSE41-NEXT: pand %xmm8, %xmm6
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm7[1,1,3,3]
-; SSE41-NEXT: por %xmm6, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm4, %xmm2
-; SSE41-NEXT: movapd %xmm2, %xmm4
-; SSE41-NEXT: xorpd %xmm5, %xmm4
-; SSE41-NEXT: movdqa %xmm1, %xmm0
-; SSE41-NEXT: pxor %xmm5, %xmm0
-; SSE41-NEXT: movdqa %xmm3, %xmm6
-; SSE41-NEXT: pxor %xmm5, %xmm6
-; SSE41-NEXT: movdqa %xmm6, %xmm7
-; SSE41-NEXT: pcmpgtd %xmm0, %xmm7
-; SSE41-NEXT: pshufd {{.*#+}} xmm8 = xmm7[0,0,2,2]
-; SSE41-NEXT: pcmpeqd %xmm0, %xmm6
-; SSE41-NEXT: pshufd {{.*#+}} xmm6 = xmm6[1,1,3,3]
-; SSE41-NEXT: pand %xmm8, %xmm6
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm7[1,1,3,3]
-; SSE41-NEXT: por %xmm6, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm1, %xmm3
-; SSE41-NEXT: movapd %xmm3, %xmm0
-; SSE41-NEXT: xorpd %xmm5, %xmm0
-; SSE41-NEXT: movapd %xmm0, %xmm1
-; SSE41-NEXT: pcmpgtd %xmm4, %xmm1
-; SSE41-NEXT: pshufd {{.*#+}} xmm6 = xmm1[0,0,2,2]
-; SSE41-NEXT: pcmpeqd %xmm4, %xmm0
-; SSE41-NEXT: pshufd {{.*#+}} xmm4 = xmm0[1,1,3,3]
-; SSE41-NEXT: pand %xmm6, %xmm4
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,3,3]
-; SSE41-NEXT: por %xmm4, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm2, %xmm3
-; SSE41-NEXT: movapd %xmm3, %xmm0
-; SSE41-NEXT: xorpd %xmm5, %xmm0
-; SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm3[2,3,2,3]
-; SSE41-NEXT: pxor %xmm1, %xmm5
-; SSE41-NEXT: movdqa %xmm5, %xmm2
-; SSE41-NEXT: pcmpgtd %xmm0, %xmm2
-; SSE41-NEXT: pmovsxdq %xmm2, %xmm4
-; SSE41-NEXT: pcmpeqd %xmm0, %xmm5
-; SSE41-NEXT: pshufd {{.*#+}} xmm5 = xmm5[1,1,3,3]
-; SSE41-NEXT: pand %xmm4, %xmm5
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,3,3]
-; SSE41-NEXT: por %xmm5, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm3, %xmm1
-; SSE41-NEXT: movq %xmm1, %rax
-; SSE41-NEXT: retq
-;
-; SSE42-LABEL: test_v8i64:
-; SSE42: # %bb.0:
-; SSE42-NEXT: movdqa %xmm0, %xmm4
-; SSE42-NEXT: movdqa %xmm2, %xmm0
-; SSE42-NEXT: pcmpgtq %xmm4, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm4, %xmm2
-; SSE42-NEXT: movdqa %xmm3, %xmm0
-; SSE42-NEXT: pcmpgtq %xmm1, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm1, %xmm3
-; SSE42-NEXT: movapd %xmm3, %xmm0
-; SSE42-NEXT: pcmpgtq %xmm2, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm2, %xmm3
-; SSE42-NEXT: pshufd {{.*#+}} xmm1 = xmm3[2,3,2,3]
-; SSE42-NEXT: movdqa %xmm1, %xmm0
-; SSE42-NEXT: pcmpgtq %xmm3, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm3, %xmm1
-; SSE42-NEXT: movq %xmm1, %rax
-; SSE42-NEXT: retq
-;
-; AVX1-LABEL: test_v8i64:
-; AVX1: # %bb.0:
-; AVX1-NEXT: vpcmpgtq %xmm0, %xmm1, %xmm2
-; AVX1-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm2
-; AVX1-NEXT: vextractf128 $1, %ymm0, %xmm0
-; AVX1-NEXT: vextractf128 $1, %ymm1, %xmm1
-; AVX1-NEXT: vpcmpgtq %xmm0, %xmm1, %xmm3
-; AVX1-NEXT: vblendvpd %xmm3, %xmm0, %xmm1, %xmm0
-; AVX1-NEXT: vpcmpgtq %xmm2, %xmm0, %xmm1
-; AVX1-NEXT: vblendvpd %xmm1, %xmm2, %xmm0, %xmm0
-; AVX1-NEXT: vshufps {{.*#+}} xmm1 = xmm0[2,3,2,3]
-; AVX1-NEXT: vpcmpgtq %xmm0, %xmm1, %xmm2
-; AVX1-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
-; AVX1-NEXT: vmovq %xmm0, %rax
-; AVX1-NEXT: vzeroupper
-; AVX1-NEXT: retq
-;
-; AVX2-LABEL: test_v8i64:
-; AVX2: # %bb.0:
-; AVX2-NEXT: vpcmpgtq %ymm0, %ymm1, %ymm2
-; AVX2-NEXT: vblendvpd %ymm2, %ymm0, %ymm1, %ymm0
-; AVX2-NEXT: vextractf128 $1, %ymm0, %xmm1
-; AVX2-NEXT: vpcmpgtq %xmm0, %xmm1, %xmm2
-; AVX2-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
-; AVX2-NEXT: vshufps {{.*#+}} xmm1 = xmm0[2,3,2,3]
-; AVX2-NEXT: vpcmpgtq %xmm0, %xmm1, %xmm2
-; AVX2-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
-; AVX2-NEXT: vmovq %xmm0, %rax
-; AVX2-NEXT: vzeroupper
-; AVX2-NEXT: retq
+define i64 @test_v8i64(<8 x i64> %a0) nounwind {
+; X86-SSE2-LABEL: test_v8i64:
+; X86-SSE2: # %bb.0:
+; X86-SSE2-NEXT: pushl %ebp
+; X86-SSE2-NEXT: movl %esp, %ebp
+; X86-SSE2-NEXT: andl $-16, %esp
+; X86-SSE2-NEXT: subl $16, %esp
+; X86-SSE2-NEXT: movdqa 8(%ebp), %xmm5
+; X86-SSE2-NEXT: movdqa {{.*#+}} xmm3 = [2147483648,0,2147483648,0]
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm4
+; X86-SSE2-NEXT: pxor %xmm3, %xmm4
+; X86-SSE2-NEXT: movdqa %xmm5, %xmm6
+; X86-SSE2-NEXT: pxor %xmm3, %xmm6
+; X86-SSE2-NEXT: movdqa %xmm6, %xmm7
+; X86-SSE2-NEXT: pcmpgtd %xmm4, %xmm7
+; X86-SSE2-NEXT: pcmpeqd %xmm4, %xmm6
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm4 = xmm7[0,0,2,2]
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm6 = xmm6[1,1,3,3]
+; X86-SSE2-NEXT: pand %xmm4, %xmm6
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm4 = xmm7[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm6, %xmm4
+; X86-SSE2-NEXT: pand %xmm4, %xmm1
+; X86-SSE2-NEXT: pandn %xmm5, %xmm4
+; X86-SSE2-NEXT: por %xmm1, %xmm4
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X86-SSE2-NEXT: pxor %xmm3, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm5
+; X86-SSE2-NEXT: pxor %xmm3, %xmm5
+; X86-SSE2-NEXT: movdqa %xmm5, %xmm6
+; X86-SSE2-NEXT: pcmpgtd %xmm1, %xmm6
+; X86-SSE2-NEXT: pcmpeqd %xmm1, %xmm5
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm6[0,0,2,2]
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm5 = xmm5[1,1,3,3]
+; X86-SSE2-NEXT: pand %xmm1, %xmm5
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm6[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm5, %xmm1
+; X86-SSE2-NEXT: pand %xmm1, %xmm0
+; X86-SSE2-NEXT: pandn %xmm2, %xmm1
+; X86-SSE2-NEXT: por %xmm0, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE2-NEXT: pxor %xmm3, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm4, %xmm2
+; X86-SSE2-NEXT: pxor %xmm3, %xmm2
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm5
+; X86-SSE2-NEXT: pcmpgtd %xmm0, %xmm5
+; X86-SSE2-NEXT: pcmpeqd %xmm0, %xmm2
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm5[0,0,2,2]
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm2[1,1,3,3]
+; X86-SSE2-NEXT: pand %xmm0, %xmm2
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm5[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm2, %xmm0
+; X86-SSE2-NEXT: pand %xmm0, %xmm1
+; X86-SSE2-NEXT: pandn %xmm4, %xmm0
+; X86-SSE2-NEXT: por %xmm1, %xmm0
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE2-NEXT: pxor %xmm3, %xmm2
+; X86-SSE2-NEXT: pxor %xmm1, %xmm3
+; X86-SSE2-NEXT: movdqa %xmm3, %xmm4
+; X86-SSE2-NEXT: pcmpgtd %xmm2, %xmm4
+; X86-SSE2-NEXT: pcmpeqd %xmm2, %xmm3
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm4[0,0,2,2]
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm3 = xmm3[1,1,3,3]
+; X86-SSE2-NEXT: pand %xmm2, %xmm3
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm4[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm3, %xmm2
+; X86-SSE2-NEXT: pand %xmm2, %xmm0
+; X86-SSE2-NEXT: pandn %xmm1, %xmm2
+; X86-SSE2-NEXT: por %xmm0, %xmm2
+; X86-SSE2-NEXT: movd %xmm2, %eax
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,1,1]
+; X86-SSE2-NEXT: movd %xmm0, %edx
+; X86-SSE2-NEXT: movl %ebp, %esp
+; X86-SSE2-NEXT: popl %ebp
+; X86-SSE2-NEXT: retl
+;
+; X64-SSE2-LABEL: test_v8i64:
+; X64-SSE2: # %bb.0:
+; X64-SSE2-NEXT: movdqa {{.*#+}} xmm4 = [2147483648,2147483648]
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm5
+; X64-SSE2-NEXT: pxor %xmm4, %xmm5
+; X64-SSE2-NEXT: movdqa %xmm2, %xmm6
+; X64-SSE2-NEXT: pxor %xmm4, %xmm6
+; X64-SSE2-NEXT: movdqa %xmm6, %xmm7
+; X64-SSE2-NEXT: pcmpgtd %xmm5, %xmm7
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm8 = xmm7[0,0,2,2]
+; X64-SSE2-NEXT: pcmpeqd %xmm5, %xmm6
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm6 = xmm6[1,1,3,3]
+; X64-SSE2-NEXT: pand %xmm8, %xmm6
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm5 = xmm7[1,1,3,3]
+; X64-SSE2-NEXT: por %xmm6, %xmm5
+; X64-SSE2-NEXT: pand %xmm5, %xmm0
+; X64-SSE2-NEXT: pandn %xmm2, %xmm5
+; X64-SSE2-NEXT: por %xmm0, %xmm5
+; X64-SSE2-NEXT: movdqa %xmm5, %xmm0
+; X64-SSE2-NEXT: pxor %xmm4, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm2
+; X64-SSE2-NEXT: pxor %xmm4, %xmm2
+; X64-SSE2-NEXT: movdqa %xmm3, %xmm6
+; X64-SSE2-NEXT: pxor %xmm4, %xmm6
+; X64-SSE2-NEXT: movdqa %xmm6, %xmm7
+; X64-SSE2-NEXT: pcmpgtd %xmm2, %xmm7
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm8 = xmm7[0,0,2,2]
+; X64-SSE2-NEXT: pcmpeqd %xmm2, %xmm6
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm6[1,1,3,3]
+; X64-SSE2-NEXT: pand %xmm8, %xmm2
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm6 = xmm7[1,1,3,3]
+; X64-SSE2-NEXT: por %xmm2, %xmm6
+; X64-SSE2-NEXT: pand %xmm6, %xmm1
+; X64-SSE2-NEXT: pandn %xmm3, %xmm6
+; X64-SSE2-NEXT: por %xmm1, %xmm6
+; X64-SSE2-NEXT: pxor %xmm6, %xmm4
+; X64-SSE2-NEXT: movdqa %xmm4, %xmm1
+; X64-SSE2-NEXT: pcmpgtd %xmm0, %xmm1
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm1[0,0,2,2]
+; X64-SSE2-NEXT: pcmpeqd %xmm0, %xmm4
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm4[1,1,3,3]
+; X64-SSE2-NEXT: pand %xmm2, %xmm0
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm1[1,1,3,3]
+; X64-SSE2-NEXT: por %xmm0, %xmm1
+; X64-SSE2-NEXT: pand %xmm1, %xmm5
+; X64-SSE2-NEXT: pandn %xmm6, %xmm1
+; X64-SSE2-NEXT: por %xmm5, %xmm1
+; X64-SSE2-NEXT: movq %xmm1, %rcx
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
+; X64-SSE2-NEXT: movq %xmm0, %rax
+; X64-SSE2-NEXT: cmpq %rax, %rcx
+; X64-SSE2-NEXT: cmovlq %rcx, %rax
+; X64-SSE2-NEXT: retq
+;
+; X86-SSE41-LABEL: test_v8i64:
+; X86-SSE41: # %bb.0:
+; X86-SSE41-NEXT: pushl %ebp
+; X86-SSE41-NEXT: movl %esp, %ebp
+; X86-SSE41-NEXT: andl $-16, %esp
+; X86-SSE41-NEXT: subl $16, %esp
+; X86-SSE41-NEXT: movdqa %xmm0, %xmm3
+; X86-SSE41-NEXT: movdqa 8(%ebp), %xmm4
+; X86-SSE41-NEXT: pmovzxdq {{.*#+}} xmm5 = [2147483648,2147483648]
+; X86-SSE41-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE41-NEXT: pxor %xmm5, %xmm0
+; X86-SSE41-NEXT: movdqa %xmm4, %xmm6
+; X86-SSE41-NEXT: pxor %xmm5, %xmm6
+; X86-SSE41-NEXT: movdqa %xmm6, %xmm7
+; X86-SSE41-NEXT: pcmpgtd %xmm0, %xmm7
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm6
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm7[0,0,2,2]
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm6 = xmm6[1,1,3,3]
+; X86-SSE41-NEXT: pand %xmm0, %xmm6
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm7[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm6, %xmm0
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm1, %xmm4
+; X86-SSE41-NEXT: movdqa %xmm3, %xmm0
+; X86-SSE41-NEXT: pxor %xmm5, %xmm0
+; X86-SSE41-NEXT: movdqa %xmm2, %xmm1
+; X86-SSE41-NEXT: pxor %xmm5, %xmm1
+; X86-SSE41-NEXT: movdqa %xmm1, %xmm6
+; X86-SSE41-NEXT: pcmpgtd %xmm0, %xmm6
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm1
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm6[0,0,2,2]
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm1[1,1,3,3]
+; X86-SSE41-NEXT: pand %xmm0, %xmm1
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm6[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm1, %xmm0
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm3, %xmm2
+; X86-SSE41-NEXT: movapd %xmm2, %xmm0
+; X86-SSE41-NEXT: xorpd %xmm5, %xmm0
+; X86-SSE41-NEXT: movapd %xmm4, %xmm1
+; X86-SSE41-NEXT: xorpd %xmm5, %xmm1
+; X86-SSE41-NEXT: movapd %xmm1, %xmm3
+; X86-SSE41-NEXT: pcmpgtd %xmm0, %xmm3
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm1
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm3[0,0,2,2]
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm1[1,1,3,3]
+; X86-SSE41-NEXT: pand %xmm0, %xmm1
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm3[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm1, %xmm0
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm2, %xmm4
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm4[2,3,2,3]
+; X86-SSE41-NEXT: movdqa %xmm4, %xmm0
+; X86-SSE41-NEXT: pxor %xmm5, %xmm0
+; X86-SSE41-NEXT: pxor %xmm1, %xmm5
+; X86-SSE41-NEXT: movdqa %xmm5, %xmm2
+; X86-SSE41-NEXT: pcmpgtd %xmm0, %xmm2
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm5
+; X86-SSE41-NEXT: pmovsxdq %xmm2, %xmm0
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm3 = xmm5[1,1,3,3]
+; X86-SSE41-NEXT: pand %xmm0, %xmm3
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm3, %xmm0
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm4, %xmm1
+; X86-SSE41-NEXT: movd %xmm1, %eax
+; X86-SSE41-NEXT: pextrd $1, %xmm1, %edx
+; X86-SSE41-NEXT: movl %ebp, %esp
+; X86-SSE41-NEXT: popl %ebp
+; X86-SSE41-NEXT: retl
+;
+; X64-SSE41-LABEL: test_v8i64:
+; X64-SSE41: # %bb.0:
+; X64-SSE41-NEXT: movdqa %xmm0, %xmm4
+; X64-SSE41-NEXT: pmovzxdq {{.*#+}} xmm5 = [2147483648,2147483648]
+; X64-SSE41-NEXT: pxor %xmm5, %xmm0
+; X64-SSE41-NEXT: movdqa %xmm2, %xmm6
+; X64-SSE41-NEXT: pxor %xmm5, %xmm6
+; X64-SSE41-NEXT: movdqa %xmm6, %xmm7
+; X64-SSE41-NEXT: pcmpgtd %xmm0, %xmm7
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm8 = xmm7[0,0,2,2]
+; X64-SSE41-NEXT: pcmpeqd %xmm0, %xmm6
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm6 = xmm6[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm8, %xmm6
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm7[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm6, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm4, %xmm2
+; X64-SSE41-NEXT: movapd %xmm2, %xmm4
+; X64-SSE41-NEXT: xorpd %xmm5, %xmm4
+; X64-SSE41-NEXT: movdqa %xmm1, %xmm0
+; X64-SSE41-NEXT: pxor %xmm5, %xmm0
+; X64-SSE41-NEXT: movdqa %xmm3, %xmm6
+; X64-SSE41-NEXT: pxor %xmm5, %xmm6
+; X64-SSE41-NEXT: movdqa %xmm6, %xmm7
+; X64-SSE41-NEXT: pcmpgtd %xmm0, %xmm7
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm8 = xmm7[0,0,2,2]
+; X64-SSE41-NEXT: pcmpeqd %xmm0, %xmm6
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm6 = xmm6[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm8, %xmm6
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm7[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm6, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm1, %xmm3
+; X64-SSE41-NEXT: movapd %xmm3, %xmm0
+; X64-SSE41-NEXT: xorpd %xmm5, %xmm0
+; X64-SSE41-NEXT: movapd %xmm0, %xmm1
+; X64-SSE41-NEXT: pcmpgtd %xmm4, %xmm1
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm6 = xmm1[0,0,2,2]
+; X64-SSE41-NEXT: pcmpeqd %xmm4, %xmm0
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm4 = xmm0[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm6, %xmm4
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm4, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm2, %xmm3
+; X64-SSE41-NEXT: movapd %xmm3, %xmm0
+; X64-SSE41-NEXT: xorpd %xmm5, %xmm0
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm3[2,3,2,3]
+; X64-SSE41-NEXT: pxor %xmm1, %xmm5
+; X64-SSE41-NEXT: movdqa %xmm5, %xmm2
+; X64-SSE41-NEXT: pcmpgtd %xmm0, %xmm2
+; X64-SSE41-NEXT: pmovsxdq %xmm2, %xmm4
+; X64-SSE41-NEXT: pcmpeqd %xmm0, %xmm5
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm5 = xmm5[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm4, %xmm5
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm5, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm3, %xmm1
+; X64-SSE41-NEXT: movq %xmm1, %rax
+; X64-SSE41-NEXT: retq
+;
+; X86-SSE42-LABEL: test_v8i64:
+; X86-SSE42: # %bb.0:
+; X86-SSE42-NEXT: pushl %ebp
+; X86-SSE42-NEXT: movl %esp, %ebp
+; X86-SSE42-NEXT: andl $-16, %esp
+; X86-SSE42-NEXT: subl $16, %esp
+; X86-SSE42-NEXT: movdqa %xmm0, %xmm3
+; X86-SSE42-NEXT: movdqa 8(%ebp), %xmm4
+; X86-SSE42-NEXT: movdqa %xmm2, %xmm0
+; X86-SSE42-NEXT: pcmpgtq %xmm3, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm3, %xmm2
+; X86-SSE42-NEXT: movdqa %xmm4, %xmm0
+; X86-SSE42-NEXT: pcmpgtq %xmm1, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm1, %xmm4
+; X86-SSE42-NEXT: movapd %xmm4, %xmm0
+; X86-SSE42-NEXT: pcmpgtq %xmm2, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm2, %xmm4
+; X86-SSE42-NEXT: pshufd {{.*#+}} xmm1 = xmm4[2,3,2,3]
+; X86-SSE42-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE42-NEXT: pcmpgtq %xmm4, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm4, %xmm1
+; X86-SSE42-NEXT: movd %xmm1, %eax
+; X86-SSE42-NEXT: pextrd $1, %xmm1, %edx
+; X86-SSE42-NEXT: movl %ebp, %esp
+; X86-SSE42-NEXT: popl %ebp
+; X86-SSE42-NEXT: retl
+;
+; X64-SSE42-LABEL: test_v8i64:
+; X64-SSE42: # %bb.0:
+; X64-SSE42-NEXT: movdqa %xmm0, %xmm4
+; X64-SSE42-NEXT: movdqa %xmm2, %xmm0
+; X64-SSE42-NEXT: pcmpgtq %xmm4, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm4, %xmm2
+; X64-SSE42-NEXT: movdqa %xmm3, %xmm0
+; X64-SSE42-NEXT: pcmpgtq %xmm1, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm1, %xmm3
+; X64-SSE42-NEXT: movapd %xmm3, %xmm0
+; X64-SSE42-NEXT: pcmpgtq %xmm2, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm2, %xmm3
+; X64-SSE42-NEXT: pshufd {{.*#+}} xmm1 = xmm3[2,3,2,3]
+; X64-SSE42-NEXT: movdqa %xmm1, %xmm0
+; X64-SSE42-NEXT: pcmpgtq %xmm3, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm3, %xmm1
+; X64-SSE42-NEXT: movq %xmm1, %rax
+; X64-SSE42-NEXT: retq
+;
+; X86-AVX1-LABEL: test_v8i64:
+; X86-AVX1: # %bb.0:
+; X86-AVX1-NEXT: vpcmpgtq %xmm0, %xmm1, %xmm2
+; X86-AVX1-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm2
+; X86-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm0
+; X86-AVX1-NEXT: vextractf128 $1, %ymm1, %xmm1
+; X86-AVX1-NEXT: vpcmpgtq %xmm0, %xmm1, %xmm3
+; X86-AVX1-NEXT: vblendvpd %xmm3, %xmm0, %xmm1, %xmm0
+; X86-AVX1-NEXT: vpcmpgtq %xmm2, %xmm0, %xmm1
+; X86-AVX1-NEXT: vblendvpd %xmm1, %xmm2, %xmm0, %xmm0
+; X86-AVX1-NEXT: vshufps {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-AVX1-NEXT: vpcmpgtq %xmm0, %xmm1, %xmm2
+; X86-AVX1-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X86-AVX1-NEXT: vmovd %xmm0, %eax
+; X86-AVX1-NEXT: vpextrd $1, %xmm0, %edx
+; X86-AVX1-NEXT: vzeroupper
+; X86-AVX1-NEXT: retl
+;
+; X64-AVX1-LABEL: test_v8i64:
+; X64-AVX1: # %bb.0:
+; X64-AVX1-NEXT: vpcmpgtq %xmm0, %xmm1, %xmm2
+; X64-AVX1-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm2
+; X64-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm0
+; X64-AVX1-NEXT: vextractf128 $1, %ymm1, %xmm1
+; X64-AVX1-NEXT: vpcmpgtq %xmm0, %xmm1, %xmm3
+; X64-AVX1-NEXT: vblendvpd %xmm3, %xmm0, %xmm1, %xmm0
+; X64-AVX1-NEXT: vpcmpgtq %xmm2, %xmm0, %xmm1
+; X64-AVX1-NEXT: vblendvpd %xmm1, %xmm2, %xmm0, %xmm0
+; X64-AVX1-NEXT: vshufps {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X64-AVX1-NEXT: vpcmpgtq %xmm0, %xmm1, %xmm2
+; X64-AVX1-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X64-AVX1-NEXT: vmovq %xmm0, %rax
+; X64-AVX1-NEXT: vzeroupper
+; X64-AVX1-NEXT: retq
+;
+; X86-AVX2-LABEL: test_v8i64:
+; X86-AVX2: # %bb.0:
+; X86-AVX2-NEXT: vpcmpgtq %ymm0, %ymm1, %ymm2
+; X86-AVX2-NEXT: vblendvpd %ymm2, %ymm0, %ymm1, %ymm0
+; X86-AVX2-NEXT: vextractf128 $1, %ymm0, %xmm1
+; X86-AVX2-NEXT: vpcmpgtq %xmm0, %xmm1, %xmm2
+; X86-AVX2-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X86-AVX2-NEXT: vshufps {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-AVX2-NEXT: vpcmpgtq %xmm0, %xmm1, %xmm2
+; X86-AVX2-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X86-AVX2-NEXT: vmovd %xmm0, %eax
+; X86-AVX2-NEXT: vpextrd $1, %xmm0, %edx
+; X86-AVX2-NEXT: vzeroupper
+; X86-AVX2-NEXT: retl
+;
+; X64-AVX2-LABEL: test_v8i64:
+; X64-AVX2: # %bb.0:
+; X64-AVX2-NEXT: vpcmpgtq %ymm0, %ymm1, %ymm2
+; X64-AVX2-NEXT: vblendvpd %ymm2, %ymm0, %ymm1, %ymm0
+; X64-AVX2-NEXT: vextractf128 $1, %ymm0, %xmm1
+; X64-AVX2-NEXT: vpcmpgtq %xmm0, %xmm1, %xmm2
+; X64-AVX2-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X64-AVX2-NEXT: vshufps {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X64-AVX2-NEXT: vpcmpgtq %xmm0, %xmm1, %xmm2
+; X64-AVX2-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X64-AVX2-NEXT: vmovq %xmm0, %rax
+; X64-AVX2-NEXT: vzeroupper
+; X64-AVX2-NEXT: retq
;
; AVX512BW-LABEL: test_v8i64:
; AVX512BW: # %bb.0:
@@ -386,306 +768,684 @@ define i64 @test_v8i64(<8 x i64> %a0) {
ret i64 %1
}
-define i64 @test_v16i64(<16 x i64> %a0) {
-; SSE2-LABEL: test_v16i64:
-; SSE2: # %bb.0:
-; SSE2-NEXT: movdqa {{.*#+}} xmm8 = [2147483648,2147483648]
-; SSE2-NEXT: movdqa %xmm0, %xmm9
-; SSE2-NEXT: pxor %xmm8, %xmm9
-; SSE2-NEXT: movdqa %xmm4, %xmm10
-; SSE2-NEXT: pxor %xmm8, %xmm10
-; SSE2-NEXT: movdqa %xmm10, %xmm11
-; SSE2-NEXT: pcmpgtd %xmm9, %xmm11
-; SSE2-NEXT: pshufd {{.*#+}} xmm12 = xmm11[0,0,2,2]
-; SSE2-NEXT: pcmpeqd %xmm9, %xmm10
-; SSE2-NEXT: pshufd {{.*#+}} xmm10 = xmm10[1,1,3,3]
-; SSE2-NEXT: pand %xmm12, %xmm10
-; SSE2-NEXT: pshufd {{.*#+}} xmm9 = xmm11[1,1,3,3]
-; SSE2-NEXT: por %xmm10, %xmm9
-; SSE2-NEXT: pand %xmm9, %xmm0
-; SSE2-NEXT: pandn %xmm4, %xmm9
-; SSE2-NEXT: por %xmm0, %xmm9
-; SSE2-NEXT: movdqa %xmm9, %xmm0
-; SSE2-NEXT: pxor %xmm8, %xmm0
-; SSE2-NEXT: movdqa %xmm2, %xmm4
-; SSE2-NEXT: pxor %xmm8, %xmm4
-; SSE2-NEXT: movdqa %xmm6, %xmm10
-; SSE2-NEXT: pxor %xmm8, %xmm10
-; SSE2-NEXT: movdqa %xmm10, %xmm11
-; SSE2-NEXT: pcmpgtd %xmm4, %xmm11
-; SSE2-NEXT: pshufd {{.*#+}} xmm12 = xmm11[0,0,2,2]
-; SSE2-NEXT: pcmpeqd %xmm4, %xmm10
-; SSE2-NEXT: pshufd {{.*#+}} xmm4 = xmm10[1,1,3,3]
-; SSE2-NEXT: pand %xmm12, %xmm4
-; SSE2-NEXT: pshufd {{.*#+}} xmm10 = xmm11[1,1,3,3]
-; SSE2-NEXT: por %xmm4, %xmm10
-; SSE2-NEXT: pand %xmm10, %xmm2
-; SSE2-NEXT: pandn %xmm6, %xmm10
-; SSE2-NEXT: por %xmm2, %xmm10
-; SSE2-NEXT: movdqa %xmm10, %xmm2
-; SSE2-NEXT: pxor %xmm8, %xmm2
-; SSE2-NEXT: movdqa %xmm2, %xmm4
-; SSE2-NEXT: pcmpgtd %xmm0, %xmm4
-; SSE2-NEXT: pshufd {{.*#+}} xmm6 = xmm4[0,0,2,2]
-; SSE2-NEXT: pcmpeqd %xmm0, %xmm2
-; SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm2[1,1,3,3]
-; SSE2-NEXT: pand %xmm6, %xmm2
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm4[1,1,3,3]
-; SSE2-NEXT: por %xmm2, %xmm0
-; SSE2-NEXT: pand %xmm0, %xmm9
-; SSE2-NEXT: pandn %xmm10, %xmm0
-; SSE2-NEXT: por %xmm9, %xmm0
-; SSE2-NEXT: movdqa %xmm0, %xmm2
-; SSE2-NEXT: pxor %xmm8, %xmm2
-; SSE2-NEXT: movdqa %xmm1, %xmm4
-; SSE2-NEXT: pxor %xmm8, %xmm4
-; SSE2-NEXT: movdqa %xmm5, %xmm6
-; SSE2-NEXT: pxor %xmm8, %xmm6
-; SSE2-NEXT: movdqa %xmm6, %xmm9
-; SSE2-NEXT: pcmpgtd %xmm4, %xmm9
-; SSE2-NEXT: pshufd {{.*#+}} xmm10 = xmm9[0,0,2,2]
-; SSE2-NEXT: pcmpeqd %xmm4, %xmm6
-; SSE2-NEXT: pshufd {{.*#+}} xmm6 = xmm6[1,1,3,3]
-; SSE2-NEXT: pand %xmm10, %xmm6
-; SSE2-NEXT: pshufd {{.*#+}} xmm4 = xmm9[1,1,3,3]
-; SSE2-NEXT: por %xmm6, %xmm4
-; SSE2-NEXT: pand %xmm4, %xmm1
-; SSE2-NEXT: pandn %xmm5, %xmm4
-; SSE2-NEXT: por %xmm1, %xmm4
-; SSE2-NEXT: movdqa %xmm4, %xmm1
-; SSE2-NEXT: pxor %xmm8, %xmm1
-; SSE2-NEXT: movdqa %xmm3, %xmm5
-; SSE2-NEXT: pxor %xmm8, %xmm5
-; SSE2-NEXT: movdqa %xmm7, %xmm6
-; SSE2-NEXT: pxor %xmm8, %xmm6
-; SSE2-NEXT: movdqa %xmm6, %xmm9
-; SSE2-NEXT: pcmpgtd %xmm5, %xmm9
-; SSE2-NEXT: pshufd {{.*#+}} xmm10 = xmm9[0,0,2,2]
-; SSE2-NEXT: pcmpeqd %xmm5, %xmm6
-; SSE2-NEXT: pshufd {{.*#+}} xmm5 = xmm6[1,1,3,3]
-; SSE2-NEXT: pand %xmm10, %xmm5
-; SSE2-NEXT: pshufd {{.*#+}} xmm6 = xmm9[1,1,3,3]
-; SSE2-NEXT: por %xmm5, %xmm6
-; SSE2-NEXT: pand %xmm6, %xmm3
-; SSE2-NEXT: pandn %xmm7, %xmm6
-; SSE2-NEXT: por %xmm3, %xmm6
-; SSE2-NEXT: movdqa %xmm6, %xmm3
-; SSE2-NEXT: pxor %xmm8, %xmm3
-; SSE2-NEXT: movdqa %xmm3, %xmm5
-; SSE2-NEXT: pcmpgtd %xmm1, %xmm5
-; SSE2-NEXT: pshufd {{.*#+}} xmm7 = xmm5[0,0,2,2]
-; SSE2-NEXT: pcmpeqd %xmm1, %xmm3
-; SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm3[1,1,3,3]
-; SSE2-NEXT: pand %xmm7, %xmm1
-; SSE2-NEXT: pshufd {{.*#+}} xmm3 = xmm5[1,1,3,3]
-; SSE2-NEXT: por %xmm1, %xmm3
-; SSE2-NEXT: pand %xmm3, %xmm4
-; SSE2-NEXT: pandn %xmm6, %xmm3
-; SSE2-NEXT: por %xmm4, %xmm3
-; SSE2-NEXT: pxor %xmm3, %xmm8
-; SSE2-NEXT: movdqa %xmm8, %xmm1
-; SSE2-NEXT: pcmpgtd %xmm2, %xmm1
-; SSE2-NEXT: pshufd {{.*#+}} xmm4 = xmm1[0,0,2,2]
-; SSE2-NEXT: pcmpeqd %xmm2, %xmm8
-; SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm8[1,1,3,3]
-; SSE2-NEXT: pand %xmm4, %xmm2
-; SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm1[1,1,3,3]
-; SSE2-NEXT: por %xmm2, %xmm1
-; SSE2-NEXT: pand %xmm1, %xmm0
-; SSE2-NEXT: pandn %xmm3, %xmm1
-; SSE2-NEXT: por %xmm0, %xmm1
-; SSE2-NEXT: movq %xmm1, %rcx
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
-; SSE2-NEXT: movq %xmm0, %rax
-; SSE2-NEXT: cmpq %rax, %rcx
-; SSE2-NEXT: cmovlq %rcx, %rax
-; SSE2-NEXT: retq
-;
-; SSE41-LABEL: test_v16i64:
-; SSE41: # %bb.0:
-; SSE41-NEXT: movdqa %xmm0, %xmm8
-; SSE41-NEXT: pmovzxdq {{.*#+}} xmm9 = [2147483648,2147483648]
-; SSE41-NEXT: pxor %xmm9, %xmm0
-; SSE41-NEXT: movdqa %xmm4, %xmm10
-; SSE41-NEXT: pxor %xmm9, %xmm10
-; SSE41-NEXT: movdqa %xmm10, %xmm11
-; SSE41-NEXT: pcmpgtd %xmm0, %xmm11
-; SSE41-NEXT: pshufd {{.*#+}} xmm12 = xmm11[0,0,2,2]
-; SSE41-NEXT: pcmpeqd %xmm0, %xmm10
-; SSE41-NEXT: pshufd {{.*#+}} xmm10 = xmm10[1,1,3,3]
-; SSE41-NEXT: pand %xmm12, %xmm10
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm11[1,1,3,3]
-; SSE41-NEXT: por %xmm10, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm8, %xmm4
-; SSE41-NEXT: movapd %xmm4, %xmm8
-; SSE41-NEXT: xorpd %xmm9, %xmm8
-; SSE41-NEXT: movdqa %xmm2, %xmm0
-; SSE41-NEXT: pxor %xmm9, %xmm0
-; SSE41-NEXT: movdqa %xmm6, %xmm10
-; SSE41-NEXT: pxor %xmm9, %xmm10
-; SSE41-NEXT: movdqa %xmm10, %xmm11
-; SSE41-NEXT: pcmpgtd %xmm0, %xmm11
-; SSE41-NEXT: pshufd {{.*#+}} xmm12 = xmm11[0,0,2,2]
-; SSE41-NEXT: pcmpeqd %xmm0, %xmm10
-; SSE41-NEXT: pshufd {{.*#+}} xmm10 = xmm10[1,1,3,3]
-; SSE41-NEXT: pand %xmm12, %xmm10
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm11[1,1,3,3]
-; SSE41-NEXT: por %xmm10, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm2, %xmm6
-; SSE41-NEXT: movapd %xmm6, %xmm0
-; SSE41-NEXT: xorpd %xmm9, %xmm0
-; SSE41-NEXT: movapd %xmm0, %xmm2
-; SSE41-NEXT: pcmpgtd %xmm8, %xmm2
-; SSE41-NEXT: pshufd {{.*#+}} xmm10 = xmm2[0,0,2,2]
-; SSE41-NEXT: pcmpeqd %xmm8, %xmm0
-; SSE41-NEXT: pshufd {{.*#+}} xmm8 = xmm0[1,1,3,3]
-; SSE41-NEXT: pand %xmm10, %xmm8
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,3,3]
-; SSE41-NEXT: por %xmm8, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm4, %xmm6
-; SSE41-NEXT: movapd %xmm6, %xmm2
-; SSE41-NEXT: xorpd %xmm9, %xmm2
-; SSE41-NEXT: movdqa %xmm1, %xmm0
-; SSE41-NEXT: pxor %xmm9, %xmm0
-; SSE41-NEXT: movdqa %xmm5, %xmm4
-; SSE41-NEXT: pxor %xmm9, %xmm4
-; SSE41-NEXT: movdqa %xmm4, %xmm8
-; SSE41-NEXT: pcmpgtd %xmm0, %xmm8
-; SSE41-NEXT: pshufd {{.*#+}} xmm10 = xmm8[0,0,2,2]
-; SSE41-NEXT: pcmpeqd %xmm0, %xmm4
-; SSE41-NEXT: pshufd {{.*#+}} xmm4 = xmm4[1,1,3,3]
-; SSE41-NEXT: pand %xmm10, %xmm4
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm8[1,1,3,3]
-; SSE41-NEXT: por %xmm4, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm1, %xmm5
-; SSE41-NEXT: movapd %xmm5, %xmm1
-; SSE41-NEXT: xorpd %xmm9, %xmm1
-; SSE41-NEXT: movdqa %xmm3, %xmm0
-; SSE41-NEXT: pxor %xmm9, %xmm0
-; SSE41-NEXT: movdqa %xmm7, %xmm4
-; SSE41-NEXT: pxor %xmm9, %xmm4
-; SSE41-NEXT: movdqa %xmm4, %xmm8
-; SSE41-NEXT: pcmpgtd %xmm0, %xmm8
-; SSE41-NEXT: pshufd {{.*#+}} xmm10 = xmm8[0,0,2,2]
-; SSE41-NEXT: pcmpeqd %xmm0, %xmm4
-; SSE41-NEXT: pshufd {{.*#+}} xmm4 = xmm4[1,1,3,3]
-; SSE41-NEXT: pand %xmm10, %xmm4
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm8[1,1,3,3]
-; SSE41-NEXT: por %xmm4, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm3, %xmm7
-; SSE41-NEXT: movapd %xmm7, %xmm0
-; SSE41-NEXT: xorpd %xmm9, %xmm0
-; SSE41-NEXT: movapd %xmm0, %xmm3
-; SSE41-NEXT: pcmpgtd %xmm1, %xmm3
-; SSE41-NEXT: pshufd {{.*#+}} xmm4 = xmm3[0,0,2,2]
-; SSE41-NEXT: pcmpeqd %xmm1, %xmm0
-; SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,3,3]
-; SSE41-NEXT: pand %xmm4, %xmm1
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm3[1,1,3,3]
-; SSE41-NEXT: por %xmm1, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm5, %xmm7
-; SSE41-NEXT: movapd %xmm7, %xmm0
-; SSE41-NEXT: xorpd %xmm9, %xmm0
-; SSE41-NEXT: movapd %xmm0, %xmm1
-; SSE41-NEXT: pcmpgtd %xmm2, %xmm1
-; SSE41-NEXT: pshufd {{.*#+}} xmm3 = xmm1[0,0,2,2]
-; SSE41-NEXT: pcmpeqd %xmm2, %xmm0
-; SSE41-NEXT: pshufd {{.*#+}} xmm2 = xmm0[1,1,3,3]
-; SSE41-NEXT: pand %xmm3, %xmm2
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,3,3]
-; SSE41-NEXT: por %xmm2, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm6, %xmm7
-; SSE41-NEXT: movapd %xmm7, %xmm0
-; SSE41-NEXT: xorpd %xmm9, %xmm0
-; SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm7[2,3,2,3]
-; SSE41-NEXT: pxor %xmm1, %xmm9
-; SSE41-NEXT: movdqa %xmm9, %xmm2
-; SSE41-NEXT: pcmpgtd %xmm0, %xmm2
-; SSE41-NEXT: pmovsxdq %xmm2, %xmm3
-; SSE41-NEXT: pcmpeqd %xmm0, %xmm9
-; SSE41-NEXT: pshufd {{.*#+}} xmm4 = xmm9[1,1,3,3]
-; SSE41-NEXT: pand %xmm3, %xmm4
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,3,3]
-; SSE41-NEXT: por %xmm4, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm7, %xmm1
-; SSE41-NEXT: movq %xmm1, %rax
-; SSE41-NEXT: retq
-;
-; SSE42-LABEL: test_v16i64:
-; SSE42: # %bb.0:
-; SSE42-NEXT: movdqa %xmm0, %xmm8
-; SSE42-NEXT: movdqa %xmm4, %xmm0
-; SSE42-NEXT: pcmpgtq %xmm8, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm8, %xmm4
-; SSE42-NEXT: movdqa %xmm6, %xmm0
-; SSE42-NEXT: pcmpgtq %xmm2, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm2, %xmm6
-; SSE42-NEXT: movapd %xmm6, %xmm0
-; SSE42-NEXT: pcmpgtq %xmm4, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm4, %xmm6
-; SSE42-NEXT: movdqa %xmm5, %xmm0
-; SSE42-NEXT: pcmpgtq %xmm1, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm1, %xmm5
-; SSE42-NEXT: movdqa %xmm7, %xmm0
-; SSE42-NEXT: pcmpgtq %xmm3, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm3, %xmm7
-; SSE42-NEXT: movapd %xmm7, %xmm0
-; SSE42-NEXT: pcmpgtq %xmm5, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm5, %xmm7
-; SSE42-NEXT: movapd %xmm7, %xmm0
-; SSE42-NEXT: pcmpgtq %xmm6, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm6, %xmm7
-; SSE42-NEXT: pshufd {{.*#+}} xmm1 = xmm7[2,3,2,3]
-; SSE42-NEXT: movdqa %xmm1, %xmm0
-; SSE42-NEXT: pcmpgtq %xmm7, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm7, %xmm1
-; SSE42-NEXT: movq %xmm1, %rax
-; SSE42-NEXT: retq
-;
-; AVX1-LABEL: test_v16i64:
-; AVX1: # %bb.0:
-; AVX1-NEXT: vpcmpgtq %xmm0, %xmm2, %xmm4
-; AVX1-NEXT: vblendvpd %xmm4, %xmm0, %xmm2, %xmm4
-; AVX1-NEXT: vpcmpgtq %xmm1, %xmm3, %xmm5
-; AVX1-NEXT: vblendvpd %xmm5, %xmm1, %xmm3, %xmm5
-; AVX1-NEXT: vpcmpgtq %xmm4, %xmm5, %xmm6
-; AVX1-NEXT: vblendvpd %xmm6, %xmm4, %xmm5, %xmm4
-; AVX1-NEXT: vextractf128 $1, %ymm0, %xmm0
-; AVX1-NEXT: vextractf128 $1, %ymm2, %xmm2
-; AVX1-NEXT: vpcmpgtq %xmm0, %xmm2, %xmm5
-; AVX1-NEXT: vblendvpd %xmm5, %xmm0, %xmm2, %xmm0
-; AVX1-NEXT: vextractf128 $1, %ymm1, %xmm1
-; AVX1-NEXT: vextractf128 $1, %ymm3, %xmm2
-; AVX1-NEXT: vpcmpgtq %xmm1, %xmm2, %xmm3
-; AVX1-NEXT: vblendvpd %xmm3, %xmm1, %xmm2, %xmm1
-; AVX1-NEXT: vpcmpgtq %xmm0, %xmm1, %xmm2
-; AVX1-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
-; AVX1-NEXT: vpcmpgtq %xmm4, %xmm0, %xmm1
-; AVX1-NEXT: vblendvpd %xmm1, %xmm4, %xmm0, %xmm0
-; AVX1-NEXT: vshufps {{.*#+}} xmm1 = xmm0[2,3,2,3]
-; AVX1-NEXT: vpcmpgtq %xmm0, %xmm1, %xmm2
-; AVX1-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
-; AVX1-NEXT: vmovq %xmm0, %rax
-; AVX1-NEXT: vzeroupper
-; AVX1-NEXT: retq
-;
-; AVX2-LABEL: test_v16i64:
-; AVX2: # %bb.0:
-; AVX2-NEXT: vpcmpgtq %ymm0, %ymm2, %ymm4
-; AVX2-NEXT: vblendvpd %ymm4, %ymm0, %ymm2, %ymm0
-; AVX2-NEXT: vpcmpgtq %ymm1, %ymm3, %ymm2
-; AVX2-NEXT: vblendvpd %ymm2, %ymm1, %ymm3, %ymm1
-; AVX2-NEXT: vpcmpgtq %ymm0, %ymm1, %ymm2
-; AVX2-NEXT: vblendvpd %ymm2, %ymm0, %ymm1, %ymm0
-; AVX2-NEXT: vextractf128 $1, %ymm0, %xmm1
-; AVX2-NEXT: vpcmpgtq %xmm0, %xmm1, %xmm2
-; AVX2-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
-; AVX2-NEXT: vshufps {{.*#+}} xmm1 = xmm0[2,3,2,3]
-; AVX2-NEXT: vpcmpgtq %xmm0, %xmm1, %xmm2
-; AVX2-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
-; AVX2-NEXT: vmovq %xmm0, %rax
-; AVX2-NEXT: vzeroupper
-; AVX2-NEXT: retq
+define i64 @test_v16i64(<16 x i64> %a0) nounwind {
+; X86-SSE2-LABEL: test_v16i64:
+; X86-SSE2: # %bb.0:
+; X86-SSE2-NEXT: pushl %ebp
+; X86-SSE2-NEXT: movl %esp, %ebp
+; X86-SSE2-NEXT: andl $-16, %esp
+; X86-SSE2-NEXT: subl $48, %esp
+; X86-SSE2-NEXT: movaps %xmm1, (%esp) # 16-byte Spill
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X86-SSE2-NEXT: movdqa 56(%ebp), %xmm5
+; X86-SSE2-NEXT: movdqa {{.*#+}} xmm3 = [2147483648,0,2147483648,0]
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm4
+; X86-SSE2-NEXT: pxor %xmm3, %xmm4
+; X86-SSE2-NEXT: movdqa %xmm5, %xmm6
+; X86-SSE2-NEXT: pxor %xmm3, %xmm6
+; X86-SSE2-NEXT: movdqa %xmm6, %xmm7
+; X86-SSE2-NEXT: pcmpgtd %xmm4, %xmm7
+; X86-SSE2-NEXT: pcmpeqd %xmm4, %xmm6
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm4 = xmm7[0,0,2,2]
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm6[1,1,3,3]
+; X86-SSE2-NEXT: pand %xmm4, %xmm0
+; X86-SSE2-NEXT: movdqa 24(%ebp), %xmm6
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm4 = xmm7[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm0, %xmm4
+; X86-SSE2-NEXT: pand %xmm4, %xmm2
+; X86-SSE2-NEXT: pandn %xmm5, %xmm4
+; X86-SSE2-NEXT: por %xmm2, %xmm4
+; X86-SSE2-NEXT: movdqa %xmm4, {{[-0-9]+}}(%e{{[sb]}}p) # 16-byte Spill
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE2-NEXT: pxor %xmm3, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm6, %xmm2
+; X86-SSE2-NEXT: pxor %xmm3, %xmm2
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm7
+; X86-SSE2-NEXT: pcmpgtd %xmm0, %xmm7
+; X86-SSE2-NEXT: pcmpeqd %xmm0, %xmm2
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm5 = xmm7[0,0,2,2]
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,3,3]
+; X86-SSE2-NEXT: pand %xmm5, %xmm0
+; X86-SSE2-NEXT: movdqa 72(%ebp), %xmm5
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm7[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm0, %xmm2
+; X86-SSE2-NEXT: movdqa 8(%ebp), %xmm7
+; X86-SSE2-NEXT: pand %xmm2, %xmm1
+; X86-SSE2-NEXT: pandn %xmm6, %xmm2
+; X86-SSE2-NEXT: por %xmm1, %xmm2
+; X86-SSE2-NEXT: movdqa %xmm7, %xmm0
+; X86-SSE2-NEXT: pxor %xmm3, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm5, %xmm1
+; X86-SSE2-NEXT: pxor %xmm3, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm6
+; X86-SSE2-NEXT: pcmpgtd %xmm0, %xmm6
+; X86-SSE2-NEXT: pcmpeqd %xmm0, %xmm1
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm1[1,1,3,3]
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm6[0,0,2,2]
+; X86-SSE2-NEXT: pand %xmm0, %xmm1
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm6[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm1, %xmm0
+; X86-SSE2-NEXT: movdqa 40(%ebp), %xmm6
+; X86-SSE2-NEXT: pand %xmm0, %xmm7
+; X86-SSE2-NEXT: pandn %xmm5, %xmm0
+; X86-SSE2-NEXT: por %xmm7, %xmm0
+; X86-SSE2-NEXT: movdqa (%esp), %xmm4 # 16-byte Reload
+; X86-SSE2-NEXT: movdqa %xmm4, %xmm1
+; X86-SSE2-NEXT: pxor %xmm3, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm6, %xmm5
+; X86-SSE2-NEXT: pxor %xmm3, %xmm5
+; X86-SSE2-NEXT: movdqa %xmm5, %xmm7
+; X86-SSE2-NEXT: pcmpgtd %xmm1, %xmm7
+; X86-SSE2-NEXT: pcmpeqd %xmm1, %xmm5
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm5[1,1,3,3]
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm5 = xmm7[0,0,2,2]
+; X86-SSE2-NEXT: pand %xmm5, %xmm1
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm5 = xmm7[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm1, %xmm5
+; X86-SSE2-NEXT: pand %xmm5, %xmm4
+; X86-SSE2-NEXT: pandn %xmm6, %xmm5
+; X86-SSE2-NEXT: por %xmm4, %xmm5
+; X86-SSE2-NEXT: movdqa %xmm5, %xmm1
+; X86-SSE2-NEXT: pxor %xmm3, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm6
+; X86-SSE2-NEXT: pxor %xmm3, %xmm6
+; X86-SSE2-NEXT: movdqa %xmm6, %xmm7
+; X86-SSE2-NEXT: pcmpgtd %xmm1, %xmm7
+; X86-SSE2-NEXT: pcmpeqd %xmm1, %xmm6
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm7[0,0,2,2]
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm6 = xmm6[1,1,3,3]
+; X86-SSE2-NEXT: pand %xmm1, %xmm6
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm7[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm6, %xmm1
+; X86-SSE2-NEXT: pand %xmm1, %xmm5
+; X86-SSE2-NEXT: pandn %xmm0, %xmm1
+; X86-SSE2-NEXT: por %xmm5, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm0
+; X86-SSE2-NEXT: pxor %xmm3, %xmm0
+; X86-SSE2-NEXT: movdqa {{[-0-9]+}}(%e{{[sb]}}p), %xmm4 # 16-byte Reload
+; X86-SSE2-NEXT: movdqa %xmm4, %xmm5
+; X86-SSE2-NEXT: pxor %xmm3, %xmm5
+; X86-SSE2-NEXT: movdqa %xmm5, %xmm6
+; X86-SSE2-NEXT: pcmpgtd %xmm0, %xmm6
+; X86-SSE2-NEXT: pcmpeqd %xmm0, %xmm5
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm6[0,0,2,2]
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm7 = xmm5[1,1,3,3]
+; X86-SSE2-NEXT: pand %xmm0, %xmm7
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm5 = xmm6[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm7, %xmm5
+; X86-SSE2-NEXT: pand %xmm5, %xmm2
+; X86-SSE2-NEXT: pandn %xmm4, %xmm5
+; X86-SSE2-NEXT: por %xmm2, %xmm5
+; X86-SSE2-NEXT: movdqa %xmm5, %xmm0
+; X86-SSE2-NEXT: pxor %xmm3, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm2
+; X86-SSE2-NEXT: pxor %xmm3, %xmm2
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm4
+; X86-SSE2-NEXT: pcmpgtd %xmm0, %xmm4
+; X86-SSE2-NEXT: pcmpeqd %xmm0, %xmm2
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm4[0,0,2,2]
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm2[1,1,3,3]
+; X86-SSE2-NEXT: pand %xmm0, %xmm2
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm4[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm2, %xmm0
+; X86-SSE2-NEXT: pand %xmm0, %xmm5
+; X86-SSE2-NEXT: pandn %xmm1, %xmm0
+; X86-SSE2-NEXT: por %xmm5, %xmm0
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE2-NEXT: pxor %xmm3, %xmm2
+; X86-SSE2-NEXT: pxor %xmm1, %xmm3
+; X86-SSE2-NEXT: movdqa %xmm3, %xmm4
+; X86-SSE2-NEXT: pcmpgtd %xmm2, %xmm4
+; X86-SSE2-NEXT: pcmpeqd %xmm2, %xmm3
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm4[0,0,2,2]
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm3 = xmm3[1,1,3,3]
+; X86-SSE2-NEXT: pand %xmm2, %xmm3
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm4[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm3, %xmm2
+; X86-SSE2-NEXT: pand %xmm2, %xmm0
+; X86-SSE2-NEXT: pandn %xmm1, %xmm2
+; X86-SSE2-NEXT: por %xmm0, %xmm2
+; X86-SSE2-NEXT: movd %xmm2, %eax
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,1,1]
+; X86-SSE2-NEXT: movd %xmm0, %edx
+; X86-SSE2-NEXT: movl %ebp, %esp
+; X86-SSE2-NEXT: popl %ebp
+; X86-SSE2-NEXT: retl
+;
+; X64-SSE2-LABEL: test_v16i64:
+; X64-SSE2: # %bb.0:
+; X64-SSE2-NEXT: movdqa {{.*#+}} xmm8 = [2147483648,2147483648]
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm9
+; X64-SSE2-NEXT: pxor %xmm8, %xmm9
+; X64-SSE2-NEXT: movdqa %xmm4, %xmm10
+; X64-SSE2-NEXT: pxor %xmm8, %xmm10
+; X64-SSE2-NEXT: movdqa %xmm10, %xmm11
+; X64-SSE2-NEXT: pcmpgtd %xmm9, %xmm11
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm12 = xmm11[0,0,2,2]
+; X64-SSE2-NEXT: pcmpeqd %xmm9, %xmm10
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm10 = xmm10[1,1,3,3]
+; X64-SSE2-NEXT: pand %xmm12, %xmm10
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm9 = xmm11[1,1,3,3]
+; X64-SSE2-NEXT: por %xmm10, %xmm9
+; X64-SSE2-NEXT: pand %xmm9, %xmm0
+; X64-SSE2-NEXT: pandn %xmm4, %xmm9
+; X64-SSE2-NEXT: por %xmm0, %xmm9
+; X64-SSE2-NEXT: movdqa %xmm9, %xmm0
+; X64-SSE2-NEXT: pxor %xmm8, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm2, %xmm4
+; X64-SSE2-NEXT: pxor %xmm8, %xmm4
+; X64-SSE2-NEXT: movdqa %xmm6, %xmm10
+; X64-SSE2-NEXT: pxor %xmm8, %xmm10
+; X64-SSE2-NEXT: movdqa %xmm10, %xmm11
+; X64-SSE2-NEXT: pcmpgtd %xmm4, %xmm11
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm12 = xmm11[0,0,2,2]
+; X64-SSE2-NEXT: pcmpeqd %xmm4, %xmm10
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm4 = xmm10[1,1,3,3]
+; X64-SSE2-NEXT: pand %xmm12, %xmm4
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm10 = xmm11[1,1,3,3]
+; X64-SSE2-NEXT: por %xmm4, %xmm10
+; X64-SSE2-NEXT: pand %xmm10, %xmm2
+; X64-SSE2-NEXT: pandn %xmm6, %xmm10
+; X64-SSE2-NEXT: por %xmm2, %xmm10
+; X64-SSE2-NEXT: movdqa %xmm10, %xmm2
+; X64-SSE2-NEXT: pxor %xmm8, %xmm2
+; X64-SSE2-NEXT: movdqa %xmm2, %xmm4
+; X64-SSE2-NEXT: pcmpgtd %xmm0, %xmm4
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm6 = xmm4[0,0,2,2]
+; X64-SSE2-NEXT: pcmpeqd %xmm0, %xmm2
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm2[1,1,3,3]
+; X64-SSE2-NEXT: pand %xmm6, %xmm2
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm4[1,1,3,3]
+; X64-SSE2-NEXT: por %xmm2, %xmm0
+; X64-SSE2-NEXT: pand %xmm0, %xmm9
+; X64-SSE2-NEXT: pandn %xmm10, %xmm0
+; X64-SSE2-NEXT: por %xmm9, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X64-SSE2-NEXT: pxor %xmm8, %xmm2
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm4
+; X64-SSE2-NEXT: pxor %xmm8, %xmm4
+; X64-SSE2-NEXT: movdqa %xmm5, %xmm6
+; X64-SSE2-NEXT: pxor %xmm8, %xmm6
+; X64-SSE2-NEXT: movdqa %xmm6, %xmm9
+; X64-SSE2-NEXT: pcmpgtd %xmm4, %xmm9
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm10 = xmm9[0,0,2,2]
+; X64-SSE2-NEXT: pcmpeqd %xmm4, %xmm6
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm6 = xmm6[1,1,3,3]
+; X64-SSE2-NEXT: pand %xmm10, %xmm6
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm4 = xmm9[1,1,3,3]
+; X64-SSE2-NEXT: por %xmm6, %xmm4
+; X64-SSE2-NEXT: pand %xmm4, %xmm1
+; X64-SSE2-NEXT: pandn %xmm5, %xmm4
+; X64-SSE2-NEXT: por %xmm1, %xmm4
+; X64-SSE2-NEXT: movdqa %xmm4, %xmm1
+; X64-SSE2-NEXT: pxor %xmm8, %xmm1
+; X64-SSE2-NEXT: movdqa %xmm3, %xmm5
+; X64-SSE2-NEXT: pxor %xmm8, %xmm5
+; X64-SSE2-NEXT: movdqa %xmm7, %xmm6
+; X64-SSE2-NEXT: pxor %xmm8, %xmm6
+; X64-SSE2-NEXT: movdqa %xmm6, %xmm9
+; X64-SSE2-NEXT: pcmpgtd %xmm5, %xmm9
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm10 = xmm9[0,0,2,2]
+; X64-SSE2-NEXT: pcmpeqd %xmm5, %xmm6
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm5 = xmm6[1,1,3,3]
+; X64-SSE2-NEXT: pand %xmm10, %xmm5
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm6 = xmm9[1,1,3,3]
+; X64-SSE2-NEXT: por %xmm5, %xmm6
+; X64-SSE2-NEXT: pand %xmm6, %xmm3
+; X64-SSE2-NEXT: pandn %xmm7, %xmm6
+; X64-SSE2-NEXT: por %xmm3, %xmm6
+; X64-SSE2-NEXT: movdqa %xmm6, %xmm3
+; X64-SSE2-NEXT: pxor %xmm8, %xmm3
+; X64-SSE2-NEXT: movdqa %xmm3, %xmm5
+; X64-SSE2-NEXT: pcmpgtd %xmm1, %xmm5
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm7 = xmm5[0,0,2,2]
+; X64-SSE2-NEXT: pcmpeqd %xmm1, %xmm3
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm3[1,1,3,3]
+; X64-SSE2-NEXT: pand %xmm7, %xmm1
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm3 = xmm5[1,1,3,3]
+; X64-SSE2-NEXT: por %xmm1, %xmm3
+; X64-SSE2-NEXT: pand %xmm3, %xmm4
+; X64-SSE2-NEXT: pandn %xmm6, %xmm3
+; X64-SSE2-NEXT: por %xmm4, %xmm3
+; X64-SSE2-NEXT: pxor %xmm3, %xmm8
+; X64-SSE2-NEXT: movdqa %xmm8, %xmm1
+; X64-SSE2-NEXT: pcmpgtd %xmm2, %xmm1
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm4 = xmm1[0,0,2,2]
+; X64-SSE2-NEXT: pcmpeqd %xmm2, %xmm8
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm8[1,1,3,3]
+; X64-SSE2-NEXT: pand %xmm4, %xmm2
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm1[1,1,3,3]
+; X64-SSE2-NEXT: por %xmm2, %xmm1
+; X64-SSE2-NEXT: pand %xmm1, %xmm0
+; X64-SSE2-NEXT: pandn %xmm3, %xmm1
+; X64-SSE2-NEXT: por %xmm0, %xmm1
+; X64-SSE2-NEXT: movq %xmm1, %rcx
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
+; X64-SSE2-NEXT: movq %xmm0, %rax
+; X64-SSE2-NEXT: cmpq %rax, %rcx
+; X64-SSE2-NEXT: cmovlq %rcx, %rax
+; X64-SSE2-NEXT: retq
+;
+; X86-SSE41-LABEL: test_v16i64:
+; X86-SSE41: # %bb.0:
+; X86-SSE41-NEXT: pushl %ebp
+; X86-SSE41-NEXT: movl %esp, %ebp
+; X86-SSE41-NEXT: andl $-16, %esp
+; X86-SSE41-NEXT: subl $48, %esp
+; X86-SSE41-NEXT: movaps %xmm1, (%esp) # 16-byte Spill
+; X86-SSE41-NEXT: movdqa %xmm0, %xmm3
+; X86-SSE41-NEXT: movdqa 56(%ebp), %xmm1
+; X86-SSE41-NEXT: pmovzxdq {{.*#+}} xmm4 = [2147483648,2147483648]
+; X86-SSE41-NEXT: movdqa %xmm2, %xmm0
+; X86-SSE41-NEXT: pxor %xmm4, %xmm0
+; X86-SSE41-NEXT: movdqa %xmm1, %xmm6
+; X86-SSE41-NEXT: movdqa %xmm1, %xmm5
+; X86-SSE41-NEXT: pxor %xmm4, %xmm6
+; X86-SSE41-NEXT: movdqa %xmm6, %xmm7
+; X86-SSE41-NEXT: pcmpgtd %xmm0, %xmm7
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm6
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm7[0,0,2,2]
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm6[1,1,3,3]
+; X86-SSE41-NEXT: pand %xmm0, %xmm1
+; X86-SSE41-NEXT: movdqa 24(%ebp), %xmm6
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm7[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm1, %xmm0
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm2, %xmm5
+; X86-SSE41-NEXT: movapd %xmm5, {{[-0-9]+}}(%e{{[sb]}}p) # 16-byte Spill
+; X86-SSE41-NEXT: movdqa %xmm3, %xmm0
+; X86-SSE41-NEXT: pxor %xmm4, %xmm0
+; X86-SSE41-NEXT: movdqa %xmm6, %xmm1
+; X86-SSE41-NEXT: pxor %xmm4, %xmm1
+; X86-SSE41-NEXT: movdqa %xmm1, %xmm7
+; X86-SSE41-NEXT: pcmpgtd %xmm0, %xmm7
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm1
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm7[0,0,2,2]
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm1[1,1,3,3]
+; X86-SSE41-NEXT: pand %xmm0, %xmm1
+; X86-SSE41-NEXT: movdqa 72(%ebp), %xmm2
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm7[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm1, %xmm0
+; X86-SSE41-NEXT: movdqa 8(%ebp), %xmm7
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm3, %xmm6
+; X86-SSE41-NEXT: movdqa %xmm7, %xmm0
+; X86-SSE41-NEXT: pxor %xmm4, %xmm0
+; X86-SSE41-NEXT: movdqa %xmm2, %xmm1
+; X86-SSE41-NEXT: pxor %xmm4, %xmm1
+; X86-SSE41-NEXT: movdqa %xmm1, %xmm3
+; X86-SSE41-NEXT: pcmpgtd %xmm0, %xmm3
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm1
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm1[1,1,3,3]
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm3[0,0,2,2]
+; X86-SSE41-NEXT: pand %xmm0, %xmm1
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm3[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm1, %xmm0
+; X86-SSE41-NEXT: movdqa 40(%ebp), %xmm3
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm7, %xmm2
+; X86-SSE41-NEXT: movdqa (%esp), %xmm5 # 16-byte Reload
+; X86-SSE41-NEXT: movdqa %xmm5, %xmm0
+; X86-SSE41-NEXT: pxor %xmm4, %xmm0
+; X86-SSE41-NEXT: movdqa %xmm3, %xmm1
+; X86-SSE41-NEXT: pxor %xmm4, %xmm1
+; X86-SSE41-NEXT: movdqa %xmm1, %xmm7
+; X86-SSE41-NEXT: pcmpgtd %xmm0, %xmm7
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm1
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm1[1,1,3,3]
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm7[0,0,2,2]
+; X86-SSE41-NEXT: pand %xmm0, %xmm1
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm7[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm1, %xmm0
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm5, %xmm3
+; X86-SSE41-NEXT: movapd %xmm3, %xmm0
+; X86-SSE41-NEXT: xorpd %xmm4, %xmm0
+; X86-SSE41-NEXT: movapd %xmm2, %xmm1
+; X86-SSE41-NEXT: xorpd %xmm4, %xmm1
+; X86-SSE41-NEXT: movapd %xmm1, %xmm7
+; X86-SSE41-NEXT: pcmpgtd %xmm0, %xmm7
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm1
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm7[0,0,2,2]
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm1[1,1,3,3]
+; X86-SSE41-NEXT: pand %xmm0, %xmm1
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm7[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm1, %xmm0
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm3, %xmm2
+; X86-SSE41-NEXT: movapd %xmm6, %xmm0
+; X86-SSE41-NEXT: xorpd %xmm4, %xmm0
+; X86-SSE41-NEXT: movdqa {{[-0-9]+}}(%e{{[sb]}}p), %xmm5 # 16-byte Reload
+; X86-SSE41-NEXT: movdqa %xmm5, %xmm1
+; X86-SSE41-NEXT: pxor %xmm4, %xmm1
+; X86-SSE41-NEXT: movdqa %xmm1, %xmm3
+; X86-SSE41-NEXT: pcmpgtd %xmm0, %xmm3
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm1
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm3[0,0,2,2]
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm1[1,1,3,3]
+; X86-SSE41-NEXT: pand %xmm0, %xmm1
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm3[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm1, %xmm0
+; X86-SSE41-NEXT: movdqa %xmm5, %xmm1
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm6, %xmm1
+; X86-SSE41-NEXT: movapd %xmm1, %xmm0
+; X86-SSE41-NEXT: movapd %xmm1, %xmm5
+; X86-SSE41-NEXT: xorpd %xmm4, %xmm0
+; X86-SSE41-NEXT: movapd %xmm2, %xmm1
+; X86-SSE41-NEXT: xorpd %xmm4, %xmm1
+; X86-SSE41-NEXT: movapd %xmm1, %xmm3
+; X86-SSE41-NEXT: pcmpgtd %xmm0, %xmm3
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm1
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm3[0,0,2,2]
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm1[1,1,3,3]
+; X86-SSE41-NEXT: pand %xmm0, %xmm1
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm3[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm1, %xmm0
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm5, %xmm2
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm2[2,3,2,3]
+; X86-SSE41-NEXT: movdqa %xmm2, %xmm0
+; X86-SSE41-NEXT: pxor %xmm4, %xmm0
+; X86-SSE41-NEXT: pxor %xmm1, %xmm4
+; X86-SSE41-NEXT: movdqa %xmm4, %xmm3
+; X86-SSE41-NEXT: pcmpgtd %xmm0, %xmm3
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm4
+; X86-SSE41-NEXT: pmovsxdq %xmm3, %xmm0
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm4 = xmm4[1,1,3,3]
+; X86-SSE41-NEXT: pand %xmm0, %xmm4
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm3[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm4, %xmm0
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm2, %xmm1
+; X86-SSE41-NEXT: movd %xmm1, %eax
+; X86-SSE41-NEXT: pextrd $1, %xmm1, %edx
+; X86-SSE41-NEXT: movl %ebp, %esp
+; X86-SSE41-NEXT: popl %ebp
+; X86-SSE41-NEXT: retl
+;
+; X64-SSE41-LABEL: test_v16i64:
+; X64-SSE41: # %bb.0:
+; X64-SSE41-NEXT: movdqa %xmm0, %xmm8
+; X64-SSE41-NEXT: pmovzxdq {{.*#+}} xmm9 = [2147483648,2147483648]
+; X64-SSE41-NEXT: pxor %xmm9, %xmm0
+; X64-SSE41-NEXT: movdqa %xmm4, %xmm10
+; X64-SSE41-NEXT: pxor %xmm9, %xmm10
+; X64-SSE41-NEXT: movdqa %xmm10, %xmm11
+; X64-SSE41-NEXT: pcmpgtd %xmm0, %xmm11
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm12 = xmm11[0,0,2,2]
+; X64-SSE41-NEXT: pcmpeqd %xmm0, %xmm10
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm10 = xmm10[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm12, %xmm10
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm11[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm10, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm8, %xmm4
+; X64-SSE41-NEXT: movapd %xmm4, %xmm8
+; X64-SSE41-NEXT: xorpd %xmm9, %xmm8
+; X64-SSE41-NEXT: movdqa %xmm2, %xmm0
+; X64-SSE41-NEXT: pxor %xmm9, %xmm0
+; X64-SSE41-NEXT: movdqa %xmm6, %xmm10
+; X64-SSE41-NEXT: pxor %xmm9, %xmm10
+; X64-SSE41-NEXT: movdqa %xmm10, %xmm11
+; X64-SSE41-NEXT: pcmpgtd %xmm0, %xmm11
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm12 = xmm11[0,0,2,2]
+; X64-SSE41-NEXT: pcmpeqd %xmm0, %xmm10
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm10 = xmm10[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm12, %xmm10
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm11[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm10, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm2, %xmm6
+; X64-SSE41-NEXT: movapd %xmm6, %xmm0
+; X64-SSE41-NEXT: xorpd %xmm9, %xmm0
+; X64-SSE41-NEXT: movapd %xmm0, %xmm2
+; X64-SSE41-NEXT: pcmpgtd %xmm8, %xmm2
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm10 = xmm2[0,0,2,2]
+; X64-SSE41-NEXT: pcmpeqd %xmm8, %xmm0
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm8 = xmm0[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm10, %xmm8
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm8, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm4, %xmm6
+; X64-SSE41-NEXT: movapd %xmm6, %xmm2
+; X64-SSE41-NEXT: xorpd %xmm9, %xmm2
+; X64-SSE41-NEXT: movdqa %xmm1, %xmm0
+; X64-SSE41-NEXT: pxor %xmm9, %xmm0
+; X64-SSE41-NEXT: movdqa %xmm5, %xmm4
+; X64-SSE41-NEXT: pxor %xmm9, %xmm4
+; X64-SSE41-NEXT: movdqa %xmm4, %xmm8
+; X64-SSE41-NEXT: pcmpgtd %xmm0, %xmm8
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm10 = xmm8[0,0,2,2]
+; X64-SSE41-NEXT: pcmpeqd %xmm0, %xmm4
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm4 = xmm4[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm10, %xmm4
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm8[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm4, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm1, %xmm5
+; X64-SSE41-NEXT: movapd %xmm5, %xmm1
+; X64-SSE41-NEXT: xorpd %xmm9, %xmm1
+; X64-SSE41-NEXT: movdqa %xmm3, %xmm0
+; X64-SSE41-NEXT: pxor %xmm9, %xmm0
+; X64-SSE41-NEXT: movdqa %xmm7, %xmm4
+; X64-SSE41-NEXT: pxor %xmm9, %xmm4
+; X64-SSE41-NEXT: movdqa %xmm4, %xmm8
+; X64-SSE41-NEXT: pcmpgtd %xmm0, %xmm8
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm10 = xmm8[0,0,2,2]
+; X64-SSE41-NEXT: pcmpeqd %xmm0, %xmm4
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm4 = xmm4[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm10, %xmm4
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm8[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm4, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm3, %xmm7
+; X64-SSE41-NEXT: movapd %xmm7, %xmm0
+; X64-SSE41-NEXT: xorpd %xmm9, %xmm0
+; X64-SSE41-NEXT: movapd %xmm0, %xmm3
+; X64-SSE41-NEXT: pcmpgtd %xmm1, %xmm3
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm4 = xmm3[0,0,2,2]
+; X64-SSE41-NEXT: pcmpeqd %xmm1, %xmm0
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm4, %xmm1
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm3[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm1, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm5, %xmm7
+; X64-SSE41-NEXT: movapd %xmm7, %xmm0
+; X64-SSE41-NEXT: xorpd %xmm9, %xmm0
+; X64-SSE41-NEXT: movapd %xmm0, %xmm1
+; X64-SSE41-NEXT: pcmpgtd %xmm2, %xmm1
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm3 = xmm1[0,0,2,2]
+; X64-SSE41-NEXT: pcmpeqd %xmm2, %xmm0
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm2 = xmm0[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm3, %xmm2
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm2, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm6, %xmm7
+; X64-SSE41-NEXT: movapd %xmm7, %xmm0
+; X64-SSE41-NEXT: xorpd %xmm9, %xmm0
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm7[2,3,2,3]
+; X64-SSE41-NEXT: pxor %xmm1, %xmm9
+; X64-SSE41-NEXT: movdqa %xmm9, %xmm2
+; X64-SSE41-NEXT: pcmpgtd %xmm0, %xmm2
+; X64-SSE41-NEXT: pmovsxdq %xmm2, %xmm3
+; X64-SSE41-NEXT: pcmpeqd %xmm0, %xmm9
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm4 = xmm9[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm3, %xmm4
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm4, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm7, %xmm1
+; X64-SSE41-NEXT: movq %xmm1, %rax
+; X64-SSE41-NEXT: retq
+;
+; X86-SSE42-LABEL: test_v16i64:
+; X86-SSE42: # %bb.0:
+; X86-SSE42-NEXT: pushl %ebp
+; X86-SSE42-NEXT: movl %esp, %ebp
+; X86-SSE42-NEXT: andl $-16, %esp
+; X86-SSE42-NEXT: subl $16, %esp
+; X86-SSE42-NEXT: movdqa %xmm0, %xmm3
+; X86-SSE42-NEXT: movdqa 8(%ebp), %xmm5
+; X86-SSE42-NEXT: movdqa 40(%ebp), %xmm4
+; X86-SSE42-NEXT: movdqa %xmm4, %xmm0
+; X86-SSE42-NEXT: pcmpgtq %xmm1, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm1, %xmm4
+; X86-SSE42-NEXT: movdqa 72(%ebp), %xmm1
+; X86-SSE42-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE42-NEXT: pcmpgtq %xmm5, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm5, %xmm1
+; X86-SSE42-NEXT: movdqa 24(%ebp), %xmm5
+; X86-SSE42-NEXT: movdqa %xmm5, %xmm0
+; X86-SSE42-NEXT: pcmpgtq %xmm3, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm3, %xmm5
+; X86-SSE42-NEXT: movdqa 56(%ebp), %xmm3
+; X86-SSE42-NEXT: movdqa %xmm3, %xmm0
+; X86-SSE42-NEXT: pcmpgtq %xmm2, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm2, %xmm3
+; X86-SSE42-NEXT: movapd %xmm3, %xmm0
+; X86-SSE42-NEXT: pcmpgtq %xmm5, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm5, %xmm3
+; X86-SSE42-NEXT: movapd %xmm1, %xmm0
+; X86-SSE42-NEXT: pcmpgtq %xmm4, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm4, %xmm1
+; X86-SSE42-NEXT: movapd %xmm1, %xmm0
+; X86-SSE42-NEXT: pcmpgtq %xmm3, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm3, %xmm1
+; X86-SSE42-NEXT: pshufd {{.*#+}} xmm2 = xmm1[2,3,2,3]
+; X86-SSE42-NEXT: movdqa %xmm2, %xmm0
+; X86-SSE42-NEXT: pcmpgtq %xmm1, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm1, %xmm2
+; X86-SSE42-NEXT: movd %xmm2, %eax
+; X86-SSE42-NEXT: pextrd $1, %xmm2, %edx
+; X86-SSE42-NEXT: movl %ebp, %esp
+; X86-SSE42-NEXT: popl %ebp
+; X86-SSE42-NEXT: retl
+;
+; X64-SSE42-LABEL: test_v16i64:
+; X64-SSE42: # %bb.0:
+; X64-SSE42-NEXT: movdqa %xmm0, %xmm8
+; X64-SSE42-NEXT: movdqa %xmm4, %xmm0
+; X64-SSE42-NEXT: pcmpgtq %xmm8, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm8, %xmm4
+; X64-SSE42-NEXT: movdqa %xmm6, %xmm0
+; X64-SSE42-NEXT: pcmpgtq %xmm2, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm2, %xmm6
+; X64-SSE42-NEXT: movapd %xmm6, %xmm0
+; X64-SSE42-NEXT: pcmpgtq %xmm4, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm4, %xmm6
+; X64-SSE42-NEXT: movdqa %xmm5, %xmm0
+; X64-SSE42-NEXT: pcmpgtq %xmm1, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm1, %xmm5
+; X64-SSE42-NEXT: movdqa %xmm7, %xmm0
+; X64-SSE42-NEXT: pcmpgtq %xmm3, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm3, %xmm7
+; X64-SSE42-NEXT: movapd %xmm7, %xmm0
+; X64-SSE42-NEXT: pcmpgtq %xmm5, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm5, %xmm7
+; X64-SSE42-NEXT: movapd %xmm7, %xmm0
+; X64-SSE42-NEXT: pcmpgtq %xmm6, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm6, %xmm7
+; X64-SSE42-NEXT: pshufd {{.*#+}} xmm1 = xmm7[2,3,2,3]
+; X64-SSE42-NEXT: movdqa %xmm1, %xmm0
+; X64-SSE42-NEXT: pcmpgtq %xmm7, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm7, %xmm1
+; X64-SSE42-NEXT: movq %xmm1, %rax
+; X64-SSE42-NEXT: retq
+;
+; X86-AVX1-LABEL: test_v16i64:
+; X86-AVX1: # %bb.0:
+; X86-AVX1-NEXT: pushl %ebp
+; X86-AVX1-NEXT: movl %esp, %ebp
+; X86-AVX1-NEXT: andl $-32, %esp
+; X86-AVX1-NEXT: subl $32, %esp
+; X86-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm3
+; X86-AVX1-NEXT: vextractf128 $1, %ymm2, %xmm4
+; X86-AVX1-NEXT: vpcmpgtq %xmm3, %xmm4, %xmm5
+; X86-AVX1-NEXT: vblendvpd %xmm5, %xmm3, %xmm4, %xmm3
+; X86-AVX1-NEXT: vextractf128 $1, %ymm1, %xmm4
+; X86-AVX1-NEXT: vmovdqa 8(%ebp), %xmm5
+; X86-AVX1-NEXT: vmovdqa 24(%ebp), %xmm6
+; X86-AVX1-NEXT: vpcmpgtq %xmm4, %xmm6, %xmm7
+; X86-AVX1-NEXT: vblendvpd %xmm7, %xmm4, %xmm6, %xmm4
+; X86-AVX1-NEXT: vpcmpgtq %xmm0, %xmm2, %xmm6
+; X86-AVX1-NEXT: vblendvpd %xmm6, %xmm0, %xmm2, %xmm0
+; X86-AVX1-NEXT: vpcmpgtq %xmm1, %xmm5, %xmm2
+; X86-AVX1-NEXT: vblendvpd %xmm2, %xmm1, %xmm5, %xmm1
+; X86-AVX1-NEXT: vpcmpgtq %xmm0, %xmm1, %xmm2
+; X86-AVX1-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X86-AVX1-NEXT: vpcmpgtq %xmm3, %xmm4, %xmm1
+; X86-AVX1-NEXT: vblendvpd %xmm1, %xmm3, %xmm4, %xmm1
+; X86-AVX1-NEXT: vpcmpgtq %xmm0, %xmm1, %xmm2
+; X86-AVX1-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X86-AVX1-NEXT: vshufps {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-AVX1-NEXT: vpcmpgtq %xmm0, %xmm1, %xmm2
+; X86-AVX1-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X86-AVX1-NEXT: vmovd %xmm0, %eax
+; X86-AVX1-NEXT: vpextrd $1, %xmm0, %edx
+; X86-AVX1-NEXT: movl %ebp, %esp
+; X86-AVX1-NEXT: popl %ebp
+; X86-AVX1-NEXT: vzeroupper
+; X86-AVX1-NEXT: retl
+;
+; X64-AVX1-LABEL: test_v16i64:
+; X64-AVX1: # %bb.0:
+; X64-AVX1-NEXT: vpcmpgtq %xmm0, %xmm2, %xmm4
+; X64-AVX1-NEXT: vblendvpd %xmm4, %xmm0, %xmm2, %xmm4
+; X64-AVX1-NEXT: vpcmpgtq %xmm1, %xmm3, %xmm5
+; X64-AVX1-NEXT: vblendvpd %xmm5, %xmm1, %xmm3, %xmm5
+; X64-AVX1-NEXT: vpcmpgtq %xmm4, %xmm5, %xmm6
+; X64-AVX1-NEXT: vblendvpd %xmm6, %xmm4, %xmm5, %xmm4
+; X64-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm0
+; X64-AVX1-NEXT: vextractf128 $1, %ymm2, %xmm2
+; X64-AVX1-NEXT: vpcmpgtq %xmm0, %xmm2, %xmm5
+; X64-AVX1-NEXT: vblendvpd %xmm5, %xmm0, %xmm2, %xmm0
+; X64-AVX1-NEXT: vextractf128 $1, %ymm1, %xmm1
+; X64-AVX1-NEXT: vextractf128 $1, %ymm3, %xmm2
+; X64-AVX1-NEXT: vpcmpgtq %xmm1, %xmm2, %xmm3
+; X64-AVX1-NEXT: vblendvpd %xmm3, %xmm1, %xmm2, %xmm1
+; X64-AVX1-NEXT: vpcmpgtq %xmm0, %xmm1, %xmm2
+; X64-AVX1-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X64-AVX1-NEXT: vpcmpgtq %xmm4, %xmm0, %xmm1
+; X64-AVX1-NEXT: vblendvpd %xmm1, %xmm4, %xmm0, %xmm0
+; X64-AVX1-NEXT: vshufps {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X64-AVX1-NEXT: vpcmpgtq %xmm0, %xmm1, %xmm2
+; X64-AVX1-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X64-AVX1-NEXT: vmovq %xmm0, %rax
+; X64-AVX1-NEXT: vzeroupper
+; X64-AVX1-NEXT: retq
+;
+; X86-AVX2-LABEL: test_v16i64:
+; X86-AVX2: # %bb.0:
+; X86-AVX2-NEXT: pushl %ebp
+; X86-AVX2-NEXT: movl %esp, %ebp
+; X86-AVX2-NEXT: andl $-32, %esp
+; X86-AVX2-NEXT: subl $32, %esp
+; X86-AVX2-NEXT: vmovdqa 8(%ebp), %ymm3
+; X86-AVX2-NEXT: vpcmpgtq %ymm0, %ymm2, %ymm4
+; X86-AVX2-NEXT: vblendvpd %ymm4, %ymm0, %ymm2, %ymm0
+; X86-AVX2-NEXT: vpcmpgtq %ymm1, %ymm3, %ymm2
+; X86-AVX2-NEXT: vblendvpd %ymm2, %ymm1, %ymm3, %ymm1
+; X86-AVX2-NEXT: vpcmpgtq %ymm0, %ymm1, %ymm2
+; X86-AVX2-NEXT: vblendvpd %ymm2, %ymm0, %ymm1, %ymm0
+; X86-AVX2-NEXT: vextractf128 $1, %ymm0, %xmm1
+; X86-AVX2-NEXT: vpcmpgtq %xmm0, %xmm1, %xmm2
+; X86-AVX2-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X86-AVX2-NEXT: vshufps {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-AVX2-NEXT: vpcmpgtq %xmm0, %xmm1, %xmm2
+; X86-AVX2-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X86-AVX2-NEXT: vmovd %xmm0, %eax
+; X86-AVX2-NEXT: vpextrd $1, %xmm0, %edx
+; X86-AVX2-NEXT: movl %ebp, %esp
+; X86-AVX2-NEXT: popl %ebp
+; X86-AVX2-NEXT: vzeroupper
+; X86-AVX2-NEXT: retl
+;
+; X64-AVX2-LABEL: test_v16i64:
+; X64-AVX2: # %bb.0:
+; X64-AVX2-NEXT: vpcmpgtq %ymm0, %ymm2, %ymm4
+; X64-AVX2-NEXT: vblendvpd %ymm4, %ymm0, %ymm2, %ymm0
+; X64-AVX2-NEXT: vpcmpgtq %ymm1, %ymm3, %ymm2
+; X64-AVX2-NEXT: vblendvpd %ymm2, %ymm1, %ymm3, %ymm1
+; X64-AVX2-NEXT: vpcmpgtq %ymm0, %ymm1, %ymm2
+; X64-AVX2-NEXT: vblendvpd %ymm2, %ymm0, %ymm1, %ymm0
+; X64-AVX2-NEXT: vextractf128 $1, %ymm0, %xmm1
+; X64-AVX2-NEXT: vpcmpgtq %xmm0, %xmm1, %xmm2
+; X64-AVX2-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X64-AVX2-NEXT: vshufps {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X64-AVX2-NEXT: vpcmpgtq %xmm0, %xmm1, %xmm2
+; X64-AVX2-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X64-AVX2-NEXT: vmovq %xmm0, %rax
+; X64-AVX2-NEXT: vzeroupper
+; X64-AVX2-NEXT: retq
;
; AVX512BW-LABEL: test_v16i64:
; AVX512BW: # %bb.0:
@@ -720,7 +1480,7 @@ define i64 @test_v16i64(<16 x i64> %a0) {
; vXi32
;
-define i32 @test_v2i32(<2 x i32> %a0) {
+define i32 @test_v2i32(<2 x i32> %a0) nounwind {
; SSE2-LABEL: test_v2i32:
; SSE2: # %bb.0:
; SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
@@ -730,33 +1490,26 @@ define i32 @test_v2i32(<2 x i32> %a0) {
; SSE2-NEXT: pandn %xmm1, %xmm2
; SSE2-NEXT: por %xmm0, %xmm2
; SSE2-NEXT: movd %xmm2, %eax
-; SSE2-NEXT: retq
+; SSE2-NEXT: ret{{[l|q]}}
;
; SSE4-LABEL: test_v2i32:
; SSE4: # %bb.0:
; SSE4-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
; SSE4-NEXT: pminsd %xmm0, %xmm1
; SSE4-NEXT: movd %xmm1, %eax
-; SSE4-NEXT: retq
+; SSE4-NEXT: ret{{[l|q]}}
;
; AVX-LABEL: test_v2i32:
; AVX: # %bb.0:
; AVX-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
; AVX-NEXT: vpminsd %xmm1, %xmm0, %xmm0
; AVX-NEXT: vmovd %xmm0, %eax
-; AVX-NEXT: retq
-;
-; AVX512-LABEL: test_v2i32:
-; AVX512: # %bb.0:
-; AVX512-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
-; AVX512-NEXT: vpminsd %xmm1, %xmm0, %xmm0
-; AVX512-NEXT: vmovd %xmm0, %eax
-; AVX512-NEXT: retq
+; AVX-NEXT: ret{{[l|q]}}
%1 = call i32 @llvm.vector.reduce.smin.v2i32(<2 x i32> %a0)
ret i32 %1
}
-define i32 @test_v4i32(<4 x i32> %a0) {
+define i32 @test_v4i32(<4 x i32> %a0) nounwind {
; SSE2-LABEL: test_v4i32:
; SSE2: # %bb.0:
; SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
@@ -770,7 +1523,7 @@ define i32 @test_v4i32(<4 x i32> %a0) {
; SSE2-NEXT: movd %xmm0, %eax
; SSE2-NEXT: cmpl %eax, %ecx
; SSE2-NEXT: cmovll %ecx, %eax
-; SSE2-NEXT: retq
+; SSE2-NEXT: ret{{[l|q]}}
;
; SSE4-LABEL: test_v4i32:
; SSE4: # %bb.0:
@@ -779,7 +1532,7 @@ define i32 @test_v4i32(<4 x i32> %a0) {
; SSE4-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
; SSE4-NEXT: pminsd %xmm1, %xmm0
; SSE4-NEXT: movd %xmm0, %eax
-; SSE4-NEXT: retq
+; SSE4-NEXT: ret{{[l|q]}}
;
; AVX-LABEL: test_v4i32:
; AVX: # %bb.0:
@@ -788,21 +1541,12 @@ define i32 @test_v4i32(<4 x i32> %a0) {
; AVX-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
; AVX-NEXT: vpminsd %xmm1, %xmm0, %xmm0
; AVX-NEXT: vmovd %xmm0, %eax
-; AVX-NEXT: retq
-;
-; AVX512-LABEL: test_v4i32:
-; AVX512: # %bb.0:
-; AVX512-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
-; AVX512-NEXT: vpminsd %xmm1, %xmm0, %xmm0
-; AVX512-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
-; AVX512-NEXT: vpminsd %xmm1, %xmm0, %xmm0
-; AVX512-NEXT: vmovd %xmm0, %eax
-; AVX512-NEXT: retq
+; AVX-NEXT: ret{{[l|q]}}
%1 = call i32 @llvm.vector.reduce.smin.v4i32(<4 x i32> %a0)
ret i32 %1
}
-define i32 @test_v8i32(<8 x i32> %a0) {
+define i32 @test_v8i32(<8 x i32> %a0) nounwind {
; SSE2-LABEL: test_v8i32:
; SSE2: # %bb.0:
; SSE2-NEXT: movdqa %xmm1, %xmm2
@@ -821,7 +1565,7 @@ define i32 @test_v8i32(<8 x i32> %a0) {
; SSE2-NEXT: movd %xmm0, %eax
; SSE2-NEXT: cmpl %eax, %ecx
; SSE2-NEXT: cmovll %ecx, %eax
-; SSE2-NEXT: retq
+; SSE2-NEXT: ret{{[l|q]}}
;
; SSE4-LABEL: test_v8i32:
; SSE4: # %bb.0:
@@ -831,7 +1575,7 @@ define i32 @test_v8i32(<8 x i32> %a0) {
; SSE4-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
; SSE4-NEXT: pminsd %xmm1, %xmm0
; SSE4-NEXT: movd %xmm0, %eax
-; SSE4-NEXT: retq
+; SSE4-NEXT: ret{{[l|q]}}
;
; AVX1-LABEL: test_v8i32:
; AVX1: # %bb.0:
@@ -843,7 +1587,7 @@ define i32 @test_v8i32(<8 x i32> %a0) {
; AVX1-NEXT: vpminsd %xmm1, %xmm0, %xmm0
; AVX1-NEXT: vmovd %xmm0, %eax
; AVX1-NEXT: vzeroupper
-; AVX1-NEXT: retq
+; AVX1-NEXT: ret{{[l|q]}}
;
; AVX2-LABEL: test_v8i32:
; AVX2: # %bb.0:
@@ -855,7 +1599,7 @@ define i32 @test_v8i32(<8 x i32> %a0) {
; AVX2-NEXT: vpminsd %xmm1, %xmm0, %xmm0
; AVX2-NEXT: vmovd %xmm0, %eax
; AVX2-NEXT: vzeroupper
-; AVX2-NEXT: retq
+; AVX2-NEXT: ret{{[l|q]}}
;
; AVX512-LABEL: test_v8i32:
; AVX512: # %bb.0:
@@ -872,48 +1616,103 @@ define i32 @test_v8i32(<8 x i32> %a0) {
ret i32 %1
}
-define i32 @test_v16i32(<16 x i32> %a0) {
-; SSE2-LABEL: test_v16i32:
-; SSE2: # %bb.0:
-; SSE2-NEXT: movdqa %xmm2, %xmm4
-; SSE2-NEXT: pcmpgtd %xmm0, %xmm4
-; SSE2-NEXT: pand %xmm4, %xmm0
-; SSE2-NEXT: pandn %xmm2, %xmm4
-; SSE2-NEXT: por %xmm0, %xmm4
-; SSE2-NEXT: movdqa %xmm3, %xmm0
-; SSE2-NEXT: pcmpgtd %xmm1, %xmm0
-; SSE2-NEXT: pand %xmm0, %xmm1
-; SSE2-NEXT: pandn %xmm3, %xmm0
-; SSE2-NEXT: por %xmm1, %xmm0
-; SSE2-NEXT: movdqa %xmm0, %xmm1
-; SSE2-NEXT: pcmpgtd %xmm4, %xmm1
-; SSE2-NEXT: pand %xmm1, %xmm4
-; SSE2-NEXT: pandn %xmm0, %xmm1
-; SSE2-NEXT: por %xmm4, %xmm1
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
-; SSE2-NEXT: movdqa %xmm0, %xmm2
-; SSE2-NEXT: pcmpgtd %xmm1, %xmm2
-; SSE2-NEXT: pand %xmm2, %xmm1
-; SSE2-NEXT: pandn %xmm0, %xmm2
-; SSE2-NEXT: por %xmm1, %xmm2
-; SSE2-NEXT: movd %xmm2, %ecx
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,1,1]
-; SSE2-NEXT: movd %xmm0, %eax
-; SSE2-NEXT: cmpl %eax, %ecx
-; SSE2-NEXT: cmovll %ecx, %eax
-; SSE2-NEXT: retq
-;
-; SSE4-LABEL: test_v16i32:
-; SSE4: # %bb.0:
-; SSE4-NEXT: pminsd %xmm3, %xmm1
-; SSE4-NEXT: pminsd %xmm2, %xmm0
-; SSE4-NEXT: pminsd %xmm1, %xmm0
-; SSE4-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
-; SSE4-NEXT: pminsd %xmm0, %xmm1
-; SSE4-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
-; SSE4-NEXT: pminsd %xmm1, %xmm0
-; SSE4-NEXT: movd %xmm0, %eax
-; SSE4-NEXT: retq
+define i32 @test_v16i32(<16 x i32> %a0) nounwind {
+; X86-SSE2-LABEL: test_v16i32:
+; X86-SSE2: # %bb.0:
+; X86-SSE2-NEXT: pushl %ebp
+; X86-SSE2-NEXT: movl %esp, %ebp
+; X86-SSE2-NEXT: andl $-16, %esp
+; X86-SSE2-NEXT: subl $16, %esp
+; X86-SSE2-NEXT: movdqa 8(%ebp), %xmm4
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm3
+; X86-SSE2-NEXT: pcmpgtd %xmm0, %xmm3
+; X86-SSE2-NEXT: pand %xmm3, %xmm0
+; X86-SSE2-NEXT: pandn %xmm2, %xmm3
+; X86-SSE2-NEXT: por %xmm0, %xmm3
+; X86-SSE2-NEXT: movdqa %xmm4, %xmm0
+; X86-SSE2-NEXT: pcmpgtd %xmm1, %xmm0
+; X86-SSE2-NEXT: pand %xmm0, %xmm1
+; X86-SSE2-NEXT: pandn %xmm4, %xmm0
+; X86-SSE2-NEXT: por %xmm1, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X86-SSE2-NEXT: pcmpgtd %xmm3, %xmm1
+; X86-SSE2-NEXT: pand %xmm1, %xmm3
+; X86-SSE2-NEXT: pandn %xmm0, %xmm1
+; X86-SSE2-NEXT: por %xmm3, %xmm1
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE2-NEXT: pcmpgtd %xmm1, %xmm2
+; X86-SSE2-NEXT: pand %xmm2, %xmm1
+; X86-SSE2-NEXT: pandn %xmm0, %xmm2
+; X86-SSE2-NEXT: por %xmm1, %xmm2
+; X86-SSE2-NEXT: movd %xmm2, %ecx
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,1,1]
+; X86-SSE2-NEXT: movd %xmm0, %eax
+; X86-SSE2-NEXT: cmpl %eax, %ecx
+; X86-SSE2-NEXT: cmovll %ecx, %eax
+; X86-SSE2-NEXT: movl %ebp, %esp
+; X86-SSE2-NEXT: popl %ebp
+; X86-SSE2-NEXT: retl
+;
+; X64-SSE2-LABEL: test_v16i32:
+; X64-SSE2: # %bb.0:
+; X64-SSE2-NEXT: movdqa %xmm2, %xmm4
+; X64-SSE2-NEXT: pcmpgtd %xmm0, %xmm4
+; X64-SSE2-NEXT: pand %xmm4, %xmm0
+; X64-SSE2-NEXT: pandn %xmm2, %xmm4
+; X64-SSE2-NEXT: por %xmm0, %xmm4
+; X64-SSE2-NEXT: movdqa %xmm3, %xmm0
+; X64-SSE2-NEXT: pcmpgtd %xmm1, %xmm0
+; X64-SSE2-NEXT: pand %xmm0, %xmm1
+; X64-SSE2-NEXT: pandn %xmm3, %xmm0
+; X64-SSE2-NEXT: por %xmm1, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X64-SSE2-NEXT: pcmpgtd %xmm4, %xmm1
+; X64-SSE2-NEXT: pand %xmm1, %xmm4
+; X64-SSE2-NEXT: pandn %xmm0, %xmm1
+; X64-SSE2-NEXT: por %xmm4, %xmm1
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X64-SSE2-NEXT: pcmpgtd %xmm1, %xmm2
+; X64-SSE2-NEXT: pand %xmm2, %xmm1
+; X64-SSE2-NEXT: pandn %xmm0, %xmm2
+; X64-SSE2-NEXT: por %xmm1, %xmm2
+; X64-SSE2-NEXT: movd %xmm2, %ecx
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,1,1]
+; X64-SSE2-NEXT: movd %xmm0, %eax
+; X64-SSE2-NEXT: cmpl %eax, %ecx
+; X64-SSE2-NEXT: cmovll %ecx, %eax
+; X64-SSE2-NEXT: retq
+;
+; X86-SSE4-LABEL: test_v16i32:
+; X86-SSE4: # %bb.0:
+; X86-SSE4-NEXT: pushl %ebp
+; X86-SSE4-NEXT: movl %esp, %ebp
+; X86-SSE4-NEXT: andl $-16, %esp
+; X86-SSE4-NEXT: subl $16, %esp
+; X86-SSE4-NEXT: pminsd %xmm2, %xmm0
+; X86-SSE4-NEXT: pminsd 8(%ebp), %xmm1
+; X86-SSE4-NEXT: pminsd %xmm0, %xmm1
+; X86-SSE4-NEXT: pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
+; X86-SSE4-NEXT: pminsd %xmm1, %xmm0
+; X86-SSE4-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; X86-SSE4-NEXT: pminsd %xmm0, %xmm1
+; X86-SSE4-NEXT: movd %xmm1, %eax
+; X86-SSE4-NEXT: movl %ebp, %esp
+; X86-SSE4-NEXT: popl %ebp
+; X86-SSE4-NEXT: retl
+;
+; X64-SSE4-LABEL: test_v16i32:
+; X64-SSE4: # %bb.0:
+; X64-SSE4-NEXT: pminsd %xmm3, %xmm1
+; X64-SSE4-NEXT: pminsd %xmm2, %xmm0
+; X64-SSE4-NEXT: pminsd %xmm1, %xmm0
+; X64-SSE4-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X64-SSE4-NEXT: pminsd %xmm0, %xmm1
+; X64-SSE4-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
+; X64-SSE4-NEXT: pminsd %xmm1, %xmm0
+; X64-SSE4-NEXT: movd %xmm0, %eax
+; X64-SSE4-NEXT: retq
;
; AVX1-LABEL: test_v16i32:
; AVX1: # %bb.0:
@@ -928,7 +1727,7 @@ define i32 @test_v16i32(<16 x i32> %a0) {
; AVX1-NEXT: vpminsd %xmm1, %xmm0, %xmm0
; AVX1-NEXT: vmovd %xmm0, %eax
; AVX1-NEXT: vzeroupper
-; AVX1-NEXT: retq
+; AVX1-NEXT: ret{{[l|q]}}
;
; AVX2-LABEL: test_v16i32:
; AVX2: # %bb.0:
@@ -941,7 +1740,7 @@ define i32 @test_v16i32(<16 x i32> %a0) {
; AVX2-NEXT: vpminsd %xmm1, %xmm0, %xmm0
; AVX2-NEXT: vmovd %xmm0, %eax
; AVX2-NEXT: vzeroupper
-; AVX2-NEXT: retq
+; AVX2-NEXT: ret{{[l|q]}}
;
; AVX512-LABEL: test_v16i32:
; AVX512: # %bb.0:
@@ -960,108 +1759,239 @@ define i32 @test_v16i32(<16 x i32> %a0) {
ret i32 %1
}
-define i32 @test_v32i32(<32 x i32> %a0) {
-; SSE2-LABEL: test_v32i32:
-; SSE2: # %bb.0:
-; SSE2-NEXT: movdqa %xmm4, %xmm8
-; SSE2-NEXT: pcmpgtd %xmm0, %xmm8
-; SSE2-NEXT: pand %xmm8, %xmm0
-; SSE2-NEXT: pandn %xmm4, %xmm8
-; SSE2-NEXT: por %xmm0, %xmm8
-; SSE2-NEXT: movdqa %xmm6, %xmm4
-; SSE2-NEXT: pcmpgtd %xmm2, %xmm4
-; SSE2-NEXT: pand %xmm4, %xmm2
-; SSE2-NEXT: pandn %xmm6, %xmm4
-; SSE2-NEXT: por %xmm2, %xmm4
-; SSE2-NEXT: movdqa %xmm4, %xmm0
-; SSE2-NEXT: pcmpgtd %xmm8, %xmm0
-; SSE2-NEXT: pand %xmm0, %xmm8
-; SSE2-NEXT: pandn %xmm4, %xmm0
-; SSE2-NEXT: por %xmm8, %xmm0
-; SSE2-NEXT: movdqa %xmm5, %xmm2
-; SSE2-NEXT: pcmpgtd %xmm1, %xmm2
-; SSE2-NEXT: pand %xmm2, %xmm1
-; SSE2-NEXT: pandn %xmm5, %xmm2
-; SSE2-NEXT: por %xmm1, %xmm2
-; SSE2-NEXT: movdqa %xmm7, %xmm1
-; SSE2-NEXT: pcmpgtd %xmm3, %xmm1
-; SSE2-NEXT: pand %xmm1, %xmm3
-; SSE2-NEXT: pandn %xmm7, %xmm1
-; SSE2-NEXT: por %xmm3, %xmm1
-; SSE2-NEXT: movdqa %xmm1, %xmm3
-; SSE2-NEXT: pcmpgtd %xmm2, %xmm3
-; SSE2-NEXT: pand %xmm3, %xmm2
-; SSE2-NEXT: pandn %xmm1, %xmm3
-; SSE2-NEXT: por %xmm2, %xmm3
-; SSE2-NEXT: movdqa %xmm3, %xmm1
-; SSE2-NEXT: pcmpgtd %xmm0, %xmm1
-; SSE2-NEXT: pand %xmm1, %xmm0
-; SSE2-NEXT: pandn %xmm3, %xmm1
-; SSE2-NEXT: por %xmm0, %xmm1
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
-; SSE2-NEXT: movdqa %xmm0, %xmm2
-; SSE2-NEXT: pcmpgtd %xmm1, %xmm2
-; SSE2-NEXT: pand %xmm2, %xmm1
-; SSE2-NEXT: pandn %xmm0, %xmm2
-; SSE2-NEXT: por %xmm1, %xmm2
-; SSE2-NEXT: movd %xmm2, %ecx
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,1,1]
-; SSE2-NEXT: movd %xmm0, %eax
-; SSE2-NEXT: cmpl %eax, %ecx
-; SSE2-NEXT: cmovll %ecx, %eax
-; SSE2-NEXT: retq
-;
-; SSE4-LABEL: test_v32i32:
-; SSE4: # %bb.0:
-; SSE4-NEXT: pminsd %xmm7, %xmm3
-; SSE4-NEXT: pminsd %xmm5, %xmm1
-; SSE4-NEXT: pminsd %xmm3, %xmm1
-; SSE4-NEXT: pminsd %xmm6, %xmm2
-; SSE4-NEXT: pminsd %xmm4, %xmm0
-; SSE4-NEXT: pminsd %xmm2, %xmm0
-; SSE4-NEXT: pminsd %xmm1, %xmm0
-; SSE4-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
-; SSE4-NEXT: pminsd %xmm0, %xmm1
-; SSE4-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
-; SSE4-NEXT: pminsd %xmm1, %xmm0
-; SSE4-NEXT: movd %xmm0, %eax
-; SSE4-NEXT: retq
-;
-; AVX1-LABEL: test_v32i32:
-; AVX1: # %bb.0:
-; AVX1-NEXT: vextractf128 $1, %ymm3, %xmm4
-; AVX1-NEXT: vextractf128 $1, %ymm1, %xmm5
-; AVX1-NEXT: vpminsd %xmm4, %xmm5, %xmm4
-; AVX1-NEXT: vextractf128 $1, %ymm2, %xmm5
-; AVX1-NEXT: vextractf128 $1, %ymm0, %xmm6
-; AVX1-NEXT: vpminsd %xmm5, %xmm6, %xmm5
-; AVX1-NEXT: vpminsd %xmm4, %xmm5, %xmm4
-; AVX1-NEXT: vpminsd %xmm3, %xmm1, %xmm1
-; AVX1-NEXT: vpminsd %xmm2, %xmm0, %xmm0
-; AVX1-NEXT: vpminsd %xmm1, %xmm0, %xmm0
-; AVX1-NEXT: vpminsd %xmm4, %xmm0, %xmm0
-; AVX1-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
-; AVX1-NEXT: vpminsd %xmm1, %xmm0, %xmm0
-; AVX1-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
-; AVX1-NEXT: vpminsd %xmm1, %xmm0, %xmm0
-; AVX1-NEXT: vmovd %xmm0, %eax
-; AVX1-NEXT: vzeroupper
-; AVX1-NEXT: retq
-;
-; AVX2-LABEL: test_v32i32:
-; AVX2: # %bb.0:
-; AVX2-NEXT: vpminsd %ymm3, %ymm1, %ymm1
-; AVX2-NEXT: vpminsd %ymm2, %ymm0, %ymm0
-; AVX2-NEXT: vpminsd %ymm1, %ymm0, %ymm0
-; AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
-; AVX2-NEXT: vpminsd %xmm1, %xmm0, %xmm0
-; AVX2-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
-; AVX2-NEXT: vpminsd %xmm1, %xmm0, %xmm0
-; AVX2-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
-; AVX2-NEXT: vpminsd %xmm1, %xmm0, %xmm0
-; AVX2-NEXT: vmovd %xmm0, %eax
-; AVX2-NEXT: vzeroupper
-; AVX2-NEXT: retq
+define i32 @test_v32i32(<32 x i32> %a0) nounwind {
+; X86-SSE2-LABEL: test_v32i32:
+; X86-SSE2: # %bb.0:
+; X86-SSE2-NEXT: pushl %ebp
+; X86-SSE2-NEXT: movl %esp, %ebp
+; X86-SSE2-NEXT: andl $-16, %esp
+; X86-SSE2-NEXT: subl $16, %esp
+; X86-SSE2-NEXT: movdqa 24(%ebp), %xmm3
+; X86-SSE2-NEXT: movdqa %xmm3, %xmm4
+; X86-SSE2-NEXT: pcmpgtd %xmm0, %xmm4
+; X86-SSE2-NEXT: pand %xmm4, %xmm0
+; X86-SSE2-NEXT: pandn %xmm3, %xmm4
+; X86-SSE2-NEXT: movdqa 56(%ebp), %xmm3
+; X86-SSE2-NEXT: por %xmm0, %xmm4
+; X86-SSE2-NEXT: movdqa %xmm3, %xmm5
+; X86-SSE2-NEXT: pcmpgtd %xmm2, %xmm5
+; X86-SSE2-NEXT: pand %xmm5, %xmm2
+; X86-SSE2-NEXT: pandn %xmm3, %xmm5
+; X86-SSE2-NEXT: movdqa 8(%ebp), %xmm3
+; X86-SSE2-NEXT: por %xmm2, %xmm5
+; X86-SSE2-NEXT: movdqa %xmm5, %xmm0
+; X86-SSE2-NEXT: pcmpgtd %xmm4, %xmm0
+; X86-SSE2-NEXT: pand %xmm0, %xmm4
+; X86-SSE2-NEXT: pandn %xmm5, %xmm0
+; X86-SSE2-NEXT: movdqa 40(%ebp), %xmm5
+; X86-SSE2-NEXT: por %xmm4, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm5, %xmm2
+; X86-SSE2-NEXT: pcmpgtd %xmm1, %xmm2
+; X86-SSE2-NEXT: pand %xmm2, %xmm1
+; X86-SSE2-NEXT: pandn %xmm5, %xmm2
+; X86-SSE2-NEXT: movdqa 72(%ebp), %xmm4
+; X86-SSE2-NEXT: por %xmm1, %xmm2
+; X86-SSE2-NEXT: movdqa %xmm4, %xmm1
+; X86-SSE2-NEXT: pcmpgtd %xmm3, %xmm1
+; X86-SSE2-NEXT: pand %xmm1, %xmm3
+; X86-SSE2-NEXT: pandn %xmm4, %xmm1
+; X86-SSE2-NEXT: por %xmm3, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm3
+; X86-SSE2-NEXT: pcmpgtd %xmm2, %xmm3
+; X86-SSE2-NEXT: pand %xmm3, %xmm2
+; X86-SSE2-NEXT: pandn %xmm1, %xmm3
+; X86-SSE2-NEXT: por %xmm2, %xmm3
+; X86-SSE2-NEXT: movdqa %xmm3, %xmm1
+; X86-SSE2-NEXT: pcmpgtd %xmm0, %xmm1
+; X86-SSE2-NEXT: pand %xmm1, %xmm0
+; X86-SSE2-NEXT: pandn %xmm3, %xmm1
+; X86-SSE2-NEXT: por %xmm0, %xmm1
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE2-NEXT: pcmpgtd %xmm1, %xmm2
+; X86-SSE2-NEXT: pand %xmm2, %xmm1
+; X86-SSE2-NEXT: pandn %xmm0, %xmm2
+; X86-SSE2-NEXT: por %xmm1, %xmm2
+; X86-SSE2-NEXT: movd %xmm2, %ecx
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,1,1]
+; X86-SSE2-NEXT: movd %xmm0, %eax
+; X86-SSE2-NEXT: cmpl %eax, %ecx
+; X86-SSE2-NEXT: cmovll %ecx, %eax
+; X86-SSE2-NEXT: movl %ebp, %esp
+; X86-SSE2-NEXT: popl %ebp
+; X86-SSE2-NEXT: retl
+;
+; X64-SSE2-LABEL: test_v32i32:
+; X64-SSE2: # %bb.0:
+; X64-SSE2-NEXT: movdqa %xmm4, %xmm8
+; X64-SSE2-NEXT: pcmpgtd %xmm0, %xmm8
+; X64-SSE2-NEXT: pand %xmm8, %xmm0
+; X64-SSE2-NEXT: pandn %xmm4, %xmm8
+; X64-SSE2-NEXT: por %xmm0, %xmm8
+; X64-SSE2-NEXT: movdqa %xmm6, %xmm4
+; X64-SSE2-NEXT: pcmpgtd %xmm2, %xmm4
+; X64-SSE2-NEXT: pand %xmm4, %xmm2
+; X64-SSE2-NEXT: pandn %xmm6, %xmm4
+; X64-SSE2-NEXT: por %xmm2, %xmm4
+; X64-SSE2-NEXT: movdqa %xmm4, %xmm0
+; X64-SSE2-NEXT: pcmpgtd %xmm8, %xmm0
+; X64-SSE2-NEXT: pand %xmm0, %xmm8
+; X64-SSE2-NEXT: pandn %xmm4, %xmm0
+; X64-SSE2-NEXT: por %xmm8, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm5, %xmm2
+; X64-SSE2-NEXT: pcmpgtd %xmm1, %xmm2
+; X64-SSE2-NEXT: pand %xmm2, %xmm1
+; X64-SSE2-NEXT: pandn %xmm5, %xmm2
+; X64-SSE2-NEXT: por %xmm1, %xmm2
+; X64-SSE2-NEXT: movdqa %xmm7, %xmm1
+; X64-SSE2-NEXT: pcmpgtd %xmm3, %xmm1
+; X64-SSE2-NEXT: pand %xmm1, %xmm3
+; X64-SSE2-NEXT: pandn %xmm7, %xmm1
+; X64-SSE2-NEXT: por %xmm3, %xmm1
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm3
+; X64-SSE2-NEXT: pcmpgtd %xmm2, %xmm3
+; X64-SSE2-NEXT: pand %xmm3, %xmm2
+; X64-SSE2-NEXT: pandn %xmm1, %xmm3
+; X64-SSE2-NEXT: por %xmm2, %xmm3
+; X64-SSE2-NEXT: movdqa %xmm3, %xmm1
+; X64-SSE2-NEXT: pcmpgtd %xmm0, %xmm1
+; X64-SSE2-NEXT: pand %xmm1, %xmm0
+; X64-SSE2-NEXT: pandn %xmm3, %xmm1
+; X64-SSE2-NEXT: por %xmm0, %xmm1
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X64-SSE2-NEXT: pcmpgtd %xmm1, %xmm2
+; X64-SSE2-NEXT: pand %xmm2, %xmm1
+; X64-SSE2-NEXT: pandn %xmm0, %xmm2
+; X64-SSE2-NEXT: por %xmm1, %xmm2
+; X64-SSE2-NEXT: movd %xmm2, %ecx
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,1,1]
+; X64-SSE2-NEXT: movd %xmm0, %eax
+; X64-SSE2-NEXT: cmpl %eax, %ecx
+; X64-SSE2-NEXT: cmovll %ecx, %eax
+; X64-SSE2-NEXT: retq
+;
+; X86-SSE4-LABEL: test_v32i32:
+; X86-SSE4: # %bb.0:
+; X86-SSE4-NEXT: pushl %ebp
+; X86-SSE4-NEXT: movl %esp, %ebp
+; X86-SSE4-NEXT: andl $-16, %esp
+; X86-SSE4-NEXT: subl $16, %esp
+; X86-SSE4-NEXT: movdqa 8(%ebp), %xmm3
+; X86-SSE4-NEXT: pminsd 72(%ebp), %xmm3
+; X86-SSE4-NEXT: pminsd 40(%ebp), %xmm1
+; X86-SSE4-NEXT: pminsd %xmm3, %xmm1
+; X86-SSE4-NEXT: pminsd 56(%ebp), %xmm2
+; X86-SSE4-NEXT: pminsd 24(%ebp), %xmm0
+; X86-SSE4-NEXT: pminsd %xmm2, %xmm0
+; X86-SSE4-NEXT: pminsd %xmm1, %xmm0
+; X86-SSE4-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-SSE4-NEXT: pminsd %xmm0, %xmm1
+; X86-SSE4-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
+; X86-SSE4-NEXT: pminsd %xmm1, %xmm0
+; X86-SSE4-NEXT: movd %xmm0, %eax
+; X86-SSE4-NEXT: movl %ebp, %esp
+; X86-SSE4-NEXT: popl %ebp
+; X86-SSE4-NEXT: retl
+;
+; X64-SSE4-LABEL: test_v32i32:
+; X64-SSE4: # %bb.0:
+; X64-SSE4-NEXT: pminsd %xmm7, %xmm3
+; X64-SSE4-NEXT: pminsd %xmm5, %xmm1
+; X64-SSE4-NEXT: pminsd %xmm3, %xmm1
+; X64-SSE4-NEXT: pminsd %xmm6, %xmm2
+; X64-SSE4-NEXT: pminsd %xmm4, %xmm0
+; X64-SSE4-NEXT: pminsd %xmm2, %xmm0
+; X64-SSE4-NEXT: pminsd %xmm1, %xmm0
+; X64-SSE4-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X64-SSE4-NEXT: pminsd %xmm0, %xmm1
+; X64-SSE4-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
+; X64-SSE4-NEXT: pminsd %xmm1, %xmm0
+; X64-SSE4-NEXT: movd %xmm0, %eax
+; X64-SSE4-NEXT: retq
+;
+; X86-AVX1-LABEL: test_v32i32:
+; X86-AVX1: # %bb.0:
+; X86-AVX1-NEXT: pushl %ebp
+; X86-AVX1-NEXT: movl %esp, %ebp
+; X86-AVX1-NEXT: andl $-32, %esp
+; X86-AVX1-NEXT: subl $32, %esp
+; X86-AVX1-NEXT: vextractf128 $1, %ymm2, %xmm3
+; X86-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm4
+; X86-AVX1-NEXT: vpminsd %xmm3, %xmm4, %xmm3
+; X86-AVX1-NEXT: vextractf128 $1, %ymm1, %xmm4
+; X86-AVX1-NEXT: vpminsd 24(%ebp), %xmm4, %xmm4
+; X86-AVX1-NEXT: vpminsd %xmm4, %xmm3, %xmm3
+; X86-AVX1-NEXT: vpminsd %xmm2, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpminsd 8(%ebp), %xmm1, %xmm1
+; X86-AVX1-NEXT: vpminsd %xmm1, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpminsd %xmm3, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-AVX1-NEXT: vpminsd %xmm1, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; X86-AVX1-NEXT: vpminsd %xmm1, %xmm0, %xmm0
+; X86-AVX1-NEXT: vmovd %xmm0, %eax
+; X86-AVX1-NEXT: movl %ebp, %esp
+; X86-AVX1-NEXT: popl %ebp
+; X86-AVX1-NEXT: vzeroupper
+; X86-AVX1-NEXT: retl
+;
+; X64-AVX1-LABEL: test_v32i32:
+; X64-AVX1: # %bb.0:
+; X64-AVX1-NEXT: vextractf128 $1, %ymm3, %xmm4
+; X64-AVX1-NEXT: vextractf128 $1, %ymm1, %xmm5
+; X64-AVX1-NEXT: vpminsd %xmm4, %xmm5, %xmm4
+; X64-AVX1-NEXT: vextractf128 $1, %ymm2, %xmm5
+; X64-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm6
+; X64-AVX1-NEXT: vpminsd %xmm5, %xmm6, %xmm5
+; X64-AVX1-NEXT: vpminsd %xmm4, %xmm5, %xmm4
+; X64-AVX1-NEXT: vpminsd %xmm3, %xmm1, %xmm1
+; X64-AVX1-NEXT: vpminsd %xmm2, %xmm0, %xmm0
+; X64-AVX1-NEXT: vpminsd %xmm1, %xmm0, %xmm0
+; X64-AVX1-NEXT: vpminsd %xmm4, %xmm0, %xmm0
+; X64-AVX1-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X64-AVX1-NEXT: vpminsd %xmm1, %xmm0, %xmm0
+; X64-AVX1-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; X64-AVX1-NEXT: vpminsd %xmm1, %xmm0, %xmm0
+; X64-AVX1-NEXT: vmovd %xmm0, %eax
+; X64-AVX1-NEXT: vzeroupper
+; X64-AVX1-NEXT: retq
+;
+; X86-AVX2-LABEL: test_v32i32:
+; X86-AVX2: # %bb.0:
+; X86-AVX2-NEXT: pushl %ebp
+; X86-AVX2-NEXT: movl %esp, %ebp
+; X86-AVX2-NEXT: andl $-32, %esp
+; X86-AVX2-NEXT: subl $32, %esp
+; X86-AVX2-NEXT: vpminsd %ymm2, %ymm0, %ymm0
+; X86-AVX2-NEXT: vpminsd 8(%ebp), %ymm1, %ymm1
+; X86-AVX2-NEXT: vpminsd %ymm1, %ymm0, %ymm0
+; X86-AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
+; X86-AVX2-NEXT: vpminsd %xmm1, %xmm0, %xmm0
+; X86-AVX2-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-AVX2-NEXT: vpminsd %xmm1, %xmm0, %xmm0
+; X86-AVX2-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; X86-AVX2-NEXT: vpminsd %xmm1, %xmm0, %xmm0
+; X86-AVX2-NEXT: vmovd %xmm0, %eax
+; X86-AVX2-NEXT: movl %ebp, %esp
+; X86-AVX2-NEXT: popl %ebp
+; X86-AVX2-NEXT: vzeroupper
+; X86-AVX2-NEXT: retl
+;
+; X64-AVX2-LABEL: test_v32i32:
+; X64-AVX2: # %bb.0:
+; X64-AVX2-NEXT: vpminsd %ymm3, %ymm1, %ymm1
+; X64-AVX2-NEXT: vpminsd %ymm2, %ymm0, %ymm0
+; X64-AVX2-NEXT: vpminsd %ymm1, %ymm0, %ymm0
+; X64-AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
+; X64-AVX2-NEXT: vpminsd %xmm1, %xmm0, %xmm0
+; X64-AVX2-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X64-AVX2-NEXT: vpminsd %xmm1, %xmm0, %xmm0
+; X64-AVX2-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; X64-AVX2-NEXT: vpminsd %xmm1, %xmm0, %xmm0
+; X64-AVX2-NEXT: vmovd %xmm0, %eax
+; X64-AVX2-NEXT: vzeroupper
+; X64-AVX2-NEXT: retq
;
; AVX512-LABEL: test_v32i32:
; AVX512: # %bb.0:
@@ -1085,7 +2015,7 @@ define i32 @test_v32i32(<32 x i32> %a0) {
; vXi16
;
-define i16 @test_v2i16(<2 x i16> %a0) {
+define i16 @test_v2i16(<2 x i16> %a0) nounwind {
; SSE-LABEL: test_v2i16:
; SSE: # %bb.0:
; SSE-NEXT: movdqa %xmm0, %xmm1
@@ -1093,7 +2023,7 @@ define i16 @test_v2i16(<2 x i16> %a0) {
; SSE-NEXT: pminsw %xmm0, %xmm1
; SSE-NEXT: movd %xmm1, %eax
; SSE-NEXT: # kill: def $ax killed $ax killed $eax
-; SSE-NEXT: retq
+; SSE-NEXT: ret{{[l|q]}}
;
; AVX-LABEL: test_v2i16:
; AVX: # %bb.0:
@@ -1101,20 +2031,12 @@ define i16 @test_v2i16(<2 x i16> %a0) {
; AVX-NEXT: vpminsw %xmm1, %xmm0, %xmm0
; AVX-NEXT: vmovd %xmm0, %eax
; AVX-NEXT: # kill: def $ax killed $ax killed $eax
-; AVX-NEXT: retq
-;
-; AVX512-LABEL: test_v2i16:
-; AVX512: # %bb.0:
-; AVX512-NEXT: vpsrld $16, %xmm0, %xmm1
-; AVX512-NEXT: vpminsw %xmm1, %xmm0, %xmm0
-; AVX512-NEXT: vmovd %xmm0, %eax
-; AVX512-NEXT: # kill: def $ax killed $ax killed $eax
-; AVX512-NEXT: retq
+; AVX-NEXT: ret{{[l|q]}}
%1 = call i16 @llvm.vector.reduce.smin.v2i16(<2 x i16> %a0)
ret i16 %1
}
-define i16 @test_v4i16(<4 x i16> %a0) {
+define i16 @test_v4i16(<4 x i16> %a0) nounwind {
; SSE-LABEL: test_v4i16:
; SSE: # %bb.0:
; SSE-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
@@ -1124,7 +2046,7 @@ define i16 @test_v4i16(<4 x i16> %a0) {
; SSE-NEXT: pminsw %xmm1, %xmm0
; SSE-NEXT: movd %xmm0, %eax
; SSE-NEXT: # kill: def $ax killed $ax killed $eax
-; SSE-NEXT: retq
+; SSE-NEXT: ret{{[l|q]}}
;
; AVX-LABEL: test_v4i16:
; AVX: # %bb.0:
@@ -1134,22 +2056,12 @@ define i16 @test_v4i16(<4 x i16> %a0) {
; AVX-NEXT: vpminsw %xmm1, %xmm0, %xmm0
; AVX-NEXT: vmovd %xmm0, %eax
; AVX-NEXT: # kill: def $ax killed $ax killed $eax
-; AVX-NEXT: retq
-;
-; AVX512-LABEL: test_v4i16:
-; AVX512: # %bb.0:
-; AVX512-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
-; AVX512-NEXT: vpminsw %xmm1, %xmm0, %xmm0
-; AVX512-NEXT: vpsrld $16, %xmm0, %xmm1
-; AVX512-NEXT: vpminsw %xmm1, %xmm0, %xmm0
-; AVX512-NEXT: vmovd %xmm0, %eax
-; AVX512-NEXT: # kill: def $ax killed $ax killed $eax
-; AVX512-NEXT: retq
+; AVX-NEXT: ret{{[l|q]}}
%1 = call i16 @llvm.vector.reduce.smin.v4i16(<4 x i16> %a0)
ret i16 %1
}
-define i16 @test_v8i16(<8 x i16> %a0) {
+define i16 @test_v8i16(<8 x i16> %a0) nounwind {
; SSE2-LABEL: test_v8i16:
; SSE2: # %bb.0:
; SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
@@ -1161,25 +2073,43 @@ define i16 @test_v8i16(<8 x i16> %a0) {
; SSE2-NEXT: pminsw %xmm0, %xmm1
; SSE2-NEXT: movd %xmm1, %eax
; SSE2-NEXT: # kill: def $ax killed $ax killed $eax
-; SSE2-NEXT: retq
-;
-; SSE4-LABEL: test_v8i16:
-; SSE4: # %bb.0:
-; SSE4-NEXT: pxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0
-; SSE4-NEXT: phminposuw %xmm0, %xmm0
-; SSE4-NEXT: movd %xmm0, %eax
-; SSE4-NEXT: xorl $32768, %eax # imm = 0x8000
-; SSE4-NEXT: # kill: def $ax killed $ax killed $eax
-; SSE4-NEXT: retq
-;
-; AVX-LABEL: test_v8i16:
-; AVX: # %bb.0:
-; AVX-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
-; AVX-NEXT: vphminposuw %xmm0, %xmm0
-; AVX-NEXT: vmovd %xmm0, %eax
-; AVX-NEXT: xorl $32768, %eax # imm = 0x8000
-; AVX-NEXT: # kill: def $ax killed $ax killed $eax
-; AVX-NEXT: retq
+; SSE2-NEXT: ret{{[l|q]}}
+;
+; X86-SSE4-LABEL: test_v8i16:
+; X86-SSE4: # %bb.0:
+; X86-SSE4-NEXT: pxor {{\.?LCPI[0-9]+_[0-9]+}}, %xmm0
+; X86-SSE4-NEXT: phminposuw %xmm0, %xmm0
+; X86-SSE4-NEXT: movd %xmm0, %eax
+; X86-SSE4-NEXT: xorl $32768, %eax # imm = 0x8000
+; X86-SSE4-NEXT: # kill: def $ax killed $ax killed $eax
+; X86-SSE4-NEXT: retl
+;
+; X64-SSE4-LABEL: test_v8i16:
+; X64-SSE4: # %bb.0:
+; X64-SSE4-NEXT: pxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0
+; X64-SSE4-NEXT: phminposuw %xmm0, %xmm0
+; X64-SSE4-NEXT: movd %xmm0, %eax
+; X64-SSE4-NEXT: xorl $32768, %eax # imm = 0x8000
+; X64-SSE4-NEXT: # kill: def $ax killed $ax killed $eax
+; X64-SSE4-NEXT: retq
+;
+; X86-AVX-LABEL: test_v8i16:
+; X86-AVX: # %bb.0:
+; X86-AVX-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}, %xmm0, %xmm0
+; X86-AVX-NEXT: vphminposuw %xmm0, %xmm0
+; X86-AVX-NEXT: vmovd %xmm0, %eax
+; X86-AVX-NEXT: xorl $32768, %eax # imm = 0x8000
+; X86-AVX-NEXT: # kill: def $ax killed $ax killed $eax
+; X86-AVX-NEXT: retl
+;
+; X64-AVX-LABEL: test_v8i16:
+; X64-AVX: # %bb.0:
+; X64-AVX-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
+; X64-AVX-NEXT: vphminposuw %xmm0, %xmm0
+; X64-AVX-NEXT: vmovd %xmm0, %eax
+; X64-AVX-NEXT: xorl $32768, %eax # imm = 0x8000
+; X64-AVX-NEXT: # kill: def $ax killed $ax killed $eax
+; X64-AVX-NEXT: retq
;
; AVX512BW-LABEL: test_v8i16:
; AVX512BW: # %bb.0:
@@ -1202,7 +2132,7 @@ define i16 @test_v8i16(<8 x i16> %a0) {
ret i16 %1
}
-define i16 @test_v16i16(<16 x i16> %a0) {
+define i16 @test_v16i16(<16 x i16> %a0) nounwind {
; SSE2-LABEL: test_v16i16:
; SSE2: # %bb.0:
; SSE2-NEXT: pminsw %xmm1, %xmm0
@@ -1215,41 +2145,75 @@ define i16 @test_v16i16(<16 x i16> %a0) {
; SSE2-NEXT: pminsw %xmm0, %xmm1
; SSE2-NEXT: movd %xmm1, %eax
; SSE2-NEXT: # kill: def $ax killed $ax killed $eax
-; SSE2-NEXT: retq
-;
-; SSE4-LABEL: test_v16i16:
-; SSE4: # %bb.0:
-; SSE4-NEXT: pminsw %xmm1, %xmm0
-; SSE4-NEXT: pxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0
-; SSE4-NEXT: phminposuw %xmm0, %xmm0
-; SSE4-NEXT: movd %xmm0, %eax
-; SSE4-NEXT: xorl $32768, %eax # imm = 0x8000
-; SSE4-NEXT: # kill: def $ax killed $ax killed $eax
-; SSE4-NEXT: retq
-;
-; AVX1-LABEL: test_v16i16:
-; AVX1: # %bb.0:
-; AVX1-NEXT: vextractf128 $1, %ymm0, %xmm1
-; AVX1-NEXT: vpminsw %xmm1, %xmm0, %xmm0
-; AVX1-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
-; AVX1-NEXT: vphminposuw %xmm0, %xmm0
-; AVX1-NEXT: vmovd %xmm0, %eax
-; AVX1-NEXT: xorl $32768, %eax # imm = 0x8000
-; AVX1-NEXT: # kill: def $ax killed $ax killed $eax
-; AVX1-NEXT: vzeroupper
-; AVX1-NEXT: retq
-;
-; AVX2-LABEL: test_v16i16:
-; AVX2: # %bb.0:
-; AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
-; AVX2-NEXT: vpminsw %xmm1, %xmm0, %xmm0
-; AVX2-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
-; AVX2-NEXT: vphminposuw %xmm0, %xmm0
-; AVX2-NEXT: vmovd %xmm0, %eax
-; AVX2-NEXT: xorl $32768, %eax # imm = 0x8000
-; AVX2-NEXT: # kill: def $ax killed $ax killed $eax
-; AVX2-NEXT: vzeroupper
-; AVX2-NEXT: retq
+; SSE2-NEXT: ret{{[l|q]}}
+;
+; X86-SSE4-LABEL: test_v16i16:
+; X86-SSE4: # %bb.0:
+; X86-SSE4-NEXT: pminsw %xmm1, %xmm0
+; X86-SSE4-NEXT: pxor {{\.?LCPI[0-9]+_[0-9]+}}, %xmm0
+; X86-SSE4-NEXT: phminposuw %xmm0, %xmm0
+; X86-SSE4-NEXT: movd %xmm0, %eax
+; X86-SSE4-NEXT: xorl $32768, %eax # imm = 0x8000
+; X86-SSE4-NEXT: # kill: def $ax killed $ax killed $eax
+; X86-SSE4-NEXT: retl
+;
+; X64-SSE4-LABEL: test_v16i16:
+; X64-SSE4: # %bb.0:
+; X64-SSE4-NEXT: pminsw %xmm1, %xmm0
+; X64-SSE4-NEXT: pxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0
+; X64-SSE4-NEXT: phminposuw %xmm0, %xmm0
+; X64-SSE4-NEXT: movd %xmm0, %eax
+; X64-SSE4-NEXT: xorl $32768, %eax # imm = 0x8000
+; X64-SSE4-NEXT: # kill: def $ax killed $ax killed $eax
+; X64-SSE4-NEXT: retq
+;
+; X86-AVX1-LABEL: test_v16i16:
+; X86-AVX1: # %bb.0:
+; X86-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm1
+; X86-AVX1-NEXT: vpminsw %xmm1, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}, %xmm0, %xmm0
+; X86-AVX1-NEXT: vphminposuw %xmm0, %xmm0
+; X86-AVX1-NEXT: vmovd %xmm0, %eax
+; X86-AVX1-NEXT: xorl $32768, %eax # imm = 0x8000
+; X86-AVX1-NEXT: # kill: def $ax killed $ax killed $eax
+; X86-AVX1-NEXT: vzeroupper
+; X86-AVX1-NEXT: retl
+;
+; X64-AVX1-LABEL: test_v16i16:
+; X64-AVX1: # %bb.0:
+; X64-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm1
+; X64-AVX1-NEXT: vpminsw %xmm1, %xmm0, %xmm0
+; X64-AVX1-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
+; X64-AVX1-NEXT: vphminposuw %xmm0, %xmm0
+; X64-AVX1-NEXT: vmovd %xmm0, %eax
+; X64-AVX1-NEXT: xorl $32768, %eax # imm = 0x8000
+; X64-AVX1-NEXT: # kill: def $ax killed $ax killed $eax
+; X64-AVX1-NEXT: vzeroupper
+; X64-AVX1-NEXT: retq
+;
+; X86-AVX2-LABEL: test_v16i16:
+; X86-AVX2: # %bb.0:
+; X86-AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
+; X86-AVX2-NEXT: vpminsw %xmm1, %xmm0, %xmm0
+; X86-AVX2-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}, %xmm0, %xmm0
+; X86-AVX2-NEXT: vphminposuw %xmm0, %xmm0
+; X86-AVX2-NEXT: vmovd %xmm0, %eax
+; X86-AVX2-NEXT: xorl $32768, %eax # imm = 0x8000
+; X86-AVX2-NEXT: # kill: def $ax killed $ax killed $eax
+; X86-AVX2-NEXT: vzeroupper
+; X86-AVX2-NEXT: retl
+;
+; X64-AVX2-LABEL: test_v16i16:
+; X64-AVX2: # %bb.0:
+; X64-AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
+; X64-AVX2-NEXT: vpminsw %xmm1, %xmm0, %xmm0
+; X64-AVX2-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
+; X64-AVX2-NEXT: vphminposuw %xmm0, %xmm0
+; X64-AVX2-NEXT: vmovd %xmm0, %eax
+; X64-AVX2-NEXT: xorl $32768, %eax # imm = 0x8000
+; X64-AVX2-NEXT: # kill: def $ax killed $ax killed $eax
+; X64-AVX2-NEXT: vzeroupper
+; X64-AVX2-NEXT: retq
;
; AVX512BW-LABEL: test_v16i16:
; AVX512BW: # %bb.0:
@@ -1278,62 +2242,130 @@ define i16 @test_v16i16(<16 x i16> %a0) {
ret i16 %1
}
-define i16 @test_v32i16(<32 x i16> %a0) {
-; SSE2-LABEL: test_v32i16:
-; SSE2: # %bb.0:
-; SSE2-NEXT: pminsw %xmm3, %xmm1
-; SSE2-NEXT: pminsw %xmm2, %xmm0
-; SSE2-NEXT: pminsw %xmm1, %xmm0
-; SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
-; SSE2-NEXT: pminsw %xmm0, %xmm1
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
-; SSE2-NEXT: pminsw %xmm1, %xmm0
-; SSE2-NEXT: movdqa %xmm0, %xmm1
-; SSE2-NEXT: psrld $16, %xmm1
-; SSE2-NEXT: pminsw %xmm0, %xmm1
-; SSE2-NEXT: movd %xmm1, %eax
-; SSE2-NEXT: # kill: def $ax killed $ax killed $eax
-; SSE2-NEXT: retq
-;
-; SSE4-LABEL: test_v32i16:
-; SSE4: # %bb.0:
-; SSE4-NEXT: pminsw %xmm3, %xmm1
-; SSE4-NEXT: pminsw %xmm2, %xmm0
-; SSE4-NEXT: pminsw %xmm1, %xmm0
-; SSE4-NEXT: pxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0
-; SSE4-NEXT: phminposuw %xmm0, %xmm0
-; SSE4-NEXT: movd %xmm0, %eax
-; SSE4-NEXT: xorl $32768, %eax # imm = 0x8000
-; SSE4-NEXT: # kill: def $ax killed $ax killed $eax
-; SSE4-NEXT: retq
-;
-; AVX1-LABEL: test_v32i16:
-; AVX1: # %bb.0:
-; AVX1-NEXT: vextractf128 $1, %ymm1, %xmm2
-; AVX1-NEXT: vextractf128 $1, %ymm0, %xmm3
-; AVX1-NEXT: vpminsw %xmm2, %xmm3, %xmm2
-; AVX1-NEXT: vpminsw %xmm1, %xmm0, %xmm0
-; AVX1-NEXT: vpminsw %xmm2, %xmm0, %xmm0
-; AVX1-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
-; AVX1-NEXT: vphminposuw %xmm0, %xmm0
-; AVX1-NEXT: vmovd %xmm0, %eax
-; AVX1-NEXT: xorl $32768, %eax # imm = 0x8000
-; AVX1-NEXT: # kill: def $ax killed $ax killed $eax
-; AVX1-NEXT: vzeroupper
-; AVX1-NEXT: retq
-;
-; AVX2-LABEL: test_v32i16:
-; AVX2: # %bb.0:
-; AVX2-NEXT: vpminsw %ymm1, %ymm0, %ymm0
-; AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
-; AVX2-NEXT: vpminsw %xmm1, %xmm0, %xmm0
-; AVX2-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
-; AVX2-NEXT: vphminposuw %xmm0, %xmm0
-; AVX2-NEXT: vmovd %xmm0, %eax
-; AVX2-NEXT: xorl $32768, %eax # imm = 0x8000
-; AVX2-NEXT: # kill: def $ax killed $ax killed $eax
-; AVX2-NEXT: vzeroupper
-; AVX2-NEXT: retq
+define i16 @test_v32i16(<32 x i16> %a0) nounwind {
+; X86-SSE2-LABEL: test_v32i16:
+; X86-SSE2: # %bb.0:
+; X86-SSE2-NEXT: pushl %ebp
+; X86-SSE2-NEXT: movl %esp, %ebp
+; X86-SSE2-NEXT: andl $-16, %esp
+; X86-SSE2-NEXT: subl $16, %esp
+; X86-SSE2-NEXT: pminsw %xmm2, %xmm0
+; X86-SSE2-NEXT: pminsw 8(%ebp), %xmm1
+; X86-SSE2-NEXT: pminsw %xmm0, %xmm1
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
+; X86-SSE2-NEXT: pminsw %xmm1, %xmm0
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; X86-SSE2-NEXT: pminsw %xmm0, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE2-NEXT: psrld $16, %xmm0
+; X86-SSE2-NEXT: pminsw %xmm1, %xmm0
+; X86-SSE2-NEXT: movd %xmm0, %eax
+; X86-SSE2-NEXT: # kill: def $ax killed $ax killed $eax
+; X86-SSE2-NEXT: movl %ebp, %esp
+; X86-SSE2-NEXT: popl %ebp
+; X86-SSE2-NEXT: retl
+;
+; X64-SSE2-LABEL: test_v32i16:
+; X64-SSE2: # %bb.0:
+; X64-SSE2-NEXT: pminsw %xmm3, %xmm1
+; X64-SSE2-NEXT: pminsw %xmm2, %xmm0
+; X64-SSE2-NEXT: pminsw %xmm1, %xmm0
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X64-SSE2-NEXT: pminsw %xmm0, %xmm1
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
+; X64-SSE2-NEXT: pminsw %xmm1, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X64-SSE2-NEXT: psrld $16, %xmm1
+; X64-SSE2-NEXT: pminsw %xmm0, %xmm1
+; X64-SSE2-NEXT: movd %xmm1, %eax
+; X64-SSE2-NEXT: # kill: def $ax killed $ax killed $eax
+; X64-SSE2-NEXT: retq
+;
+; X86-SSE4-LABEL: test_v32i16:
+; X86-SSE4: # %bb.0:
+; X86-SSE4-NEXT: pushl %ebp
+; X86-SSE4-NEXT: movl %esp, %ebp
+; X86-SSE4-NEXT: andl $-16, %esp
+; X86-SSE4-NEXT: subl $16, %esp
+; X86-SSE4-NEXT: pminsw %xmm2, %xmm0
+; X86-SSE4-NEXT: pminsw 8(%ebp), %xmm1
+; X86-SSE4-NEXT: pminsw %xmm0, %xmm1
+; X86-SSE4-NEXT: pxor {{\.?LCPI[0-9]+_[0-9]+}}, %xmm1
+; X86-SSE4-NEXT: phminposuw %xmm1, %xmm0
+; X86-SSE4-NEXT: movd %xmm0, %eax
+; X86-SSE4-NEXT: xorl $32768, %eax # imm = 0x8000
+; X86-SSE4-NEXT: # kill: def $ax killed $ax killed $eax
+; X86-SSE4-NEXT: movl %ebp, %esp
+; X86-SSE4-NEXT: popl %ebp
+; X86-SSE4-NEXT: retl
+;
+; X64-SSE4-LABEL: test_v32i16:
+; X64-SSE4: # %bb.0:
+; X64-SSE4-NEXT: pminsw %xmm3, %xmm1
+; X64-SSE4-NEXT: pminsw %xmm2, %xmm0
+; X64-SSE4-NEXT: pminsw %xmm1, %xmm0
+; X64-SSE4-NEXT: pxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0
+; X64-SSE4-NEXT: phminposuw %xmm0, %xmm0
+; X64-SSE4-NEXT: movd %xmm0, %eax
+; X64-SSE4-NEXT: xorl $32768, %eax # imm = 0x8000
+; X64-SSE4-NEXT: # kill: def $ax killed $ax killed $eax
+; X64-SSE4-NEXT: retq
+;
+; X86-AVX1-LABEL: test_v32i16:
+; X86-AVX1: # %bb.0:
+; X86-AVX1-NEXT: vextractf128 $1, %ymm1, %xmm2
+; X86-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm3
+; X86-AVX1-NEXT: vpminsw %xmm2, %xmm3, %xmm2
+; X86-AVX1-NEXT: vpminsw %xmm1, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpminsw %xmm2, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}, %xmm0, %xmm0
+; X86-AVX1-NEXT: vphminposuw %xmm0, %xmm0
+; X86-AVX1-NEXT: vmovd %xmm0, %eax
+; X86-AVX1-NEXT: xorl $32768, %eax # imm = 0x8000
+; X86-AVX1-NEXT: # kill: def $ax killed $ax killed $eax
+; X86-AVX1-NEXT: vzeroupper
+; X86-AVX1-NEXT: retl
+;
+; X64-AVX1-LABEL: test_v32i16:
+; X64-AVX1: # %bb.0:
+; X64-AVX1-NEXT: vextractf128 $1, %ymm1, %xmm2
+; X64-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm3
+; X64-AVX1-NEXT: vpminsw %xmm2, %xmm3, %xmm2
+; X64-AVX1-NEXT: vpminsw %xmm1, %xmm0, %xmm0
+; X64-AVX1-NEXT: vpminsw %xmm2, %xmm0, %xmm0
+; X64-AVX1-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
+; X64-AVX1-NEXT: vphminposuw %xmm0, %xmm0
+; X64-AVX1-NEXT: vmovd %xmm0, %eax
+; X64-AVX1-NEXT: xorl $32768, %eax # imm = 0x8000
+; X64-AVX1-NEXT: # kill: def $ax killed $ax killed $eax
+; X64-AVX1-NEXT: vzeroupper
+; X64-AVX1-NEXT: retq
+;
+; X86-AVX2-LABEL: test_v32i16:
+; X86-AVX2: # %bb.0:
+; X86-AVX2-NEXT: vpminsw %ymm1, %ymm0, %ymm0
+; X86-AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
+; X86-AVX2-NEXT: vpminsw %xmm1, %xmm0, %xmm0
+; X86-AVX2-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}, %xmm0, %xmm0
+; X86-AVX2-NEXT: vphminposuw %xmm0, %xmm0
+; X86-AVX2-NEXT: vmovd %xmm0, %eax
+; X86-AVX2-NEXT: xorl $32768, %eax # imm = 0x8000
+; X86-AVX2-NEXT: # kill: def $ax killed $ax killed $eax
+; X86-AVX2-NEXT: vzeroupper
+; X86-AVX2-NEXT: retl
+;
+; X64-AVX2-LABEL: test_v32i16:
+; X64-AVX2: # %bb.0:
+; X64-AVX2-NEXT: vpminsw %ymm1, %ymm0, %ymm0
+; X64-AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
+; X64-AVX2-NEXT: vpminsw %xmm1, %xmm0, %xmm0
+; X64-AVX2-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
+; X64-AVX2-NEXT: vphminposuw %xmm0, %xmm0
+; X64-AVX2-NEXT: vmovd %xmm0, %eax
+; X64-AVX2-NEXT: xorl $32768, %eax # imm = 0x8000
+; X64-AVX2-NEXT: # kill: def $ax killed $ax killed $eax
+; X64-AVX2-NEXT: vzeroupper
+; X64-AVX2-NEXT: retq
;
; AVX512BW-LABEL: test_v32i16:
; AVX512BW: # %bb.0:
@@ -1366,78 +2398,175 @@ define i16 @test_v32i16(<32 x i16> %a0) {
ret i16 %1
}
-define i16 @test_v64i16(<64 x i16> %a0) {
-; SSE2-LABEL: test_v64i16:
-; SSE2: # %bb.0:
-; SSE2-NEXT: pminsw %xmm7, %xmm3
-; SSE2-NEXT: pminsw %xmm5, %xmm1
-; SSE2-NEXT: pminsw %xmm3, %xmm1
-; SSE2-NEXT: pminsw %xmm6, %xmm2
-; SSE2-NEXT: pminsw %xmm4, %xmm0
-; SSE2-NEXT: pminsw %xmm2, %xmm0
-; SSE2-NEXT: pminsw %xmm1, %xmm0
-; SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
-; SSE2-NEXT: pminsw %xmm0, %xmm1
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
-; SSE2-NEXT: pminsw %xmm1, %xmm0
-; SSE2-NEXT: movdqa %xmm0, %xmm1
-; SSE2-NEXT: psrld $16, %xmm1
-; SSE2-NEXT: pminsw %xmm0, %xmm1
-; SSE2-NEXT: movd %xmm1, %eax
-; SSE2-NEXT: # kill: def $ax killed $ax killed $eax
-; SSE2-NEXT: retq
-;
-; SSE4-LABEL: test_v64i16:
-; SSE4: # %bb.0:
-; SSE4-NEXT: pminsw %xmm7, %xmm3
-; SSE4-NEXT: pminsw %xmm5, %xmm1
-; SSE4-NEXT: pminsw %xmm3, %xmm1
-; SSE4-NEXT: pminsw %xmm6, %xmm2
-; SSE4-NEXT: pminsw %xmm4, %xmm0
-; SSE4-NEXT: pminsw %xmm2, %xmm0
-; SSE4-NEXT: pminsw %xmm1, %xmm0
-; SSE4-NEXT: pxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0
-; SSE4-NEXT: phminposuw %xmm0, %xmm0
-; SSE4-NEXT: movd %xmm0, %eax
-; SSE4-NEXT: xorl $32768, %eax # imm = 0x8000
-; SSE4-NEXT: # kill: def $ax killed $ax killed $eax
-; SSE4-NEXT: retq
-;
-; AVX1-LABEL: test_v64i16:
-; AVX1: # %bb.0:
-; AVX1-NEXT: vextractf128 $1, %ymm3, %xmm4
-; AVX1-NEXT: vextractf128 $1, %ymm1, %xmm5
-; AVX1-NEXT: vpminsw %xmm4, %xmm5, %xmm4
-; AVX1-NEXT: vextractf128 $1, %ymm2, %xmm5
-; AVX1-NEXT: vextractf128 $1, %ymm0, %xmm6
-; AVX1-NEXT: vpminsw %xmm5, %xmm6, %xmm5
-; AVX1-NEXT: vpminsw %xmm4, %xmm5, %xmm4
-; AVX1-NEXT: vpminsw %xmm3, %xmm1, %xmm1
-; AVX1-NEXT: vpminsw %xmm2, %xmm0, %xmm0
-; AVX1-NEXT: vpminsw %xmm1, %xmm0, %xmm0
-; AVX1-NEXT: vpminsw %xmm4, %xmm0, %xmm0
-; AVX1-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
-; AVX1-NEXT: vphminposuw %xmm0, %xmm0
-; AVX1-NEXT: vmovd %xmm0, %eax
-; AVX1-NEXT: xorl $32768, %eax # imm = 0x8000
-; AVX1-NEXT: # kill: def $ax killed $ax killed $eax
-; AVX1-NEXT: vzeroupper
-; AVX1-NEXT: retq
-;
-; AVX2-LABEL: test_v64i16:
-; AVX2: # %bb.0:
-; AVX2-NEXT: vpminsw %ymm3, %ymm1, %ymm1
-; AVX2-NEXT: vpminsw %ymm2, %ymm0, %ymm0
-; AVX2-NEXT: vpminsw %ymm1, %ymm0, %ymm0
-; AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
-; AVX2-NEXT: vpminsw %xmm1, %xmm0, %xmm0
-; AVX2-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
-; AVX2-NEXT: vphminposuw %xmm0, %xmm0
-; AVX2-NEXT: vmovd %xmm0, %eax
-; AVX2-NEXT: xorl $32768, %eax # imm = 0x8000
-; AVX2-NEXT: # kill: def $ax killed $ax killed $eax
-; AVX2-NEXT: vzeroupper
-; AVX2-NEXT: retq
+define i16 @test_v64i16(<64 x i16> %a0) nounwind {
+; X86-SSE2-LABEL: test_v64i16:
+; X86-SSE2: # %bb.0:
+; X86-SSE2-NEXT: pushl %ebp
+; X86-SSE2-NEXT: movl %esp, %ebp
+; X86-SSE2-NEXT: andl $-16, %esp
+; X86-SSE2-NEXT: subl $16, %esp
+; X86-SSE2-NEXT: movdqa 8(%ebp), %xmm3
+; X86-SSE2-NEXT: pminsw 72(%ebp), %xmm3
+; X86-SSE2-NEXT: pminsw 40(%ebp), %xmm1
+; X86-SSE2-NEXT: pminsw %xmm3, %xmm1
+; X86-SSE2-NEXT: pminsw 56(%ebp), %xmm2
+; X86-SSE2-NEXT: pminsw 24(%ebp), %xmm0
+; X86-SSE2-NEXT: pminsw %xmm2, %xmm0
+; X86-SSE2-NEXT: pminsw %xmm1, %xmm0
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-SSE2-NEXT: pminsw %xmm0, %xmm1
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
+; X86-SSE2-NEXT: pminsw %xmm1, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X86-SSE2-NEXT: psrld $16, %xmm1
+; X86-SSE2-NEXT: pminsw %xmm0, %xmm1
+; X86-SSE2-NEXT: movd %xmm1, %eax
+; X86-SSE2-NEXT: # kill: def $ax killed $ax killed $eax
+; X86-SSE2-NEXT: movl %ebp, %esp
+; X86-SSE2-NEXT: popl %ebp
+; X86-SSE2-NEXT: retl
+;
+; X64-SSE2-LABEL: test_v64i16:
+; X64-SSE2: # %bb.0:
+; X64-SSE2-NEXT: pminsw %xmm7, %xmm3
+; X64-SSE2-NEXT: pminsw %xmm5, %xmm1
+; X64-SSE2-NEXT: pminsw %xmm3, %xmm1
+; X64-SSE2-NEXT: pminsw %xmm6, %xmm2
+; X64-SSE2-NEXT: pminsw %xmm4, %xmm0
+; X64-SSE2-NEXT: pminsw %xmm2, %xmm0
+; X64-SSE2-NEXT: pminsw %xmm1, %xmm0
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X64-SSE2-NEXT: pminsw %xmm0, %xmm1
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
+; X64-SSE2-NEXT: pminsw %xmm1, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X64-SSE2-NEXT: psrld $16, %xmm1
+; X64-SSE2-NEXT: pminsw %xmm0, %xmm1
+; X64-SSE2-NEXT: movd %xmm1, %eax
+; X64-SSE2-NEXT: # kill: def $ax killed $ax killed $eax
+; X64-SSE2-NEXT: retq
+;
+; X86-SSE4-LABEL: test_v64i16:
+; X86-SSE4: # %bb.0:
+; X86-SSE4-NEXT: pushl %ebp
+; X86-SSE4-NEXT: movl %esp, %ebp
+; X86-SSE4-NEXT: andl $-16, %esp
+; X86-SSE4-NEXT: subl $16, %esp
+; X86-SSE4-NEXT: movdqa 8(%ebp), %xmm3
+; X86-SSE4-NEXT: pminsw 72(%ebp), %xmm3
+; X86-SSE4-NEXT: pminsw 40(%ebp), %xmm1
+; X86-SSE4-NEXT: pminsw %xmm3, %xmm1
+; X86-SSE4-NEXT: pminsw 56(%ebp), %xmm2
+; X86-SSE4-NEXT: pminsw 24(%ebp), %xmm0
+; X86-SSE4-NEXT: pminsw %xmm2, %xmm0
+; X86-SSE4-NEXT: pminsw %xmm1, %xmm0
+; X86-SSE4-NEXT: pxor {{\.?LCPI[0-9]+_[0-9]+}}, %xmm0
+; X86-SSE4-NEXT: phminposuw %xmm0, %xmm0
+; X86-SSE4-NEXT: movd %xmm0, %eax
+; X86-SSE4-NEXT: xorl $32768, %eax # imm = 0x8000
+; X86-SSE4-NEXT: # kill: def $ax killed $ax killed $eax
+; X86-SSE4-NEXT: movl %ebp, %esp
+; X86-SSE4-NEXT: popl %ebp
+; X86-SSE4-NEXT: retl
+;
+; X64-SSE4-LABEL: test_v64i16:
+; X64-SSE4: # %bb.0:
+; X64-SSE4-NEXT: pminsw %xmm7, %xmm3
+; X64-SSE4-NEXT: pminsw %xmm5, %xmm1
+; X64-SSE4-NEXT: pminsw %xmm3, %xmm1
+; X64-SSE4-NEXT: pminsw %xmm6, %xmm2
+; X64-SSE4-NEXT: pminsw %xmm4, %xmm0
+; X64-SSE4-NEXT: pminsw %xmm2, %xmm0
+; X64-SSE4-NEXT: pminsw %xmm1, %xmm0
+; X64-SSE4-NEXT: pxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0
+; X64-SSE4-NEXT: phminposuw %xmm0, %xmm0
+; X64-SSE4-NEXT: movd %xmm0, %eax
+; X64-SSE4-NEXT: xorl $32768, %eax # imm = 0x8000
+; X64-SSE4-NEXT: # kill: def $ax killed $ax killed $eax
+; X64-SSE4-NEXT: retq
+;
+; X86-AVX1-LABEL: test_v64i16:
+; X86-AVX1: # %bb.0:
+; X86-AVX1-NEXT: pushl %ebp
+; X86-AVX1-NEXT: movl %esp, %ebp
+; X86-AVX1-NEXT: andl $-32, %esp
+; X86-AVX1-NEXT: subl $32, %esp
+; X86-AVX1-NEXT: vextractf128 $1, %ymm2, %xmm3
+; X86-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm4
+; X86-AVX1-NEXT: vpminsw %xmm3, %xmm4, %xmm3
+; X86-AVX1-NEXT: vextractf128 $1, %ymm1, %xmm4
+; X86-AVX1-NEXT: vpminsw 24(%ebp), %xmm4, %xmm4
+; X86-AVX1-NEXT: vpminsw %xmm4, %xmm3, %xmm3
+; X86-AVX1-NEXT: vpminsw %xmm2, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpminsw 8(%ebp), %xmm1, %xmm1
+; X86-AVX1-NEXT: vpminsw %xmm1, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpminsw %xmm3, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}, %xmm0, %xmm0
+; X86-AVX1-NEXT: vphminposuw %xmm0, %xmm0
+; X86-AVX1-NEXT: vmovd %xmm0, %eax
+; X86-AVX1-NEXT: xorl $32768, %eax # imm = 0x8000
+; X86-AVX1-NEXT: # kill: def $ax killed $ax killed $eax
+; X86-AVX1-NEXT: movl %ebp, %esp
+; X86-AVX1-NEXT: popl %ebp
+; X86-AVX1-NEXT: vzeroupper
+; X86-AVX1-NEXT: retl
+;
+; X64-AVX1-LABEL: test_v64i16:
+; X64-AVX1: # %bb.0:
+; X64-AVX1-NEXT: vextractf128 $1, %ymm3, %xmm4
+; X64-AVX1-NEXT: vextractf128 $1, %ymm1, %xmm5
+; X64-AVX1-NEXT: vpminsw %xmm4, %xmm5, %xmm4
+; X64-AVX1-NEXT: vextractf128 $1, %ymm2, %xmm5
+; X64-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm6
+; X64-AVX1-NEXT: vpminsw %xmm5, %xmm6, %xmm5
+; X64-AVX1-NEXT: vpminsw %xmm4, %xmm5, %xmm4
+; X64-AVX1-NEXT: vpminsw %xmm3, %xmm1, %xmm1
+; X64-AVX1-NEXT: vpminsw %xmm2, %xmm0, %xmm0
+; X64-AVX1-NEXT: vpminsw %xmm1, %xmm0, %xmm0
+; X64-AVX1-NEXT: vpminsw %xmm4, %xmm0, %xmm0
+; X64-AVX1-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
+; X64-AVX1-NEXT: vphminposuw %xmm0, %xmm0
+; X64-AVX1-NEXT: vmovd %xmm0, %eax
+; X64-AVX1-NEXT: xorl $32768, %eax # imm = 0x8000
+; X64-AVX1-NEXT: # kill: def $ax killed $ax killed $eax
+; X64-AVX1-NEXT: vzeroupper
+; X64-AVX1-NEXT: retq
+;
+; X86-AVX2-LABEL: test_v64i16:
+; X86-AVX2: # %bb.0:
+; X86-AVX2-NEXT: pushl %ebp
+; X86-AVX2-NEXT: movl %esp, %ebp
+; X86-AVX2-NEXT: andl $-32, %esp
+; X86-AVX2-NEXT: subl $32, %esp
+; X86-AVX2-NEXT: vpminsw %ymm2, %ymm0, %ymm0
+; X86-AVX2-NEXT: vpminsw 8(%ebp), %ymm1, %ymm1
+; X86-AVX2-NEXT: vpminsw %ymm1, %ymm0, %ymm0
+; X86-AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
+; X86-AVX2-NEXT: vpminsw %xmm1, %xmm0, %xmm0
+; X86-AVX2-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}, %xmm0, %xmm0
+; X86-AVX2-NEXT: vphminposuw %xmm0, %xmm0
+; X86-AVX2-NEXT: vmovd %xmm0, %eax
+; X86-AVX2-NEXT: xorl $32768, %eax # imm = 0x8000
+; X86-AVX2-NEXT: # kill: def $ax killed $ax killed $eax
+; X86-AVX2-NEXT: movl %ebp, %esp
+; X86-AVX2-NEXT: popl %ebp
+; X86-AVX2-NEXT: vzeroupper
+; X86-AVX2-NEXT: retl
+;
+; X64-AVX2-LABEL: test_v64i16:
+; X64-AVX2: # %bb.0:
+; X64-AVX2-NEXT: vpminsw %ymm3, %ymm1, %ymm1
+; X64-AVX2-NEXT: vpminsw %ymm2, %ymm0, %ymm0
+; X64-AVX2-NEXT: vpminsw %ymm1, %ymm0, %ymm0
+; X64-AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
+; X64-AVX2-NEXT: vpminsw %xmm1, %xmm0, %xmm0
+; X64-AVX2-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
+; X64-AVX2-NEXT: vphminposuw %xmm0, %xmm0
+; X64-AVX2-NEXT: vmovd %xmm0, %eax
+; X64-AVX2-NEXT: xorl $32768, %eax # imm = 0x8000
+; X64-AVX2-NEXT: # kill: def $ax killed $ax killed $eax
+; X64-AVX2-NEXT: vzeroupper
+; X64-AVX2-NEXT: retq
;
; AVX512BW-LABEL: test_v64i16:
; AVX512BW: # %bb.0:
@@ -1476,7 +2605,7 @@ define i16 @test_v64i16(<64 x i16> %a0) {
; vXi8
;
-define i8 @test_v2i8(<2 x i8> %a0) {
+define i8 @test_v2i8(<2 x i8> %a0) nounwind {
; SSE2-LABEL: test_v2i8:
; SSE2: # %bb.0:
; SSE2-NEXT: movdqa %xmm0, %xmm1
@@ -1488,7 +2617,7 @@ define i8 @test_v2i8(<2 x i8> %a0) {
; SSE2-NEXT: por %xmm0, %xmm2
; SSE2-NEXT: movd %xmm2, %eax
; SSE2-NEXT: # kill: def $al killed $al killed $eax
-; SSE2-NEXT: retq
+; SSE2-NEXT: ret{{[l|q]}}
;
; SSE4-LABEL: test_v2i8:
; SSE4: # %bb.0:
@@ -1497,7 +2626,7 @@ define i8 @test_v2i8(<2 x i8> %a0) {
; SSE4-NEXT: pminsb %xmm0, %xmm1
; SSE4-NEXT: movd %xmm1, %eax
; SSE4-NEXT: # kill: def $al killed $al killed $eax
-; SSE4-NEXT: retq
+; SSE4-NEXT: ret{{[l|q]}}
;
; AVX-LABEL: test_v2i8:
; AVX: # %bb.0:
@@ -1505,39 +2634,51 @@ define i8 @test_v2i8(<2 x i8> %a0) {
; AVX-NEXT: vpminsb %xmm1, %xmm0, %xmm0
; AVX-NEXT: vmovd %xmm0, %eax
; AVX-NEXT: # kill: def $al killed $al killed $eax
-; AVX-NEXT: retq
-;
-; AVX512-LABEL: test_v2i8:
-; AVX512: # %bb.0:
-; AVX512-NEXT: vpsrlw $8, %xmm0, %xmm1
-; AVX512-NEXT: vpminsb %xmm1, %xmm0, %xmm0
-; AVX512-NEXT: vmovd %xmm0, %eax
-; AVX512-NEXT: # kill: def $al killed $al killed $eax
-; AVX512-NEXT: retq
+; AVX-NEXT: ret{{[l|q]}}
%1 = call i8 @llvm.vector.reduce.smin.v2i8(<2 x i8> %a0)
ret i8 %1
}
-define i8 @test_v4i8(<4 x i8> %a0) {
-; SSE2-LABEL: test_v4i8:
-; SSE2: # %bb.0:
-; SSE2-NEXT: movdqa %xmm0, %xmm1
-; SSE2-NEXT: psrld $16, %xmm1
-; SSE2-NEXT: movdqa %xmm1, %xmm2
-; SSE2-NEXT: pcmpgtb %xmm0, %xmm2
-; SSE2-NEXT: pand %xmm2, %xmm0
-; SSE2-NEXT: pandn %xmm1, %xmm2
-; SSE2-NEXT: por %xmm0, %xmm2
-; SSE2-NEXT: movdqa %xmm2, %xmm0
-; SSE2-NEXT: psrlw $8, %xmm0
-; SSE2-NEXT: movdqa %xmm0, %xmm1
-; SSE2-NEXT: pcmpgtb %xmm2, %xmm1
-; SSE2-NEXT: pand %xmm1, %xmm2
-; SSE2-NEXT: pandn %xmm0, %xmm1
-; SSE2-NEXT: por %xmm2, %xmm1
-; SSE2-NEXT: movd %xmm1, %eax
-; SSE2-NEXT: # kill: def $al killed $al killed $eax
-; SSE2-NEXT: retq
+define i8 @test_v4i8(<4 x i8> %a0) nounwind {
+; X86-SSE2-LABEL: test_v4i8:
+; X86-SSE2: # %bb.0:
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE2-NEXT: psrld $16, %xmm2
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm1
+; X86-SSE2-NEXT: pcmpgtb %xmm0, %xmm1
+; X86-SSE2-NEXT: pand %xmm1, %xmm0
+; X86-SSE2-NEXT: pandn %xmm2, %xmm1
+; X86-SSE2-NEXT: por %xmm0, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE2-NEXT: psrlw $8, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE2-NEXT: pcmpgtb %xmm1, %xmm2
+; X86-SSE2-NEXT: pand %xmm2, %xmm1
+; X86-SSE2-NEXT: pandn %xmm0, %xmm2
+; X86-SSE2-NEXT: por %xmm1, %xmm2
+; X86-SSE2-NEXT: movd %xmm2, %eax
+; X86-SSE2-NEXT: # kill: def $al killed $al killed $eax
+; X86-SSE2-NEXT: retl
+;
+; X64-SSE2-LABEL: test_v4i8:
+; X64-SSE2: # %bb.0:
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X64-SSE2-NEXT: psrld $16, %xmm1
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm2
+; X64-SSE2-NEXT: pcmpgtb %xmm0, %xmm2
+; X64-SSE2-NEXT: pand %xmm2, %xmm0
+; X64-SSE2-NEXT: pandn %xmm1, %xmm2
+; X64-SSE2-NEXT: por %xmm0, %xmm2
+; X64-SSE2-NEXT: movdqa %xmm2, %xmm0
+; X64-SSE2-NEXT: psrlw $8, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X64-SSE2-NEXT: pcmpgtb %xmm2, %xmm1
+; X64-SSE2-NEXT: pand %xmm1, %xmm2
+; X64-SSE2-NEXT: pandn %xmm0, %xmm1
+; X64-SSE2-NEXT: por %xmm2, %xmm1
+; X64-SSE2-NEXT: movd %xmm1, %eax
+; X64-SSE2-NEXT: # kill: def $al killed $al killed $eax
+; X64-SSE2-NEXT: retq
;
; SSE4-LABEL: test_v4i8:
; SSE4: # %bb.0:
@@ -1549,7 +2690,7 @@ define i8 @test_v4i8(<4 x i8> %a0) {
; SSE4-NEXT: pminsb %xmm1, %xmm0
; SSE4-NEXT: movd %xmm0, %eax
; SSE4-NEXT: # kill: def $al killed $al killed $eax
-; SSE4-NEXT: retq
+; SSE4-NEXT: ret{{[l|q]}}
;
; AVX-LABEL: test_v4i8:
; AVX: # %bb.0:
@@ -1559,47 +2700,63 @@ define i8 @test_v4i8(<4 x i8> %a0) {
; AVX-NEXT: vpminsb %xmm1, %xmm0, %xmm0
; AVX-NEXT: vmovd %xmm0, %eax
; AVX-NEXT: # kill: def $al killed $al killed $eax
-; AVX-NEXT: retq
-;
-; AVX512-LABEL: test_v4i8:
-; AVX512: # %bb.0:
-; AVX512-NEXT: vpsrld $16, %xmm0, %xmm1
-; AVX512-NEXT: vpminsb %xmm1, %xmm0, %xmm0
-; AVX512-NEXT: vpsrlw $8, %xmm0, %xmm1
-; AVX512-NEXT: vpminsb %xmm1, %xmm0, %xmm0
-; AVX512-NEXT: vmovd %xmm0, %eax
-; AVX512-NEXT: # kill: def $al killed $al killed $eax
-; AVX512-NEXT: retq
+; AVX-NEXT: ret{{[l|q]}}
%1 = call i8 @llvm.vector.reduce.smin.v4i8(<4 x i8> %a0)
ret i8 %1
}
-define i8 @test_v8i8(<8 x i8> %a0) {
-; SSE2-LABEL: test_v8i8:
-; SSE2: # %bb.0:
-; SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
-; SSE2-NEXT: movdqa %xmm1, %xmm2
-; SSE2-NEXT: pcmpgtb %xmm0, %xmm2
-; SSE2-NEXT: pand %xmm2, %xmm0
-; SSE2-NEXT: pandn %xmm1, %xmm2
-; SSE2-NEXT: por %xmm0, %xmm2
-; SSE2-NEXT: movdqa %xmm2, %xmm0
-; SSE2-NEXT: psrld $16, %xmm0
-; SSE2-NEXT: movdqa %xmm0, %xmm1
-; SSE2-NEXT: pcmpgtb %xmm2, %xmm1
-; SSE2-NEXT: pand %xmm1, %xmm2
-; SSE2-NEXT: pandn %xmm0, %xmm1
-; SSE2-NEXT: por %xmm2, %xmm1
-; SSE2-NEXT: movdqa %xmm1, %xmm0
-; SSE2-NEXT: psrlw $8, %xmm0
-; SSE2-NEXT: movdqa %xmm0, %xmm2
-; SSE2-NEXT: pcmpgtb %xmm1, %xmm2
-; SSE2-NEXT: pand %xmm2, %xmm1
-; SSE2-NEXT: pandn %xmm0, %xmm2
-; SSE2-NEXT: por %xmm1, %xmm2
-; SSE2-NEXT: movd %xmm2, %eax
-; SSE2-NEXT: # kill: def $al killed $al killed $eax
-; SSE2-NEXT: retq
+define i8 @test_v8i8(<8 x i8> %a0) nounwind {
+; X86-SSE2-LABEL: test_v8i8:
+; X86-SSE2: # %bb.0:
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm0[1,1,1,1]
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm1
+; X86-SSE2-NEXT: pcmpgtb %xmm0, %xmm1
+; X86-SSE2-NEXT: pand %xmm1, %xmm0
+; X86-SSE2-NEXT: pandn %xmm2, %xmm1
+; X86-SSE2-NEXT: por %xmm0, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm2
+; X86-SSE2-NEXT: psrld $16, %xmm2
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm0
+; X86-SSE2-NEXT: pcmpgtb %xmm1, %xmm0
+; X86-SSE2-NEXT: pand %xmm0, %xmm1
+; X86-SSE2-NEXT: pandn %xmm2, %xmm0
+; X86-SSE2-NEXT: por %xmm1, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X86-SSE2-NEXT: psrlw $8, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm2
+; X86-SSE2-NEXT: pcmpgtb %xmm0, %xmm2
+; X86-SSE2-NEXT: pand %xmm2, %xmm0
+; X86-SSE2-NEXT: pandn %xmm1, %xmm2
+; X86-SSE2-NEXT: por %xmm0, %xmm2
+; X86-SSE2-NEXT: movd %xmm2, %eax
+; X86-SSE2-NEXT: # kill: def $al killed $al killed $eax
+; X86-SSE2-NEXT: retl
+;
+; X64-SSE2-LABEL: test_v8i8:
+; X64-SSE2: # %bb.0:
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm2
+; X64-SSE2-NEXT: pcmpgtb %xmm0, %xmm2
+; X64-SSE2-NEXT: pand %xmm2, %xmm0
+; X64-SSE2-NEXT: pandn %xmm1, %xmm2
+; X64-SSE2-NEXT: por %xmm0, %xmm2
+; X64-SSE2-NEXT: movdqa %xmm2, %xmm0
+; X64-SSE2-NEXT: psrld $16, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X64-SSE2-NEXT: pcmpgtb %xmm2, %xmm1
+; X64-SSE2-NEXT: pand %xmm1, %xmm2
+; X64-SSE2-NEXT: pandn %xmm0, %xmm1
+; X64-SSE2-NEXT: por %xmm2, %xmm1
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X64-SSE2-NEXT: psrlw $8, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X64-SSE2-NEXT: pcmpgtb %xmm1, %xmm2
+; X64-SSE2-NEXT: pand %xmm2, %xmm1
+; X64-SSE2-NEXT: pandn %xmm0, %xmm2
+; X64-SSE2-NEXT: por %xmm1, %xmm2
+; X64-SSE2-NEXT: movd %xmm2, %eax
+; X64-SSE2-NEXT: # kill: def $al killed $al killed $eax
+; X64-SSE2-NEXT: retq
;
; SSE4-LABEL: test_v8i8:
; SSE4: # %bb.0:
@@ -1613,7 +2770,7 @@ define i8 @test_v8i8(<8 x i8> %a0) {
; SSE4-NEXT: pminsb %xmm0, %xmm1
; SSE4-NEXT: movd %xmm1, %eax
; SSE4-NEXT: # kill: def $al killed $al killed $eax
-; SSE4-NEXT: retq
+; SSE4-NEXT: ret{{[l|q]}}
;
; AVX-LABEL: test_v8i8:
; AVX: # %bb.0:
@@ -1625,78 +2782,121 @@ define i8 @test_v8i8(<8 x i8> %a0) {
; AVX-NEXT: vpminsb %xmm1, %xmm0, %xmm0
; AVX-NEXT: vmovd %xmm0, %eax
; AVX-NEXT: # kill: def $al killed $al killed $eax
-; AVX-NEXT: retq
-;
-; AVX512-LABEL: test_v8i8:
-; AVX512: # %bb.0:
-; AVX512-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
-; AVX512-NEXT: vpminsb %xmm1, %xmm0, %xmm0
-; AVX512-NEXT: vpsrld $16, %xmm0, %xmm1
-; AVX512-NEXT: vpminsb %xmm1, %xmm0, %xmm0
-; AVX512-NEXT: vpsrlw $8, %xmm0, %xmm1
-; AVX512-NEXT: vpminsb %xmm1, %xmm0, %xmm0
-; AVX512-NEXT: vmovd %xmm0, %eax
-; AVX512-NEXT: # kill: def $al killed $al killed $eax
-; AVX512-NEXT: retq
+; AVX-NEXT: ret{{[l|q]}}
%1 = call i8 @llvm.vector.reduce.smin.v8i8(<8 x i8> %a0)
ret i8 %1
}
-define i8 @test_v16i8(<16 x i8> %a0) {
-; SSE2-LABEL: test_v16i8:
-; SSE2: # %bb.0:
-; SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
-; SSE2-NEXT: movdqa %xmm1, %xmm2
-; SSE2-NEXT: pcmpgtb %xmm0, %xmm2
-; SSE2-NEXT: pand %xmm2, %xmm0
-; SSE2-NEXT: pandn %xmm1, %xmm2
-; SSE2-NEXT: por %xmm0, %xmm2
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,1,1]
-; SSE2-NEXT: movdqa %xmm0, %xmm1
-; SSE2-NEXT: pcmpgtb %xmm2, %xmm1
-; SSE2-NEXT: pand %xmm1, %xmm2
-; SSE2-NEXT: pandn %xmm0, %xmm1
-; SSE2-NEXT: por %xmm2, %xmm1
-; SSE2-NEXT: movdqa %xmm1, %xmm0
-; SSE2-NEXT: psrld $16, %xmm0
-; SSE2-NEXT: movdqa %xmm0, %xmm2
-; SSE2-NEXT: pcmpgtb %xmm1, %xmm2
-; SSE2-NEXT: pand %xmm2, %xmm1
-; SSE2-NEXT: pandn %xmm0, %xmm2
-; SSE2-NEXT: por %xmm1, %xmm2
-; SSE2-NEXT: movdqa %xmm2, %xmm0
-; SSE2-NEXT: psrlw $8, %xmm0
-; SSE2-NEXT: movdqa %xmm0, %xmm1
-; SSE2-NEXT: pcmpgtb %xmm2, %xmm1
-; SSE2-NEXT: pand %xmm1, %xmm2
-; SSE2-NEXT: pandn %xmm0, %xmm1
-; SSE2-NEXT: por %xmm2, %xmm1
-; SSE2-NEXT: movd %xmm1, %eax
-; SSE2-NEXT: # kill: def $al killed $al killed $eax
-; SSE2-NEXT: retq
-;
-; SSE4-LABEL: test_v16i8:
-; SSE4: # %bb.0:
-; SSE4-NEXT: pxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0
-; SSE4-NEXT: movdqa %xmm0, %xmm1
-; SSE4-NEXT: psrlw $8, %xmm1
-; SSE4-NEXT: pminub %xmm0, %xmm1
-; SSE4-NEXT: phminposuw %xmm1, %xmm0
-; SSE4-NEXT: movd %xmm0, %eax
-; SSE4-NEXT: addb $-128, %al
-; SSE4-NEXT: # kill: def $al killed $al killed $eax
-; SSE4-NEXT: retq
-;
-; AVX-LABEL: test_v16i8:
-; AVX: # %bb.0:
-; AVX-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
-; AVX-NEXT: vpsrlw $8, %xmm0, %xmm1
-; AVX-NEXT: vpminub %xmm1, %xmm0, %xmm0
-; AVX-NEXT: vphminposuw %xmm0, %xmm0
-; AVX-NEXT: vmovd %xmm0, %eax
-; AVX-NEXT: addb $-128, %al
-; AVX-NEXT: # kill: def $al killed $al killed $eax
-; AVX-NEXT: retq
+define i8 @test_v16i8(<16 x i8> %a0) nounwind {
+; X86-SSE2-LABEL: test_v16i8:
+; X86-SSE2: # %bb.0:
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm2
+; X86-SSE2-NEXT: pcmpgtb %xmm0, %xmm2
+; X86-SSE2-NEXT: pand %xmm2, %xmm0
+; X86-SSE2-NEXT: pandn %xmm1, %xmm2
+; X86-SSE2-NEXT: por %xmm0, %xmm2
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm2[1,1,1,1]
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE2-NEXT: pcmpgtb %xmm2, %xmm0
+; X86-SSE2-NEXT: pand %xmm0, %xmm2
+; X86-SSE2-NEXT: pandn %xmm1, %xmm0
+; X86-SSE2-NEXT: por %xmm2, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE2-NEXT: psrld $16, %xmm2
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm1
+; X86-SSE2-NEXT: pcmpgtb %xmm0, %xmm1
+; X86-SSE2-NEXT: pand %xmm1, %xmm0
+; X86-SSE2-NEXT: pandn %xmm2, %xmm1
+; X86-SSE2-NEXT: por %xmm0, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE2-NEXT: psrlw $8, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE2-NEXT: pcmpgtb %xmm1, %xmm2
+; X86-SSE2-NEXT: pand %xmm2, %xmm1
+; X86-SSE2-NEXT: pandn %xmm0, %xmm2
+; X86-SSE2-NEXT: por %xmm1, %xmm2
+; X86-SSE2-NEXT: movd %xmm2, %eax
+; X86-SSE2-NEXT: # kill: def $al killed $al killed $eax
+; X86-SSE2-NEXT: retl
+;
+; X64-SSE2-LABEL: test_v16i8:
+; X64-SSE2: # %bb.0:
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm2
+; X64-SSE2-NEXT: pcmpgtb %xmm0, %xmm2
+; X64-SSE2-NEXT: pand %xmm2, %xmm0
+; X64-SSE2-NEXT: pandn %xmm1, %xmm2
+; X64-SSE2-NEXT: por %xmm0, %xmm2
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,1,1]
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X64-SSE2-NEXT: pcmpgtb %xmm2, %xmm1
+; X64-SSE2-NEXT: pand %xmm1, %xmm2
+; X64-SSE2-NEXT: pandn %xmm0, %xmm1
+; X64-SSE2-NEXT: por %xmm2, %xmm1
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X64-SSE2-NEXT: psrld $16, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X64-SSE2-NEXT: pcmpgtb %xmm1, %xmm2
+; X64-SSE2-NEXT: pand %xmm2, %xmm1
+; X64-SSE2-NEXT: pandn %xmm0, %xmm2
+; X64-SSE2-NEXT: por %xmm1, %xmm2
+; X64-SSE2-NEXT: movdqa %xmm2, %xmm0
+; X64-SSE2-NEXT: psrlw $8, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X64-SSE2-NEXT: pcmpgtb %xmm2, %xmm1
+; X64-SSE2-NEXT: pand %xmm1, %xmm2
+; X64-SSE2-NEXT: pandn %xmm0, %xmm1
+; X64-SSE2-NEXT: por %xmm2, %xmm1
+; X64-SSE2-NEXT: movd %xmm1, %eax
+; X64-SSE2-NEXT: # kill: def $al killed $al killed $eax
+; X64-SSE2-NEXT: retq
+;
+; X86-SSE4-LABEL: test_v16i8:
+; X86-SSE4: # %bb.0:
+; X86-SSE4-NEXT: pxor {{\.?LCPI[0-9]+_[0-9]+}}, %xmm0
+; X86-SSE4-NEXT: movdqa %xmm0, %xmm1
+; X86-SSE4-NEXT: psrlw $8, %xmm1
+; X86-SSE4-NEXT: pminub %xmm0, %xmm1
+; X86-SSE4-NEXT: phminposuw %xmm1, %xmm0
+; X86-SSE4-NEXT: movd %xmm0, %eax
+; X86-SSE4-NEXT: addb $-128, %al
+; X86-SSE4-NEXT: # kill: def $al killed $al killed $eax
+; X86-SSE4-NEXT: retl
+;
+; X64-SSE4-LABEL: test_v16i8:
+; X64-SSE4: # %bb.0:
+; X64-SSE4-NEXT: pxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0
+; X64-SSE4-NEXT: movdqa %xmm0, %xmm1
+; X64-SSE4-NEXT: psrlw $8, %xmm1
+; X64-SSE4-NEXT: pminub %xmm0, %xmm1
+; X64-SSE4-NEXT: phminposuw %xmm1, %xmm0
+; X64-SSE4-NEXT: movd %xmm0, %eax
+; X64-SSE4-NEXT: addb $-128, %al
+; X64-SSE4-NEXT: # kill: def $al killed $al killed $eax
+; X64-SSE4-NEXT: retq
+;
+; X86-AVX-LABEL: test_v16i8:
+; X86-AVX: # %bb.0:
+; X86-AVX-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}, %xmm0, %xmm0
+; X86-AVX-NEXT: vpsrlw $8, %xmm0, %xmm1
+; X86-AVX-NEXT: vpminub %xmm1, %xmm0, %xmm0
+; X86-AVX-NEXT: vphminposuw %xmm0, %xmm0
+; X86-AVX-NEXT: vmovd %xmm0, %eax
+; X86-AVX-NEXT: addb $-128, %al
+; X86-AVX-NEXT: # kill: def $al killed $al killed $eax
+; X86-AVX-NEXT: retl
+;
+; X64-AVX-LABEL: test_v16i8:
+; X64-AVX: # %bb.0:
+; X64-AVX-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
+; X64-AVX-NEXT: vpsrlw $8, %xmm0, %xmm1
+; X64-AVX-NEXT: vpminub %xmm1, %xmm0, %xmm0
+; X64-AVX-NEXT: vphminposuw %xmm0, %xmm0
+; X64-AVX-NEXT: vmovd %xmm0, %eax
+; X64-AVX-NEXT: addb $-128, %al
+; X64-AVX-NEXT: # kill: def $al killed $al killed $eax
+; X64-AVX-NEXT: retq
;
; AVX512BW-LABEL: test_v16i8:
; AVX512BW: # %bb.0:
@@ -1723,84 +2923,162 @@ define i8 @test_v16i8(<16 x i8> %a0) {
ret i8 %1
}
-define i8 @test_v32i8(<32 x i8> %a0) {
-; SSE2-LABEL: test_v32i8:
-; SSE2: # %bb.0:
-; SSE2-NEXT: movdqa %xmm1, %xmm2
-; SSE2-NEXT: pcmpgtb %xmm0, %xmm2
-; SSE2-NEXT: pand %xmm2, %xmm0
-; SSE2-NEXT: pandn %xmm1, %xmm2
-; SSE2-NEXT: por %xmm0, %xmm2
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm2[2,3,2,3]
-; SSE2-NEXT: movdqa %xmm0, %xmm1
-; SSE2-NEXT: pcmpgtb %xmm2, %xmm1
-; SSE2-NEXT: pand %xmm1, %xmm2
-; SSE2-NEXT: pandn %xmm0, %xmm1
-; SSE2-NEXT: por %xmm2, %xmm1
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
-; SSE2-NEXT: movdqa %xmm0, %xmm2
-; SSE2-NEXT: pcmpgtb %xmm1, %xmm2
-; SSE2-NEXT: pand %xmm2, %xmm1
-; SSE2-NEXT: pandn %xmm0, %xmm2
-; SSE2-NEXT: por %xmm1, %xmm2
-; SSE2-NEXT: movdqa %xmm2, %xmm0
-; SSE2-NEXT: psrld $16, %xmm0
-; SSE2-NEXT: movdqa %xmm0, %xmm1
-; SSE2-NEXT: pcmpgtb %xmm2, %xmm1
-; SSE2-NEXT: pand %xmm1, %xmm2
-; SSE2-NEXT: pandn %xmm0, %xmm1
-; SSE2-NEXT: por %xmm2, %xmm1
-; SSE2-NEXT: movdqa %xmm1, %xmm0
-; SSE2-NEXT: psrlw $8, %xmm0
-; SSE2-NEXT: movdqa %xmm0, %xmm2
-; SSE2-NEXT: pcmpgtb %xmm1, %xmm2
-; SSE2-NEXT: pand %xmm2, %xmm1
-; SSE2-NEXT: pandn %xmm0, %xmm2
-; SSE2-NEXT: por %xmm1, %xmm2
-; SSE2-NEXT: movd %xmm2, %eax
-; SSE2-NEXT: # kill: def $al killed $al killed $eax
-; SSE2-NEXT: retq
-;
-; SSE4-LABEL: test_v32i8:
-; SSE4: # %bb.0:
-; SSE4-NEXT: pminsb %xmm1, %xmm0
-; SSE4-NEXT: pxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0
-; SSE4-NEXT: movdqa %xmm0, %xmm1
-; SSE4-NEXT: psrlw $8, %xmm1
-; SSE4-NEXT: pminub %xmm0, %xmm1
-; SSE4-NEXT: phminposuw %xmm1, %xmm0
-; SSE4-NEXT: movd %xmm0, %eax
-; SSE4-NEXT: addb $-128, %al
-; SSE4-NEXT: # kill: def $al killed $al killed $eax
-; SSE4-NEXT: retq
-;
-; AVX1-LABEL: test_v32i8:
-; AVX1: # %bb.0:
-; AVX1-NEXT: vextractf128 $1, %ymm0, %xmm1
-; AVX1-NEXT: vpminsb %xmm1, %xmm0, %xmm0
-; AVX1-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
-; AVX1-NEXT: vpsrlw $8, %xmm0, %xmm1
-; AVX1-NEXT: vpminub %xmm1, %xmm0, %xmm0
-; AVX1-NEXT: vphminposuw %xmm0, %xmm0
-; AVX1-NEXT: vmovd %xmm0, %eax
-; AVX1-NEXT: addb $-128, %al
-; AVX1-NEXT: # kill: def $al killed $al killed $eax
-; AVX1-NEXT: vzeroupper
-; AVX1-NEXT: retq
-;
-; AVX2-LABEL: test_v32i8:
-; AVX2: # %bb.0:
-; AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
-; AVX2-NEXT: vpminsb %xmm1, %xmm0, %xmm0
-; AVX2-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
-; AVX2-NEXT: vpsrlw $8, %xmm0, %xmm1
-; AVX2-NEXT: vpminub %xmm1, %xmm0, %xmm0
-; AVX2-NEXT: vphminposuw %xmm0, %xmm0
-; AVX2-NEXT: vmovd %xmm0, %eax
-; AVX2-NEXT: addb $-128, %al
-; AVX2-NEXT: # kill: def $al killed $al killed $eax
-; AVX2-NEXT: vzeroupper
-; AVX2-NEXT: retq
+define i8 @test_v32i8(<32 x i8> %a0) nounwind {
+; X86-SSE2-LABEL: test_v32i8:
+; X86-SSE2: # %bb.0:
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm2
+; X86-SSE2-NEXT: pcmpgtb %xmm0, %xmm2
+; X86-SSE2-NEXT: pand %xmm2, %xmm0
+; X86-SSE2-NEXT: pandn %xmm1, %xmm2
+; X86-SSE2-NEXT: por %xmm0, %xmm2
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm2[2,3,2,3]
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X86-SSE2-NEXT: pcmpgtb %xmm2, %xmm1
+; X86-SSE2-NEXT: pand %xmm1, %xmm2
+; X86-SSE2-NEXT: pandn %xmm0, %xmm1
+; X86-SSE2-NEXT: por %xmm2, %xmm1
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm1[1,1,1,1]
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm0
+; X86-SSE2-NEXT: pcmpgtb %xmm1, %xmm0
+; X86-SSE2-NEXT: pand %xmm0, %xmm1
+; X86-SSE2-NEXT: pandn %xmm2, %xmm0
+; X86-SSE2-NEXT: por %xmm1, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE2-NEXT: psrld $16, %xmm2
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm1
+; X86-SSE2-NEXT: pcmpgtb %xmm0, %xmm1
+; X86-SSE2-NEXT: pand %xmm1, %xmm0
+; X86-SSE2-NEXT: pandn %xmm2, %xmm1
+; X86-SSE2-NEXT: por %xmm0, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE2-NEXT: psrlw $8, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE2-NEXT: pcmpgtb %xmm1, %xmm2
+; X86-SSE2-NEXT: pand %xmm2, %xmm1
+; X86-SSE2-NEXT: pandn %xmm0, %xmm2
+; X86-SSE2-NEXT: por %xmm1, %xmm2
+; X86-SSE2-NEXT: movd %xmm2, %eax
+; X86-SSE2-NEXT: # kill: def $al killed $al killed $eax
+; X86-SSE2-NEXT: retl
+;
+; X64-SSE2-LABEL: test_v32i8:
+; X64-SSE2: # %bb.0:
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm2
+; X64-SSE2-NEXT: pcmpgtb %xmm0, %xmm2
+; X64-SSE2-NEXT: pand %xmm2, %xmm0
+; X64-SSE2-NEXT: pandn %xmm1, %xmm2
+; X64-SSE2-NEXT: por %xmm0, %xmm2
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm2[2,3,2,3]
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X64-SSE2-NEXT: pcmpgtb %xmm2, %xmm1
+; X64-SSE2-NEXT: pand %xmm1, %xmm2
+; X64-SSE2-NEXT: pandn %xmm0, %xmm1
+; X64-SSE2-NEXT: por %xmm2, %xmm1
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X64-SSE2-NEXT: pcmpgtb %xmm1, %xmm2
+; X64-SSE2-NEXT: pand %xmm2, %xmm1
+; X64-SSE2-NEXT: pandn %xmm0, %xmm2
+; X64-SSE2-NEXT: por %xmm1, %xmm2
+; X64-SSE2-NEXT: movdqa %xmm2, %xmm0
+; X64-SSE2-NEXT: psrld $16, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X64-SSE2-NEXT: pcmpgtb %xmm2, %xmm1
+; X64-SSE2-NEXT: pand %xmm1, %xmm2
+; X64-SSE2-NEXT: pandn %xmm0, %xmm1
+; X64-SSE2-NEXT: por %xmm2, %xmm1
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X64-SSE2-NEXT: psrlw $8, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X64-SSE2-NEXT: pcmpgtb %xmm1, %xmm2
+; X64-SSE2-NEXT: pand %xmm2, %xmm1
+; X64-SSE2-NEXT: pandn %xmm0, %xmm2
+; X64-SSE2-NEXT: por %xmm1, %xmm2
+; X64-SSE2-NEXT: movd %xmm2, %eax
+; X64-SSE2-NEXT: # kill: def $al killed $al killed $eax
+; X64-SSE2-NEXT: retq
+;
+; X86-SSE4-LABEL: test_v32i8:
+; X86-SSE4: # %bb.0:
+; X86-SSE4-NEXT: pminsb %xmm1, %xmm0
+; X86-SSE4-NEXT: pxor {{\.?LCPI[0-9]+_[0-9]+}}, %xmm0
+; X86-SSE4-NEXT: movdqa %xmm0, %xmm1
+; X86-SSE4-NEXT: psrlw $8, %xmm1
+; X86-SSE4-NEXT: pminub %xmm0, %xmm1
+; X86-SSE4-NEXT: phminposuw %xmm1, %xmm0
+; X86-SSE4-NEXT: movd %xmm0, %eax
+; X86-SSE4-NEXT: addb $-128, %al
+; X86-SSE4-NEXT: # kill: def $al killed $al killed $eax
+; X86-SSE4-NEXT: retl
+;
+; X64-SSE4-LABEL: test_v32i8:
+; X64-SSE4: # %bb.0:
+; X64-SSE4-NEXT: pminsb %xmm1, %xmm0
+; X64-SSE4-NEXT: pxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0
+; X64-SSE4-NEXT: movdqa %xmm0, %xmm1
+; X64-SSE4-NEXT: psrlw $8, %xmm1
+; X64-SSE4-NEXT: pminub %xmm0, %xmm1
+; X64-SSE4-NEXT: phminposuw %xmm1, %xmm0
+; X64-SSE4-NEXT: movd %xmm0, %eax
+; X64-SSE4-NEXT: addb $-128, %al
+; X64-SSE4-NEXT: # kill: def $al killed $al killed $eax
+; X64-SSE4-NEXT: retq
+;
+; X86-AVX1-LABEL: test_v32i8:
+; X86-AVX1: # %bb.0:
+; X86-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm1
+; X86-AVX1-NEXT: vpminsb %xmm1, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpsrlw $8, %xmm0, %xmm1
+; X86-AVX1-NEXT: vpminub %xmm1, %xmm0, %xmm0
+; X86-AVX1-NEXT: vphminposuw %xmm0, %xmm0
+; X86-AVX1-NEXT: vmovd %xmm0, %eax
+; X86-AVX1-NEXT: addb $-128, %al
+; X86-AVX1-NEXT: # kill: def $al killed $al killed $eax
+; X86-AVX1-NEXT: vzeroupper
+; X86-AVX1-NEXT: retl
+;
+; X64-AVX1-LABEL: test_v32i8:
+; X64-AVX1: # %bb.0:
+; X64-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm1
+; X64-AVX1-NEXT: vpminsb %xmm1, %xmm0, %xmm0
+; X64-AVX1-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
+; X64-AVX1-NEXT: vpsrlw $8, %xmm0, %xmm1
+; X64-AVX1-NEXT: vpminub %xmm1, %xmm0, %xmm0
+; X64-AVX1-NEXT: vphminposuw %xmm0, %xmm0
+; X64-AVX1-NEXT: vmovd %xmm0, %eax
+; X64-AVX1-NEXT: addb $-128, %al
+; X64-AVX1-NEXT: # kill: def $al killed $al killed $eax
+; X64-AVX1-NEXT: vzeroupper
+; X64-AVX1-NEXT: retq
+;
+; X86-AVX2-LABEL: test_v32i8:
+; X86-AVX2: # %bb.0:
+; X86-AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
+; X86-AVX2-NEXT: vpminsb %xmm1, %xmm0, %xmm0
+; X86-AVX2-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}, %xmm0, %xmm0
+; X86-AVX2-NEXT: vpsrlw $8, %xmm0, %xmm1
+; X86-AVX2-NEXT: vpminub %xmm1, %xmm0, %xmm0
+; X86-AVX2-NEXT: vphminposuw %xmm0, %xmm0
+; X86-AVX2-NEXT: vmovd %xmm0, %eax
+; X86-AVX2-NEXT: addb $-128, %al
+; X86-AVX2-NEXT: # kill: def $al killed $al killed $eax
+; X86-AVX2-NEXT: vzeroupper
+; X86-AVX2-NEXT: retl
+;
+; X64-AVX2-LABEL: test_v32i8:
+; X64-AVX2: # %bb.0:
+; X64-AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
+; X64-AVX2-NEXT: vpminsb %xmm1, %xmm0, %xmm0
+; X64-AVX2-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
+; X64-AVX2-NEXT: vpsrlw $8, %xmm0, %xmm1
+; X64-AVX2-NEXT: vpminub %xmm1, %xmm0, %xmm0
+; X64-AVX2-NEXT: vphminposuw %xmm0, %xmm0
+; X64-AVX2-NEXT: vmovd %xmm0, %eax
+; X64-AVX2-NEXT: addb $-128, %al
+; X64-AVX2-NEXT: # kill: def $al killed $al killed $eax
+; X64-AVX2-NEXT: vzeroupper
+; X64-AVX2-NEXT: retq
;
; AVX512BW-LABEL: test_v32i8:
; AVX512BW: # %bb.0:
@@ -1833,100 +3111,207 @@ define i8 @test_v32i8(<32 x i8> %a0) {
ret i8 %1
}
-define i8 @test_v64i8(<64 x i8> %a0) {
-; SSE2-LABEL: test_v64i8:
-; SSE2: # %bb.0:
-; SSE2-NEXT: movdqa %xmm2, %xmm4
-; SSE2-NEXT: pcmpgtb %xmm0, %xmm4
-; SSE2-NEXT: pand %xmm4, %xmm0
-; SSE2-NEXT: pandn %xmm2, %xmm4
-; SSE2-NEXT: por %xmm0, %xmm4
-; SSE2-NEXT: movdqa %xmm3, %xmm0
-; SSE2-NEXT: pcmpgtb %xmm1, %xmm0
-; SSE2-NEXT: pand %xmm0, %xmm1
-; SSE2-NEXT: pandn %xmm3, %xmm0
-; SSE2-NEXT: por %xmm1, %xmm0
-; SSE2-NEXT: movdqa %xmm0, %xmm1
-; SSE2-NEXT: pcmpgtb %xmm4, %xmm1
-; SSE2-NEXT: pand %xmm1, %xmm4
-; SSE2-NEXT: pandn %xmm0, %xmm1
-; SSE2-NEXT: por %xmm4, %xmm1
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
-; SSE2-NEXT: movdqa %xmm0, %xmm2
-; SSE2-NEXT: pcmpgtb %xmm1, %xmm2
-; SSE2-NEXT: pand %xmm2, %xmm1
-; SSE2-NEXT: pandn %xmm0, %xmm2
-; SSE2-NEXT: por %xmm1, %xmm2
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,1,1]
-; SSE2-NEXT: movdqa %xmm0, %xmm1
-; SSE2-NEXT: pcmpgtb %xmm2, %xmm1
-; SSE2-NEXT: pand %xmm1, %xmm2
-; SSE2-NEXT: pandn %xmm0, %xmm1
-; SSE2-NEXT: por %xmm2, %xmm1
-; SSE2-NEXT: movdqa %xmm1, %xmm0
-; SSE2-NEXT: psrld $16, %xmm0
-; SSE2-NEXT: movdqa %xmm0, %xmm2
-; SSE2-NEXT: pcmpgtb %xmm1, %xmm2
-; SSE2-NEXT: pand %xmm2, %xmm1
-; SSE2-NEXT: pandn %xmm0, %xmm2
-; SSE2-NEXT: por %xmm1, %xmm2
-; SSE2-NEXT: movdqa %xmm2, %xmm0
-; SSE2-NEXT: psrlw $8, %xmm0
-; SSE2-NEXT: movdqa %xmm0, %xmm1
-; SSE2-NEXT: pcmpgtb %xmm2, %xmm1
-; SSE2-NEXT: pand %xmm1, %xmm2
-; SSE2-NEXT: pandn %xmm0, %xmm1
-; SSE2-NEXT: por %xmm2, %xmm1
-; SSE2-NEXT: movd %xmm1, %eax
-; SSE2-NEXT: # kill: def $al killed $al killed $eax
-; SSE2-NEXT: retq
-;
-; SSE4-LABEL: test_v64i8:
-; SSE4: # %bb.0:
-; SSE4-NEXT: pminsb %xmm3, %xmm1
-; SSE4-NEXT: pminsb %xmm2, %xmm0
-; SSE4-NEXT: pminsb %xmm1, %xmm0
-; SSE4-NEXT: pxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0
-; SSE4-NEXT: movdqa %xmm0, %xmm1
-; SSE4-NEXT: psrlw $8, %xmm1
-; SSE4-NEXT: pminub %xmm0, %xmm1
-; SSE4-NEXT: phminposuw %xmm1, %xmm0
-; SSE4-NEXT: movd %xmm0, %eax
-; SSE4-NEXT: addb $-128, %al
-; SSE4-NEXT: # kill: def $al killed $al killed $eax
-; SSE4-NEXT: retq
-;
-; AVX1-LABEL: test_v64i8:
-; AVX1: # %bb.0:
-; AVX1-NEXT: vextractf128 $1, %ymm1, %xmm2
-; AVX1-NEXT: vextractf128 $1, %ymm0, %xmm3
-; AVX1-NEXT: vpminsb %xmm2, %xmm3, %xmm2
-; AVX1-NEXT: vpminsb %xmm1, %xmm0, %xmm0
-; AVX1-NEXT: vpminsb %xmm2, %xmm0, %xmm0
-; AVX1-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
-; AVX1-NEXT: vpsrlw $8, %xmm0, %xmm1
-; AVX1-NEXT: vpminub %xmm1, %xmm0, %xmm0
-; AVX1-NEXT: vphminposuw %xmm0, %xmm0
-; AVX1-NEXT: vmovd %xmm0, %eax
-; AVX1-NEXT: addb $-128, %al
-; AVX1-NEXT: # kill: def $al killed $al killed $eax
-; AVX1-NEXT: vzeroupper
-; AVX1-NEXT: retq
-;
-; AVX2-LABEL: test_v64i8:
-; AVX2: # %bb.0:
-; AVX2-NEXT: vpminsb %ymm1, %ymm0, %ymm0
-; AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
-; AVX2-NEXT: vpminsb %xmm1, %xmm0, %xmm0
-; AVX2-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
-; AVX2-NEXT: vpsrlw $8, %xmm0, %xmm1
-; AVX2-NEXT: vpminub %xmm1, %xmm0, %xmm0
-; AVX2-NEXT: vphminposuw %xmm0, %xmm0
-; AVX2-NEXT: vmovd %xmm0, %eax
-; AVX2-NEXT: addb $-128, %al
-; AVX2-NEXT: # kill: def $al killed $al killed $eax
-; AVX2-NEXT: vzeroupper
-; AVX2-NEXT: retq
+define i8 @test_v64i8(<64 x i8> %a0) nounwind {
+; X86-SSE2-LABEL: test_v64i8:
+; X86-SSE2: # %bb.0:
+; X86-SSE2-NEXT: pushl %ebp
+; X86-SSE2-NEXT: movl %esp, %ebp
+; X86-SSE2-NEXT: andl $-16, %esp
+; X86-SSE2-NEXT: subl $16, %esp
+; X86-SSE2-NEXT: movdqa 8(%ebp), %xmm4
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm3
+; X86-SSE2-NEXT: pcmpgtb %xmm0, %xmm3
+; X86-SSE2-NEXT: pand %xmm3, %xmm0
+; X86-SSE2-NEXT: pandn %xmm2, %xmm3
+; X86-SSE2-NEXT: por %xmm0, %xmm3
+; X86-SSE2-NEXT: movdqa %xmm4, %xmm0
+; X86-SSE2-NEXT: pcmpgtb %xmm1, %xmm0
+; X86-SSE2-NEXT: pand %xmm0, %xmm1
+; X86-SSE2-NEXT: pandn %xmm4, %xmm0
+; X86-SSE2-NEXT: por %xmm1, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X86-SSE2-NEXT: pcmpgtb %xmm3, %xmm1
+; X86-SSE2-NEXT: pand %xmm1, %xmm3
+; X86-SSE2-NEXT: pandn %xmm0, %xmm1
+; X86-SSE2-NEXT: por %xmm3, %xmm1
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE2-NEXT: pcmpgtb %xmm1, %xmm2
+; X86-SSE2-NEXT: pand %xmm2, %xmm1
+; X86-SSE2-NEXT: pandn %xmm0, %xmm2
+; X86-SSE2-NEXT: por %xmm1, %xmm2
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm2[1,1,1,1]
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE2-NEXT: pcmpgtb %xmm2, %xmm0
+; X86-SSE2-NEXT: pand %xmm0, %xmm2
+; X86-SSE2-NEXT: pandn %xmm1, %xmm0
+; X86-SSE2-NEXT: por %xmm2, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE2-NEXT: psrld $16, %xmm2
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm1
+; X86-SSE2-NEXT: pcmpgtb %xmm0, %xmm1
+; X86-SSE2-NEXT: pand %xmm1, %xmm0
+; X86-SSE2-NEXT: pandn %xmm2, %xmm1
+; X86-SSE2-NEXT: por %xmm0, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE2-NEXT: psrlw $8, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE2-NEXT: pcmpgtb %xmm1, %xmm2
+; X86-SSE2-NEXT: pand %xmm2, %xmm1
+; X86-SSE2-NEXT: pandn %xmm0, %xmm2
+; X86-SSE2-NEXT: por %xmm1, %xmm2
+; X86-SSE2-NEXT: movd %xmm2, %eax
+; X86-SSE2-NEXT: # kill: def $al killed $al killed $eax
+; X86-SSE2-NEXT: movl %ebp, %esp
+; X86-SSE2-NEXT: popl %ebp
+; X86-SSE2-NEXT: retl
+;
+; X64-SSE2-LABEL: test_v64i8:
+; X64-SSE2: # %bb.0:
+; X64-SSE2-NEXT: movdqa %xmm2, %xmm4
+; X64-SSE2-NEXT: pcmpgtb %xmm0, %xmm4
+; X64-SSE2-NEXT: pand %xmm4, %xmm0
+; X64-SSE2-NEXT: pandn %xmm2, %xmm4
+; X64-SSE2-NEXT: por %xmm0, %xmm4
+; X64-SSE2-NEXT: movdqa %xmm3, %xmm0
+; X64-SSE2-NEXT: pcmpgtb %xmm1, %xmm0
+; X64-SSE2-NEXT: pand %xmm0, %xmm1
+; X64-SSE2-NEXT: pandn %xmm3, %xmm0
+; X64-SSE2-NEXT: por %xmm1, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X64-SSE2-NEXT: pcmpgtb %xmm4, %xmm1
+; X64-SSE2-NEXT: pand %xmm1, %xmm4
+; X64-SSE2-NEXT: pandn %xmm0, %xmm1
+; X64-SSE2-NEXT: por %xmm4, %xmm1
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X64-SSE2-NEXT: pcmpgtb %xmm1, %xmm2
+; X64-SSE2-NEXT: pand %xmm2, %xmm1
+; X64-SSE2-NEXT: pandn %xmm0, %xmm2
+; X64-SSE2-NEXT: por %xmm1, %xmm2
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,1,1]
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X64-SSE2-NEXT: pcmpgtb %xmm2, %xmm1
+; X64-SSE2-NEXT: pand %xmm1, %xmm2
+; X64-SSE2-NEXT: pandn %xmm0, %xmm1
+; X64-SSE2-NEXT: por %xmm2, %xmm1
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X64-SSE2-NEXT: psrld $16, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X64-SSE2-NEXT: pcmpgtb %xmm1, %xmm2
+; X64-SSE2-NEXT: pand %xmm2, %xmm1
+; X64-SSE2-NEXT: pandn %xmm0, %xmm2
+; X64-SSE2-NEXT: por %xmm1, %xmm2
+; X64-SSE2-NEXT: movdqa %xmm2, %xmm0
+; X64-SSE2-NEXT: psrlw $8, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X64-SSE2-NEXT: pcmpgtb %xmm2, %xmm1
+; X64-SSE2-NEXT: pand %xmm1, %xmm2
+; X64-SSE2-NEXT: pandn %xmm0, %xmm1
+; X64-SSE2-NEXT: por %xmm2, %xmm1
+; X64-SSE2-NEXT: movd %xmm1, %eax
+; X64-SSE2-NEXT: # kill: def $al killed $al killed $eax
+; X64-SSE2-NEXT: retq
+;
+; X86-SSE4-LABEL: test_v64i8:
+; X86-SSE4: # %bb.0:
+; X86-SSE4-NEXT: pushl %ebp
+; X86-SSE4-NEXT: movl %esp, %ebp
+; X86-SSE4-NEXT: andl $-16, %esp
+; X86-SSE4-NEXT: subl $16, %esp
+; X86-SSE4-NEXT: pminsb %xmm2, %xmm0
+; X86-SSE4-NEXT: pminsb 8(%ebp), %xmm1
+; X86-SSE4-NEXT: pminsb %xmm0, %xmm1
+; X86-SSE4-NEXT: pxor {{\.?LCPI[0-9]+_[0-9]+}}, %xmm1
+; X86-SSE4-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE4-NEXT: psrlw $8, %xmm0
+; X86-SSE4-NEXT: pminub %xmm1, %xmm0
+; X86-SSE4-NEXT: phminposuw %xmm0, %xmm0
+; X86-SSE4-NEXT: movd %xmm0, %eax
+; X86-SSE4-NEXT: addb $-128, %al
+; X86-SSE4-NEXT: # kill: def $al killed $al killed $eax
+; X86-SSE4-NEXT: movl %ebp, %esp
+; X86-SSE4-NEXT: popl %ebp
+; X86-SSE4-NEXT: retl
+;
+; X64-SSE4-LABEL: test_v64i8:
+; X64-SSE4: # %bb.0:
+; X64-SSE4-NEXT: pminsb %xmm3, %xmm1
+; X64-SSE4-NEXT: pminsb %xmm2, %xmm0
+; X64-SSE4-NEXT: pminsb %xmm1, %xmm0
+; X64-SSE4-NEXT: pxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0
+; X64-SSE4-NEXT: movdqa %xmm0, %xmm1
+; X64-SSE4-NEXT: psrlw $8, %xmm1
+; X64-SSE4-NEXT: pminub %xmm0, %xmm1
+; X64-SSE4-NEXT: phminposuw %xmm1, %xmm0
+; X64-SSE4-NEXT: movd %xmm0, %eax
+; X64-SSE4-NEXT: addb $-128, %al
+; X64-SSE4-NEXT: # kill: def $al killed $al killed $eax
+; X64-SSE4-NEXT: retq
+;
+; X86-AVX1-LABEL: test_v64i8:
+; X86-AVX1: # %bb.0:
+; X86-AVX1-NEXT: vextractf128 $1, %ymm1, %xmm2
+; X86-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm3
+; X86-AVX1-NEXT: vpminsb %xmm2, %xmm3, %xmm2
+; X86-AVX1-NEXT: vpminsb %xmm1, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpminsb %xmm2, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpsrlw $8, %xmm0, %xmm1
+; X86-AVX1-NEXT: vpminub %xmm1, %xmm0, %xmm0
+; X86-AVX1-NEXT: vphminposuw %xmm0, %xmm0
+; X86-AVX1-NEXT: vmovd %xmm0, %eax
+; X86-AVX1-NEXT: addb $-128, %al
+; X86-AVX1-NEXT: # kill: def $al killed $al killed $eax
+; X86-AVX1-NEXT: vzeroupper
+; X86-AVX1-NEXT: retl
+;
+; X64-AVX1-LABEL: test_v64i8:
+; X64-AVX1: # %bb.0:
+; X64-AVX1-NEXT: vextractf128 $1, %ymm1, %xmm2
+; X64-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm3
+; X64-AVX1-NEXT: vpminsb %xmm2, %xmm3, %xmm2
+; X64-AVX1-NEXT: vpminsb %xmm1, %xmm0, %xmm0
+; X64-AVX1-NEXT: vpminsb %xmm2, %xmm0, %xmm0
+; X64-AVX1-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
+; X64-AVX1-NEXT: vpsrlw $8, %xmm0, %xmm1
+; X64-AVX1-NEXT: vpminub %xmm1, %xmm0, %xmm0
+; X64-AVX1-NEXT: vphminposuw %xmm0, %xmm0
+; X64-AVX1-NEXT: vmovd %xmm0, %eax
+; X64-AVX1-NEXT: addb $-128, %al
+; X64-AVX1-NEXT: # kill: def $al killed $al killed $eax
+; X64-AVX1-NEXT: vzeroupper
+; X64-AVX1-NEXT: retq
+;
+; X86-AVX2-LABEL: test_v64i8:
+; X86-AVX2: # %bb.0:
+; X86-AVX2-NEXT: vpminsb %ymm1, %ymm0, %ymm0
+; X86-AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
+; X86-AVX2-NEXT: vpminsb %xmm1, %xmm0, %xmm0
+; X86-AVX2-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}, %xmm0, %xmm0
+; X86-AVX2-NEXT: vpsrlw $8, %xmm0, %xmm1
+; X86-AVX2-NEXT: vpminub %xmm1, %xmm0, %xmm0
+; X86-AVX2-NEXT: vphminposuw %xmm0, %xmm0
+; X86-AVX2-NEXT: vmovd %xmm0, %eax
+; X86-AVX2-NEXT: addb $-128, %al
+; X86-AVX2-NEXT: # kill: def $al killed $al killed $eax
+; X86-AVX2-NEXT: vzeroupper
+; X86-AVX2-NEXT: retl
+;
+; X64-AVX2-LABEL: test_v64i8:
+; X64-AVX2: # %bb.0:
+; X64-AVX2-NEXT: vpminsb %ymm1, %ymm0, %ymm0
+; X64-AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
+; X64-AVX2-NEXT: vpminsb %xmm1, %xmm0, %xmm0
+; X64-AVX2-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
+; X64-AVX2-NEXT: vpsrlw $8, %xmm0, %xmm1
+; X64-AVX2-NEXT: vpminub %xmm1, %xmm0, %xmm0
+; X64-AVX2-NEXT: vphminposuw %xmm0, %xmm0
+; X64-AVX2-NEXT: vmovd %xmm0, %eax
+; X64-AVX2-NEXT: addb $-128, %al
+; X64-AVX2-NEXT: # kill: def $al killed $al killed $eax
+; X64-AVX2-NEXT: vzeroupper
+; X64-AVX2-NEXT: retq
;
; AVX512BW-LABEL: test_v64i8:
; AVX512BW: # %bb.0:
@@ -1963,132 +3348,287 @@ define i8 @test_v64i8(<64 x i8> %a0) {
ret i8 %1
}
-define i8 @test_v128i8(<128 x i8> %a0) {
-; SSE2-LABEL: test_v128i8:
-; SSE2: # %bb.0:
-; SSE2-NEXT: movdqa %xmm4, %xmm8
-; SSE2-NEXT: pcmpgtb %xmm0, %xmm8
-; SSE2-NEXT: pand %xmm8, %xmm0
-; SSE2-NEXT: pandn %xmm4, %xmm8
-; SSE2-NEXT: por %xmm0, %xmm8
-; SSE2-NEXT: movdqa %xmm6, %xmm4
-; SSE2-NEXT: pcmpgtb %xmm2, %xmm4
-; SSE2-NEXT: pand %xmm4, %xmm2
-; SSE2-NEXT: pandn %xmm6, %xmm4
-; SSE2-NEXT: por %xmm2, %xmm4
-; SSE2-NEXT: movdqa %xmm4, %xmm0
-; SSE2-NEXT: pcmpgtb %xmm8, %xmm0
-; SSE2-NEXT: pand %xmm0, %xmm8
-; SSE2-NEXT: pandn %xmm4, %xmm0
-; SSE2-NEXT: por %xmm8, %xmm0
-; SSE2-NEXT: movdqa %xmm5, %xmm2
-; SSE2-NEXT: pcmpgtb %xmm1, %xmm2
-; SSE2-NEXT: pand %xmm2, %xmm1
-; SSE2-NEXT: pandn %xmm5, %xmm2
-; SSE2-NEXT: por %xmm1, %xmm2
-; SSE2-NEXT: movdqa %xmm7, %xmm1
-; SSE2-NEXT: pcmpgtb %xmm3, %xmm1
-; SSE2-NEXT: pand %xmm1, %xmm3
-; SSE2-NEXT: pandn %xmm7, %xmm1
-; SSE2-NEXT: por %xmm3, %xmm1
-; SSE2-NEXT: movdqa %xmm1, %xmm3
-; SSE2-NEXT: pcmpgtb %xmm2, %xmm3
-; SSE2-NEXT: pand %xmm3, %xmm2
-; SSE2-NEXT: pandn %xmm1, %xmm3
-; SSE2-NEXT: por %xmm2, %xmm3
-; SSE2-NEXT: movdqa %xmm3, %xmm1
-; SSE2-NEXT: pcmpgtb %xmm0, %xmm1
-; SSE2-NEXT: pand %xmm1, %xmm0
-; SSE2-NEXT: pandn %xmm3, %xmm1
-; SSE2-NEXT: por %xmm0, %xmm1
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
-; SSE2-NEXT: movdqa %xmm0, %xmm2
-; SSE2-NEXT: pcmpgtb %xmm1, %xmm2
-; SSE2-NEXT: pand %xmm2, %xmm1
-; SSE2-NEXT: pandn %xmm0, %xmm2
-; SSE2-NEXT: por %xmm1, %xmm2
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,1,1]
-; SSE2-NEXT: movdqa %xmm0, %xmm1
-; SSE2-NEXT: pcmpgtb %xmm2, %xmm1
-; SSE2-NEXT: pand %xmm1, %xmm2
-; SSE2-NEXT: pandn %xmm0, %xmm1
-; SSE2-NEXT: por %xmm2, %xmm1
-; SSE2-NEXT: movdqa %xmm1, %xmm0
-; SSE2-NEXT: psrld $16, %xmm0
-; SSE2-NEXT: movdqa %xmm0, %xmm2
-; SSE2-NEXT: pcmpgtb %xmm1, %xmm2
-; SSE2-NEXT: pand %xmm2, %xmm1
-; SSE2-NEXT: pandn %xmm0, %xmm2
-; SSE2-NEXT: por %xmm1, %xmm2
-; SSE2-NEXT: movdqa %xmm2, %xmm0
-; SSE2-NEXT: psrlw $8, %xmm0
-; SSE2-NEXT: movdqa %xmm0, %xmm1
-; SSE2-NEXT: pcmpgtb %xmm2, %xmm1
-; SSE2-NEXT: pand %xmm1, %xmm2
-; SSE2-NEXT: pandn %xmm0, %xmm1
-; SSE2-NEXT: por %xmm2, %xmm1
-; SSE2-NEXT: movd %xmm1, %eax
-; SSE2-NEXT: # kill: def $al killed $al killed $eax
-; SSE2-NEXT: retq
-;
-; SSE4-LABEL: test_v128i8:
-; SSE4: # %bb.0:
-; SSE4-NEXT: pminsb %xmm7, %xmm3
-; SSE4-NEXT: pminsb %xmm5, %xmm1
-; SSE4-NEXT: pminsb %xmm3, %xmm1
-; SSE4-NEXT: pminsb %xmm6, %xmm2
-; SSE4-NEXT: pminsb %xmm4, %xmm0
-; SSE4-NEXT: pminsb %xmm2, %xmm0
-; SSE4-NEXT: pminsb %xmm1, %xmm0
-; SSE4-NEXT: pxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0
-; SSE4-NEXT: movdqa %xmm0, %xmm1
-; SSE4-NEXT: psrlw $8, %xmm1
-; SSE4-NEXT: pminub %xmm0, %xmm1
-; SSE4-NEXT: phminposuw %xmm1, %xmm0
-; SSE4-NEXT: movd %xmm0, %eax
-; SSE4-NEXT: addb $-128, %al
-; SSE4-NEXT: # kill: def $al killed $al killed $eax
-; SSE4-NEXT: retq
-;
-; AVX1-LABEL: test_v128i8:
-; AVX1: # %bb.0:
-; AVX1-NEXT: vextractf128 $1, %ymm3, %xmm4
-; AVX1-NEXT: vextractf128 $1, %ymm1, %xmm5
-; AVX1-NEXT: vpminsb %xmm4, %xmm5, %xmm4
-; AVX1-NEXT: vextractf128 $1, %ymm2, %xmm5
-; AVX1-NEXT: vextractf128 $1, %ymm0, %xmm6
-; AVX1-NEXT: vpminsb %xmm5, %xmm6, %xmm5
-; AVX1-NEXT: vpminsb %xmm4, %xmm5, %xmm4
-; AVX1-NEXT: vpminsb %xmm3, %xmm1, %xmm1
-; AVX1-NEXT: vpminsb %xmm2, %xmm0, %xmm0
-; AVX1-NEXT: vpminsb %xmm1, %xmm0, %xmm0
-; AVX1-NEXT: vpminsb %xmm4, %xmm0, %xmm0
-; AVX1-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
-; AVX1-NEXT: vpsrlw $8, %xmm0, %xmm1
-; AVX1-NEXT: vpminub %xmm1, %xmm0, %xmm0
-; AVX1-NEXT: vphminposuw %xmm0, %xmm0
-; AVX1-NEXT: vmovd %xmm0, %eax
-; AVX1-NEXT: addb $-128, %al
-; AVX1-NEXT: # kill: def $al killed $al killed $eax
-; AVX1-NEXT: vzeroupper
-; AVX1-NEXT: retq
-;
-; AVX2-LABEL: test_v128i8:
-; AVX2: # %bb.0:
-; AVX2-NEXT: vpminsb %ymm3, %ymm1, %ymm1
-; AVX2-NEXT: vpminsb %ymm2, %ymm0, %ymm0
-; AVX2-NEXT: vpminsb %ymm1, %ymm0, %ymm0
-; AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
-; AVX2-NEXT: vpminsb %xmm1, %xmm0, %xmm0
-; AVX2-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
-; AVX2-NEXT: vpsrlw $8, %xmm0, %xmm1
-; AVX2-NEXT: vpminub %xmm1, %xmm0, %xmm0
-; AVX2-NEXT: vphminposuw %xmm0, %xmm0
-; AVX2-NEXT: vmovd %xmm0, %eax
-; AVX2-NEXT: addb $-128, %al
-; AVX2-NEXT: # kill: def $al killed $al killed $eax
-; AVX2-NEXT: vzeroupper
-; AVX2-NEXT: retq
+define i8 @test_v128i8(<128 x i8> %a0) nounwind {
+; X86-SSE2-LABEL: test_v128i8:
+; X86-SSE2: # %bb.0:
+; X86-SSE2-NEXT: pushl %ebp
+; X86-SSE2-NEXT: movl %esp, %ebp
+; X86-SSE2-NEXT: andl $-16, %esp
+; X86-SSE2-NEXT: subl $16, %esp
+; X86-SSE2-NEXT: movdqa 24(%ebp), %xmm3
+; X86-SSE2-NEXT: movdqa %xmm3, %xmm4
+; X86-SSE2-NEXT: pcmpgtb %xmm0, %xmm4
+; X86-SSE2-NEXT: pand %xmm4, %xmm0
+; X86-SSE2-NEXT: pandn %xmm3, %xmm4
+; X86-SSE2-NEXT: movdqa 56(%ebp), %xmm3
+; X86-SSE2-NEXT: por %xmm0, %xmm4
+; X86-SSE2-NEXT: movdqa %xmm3, %xmm5
+; X86-SSE2-NEXT: pcmpgtb %xmm2, %xmm5
+; X86-SSE2-NEXT: pand %xmm5, %xmm2
+; X86-SSE2-NEXT: pandn %xmm3, %xmm5
+; X86-SSE2-NEXT: movdqa 8(%ebp), %xmm3
+; X86-SSE2-NEXT: por %xmm2, %xmm5
+; X86-SSE2-NEXT: movdqa %xmm5, %xmm0
+; X86-SSE2-NEXT: pcmpgtb %xmm4, %xmm0
+; X86-SSE2-NEXT: pand %xmm0, %xmm4
+; X86-SSE2-NEXT: pandn %xmm5, %xmm0
+; X86-SSE2-NEXT: movdqa 40(%ebp), %xmm5
+; X86-SSE2-NEXT: por %xmm4, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm5, %xmm2
+; X86-SSE2-NEXT: pcmpgtb %xmm1, %xmm2
+; X86-SSE2-NEXT: pand %xmm2, %xmm1
+; X86-SSE2-NEXT: pandn %xmm5, %xmm2
+; X86-SSE2-NEXT: movdqa 72(%ebp), %xmm4
+; X86-SSE2-NEXT: por %xmm1, %xmm2
+; X86-SSE2-NEXT: movdqa %xmm4, %xmm1
+; X86-SSE2-NEXT: pcmpgtb %xmm3, %xmm1
+; X86-SSE2-NEXT: pand %xmm1, %xmm3
+; X86-SSE2-NEXT: pandn %xmm4, %xmm1
+; X86-SSE2-NEXT: por %xmm3, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm3
+; X86-SSE2-NEXT: pcmpgtb %xmm2, %xmm3
+; X86-SSE2-NEXT: pand %xmm3, %xmm2
+; X86-SSE2-NEXT: pandn %xmm1, %xmm3
+; X86-SSE2-NEXT: por %xmm2, %xmm3
+; X86-SSE2-NEXT: movdqa %xmm3, %xmm1
+; X86-SSE2-NEXT: pcmpgtb %xmm0, %xmm1
+; X86-SSE2-NEXT: pand %xmm1, %xmm0
+; X86-SSE2-NEXT: pandn %xmm3, %xmm1
+; X86-SSE2-NEXT: por %xmm0, %xmm1
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE2-NEXT: pcmpgtb %xmm1, %xmm2
+; X86-SSE2-NEXT: pand %xmm2, %xmm1
+; X86-SSE2-NEXT: pandn %xmm0, %xmm2
+; X86-SSE2-NEXT: por %xmm1, %xmm2
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm2[1,1,1,1]
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE2-NEXT: pcmpgtb %xmm2, %xmm0
+; X86-SSE2-NEXT: pand %xmm0, %xmm2
+; X86-SSE2-NEXT: pandn %xmm1, %xmm0
+; X86-SSE2-NEXT: por %xmm2, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE2-NEXT: psrld $16, %xmm2
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm1
+; X86-SSE2-NEXT: pcmpgtb %xmm0, %xmm1
+; X86-SSE2-NEXT: pand %xmm1, %xmm0
+; X86-SSE2-NEXT: pandn %xmm2, %xmm1
+; X86-SSE2-NEXT: por %xmm0, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE2-NEXT: psrlw $8, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE2-NEXT: pcmpgtb %xmm1, %xmm2
+; X86-SSE2-NEXT: pand %xmm2, %xmm1
+; X86-SSE2-NEXT: pandn %xmm0, %xmm2
+; X86-SSE2-NEXT: por %xmm1, %xmm2
+; X86-SSE2-NEXT: movd %xmm2, %eax
+; X86-SSE2-NEXT: # kill: def $al killed $al killed $eax
+; X86-SSE2-NEXT: movl %ebp, %esp
+; X86-SSE2-NEXT: popl %ebp
+; X86-SSE2-NEXT: retl
+;
+; X64-SSE2-LABEL: test_v128i8:
+; X64-SSE2: # %bb.0:
+; X64-SSE2-NEXT: movdqa %xmm4, %xmm8
+; X64-SSE2-NEXT: pcmpgtb %xmm0, %xmm8
+; X64-SSE2-NEXT: pand %xmm8, %xmm0
+; X64-SSE2-NEXT: pandn %xmm4, %xmm8
+; X64-SSE2-NEXT: por %xmm0, %xmm8
+; X64-SSE2-NEXT: movdqa %xmm6, %xmm4
+; X64-SSE2-NEXT: pcmpgtb %xmm2, %xmm4
+; X64-SSE2-NEXT: pand %xmm4, %xmm2
+; X64-SSE2-NEXT: pandn %xmm6, %xmm4
+; X64-SSE2-NEXT: por %xmm2, %xmm4
+; X64-SSE2-NEXT: movdqa %xmm4, %xmm0
+; X64-SSE2-NEXT: pcmpgtb %xmm8, %xmm0
+; X64-SSE2-NEXT: pand %xmm0, %xmm8
+; X64-SSE2-NEXT: pandn %xmm4, %xmm0
+; X64-SSE2-NEXT: por %xmm8, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm5, %xmm2
+; X64-SSE2-NEXT: pcmpgtb %xmm1, %xmm2
+; X64-SSE2-NEXT: pand %xmm2, %xmm1
+; X64-SSE2-NEXT: pandn %xmm5, %xmm2
+; X64-SSE2-NEXT: por %xmm1, %xmm2
+; X64-SSE2-NEXT: movdqa %xmm7, %xmm1
+; X64-SSE2-NEXT: pcmpgtb %xmm3, %xmm1
+; X64-SSE2-NEXT: pand %xmm1, %xmm3
+; X64-SSE2-NEXT: pandn %xmm7, %xmm1
+; X64-SSE2-NEXT: por %xmm3, %xmm1
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm3
+; X64-SSE2-NEXT: pcmpgtb %xmm2, %xmm3
+; X64-SSE2-NEXT: pand %xmm3, %xmm2
+; X64-SSE2-NEXT: pandn %xmm1, %xmm3
+; X64-SSE2-NEXT: por %xmm2, %xmm3
+; X64-SSE2-NEXT: movdqa %xmm3, %xmm1
+; X64-SSE2-NEXT: pcmpgtb %xmm0, %xmm1
+; X64-SSE2-NEXT: pand %xmm1, %xmm0
+; X64-SSE2-NEXT: pandn %xmm3, %xmm1
+; X64-SSE2-NEXT: por %xmm0, %xmm1
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X64-SSE2-NEXT: pcmpgtb %xmm1, %xmm2
+; X64-SSE2-NEXT: pand %xmm2, %xmm1
+; X64-SSE2-NEXT: pandn %xmm0, %xmm2
+; X64-SSE2-NEXT: por %xmm1, %xmm2
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,1,1]
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X64-SSE2-NEXT: pcmpgtb %xmm2, %xmm1
+; X64-SSE2-NEXT: pand %xmm1, %xmm2
+; X64-SSE2-NEXT: pandn %xmm0, %xmm1
+; X64-SSE2-NEXT: por %xmm2, %xmm1
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X64-SSE2-NEXT: psrld $16, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X64-SSE2-NEXT: pcmpgtb %xmm1, %xmm2
+; X64-SSE2-NEXT: pand %xmm2, %xmm1
+; X64-SSE2-NEXT: pandn %xmm0, %xmm2
+; X64-SSE2-NEXT: por %xmm1, %xmm2
+; X64-SSE2-NEXT: movdqa %xmm2, %xmm0
+; X64-SSE2-NEXT: psrlw $8, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X64-SSE2-NEXT: pcmpgtb %xmm2, %xmm1
+; X64-SSE2-NEXT: pand %xmm1, %xmm2
+; X64-SSE2-NEXT: pandn %xmm0, %xmm1
+; X64-SSE2-NEXT: por %xmm2, %xmm1
+; X64-SSE2-NEXT: movd %xmm1, %eax
+; X64-SSE2-NEXT: # kill: def $al killed $al killed $eax
+; X64-SSE2-NEXT: retq
+;
+; X86-SSE4-LABEL: test_v128i8:
+; X86-SSE4: # %bb.0:
+; X86-SSE4-NEXT: pushl %ebp
+; X86-SSE4-NEXT: movl %esp, %ebp
+; X86-SSE4-NEXT: andl $-16, %esp
+; X86-SSE4-NEXT: subl $16, %esp
+; X86-SSE4-NEXT: movdqa 8(%ebp), %xmm3
+; X86-SSE4-NEXT: pminsb 72(%ebp), %xmm3
+; X86-SSE4-NEXT: pminsb 40(%ebp), %xmm1
+; X86-SSE4-NEXT: pminsb %xmm3, %xmm1
+; X86-SSE4-NEXT: pminsb 56(%ebp), %xmm2
+; X86-SSE4-NEXT: pminsb 24(%ebp), %xmm0
+; X86-SSE4-NEXT: pminsb %xmm2, %xmm0
+; X86-SSE4-NEXT: pminsb %xmm1, %xmm0
+; X86-SSE4-NEXT: pxor {{\.?LCPI[0-9]+_[0-9]+}}, %xmm0
+; X86-SSE4-NEXT: movdqa %xmm0, %xmm1
+; X86-SSE4-NEXT: psrlw $8, %xmm1
+; X86-SSE4-NEXT: pminub %xmm0, %xmm1
+; X86-SSE4-NEXT: phminposuw %xmm1, %xmm0
+; X86-SSE4-NEXT: movd %xmm0, %eax
+; X86-SSE4-NEXT: addb $-128, %al
+; X86-SSE4-NEXT: # kill: def $al killed $al killed $eax
+; X86-SSE4-NEXT: movl %ebp, %esp
+; X86-SSE4-NEXT: popl %ebp
+; X86-SSE4-NEXT: retl
+;
+; X64-SSE4-LABEL: test_v128i8:
+; X64-SSE4: # %bb.0:
+; X64-SSE4-NEXT: pminsb %xmm7, %xmm3
+; X64-SSE4-NEXT: pminsb %xmm5, %xmm1
+; X64-SSE4-NEXT: pminsb %xmm3, %xmm1
+; X64-SSE4-NEXT: pminsb %xmm6, %xmm2
+; X64-SSE4-NEXT: pminsb %xmm4, %xmm0
+; X64-SSE4-NEXT: pminsb %xmm2, %xmm0
+; X64-SSE4-NEXT: pminsb %xmm1, %xmm0
+; X64-SSE4-NEXT: pxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0
+; X64-SSE4-NEXT: movdqa %xmm0, %xmm1
+; X64-SSE4-NEXT: psrlw $8, %xmm1
+; X64-SSE4-NEXT: pminub %xmm0, %xmm1
+; X64-SSE4-NEXT: phminposuw %xmm1, %xmm0
+; X64-SSE4-NEXT: movd %xmm0, %eax
+; X64-SSE4-NEXT: addb $-128, %al
+; X64-SSE4-NEXT: # kill: def $al killed $al killed $eax
+; X64-SSE4-NEXT: retq
+;
+; X86-AVX1-LABEL: test_v128i8:
+; X86-AVX1: # %bb.0:
+; X86-AVX1-NEXT: pushl %ebp
+; X86-AVX1-NEXT: movl %esp, %ebp
+; X86-AVX1-NEXT: andl $-32, %esp
+; X86-AVX1-NEXT: subl $32, %esp
+; X86-AVX1-NEXT: vextractf128 $1, %ymm2, %xmm3
+; X86-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm4
+; X86-AVX1-NEXT: vpminsb %xmm3, %xmm4, %xmm3
+; X86-AVX1-NEXT: vextractf128 $1, %ymm1, %xmm4
+; X86-AVX1-NEXT: vpminsb 24(%ebp), %xmm4, %xmm4
+; X86-AVX1-NEXT: vpminsb %xmm4, %xmm3, %xmm3
+; X86-AVX1-NEXT: vpminsb %xmm2, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpminsb 8(%ebp), %xmm1, %xmm1
+; X86-AVX1-NEXT: vpminsb %xmm1, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpminsb %xmm3, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpsrlw $8, %xmm0, %xmm1
+; X86-AVX1-NEXT: vpminub %xmm1, %xmm0, %xmm0
+; X86-AVX1-NEXT: vphminposuw %xmm0, %xmm0
+; X86-AVX1-NEXT: vmovd %xmm0, %eax
+; X86-AVX1-NEXT: addb $-128, %al
+; X86-AVX1-NEXT: # kill: def $al killed $al killed $eax
+; X86-AVX1-NEXT: movl %ebp, %esp
+; X86-AVX1-NEXT: popl %ebp
+; X86-AVX1-NEXT: vzeroupper
+; X86-AVX1-NEXT: retl
+;
+; X64-AVX1-LABEL: test_v128i8:
+; X64-AVX1: # %bb.0:
+; X64-AVX1-NEXT: vextractf128 $1, %ymm3, %xmm4
+; X64-AVX1-NEXT: vextractf128 $1, %ymm1, %xmm5
+; X64-AVX1-NEXT: vpminsb %xmm4, %xmm5, %xmm4
+; X64-AVX1-NEXT: vextractf128 $1, %ymm2, %xmm5
+; X64-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm6
+; X64-AVX1-NEXT: vpminsb %xmm5, %xmm6, %xmm5
+; X64-AVX1-NEXT: vpminsb %xmm4, %xmm5, %xmm4
+; X64-AVX1-NEXT: vpminsb %xmm3, %xmm1, %xmm1
+; X64-AVX1-NEXT: vpminsb %xmm2, %xmm0, %xmm0
+; X64-AVX1-NEXT: vpminsb %xmm1, %xmm0, %xmm0
+; X64-AVX1-NEXT: vpminsb %xmm4, %xmm0, %xmm0
+; X64-AVX1-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
+; X64-AVX1-NEXT: vpsrlw $8, %xmm0, %xmm1
+; X64-AVX1-NEXT: vpminub %xmm1, %xmm0, %xmm0
+; X64-AVX1-NEXT: vphminposuw %xmm0, %xmm0
+; X64-AVX1-NEXT: vmovd %xmm0, %eax
+; X64-AVX1-NEXT: addb $-128, %al
+; X64-AVX1-NEXT: # kill: def $al killed $al killed $eax
+; X64-AVX1-NEXT: vzeroupper
+; X64-AVX1-NEXT: retq
+;
+; X86-AVX2-LABEL: test_v128i8:
+; X86-AVX2: # %bb.0:
+; X86-AVX2-NEXT: pushl %ebp
+; X86-AVX2-NEXT: movl %esp, %ebp
+; X86-AVX2-NEXT: andl $-32, %esp
+; X86-AVX2-NEXT: subl $32, %esp
+; X86-AVX2-NEXT: vpminsb %ymm2, %ymm0, %ymm0
+; X86-AVX2-NEXT: vpminsb 8(%ebp), %ymm1, %ymm1
+; X86-AVX2-NEXT: vpminsb %ymm1, %ymm0, %ymm0
+; X86-AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
+; X86-AVX2-NEXT: vpminsb %xmm1, %xmm0, %xmm0
+; X86-AVX2-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}, %xmm0, %xmm0
+; X86-AVX2-NEXT: vpsrlw $8, %xmm0, %xmm1
+; X86-AVX2-NEXT: vpminub %xmm1, %xmm0, %xmm0
+; X86-AVX2-NEXT: vphminposuw %xmm0, %xmm0
+; X86-AVX2-NEXT: vmovd %xmm0, %eax
+; X86-AVX2-NEXT: addb $-128, %al
+; X86-AVX2-NEXT: # kill: def $al killed $al killed $eax
+; X86-AVX2-NEXT: movl %ebp, %esp
+; X86-AVX2-NEXT: popl %ebp
+; X86-AVX2-NEXT: vzeroupper
+; X86-AVX2-NEXT: retl
+;
+; X64-AVX2-LABEL: test_v128i8:
+; X64-AVX2: # %bb.0:
+; X64-AVX2-NEXT: vpminsb %ymm3, %ymm1, %ymm1
+; X64-AVX2-NEXT: vpminsb %ymm2, %ymm0, %ymm0
+; X64-AVX2-NEXT: vpminsb %ymm1, %ymm0, %ymm0
+; X64-AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
+; X64-AVX2-NEXT: vpminsb %xmm1, %xmm0, %xmm0
+; X64-AVX2-NEXT: vpxor {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0, %xmm0
+; X64-AVX2-NEXT: vpsrlw $8, %xmm0, %xmm1
+; X64-AVX2-NEXT: vpminub %xmm1, %xmm0, %xmm0
+; X64-AVX2-NEXT: vphminposuw %xmm0, %xmm0
+; X64-AVX2-NEXT: vmovd %xmm0, %eax
+; X64-AVX2-NEXT: addb $-128, %al
+; X64-AVX2-NEXT: # kill: def $al killed $al killed $eax
+; X64-AVX2-NEXT: vzeroupper
+; X64-AVX2-NEXT: retq
;
; AVX512BW-LABEL: test_v128i8:
; AVX512BW: # %bb.0:
diff --git a/llvm/test/CodeGen/X86/vector-reduce-umax.ll b/llvm/test/CodeGen/X86/vector-reduce-umax.ll
index 89e865e470dff..145c27e5eb976 100644
--- a/llvm/test/CodeGen/X86/vector-reduce-umax.ll
+++ b/llvm/test/CodeGen/X86/vector-reduce-umax.ll
@@ -1,80 +1,167 @@
; NOTE: Assertions have been autogenerated by utils/update_llc_test_checks.py
-; RUN: llc < %s -mtriple=x86_64-unknown-unknown -mattr=+sse2 | FileCheck %s --check-prefixes=SSE,SSE2
-; RUN: llc < %s -mtriple=x86_64-unknown-unknown -mattr=+sse4.1 | FileCheck %s --check-prefixes=SSE,SSE4,SSE41
-; RUN: llc < %s -mtriple=x86_64-unknown-unknown -mattr=+sse4.2 | FileCheck %s --check-prefixes=SSE,SSE4,SSE42
-; RUN: llc < %s -mtriple=x86_64-unknown-unknown -mattr=+avx | FileCheck %s --check-prefixes=AVX,AVX1
-; RUN: llc < %s -mtriple=x86_64-unknown-unknown -mattr=+avx2 | FileCheck %s --check-prefixes=AVX,AVX2
-; RUN: llc < %s -mtriple=x86_64-unknown-unknown -mattr=+avx512f,+avx512bw | FileCheck %s --check-prefixes=AVX512,AVX512BW
-; RUN: llc < %s -mtriple=x86_64-unknown-unknown -mattr=+avx512f,+avx512bw,+avx512vl | FileCheck %s --check-prefixes=AVX512,AVX512VL
+; RUN: llc < %s -mtriple=i686-- -mattr=+sse2 | FileCheck %s --check-prefixes=SSE,SSE2,X86-SSE2
+; RUN: llc < %s -mtriple=x86_64-- -mattr=+sse2 | FileCheck %s --check-prefixes=SSE,SSE2,X64-SSE2
+; RUN: llc < %s -mtriple=i686-- -mattr=+sse4.1 | FileCheck %s --check-prefixes=SSE,SSE4,X86-SSE4,X86-SSE41
+; RUN: llc < %s -mtriple=x86_64-- -mattr=+sse4.1 | FileCheck %s --check-prefixes=SSE,SSE4,X64-SSE4,X64-SSE41
+; RUN: llc < %s -mtriple=i686-- -mattr=+sse4.2 | FileCheck %s --check-prefixes=SSE,SSE4,X86-SSE4,X86-SSE42
+; RUN: llc < %s -mtriple=x86_64-- -mattr=+sse4.2 | FileCheck %s --check-prefixes=SSE,SSE4,X64-SSE4,X64-SSE42
+; RUN: llc < %s -mtriple=i686-- -mattr=+avx | FileCheck %s --check-prefixes=AVX,AVX1,X86-AVX1
+; RUN: llc < %s -mtriple=x86_64-- -mattr=+avx | FileCheck %s --check-prefixes=AVX,AVX1,X64-AVX1
+; RUN: llc < %s -mtriple=i686-- -mattr=+avx2 | FileCheck %s --check-prefixes=AVX,AVX2,X86-AVX2
+; RUN: llc < %s -mtriple=x86_64-- -mattr=+avx2 | FileCheck %s --check-prefixes=AVX,AVX2,X64-AVX2
+; RUN: llc < %s -mtriple=x86_64-- -mattr=+avx512f,+avx512bw | FileCheck %s --check-prefixes=AVX,AVX512,AVX512BW
+; RUN: llc < %s -mtriple=x86_64-- -mattr=+avx512f,+avx512bw,+avx512dq,+avx512vl | FileCheck %s --check-prefixes=AVX,AVX512,AVX512VL
;
; vXi64
;
-define i64 @test_v2i64(<2 x i64> %a0) {
-; SSE2-LABEL: test_v2i64:
-; SSE2: # %bb.0:
-; SSE2-NEXT: movq %xmm0, %rcx
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm0[2,3,2,3]
-; SSE2-NEXT: movq %xmm0, %rax
-; SSE2-NEXT: cmpq %rax, %rcx
-; SSE2-NEXT: cmovaq %rcx, %rax
-; SSE2-NEXT: retq
-;
-; SSE41-LABEL: test_v2i64:
-; SSE41: # %bb.0:
-; SSE41-NEXT: movdqa %xmm0, %xmm1
-; SSE41-NEXT: movdqa {{.*#+}} xmm0 = [9223372039002259456,9223372039002259456]
-; SSE41-NEXT: movdqa %xmm1, %xmm2
-; SSE41-NEXT: pxor %xmm0, %xmm2
-; SSE41-NEXT: pshufd {{.*#+}} xmm3 = xmm1[2,3,2,3]
-; SSE41-NEXT: pxor %xmm3, %xmm0
-; SSE41-NEXT: movdqa %xmm2, %xmm4
-; SSE41-NEXT: pcmpgtd %xmm0, %xmm4
-; SSE41-NEXT: pmovsxdq %xmm4, %xmm5
-; SSE41-NEXT: pcmpeqd %xmm2, %xmm0
-; SSE41-NEXT: pshufd {{.*#+}} xmm2 = xmm0[1,1,3,3]
-; SSE41-NEXT: pand %xmm5, %xmm2
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm4[1,1,3,3]
-; SSE41-NEXT: por %xmm2, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm1, %xmm3
-; SSE41-NEXT: movq %xmm3, %rax
-; SSE41-NEXT: retq
-;
-; SSE42-LABEL: test_v2i64:
-; SSE42: # %bb.0:
-; SSE42-NEXT: movdqa %xmm0, %xmm1
-; SSE42-NEXT: movdqa {{.*#+}} xmm2 = [9223372036854775808,9223372036854775808]
-; SSE42-NEXT: pxor %xmm2, %xmm0
-; SSE42-NEXT: pshufd {{.*#+}} xmm3 = xmm1[2,3,2,3]
-; SSE42-NEXT: pxor %xmm3, %xmm2
-; SSE42-NEXT: pcmpgtq %xmm2, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm1, %xmm3
-; SSE42-NEXT: movq %xmm3, %rax
-; SSE42-NEXT: retq
-;
-; AVX1-LABEL: test_v2i64:
-; AVX1: # %bb.0:
-; AVX1-NEXT: vmovddup {{.*#+}} xmm1 = [9223372036854775808,9223372036854775808]
-; AVX1-NEXT: # xmm1 = mem[0,0]
-; AVX1-NEXT: vpxor %xmm1, %xmm0, %xmm2
-; AVX1-NEXT: vpshufd {{.*#+}} xmm3 = xmm0[2,3,2,3]
-; AVX1-NEXT: vpxor %xmm1, %xmm3, %xmm1
-; AVX1-NEXT: vpcmpgtq %xmm1, %xmm2, %xmm1
-; AVX1-NEXT: vblendvpd %xmm1, %xmm0, %xmm3, %xmm0
-; AVX1-NEXT: vmovq %xmm0, %rax
-; AVX1-NEXT: retq
-;
-; AVX2-LABEL: test_v2i64:
-; AVX2: # %bb.0:
-; AVX2-NEXT: vpbroadcastq {{.*#+}} xmm1 = [9223372036854775808,9223372036854775808]
-; AVX2-NEXT: vpxor %xmm1, %xmm0, %xmm2
-; AVX2-NEXT: vpshufd {{.*#+}} xmm3 = xmm0[2,3,2,3]
-; AVX2-NEXT: vpxor %xmm1, %xmm3, %xmm1
-; AVX2-NEXT: vpcmpgtq %xmm1, %xmm2, %xmm1
-; AVX2-NEXT: vblendvpd %xmm1, %xmm0, %xmm3, %xmm0
-; AVX2-NEXT: vmovq %xmm0, %rax
-; AVX2-NEXT: retq
+define i64 @test_v2i64(<2 x i64> %a0) nounwind {
+; X86-SSE2-LABEL: test_v2i64:
+; X86-SSE2: # %bb.0:
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-SSE2-NEXT: movdqa {{.*#+}} xmm2 = [2147483648,2147483648,2147483648,2147483648]
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm3
+; X86-SSE2-NEXT: pxor %xmm2, %xmm3
+; X86-SSE2-NEXT: pxor %xmm1, %xmm2
+; X86-SSE2-NEXT: movdqa %xmm3, %xmm4
+; X86-SSE2-NEXT: pcmpgtd %xmm2, %xmm4
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm5 = xmm4[0,0,2,2]
+; X86-SSE2-NEXT: pcmpeqd %xmm3, %xmm2
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm2[1,1,3,3]
+; X86-SSE2-NEXT: pand %xmm5, %xmm2
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm3 = xmm4[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm2, %xmm3
+; X86-SSE2-NEXT: pand %xmm3, %xmm0
+; X86-SSE2-NEXT: pandn %xmm1, %xmm3
+; X86-SSE2-NEXT: por %xmm0, %xmm3
+; X86-SSE2-NEXT: movd %xmm3, %eax
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm3[1,1,1,1]
+; X86-SSE2-NEXT: movd %xmm0, %edx
+; X86-SSE2-NEXT: retl
+;
+; X64-SSE2-LABEL: test_v2i64:
+; X64-SSE2: # %bb.0:
+; X64-SSE2-NEXT: movq %xmm0, %rcx
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm0[2,3,2,3]
+; X64-SSE2-NEXT: movq %xmm0, %rax
+; X64-SSE2-NEXT: cmpq %rax, %rcx
+; X64-SSE2-NEXT: cmovaq %rcx, %rax
+; X64-SSE2-NEXT: retq
+;
+; X86-SSE41-LABEL: test_v2i64:
+; X86-SSE41: # %bb.0:
+; X86-SSE41-NEXT: movdqa %xmm0, %xmm1
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm2 = xmm0[2,3,2,3]
+; X86-SSE41-NEXT: movdqa {{.*#+}} xmm0 = [2147483648,2147483648,2147483648,2147483648]
+; X86-SSE41-NEXT: movdqa %xmm1, %xmm3
+; X86-SSE41-NEXT: pxor %xmm0, %xmm3
+; X86-SSE41-NEXT: pxor %xmm2, %xmm0
+; X86-SSE41-NEXT: movdqa %xmm3, %xmm4
+; X86-SSE41-NEXT: pcmpgtd %xmm0, %xmm4
+; X86-SSE41-NEXT: pmovsxdq %xmm4, %xmm5
+; X86-SSE41-NEXT: pcmpeqd %xmm3, %xmm0
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm3 = xmm0[1,1,3,3]
+; X86-SSE41-NEXT: pand %xmm5, %xmm3
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm4[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm3, %xmm0
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm1, %xmm2
+; X86-SSE41-NEXT: movd %xmm2, %eax
+; X86-SSE41-NEXT: pextrd $1, %xmm2, %edx
+; X86-SSE41-NEXT: retl
+;
+; X64-SSE41-LABEL: test_v2i64:
+; X64-SSE41: # %bb.0:
+; X64-SSE41-NEXT: movdqa %xmm0, %xmm1
+; X64-SSE41-NEXT: movdqa {{.*#+}} xmm0 = [9223372039002259456,9223372039002259456]
+; X64-SSE41-NEXT: movdqa %xmm1, %xmm2
+; X64-SSE41-NEXT: pxor %xmm0, %xmm2
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm3 = xmm1[2,3,2,3]
+; X64-SSE41-NEXT: pxor %xmm3, %xmm0
+; X64-SSE41-NEXT: movdqa %xmm2, %xmm4
+; X64-SSE41-NEXT: pcmpgtd %xmm0, %xmm4
+; X64-SSE41-NEXT: pmovsxdq %xmm4, %xmm5
+; X64-SSE41-NEXT: pcmpeqd %xmm2, %xmm0
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm2 = xmm0[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm5, %xmm2
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm4[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm2, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm1, %xmm3
+; X64-SSE41-NEXT: movq %xmm3, %rax
+; X64-SSE41-NEXT: retq
+;
+; X86-SSE42-LABEL: test_v2i64:
+; X86-SSE42: # %bb.0:
+; X86-SSE42-NEXT: movdqa %xmm0, %xmm1
+; X86-SSE42-NEXT: pshufd {{.*#+}} xmm2 = xmm0[2,3,2,3]
+; X86-SSE42-NEXT: movdqa {{.*#+}} xmm3 = [0,2147483648,0,2147483648]
+; X86-SSE42-NEXT: pxor %xmm3, %xmm0
+; X86-SSE42-NEXT: pxor %xmm2, %xmm3
+; X86-SSE42-NEXT: pcmpgtq %xmm3, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm1, %xmm2
+; X86-SSE42-NEXT: movd %xmm2, %eax
+; X86-SSE42-NEXT: pextrd $1, %xmm2, %edx
+; X86-SSE42-NEXT: retl
+;
+; X64-SSE42-LABEL: test_v2i64:
+; X64-SSE42: # %bb.0:
+; X64-SSE42-NEXT: movdqa %xmm0, %xmm1
+; X64-SSE42-NEXT: movdqa {{.*#+}} xmm2 = [9223372036854775808,9223372036854775808]
+; X64-SSE42-NEXT: pxor %xmm2, %xmm0
+; X64-SSE42-NEXT: pshufd {{.*#+}} xmm3 = xmm1[2,3,2,3]
+; X64-SSE42-NEXT: pxor %xmm3, %xmm2
+; X64-SSE42-NEXT: pcmpgtq %xmm2, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm1, %xmm3
+; X64-SSE42-NEXT: movq %xmm3, %rax
+; X64-SSE42-NEXT: retq
+;
+; X86-AVX1-LABEL: test_v2i64:
+; X86-AVX1: # %bb.0:
+; X86-AVX1-NEXT: vshufps {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-AVX1-NEXT: vmovddup {{.*#+}} xmm2 = [0,2147483648,0,2147483648]
+; X86-AVX1-NEXT: # xmm2 = mem[0,0]
+; X86-AVX1-NEXT: vxorps %xmm2, %xmm0, %xmm3
+; X86-AVX1-NEXT: vxorps %xmm2, %xmm1, %xmm2
+; X86-AVX1-NEXT: vpcmpgtq %xmm2, %xmm3, %xmm2
+; X86-AVX1-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X86-AVX1-NEXT: vmovd %xmm0, %eax
+; X86-AVX1-NEXT: vpextrd $1, %xmm0, %edx
+; X86-AVX1-NEXT: retl
+;
+; X64-AVX1-LABEL: test_v2i64:
+; X64-AVX1: # %bb.0:
+; X64-AVX1-NEXT: vmovddup {{.*#+}} xmm1 = [9223372036854775808,9223372036854775808]
+; X64-AVX1-NEXT: # xmm1 = mem[0,0]
+; X64-AVX1-NEXT: vpxor %xmm1, %xmm0, %xmm2
+; X64-AVX1-NEXT: vpshufd {{.*#+}} xmm3 = xmm0[2,3,2,3]
+; X64-AVX1-NEXT: vpxor %xmm1, %xmm3, %xmm1
+; X64-AVX1-NEXT: vpcmpgtq %xmm1, %xmm2, %xmm1
+; X64-AVX1-NEXT: vblendvpd %xmm1, %xmm0, %xmm3, %xmm0
+; X64-AVX1-NEXT: vmovq %xmm0, %rax
+; X64-AVX1-NEXT: retq
+;
+; X86-AVX2-LABEL: test_v2i64:
+; X86-AVX2: # %bb.0:
+; X86-AVX2-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-AVX2-NEXT: vpbroadcastq {{.*#+}} xmm2 = [0,2147483648,0,2147483648]
+; X86-AVX2-NEXT: vpxor %xmm2, %xmm0, %xmm3
+; X86-AVX2-NEXT: vpxor %xmm2, %xmm1, %xmm2
+; X86-AVX2-NEXT: vpcmpgtq %xmm2, %xmm3, %xmm2
+; X86-AVX2-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X86-AVX2-NEXT: vmovd %xmm0, %eax
+; X86-AVX2-NEXT: vpextrd $1, %xmm0, %edx
+; X86-AVX2-NEXT: retl
+;
+; X64-AVX2-LABEL: test_v2i64:
+; X64-AVX2: # %bb.0:
+; X64-AVX2-NEXT: vpbroadcastq {{.*#+}} xmm1 = [9223372036854775808,9223372036854775808]
+; X64-AVX2-NEXT: vpxor %xmm1, %xmm0, %xmm2
+; X64-AVX2-NEXT: vpshufd {{.*#+}} xmm3 = xmm0[2,3,2,3]
+; X64-AVX2-NEXT: vpxor %xmm1, %xmm3, %xmm1
+; X64-AVX2-NEXT: vpcmpgtq %xmm1, %xmm2, %xmm1
+; X64-AVX2-NEXT: vblendvpd %xmm1, %xmm0, %xmm3, %xmm0
+; X64-AVX2-NEXT: vmovq %xmm0, %rax
+; X64-AVX2-NEXT: retq
;
; AVX512BW-LABEL: test_v2i64:
; AVX512BW: # %bb.0:
@@ -95,116 +182,244 @@ define i64 @test_v2i64(<2 x i64> %a0) {
ret i64 %1
}
-define i64 @test_v4i64(<4 x i64> %a0) {
-; SSE2-LABEL: test_v4i64:
-; SSE2: # %bb.0:
-; SSE2-NEXT: movdqa {{.*#+}} xmm2 = [9223372039002259456,9223372039002259456]
-; SSE2-NEXT: movdqa %xmm1, %xmm3
-; SSE2-NEXT: pxor %xmm2, %xmm3
-; SSE2-NEXT: pxor %xmm0, %xmm2
-; SSE2-NEXT: movdqa %xmm2, %xmm4
-; SSE2-NEXT: pcmpgtd %xmm3, %xmm4
-; SSE2-NEXT: pshufd {{.*#+}} xmm5 = xmm4[0,0,2,2]
-; SSE2-NEXT: pcmpeqd %xmm3, %xmm2
-; SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm2[1,1,3,3]
-; SSE2-NEXT: pand %xmm5, %xmm2
-; SSE2-NEXT: pshufd {{.*#+}} xmm3 = xmm4[1,1,3,3]
-; SSE2-NEXT: por %xmm2, %xmm3
-; SSE2-NEXT: pand %xmm3, %xmm0
-; SSE2-NEXT: pandn %xmm1, %xmm3
-; SSE2-NEXT: por %xmm0, %xmm3
-; SSE2-NEXT: movq %xmm3, %rcx
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm3[2,3,2,3]
-; SSE2-NEXT: movq %xmm0, %rax
-; SSE2-NEXT: cmpq %rax, %rcx
-; SSE2-NEXT: cmovaq %rcx, %rax
-; SSE2-NEXT: retq
-;
-; SSE41-LABEL: test_v4i64:
-; SSE41: # %bb.0:
-; SSE41-NEXT: movdqa %xmm0, %xmm2
-; SSE41-NEXT: movdqa {{.*#+}} xmm3 = [9223372039002259456,9223372039002259456]
-; SSE41-NEXT: movdqa %xmm1, %xmm0
-; SSE41-NEXT: pxor %xmm3, %xmm0
-; SSE41-NEXT: movdqa %xmm2, %xmm4
-; SSE41-NEXT: pxor %xmm3, %xmm4
-; SSE41-NEXT: movdqa %xmm4, %xmm5
-; SSE41-NEXT: pcmpgtd %xmm0, %xmm5
-; SSE41-NEXT: pshufd {{.*#+}} xmm6 = xmm5[0,0,2,2]
-; SSE41-NEXT: pcmpeqd %xmm0, %xmm4
-; SSE41-NEXT: pshufd {{.*#+}} xmm4 = xmm4[1,1,3,3]
-; SSE41-NEXT: pand %xmm6, %xmm4
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm5[1,1,3,3]
-; SSE41-NEXT: por %xmm4, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm2, %xmm1
-; SSE41-NEXT: movapd %xmm1, %xmm0
-; SSE41-NEXT: xorpd %xmm3, %xmm0
-; SSE41-NEXT: pshufd {{.*#+}} xmm2 = xmm1[2,3,2,3]
-; SSE41-NEXT: pxor %xmm2, %xmm3
-; SSE41-NEXT: movapd %xmm0, %xmm4
-; SSE41-NEXT: pcmpgtd %xmm3, %xmm4
-; SSE41-NEXT: pmovsxdq %xmm4, %xmm5
-; SSE41-NEXT: pcmpeqd %xmm0, %xmm3
-; SSE41-NEXT: pshufd {{.*#+}} xmm3 = xmm3[1,1,3,3]
-; SSE41-NEXT: pand %xmm5, %xmm3
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm4[1,1,3,3]
-; SSE41-NEXT: por %xmm3, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm1, %xmm2
-; SSE41-NEXT: movq %xmm2, %rax
-; SSE41-NEXT: retq
-;
-; SSE42-LABEL: test_v4i64:
-; SSE42: # %bb.0:
-; SSE42-NEXT: movdqa %xmm0, %xmm2
-; SSE42-NEXT: movdqa {{.*#+}} xmm3 = [9223372036854775808,9223372036854775808]
-; SSE42-NEXT: movdqa %xmm1, %xmm4
-; SSE42-NEXT: pxor %xmm3, %xmm4
-; SSE42-NEXT: pxor %xmm3, %xmm0
-; SSE42-NEXT: pcmpgtq %xmm4, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm2, %xmm1
-; SSE42-NEXT: movapd %xmm1, %xmm0
-; SSE42-NEXT: xorpd %xmm3, %xmm0
-; SSE42-NEXT: pshufd {{.*#+}} xmm2 = xmm1[2,3,2,3]
-; SSE42-NEXT: pxor %xmm2, %xmm3
-; SSE42-NEXT: pcmpgtq %xmm3, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm1, %xmm2
-; SSE42-NEXT: movq %xmm2, %rax
-; SSE42-NEXT: retq
-;
-; AVX1-LABEL: test_v4i64:
-; AVX1: # %bb.0:
-; AVX1-NEXT: vextractf128 $1, %ymm0, %xmm1
-; AVX1-NEXT: vmovddup {{.*#+}} xmm2 = [9223372036854775808,9223372036854775808]
-; AVX1-NEXT: # xmm2 = mem[0,0]
-; AVX1-NEXT: vpxor %xmm2, %xmm1, %xmm3
-; AVX1-NEXT: vpxor %xmm2, %xmm0, %xmm4
-; AVX1-NEXT: vpcmpgtq %xmm3, %xmm4, %xmm3
-; AVX1-NEXT: vblendvpd %xmm3, %xmm0, %xmm1, %xmm0
-; AVX1-NEXT: vxorpd %xmm2, %xmm0, %xmm1
-; AVX1-NEXT: vshufps {{.*#+}} xmm3 = xmm0[2,3,2,3]
-; AVX1-NEXT: vxorpd %xmm2, %xmm3, %xmm2
-; AVX1-NEXT: vpcmpgtq %xmm2, %xmm1, %xmm1
-; AVX1-NEXT: vblendvpd %xmm1, %xmm0, %xmm3, %xmm0
-; AVX1-NEXT: vmovq %xmm0, %rax
-; AVX1-NEXT: vzeroupper
-; AVX1-NEXT: retq
-;
-; AVX2-LABEL: test_v4i64:
-; AVX2: # %bb.0:
-; AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
-; AVX2-NEXT: vpbroadcastq {{.*#+}} xmm2 = [9223372036854775808,9223372036854775808]
-; AVX2-NEXT: vpxor %xmm2, %xmm1, %xmm3
-; AVX2-NEXT: vpxor %xmm2, %xmm0, %xmm4
-; AVX2-NEXT: vpcmpgtq %xmm3, %xmm4, %xmm3
-; AVX2-NEXT: vblendvpd %xmm3, %xmm0, %xmm1, %xmm0
-; AVX2-NEXT: vxorpd %xmm2, %xmm0, %xmm1
-; AVX2-NEXT: vshufps {{.*#+}} xmm3 = xmm0[2,3,2,3]
-; AVX2-NEXT: vxorpd %xmm2, %xmm3, %xmm2
-; AVX2-NEXT: vpcmpgtq %xmm2, %xmm1, %xmm1
-; AVX2-NEXT: vblendvpd %xmm1, %xmm0, %xmm3, %xmm0
-; AVX2-NEXT: vmovq %xmm0, %rax
-; AVX2-NEXT: vzeroupper
-; AVX2-NEXT: retq
+define i64 @test_v4i64(<4 x i64> %a0) nounwind {
+; X86-SSE2-LABEL: test_v4i64:
+; X86-SSE2: # %bb.0:
+; X86-SSE2-NEXT: movdqa {{.*#+}} xmm2 = [2147483648,2147483648,2147483648,2147483648]
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm3
+; X86-SSE2-NEXT: pxor %xmm2, %xmm3
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm4
+; X86-SSE2-NEXT: pxor %xmm2, %xmm4
+; X86-SSE2-NEXT: movdqa %xmm4, %xmm5
+; X86-SSE2-NEXT: pcmpgtd %xmm3, %xmm5
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm6 = xmm5[0,0,2,2]
+; X86-SSE2-NEXT: pcmpeqd %xmm3, %xmm4
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm4 = xmm4[1,1,3,3]
+; X86-SSE2-NEXT: pand %xmm6, %xmm4
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm3 = xmm5[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm4, %xmm3
+; X86-SSE2-NEXT: pand %xmm3, %xmm0
+; X86-SSE2-NEXT: pandn %xmm1, %xmm3
+; X86-SSE2-NEXT: por %xmm0, %xmm3
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm3[2,3,2,3]
+; X86-SSE2-NEXT: movdqa %xmm3, %xmm1
+; X86-SSE2-NEXT: pxor %xmm2, %xmm1
+; X86-SSE2-NEXT: pxor %xmm0, %xmm2
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm4
+; X86-SSE2-NEXT: pcmpgtd %xmm2, %xmm4
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm5 = xmm4[0,0,2,2]
+; X86-SSE2-NEXT: pcmpeqd %xmm1, %xmm2
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm2[1,1,3,3]
+; X86-SSE2-NEXT: pand %xmm5, %xmm1
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm4[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm1, %xmm2
+; X86-SSE2-NEXT: pand %xmm2, %xmm3
+; X86-SSE2-NEXT: pandn %xmm0, %xmm2
+; X86-SSE2-NEXT: por %xmm3, %xmm2
+; X86-SSE2-NEXT: movd %xmm2, %eax
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,1,1]
+; X86-SSE2-NEXT: movd %xmm0, %edx
+; X86-SSE2-NEXT: retl
+;
+; X64-SSE2-LABEL: test_v4i64:
+; X64-SSE2: # %bb.0:
+; X64-SSE2-NEXT: movdqa {{.*#+}} xmm2 = [9223372039002259456,9223372039002259456]
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm3
+; X64-SSE2-NEXT: pxor %xmm2, %xmm3
+; X64-SSE2-NEXT: pxor %xmm0, %xmm2
+; X64-SSE2-NEXT: movdqa %xmm2, %xmm4
+; X64-SSE2-NEXT: pcmpgtd %xmm3, %xmm4
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm5 = xmm4[0,0,2,2]
+; X64-SSE2-NEXT: pcmpeqd %xmm3, %xmm2
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm2[1,1,3,3]
+; X64-SSE2-NEXT: pand %xmm5, %xmm2
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm3 = xmm4[1,1,3,3]
+; X64-SSE2-NEXT: por %xmm2, %xmm3
+; X64-SSE2-NEXT: pand %xmm3, %xmm0
+; X64-SSE2-NEXT: pandn %xmm1, %xmm3
+; X64-SSE2-NEXT: por %xmm0, %xmm3
+; X64-SSE2-NEXT: movq %xmm3, %rcx
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm3[2,3,2,3]
+; X64-SSE2-NEXT: movq %xmm0, %rax
+; X64-SSE2-NEXT: cmpq %rax, %rcx
+; X64-SSE2-NEXT: cmovaq %rcx, %rax
+; X64-SSE2-NEXT: retq
+;
+; X86-SSE41-LABEL: test_v4i64:
+; X86-SSE41: # %bb.0:
+; X86-SSE41-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE41-NEXT: movdqa {{.*#+}} xmm3 = [2147483648,2147483648,2147483648,2147483648]
+; X86-SSE41-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE41-NEXT: pxor %xmm3, %xmm0
+; X86-SSE41-NEXT: movdqa %xmm2, %xmm4
+; X86-SSE41-NEXT: pxor %xmm3, %xmm4
+; X86-SSE41-NEXT: movdqa %xmm4, %xmm5
+; X86-SSE41-NEXT: pcmpgtd %xmm0, %xmm5
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm6 = xmm5[0,0,2,2]
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm4
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm4 = xmm4[1,1,3,3]
+; X86-SSE41-NEXT: pand %xmm6, %xmm4
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm5[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm4, %xmm0
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm2, %xmm1
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm2 = xmm1[2,3,2,3]
+; X86-SSE41-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE41-NEXT: pxor %xmm3, %xmm0
+; X86-SSE41-NEXT: pxor %xmm2, %xmm3
+; X86-SSE41-NEXT: movdqa %xmm0, %xmm4
+; X86-SSE41-NEXT: pcmpgtd %xmm3, %xmm4
+; X86-SSE41-NEXT: pmovsxdq %xmm4, %xmm5
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm3
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm3 = xmm3[1,1,3,3]
+; X86-SSE41-NEXT: pand %xmm5, %xmm3
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm4[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm3, %xmm0
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm1, %xmm2
+; X86-SSE41-NEXT: movd %xmm2, %eax
+; X86-SSE41-NEXT: pextrd $1, %xmm2, %edx
+; X86-SSE41-NEXT: retl
+;
+; X64-SSE41-LABEL: test_v4i64:
+; X64-SSE41: # %bb.0:
+; X64-SSE41-NEXT: movdqa %xmm0, %xmm2
+; X64-SSE41-NEXT: movdqa {{.*#+}} xmm3 = [9223372039002259456,9223372039002259456]
+; X64-SSE41-NEXT: movdqa %xmm1, %xmm0
+; X64-SSE41-NEXT: pxor %xmm3, %xmm0
+; X64-SSE41-NEXT: movdqa %xmm2, %xmm4
+; X64-SSE41-NEXT: pxor %xmm3, %xmm4
+; X64-SSE41-NEXT: movdqa %xmm4, %xmm5
+; X64-SSE41-NEXT: pcmpgtd %xmm0, %xmm5
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm6 = xmm5[0,0,2,2]
+; X64-SSE41-NEXT: pcmpeqd %xmm0, %xmm4
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm4 = xmm4[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm6, %xmm4
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm5[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm4, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm2, %xmm1
+; X64-SSE41-NEXT: movapd %xmm1, %xmm0
+; X64-SSE41-NEXT: xorpd %xmm3, %xmm0
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm2 = xmm1[2,3,2,3]
+; X64-SSE41-NEXT: pxor %xmm2, %xmm3
+; X64-SSE41-NEXT: movapd %xmm0, %xmm4
+; X64-SSE41-NEXT: pcmpgtd %xmm3, %xmm4
+; X64-SSE41-NEXT: pmovsxdq %xmm4, %xmm5
+; X64-SSE41-NEXT: pcmpeqd %xmm0, %xmm3
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm3 = xmm3[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm5, %xmm3
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm4[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm3, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm1, %xmm2
+; X64-SSE41-NEXT: movq %xmm2, %rax
+; X64-SSE41-NEXT: retq
+;
+; X86-SSE42-LABEL: test_v4i64:
+; X86-SSE42: # %bb.0:
+; X86-SSE42-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE42-NEXT: movdqa {{.*#+}} xmm3 = [0,2147483648,0,2147483648]
+; X86-SSE42-NEXT: movdqa %xmm1, %xmm4
+; X86-SSE42-NEXT: pxor %xmm3, %xmm4
+; X86-SSE42-NEXT: pxor %xmm3, %xmm0
+; X86-SSE42-NEXT: pcmpgtq %xmm4, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm2, %xmm1
+; X86-SSE42-NEXT: pshufd {{.*#+}} xmm2 = xmm1[2,3,2,3]
+; X86-SSE42-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE42-NEXT: pxor %xmm3, %xmm0
+; X86-SSE42-NEXT: pxor %xmm2, %xmm3
+; X86-SSE42-NEXT: pcmpgtq %xmm3, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm1, %xmm2
+; X86-SSE42-NEXT: movd %xmm2, %eax
+; X86-SSE42-NEXT: pextrd $1, %xmm2, %edx
+; X86-SSE42-NEXT: retl
+;
+; X64-SSE42-LABEL: test_v4i64:
+; X64-SSE42: # %bb.0:
+; X64-SSE42-NEXT: movdqa %xmm0, %xmm2
+; X64-SSE42-NEXT: movdqa {{.*#+}} xmm3 = [9223372036854775808,9223372036854775808]
+; X64-SSE42-NEXT: movdqa %xmm1, %xmm4
+; X64-SSE42-NEXT: pxor %xmm3, %xmm4
+; X64-SSE42-NEXT: pxor %xmm3, %xmm0
+; X64-SSE42-NEXT: pcmpgtq %xmm4, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm2, %xmm1
+; X64-SSE42-NEXT: movapd %xmm1, %xmm0
+; X64-SSE42-NEXT: xorpd %xmm3, %xmm0
+; X64-SSE42-NEXT: pshufd {{.*#+}} xmm2 = xmm1[2,3,2,3]
+; X64-SSE42-NEXT: pxor %xmm2, %xmm3
+; X64-SSE42-NEXT: pcmpgtq %xmm3, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm1, %xmm2
+; X64-SSE42-NEXT: movq %xmm2, %rax
+; X64-SSE42-NEXT: retq
+;
+; X86-AVX1-LABEL: test_v4i64:
+; X86-AVX1: # %bb.0:
+; X86-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm1
+; X86-AVX1-NEXT: vmovddup {{.*#+}} xmm2 = [0,2147483648,0,2147483648]
+; X86-AVX1-NEXT: # xmm2 = mem[0,0]
+; X86-AVX1-NEXT: vxorps %xmm2, %xmm1, %xmm3
+; X86-AVX1-NEXT: vxorps %xmm2, %xmm0, %xmm4
+; X86-AVX1-NEXT: vpcmpgtq %xmm3, %xmm4, %xmm3
+; X86-AVX1-NEXT: vblendvpd %xmm3, %xmm0, %xmm1, %xmm0
+; X86-AVX1-NEXT: vshufps {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-AVX1-NEXT: vxorpd %xmm2, %xmm0, %xmm3
+; X86-AVX1-NEXT: vxorpd %xmm2, %xmm1, %xmm2
+; X86-AVX1-NEXT: vpcmpgtq %xmm2, %xmm3, %xmm2
+; X86-AVX1-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X86-AVX1-NEXT: vmovd %xmm0, %eax
+; X86-AVX1-NEXT: vpextrd $1, %xmm0, %edx
+; X86-AVX1-NEXT: vzeroupper
+; X86-AVX1-NEXT: retl
+;
+; X64-AVX1-LABEL: test_v4i64:
+; X64-AVX1: # %bb.0:
+; X64-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm1
+; X64-AVX1-NEXT: vmovddup {{.*#+}} xmm2 = [9223372036854775808,9223372036854775808]
+; X64-AVX1-NEXT: # xmm2 = mem[0,0]
+; X64-AVX1-NEXT: vpxor %xmm2, %xmm1, %xmm3
+; X64-AVX1-NEXT: vpxor %xmm2, %xmm0, %xmm4
+; X64-AVX1-NEXT: vpcmpgtq %xmm3, %xmm4, %xmm3
+; X64-AVX1-NEXT: vblendvpd %xmm3, %xmm0, %xmm1, %xmm0
+; X64-AVX1-NEXT: vxorpd %xmm2, %xmm0, %xmm1
+; X64-AVX1-NEXT: vshufps {{.*#+}} xmm3 = xmm0[2,3,2,3]
+; X64-AVX1-NEXT: vxorpd %xmm2, %xmm3, %xmm2
+; X64-AVX1-NEXT: vpcmpgtq %xmm2, %xmm1, %xmm1
+; X64-AVX1-NEXT: vblendvpd %xmm1, %xmm0, %xmm3, %xmm0
+; X64-AVX1-NEXT: vmovq %xmm0, %rax
+; X64-AVX1-NEXT: vzeroupper
+; X64-AVX1-NEXT: retq
+;
+; X86-AVX2-LABEL: test_v4i64:
+; X86-AVX2: # %bb.0:
+; X86-AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
+; X86-AVX2-NEXT: vpbroadcastq {{.*#+}} xmm2 = [0,2147483648,0,2147483648]
+; X86-AVX2-NEXT: vpxor %xmm2, %xmm1, %xmm3
+; X86-AVX2-NEXT: vpxor %xmm2, %xmm0, %xmm4
+; X86-AVX2-NEXT: vpcmpgtq %xmm3, %xmm4, %xmm3
+; X86-AVX2-NEXT: vblendvpd %xmm3, %xmm0, %xmm1, %xmm0
+; X86-AVX2-NEXT: vshufps {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-AVX2-NEXT: vxorpd %xmm2, %xmm0, %xmm3
+; X86-AVX2-NEXT: vxorpd %xmm2, %xmm1, %xmm2
+; X86-AVX2-NEXT: vpcmpgtq %xmm2, %xmm3, %xmm2
+; X86-AVX2-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X86-AVX2-NEXT: vmovd %xmm0, %eax
+; X86-AVX2-NEXT: vpextrd $1, %xmm0, %edx
+; X86-AVX2-NEXT: vzeroupper
+; X86-AVX2-NEXT: retl
+;
+; X64-AVX2-LABEL: test_v4i64:
+; X64-AVX2: # %bb.0:
+; X64-AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
+; X64-AVX2-NEXT: vpbroadcastq {{.*#+}} xmm2 = [9223372036854775808,9223372036854775808]
+; X64-AVX2-NEXT: vpxor %xmm2, %xmm1, %xmm3
+; X64-AVX2-NEXT: vpxor %xmm2, %xmm0, %xmm4
+; X64-AVX2-NEXT: vpcmpgtq %xmm3, %xmm4, %xmm3
+; X64-AVX2-NEXT: vblendvpd %xmm3, %xmm0, %xmm1, %xmm0
+; X64-AVX2-NEXT: vxorpd %xmm2, %xmm0, %xmm1
+; X64-AVX2-NEXT: vshufps {{.*#+}} xmm3 = xmm0[2,3,2,3]
+; X64-AVX2-NEXT: vxorpd %xmm2, %xmm3, %xmm2
+; X64-AVX2-NEXT: vpcmpgtq %xmm2, %xmm1, %xmm1
+; X64-AVX2-NEXT: vblendvpd %xmm1, %xmm0, %xmm3, %xmm0
+; X64-AVX2-NEXT: vmovq %xmm0, %rax
+; X64-AVX2-NEXT: vzeroupper
+; X64-AVX2-NEXT: retq
;
; AVX512BW-LABEL: test_v4i64:
; AVX512BW: # %bb.0:
@@ -230,198 +445,428 @@ define i64 @test_v4i64(<4 x i64> %a0) {
ret i64 %1
}
-define i64 @test_v8i64(<8 x i64> %a0) {
-; SSE2-LABEL: test_v8i64:
-; SSE2: # %bb.0:
-; SSE2-NEXT: movdqa {{.*#+}} xmm4 = [9223372039002259456,9223372039002259456]
-; SSE2-NEXT: movdqa %xmm3, %xmm5
-; SSE2-NEXT: pxor %xmm4, %xmm5
-; SSE2-NEXT: movdqa %xmm1, %xmm6
-; SSE2-NEXT: pxor %xmm4, %xmm6
-; SSE2-NEXT: movdqa %xmm6, %xmm7
-; SSE2-NEXT: pcmpgtd %xmm5, %xmm7
-; SSE2-NEXT: pshufd {{.*#+}} xmm8 = xmm7[0,0,2,2]
-; SSE2-NEXT: pcmpeqd %xmm5, %xmm6
-; SSE2-NEXT: pshufd {{.*#+}} xmm6 = xmm6[1,1,3,3]
-; SSE2-NEXT: pand %xmm8, %xmm6
-; SSE2-NEXT: pshufd {{.*#+}} xmm5 = xmm7[1,1,3,3]
-; SSE2-NEXT: por %xmm6, %xmm5
-; SSE2-NEXT: pand %xmm5, %xmm1
-; SSE2-NEXT: pandn %xmm3, %xmm5
-; SSE2-NEXT: por %xmm1, %xmm5
-; SSE2-NEXT: movdqa %xmm5, %xmm1
-; SSE2-NEXT: pxor %xmm4, %xmm1
-; SSE2-NEXT: movdqa %xmm2, %xmm3
-; SSE2-NEXT: pxor %xmm4, %xmm3
-; SSE2-NEXT: movdqa %xmm0, %xmm6
-; SSE2-NEXT: pxor %xmm4, %xmm6
-; SSE2-NEXT: movdqa %xmm6, %xmm7
-; SSE2-NEXT: pcmpgtd %xmm3, %xmm7
-; SSE2-NEXT: pshufd {{.*#+}} xmm8 = xmm7[0,0,2,2]
-; SSE2-NEXT: pcmpeqd %xmm3, %xmm6
-; SSE2-NEXT: pshufd {{.*#+}} xmm3 = xmm6[1,1,3,3]
-; SSE2-NEXT: pand %xmm8, %xmm3
-; SSE2-NEXT: pshufd {{.*#+}} xmm6 = xmm7[1,1,3,3]
-; SSE2-NEXT: por %xmm3, %xmm6
-; SSE2-NEXT: pand %xmm6, %xmm0
-; SSE2-NEXT: pandn %xmm2, %xmm6
-; SSE2-NEXT: por %xmm0, %xmm6
-; SSE2-NEXT: pxor %xmm6, %xmm4
-; SSE2-NEXT: movdqa %xmm4, %xmm0
-; SSE2-NEXT: pcmpgtd %xmm1, %xmm0
-; SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm0[0,0,2,2]
-; SSE2-NEXT: pcmpeqd %xmm1, %xmm4
-; SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm4[1,1,3,3]
-; SSE2-NEXT: pand %xmm2, %xmm1
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm0[1,1,3,3]
-; SSE2-NEXT: por %xmm1, %xmm0
-; SSE2-NEXT: pand %xmm0, %xmm6
-; SSE2-NEXT: pandn %xmm5, %xmm0
-; SSE2-NEXT: por %xmm6, %xmm0
-; SSE2-NEXT: movq %xmm0, %rcx
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm0[2,3,2,3]
-; SSE2-NEXT: movq %xmm0, %rax
-; SSE2-NEXT: cmpq %rax, %rcx
-; SSE2-NEXT: cmovaq %rcx, %rax
-; SSE2-NEXT: retq
-;
-; SSE41-LABEL: test_v8i64:
-; SSE41: # %bb.0:
-; SSE41-NEXT: movdqa %xmm0, %xmm4
-; SSE41-NEXT: movdqa {{.*#+}} xmm5 = [9223372039002259456,9223372039002259456]
-; SSE41-NEXT: movdqa %xmm3, %xmm0
-; SSE41-NEXT: pxor %xmm5, %xmm0
-; SSE41-NEXT: movdqa %xmm1, %xmm6
-; SSE41-NEXT: pxor %xmm5, %xmm6
-; SSE41-NEXT: movdqa %xmm6, %xmm7
-; SSE41-NEXT: pcmpgtd %xmm0, %xmm7
-; SSE41-NEXT: pshufd {{.*#+}} xmm8 = xmm7[0,0,2,2]
-; SSE41-NEXT: pcmpeqd %xmm0, %xmm6
-; SSE41-NEXT: pshufd {{.*#+}} xmm6 = xmm6[1,1,3,3]
-; SSE41-NEXT: pand %xmm8, %xmm6
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm7[1,1,3,3]
-; SSE41-NEXT: por %xmm6, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm1, %xmm3
-; SSE41-NEXT: movapd %xmm3, %xmm1
-; SSE41-NEXT: xorpd %xmm5, %xmm1
-; SSE41-NEXT: movdqa %xmm2, %xmm0
-; SSE41-NEXT: pxor %xmm5, %xmm0
-; SSE41-NEXT: movdqa %xmm4, %xmm6
-; SSE41-NEXT: pxor %xmm5, %xmm6
-; SSE41-NEXT: movdqa %xmm6, %xmm7
-; SSE41-NEXT: pcmpgtd %xmm0, %xmm7
-; SSE41-NEXT: pshufd {{.*#+}} xmm8 = xmm7[0,0,2,2]
-; SSE41-NEXT: pcmpeqd %xmm0, %xmm6
-; SSE41-NEXT: pshufd {{.*#+}} xmm6 = xmm6[1,1,3,3]
-; SSE41-NEXT: pand %xmm8, %xmm6
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm7[1,1,3,3]
-; SSE41-NEXT: por %xmm6, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm4, %xmm2
-; SSE41-NEXT: movapd %xmm2, %xmm0
-; SSE41-NEXT: xorpd %xmm5, %xmm0
-; SSE41-NEXT: movapd %xmm0, %xmm4
-; SSE41-NEXT: pcmpgtd %xmm1, %xmm4
-; SSE41-NEXT: pshufd {{.*#+}} xmm6 = xmm4[0,0,2,2]
-; SSE41-NEXT: pcmpeqd %xmm1, %xmm0
-; SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,3,3]
-; SSE41-NEXT: pand %xmm6, %xmm1
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm4[1,1,3,3]
-; SSE41-NEXT: por %xmm1, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm2, %xmm3
-; SSE41-NEXT: movapd %xmm3, %xmm0
-; SSE41-NEXT: xorpd %xmm5, %xmm0
-; SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm3[2,3,2,3]
-; SSE41-NEXT: pxor %xmm1, %xmm5
-; SSE41-NEXT: movapd %xmm0, %xmm2
-; SSE41-NEXT: pcmpgtd %xmm5, %xmm2
-; SSE41-NEXT: pmovsxdq %xmm2, %xmm4
-; SSE41-NEXT: pcmpeqd %xmm0, %xmm5
-; SSE41-NEXT: pshufd {{.*#+}} xmm5 = xmm5[1,1,3,3]
-; SSE41-NEXT: pand %xmm4, %xmm5
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,3,3]
-; SSE41-NEXT: por %xmm5, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm3, %xmm1
-; SSE41-NEXT: movq %xmm1, %rax
-; SSE41-NEXT: retq
-;
-; SSE42-LABEL: test_v8i64:
-; SSE42: # %bb.0:
-; SSE42-NEXT: movdqa %xmm0, %xmm4
-; SSE42-NEXT: movdqa {{.*#+}} xmm5 = [9223372036854775808,9223372036854775808]
-; SSE42-NEXT: movdqa %xmm3, %xmm6
-; SSE42-NEXT: pxor %xmm5, %xmm6
-; SSE42-NEXT: movdqa %xmm1, %xmm0
-; SSE42-NEXT: pxor %xmm5, %xmm0
-; SSE42-NEXT: pcmpgtq %xmm6, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm1, %xmm3
-; SSE42-NEXT: movapd %xmm3, %xmm1
-; SSE42-NEXT: xorpd %xmm5, %xmm1
-; SSE42-NEXT: movdqa %xmm2, %xmm6
-; SSE42-NEXT: pxor %xmm5, %xmm6
-; SSE42-NEXT: movdqa %xmm4, %xmm0
-; SSE42-NEXT: pxor %xmm5, %xmm0
-; SSE42-NEXT: pcmpgtq %xmm6, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm4, %xmm2
-; SSE42-NEXT: movapd %xmm2, %xmm0
-; SSE42-NEXT: xorpd %xmm5, %xmm0
-; SSE42-NEXT: pcmpgtq %xmm1, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm2, %xmm3
-; SSE42-NEXT: movapd %xmm3, %xmm0
-; SSE42-NEXT: xorpd %xmm5, %xmm0
-; SSE42-NEXT: pshufd {{.*#+}} xmm1 = xmm3[2,3,2,3]
-; SSE42-NEXT: pxor %xmm1, %xmm5
-; SSE42-NEXT: pcmpgtq %xmm5, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm3, %xmm1
-; SSE42-NEXT: movq %xmm1, %rax
-; SSE42-NEXT: retq
-;
-; AVX1-LABEL: test_v8i64:
-; AVX1: # %bb.0:
-; AVX1-NEXT: vextractf128 $1, %ymm1, %xmm2
-; AVX1-NEXT: vmovddup {{.*#+}} xmm3 = [9223372036854775808,9223372036854775808]
-; AVX1-NEXT: # xmm3 = mem[0,0]
-; AVX1-NEXT: vpxor %xmm3, %xmm2, %xmm4
-; AVX1-NEXT: vextractf128 $1, %ymm0, %xmm5
-; AVX1-NEXT: vpxor %xmm3, %xmm5, %xmm6
-; AVX1-NEXT: vpcmpgtq %xmm4, %xmm6, %xmm4
-; AVX1-NEXT: vblendvpd %xmm4, %xmm5, %xmm2, %xmm2
-; AVX1-NEXT: vxorpd %xmm3, %xmm2, %xmm4
-; AVX1-NEXT: vpxor %xmm3, %xmm1, %xmm5
-; AVX1-NEXT: vpxor %xmm3, %xmm0, %xmm6
-; AVX1-NEXT: vpcmpgtq %xmm5, %xmm6, %xmm5
-; AVX1-NEXT: vblendvpd %xmm5, %xmm0, %xmm1, %xmm0
-; AVX1-NEXT: vxorpd %xmm3, %xmm0, %xmm1
-; AVX1-NEXT: vpcmpgtq %xmm4, %xmm1, %xmm1
-; AVX1-NEXT: vblendvpd %xmm1, %xmm0, %xmm2, %xmm0
-; AVX1-NEXT: vxorpd %xmm3, %xmm0, %xmm1
-; AVX1-NEXT: vshufps {{.*#+}} xmm2 = xmm0[2,3,2,3]
-; AVX1-NEXT: vxorpd %xmm3, %xmm2, %xmm3
-; AVX1-NEXT: vpcmpgtq %xmm3, %xmm1, %xmm1
-; AVX1-NEXT: vblendvpd %xmm1, %xmm0, %xmm2, %xmm0
-; AVX1-NEXT: vmovq %xmm0, %rax
-; AVX1-NEXT: vzeroupper
-; AVX1-NEXT: retq
-;
-; AVX2-LABEL: test_v8i64:
-; AVX2: # %bb.0:
-; AVX2-NEXT: vpbroadcastq {{.*#+}} ymm2 = [9223372036854775808,9223372036854775808,9223372036854775808,9223372036854775808]
-; AVX2-NEXT: vpxor %ymm2, %ymm1, %ymm3
-; AVX2-NEXT: vpxor %ymm2, %ymm0, %ymm4
-; AVX2-NEXT: vpcmpgtq %ymm3, %ymm4, %ymm3
-; AVX2-NEXT: vblendvpd %ymm3, %ymm0, %ymm1, %ymm0
-; AVX2-NEXT: vextractf128 $1, %ymm0, %xmm1
-; AVX2-NEXT: vxorpd %xmm2, %xmm1, %xmm3
-; AVX2-NEXT: vxorpd %xmm2, %xmm0, %xmm4
-; AVX2-NEXT: vpcmpgtq %xmm3, %xmm4, %xmm3
-; AVX2-NEXT: vblendvpd %xmm3, %xmm0, %xmm1, %xmm0
-; AVX2-NEXT: vxorpd %xmm2, %xmm0, %xmm1
-; AVX2-NEXT: vshufps {{.*#+}} xmm3 = xmm0[2,3,2,3]
-; AVX2-NEXT: vxorpd %xmm2, %xmm3, %xmm2
-; AVX2-NEXT: vpcmpgtq %xmm2, %xmm1, %xmm1
-; AVX2-NEXT: vblendvpd %xmm1, %xmm0, %xmm3, %xmm0
-; AVX2-NEXT: vmovq %xmm0, %rax
-; AVX2-NEXT: vzeroupper
-; AVX2-NEXT: retq
+define i64 @test_v8i64(<8 x i64> %a0) nounwind {
+; X86-SSE2-LABEL: test_v8i64:
+; X86-SSE2: # %bb.0:
+; X86-SSE2-NEXT: pushl %ebp
+; X86-SSE2-NEXT: movl %esp, %ebp
+; X86-SSE2-NEXT: andl $-16, %esp
+; X86-SSE2-NEXT: subl $16, %esp
+; X86-SSE2-NEXT: movdqa {{.*#+}} xmm3 = [2147483648,2147483648,2147483648,2147483648]
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm4
+; X86-SSE2-NEXT: pxor %xmm3, %xmm4
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm5
+; X86-SSE2-NEXT: pxor %xmm3, %xmm5
+; X86-SSE2-NEXT: movdqa %xmm5, %xmm6
+; X86-SSE2-NEXT: pcmpgtd %xmm4, %xmm6
+; X86-SSE2-NEXT: pcmpeqd %xmm4, %xmm5
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm4 = xmm6[0,0,2,2]
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm7 = xmm5[1,1,3,3]
+; X86-SSE2-NEXT: pand %xmm4, %xmm7
+; X86-SSE2-NEXT: movdqa 8(%ebp), %xmm5
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm4 = xmm6[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm7, %xmm4
+; X86-SSE2-NEXT: pand %xmm4, %xmm0
+; X86-SSE2-NEXT: pandn %xmm2, %xmm4
+; X86-SSE2-NEXT: por %xmm0, %xmm4
+; X86-SSE2-NEXT: movdqa %xmm5, %xmm0
+; X86-SSE2-NEXT: pxor %xmm3, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm2
+; X86-SSE2-NEXT: pxor %xmm3, %xmm2
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm6
+; X86-SSE2-NEXT: pcmpgtd %xmm0, %xmm6
+; X86-SSE2-NEXT: pcmpeqd %xmm0, %xmm2
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm6[0,0,2,2]
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm7 = xmm2[1,1,3,3]
+; X86-SSE2-NEXT: pand %xmm0, %xmm7
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm6[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm7, %xmm2
+; X86-SSE2-NEXT: pand %xmm2, %xmm1
+; X86-SSE2-NEXT: pandn %xmm5, %xmm2
+; X86-SSE2-NEXT: por %xmm1, %xmm2
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm0
+; X86-SSE2-NEXT: pxor %xmm3, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm4, %xmm1
+; X86-SSE2-NEXT: pxor %xmm3, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm5
+; X86-SSE2-NEXT: pcmpgtd %xmm0, %xmm5
+; X86-SSE2-NEXT: pcmpeqd %xmm0, %xmm1
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm5[0,0,2,2]
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm1[1,1,3,3]
+; X86-SSE2-NEXT: pand %xmm0, %xmm1
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm5[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm1, %xmm0
+; X86-SSE2-NEXT: pand %xmm0, %xmm4
+; X86-SSE2-NEXT: pandn %xmm2, %xmm0
+; X86-SSE2-NEXT: por %xmm4, %xmm0
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE2-NEXT: pxor %xmm3, %xmm2
+; X86-SSE2-NEXT: pxor %xmm1, %xmm3
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm4
+; X86-SSE2-NEXT: pcmpgtd %xmm3, %xmm4
+; X86-SSE2-NEXT: pcmpeqd %xmm2, %xmm3
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm4[0,0,2,2]
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm3 = xmm3[1,1,3,3]
+; X86-SSE2-NEXT: pand %xmm2, %xmm3
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm4[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm3, %xmm2
+; X86-SSE2-NEXT: pand %xmm2, %xmm0
+; X86-SSE2-NEXT: pandn %xmm1, %xmm2
+; X86-SSE2-NEXT: por %xmm0, %xmm2
+; X86-SSE2-NEXT: movd %xmm2, %eax
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,1,1]
+; X86-SSE2-NEXT: movd %xmm0, %edx
+; X86-SSE2-NEXT: movl %ebp, %esp
+; X86-SSE2-NEXT: popl %ebp
+; X86-SSE2-NEXT: retl
+;
+; X64-SSE2-LABEL: test_v8i64:
+; X64-SSE2: # %bb.0:
+; X64-SSE2-NEXT: movdqa {{.*#+}} xmm4 = [9223372039002259456,9223372039002259456]
+; X64-SSE2-NEXT: movdqa %xmm3, %xmm5
+; X64-SSE2-NEXT: pxor %xmm4, %xmm5
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm6
+; X64-SSE2-NEXT: pxor %xmm4, %xmm6
+; X64-SSE2-NEXT: movdqa %xmm6, %xmm7
+; X64-SSE2-NEXT: pcmpgtd %xmm5, %xmm7
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm8 = xmm7[0,0,2,2]
+; X64-SSE2-NEXT: pcmpeqd %xmm5, %xmm6
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm6 = xmm6[1,1,3,3]
+; X64-SSE2-NEXT: pand %xmm8, %xmm6
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm5 = xmm7[1,1,3,3]
+; X64-SSE2-NEXT: por %xmm6, %xmm5
+; X64-SSE2-NEXT: pand %xmm5, %xmm1
+; X64-SSE2-NEXT: pandn %xmm3, %xmm5
+; X64-SSE2-NEXT: por %xmm1, %xmm5
+; X64-SSE2-NEXT: movdqa %xmm5, %xmm1
+; X64-SSE2-NEXT: pxor %xmm4, %xmm1
+; X64-SSE2-NEXT: movdqa %xmm2, %xmm3
+; X64-SSE2-NEXT: pxor %xmm4, %xmm3
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm6
+; X64-SSE2-NEXT: pxor %xmm4, %xmm6
+; X64-SSE2-NEXT: movdqa %xmm6, %xmm7
+; X64-SSE2-NEXT: pcmpgtd %xmm3, %xmm7
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm8 = xmm7[0,0,2,2]
+; X64-SSE2-NEXT: pcmpeqd %xmm3, %xmm6
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm3 = xmm6[1,1,3,3]
+; X64-SSE2-NEXT: pand %xmm8, %xmm3
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm6 = xmm7[1,1,3,3]
+; X64-SSE2-NEXT: por %xmm3, %xmm6
+; X64-SSE2-NEXT: pand %xmm6, %xmm0
+; X64-SSE2-NEXT: pandn %xmm2, %xmm6
+; X64-SSE2-NEXT: por %xmm0, %xmm6
+; X64-SSE2-NEXT: pxor %xmm6, %xmm4
+; X64-SSE2-NEXT: movdqa %xmm4, %xmm0
+; X64-SSE2-NEXT: pcmpgtd %xmm1, %xmm0
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm0[0,0,2,2]
+; X64-SSE2-NEXT: pcmpeqd %xmm1, %xmm4
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm4[1,1,3,3]
+; X64-SSE2-NEXT: pand %xmm2, %xmm1
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm0[1,1,3,3]
+; X64-SSE2-NEXT: por %xmm1, %xmm0
+; X64-SSE2-NEXT: pand %xmm0, %xmm6
+; X64-SSE2-NEXT: pandn %xmm5, %xmm0
+; X64-SSE2-NEXT: por %xmm6, %xmm0
+; X64-SSE2-NEXT: movq %xmm0, %rcx
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm0[2,3,2,3]
+; X64-SSE2-NEXT: movq %xmm0, %rax
+; X64-SSE2-NEXT: cmpq %rax, %rcx
+; X64-SSE2-NEXT: cmovaq %rcx, %rax
+; X64-SSE2-NEXT: retq
+;
+; X86-SSE41-LABEL: test_v8i64:
+; X86-SSE41: # %bb.0:
+; X86-SSE41-NEXT: pushl %ebp
+; X86-SSE41-NEXT: movl %esp, %ebp
+; X86-SSE41-NEXT: andl $-16, %esp
+; X86-SSE41-NEXT: subl $16, %esp
+; X86-SSE41-NEXT: movdqa %xmm0, %xmm3
+; X86-SSE41-NEXT: movdqa {{.*#+}} xmm4 = [2147483648,2147483648,2147483648,2147483648]
+; X86-SSE41-NEXT: movdqa %xmm2, %xmm0
+; X86-SSE41-NEXT: pxor %xmm4, %xmm0
+; X86-SSE41-NEXT: movdqa %xmm3, %xmm5
+; X86-SSE41-NEXT: pxor %xmm4, %xmm5
+; X86-SSE41-NEXT: movdqa %xmm5, %xmm6
+; X86-SSE41-NEXT: pcmpgtd %xmm0, %xmm6
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm5
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm6[0,0,2,2]
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm7 = xmm5[1,1,3,3]
+; X86-SSE41-NEXT: pand %xmm0, %xmm7
+; X86-SSE41-NEXT: movdqa 8(%ebp), %xmm5
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm6[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm7, %xmm0
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm3, %xmm2
+; X86-SSE41-NEXT: movdqa %xmm5, %xmm0
+; X86-SSE41-NEXT: pxor %xmm4, %xmm0
+; X86-SSE41-NEXT: movdqa %xmm1, %xmm3
+; X86-SSE41-NEXT: pxor %xmm4, %xmm3
+; X86-SSE41-NEXT: movdqa %xmm3, %xmm6
+; X86-SSE41-NEXT: pcmpgtd %xmm0, %xmm6
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm3
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm6[0,0,2,2]
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm3 = xmm3[1,1,3,3]
+; X86-SSE41-NEXT: pand %xmm0, %xmm3
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm6[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm3, %xmm0
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm1, %xmm5
+; X86-SSE41-NEXT: movapd %xmm5, %xmm0
+; X86-SSE41-NEXT: xorpd %xmm4, %xmm0
+; X86-SSE41-NEXT: movapd %xmm2, %xmm1
+; X86-SSE41-NEXT: xorpd %xmm4, %xmm1
+; X86-SSE41-NEXT: movapd %xmm1, %xmm3
+; X86-SSE41-NEXT: pcmpgtd %xmm0, %xmm3
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm1
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm3[0,0,2,2]
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm1[1,1,3,3]
+; X86-SSE41-NEXT: pand %xmm0, %xmm1
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm3[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm1, %xmm0
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm2, %xmm5
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm5[2,3,2,3]
+; X86-SSE41-NEXT: movdqa %xmm5, %xmm0
+; X86-SSE41-NEXT: pxor %xmm4, %xmm0
+; X86-SSE41-NEXT: pxor %xmm1, %xmm4
+; X86-SSE41-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE41-NEXT: pcmpgtd %xmm4, %xmm2
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm4
+; X86-SSE41-NEXT: pmovsxdq %xmm2, %xmm0
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm3 = xmm4[1,1,3,3]
+; X86-SSE41-NEXT: pand %xmm0, %xmm3
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm3, %xmm0
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm5, %xmm1
+; X86-SSE41-NEXT: movd %xmm1, %eax
+; X86-SSE41-NEXT: pextrd $1, %xmm1, %edx
+; X86-SSE41-NEXT: movl %ebp, %esp
+; X86-SSE41-NEXT: popl %ebp
+; X86-SSE41-NEXT: retl
+;
+; X64-SSE41-LABEL: test_v8i64:
+; X64-SSE41: # %bb.0:
+; X64-SSE41-NEXT: movdqa %xmm0, %xmm4
+; X64-SSE41-NEXT: movdqa {{.*#+}} xmm5 = [9223372039002259456,9223372039002259456]
+; X64-SSE41-NEXT: movdqa %xmm3, %xmm0
+; X64-SSE41-NEXT: pxor %xmm5, %xmm0
+; X64-SSE41-NEXT: movdqa %xmm1, %xmm6
+; X64-SSE41-NEXT: pxor %xmm5, %xmm6
+; X64-SSE41-NEXT: movdqa %xmm6, %xmm7
+; X64-SSE41-NEXT: pcmpgtd %xmm0, %xmm7
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm8 = xmm7[0,0,2,2]
+; X64-SSE41-NEXT: pcmpeqd %xmm0, %xmm6
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm6 = xmm6[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm8, %xmm6
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm7[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm6, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm1, %xmm3
+; X64-SSE41-NEXT: movapd %xmm3, %xmm1
+; X64-SSE41-NEXT: xorpd %xmm5, %xmm1
+; X64-SSE41-NEXT: movdqa %xmm2, %xmm0
+; X64-SSE41-NEXT: pxor %xmm5, %xmm0
+; X64-SSE41-NEXT: movdqa %xmm4, %xmm6
+; X64-SSE41-NEXT: pxor %xmm5, %xmm6
+; X64-SSE41-NEXT: movdqa %xmm6, %xmm7
+; X64-SSE41-NEXT: pcmpgtd %xmm0, %xmm7
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm8 = xmm7[0,0,2,2]
+; X64-SSE41-NEXT: pcmpeqd %xmm0, %xmm6
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm6 = xmm6[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm8, %xmm6
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm7[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm6, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm4, %xmm2
+; X64-SSE41-NEXT: movapd %xmm2, %xmm0
+; X64-SSE41-NEXT: xorpd %xmm5, %xmm0
+; X64-SSE41-NEXT: movapd %xmm0, %xmm4
+; X64-SSE41-NEXT: pcmpgtd %xmm1, %xmm4
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm6 = xmm4[0,0,2,2]
+; X64-SSE41-NEXT: pcmpeqd %xmm1, %xmm0
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm6, %xmm1
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm4[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm1, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm2, %xmm3
+; X64-SSE41-NEXT: movapd %xmm3, %xmm0
+; X64-SSE41-NEXT: xorpd %xmm5, %xmm0
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm3[2,3,2,3]
+; X64-SSE41-NEXT: pxor %xmm1, %xmm5
+; X64-SSE41-NEXT: movapd %xmm0, %xmm2
+; X64-SSE41-NEXT: pcmpgtd %xmm5, %xmm2
+; X64-SSE41-NEXT: pmovsxdq %xmm2, %xmm4
+; X64-SSE41-NEXT: pcmpeqd %xmm0, %xmm5
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm5 = xmm5[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm4, %xmm5
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm5, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm3, %xmm1
+; X64-SSE41-NEXT: movq %xmm1, %rax
+; X64-SSE41-NEXT: retq
+;
+; X86-SSE42-LABEL: test_v8i64:
+; X86-SSE42: # %bb.0:
+; X86-SSE42-NEXT: pushl %ebp
+; X86-SSE42-NEXT: movl %esp, %ebp
+; X86-SSE42-NEXT: andl $-16, %esp
+; X86-SSE42-NEXT: subl $16, %esp
+; X86-SSE42-NEXT: movdqa %xmm0, %xmm3
+; X86-SSE42-NEXT: movdqa 8(%ebp), %xmm4
+; X86-SSE42-NEXT: movdqa {{.*#+}} xmm5 = [0,2147483648,0,2147483648]
+; X86-SSE42-NEXT: movdqa %xmm2, %xmm6
+; X86-SSE42-NEXT: pxor %xmm5, %xmm6
+; X86-SSE42-NEXT: pxor %xmm5, %xmm0
+; X86-SSE42-NEXT: pcmpgtq %xmm6, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm3, %xmm2
+; X86-SSE42-NEXT: movdqa %xmm4, %xmm3
+; X86-SSE42-NEXT: pxor %xmm5, %xmm3
+; X86-SSE42-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE42-NEXT: pxor %xmm5, %xmm0
+; X86-SSE42-NEXT: pcmpgtq %xmm3, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm1, %xmm4
+; X86-SSE42-NEXT: movapd %xmm4, %xmm1
+; X86-SSE42-NEXT: xorpd %xmm5, %xmm1
+; X86-SSE42-NEXT: movapd %xmm2, %xmm0
+; X86-SSE42-NEXT: xorpd %xmm5, %xmm0
+; X86-SSE42-NEXT: pcmpgtq %xmm1, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm2, %xmm4
+; X86-SSE42-NEXT: pshufd {{.*#+}} xmm1 = xmm4[2,3,2,3]
+; X86-SSE42-NEXT: movdqa %xmm4, %xmm0
+; X86-SSE42-NEXT: pxor %xmm5, %xmm0
+; X86-SSE42-NEXT: pxor %xmm1, %xmm5
+; X86-SSE42-NEXT: pcmpgtq %xmm5, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm4, %xmm1
+; X86-SSE42-NEXT: movd %xmm1, %eax
+; X86-SSE42-NEXT: pextrd $1, %xmm1, %edx
+; X86-SSE42-NEXT: movl %ebp, %esp
+; X86-SSE42-NEXT: popl %ebp
+; X86-SSE42-NEXT: retl
+;
+; X64-SSE42-LABEL: test_v8i64:
+; X64-SSE42: # %bb.0:
+; X64-SSE42-NEXT: movdqa %xmm0, %xmm4
+; X64-SSE42-NEXT: movdqa {{.*#+}} xmm5 = [9223372036854775808,9223372036854775808]
+; X64-SSE42-NEXT: movdqa %xmm3, %xmm6
+; X64-SSE42-NEXT: pxor %xmm5, %xmm6
+; X64-SSE42-NEXT: movdqa %xmm1, %xmm0
+; X64-SSE42-NEXT: pxor %xmm5, %xmm0
+; X64-SSE42-NEXT: pcmpgtq %xmm6, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm1, %xmm3
+; X64-SSE42-NEXT: movapd %xmm3, %xmm1
+; X64-SSE42-NEXT: xorpd %xmm5, %xmm1
+; X64-SSE42-NEXT: movdqa %xmm2, %xmm6
+; X64-SSE42-NEXT: pxor %xmm5, %xmm6
+; X64-SSE42-NEXT: movdqa %xmm4, %xmm0
+; X64-SSE42-NEXT: pxor %xmm5, %xmm0
+; X64-SSE42-NEXT: pcmpgtq %xmm6, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm4, %xmm2
+; X64-SSE42-NEXT: movapd %xmm2, %xmm0
+; X64-SSE42-NEXT: xorpd %xmm5, %xmm0
+; X64-SSE42-NEXT: pcmpgtq %xmm1, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm2, %xmm3
+; X64-SSE42-NEXT: movapd %xmm3, %xmm0
+; X64-SSE42-NEXT: xorpd %xmm5, %xmm0
+; X64-SSE42-NEXT: pshufd {{.*#+}} xmm1 = xmm3[2,3,2,3]
+; X64-SSE42-NEXT: pxor %xmm1, %xmm5
+; X64-SSE42-NEXT: pcmpgtq %xmm5, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm3, %xmm1
+; X64-SSE42-NEXT: movq %xmm1, %rax
+; X64-SSE42-NEXT: retq
+;
+; X86-AVX1-LABEL: test_v8i64:
+; X86-AVX1: # %bb.0:
+; X86-AVX1-NEXT: vmovddup {{.*#+}} xmm2 = [0,2147483648,0,2147483648]
+; X86-AVX1-NEXT: # xmm2 = mem[0,0]
+; X86-AVX1-NEXT: vxorps %xmm2, %xmm1, %xmm3
+; X86-AVX1-NEXT: vxorps %xmm2, %xmm0, %xmm4
+; X86-AVX1-NEXT: vpcmpgtq %xmm3, %xmm4, %xmm3
+; X86-AVX1-NEXT: vblendvpd %xmm3, %xmm0, %xmm1, %xmm3
+; X86-AVX1-NEXT: vextractf128 $1, %ymm1, %xmm1
+; X86-AVX1-NEXT: vxorps %xmm2, %xmm1, %xmm4
+; X86-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm0
+; X86-AVX1-NEXT: vxorps %xmm2, %xmm0, %xmm5
+; X86-AVX1-NEXT: vpcmpgtq %xmm4, %xmm5, %xmm4
+; X86-AVX1-NEXT: vblendvpd %xmm4, %xmm0, %xmm1, %xmm0
+; X86-AVX1-NEXT: vxorpd %xmm2, %xmm0, %xmm1
+; X86-AVX1-NEXT: vxorpd %xmm2, %xmm3, %xmm4
+; X86-AVX1-NEXT: vpcmpgtq %xmm1, %xmm4, %xmm1
+; X86-AVX1-NEXT: vblendvpd %xmm1, %xmm3, %xmm0, %xmm0
+; X86-AVX1-NEXT: vshufps {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-AVX1-NEXT: vxorpd %xmm2, %xmm0, %xmm3
+; X86-AVX1-NEXT: vxorpd %xmm2, %xmm1, %xmm2
+; X86-AVX1-NEXT: vpcmpgtq %xmm2, %xmm3, %xmm2
+; X86-AVX1-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X86-AVX1-NEXT: vmovd %xmm0, %eax
+; X86-AVX1-NEXT: vpextrd $1, %xmm0, %edx
+; X86-AVX1-NEXT: vzeroupper
+; X86-AVX1-NEXT: retl
+;
+; X64-AVX1-LABEL: test_v8i64:
+; X64-AVX1: # %bb.0:
+; X64-AVX1-NEXT: vextractf128 $1, %ymm1, %xmm2
+; X64-AVX1-NEXT: vmovddup {{.*#+}} xmm3 = [9223372036854775808,9223372036854775808]
+; X64-AVX1-NEXT: # xmm3 = mem[0,0]
+; X64-AVX1-NEXT: vpxor %xmm3, %xmm2, %xmm4
+; X64-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm5
+; X64-AVX1-NEXT: vpxor %xmm3, %xmm5, %xmm6
+; X64-AVX1-NEXT: vpcmpgtq %xmm4, %xmm6, %xmm4
+; X64-AVX1-NEXT: vblendvpd %xmm4, %xmm5, %xmm2, %xmm2
+; X64-AVX1-NEXT: vxorpd %xmm3, %xmm2, %xmm4
+; X64-AVX1-NEXT: vpxor %xmm3, %xmm1, %xmm5
+; X64-AVX1-NEXT: vpxor %xmm3, %xmm0, %xmm6
+; X64-AVX1-NEXT: vpcmpgtq %xmm5, %xmm6, %xmm5
+; X64-AVX1-NEXT: vblendvpd %xmm5, %xmm0, %xmm1, %xmm0
+; X64-AVX1-NEXT: vxorpd %xmm3, %xmm0, %xmm1
+; X64-AVX1-NEXT: vpcmpgtq %xmm4, %xmm1, %xmm1
+; X64-AVX1-NEXT: vblendvpd %xmm1, %xmm0, %xmm2, %xmm0
+; X64-AVX1-NEXT: vxorpd %xmm3, %xmm0, %xmm1
+; X64-AVX1-NEXT: vshufps {{.*#+}} xmm2 = xmm0[2,3,2,3]
+; X64-AVX1-NEXT: vxorpd %xmm3, %xmm2, %xmm3
+; X64-AVX1-NEXT: vpcmpgtq %xmm3, %xmm1, %xmm1
+; X64-AVX1-NEXT: vblendvpd %xmm1, %xmm0, %xmm2, %xmm0
+; X64-AVX1-NEXT: vmovq %xmm0, %rax
+; X64-AVX1-NEXT: vzeroupper
+; X64-AVX1-NEXT: retq
+;
+; X86-AVX2-LABEL: test_v8i64:
+; X86-AVX2: # %bb.0:
+; X86-AVX2-NEXT: vpbroadcastq {{.*#+}} ymm2 = [0,2147483648,0,2147483648,0,2147483648,0,2147483648]
+; X86-AVX2-NEXT: vpxor %ymm2, %ymm1, %ymm3
+; X86-AVX2-NEXT: vpxor %ymm2, %ymm0, %ymm4
+; X86-AVX2-NEXT: vpcmpgtq %ymm3, %ymm4, %ymm3
+; X86-AVX2-NEXT: vblendvpd %ymm3, %ymm0, %ymm1, %ymm0
+; X86-AVX2-NEXT: vextractf128 $1, %ymm0, %xmm1
+; X86-AVX2-NEXT: vxorpd %xmm2, %xmm1, %xmm3
+; X86-AVX2-NEXT: vxorpd %xmm2, %xmm0, %xmm4
+; X86-AVX2-NEXT: vpcmpgtq %xmm3, %xmm4, %xmm3
+; X86-AVX2-NEXT: vblendvpd %xmm3, %xmm0, %xmm1, %xmm0
+; X86-AVX2-NEXT: vshufps {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-AVX2-NEXT: vxorpd %xmm2, %xmm0, %xmm3
+; X86-AVX2-NEXT: vxorpd %xmm2, %xmm1, %xmm2
+; X86-AVX2-NEXT: vpcmpgtq %xmm2, %xmm3, %xmm2
+; X86-AVX2-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X86-AVX2-NEXT: vmovd %xmm0, %eax
+; X86-AVX2-NEXT: vpextrd $1, %xmm0, %edx
+; X86-AVX2-NEXT: vzeroupper
+; X86-AVX2-NEXT: retl
+;
+; X64-AVX2-LABEL: test_v8i64:
+; X64-AVX2: # %bb.0:
+; X64-AVX2-NEXT: vpbroadcastq {{.*#+}} ymm2 = [9223372036854775808,9223372036854775808,9223372036854775808,9223372036854775808]
+; X64-AVX2-NEXT: vpxor %ymm2, %ymm1, %ymm3
+; X64-AVX2-NEXT: vpxor %ymm2, %ymm0, %ymm4
+; X64-AVX2-NEXT: vpcmpgtq %ymm3, %ymm4, %ymm3
+; X64-AVX2-NEXT: vblendvpd %ymm3, %ymm0, %ymm1, %ymm0
+; X64-AVX2-NEXT: vextractf128 $1, %ymm0, %xmm1
+; X64-AVX2-NEXT: vxorpd %xmm2, %xmm1, %xmm3
+; X64-AVX2-NEXT: vxorpd %xmm2, %xmm0, %xmm4
+; X64-AVX2-NEXT: vpcmpgtq %xmm3, %xmm4, %xmm3
+; X64-AVX2-NEXT: vblendvpd %xmm3, %xmm0, %xmm1, %xmm0
+; X64-AVX2-NEXT: vxorpd %xmm2, %xmm0, %xmm1
+; X64-AVX2-NEXT: vshufps {{.*#+}} xmm3 = xmm0[2,3,2,3]
+; X64-AVX2-NEXT: vxorpd %xmm2, %xmm3, %xmm2
+; X64-AVX2-NEXT: vpcmpgtq %xmm2, %xmm1, %xmm1
+; X64-AVX2-NEXT: vblendvpd %xmm1, %xmm0, %xmm3, %xmm0
+; X64-AVX2-NEXT: vmovq %xmm0, %rax
+; X64-AVX2-NEXT: vzeroupper
+; X64-AVX2-NEXT: retq
;
; AVX512BW-LABEL: test_v8i64:
; AVX512BW: # %bb.0:
@@ -450,360 +895,788 @@ define i64 @test_v8i64(<8 x i64> %a0) {
ret i64 %1
}
-define i64 @test_v16i64(<16 x i64> %a0) {
-; SSE2-LABEL: test_v16i64:
-; SSE2: # %bb.0:
-; SSE2-NEXT: movdqa {{.*#+}} xmm8 = [9223372039002259456,9223372039002259456]
-; SSE2-NEXT: movdqa %xmm7, %xmm9
-; SSE2-NEXT: pxor %xmm8, %xmm9
-; SSE2-NEXT: movdqa %xmm3, %xmm10
-; SSE2-NEXT: pxor %xmm8, %xmm10
-; SSE2-NEXT: movdqa %xmm10, %xmm11
-; SSE2-NEXT: pcmpgtd %xmm9, %xmm11
-; SSE2-NEXT: pshufd {{.*#+}} xmm12 = xmm11[0,0,2,2]
-; SSE2-NEXT: pcmpeqd %xmm9, %xmm10
-; SSE2-NEXT: pshufd {{.*#+}} xmm10 = xmm10[1,1,3,3]
-; SSE2-NEXT: pand %xmm12, %xmm10
-; SSE2-NEXT: pshufd {{.*#+}} xmm9 = xmm11[1,1,3,3]
-; SSE2-NEXT: por %xmm10, %xmm9
-; SSE2-NEXT: pand %xmm9, %xmm3
-; SSE2-NEXT: pandn %xmm7, %xmm9
-; SSE2-NEXT: por %xmm3, %xmm9
-; SSE2-NEXT: movdqa %xmm9, %xmm3
-; SSE2-NEXT: pxor %xmm8, %xmm3
-; SSE2-NEXT: movdqa %xmm5, %xmm7
-; SSE2-NEXT: pxor %xmm8, %xmm7
-; SSE2-NEXT: movdqa %xmm1, %xmm10
-; SSE2-NEXT: pxor %xmm8, %xmm10
-; SSE2-NEXT: movdqa %xmm10, %xmm11
-; SSE2-NEXT: pcmpgtd %xmm7, %xmm11
-; SSE2-NEXT: pshufd {{.*#+}} xmm12 = xmm11[0,0,2,2]
-; SSE2-NEXT: pcmpeqd %xmm7, %xmm10
-; SSE2-NEXT: pshufd {{.*#+}} xmm7 = xmm10[1,1,3,3]
-; SSE2-NEXT: pand %xmm12, %xmm7
-; SSE2-NEXT: pshufd {{.*#+}} xmm10 = xmm11[1,1,3,3]
-; SSE2-NEXT: por %xmm7, %xmm10
-; SSE2-NEXT: pand %xmm10, %xmm1
-; SSE2-NEXT: pandn %xmm5, %xmm10
-; SSE2-NEXT: por %xmm1, %xmm10
-; SSE2-NEXT: movdqa %xmm10, %xmm1
-; SSE2-NEXT: pxor %xmm8, %xmm1
-; SSE2-NEXT: movdqa %xmm1, %xmm5
-; SSE2-NEXT: pcmpgtd %xmm3, %xmm5
-; SSE2-NEXT: pshufd {{.*#+}} xmm7 = xmm5[0,0,2,2]
-; SSE2-NEXT: pcmpeqd %xmm3, %xmm1
-; SSE2-NEXT: pshufd {{.*#+}} xmm3 = xmm1[1,1,3,3]
-; SSE2-NEXT: pand %xmm7, %xmm3
-; SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm5[1,1,3,3]
-; SSE2-NEXT: por %xmm3, %xmm1
-; SSE2-NEXT: pand %xmm1, %xmm10
-; SSE2-NEXT: pandn %xmm9, %xmm1
-; SSE2-NEXT: por %xmm10, %xmm1
-; SSE2-NEXT: movdqa %xmm1, %xmm3
-; SSE2-NEXT: pxor %xmm8, %xmm3
-; SSE2-NEXT: movdqa %xmm6, %xmm5
-; SSE2-NEXT: pxor %xmm8, %xmm5
-; SSE2-NEXT: movdqa %xmm2, %xmm7
-; SSE2-NEXT: pxor %xmm8, %xmm7
-; SSE2-NEXT: movdqa %xmm7, %xmm9
-; SSE2-NEXT: pcmpgtd %xmm5, %xmm9
-; SSE2-NEXT: pshufd {{.*#+}} xmm10 = xmm9[0,0,2,2]
-; SSE2-NEXT: pcmpeqd %xmm5, %xmm7
-; SSE2-NEXT: pshufd {{.*#+}} xmm7 = xmm7[1,1,3,3]
-; SSE2-NEXT: pand %xmm10, %xmm7
-; SSE2-NEXT: pshufd {{.*#+}} xmm5 = xmm9[1,1,3,3]
-; SSE2-NEXT: por %xmm7, %xmm5
-; SSE2-NEXT: pand %xmm5, %xmm2
-; SSE2-NEXT: pandn %xmm6, %xmm5
-; SSE2-NEXT: por %xmm2, %xmm5
-; SSE2-NEXT: movdqa %xmm5, %xmm2
-; SSE2-NEXT: pxor %xmm8, %xmm2
-; SSE2-NEXT: movdqa %xmm4, %xmm6
-; SSE2-NEXT: pxor %xmm8, %xmm6
-; SSE2-NEXT: movdqa %xmm0, %xmm7
-; SSE2-NEXT: pxor %xmm8, %xmm7
-; SSE2-NEXT: movdqa %xmm7, %xmm9
-; SSE2-NEXT: pcmpgtd %xmm6, %xmm9
-; SSE2-NEXT: pshufd {{.*#+}} xmm10 = xmm9[0,0,2,2]
-; SSE2-NEXT: pcmpeqd %xmm6, %xmm7
-; SSE2-NEXT: pshufd {{.*#+}} xmm6 = xmm7[1,1,3,3]
-; SSE2-NEXT: pand %xmm10, %xmm6
-; SSE2-NEXT: pshufd {{.*#+}} xmm7 = xmm9[1,1,3,3]
-; SSE2-NEXT: por %xmm6, %xmm7
-; SSE2-NEXT: pand %xmm7, %xmm0
-; SSE2-NEXT: pandn %xmm4, %xmm7
-; SSE2-NEXT: por %xmm0, %xmm7
-; SSE2-NEXT: movdqa %xmm7, %xmm0
-; SSE2-NEXT: pxor %xmm8, %xmm0
-; SSE2-NEXT: movdqa %xmm0, %xmm4
-; SSE2-NEXT: pcmpgtd %xmm2, %xmm4
-; SSE2-NEXT: pshufd {{.*#+}} xmm6 = xmm4[0,0,2,2]
-; SSE2-NEXT: pcmpeqd %xmm2, %xmm0
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm0[1,1,3,3]
-; SSE2-NEXT: pand %xmm6, %xmm0
-; SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm4[1,1,3,3]
-; SSE2-NEXT: por %xmm0, %xmm2
-; SSE2-NEXT: pand %xmm2, %xmm7
-; SSE2-NEXT: pandn %xmm5, %xmm2
-; SSE2-NEXT: por %xmm7, %xmm2
-; SSE2-NEXT: pxor %xmm2, %xmm8
-; SSE2-NEXT: movdqa %xmm8, %xmm0
-; SSE2-NEXT: pcmpgtd %xmm3, %xmm0
-; SSE2-NEXT: pshufd {{.*#+}} xmm4 = xmm0[0,0,2,2]
-; SSE2-NEXT: pcmpeqd %xmm3, %xmm8
-; SSE2-NEXT: pshufd {{.*#+}} xmm3 = xmm8[1,1,3,3]
-; SSE2-NEXT: pand %xmm4, %xmm3
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm0[1,1,3,3]
-; SSE2-NEXT: por %xmm3, %xmm0
-; SSE2-NEXT: pand %xmm0, %xmm2
-; SSE2-NEXT: pandn %xmm1, %xmm0
-; SSE2-NEXT: por %xmm2, %xmm0
-; SSE2-NEXT: movq %xmm0, %rcx
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm0[2,3,2,3]
-; SSE2-NEXT: movq %xmm0, %rax
-; SSE2-NEXT: cmpq %rax, %rcx
-; SSE2-NEXT: cmovaq %rcx, %rax
-; SSE2-NEXT: retq
-;
-; SSE41-LABEL: test_v16i64:
-; SSE41: # %bb.0:
-; SSE41-NEXT: movdqa %xmm0, %xmm8
-; SSE41-NEXT: movdqa {{.*#+}} xmm9 = [9223372039002259456,9223372039002259456]
-; SSE41-NEXT: movdqa %xmm7, %xmm0
-; SSE41-NEXT: pxor %xmm9, %xmm0
-; SSE41-NEXT: movdqa %xmm3, %xmm10
-; SSE41-NEXT: pxor %xmm9, %xmm10
-; SSE41-NEXT: movdqa %xmm10, %xmm11
-; SSE41-NEXT: pcmpgtd %xmm0, %xmm11
-; SSE41-NEXT: pshufd {{.*#+}} xmm12 = xmm11[0,0,2,2]
-; SSE41-NEXT: pcmpeqd %xmm0, %xmm10
-; SSE41-NEXT: pshufd {{.*#+}} xmm10 = xmm10[1,1,3,3]
-; SSE41-NEXT: pand %xmm12, %xmm10
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm11[1,1,3,3]
-; SSE41-NEXT: por %xmm10, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm3, %xmm7
-; SSE41-NEXT: movapd %xmm7, %xmm3
-; SSE41-NEXT: xorpd %xmm9, %xmm3
-; SSE41-NEXT: movdqa %xmm5, %xmm0
-; SSE41-NEXT: pxor %xmm9, %xmm0
-; SSE41-NEXT: movdqa %xmm1, %xmm10
-; SSE41-NEXT: pxor %xmm9, %xmm10
-; SSE41-NEXT: movdqa %xmm10, %xmm11
-; SSE41-NEXT: pcmpgtd %xmm0, %xmm11
-; SSE41-NEXT: pshufd {{.*#+}} xmm12 = xmm11[0,0,2,2]
-; SSE41-NEXT: pcmpeqd %xmm0, %xmm10
-; SSE41-NEXT: pshufd {{.*#+}} xmm10 = xmm10[1,1,3,3]
-; SSE41-NEXT: pand %xmm12, %xmm10
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm11[1,1,3,3]
-; SSE41-NEXT: por %xmm10, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm1, %xmm5
-; SSE41-NEXT: movapd %xmm5, %xmm0
-; SSE41-NEXT: xorpd %xmm9, %xmm0
-; SSE41-NEXT: movapd %xmm0, %xmm1
-; SSE41-NEXT: pcmpgtd %xmm3, %xmm1
-; SSE41-NEXT: pshufd {{.*#+}} xmm10 = xmm1[0,0,2,2]
-; SSE41-NEXT: pcmpeqd %xmm3, %xmm0
-; SSE41-NEXT: pshufd {{.*#+}} xmm3 = xmm0[1,1,3,3]
-; SSE41-NEXT: pand %xmm10, %xmm3
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,3,3]
-; SSE41-NEXT: por %xmm3, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm5, %xmm7
-; SSE41-NEXT: movapd %xmm7, %xmm1
-; SSE41-NEXT: xorpd %xmm9, %xmm1
-; SSE41-NEXT: movdqa %xmm6, %xmm0
-; SSE41-NEXT: pxor %xmm9, %xmm0
-; SSE41-NEXT: movdqa %xmm2, %xmm3
-; SSE41-NEXT: pxor %xmm9, %xmm3
-; SSE41-NEXT: movdqa %xmm3, %xmm5
-; SSE41-NEXT: pcmpgtd %xmm0, %xmm5
-; SSE41-NEXT: pshufd {{.*#+}} xmm10 = xmm5[0,0,2,2]
-; SSE41-NEXT: pcmpeqd %xmm0, %xmm3
-; SSE41-NEXT: pshufd {{.*#+}} xmm3 = xmm3[1,1,3,3]
-; SSE41-NEXT: pand %xmm10, %xmm3
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm5[1,1,3,3]
-; SSE41-NEXT: por %xmm3, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm2, %xmm6
-; SSE41-NEXT: movapd %xmm6, %xmm2
-; SSE41-NEXT: xorpd %xmm9, %xmm2
-; SSE41-NEXT: movdqa %xmm4, %xmm0
-; SSE41-NEXT: pxor %xmm9, %xmm0
-; SSE41-NEXT: movdqa %xmm8, %xmm3
-; SSE41-NEXT: pxor %xmm9, %xmm3
-; SSE41-NEXT: movdqa %xmm3, %xmm5
-; SSE41-NEXT: pcmpgtd %xmm0, %xmm5
-; SSE41-NEXT: pshufd {{.*#+}} xmm10 = xmm5[0,0,2,2]
-; SSE41-NEXT: pcmpeqd %xmm0, %xmm3
-; SSE41-NEXT: pshufd {{.*#+}} xmm3 = xmm3[1,1,3,3]
-; SSE41-NEXT: pand %xmm10, %xmm3
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm5[1,1,3,3]
-; SSE41-NEXT: por %xmm3, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm8, %xmm4
-; SSE41-NEXT: movapd %xmm4, %xmm0
-; SSE41-NEXT: xorpd %xmm9, %xmm0
-; SSE41-NEXT: movapd %xmm0, %xmm3
-; SSE41-NEXT: pcmpgtd %xmm2, %xmm3
-; SSE41-NEXT: pshufd {{.*#+}} xmm5 = xmm3[0,0,2,2]
-; SSE41-NEXT: pcmpeqd %xmm2, %xmm0
-; SSE41-NEXT: pshufd {{.*#+}} xmm2 = xmm0[1,1,3,3]
-; SSE41-NEXT: pand %xmm5, %xmm2
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm3[1,1,3,3]
-; SSE41-NEXT: por %xmm2, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm4, %xmm6
-; SSE41-NEXT: movapd %xmm6, %xmm0
-; SSE41-NEXT: xorpd %xmm9, %xmm0
-; SSE41-NEXT: movapd %xmm0, %xmm2
-; SSE41-NEXT: pcmpgtd %xmm1, %xmm2
-; SSE41-NEXT: pshufd {{.*#+}} xmm3 = xmm2[0,0,2,2]
-; SSE41-NEXT: pcmpeqd %xmm1, %xmm0
-; SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,3,3]
-; SSE41-NEXT: pand %xmm3, %xmm1
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,3,3]
-; SSE41-NEXT: por %xmm1, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm6, %xmm7
-; SSE41-NEXT: movapd %xmm7, %xmm0
-; SSE41-NEXT: xorpd %xmm9, %xmm0
-; SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm7[2,3,2,3]
-; SSE41-NEXT: pxor %xmm1, %xmm9
-; SSE41-NEXT: movapd %xmm0, %xmm2
-; SSE41-NEXT: pcmpgtd %xmm9, %xmm2
-; SSE41-NEXT: pmovsxdq %xmm2, %xmm3
-; SSE41-NEXT: pcmpeqd %xmm0, %xmm9
-; SSE41-NEXT: pshufd {{.*#+}} xmm4 = xmm9[1,1,3,3]
-; SSE41-NEXT: pand %xmm3, %xmm4
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,3,3]
-; SSE41-NEXT: por %xmm4, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm7, %xmm1
-; SSE41-NEXT: movq %xmm1, %rax
-; SSE41-NEXT: retq
-;
-; SSE42-LABEL: test_v16i64:
-; SSE42: # %bb.0:
-; SSE42-NEXT: movdqa %xmm0, %xmm8
-; SSE42-NEXT: movdqa {{.*#+}} xmm9 = [9223372036854775808,9223372036854775808]
-; SSE42-NEXT: movdqa %xmm7, %xmm10
-; SSE42-NEXT: pxor %xmm9, %xmm10
-; SSE42-NEXT: movdqa %xmm3, %xmm0
-; SSE42-NEXT: pxor %xmm9, %xmm0
-; SSE42-NEXT: pcmpgtq %xmm10, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm3, %xmm7
-; SSE42-NEXT: movapd %xmm7, %xmm3
-; SSE42-NEXT: xorpd %xmm9, %xmm3
-; SSE42-NEXT: movdqa %xmm5, %xmm10
-; SSE42-NEXT: pxor %xmm9, %xmm10
-; SSE42-NEXT: movdqa %xmm1, %xmm0
-; SSE42-NEXT: pxor %xmm9, %xmm0
-; SSE42-NEXT: pcmpgtq %xmm10, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm1, %xmm5
-; SSE42-NEXT: movapd %xmm5, %xmm0
-; SSE42-NEXT: xorpd %xmm9, %xmm0
-; SSE42-NEXT: pcmpgtq %xmm3, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm5, %xmm7
-; SSE42-NEXT: movapd %xmm7, %xmm1
-; SSE42-NEXT: xorpd %xmm9, %xmm1
-; SSE42-NEXT: movdqa %xmm6, %xmm3
-; SSE42-NEXT: pxor %xmm9, %xmm3
-; SSE42-NEXT: movdqa %xmm2, %xmm0
-; SSE42-NEXT: pxor %xmm9, %xmm0
-; SSE42-NEXT: pcmpgtq %xmm3, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm2, %xmm6
-; SSE42-NEXT: movapd %xmm6, %xmm2
-; SSE42-NEXT: xorpd %xmm9, %xmm2
-; SSE42-NEXT: movdqa %xmm4, %xmm3
-; SSE42-NEXT: pxor %xmm9, %xmm3
-; SSE42-NEXT: movdqa %xmm8, %xmm0
-; SSE42-NEXT: pxor %xmm9, %xmm0
-; SSE42-NEXT: pcmpgtq %xmm3, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm8, %xmm4
-; SSE42-NEXT: movapd %xmm4, %xmm0
-; SSE42-NEXT: xorpd %xmm9, %xmm0
-; SSE42-NEXT: pcmpgtq %xmm2, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm4, %xmm6
-; SSE42-NEXT: movapd %xmm6, %xmm0
-; SSE42-NEXT: xorpd %xmm9, %xmm0
-; SSE42-NEXT: pcmpgtq %xmm1, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm6, %xmm7
-; SSE42-NEXT: movapd %xmm7, %xmm0
-; SSE42-NEXT: xorpd %xmm9, %xmm0
-; SSE42-NEXT: pshufd {{.*#+}} xmm1 = xmm7[2,3,2,3]
-; SSE42-NEXT: pxor %xmm1, %xmm9
-; SSE42-NEXT: pcmpgtq %xmm9, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm7, %xmm1
-; SSE42-NEXT: movq %xmm1, %rax
-; SSE42-NEXT: retq
-;
-; AVX1-LABEL: test_v16i64:
-; AVX1: # %bb.0:
-; AVX1-NEXT: vextractf128 $1, %ymm3, %xmm5
-; AVX1-NEXT: vmovddup {{.*#+}} xmm4 = [9223372036854775808,9223372036854775808]
-; AVX1-NEXT: # xmm4 = mem[0,0]
-; AVX1-NEXT: vpxor %xmm4, %xmm5, %xmm6
-; AVX1-NEXT: vextractf128 $1, %ymm1, %xmm7
-; AVX1-NEXT: vpxor %xmm4, %xmm7, %xmm8
-; AVX1-NEXT: vpcmpgtq %xmm6, %xmm8, %xmm6
-; AVX1-NEXT: vblendvpd %xmm6, %xmm7, %xmm5, %xmm5
-; AVX1-NEXT: vxorpd %xmm4, %xmm5, %xmm6
-; AVX1-NEXT: vextractf128 $1, %ymm2, %xmm7
-; AVX1-NEXT: vpxor %xmm4, %xmm7, %xmm8
-; AVX1-NEXT: vextractf128 $1, %ymm0, %xmm9
-; AVX1-NEXT: vpxor %xmm4, %xmm9, %xmm10
-; AVX1-NEXT: vpcmpgtq %xmm8, %xmm10, %xmm8
-; AVX1-NEXT: vblendvpd %xmm8, %xmm9, %xmm7, %xmm7
-; AVX1-NEXT: vxorpd %xmm4, %xmm7, %xmm8
-; AVX1-NEXT: vpcmpgtq %xmm6, %xmm8, %xmm6
-; AVX1-NEXT: vblendvpd %xmm6, %xmm7, %xmm5, %xmm5
-; AVX1-NEXT: vxorpd %xmm4, %xmm5, %xmm6
-; AVX1-NEXT: vpxor %xmm4, %xmm3, %xmm7
-; AVX1-NEXT: vpxor %xmm4, %xmm1, %xmm8
-; AVX1-NEXT: vpcmpgtq %xmm7, %xmm8, %xmm7
-; AVX1-NEXT: vblendvpd %xmm7, %xmm1, %xmm3, %xmm1
-; AVX1-NEXT: vxorpd %xmm4, %xmm1, %xmm3
-; AVX1-NEXT: vpxor %xmm4, %xmm2, %xmm7
-; AVX1-NEXT: vpxor %xmm4, %xmm0, %xmm8
-; AVX1-NEXT: vpcmpgtq %xmm7, %xmm8, %xmm7
-; AVX1-NEXT: vblendvpd %xmm7, %xmm0, %xmm2, %xmm0
-; AVX1-NEXT: vxorpd %xmm4, %xmm0, %xmm2
-; AVX1-NEXT: vpcmpgtq %xmm3, %xmm2, %xmm2
-; AVX1-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
-; AVX1-NEXT: vxorpd %xmm4, %xmm0, %xmm1
-; AVX1-NEXT: vpcmpgtq %xmm6, %xmm1, %xmm1
-; AVX1-NEXT: vblendvpd %xmm1, %xmm0, %xmm5, %xmm0
-; AVX1-NEXT: vxorpd %xmm4, %xmm0, %xmm1
-; AVX1-NEXT: vshufps {{.*#+}} xmm2 = xmm0[2,3,2,3]
-; AVX1-NEXT: vxorpd %xmm4, %xmm2, %xmm3
-; AVX1-NEXT: vpcmpgtq %xmm3, %xmm1, %xmm1
-; AVX1-NEXT: vblendvpd %xmm1, %xmm0, %xmm2, %xmm0
-; AVX1-NEXT: vmovq %xmm0, %rax
-; AVX1-NEXT: vzeroupper
-; AVX1-NEXT: retq
-;
-; AVX2-LABEL: test_v16i64:
-; AVX2: # %bb.0:
-; AVX2-NEXT: vpbroadcastq {{.*#+}} ymm4 = [9223372036854775808,9223372036854775808,9223372036854775808,9223372036854775808]
-; AVX2-NEXT: vpxor %ymm4, %ymm3, %ymm5
-; AVX2-NEXT: vpxor %ymm4, %ymm1, %ymm6
-; AVX2-NEXT: vpcmpgtq %ymm5, %ymm6, %ymm5
-; AVX2-NEXT: vblendvpd %ymm5, %ymm1, %ymm3, %ymm1
-; AVX2-NEXT: vxorpd %ymm4, %ymm1, %ymm3
-; AVX2-NEXT: vpxor %ymm4, %ymm2, %ymm5
-; AVX2-NEXT: vpxor %ymm4, %ymm0, %ymm6
-; AVX2-NEXT: vpcmpgtq %ymm5, %ymm6, %ymm5
-; AVX2-NEXT: vblendvpd %ymm5, %ymm0, %ymm2, %ymm0
-; AVX2-NEXT: vxorpd %ymm4, %ymm0, %ymm2
-; AVX2-NEXT: vpcmpgtq %ymm3, %ymm2, %ymm2
-; AVX2-NEXT: vblendvpd %ymm2, %ymm0, %ymm1, %ymm0
-; AVX2-NEXT: vextractf128 $1, %ymm0, %xmm1
-; AVX2-NEXT: vxorpd %xmm4, %xmm1, %xmm2
-; AVX2-NEXT: vxorpd %xmm4, %xmm0, %xmm3
-; AVX2-NEXT: vpcmpgtq %xmm2, %xmm3, %xmm2
-; AVX2-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
-; AVX2-NEXT: vxorpd %xmm4, %xmm0, %xmm1
-; AVX2-NEXT: vshufps {{.*#+}} xmm2 = xmm0[2,3,2,3]
-; AVX2-NEXT: vxorpd %xmm4, %xmm2, %xmm3
-; AVX2-NEXT: vpcmpgtq %xmm3, %xmm1, %xmm1
-; AVX2-NEXT: vblendvpd %xmm1, %xmm0, %xmm2, %xmm0
-; AVX2-NEXT: vmovq %xmm0, %rax
-; AVX2-NEXT: vzeroupper
-; AVX2-NEXT: retq
+define i64 @test_v16i64(<16 x i64> %a0) nounwind {
+; X86-SSE2-LABEL: test_v16i64:
+; X86-SSE2: # %bb.0:
+; X86-SSE2-NEXT: pushl %ebp
+; X86-SSE2-NEXT: movl %esp, %ebp
+; X86-SSE2-NEXT: andl $-16, %esp
+; X86-SSE2-NEXT: subl $32, %esp
+; X86-SSE2-NEXT: movaps %xmm2, (%esp) # 16-byte Spill
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE2-NEXT: movdqa 40(%ebp), %xmm6
+; X86-SSE2-NEXT: movdqa {{.*#+}} xmm3 = [2147483648,2147483648,2147483648,2147483648]
+; X86-SSE2-NEXT: movdqa %xmm6, %xmm4
+; X86-SSE2-NEXT: pxor %xmm3, %xmm4
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm5
+; X86-SSE2-NEXT: pxor %xmm3, %xmm5
+; X86-SSE2-NEXT: movdqa %xmm5, %xmm7
+; X86-SSE2-NEXT: pcmpgtd %xmm4, %xmm7
+; X86-SSE2-NEXT: pcmpeqd %xmm4, %xmm5
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm4 = xmm7[0,0,2,2]
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm5[1,1,3,3]
+; X86-SSE2-NEXT: pand %xmm4, %xmm0
+; X86-SSE2-NEXT: movdqa 8(%ebp), %xmm5
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm4 = xmm7[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm0, %xmm4
+; X86-SSE2-NEXT: movdqa 72(%ebp), %xmm7
+; X86-SSE2-NEXT: pand %xmm4, %xmm1
+; X86-SSE2-NEXT: pandn %xmm6, %xmm4
+; X86-SSE2-NEXT: por %xmm1, %xmm4
+; X86-SSE2-NEXT: movdqa %xmm7, %xmm0
+; X86-SSE2-NEXT: pxor %xmm3, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm5, %xmm1
+; X86-SSE2-NEXT: pxor %xmm3, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm6
+; X86-SSE2-NEXT: pcmpgtd %xmm0, %xmm6
+; X86-SSE2-NEXT: pcmpeqd %xmm0, %xmm1
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,3,3]
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm6[0,0,2,2]
+; X86-SSE2-NEXT: pand %xmm1, %xmm0
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm6[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm0, %xmm1
+; X86-SSE2-NEXT: movdqa 24(%ebp), %xmm6
+; X86-SSE2-NEXT: pand %xmm1, %xmm5
+; X86-SSE2-NEXT: pandn %xmm7, %xmm1
+; X86-SSE2-NEXT: por %xmm5, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm6, %xmm0
+; X86-SSE2-NEXT: pxor %xmm3, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm5
+; X86-SSE2-NEXT: pxor %xmm3, %xmm5
+; X86-SSE2-NEXT: movdqa %xmm5, %xmm7
+; X86-SSE2-NEXT: pcmpgtd %xmm0, %xmm7
+; X86-SSE2-NEXT: pcmpeqd %xmm0, %xmm5
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm5[1,1,3,3]
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm5 = xmm7[0,0,2,2]
+; X86-SSE2-NEXT: pand %xmm5, %xmm0
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm5 = xmm7[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm0, %xmm5
+; X86-SSE2-NEXT: movdqa 56(%ebp), %xmm0
+; X86-SSE2-NEXT: pand %xmm5, %xmm2
+; X86-SSE2-NEXT: pandn %xmm6, %xmm5
+; X86-SSE2-NEXT: por %xmm2, %xmm5
+; X86-SSE2-NEXT: pxor %xmm3, %xmm0
+; X86-SSE2-NEXT: movdqa (%esp), %xmm7 # 16-byte Reload
+; X86-SSE2-NEXT: movdqa %xmm7, %xmm2
+; X86-SSE2-NEXT: pxor %xmm3, %xmm2
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm6
+; X86-SSE2-NEXT: pcmpgtd %xmm0, %xmm6
+; X86-SSE2-NEXT: pcmpeqd %xmm0, %xmm2
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,3,3]
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm6[0,0,2,2]
+; X86-SSE2-NEXT: pand %xmm2, %xmm0
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm6 = xmm6[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm0, %xmm6
+; X86-SSE2-NEXT: pand %xmm6, %xmm7
+; X86-SSE2-NEXT: movdqa 56(%ebp), %xmm2
+; X86-SSE2-NEXT: pandn %xmm2, %xmm6
+; X86-SSE2-NEXT: por %xmm7, %xmm6
+; X86-SSE2-NEXT: movdqa %xmm6, %xmm0
+; X86-SSE2-NEXT: pxor %xmm3, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm5, %xmm2
+; X86-SSE2-NEXT: pxor %xmm3, %xmm2
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm7
+; X86-SSE2-NEXT: pcmpgtd %xmm0, %xmm7
+; X86-SSE2-NEXT: pcmpeqd %xmm0, %xmm2
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm7[0,0,2,2]
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm2[1,1,3,3]
+; X86-SSE2-NEXT: pand %xmm0, %xmm2
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm7[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm2, %xmm0
+; X86-SSE2-NEXT: pand %xmm0, %xmm5
+; X86-SSE2-NEXT: pandn %xmm6, %xmm0
+; X86-SSE2-NEXT: por %xmm5, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm2
+; X86-SSE2-NEXT: pxor %xmm3, %xmm2
+; X86-SSE2-NEXT: movdqa %xmm4, %xmm5
+; X86-SSE2-NEXT: pxor %xmm3, %xmm5
+; X86-SSE2-NEXT: movdqa %xmm5, %xmm6
+; X86-SSE2-NEXT: pcmpgtd %xmm2, %xmm6
+; X86-SSE2-NEXT: pcmpeqd %xmm2, %xmm5
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm6[0,0,2,2]
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm5 = xmm5[1,1,3,3]
+; X86-SSE2-NEXT: pand %xmm2, %xmm5
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm6[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm5, %xmm2
+; X86-SSE2-NEXT: pand %xmm2, %xmm4
+; X86-SSE2-NEXT: pandn %xmm1, %xmm2
+; X86-SSE2-NEXT: por %xmm4, %xmm2
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm1
+; X86-SSE2-NEXT: pxor %xmm3, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm4
+; X86-SSE2-NEXT: pxor %xmm3, %xmm4
+; X86-SSE2-NEXT: movdqa %xmm4, %xmm5
+; X86-SSE2-NEXT: pcmpgtd %xmm1, %xmm5
+; X86-SSE2-NEXT: pcmpeqd %xmm1, %xmm4
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm5[0,0,2,2]
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm4 = xmm4[1,1,3,3]
+; X86-SSE2-NEXT: pand %xmm1, %xmm4
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm5[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm4, %xmm1
+; X86-SSE2-NEXT: pand %xmm1, %xmm0
+; X86-SSE2-NEXT: pandn %xmm2, %xmm1
+; X86-SSE2-NEXT: por %xmm0, %xmm1
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm2
+; X86-SSE2-NEXT: pxor %xmm3, %xmm2
+; X86-SSE2-NEXT: pxor %xmm0, %xmm3
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm4
+; X86-SSE2-NEXT: pcmpgtd %xmm3, %xmm4
+; X86-SSE2-NEXT: pcmpeqd %xmm2, %xmm3
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm4[0,0,2,2]
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm3 = xmm3[1,1,3,3]
+; X86-SSE2-NEXT: pand %xmm2, %xmm3
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm4[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm3, %xmm2
+; X86-SSE2-NEXT: pand %xmm2, %xmm1
+; X86-SSE2-NEXT: pandn %xmm0, %xmm2
+; X86-SSE2-NEXT: por %xmm1, %xmm2
+; X86-SSE2-NEXT: movd %xmm2, %eax
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,1,1]
+; X86-SSE2-NEXT: movd %xmm0, %edx
+; X86-SSE2-NEXT: movl %ebp, %esp
+; X86-SSE2-NEXT: popl %ebp
+; X86-SSE2-NEXT: retl
+;
+; X64-SSE2-LABEL: test_v16i64:
+; X64-SSE2: # %bb.0:
+; X64-SSE2-NEXT: movdqa {{.*#+}} xmm8 = [9223372039002259456,9223372039002259456]
+; X64-SSE2-NEXT: movdqa %xmm7, %xmm9
+; X64-SSE2-NEXT: pxor %xmm8, %xmm9
+; X64-SSE2-NEXT: movdqa %xmm3, %xmm10
+; X64-SSE2-NEXT: pxor %xmm8, %xmm10
+; X64-SSE2-NEXT: movdqa %xmm10, %xmm11
+; X64-SSE2-NEXT: pcmpgtd %xmm9, %xmm11
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm12 = xmm11[0,0,2,2]
+; X64-SSE2-NEXT: pcmpeqd %xmm9, %xmm10
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm10 = xmm10[1,1,3,3]
+; X64-SSE2-NEXT: pand %xmm12, %xmm10
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm9 = xmm11[1,1,3,3]
+; X64-SSE2-NEXT: por %xmm10, %xmm9
+; X64-SSE2-NEXT: pand %xmm9, %xmm3
+; X64-SSE2-NEXT: pandn %xmm7, %xmm9
+; X64-SSE2-NEXT: por %xmm3, %xmm9
+; X64-SSE2-NEXT: movdqa %xmm9, %xmm3
+; X64-SSE2-NEXT: pxor %xmm8, %xmm3
+; X64-SSE2-NEXT: movdqa %xmm5, %xmm7
+; X64-SSE2-NEXT: pxor %xmm8, %xmm7
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm10
+; X64-SSE2-NEXT: pxor %xmm8, %xmm10
+; X64-SSE2-NEXT: movdqa %xmm10, %xmm11
+; X64-SSE2-NEXT: pcmpgtd %xmm7, %xmm11
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm12 = xmm11[0,0,2,2]
+; X64-SSE2-NEXT: pcmpeqd %xmm7, %xmm10
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm7 = xmm10[1,1,3,3]
+; X64-SSE2-NEXT: pand %xmm12, %xmm7
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm10 = xmm11[1,1,3,3]
+; X64-SSE2-NEXT: por %xmm7, %xmm10
+; X64-SSE2-NEXT: pand %xmm10, %xmm1
+; X64-SSE2-NEXT: pandn %xmm5, %xmm10
+; X64-SSE2-NEXT: por %xmm1, %xmm10
+; X64-SSE2-NEXT: movdqa %xmm10, %xmm1
+; X64-SSE2-NEXT: pxor %xmm8, %xmm1
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm5
+; X64-SSE2-NEXT: pcmpgtd %xmm3, %xmm5
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm7 = xmm5[0,0,2,2]
+; X64-SSE2-NEXT: pcmpeqd %xmm3, %xmm1
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm3 = xmm1[1,1,3,3]
+; X64-SSE2-NEXT: pand %xmm7, %xmm3
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm5[1,1,3,3]
+; X64-SSE2-NEXT: por %xmm3, %xmm1
+; X64-SSE2-NEXT: pand %xmm1, %xmm10
+; X64-SSE2-NEXT: pandn %xmm9, %xmm1
+; X64-SSE2-NEXT: por %xmm10, %xmm1
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm3
+; X64-SSE2-NEXT: pxor %xmm8, %xmm3
+; X64-SSE2-NEXT: movdqa %xmm6, %xmm5
+; X64-SSE2-NEXT: pxor %xmm8, %xmm5
+; X64-SSE2-NEXT: movdqa %xmm2, %xmm7
+; X64-SSE2-NEXT: pxor %xmm8, %xmm7
+; X64-SSE2-NEXT: movdqa %xmm7, %xmm9
+; X64-SSE2-NEXT: pcmpgtd %xmm5, %xmm9
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm10 = xmm9[0,0,2,2]
+; X64-SSE2-NEXT: pcmpeqd %xmm5, %xmm7
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm7 = xmm7[1,1,3,3]
+; X64-SSE2-NEXT: pand %xmm10, %xmm7
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm5 = xmm9[1,1,3,3]
+; X64-SSE2-NEXT: por %xmm7, %xmm5
+; X64-SSE2-NEXT: pand %xmm5, %xmm2
+; X64-SSE2-NEXT: pandn %xmm6, %xmm5
+; X64-SSE2-NEXT: por %xmm2, %xmm5
+; X64-SSE2-NEXT: movdqa %xmm5, %xmm2
+; X64-SSE2-NEXT: pxor %xmm8, %xmm2
+; X64-SSE2-NEXT: movdqa %xmm4, %xmm6
+; X64-SSE2-NEXT: pxor %xmm8, %xmm6
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm7
+; X64-SSE2-NEXT: pxor %xmm8, %xmm7
+; X64-SSE2-NEXT: movdqa %xmm7, %xmm9
+; X64-SSE2-NEXT: pcmpgtd %xmm6, %xmm9
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm10 = xmm9[0,0,2,2]
+; X64-SSE2-NEXT: pcmpeqd %xmm6, %xmm7
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm6 = xmm7[1,1,3,3]
+; X64-SSE2-NEXT: pand %xmm10, %xmm6
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm7 = xmm9[1,1,3,3]
+; X64-SSE2-NEXT: por %xmm6, %xmm7
+; X64-SSE2-NEXT: pand %xmm7, %xmm0
+; X64-SSE2-NEXT: pandn %xmm4, %xmm7
+; X64-SSE2-NEXT: por %xmm0, %xmm7
+; X64-SSE2-NEXT: movdqa %xmm7, %xmm0
+; X64-SSE2-NEXT: pxor %xmm8, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm4
+; X64-SSE2-NEXT: pcmpgtd %xmm2, %xmm4
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm6 = xmm4[0,0,2,2]
+; X64-SSE2-NEXT: pcmpeqd %xmm2, %xmm0
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm0[1,1,3,3]
+; X64-SSE2-NEXT: pand %xmm6, %xmm0
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm4[1,1,3,3]
+; X64-SSE2-NEXT: por %xmm0, %xmm2
+; X64-SSE2-NEXT: pand %xmm2, %xmm7
+; X64-SSE2-NEXT: pandn %xmm5, %xmm2
+; X64-SSE2-NEXT: por %xmm7, %xmm2
+; X64-SSE2-NEXT: pxor %xmm2, %xmm8
+; X64-SSE2-NEXT: movdqa %xmm8, %xmm0
+; X64-SSE2-NEXT: pcmpgtd %xmm3, %xmm0
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm4 = xmm0[0,0,2,2]
+; X64-SSE2-NEXT: pcmpeqd %xmm3, %xmm8
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm3 = xmm8[1,1,3,3]
+; X64-SSE2-NEXT: pand %xmm4, %xmm3
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm0[1,1,3,3]
+; X64-SSE2-NEXT: por %xmm3, %xmm0
+; X64-SSE2-NEXT: pand %xmm0, %xmm2
+; X64-SSE2-NEXT: pandn %xmm1, %xmm0
+; X64-SSE2-NEXT: por %xmm2, %xmm0
+; X64-SSE2-NEXT: movq %xmm0, %rcx
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm0[2,3,2,3]
+; X64-SSE2-NEXT: movq %xmm0, %rax
+; X64-SSE2-NEXT: cmpq %rax, %rcx
+; X64-SSE2-NEXT: cmovaq %rcx, %rax
+; X64-SSE2-NEXT: retq
+;
+; X86-SSE41-LABEL: test_v16i64:
+; X86-SSE41: # %bb.0:
+; X86-SSE41-NEXT: pushl %ebp
+; X86-SSE41-NEXT: movl %esp, %ebp
+; X86-SSE41-NEXT: andl $-16, %esp
+; X86-SSE41-NEXT: subl $48, %esp
+; X86-SSE41-NEXT: movaps %xmm2, (%esp) # 16-byte Spill
+; X86-SSE41-NEXT: movdqa %xmm0, %xmm3
+; X86-SSE41-NEXT: movdqa 40(%ebp), %xmm2
+; X86-SSE41-NEXT: movdqa {{.*#+}} xmm4 = [2147483648,2147483648,2147483648,2147483648]
+; X86-SSE41-NEXT: movdqa %xmm2, %xmm0
+; X86-SSE41-NEXT: movdqa %xmm2, %xmm6
+; X86-SSE41-NEXT: pxor %xmm4, %xmm0
+; X86-SSE41-NEXT: movdqa %xmm1, %xmm2
+; X86-SSE41-NEXT: pxor %xmm4, %xmm2
+; X86-SSE41-NEXT: movdqa %xmm2, %xmm5
+; X86-SSE41-NEXT: pcmpgtd %xmm0, %xmm5
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm2
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm5[0,0,2,2]
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm7 = xmm2[1,1,3,3]
+; X86-SSE41-NEXT: pand %xmm0, %xmm7
+; X86-SSE41-NEXT: movdqa 8(%ebp), %xmm2
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm5[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm7, %xmm0
+; X86-SSE41-NEXT: movdqa 72(%ebp), %xmm5
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm1, %xmm6
+; X86-SSE41-NEXT: movapd %xmm6, {{[-0-9]+}}(%e{{[sb]}}p) # 16-byte Spill
+; X86-SSE41-NEXT: movdqa %xmm5, %xmm0
+; X86-SSE41-NEXT: pxor %xmm4, %xmm0
+; X86-SSE41-NEXT: movdqa %xmm2, %xmm1
+; X86-SSE41-NEXT: pxor %xmm4, %xmm1
+; X86-SSE41-NEXT: movdqa %xmm1, %xmm7
+; X86-SSE41-NEXT: pcmpgtd %xmm0, %xmm7
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm1
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm1[1,1,3,3]
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm7[0,0,2,2]
+; X86-SSE41-NEXT: pand %xmm0, %xmm1
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm7[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm1, %xmm0
+; X86-SSE41-NEXT: movdqa 24(%ebp), %xmm7
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm2, %xmm5
+; X86-SSE41-NEXT: movdqa %xmm7, %xmm0
+; X86-SSE41-NEXT: pxor %xmm4, %xmm0
+; X86-SSE41-NEXT: movdqa %xmm3, %xmm1
+; X86-SSE41-NEXT: pxor %xmm4, %xmm1
+; X86-SSE41-NEXT: movdqa %xmm1, %xmm2
+; X86-SSE41-NEXT: pcmpgtd %xmm0, %xmm2
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm1
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm1[1,1,3,3]
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm2[0,0,2,2]
+; X86-SSE41-NEXT: pand %xmm0, %xmm1
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm1, %xmm0
+; X86-SSE41-NEXT: movdqa 56(%ebp), %xmm1
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm3, %xmm7
+; X86-SSE41-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE41-NEXT: pxor %xmm4, %xmm0
+; X86-SSE41-NEXT: movdqa (%esp), %xmm6 # 16-byte Reload
+; X86-SSE41-NEXT: movdqa %xmm6, %xmm2
+; X86-SSE41-NEXT: pxor %xmm4, %xmm2
+; X86-SSE41-NEXT: movdqa %xmm2, %xmm3
+; X86-SSE41-NEXT: pcmpgtd %xmm0, %xmm3
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm2
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm2 = xmm2[1,1,3,3]
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm3[0,0,2,2]
+; X86-SSE41-NEXT: pand %xmm0, %xmm2
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm3[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm2, %xmm0
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm6, %xmm1
+; X86-SSE41-NEXT: movapd %xmm1, %xmm0
+; X86-SSE41-NEXT: xorpd %xmm4, %xmm0
+; X86-SSE41-NEXT: movapd %xmm7, %xmm2
+; X86-SSE41-NEXT: xorpd %xmm4, %xmm2
+; X86-SSE41-NEXT: movapd %xmm2, %xmm3
+; X86-SSE41-NEXT: pcmpgtd %xmm0, %xmm3
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm2
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm3[0,0,2,2]
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm2 = xmm2[1,1,3,3]
+; X86-SSE41-NEXT: pand %xmm0, %xmm2
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm3[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm2, %xmm0
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm7, %xmm1
+; X86-SSE41-NEXT: movapd %xmm5, %xmm0
+; X86-SSE41-NEXT: xorpd %xmm4, %xmm0
+; X86-SSE41-NEXT: movdqa {{[-0-9]+}}(%e{{[sb]}}p), %xmm6 # 16-byte Reload
+; X86-SSE41-NEXT: movdqa %xmm6, %xmm2
+; X86-SSE41-NEXT: pxor %xmm4, %xmm2
+; X86-SSE41-NEXT: movdqa %xmm2, %xmm3
+; X86-SSE41-NEXT: pcmpgtd %xmm0, %xmm3
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm2
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm3[0,0,2,2]
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm2 = xmm2[1,1,3,3]
+; X86-SSE41-NEXT: pand %xmm0, %xmm2
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm3[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm2, %xmm0
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm6, %xmm5
+; X86-SSE41-NEXT: movapd %xmm5, %xmm0
+; X86-SSE41-NEXT: xorpd %xmm4, %xmm0
+; X86-SSE41-NEXT: movapd %xmm1, %xmm2
+; X86-SSE41-NEXT: xorpd %xmm4, %xmm2
+; X86-SSE41-NEXT: movapd %xmm2, %xmm3
+; X86-SSE41-NEXT: pcmpgtd %xmm0, %xmm3
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm2
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm3[0,0,2,2]
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm2 = xmm2[1,1,3,3]
+; X86-SSE41-NEXT: pand %xmm0, %xmm2
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm3[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm2, %xmm0
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm1, %xmm5
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm5[2,3,2,3]
+; X86-SSE41-NEXT: movdqa %xmm5, %xmm0
+; X86-SSE41-NEXT: pxor %xmm4, %xmm0
+; X86-SSE41-NEXT: pxor %xmm1, %xmm4
+; X86-SSE41-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE41-NEXT: pcmpgtd %xmm4, %xmm2
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm4
+; X86-SSE41-NEXT: pmovsxdq %xmm2, %xmm0
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm3 = xmm4[1,1,3,3]
+; X86-SSE41-NEXT: pand %xmm0, %xmm3
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm3, %xmm0
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm5, %xmm1
+; X86-SSE41-NEXT: movd %xmm1, %eax
+; X86-SSE41-NEXT: pextrd $1, %xmm1, %edx
+; X86-SSE41-NEXT: movl %ebp, %esp
+; X86-SSE41-NEXT: popl %ebp
+; X86-SSE41-NEXT: retl
+;
+; X64-SSE41-LABEL: test_v16i64:
+; X64-SSE41: # %bb.0:
+; X64-SSE41-NEXT: movdqa %xmm0, %xmm8
+; X64-SSE41-NEXT: movdqa {{.*#+}} xmm9 = [9223372039002259456,9223372039002259456]
+; X64-SSE41-NEXT: movdqa %xmm7, %xmm0
+; X64-SSE41-NEXT: pxor %xmm9, %xmm0
+; X64-SSE41-NEXT: movdqa %xmm3, %xmm10
+; X64-SSE41-NEXT: pxor %xmm9, %xmm10
+; X64-SSE41-NEXT: movdqa %xmm10, %xmm11
+; X64-SSE41-NEXT: pcmpgtd %xmm0, %xmm11
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm12 = xmm11[0,0,2,2]
+; X64-SSE41-NEXT: pcmpeqd %xmm0, %xmm10
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm10 = xmm10[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm12, %xmm10
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm11[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm10, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm3, %xmm7
+; X64-SSE41-NEXT: movapd %xmm7, %xmm3
+; X64-SSE41-NEXT: xorpd %xmm9, %xmm3
+; X64-SSE41-NEXT: movdqa %xmm5, %xmm0
+; X64-SSE41-NEXT: pxor %xmm9, %xmm0
+; X64-SSE41-NEXT: movdqa %xmm1, %xmm10
+; X64-SSE41-NEXT: pxor %xmm9, %xmm10
+; X64-SSE41-NEXT: movdqa %xmm10, %xmm11
+; X64-SSE41-NEXT: pcmpgtd %xmm0, %xmm11
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm12 = xmm11[0,0,2,2]
+; X64-SSE41-NEXT: pcmpeqd %xmm0, %xmm10
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm10 = xmm10[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm12, %xmm10
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm11[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm10, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm1, %xmm5
+; X64-SSE41-NEXT: movapd %xmm5, %xmm0
+; X64-SSE41-NEXT: xorpd %xmm9, %xmm0
+; X64-SSE41-NEXT: movapd %xmm0, %xmm1
+; X64-SSE41-NEXT: pcmpgtd %xmm3, %xmm1
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm10 = xmm1[0,0,2,2]
+; X64-SSE41-NEXT: pcmpeqd %xmm3, %xmm0
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm3 = xmm0[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm10, %xmm3
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm3, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm5, %xmm7
+; X64-SSE41-NEXT: movapd %xmm7, %xmm1
+; X64-SSE41-NEXT: xorpd %xmm9, %xmm1
+; X64-SSE41-NEXT: movdqa %xmm6, %xmm0
+; X64-SSE41-NEXT: pxor %xmm9, %xmm0
+; X64-SSE41-NEXT: movdqa %xmm2, %xmm3
+; X64-SSE41-NEXT: pxor %xmm9, %xmm3
+; X64-SSE41-NEXT: movdqa %xmm3, %xmm5
+; X64-SSE41-NEXT: pcmpgtd %xmm0, %xmm5
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm10 = xmm5[0,0,2,2]
+; X64-SSE41-NEXT: pcmpeqd %xmm0, %xmm3
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm3 = xmm3[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm10, %xmm3
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm5[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm3, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm2, %xmm6
+; X64-SSE41-NEXT: movapd %xmm6, %xmm2
+; X64-SSE41-NEXT: xorpd %xmm9, %xmm2
+; X64-SSE41-NEXT: movdqa %xmm4, %xmm0
+; X64-SSE41-NEXT: pxor %xmm9, %xmm0
+; X64-SSE41-NEXT: movdqa %xmm8, %xmm3
+; X64-SSE41-NEXT: pxor %xmm9, %xmm3
+; X64-SSE41-NEXT: movdqa %xmm3, %xmm5
+; X64-SSE41-NEXT: pcmpgtd %xmm0, %xmm5
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm10 = xmm5[0,0,2,2]
+; X64-SSE41-NEXT: pcmpeqd %xmm0, %xmm3
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm3 = xmm3[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm10, %xmm3
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm5[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm3, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm8, %xmm4
+; X64-SSE41-NEXT: movapd %xmm4, %xmm0
+; X64-SSE41-NEXT: xorpd %xmm9, %xmm0
+; X64-SSE41-NEXT: movapd %xmm0, %xmm3
+; X64-SSE41-NEXT: pcmpgtd %xmm2, %xmm3
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm5 = xmm3[0,0,2,2]
+; X64-SSE41-NEXT: pcmpeqd %xmm2, %xmm0
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm2 = xmm0[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm5, %xmm2
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm3[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm2, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm4, %xmm6
+; X64-SSE41-NEXT: movapd %xmm6, %xmm0
+; X64-SSE41-NEXT: xorpd %xmm9, %xmm0
+; X64-SSE41-NEXT: movapd %xmm0, %xmm2
+; X64-SSE41-NEXT: pcmpgtd %xmm1, %xmm2
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm3 = xmm2[0,0,2,2]
+; X64-SSE41-NEXT: pcmpeqd %xmm1, %xmm0
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm3, %xmm1
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm1, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm6, %xmm7
+; X64-SSE41-NEXT: movapd %xmm7, %xmm0
+; X64-SSE41-NEXT: xorpd %xmm9, %xmm0
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm7[2,3,2,3]
+; X64-SSE41-NEXT: pxor %xmm1, %xmm9
+; X64-SSE41-NEXT: movapd %xmm0, %xmm2
+; X64-SSE41-NEXT: pcmpgtd %xmm9, %xmm2
+; X64-SSE41-NEXT: pmovsxdq %xmm2, %xmm3
+; X64-SSE41-NEXT: pcmpeqd %xmm0, %xmm9
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm4 = xmm9[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm3, %xmm4
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm4, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm7, %xmm1
+; X64-SSE41-NEXT: movq %xmm1, %rax
+; X64-SSE41-NEXT: retq
+;
+; X86-SSE42-LABEL: test_v16i64:
+; X86-SSE42: # %bb.0:
+; X86-SSE42-NEXT: pushl %ebp
+; X86-SSE42-NEXT: movl %esp, %ebp
+; X86-SSE42-NEXT: andl $-16, %esp
+; X86-SSE42-NEXT: subl $16, %esp
+; X86-SSE42-NEXT: movdqa %xmm0, %xmm3
+; X86-SSE42-NEXT: movdqa 8(%ebp), %xmm7
+; X86-SSE42-NEXT: movdqa 40(%ebp), %xmm6
+; X86-SSE42-NEXT: movdqa {{.*#+}} xmm4 = [0,2147483648,0,2147483648]
+; X86-SSE42-NEXT: movdqa %xmm6, %xmm5
+; X86-SSE42-NEXT: pxor %xmm4, %xmm5
+; X86-SSE42-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE42-NEXT: pxor %xmm4, %xmm0
+; X86-SSE42-NEXT: pcmpgtq %xmm5, %xmm0
+; X86-SSE42-NEXT: movdqa 72(%ebp), %xmm5
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm1, %xmm6
+; X86-SSE42-NEXT: movdqa %xmm5, %xmm1
+; X86-SSE42-NEXT: pxor %xmm4, %xmm1
+; X86-SSE42-NEXT: movdqa %xmm7, %xmm0
+; X86-SSE42-NEXT: pxor %xmm4, %xmm0
+; X86-SSE42-NEXT: pcmpgtq %xmm1, %xmm0
+; X86-SSE42-NEXT: movdqa 24(%ebp), %xmm7
+; X86-SSE42-NEXT: movapd 8(%ebp), %xmm1
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm1, %xmm5
+; X86-SSE42-NEXT: movdqa %xmm7, %xmm1
+; X86-SSE42-NEXT: pxor %xmm4, %xmm1
+; X86-SSE42-NEXT: movdqa %xmm3, %xmm0
+; X86-SSE42-NEXT: pxor %xmm4, %xmm0
+; X86-SSE42-NEXT: pcmpgtq %xmm1, %xmm0
+; X86-SSE42-NEXT: movdqa 56(%ebp), %xmm1
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm3, %xmm7
+; X86-SSE42-NEXT: movdqa %xmm1, %xmm3
+; X86-SSE42-NEXT: pxor %xmm4, %xmm3
+; X86-SSE42-NEXT: movdqa %xmm2, %xmm0
+; X86-SSE42-NEXT: pxor %xmm4, %xmm0
+; X86-SSE42-NEXT: pcmpgtq %xmm3, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm2, %xmm1
+; X86-SSE42-NEXT: movapd %xmm1, %xmm2
+; X86-SSE42-NEXT: xorpd %xmm4, %xmm2
+; X86-SSE42-NEXT: movapd %xmm7, %xmm0
+; X86-SSE42-NEXT: xorpd %xmm4, %xmm0
+; X86-SSE42-NEXT: pcmpgtq %xmm2, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm7, %xmm1
+; X86-SSE42-NEXT: movapd %xmm5, %xmm2
+; X86-SSE42-NEXT: xorpd %xmm4, %xmm2
+; X86-SSE42-NEXT: movapd %xmm6, %xmm0
+; X86-SSE42-NEXT: xorpd %xmm4, %xmm0
+; X86-SSE42-NEXT: pcmpgtq %xmm2, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm6, %xmm5
+; X86-SSE42-NEXT: movapd %xmm5, %xmm2
+; X86-SSE42-NEXT: xorpd %xmm4, %xmm2
+; X86-SSE42-NEXT: movapd %xmm1, %xmm0
+; X86-SSE42-NEXT: xorpd %xmm4, %xmm0
+; X86-SSE42-NEXT: pcmpgtq %xmm2, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm1, %xmm5
+; X86-SSE42-NEXT: pshufd {{.*#+}} xmm1 = xmm5[2,3,2,3]
+; X86-SSE42-NEXT: movdqa %xmm5, %xmm0
+; X86-SSE42-NEXT: pxor %xmm4, %xmm0
+; X86-SSE42-NEXT: pxor %xmm1, %xmm4
+; X86-SSE42-NEXT: pcmpgtq %xmm4, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm5, %xmm1
+; X86-SSE42-NEXT: movd %xmm1, %eax
+; X86-SSE42-NEXT: pextrd $1, %xmm1, %edx
+; X86-SSE42-NEXT: movl %ebp, %esp
+; X86-SSE42-NEXT: popl %ebp
+; X86-SSE42-NEXT: retl
+;
+; X64-SSE42-LABEL: test_v16i64:
+; X64-SSE42: # %bb.0:
+; X64-SSE42-NEXT: movdqa %xmm0, %xmm8
+; X64-SSE42-NEXT: movdqa {{.*#+}} xmm9 = [9223372036854775808,9223372036854775808]
+; X64-SSE42-NEXT: movdqa %xmm7, %xmm10
+; X64-SSE42-NEXT: pxor %xmm9, %xmm10
+; X64-SSE42-NEXT: movdqa %xmm3, %xmm0
+; X64-SSE42-NEXT: pxor %xmm9, %xmm0
+; X64-SSE42-NEXT: pcmpgtq %xmm10, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm3, %xmm7
+; X64-SSE42-NEXT: movapd %xmm7, %xmm3
+; X64-SSE42-NEXT: xorpd %xmm9, %xmm3
+; X64-SSE42-NEXT: movdqa %xmm5, %xmm10
+; X64-SSE42-NEXT: pxor %xmm9, %xmm10
+; X64-SSE42-NEXT: movdqa %xmm1, %xmm0
+; X64-SSE42-NEXT: pxor %xmm9, %xmm0
+; X64-SSE42-NEXT: pcmpgtq %xmm10, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm1, %xmm5
+; X64-SSE42-NEXT: movapd %xmm5, %xmm0
+; X64-SSE42-NEXT: xorpd %xmm9, %xmm0
+; X64-SSE42-NEXT: pcmpgtq %xmm3, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm5, %xmm7
+; X64-SSE42-NEXT: movapd %xmm7, %xmm1
+; X64-SSE42-NEXT: xorpd %xmm9, %xmm1
+; X64-SSE42-NEXT: movdqa %xmm6, %xmm3
+; X64-SSE42-NEXT: pxor %xmm9, %xmm3
+; X64-SSE42-NEXT: movdqa %xmm2, %xmm0
+; X64-SSE42-NEXT: pxor %xmm9, %xmm0
+; X64-SSE42-NEXT: pcmpgtq %xmm3, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm2, %xmm6
+; X64-SSE42-NEXT: movapd %xmm6, %xmm2
+; X64-SSE42-NEXT: xorpd %xmm9, %xmm2
+; X64-SSE42-NEXT: movdqa %xmm4, %xmm3
+; X64-SSE42-NEXT: pxor %xmm9, %xmm3
+; X64-SSE42-NEXT: movdqa %xmm8, %xmm0
+; X64-SSE42-NEXT: pxor %xmm9, %xmm0
+; X64-SSE42-NEXT: pcmpgtq %xmm3, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm8, %xmm4
+; X64-SSE42-NEXT: movapd %xmm4, %xmm0
+; X64-SSE42-NEXT: xorpd %xmm9, %xmm0
+; X64-SSE42-NEXT: pcmpgtq %xmm2, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm4, %xmm6
+; X64-SSE42-NEXT: movapd %xmm6, %xmm0
+; X64-SSE42-NEXT: xorpd %xmm9, %xmm0
+; X64-SSE42-NEXT: pcmpgtq %xmm1, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm6, %xmm7
+; X64-SSE42-NEXT: movapd %xmm7, %xmm0
+; X64-SSE42-NEXT: xorpd %xmm9, %xmm0
+; X64-SSE42-NEXT: pshufd {{.*#+}} xmm1 = xmm7[2,3,2,3]
+; X64-SSE42-NEXT: pxor %xmm1, %xmm9
+; X64-SSE42-NEXT: pcmpgtq %xmm9, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm7, %xmm1
+; X64-SSE42-NEXT: movq %xmm1, %rax
+; X64-SSE42-NEXT: retq
+;
+; X86-AVX1-LABEL: test_v16i64:
+; X86-AVX1: # %bb.0:
+; X86-AVX1-NEXT: pushl %ebp
+; X86-AVX1-NEXT: movl %esp, %ebp
+; X86-AVX1-NEXT: andl $-32, %esp
+; X86-AVX1-NEXT: subl $32, %esp
+; X86-AVX1-NEXT: vextractf128 $1, %ymm2, %xmm4
+; X86-AVX1-NEXT: vmovddup {{.*#+}} xmm3 = [0,2147483648,0,2147483648]
+; X86-AVX1-NEXT: # xmm3 = mem[0,0]
+; X86-AVX1-NEXT: vxorps %xmm3, %xmm4, %xmm5
+; X86-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm6
+; X86-AVX1-NEXT: vxorps %xmm3, %xmm6, %xmm7
+; X86-AVX1-NEXT: vpcmpgtq %xmm5, %xmm7, %xmm5
+; X86-AVX1-NEXT: vblendvpd %xmm5, %xmm6, %xmm4, %xmm4
+; X86-AVX1-NEXT: vxorps 24(%ebp), %xmm3, %xmm6
+; X86-AVX1-NEXT: vextractf128 $1, %ymm1, %xmm7
+; X86-AVX1-NEXT: vxorps %xmm3, %xmm7, %xmm5
+; X86-AVX1-NEXT: vpcmpgtq %xmm6, %xmm5, %xmm5
+; X86-AVX1-NEXT: vmovapd 24(%ebp), %xmm6
+; X86-AVX1-NEXT: vblendvpd %xmm5, %xmm7, %xmm6, %xmm5
+; X86-AVX1-NEXT: vxorps %xmm3, %xmm2, %xmm6
+; X86-AVX1-NEXT: vxorps %xmm3, %xmm0, %xmm7
+; X86-AVX1-NEXT: vpcmpgtq %xmm6, %xmm7, %xmm6
+; X86-AVX1-NEXT: vmovaps 8(%ebp), %xmm7
+; X86-AVX1-NEXT: vblendvpd %xmm6, %xmm0, %xmm2, %xmm0
+; X86-AVX1-NEXT: vxorps %xmm3, %xmm7, %xmm2
+; X86-AVX1-NEXT: vxorps %xmm3, %xmm1, %xmm6
+; X86-AVX1-NEXT: vpcmpgtq %xmm2, %xmm6, %xmm2
+; X86-AVX1-NEXT: vblendvpd %xmm2, %xmm1, %xmm7, %xmm1
+; X86-AVX1-NEXT: vxorpd %xmm3, %xmm1, %xmm2
+; X86-AVX1-NEXT: vxorpd %xmm3, %xmm0, %xmm6
+; X86-AVX1-NEXT: vpcmpgtq %xmm2, %xmm6, %xmm2
+; X86-AVX1-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X86-AVX1-NEXT: vxorpd %xmm3, %xmm5, %xmm1
+; X86-AVX1-NEXT: vxorpd %xmm3, %xmm4, %xmm2
+; X86-AVX1-NEXT: vpcmpgtq %xmm1, %xmm2, %xmm1
+; X86-AVX1-NEXT: vblendvpd %xmm1, %xmm4, %xmm5, %xmm1
+; X86-AVX1-NEXT: vxorpd %xmm3, %xmm1, %xmm2
+; X86-AVX1-NEXT: vxorpd %xmm3, %xmm0, %xmm4
+; X86-AVX1-NEXT: vpcmpgtq %xmm2, %xmm4, %xmm2
+; X86-AVX1-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X86-AVX1-NEXT: vshufps {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-AVX1-NEXT: vxorpd %xmm3, %xmm0, %xmm2
+; X86-AVX1-NEXT: vxorpd %xmm3, %xmm1, %xmm3
+; X86-AVX1-NEXT: vpcmpgtq %xmm3, %xmm2, %xmm2
+; X86-AVX1-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X86-AVX1-NEXT: vmovd %xmm0, %eax
+; X86-AVX1-NEXT: vpextrd $1, %xmm0, %edx
+; X86-AVX1-NEXT: movl %ebp, %esp
+; X86-AVX1-NEXT: popl %ebp
+; X86-AVX1-NEXT: vzeroupper
+; X86-AVX1-NEXT: retl
+;
+; X64-AVX1-LABEL: test_v16i64:
+; X64-AVX1: # %bb.0:
+; X64-AVX1-NEXT: vextractf128 $1, %ymm3, %xmm5
+; X64-AVX1-NEXT: vmovddup {{.*#+}} xmm4 = [9223372036854775808,9223372036854775808]
+; X64-AVX1-NEXT: # xmm4 = mem[0,0]
+; X64-AVX1-NEXT: vpxor %xmm4, %xmm5, %xmm6
+; X64-AVX1-NEXT: vextractf128 $1, %ymm1, %xmm7
+; X64-AVX1-NEXT: vpxor %xmm4, %xmm7, %xmm8
+; X64-AVX1-NEXT: vpcmpgtq %xmm6, %xmm8, %xmm6
+; X64-AVX1-NEXT: vblendvpd %xmm6, %xmm7, %xmm5, %xmm5
+; X64-AVX1-NEXT: vxorpd %xmm4, %xmm5, %xmm6
+; X64-AVX1-NEXT: vextractf128 $1, %ymm2, %xmm7
+; X64-AVX1-NEXT: vpxor %xmm4, %xmm7, %xmm8
+; X64-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm9
+; X64-AVX1-NEXT: vpxor %xmm4, %xmm9, %xmm10
+; X64-AVX1-NEXT: vpcmpgtq %xmm8, %xmm10, %xmm8
+; X64-AVX1-NEXT: vblendvpd %xmm8, %xmm9, %xmm7, %xmm7
+; X64-AVX1-NEXT: vxorpd %xmm4, %xmm7, %xmm8
+; X64-AVX1-NEXT: vpcmpgtq %xmm6, %xmm8, %xmm6
+; X64-AVX1-NEXT: vblendvpd %xmm6, %xmm7, %xmm5, %xmm5
+; X64-AVX1-NEXT: vxorpd %xmm4, %xmm5, %xmm6
+; X64-AVX1-NEXT: vpxor %xmm4, %xmm3, %xmm7
+; X64-AVX1-NEXT: vpxor %xmm4, %xmm1, %xmm8
+; X64-AVX1-NEXT: vpcmpgtq %xmm7, %xmm8, %xmm7
+; X64-AVX1-NEXT: vblendvpd %xmm7, %xmm1, %xmm3, %xmm1
+; X64-AVX1-NEXT: vxorpd %xmm4, %xmm1, %xmm3
+; X64-AVX1-NEXT: vpxor %xmm4, %xmm2, %xmm7
+; X64-AVX1-NEXT: vpxor %xmm4, %xmm0, %xmm8
+; X64-AVX1-NEXT: vpcmpgtq %xmm7, %xmm8, %xmm7
+; X64-AVX1-NEXT: vblendvpd %xmm7, %xmm0, %xmm2, %xmm0
+; X64-AVX1-NEXT: vxorpd %xmm4, %xmm0, %xmm2
+; X64-AVX1-NEXT: vpcmpgtq %xmm3, %xmm2, %xmm2
+; X64-AVX1-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X64-AVX1-NEXT: vxorpd %xmm4, %xmm0, %xmm1
+; X64-AVX1-NEXT: vpcmpgtq %xmm6, %xmm1, %xmm1
+; X64-AVX1-NEXT: vblendvpd %xmm1, %xmm0, %xmm5, %xmm0
+; X64-AVX1-NEXT: vxorpd %xmm4, %xmm0, %xmm1
+; X64-AVX1-NEXT: vshufps {{.*#+}} xmm2 = xmm0[2,3,2,3]
+; X64-AVX1-NEXT: vxorpd %xmm4, %xmm2, %xmm3
+; X64-AVX1-NEXT: vpcmpgtq %xmm3, %xmm1, %xmm1
+; X64-AVX1-NEXT: vblendvpd %xmm1, %xmm0, %xmm2, %xmm0
+; X64-AVX1-NEXT: vmovq %xmm0, %rax
+; X64-AVX1-NEXT: vzeroupper
+; X64-AVX1-NEXT: retq
+;
+; X86-AVX2-LABEL: test_v16i64:
+; X86-AVX2: # %bb.0:
+; X86-AVX2-NEXT: pushl %ebp
+; X86-AVX2-NEXT: movl %esp, %ebp
+; X86-AVX2-NEXT: andl $-32, %esp
+; X86-AVX2-NEXT: subl $32, %esp
+; X86-AVX2-NEXT: vmovdqa 8(%ebp), %ymm4
+; X86-AVX2-NEXT: vpbroadcastq {{.*#+}} ymm3 = [0,2147483648,0,2147483648,0,2147483648,0,2147483648]
+; X86-AVX2-NEXT: vpxor %ymm3, %ymm2, %ymm5
+; X86-AVX2-NEXT: vpxor %ymm3, %ymm0, %ymm6
+; X86-AVX2-NEXT: vpcmpgtq %ymm5, %ymm6, %ymm5
+; X86-AVX2-NEXT: vblendvpd %ymm5, %ymm0, %ymm2, %ymm0
+; X86-AVX2-NEXT: vpxor %ymm3, %ymm4, %ymm2
+; X86-AVX2-NEXT: vpxor %ymm3, %ymm1, %ymm5
+; X86-AVX2-NEXT: vpcmpgtq %ymm2, %ymm5, %ymm2
+; X86-AVX2-NEXT: vblendvpd %ymm2, %ymm1, %ymm4, %ymm1
+; X86-AVX2-NEXT: vxorpd %ymm3, %ymm1, %ymm2
+; X86-AVX2-NEXT: vxorpd %ymm3, %ymm0, %ymm4
+; X86-AVX2-NEXT: vpcmpgtq %ymm2, %ymm4, %ymm2
+; X86-AVX2-NEXT: vblendvpd %ymm2, %ymm0, %ymm1, %ymm0
+; X86-AVX2-NEXT: vextractf128 $1, %ymm0, %xmm1
+; X86-AVX2-NEXT: vxorpd %xmm3, %xmm1, %xmm2
+; X86-AVX2-NEXT: vxorpd %xmm3, %xmm0, %xmm4
+; X86-AVX2-NEXT: vpcmpgtq %xmm2, %xmm4, %xmm2
+; X86-AVX2-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X86-AVX2-NEXT: vshufps {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-AVX2-NEXT: vxorpd %xmm3, %xmm0, %xmm2
+; X86-AVX2-NEXT: vxorpd %xmm3, %xmm1, %xmm3
+; X86-AVX2-NEXT: vpcmpgtq %xmm3, %xmm2, %xmm2
+; X86-AVX2-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X86-AVX2-NEXT: vmovd %xmm0, %eax
+; X86-AVX2-NEXT: vpextrd $1, %xmm0, %edx
+; X86-AVX2-NEXT: movl %ebp, %esp
+; X86-AVX2-NEXT: popl %ebp
+; X86-AVX2-NEXT: vzeroupper
+; X86-AVX2-NEXT: retl
+;
+; X64-AVX2-LABEL: test_v16i64:
+; X64-AVX2: # %bb.0:
+; X64-AVX2-NEXT: vpbroadcastq {{.*#+}} ymm4 = [9223372036854775808,9223372036854775808,9223372036854775808,9223372036854775808]
+; X64-AVX2-NEXT: vpxor %ymm4, %ymm3, %ymm5
+; X64-AVX2-NEXT: vpxor %ymm4, %ymm1, %ymm6
+; X64-AVX2-NEXT: vpcmpgtq %ymm5, %ymm6, %ymm5
+; X64-AVX2-NEXT: vblendvpd %ymm5, %ymm1, %ymm3, %ymm1
+; X64-AVX2-NEXT: vxorpd %ymm4, %ymm1, %ymm3
+; X64-AVX2-NEXT: vpxor %ymm4, %ymm2, %ymm5
+; X64-AVX2-NEXT: vpxor %ymm4, %ymm0, %ymm6
+; X64-AVX2-NEXT: vpcmpgtq %ymm5, %ymm6, %ymm5
+; X64-AVX2-NEXT: vblendvpd %ymm5, %ymm0, %ymm2, %ymm0
+; X64-AVX2-NEXT: vxorpd %ymm4, %ymm0, %ymm2
+; X64-AVX2-NEXT: vpcmpgtq %ymm3, %ymm2, %ymm2
+; X64-AVX2-NEXT: vblendvpd %ymm2, %ymm0, %ymm1, %ymm0
+; X64-AVX2-NEXT: vextractf128 $1, %ymm0, %xmm1
+; X64-AVX2-NEXT: vxorpd %xmm4, %xmm1, %xmm2
+; X64-AVX2-NEXT: vxorpd %xmm4, %xmm0, %xmm3
+; X64-AVX2-NEXT: vpcmpgtq %xmm2, %xmm3, %xmm2
+; X64-AVX2-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X64-AVX2-NEXT: vxorpd %xmm4, %xmm0, %xmm1
+; X64-AVX2-NEXT: vshufps {{.*#+}} xmm2 = xmm0[2,3,2,3]
+; X64-AVX2-NEXT: vxorpd %xmm4, %xmm2, %xmm3
+; X64-AVX2-NEXT: vpcmpgtq %xmm3, %xmm1, %xmm1
+; X64-AVX2-NEXT: vblendvpd %xmm1, %xmm0, %xmm2, %xmm0
+; X64-AVX2-NEXT: vmovq %xmm0, %rax
+; X64-AVX2-NEXT: vzeroupper
+; X64-AVX2-NEXT: retq
;
; AVX512BW-LABEL: test_v16i64:
; AVX512BW: # %bb.0:
@@ -838,7 +1711,7 @@ define i64 @test_v16i64(<16 x i64> %a0) {
; vXi32
;
-define i32 @test_v2i32(<2 x i32> %a0) {
+define i32 @test_v2i32(<2 x i32> %a0) nounwind {
; SSE2-LABEL: test_v2i32:
; SSE2: # %bb.0:
; SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
@@ -851,33 +1724,26 @@ define i32 @test_v2i32(<2 x i32> %a0) {
; SSE2-NEXT: pandn %xmm1, %xmm3
; SSE2-NEXT: por %xmm0, %xmm3
; SSE2-NEXT: movd %xmm3, %eax
-; SSE2-NEXT: retq
+; SSE2-NEXT: ret{{[l|q]}}
;
; SSE4-LABEL: test_v2i32:
; SSE4: # %bb.0:
; SSE4-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
; SSE4-NEXT: pmaxud %xmm0, %xmm1
; SSE4-NEXT: movd %xmm1, %eax
-; SSE4-NEXT: retq
+; SSE4-NEXT: ret{{[l|q]}}
;
; AVX-LABEL: test_v2i32:
; AVX: # %bb.0:
; AVX-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
; AVX-NEXT: vpmaxud %xmm1, %xmm0, %xmm0
; AVX-NEXT: vmovd %xmm0, %eax
-; AVX-NEXT: retq
-;
-; AVX512-LABEL: test_v2i32:
-; AVX512: # %bb.0:
-; AVX512-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
-; AVX512-NEXT: vpmaxud %xmm1, %xmm0, %xmm0
-; AVX512-NEXT: vmovd %xmm0, %eax
-; AVX512-NEXT: retq
+; AVX-NEXT: ret{{[l|q]}}
%1 = call i32 @llvm.vector.reduce.umax.v2i32(<2 x i32> %a0)
ret i32 %1
}
-define i32 @test_v4i32(<4 x i32> %a0) {
+define i32 @test_v4i32(<4 x i32> %a0) nounwind {
; SSE2-LABEL: test_v4i32:
; SSE2: # %bb.0:
; SSE2-NEXT: movdqa {{.*#+}} xmm1 = [2147483648,2147483648,2147483648,2147483648]
@@ -894,7 +1760,7 @@ define i32 @test_v4i32(<4 x i32> %a0) {
; SSE2-NEXT: movd %xmm0, %eax
; SSE2-NEXT: cmpl %eax, %ecx
; SSE2-NEXT: cmoval %ecx, %eax
-; SSE2-NEXT: retq
+; SSE2-NEXT: ret{{[l|q]}}
;
; SSE4-LABEL: test_v4i32:
; SSE4: # %bb.0:
@@ -903,7 +1769,7 @@ define i32 @test_v4i32(<4 x i32> %a0) {
; SSE4-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
; SSE4-NEXT: pmaxud %xmm1, %xmm0
; SSE4-NEXT: movd %xmm0, %eax
-; SSE4-NEXT: retq
+; SSE4-NEXT: ret{{[l|q]}}
;
; AVX-LABEL: test_v4i32:
; AVX: # %bb.0:
@@ -912,46 +1778,63 @@ define i32 @test_v4i32(<4 x i32> %a0) {
; AVX-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
; AVX-NEXT: vpmaxud %xmm1, %xmm0, %xmm0
; AVX-NEXT: vmovd %xmm0, %eax
-; AVX-NEXT: retq
-;
-; AVX512-LABEL: test_v4i32:
-; AVX512: # %bb.0:
-; AVX512-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
-; AVX512-NEXT: vpmaxud %xmm1, %xmm0, %xmm0
-; AVX512-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
-; AVX512-NEXT: vpmaxud %xmm1, %xmm0, %xmm0
-; AVX512-NEXT: vmovd %xmm0, %eax
-; AVX512-NEXT: retq
+; AVX-NEXT: ret{{[l|q]}}
%1 = call i32 @llvm.vector.reduce.umax.v4i32(<4 x i32> %a0)
ret i32 %1
}
-define i32 @test_v8i32(<8 x i32> %a0) {
-; SSE2-LABEL: test_v8i32:
-; SSE2: # %bb.0:
-; SSE2-NEXT: movdqa {{.*#+}} xmm2 = [2147483648,2147483648,2147483648,2147483648]
-; SSE2-NEXT: movdqa %xmm1, %xmm3
-; SSE2-NEXT: pxor %xmm2, %xmm3
-; SSE2-NEXT: movdqa %xmm0, %xmm4
-; SSE2-NEXT: pxor %xmm2, %xmm4
-; SSE2-NEXT: pcmpgtd %xmm3, %xmm4
-; SSE2-NEXT: pand %xmm4, %xmm0
-; SSE2-NEXT: pandn %xmm1, %xmm4
-; SSE2-NEXT: por %xmm0, %xmm4
-; SSE2-NEXT: movdqa %xmm4, %xmm0
-; SSE2-NEXT: pxor %xmm2, %xmm0
-; SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm4[2,3,2,3]
-; SSE2-NEXT: pxor %xmm1, %xmm2
-; SSE2-NEXT: pcmpgtd %xmm2, %xmm0
-; SSE2-NEXT: pand %xmm0, %xmm4
-; SSE2-NEXT: pandn %xmm1, %xmm0
-; SSE2-NEXT: por %xmm4, %xmm0
-; SSE2-NEXT: movd %xmm0, %ecx
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm0[1,1,1,1]
-; SSE2-NEXT: movd %xmm0, %eax
-; SSE2-NEXT: cmpl %eax, %ecx
-; SSE2-NEXT: cmoval %ecx, %eax
-; SSE2-NEXT: retq
+define i32 @test_v8i32(<8 x i32> %a0) nounwind {
+; X86-SSE2-LABEL: test_v8i32:
+; X86-SSE2: # %bb.0:
+; X86-SSE2-NEXT: movdqa {{.*#+}} xmm3 = [2147483648,2147483648,2147483648,2147483648]
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm4
+; X86-SSE2-NEXT: pxor %xmm3, %xmm4
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE2-NEXT: pxor %xmm3, %xmm2
+; X86-SSE2-NEXT: pcmpgtd %xmm4, %xmm2
+; X86-SSE2-NEXT: pand %xmm2, %xmm0
+; X86-SSE2-NEXT: pandn %xmm1, %xmm2
+; X86-SSE2-NEXT: por %xmm0, %xmm2
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm0
+; X86-SSE2-NEXT: pxor %xmm3, %xmm0
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm2[2,3,2,3]
+; X86-SSE2-NEXT: pxor %xmm1, %xmm3
+; X86-SSE2-NEXT: pcmpgtd %xmm3, %xmm0
+; X86-SSE2-NEXT: pand %xmm0, %xmm2
+; X86-SSE2-NEXT: pandn %xmm1, %xmm0
+; X86-SSE2-NEXT: por %xmm2, %xmm0
+; X86-SSE2-NEXT: movd %xmm0, %ecx
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm0[1,1,1,1]
+; X86-SSE2-NEXT: movd %xmm0, %eax
+; X86-SSE2-NEXT: cmpl %eax, %ecx
+; X86-SSE2-NEXT: cmoval %ecx, %eax
+; X86-SSE2-NEXT: retl
+;
+; X64-SSE2-LABEL: test_v8i32:
+; X64-SSE2: # %bb.0:
+; X64-SSE2-NEXT: movdqa {{.*#+}} xmm2 = [2147483648,2147483648,2147483648,2147483648]
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm3
+; X64-SSE2-NEXT: pxor %xmm2, %xmm3
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm4
+; X64-SSE2-NEXT: pxor %xmm2, %xmm4
+; X64-SSE2-NEXT: pcmpgtd %xmm3, %xmm4
+; X64-SSE2-NEXT: pand %xmm4, %xmm0
+; X64-SSE2-NEXT: pandn %xmm1, %xmm4
+; X64-SSE2-NEXT: por %xmm0, %xmm4
+; X64-SSE2-NEXT: movdqa %xmm4, %xmm0
+; X64-SSE2-NEXT: pxor %xmm2, %xmm0
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm4[2,3,2,3]
+; X64-SSE2-NEXT: pxor %xmm1, %xmm2
+; X64-SSE2-NEXT: pcmpgtd %xmm2, %xmm0
+; X64-SSE2-NEXT: pand %xmm0, %xmm4
+; X64-SSE2-NEXT: pandn %xmm1, %xmm0
+; X64-SSE2-NEXT: por %xmm4, %xmm0
+; X64-SSE2-NEXT: movd %xmm0, %ecx
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm0[1,1,1,1]
+; X64-SSE2-NEXT: movd %xmm0, %eax
+; X64-SSE2-NEXT: cmpl %eax, %ecx
+; X64-SSE2-NEXT: cmoval %ecx, %eax
+; X64-SSE2-NEXT: retq
;
; SSE4-LABEL: test_v8i32:
; SSE4: # %bb.0:
@@ -961,7 +1844,7 @@ define i32 @test_v8i32(<8 x i32> %a0) {
; SSE4-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
; SSE4-NEXT: pmaxud %xmm1, %xmm0
; SSE4-NEXT: movd %xmm0, %eax
-; SSE4-NEXT: retq
+; SSE4-NEXT: ret{{[l|q]}}
;
; AVX1-LABEL: test_v8i32:
; AVX1: # %bb.0:
@@ -973,7 +1856,7 @@ define i32 @test_v8i32(<8 x i32> %a0) {
; AVX1-NEXT: vpmaxud %xmm1, %xmm0, %xmm0
; AVX1-NEXT: vmovd %xmm0, %eax
; AVX1-NEXT: vzeroupper
-; AVX1-NEXT: retq
+; AVX1-NEXT: ret{{[l|q]}}
;
; AVX2-LABEL: test_v8i32:
; AVX2: # %bb.0:
@@ -985,7 +1868,7 @@ define i32 @test_v8i32(<8 x i32> %a0) {
; AVX2-NEXT: vpmaxud %xmm1, %xmm0, %xmm0
; AVX2-NEXT: vmovd %xmm0, %eax
; AVX2-NEXT: vzeroupper
-; AVX2-NEXT: retq
+; AVX2-NEXT: ret{{[l|q]}}
;
; AVX512-LABEL: test_v8i32:
; AVX512: # %bb.0:
@@ -1002,60 +1885,127 @@ define i32 @test_v8i32(<8 x i32> %a0) {
ret i32 %1
}
-define i32 @test_v16i32(<16 x i32> %a0) {
-; SSE2-LABEL: test_v16i32:
-; SSE2: # %bb.0:
-; SSE2-NEXT: movdqa {{.*#+}} xmm4 = [2147483648,2147483648,2147483648,2147483648]
-; SSE2-NEXT: movdqa %xmm3, %xmm5
-; SSE2-NEXT: pxor %xmm4, %xmm5
-; SSE2-NEXT: movdqa %xmm1, %xmm6
-; SSE2-NEXT: pxor %xmm4, %xmm6
-; SSE2-NEXT: pcmpgtd %xmm5, %xmm6
-; SSE2-NEXT: pand %xmm6, %xmm1
-; SSE2-NEXT: pandn %xmm3, %xmm6
-; SSE2-NEXT: por %xmm1, %xmm6
-; SSE2-NEXT: movdqa %xmm6, %xmm1
-; SSE2-NEXT: pxor %xmm4, %xmm1
-; SSE2-NEXT: movdqa %xmm2, %xmm3
-; SSE2-NEXT: pxor %xmm4, %xmm3
-; SSE2-NEXT: movdqa %xmm0, %xmm5
-; SSE2-NEXT: pxor %xmm4, %xmm5
-; SSE2-NEXT: pcmpgtd %xmm3, %xmm5
-; SSE2-NEXT: pand %xmm5, %xmm0
-; SSE2-NEXT: pandn %xmm2, %xmm5
-; SSE2-NEXT: por %xmm0, %xmm5
-; SSE2-NEXT: movdqa %xmm5, %xmm0
-; SSE2-NEXT: pxor %xmm4, %xmm0
-; SSE2-NEXT: pcmpgtd %xmm1, %xmm0
-; SSE2-NEXT: pand %xmm0, %xmm5
-; SSE2-NEXT: pandn %xmm6, %xmm0
-; SSE2-NEXT: por %xmm5, %xmm0
-; SSE2-NEXT: movdqa %xmm0, %xmm1
-; SSE2-NEXT: pxor %xmm4, %xmm1
-; SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm0[2,3,2,3]
-; SSE2-NEXT: pxor %xmm2, %xmm4
-; SSE2-NEXT: pcmpgtd %xmm4, %xmm1
-; SSE2-NEXT: pand %xmm1, %xmm0
-; SSE2-NEXT: pandn %xmm2, %xmm1
-; SSE2-NEXT: por %xmm0, %xmm1
-; SSE2-NEXT: movd %xmm1, %ecx
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
-; SSE2-NEXT: movd %xmm0, %eax
-; SSE2-NEXT: cmpl %eax, %ecx
-; SSE2-NEXT: cmoval %ecx, %eax
-; SSE2-NEXT: retq
-;
-; SSE4-LABEL: test_v16i32:
-; SSE4: # %bb.0:
-; SSE4-NEXT: pmaxud %xmm3, %xmm1
-; SSE4-NEXT: pmaxud %xmm2, %xmm0
-; SSE4-NEXT: pmaxud %xmm1, %xmm0
-; SSE4-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
-; SSE4-NEXT: pmaxud %xmm0, %xmm1
-; SSE4-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
-; SSE4-NEXT: pmaxud %xmm1, %xmm0
-; SSE4-NEXT: movd %xmm0, %eax
-; SSE4-NEXT: retq
+define i32 @test_v16i32(<16 x i32> %a0) nounwind {
+; X86-SSE2-LABEL: test_v16i32:
+; X86-SSE2: # %bb.0:
+; X86-SSE2-NEXT: pushl %ebp
+; X86-SSE2-NEXT: movl %esp, %ebp
+; X86-SSE2-NEXT: andl $-16, %esp
+; X86-SSE2-NEXT: subl $16, %esp
+; X86-SSE2-NEXT: movdqa 8(%ebp), %xmm5
+; X86-SSE2-NEXT: movdqa {{.*#+}} xmm3 = [2147483648,2147483648,2147483648,2147483648]
+; X86-SSE2-NEXT: movdqa %xmm5, %xmm6
+; X86-SSE2-NEXT: pxor %xmm3, %xmm6
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm4
+; X86-SSE2-NEXT: pxor %xmm3, %xmm4
+; X86-SSE2-NEXT: pcmpgtd %xmm6, %xmm4
+; X86-SSE2-NEXT: pand %xmm4, %xmm1
+; X86-SSE2-NEXT: pandn %xmm5, %xmm4
+; X86-SSE2-NEXT: por %xmm1, %xmm4
+; X86-SSE2-NEXT: movdqa %xmm4, %xmm5
+; X86-SSE2-NEXT: pxor %xmm3, %xmm5
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm6
+; X86-SSE2-NEXT: pxor %xmm3, %xmm6
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X86-SSE2-NEXT: pxor %xmm3, %xmm1
+; X86-SSE2-NEXT: pcmpgtd %xmm6, %xmm1
+; X86-SSE2-NEXT: pand %xmm1, %xmm0
+; X86-SSE2-NEXT: pandn %xmm2, %xmm1
+; X86-SSE2-NEXT: por %xmm0, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE2-NEXT: pxor %xmm3, %xmm0
+; X86-SSE2-NEXT: pcmpgtd %xmm5, %xmm0
+; X86-SSE2-NEXT: pand %xmm0, %xmm1
+; X86-SSE2-NEXT: pandn %xmm4, %xmm0
+; X86-SSE2-NEXT: por %xmm1, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X86-SSE2-NEXT: pxor %xmm3, %xmm1
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm0[2,3,2,3]
+; X86-SSE2-NEXT: pxor %xmm2, %xmm3
+; X86-SSE2-NEXT: pcmpgtd %xmm3, %xmm1
+; X86-SSE2-NEXT: pand %xmm1, %xmm0
+; X86-SSE2-NEXT: pandn %xmm2, %xmm1
+; X86-SSE2-NEXT: por %xmm0, %xmm1
+; X86-SSE2-NEXT: movd %xmm1, %ecx
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
+; X86-SSE2-NEXT: movd %xmm0, %eax
+; X86-SSE2-NEXT: cmpl %eax, %ecx
+; X86-SSE2-NEXT: cmoval %ecx, %eax
+; X86-SSE2-NEXT: movl %ebp, %esp
+; X86-SSE2-NEXT: popl %ebp
+; X86-SSE2-NEXT: retl
+;
+; X64-SSE2-LABEL: test_v16i32:
+; X64-SSE2: # %bb.0:
+; X64-SSE2-NEXT: movdqa {{.*#+}} xmm4 = [2147483648,2147483648,2147483648,2147483648]
+; X64-SSE2-NEXT: movdqa %xmm3, %xmm5
+; X64-SSE2-NEXT: pxor %xmm4, %xmm5
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm6
+; X64-SSE2-NEXT: pxor %xmm4, %xmm6
+; X64-SSE2-NEXT: pcmpgtd %xmm5, %xmm6
+; X64-SSE2-NEXT: pand %xmm6, %xmm1
+; X64-SSE2-NEXT: pandn %xmm3, %xmm6
+; X64-SSE2-NEXT: por %xmm1, %xmm6
+; X64-SSE2-NEXT: movdqa %xmm6, %xmm1
+; X64-SSE2-NEXT: pxor %xmm4, %xmm1
+; X64-SSE2-NEXT: movdqa %xmm2, %xmm3
+; X64-SSE2-NEXT: pxor %xmm4, %xmm3
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm5
+; X64-SSE2-NEXT: pxor %xmm4, %xmm5
+; X64-SSE2-NEXT: pcmpgtd %xmm3, %xmm5
+; X64-SSE2-NEXT: pand %xmm5, %xmm0
+; X64-SSE2-NEXT: pandn %xmm2, %xmm5
+; X64-SSE2-NEXT: por %xmm0, %xmm5
+; X64-SSE2-NEXT: movdqa %xmm5, %xmm0
+; X64-SSE2-NEXT: pxor %xmm4, %xmm0
+; X64-SSE2-NEXT: pcmpgtd %xmm1, %xmm0
+; X64-SSE2-NEXT: pand %xmm0, %xmm5
+; X64-SSE2-NEXT: pandn %xmm6, %xmm0
+; X64-SSE2-NEXT: por %xmm5, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X64-SSE2-NEXT: pxor %xmm4, %xmm1
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm0[2,3,2,3]
+; X64-SSE2-NEXT: pxor %xmm2, %xmm4
+; X64-SSE2-NEXT: pcmpgtd %xmm4, %xmm1
+; X64-SSE2-NEXT: pand %xmm1, %xmm0
+; X64-SSE2-NEXT: pandn %xmm2, %xmm1
+; X64-SSE2-NEXT: por %xmm0, %xmm1
+; X64-SSE2-NEXT: movd %xmm1, %ecx
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
+; X64-SSE2-NEXT: movd %xmm0, %eax
+; X64-SSE2-NEXT: cmpl %eax, %ecx
+; X64-SSE2-NEXT: cmoval %ecx, %eax
+; X64-SSE2-NEXT: retq
+;
+; X86-SSE4-LABEL: test_v16i32:
+; X86-SSE4: # %bb.0:
+; X86-SSE4-NEXT: pushl %ebp
+; X86-SSE4-NEXT: movl %esp, %ebp
+; X86-SSE4-NEXT: andl $-16, %esp
+; X86-SSE4-NEXT: subl $16, %esp
+; X86-SSE4-NEXT: pmaxud %xmm2, %xmm0
+; X86-SSE4-NEXT: pmaxud 8(%ebp), %xmm1
+; X86-SSE4-NEXT: pmaxud %xmm0, %xmm1
+; X86-SSE4-NEXT: pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
+; X86-SSE4-NEXT: pmaxud %xmm1, %xmm0
+; X86-SSE4-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; X86-SSE4-NEXT: pmaxud %xmm0, %xmm1
+; X86-SSE4-NEXT: movd %xmm1, %eax
+; X86-SSE4-NEXT: movl %ebp, %esp
+; X86-SSE4-NEXT: popl %ebp
+; X86-SSE4-NEXT: retl
+;
+; X64-SSE4-LABEL: test_v16i32:
+; X64-SSE4: # %bb.0:
+; X64-SSE4-NEXT: pmaxud %xmm3, %xmm1
+; X64-SSE4-NEXT: pmaxud %xmm2, %xmm0
+; X64-SSE4-NEXT: pmaxud %xmm1, %xmm0
+; X64-SSE4-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X64-SSE4-NEXT: pmaxud %xmm0, %xmm1
+; X64-SSE4-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
+; X64-SSE4-NEXT: pmaxud %xmm1, %xmm0
+; X64-SSE4-NEXT: movd %xmm0, %eax
+; X64-SSE4-NEXT: retq
;
; AVX1-LABEL: test_v16i32:
; AVX1: # %bb.0:
@@ -1070,7 +2020,7 @@ define i32 @test_v16i32(<16 x i32> %a0) {
; AVX1-NEXT: vpmaxud %xmm1, %xmm0, %xmm0
; AVX1-NEXT: vmovd %xmm0, %eax
; AVX1-NEXT: vzeroupper
-; AVX1-NEXT: retq
+; AVX1-NEXT: ret{{[l|q]}}
;
; AVX2-LABEL: test_v16i32:
; AVX2: # %bb.0:
@@ -1083,7 +2033,7 @@ define i32 @test_v16i32(<16 x i32> %a0) {
; AVX2-NEXT: vpmaxud %xmm1, %xmm0, %xmm0
; AVX2-NEXT: vmovd %xmm0, %eax
; AVX2-NEXT: vzeroupper
-; AVX2-NEXT: retq
+; AVX2-NEXT: ret{{[l|q]}}
;
; AVX512-LABEL: test_v16i32:
; AVX512: # %bb.0:
@@ -1102,132 +2052,287 @@ define i32 @test_v16i32(<16 x i32> %a0) {
ret i32 %1
}
-define i32 @test_v32i32(<32 x i32> %a0) {
-; SSE2-LABEL: test_v32i32:
-; SSE2: # %bb.0:
-; SSE2-NEXT: movdqa {{.*#+}} xmm8 = [2147483648,2147483648,2147483648,2147483648]
-; SSE2-NEXT: movdqa %xmm7, %xmm9
-; SSE2-NEXT: pxor %xmm8, %xmm9
-; SSE2-NEXT: movdqa %xmm3, %xmm10
-; SSE2-NEXT: pxor %xmm8, %xmm10
-; SSE2-NEXT: pcmpgtd %xmm9, %xmm10
-; SSE2-NEXT: pand %xmm10, %xmm3
-; SSE2-NEXT: pandn %xmm7, %xmm10
-; SSE2-NEXT: por %xmm3, %xmm10
-; SSE2-NEXT: movdqa %xmm10, %xmm3
-; SSE2-NEXT: pxor %xmm8, %xmm3
-; SSE2-NEXT: movdqa %xmm5, %xmm7
-; SSE2-NEXT: pxor %xmm8, %xmm7
-; SSE2-NEXT: movdqa %xmm1, %xmm9
-; SSE2-NEXT: pxor %xmm8, %xmm9
-; SSE2-NEXT: pcmpgtd %xmm7, %xmm9
-; SSE2-NEXT: pand %xmm9, %xmm1
-; SSE2-NEXT: pandn %xmm5, %xmm9
-; SSE2-NEXT: por %xmm1, %xmm9
-; SSE2-NEXT: movdqa %xmm9, %xmm1
-; SSE2-NEXT: pxor %xmm8, %xmm1
-; SSE2-NEXT: pcmpgtd %xmm3, %xmm1
-; SSE2-NEXT: pand %xmm1, %xmm9
-; SSE2-NEXT: pandn %xmm10, %xmm1
-; SSE2-NEXT: por %xmm9, %xmm1
-; SSE2-NEXT: movdqa %xmm1, %xmm3
-; SSE2-NEXT: pxor %xmm8, %xmm3
-; SSE2-NEXT: movdqa %xmm6, %xmm5
-; SSE2-NEXT: pxor %xmm8, %xmm5
-; SSE2-NEXT: movdqa %xmm2, %xmm7
-; SSE2-NEXT: pxor %xmm8, %xmm7
-; SSE2-NEXT: pcmpgtd %xmm5, %xmm7
-; SSE2-NEXT: pand %xmm7, %xmm2
-; SSE2-NEXT: pandn %xmm6, %xmm7
-; SSE2-NEXT: por %xmm2, %xmm7
-; SSE2-NEXT: movdqa %xmm7, %xmm2
-; SSE2-NEXT: pxor %xmm8, %xmm2
-; SSE2-NEXT: movdqa %xmm4, %xmm5
-; SSE2-NEXT: pxor %xmm8, %xmm5
-; SSE2-NEXT: movdqa %xmm0, %xmm6
-; SSE2-NEXT: pxor %xmm8, %xmm6
-; SSE2-NEXT: pcmpgtd %xmm5, %xmm6
-; SSE2-NEXT: pand %xmm6, %xmm0
-; SSE2-NEXT: pandn %xmm4, %xmm6
-; SSE2-NEXT: por %xmm0, %xmm6
-; SSE2-NEXT: movdqa %xmm6, %xmm0
-; SSE2-NEXT: pxor %xmm8, %xmm0
-; SSE2-NEXT: pcmpgtd %xmm2, %xmm0
-; SSE2-NEXT: pand %xmm0, %xmm6
-; SSE2-NEXT: pandn %xmm7, %xmm0
-; SSE2-NEXT: por %xmm6, %xmm0
-; SSE2-NEXT: movdqa %xmm0, %xmm2
-; SSE2-NEXT: pxor %xmm8, %xmm2
-; SSE2-NEXT: pcmpgtd %xmm3, %xmm2
-; SSE2-NEXT: pand %xmm2, %xmm0
-; SSE2-NEXT: pandn %xmm1, %xmm2
-; SSE2-NEXT: por %xmm0, %xmm2
-; SSE2-NEXT: movdqa %xmm2, %xmm0
-; SSE2-NEXT: pxor %xmm8, %xmm0
-; SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm2[2,3,2,3]
-; SSE2-NEXT: pxor %xmm1, %xmm8
-; SSE2-NEXT: pcmpgtd %xmm8, %xmm0
-; SSE2-NEXT: pand %xmm0, %xmm2
-; SSE2-NEXT: pandn %xmm1, %xmm0
-; SSE2-NEXT: por %xmm2, %xmm0
-; SSE2-NEXT: movd %xmm0, %ecx
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm0[1,1,1,1]
-; SSE2-NEXT: movd %xmm0, %eax
-; SSE2-NEXT: cmpl %eax, %ecx
-; SSE2-NEXT: cmoval %ecx, %eax
-; SSE2-NEXT: retq
-;
-; SSE4-LABEL: test_v32i32:
-; SSE4: # %bb.0:
-; SSE4-NEXT: pmaxud %xmm7, %xmm3
-; SSE4-NEXT: pmaxud %xmm5, %xmm1
-; SSE4-NEXT: pmaxud %xmm3, %xmm1
-; SSE4-NEXT: pmaxud %xmm6, %xmm2
-; SSE4-NEXT: pmaxud %xmm4, %xmm0
-; SSE4-NEXT: pmaxud %xmm2, %xmm0
-; SSE4-NEXT: pmaxud %xmm1, %xmm0
-; SSE4-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
-; SSE4-NEXT: pmaxud %xmm0, %xmm1
-; SSE4-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
-; SSE4-NEXT: pmaxud %xmm1, %xmm0
-; SSE4-NEXT: movd %xmm0, %eax
-; SSE4-NEXT: retq
-;
-; AVX1-LABEL: test_v32i32:
-; AVX1: # %bb.0:
-; AVX1-NEXT: vextractf128 $1, %ymm3, %xmm4
-; AVX1-NEXT: vextractf128 $1, %ymm1, %xmm5
-; AVX1-NEXT: vpmaxud %xmm4, %xmm5, %xmm4
-; AVX1-NEXT: vextractf128 $1, %ymm2, %xmm5
-; AVX1-NEXT: vextractf128 $1, %ymm0, %xmm6
-; AVX1-NEXT: vpmaxud %xmm5, %xmm6, %xmm5
-; AVX1-NEXT: vpmaxud %xmm4, %xmm5, %xmm4
-; AVX1-NEXT: vpmaxud %xmm3, %xmm1, %xmm1
-; AVX1-NEXT: vpmaxud %xmm2, %xmm0, %xmm0
-; AVX1-NEXT: vpmaxud %xmm1, %xmm0, %xmm0
-; AVX1-NEXT: vpmaxud %xmm4, %xmm0, %xmm0
-; AVX1-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
-; AVX1-NEXT: vpmaxud %xmm1, %xmm0, %xmm0
-; AVX1-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
-; AVX1-NEXT: vpmaxud %xmm1, %xmm0, %xmm0
-; AVX1-NEXT: vmovd %xmm0, %eax
-; AVX1-NEXT: vzeroupper
-; AVX1-NEXT: retq
-;
-; AVX2-LABEL: test_v32i32:
-; AVX2: # %bb.0:
-; AVX2-NEXT: vpmaxud %ymm3, %ymm1, %ymm1
-; AVX2-NEXT: vpmaxud %ymm2, %ymm0, %ymm0
-; AVX2-NEXT: vpmaxud %ymm1, %ymm0, %ymm0
-; AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
-; AVX2-NEXT: vpmaxud %xmm1, %xmm0, %xmm0
-; AVX2-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
-; AVX2-NEXT: vpmaxud %xmm1, %xmm0, %xmm0
-; AVX2-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
-; AVX2-NEXT: vpmaxud %xmm1, %xmm0, %xmm0
-; AVX2-NEXT: vmovd %xmm0, %eax
-; AVX2-NEXT: vzeroupper
-; AVX2-NEXT: retq
+define i32 @test_v32i32(<32 x i32> %a0) nounwind {
+; X86-SSE2-LABEL: test_v32i32:
+; X86-SSE2: # %bb.0:
+; X86-SSE2-NEXT: pushl %ebp
+; X86-SSE2-NEXT: movl %esp, %ebp
+; X86-SSE2-NEXT: andl $-16, %esp
+; X86-SSE2-NEXT: subl $16, %esp
+; X86-SSE2-NEXT: movdqa 8(%ebp), %xmm5
+; X86-SSE2-NEXT: movdqa 72(%ebp), %xmm7
+; X86-SSE2-NEXT: movdqa {{.*#+}} xmm3 = [2147483648,2147483648,2147483648,2147483648]
+; X86-SSE2-NEXT: movdqa %xmm7, %xmm6
+; X86-SSE2-NEXT: pxor %xmm3, %xmm6
+; X86-SSE2-NEXT: movdqa %xmm5, %xmm4
+; X86-SSE2-NEXT: pxor %xmm3, %xmm4
+; X86-SSE2-NEXT: pcmpgtd %xmm6, %xmm4
+; X86-SSE2-NEXT: movdqa 40(%ebp), %xmm6
+; X86-SSE2-NEXT: pand %xmm4, %xmm5
+; X86-SSE2-NEXT: pandn %xmm7, %xmm4
+; X86-SSE2-NEXT: por %xmm5, %xmm4
+; X86-SSE2-NEXT: movdqa %xmm6, %xmm7
+; X86-SSE2-NEXT: pxor %xmm3, %xmm7
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm5
+; X86-SSE2-NEXT: pxor %xmm3, %xmm5
+; X86-SSE2-NEXT: pcmpgtd %xmm7, %xmm5
+; X86-SSE2-NEXT: pand %xmm5, %xmm1
+; X86-SSE2-NEXT: pandn %xmm6, %xmm5
+; X86-SSE2-NEXT: movdqa %xmm4, %xmm6
+; X86-SSE2-NEXT: pxor %xmm3, %xmm6
+; X86-SSE2-NEXT: por %xmm1, %xmm5
+; X86-SSE2-NEXT: movdqa %xmm5, %xmm1
+; X86-SSE2-NEXT: pxor %xmm3, %xmm1
+; X86-SSE2-NEXT: pcmpgtd %xmm6, %xmm1
+; X86-SSE2-NEXT: movdqa 56(%ebp), %xmm6
+; X86-SSE2-NEXT: pand %xmm1, %xmm5
+; X86-SSE2-NEXT: pandn %xmm4, %xmm1
+; X86-SSE2-NEXT: por %xmm5, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm6, %xmm5
+; X86-SSE2-NEXT: pxor %xmm3, %xmm5
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm4
+; X86-SSE2-NEXT: pxor %xmm3, %xmm4
+; X86-SSE2-NEXT: pcmpgtd %xmm5, %xmm4
+; X86-SSE2-NEXT: movdqa 24(%ebp), %xmm5
+; X86-SSE2-NEXT: pand %xmm4, %xmm2
+; X86-SSE2-NEXT: pandn %xmm6, %xmm4
+; X86-SSE2-NEXT: por %xmm2, %xmm4
+; X86-SSE2-NEXT: movdqa %xmm5, %xmm6
+; X86-SSE2-NEXT: pxor %xmm3, %xmm6
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE2-NEXT: pxor %xmm3, %xmm2
+; X86-SSE2-NEXT: pcmpgtd %xmm6, %xmm2
+; X86-SSE2-NEXT: pand %xmm2, %xmm0
+; X86-SSE2-NEXT: pandn %xmm5, %xmm2
+; X86-SSE2-NEXT: movdqa %xmm4, %xmm6
+; X86-SSE2-NEXT: pxor %xmm3, %xmm6
+; X86-SSE2-NEXT: por %xmm0, %xmm2
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm5
+; X86-SSE2-NEXT: pxor %xmm3, %xmm5
+; X86-SSE2-NEXT: pcmpgtd %xmm6, %xmm5
+; X86-SSE2-NEXT: pand %xmm5, %xmm2
+; X86-SSE2-NEXT: pandn %xmm4, %xmm5
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm4
+; X86-SSE2-NEXT: pxor %xmm3, %xmm4
+; X86-SSE2-NEXT: por %xmm2, %xmm5
+; X86-SSE2-NEXT: movdqa %xmm5, %xmm0
+; X86-SSE2-NEXT: pxor %xmm3, %xmm0
+; X86-SSE2-NEXT: pcmpgtd %xmm4, %xmm0
+; X86-SSE2-NEXT: pand %xmm0, %xmm5
+; X86-SSE2-NEXT: pandn %xmm1, %xmm0
+; X86-SSE2-NEXT: por %xmm5, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X86-SSE2-NEXT: pxor %xmm3, %xmm1
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm0[2,3,2,3]
+; X86-SSE2-NEXT: pxor %xmm2, %xmm3
+; X86-SSE2-NEXT: pcmpgtd %xmm3, %xmm1
+; X86-SSE2-NEXT: pand %xmm1, %xmm0
+; X86-SSE2-NEXT: pandn %xmm2, %xmm1
+; X86-SSE2-NEXT: por %xmm0, %xmm1
+; X86-SSE2-NEXT: movd %xmm1, %ecx
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
+; X86-SSE2-NEXT: movd %xmm0, %eax
+; X86-SSE2-NEXT: cmpl %eax, %ecx
+; X86-SSE2-NEXT: cmoval %ecx, %eax
+; X86-SSE2-NEXT: movl %ebp, %esp
+; X86-SSE2-NEXT: popl %ebp
+; X86-SSE2-NEXT: retl
+;
+; X64-SSE2-LABEL: test_v32i32:
+; X64-SSE2: # %bb.0:
+; X64-SSE2-NEXT: movdqa {{.*#+}} xmm8 = [2147483648,2147483648,2147483648,2147483648]
+; X64-SSE2-NEXT: movdqa %xmm7, %xmm9
+; X64-SSE2-NEXT: pxor %xmm8, %xmm9
+; X64-SSE2-NEXT: movdqa %xmm3, %xmm10
+; X64-SSE2-NEXT: pxor %xmm8, %xmm10
+; X64-SSE2-NEXT: pcmpgtd %xmm9, %xmm10
+; X64-SSE2-NEXT: pand %xmm10, %xmm3
+; X64-SSE2-NEXT: pandn %xmm7, %xmm10
+; X64-SSE2-NEXT: por %xmm3, %xmm10
+; X64-SSE2-NEXT: movdqa %xmm10, %xmm3
+; X64-SSE2-NEXT: pxor %xmm8, %xmm3
+; X64-SSE2-NEXT: movdqa %xmm5, %xmm7
+; X64-SSE2-NEXT: pxor %xmm8, %xmm7
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm9
+; X64-SSE2-NEXT: pxor %xmm8, %xmm9
+; X64-SSE2-NEXT: pcmpgtd %xmm7, %xmm9
+; X64-SSE2-NEXT: pand %xmm9, %xmm1
+; X64-SSE2-NEXT: pandn %xmm5, %xmm9
+; X64-SSE2-NEXT: por %xmm1, %xmm9
+; X64-SSE2-NEXT: movdqa %xmm9, %xmm1
+; X64-SSE2-NEXT: pxor %xmm8, %xmm1
+; X64-SSE2-NEXT: pcmpgtd %xmm3, %xmm1
+; X64-SSE2-NEXT: pand %xmm1, %xmm9
+; X64-SSE2-NEXT: pandn %xmm10, %xmm1
+; X64-SSE2-NEXT: por %xmm9, %xmm1
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm3
+; X64-SSE2-NEXT: pxor %xmm8, %xmm3
+; X64-SSE2-NEXT: movdqa %xmm6, %xmm5
+; X64-SSE2-NEXT: pxor %xmm8, %xmm5
+; X64-SSE2-NEXT: movdqa %xmm2, %xmm7
+; X64-SSE2-NEXT: pxor %xmm8, %xmm7
+; X64-SSE2-NEXT: pcmpgtd %xmm5, %xmm7
+; X64-SSE2-NEXT: pand %xmm7, %xmm2
+; X64-SSE2-NEXT: pandn %xmm6, %xmm7
+; X64-SSE2-NEXT: por %xmm2, %xmm7
+; X64-SSE2-NEXT: movdqa %xmm7, %xmm2
+; X64-SSE2-NEXT: pxor %xmm8, %xmm2
+; X64-SSE2-NEXT: movdqa %xmm4, %xmm5
+; X64-SSE2-NEXT: pxor %xmm8, %xmm5
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm6
+; X64-SSE2-NEXT: pxor %xmm8, %xmm6
+; X64-SSE2-NEXT: pcmpgtd %xmm5, %xmm6
+; X64-SSE2-NEXT: pand %xmm6, %xmm0
+; X64-SSE2-NEXT: pandn %xmm4, %xmm6
+; X64-SSE2-NEXT: por %xmm0, %xmm6
+; X64-SSE2-NEXT: movdqa %xmm6, %xmm0
+; X64-SSE2-NEXT: pxor %xmm8, %xmm0
+; X64-SSE2-NEXT: pcmpgtd %xmm2, %xmm0
+; X64-SSE2-NEXT: pand %xmm0, %xmm6
+; X64-SSE2-NEXT: pandn %xmm7, %xmm0
+; X64-SSE2-NEXT: por %xmm6, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X64-SSE2-NEXT: pxor %xmm8, %xmm2
+; X64-SSE2-NEXT: pcmpgtd %xmm3, %xmm2
+; X64-SSE2-NEXT: pand %xmm2, %xmm0
+; X64-SSE2-NEXT: pandn %xmm1, %xmm2
+; X64-SSE2-NEXT: por %xmm0, %xmm2
+; X64-SSE2-NEXT: movdqa %xmm2, %xmm0
+; X64-SSE2-NEXT: pxor %xmm8, %xmm0
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm2[2,3,2,3]
+; X64-SSE2-NEXT: pxor %xmm1, %xmm8
+; X64-SSE2-NEXT: pcmpgtd %xmm8, %xmm0
+; X64-SSE2-NEXT: pand %xmm0, %xmm2
+; X64-SSE2-NEXT: pandn %xmm1, %xmm0
+; X64-SSE2-NEXT: por %xmm2, %xmm0
+; X64-SSE2-NEXT: movd %xmm0, %ecx
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm0[1,1,1,1]
+; X64-SSE2-NEXT: movd %xmm0, %eax
+; X64-SSE2-NEXT: cmpl %eax, %ecx
+; X64-SSE2-NEXT: cmoval %ecx, %eax
+; X64-SSE2-NEXT: retq
+;
+; X86-SSE4-LABEL: test_v32i32:
+; X86-SSE4: # %bb.0:
+; X86-SSE4-NEXT: pushl %ebp
+; X86-SSE4-NEXT: movl %esp, %ebp
+; X86-SSE4-NEXT: andl $-16, %esp
+; X86-SSE4-NEXT: subl $16, %esp
+; X86-SSE4-NEXT: movdqa 8(%ebp), %xmm3
+; X86-SSE4-NEXT: pmaxud 72(%ebp), %xmm3
+; X86-SSE4-NEXT: pmaxud 40(%ebp), %xmm1
+; X86-SSE4-NEXT: pmaxud %xmm3, %xmm1
+; X86-SSE4-NEXT: pmaxud 56(%ebp), %xmm2
+; X86-SSE4-NEXT: pmaxud 24(%ebp), %xmm0
+; X86-SSE4-NEXT: pmaxud %xmm2, %xmm0
+; X86-SSE4-NEXT: pmaxud %xmm1, %xmm0
+; X86-SSE4-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-SSE4-NEXT: pmaxud %xmm0, %xmm1
+; X86-SSE4-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
+; X86-SSE4-NEXT: pmaxud %xmm1, %xmm0
+; X86-SSE4-NEXT: movd %xmm0, %eax
+; X86-SSE4-NEXT: movl %ebp, %esp
+; X86-SSE4-NEXT: popl %ebp
+; X86-SSE4-NEXT: retl
+;
+; X64-SSE4-LABEL: test_v32i32:
+; X64-SSE4: # %bb.0:
+; X64-SSE4-NEXT: pmaxud %xmm7, %xmm3
+; X64-SSE4-NEXT: pmaxud %xmm5, %xmm1
+; X64-SSE4-NEXT: pmaxud %xmm3, %xmm1
+; X64-SSE4-NEXT: pmaxud %xmm6, %xmm2
+; X64-SSE4-NEXT: pmaxud %xmm4, %xmm0
+; X64-SSE4-NEXT: pmaxud %xmm2, %xmm0
+; X64-SSE4-NEXT: pmaxud %xmm1, %xmm0
+; X64-SSE4-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X64-SSE4-NEXT: pmaxud %xmm0, %xmm1
+; X64-SSE4-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
+; X64-SSE4-NEXT: pmaxud %xmm1, %xmm0
+; X64-SSE4-NEXT: movd %xmm0, %eax
+; X64-SSE4-NEXT: retq
+;
+; X86-AVX1-LABEL: test_v32i32:
+; X86-AVX1: # %bb.0:
+; X86-AVX1-NEXT: pushl %ebp
+; X86-AVX1-NEXT: movl %esp, %ebp
+; X86-AVX1-NEXT: andl $-32, %esp
+; X86-AVX1-NEXT: subl $32, %esp
+; X86-AVX1-NEXT: vextractf128 $1, %ymm2, %xmm3
+; X86-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm4
+; X86-AVX1-NEXT: vpmaxud %xmm3, %xmm4, %xmm3
+; X86-AVX1-NEXT: vextractf128 $1, %ymm1, %xmm4
+; X86-AVX1-NEXT: vpmaxud 24(%ebp), %xmm4, %xmm4
+; X86-AVX1-NEXT: vpmaxud %xmm4, %xmm3, %xmm3
+; X86-AVX1-NEXT: vpmaxud %xmm2, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpmaxud 8(%ebp), %xmm1, %xmm1
+; X86-AVX1-NEXT: vpmaxud %xmm1, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpmaxud %xmm3, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-AVX1-NEXT: vpmaxud %xmm1, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; X86-AVX1-NEXT: vpmaxud %xmm1, %xmm0, %xmm0
+; X86-AVX1-NEXT: vmovd %xmm0, %eax
+; X86-AVX1-NEXT: movl %ebp, %esp
+; X86-AVX1-NEXT: popl %ebp
+; X86-AVX1-NEXT: vzeroupper
+; X86-AVX1-NEXT: retl
+;
+; X64-AVX1-LABEL: test_v32i32:
+; X64-AVX1: # %bb.0:
+; X64-AVX1-NEXT: vextractf128 $1, %ymm3, %xmm4
+; X64-AVX1-NEXT: vextractf128 $1, %ymm1, %xmm5
+; X64-AVX1-NEXT: vpmaxud %xmm4, %xmm5, %xmm4
+; X64-AVX1-NEXT: vextractf128 $1, %ymm2, %xmm5
+; X64-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm6
+; X64-AVX1-NEXT: vpmaxud %xmm5, %xmm6, %xmm5
+; X64-AVX1-NEXT: vpmaxud %xmm4, %xmm5, %xmm4
+; X64-AVX1-NEXT: vpmaxud %xmm3, %xmm1, %xmm1
+; X64-AVX1-NEXT: vpmaxud %xmm2, %xmm0, %xmm0
+; X64-AVX1-NEXT: vpmaxud %xmm1, %xmm0, %xmm0
+; X64-AVX1-NEXT: vpmaxud %xmm4, %xmm0, %xmm0
+; X64-AVX1-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X64-AVX1-NEXT: vpmaxud %xmm1, %xmm0, %xmm0
+; X64-AVX1-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; X64-AVX1-NEXT: vpmaxud %xmm1, %xmm0, %xmm0
+; X64-AVX1-NEXT: vmovd %xmm0, %eax
+; X64-AVX1-NEXT: vzeroupper
+; X64-AVX1-NEXT: retq
+;
+; X86-AVX2-LABEL: test_v32i32:
+; X86-AVX2: # %bb.0:
+; X86-AVX2-NEXT: pushl %ebp
+; X86-AVX2-NEXT: movl %esp, %ebp
+; X86-AVX2-NEXT: andl $-32, %esp
+; X86-AVX2-NEXT: subl $32, %esp
+; X86-AVX2-NEXT: vpmaxud %ymm2, %ymm0, %ymm0
+; X86-AVX2-NEXT: vpmaxud 8(%ebp), %ymm1, %ymm1
+; X86-AVX2-NEXT: vpmaxud %ymm1, %ymm0, %ymm0
+; X86-AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
+; X86-AVX2-NEXT: vpmaxud %xmm1, %xmm0, %xmm0
+; X86-AVX2-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-AVX2-NEXT: vpmaxud %xmm1, %xmm0, %xmm0
+; X86-AVX2-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; X86-AVX2-NEXT: vpmaxud %xmm1, %xmm0, %xmm0
+; X86-AVX2-NEXT: vmovd %xmm0, %eax
+; X86-AVX2-NEXT: movl %ebp, %esp
+; X86-AVX2-NEXT: popl %ebp
+; X86-AVX2-NEXT: vzeroupper
+; X86-AVX2-NEXT: retl
+;
+; X64-AVX2-LABEL: test_v32i32:
+; X64-AVX2: # %bb.0:
+; X64-AVX2-NEXT: vpmaxud %ymm3, %ymm1, %ymm1
+; X64-AVX2-NEXT: vpmaxud %ymm2, %ymm0, %ymm0
+; X64-AVX2-NEXT: vpmaxud %ymm1, %ymm0, %ymm0
+; X64-AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
+; X64-AVX2-NEXT: vpmaxud %xmm1, %xmm0, %xmm0
+; X64-AVX2-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X64-AVX2-NEXT: vpmaxud %xmm1, %xmm0, %xmm0
+; X64-AVX2-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; X64-AVX2-NEXT: vpmaxud %xmm1, %xmm0, %xmm0
+; X64-AVX2-NEXT: vmovd %xmm0, %eax
+; X64-AVX2-NEXT: vzeroupper
+; X64-AVX2-NEXT: retq
;
; AVX512-LABEL: test_v32i32:
; AVX512: # %bb.0:
@@ -1251,7 +2356,7 @@ define i32 @test_v32i32(<32 x i32> %a0) {
; vXi16
;
-define i16 @test_v2i16(<2 x i16> %a0) {
+define i16 @test_v2i16(<2 x i16> %a0) nounwind {
; SSE2-LABEL: test_v2i16:
; SSE2: # %bb.0:
; SSE2-NEXT: movdqa %xmm0, %xmm1
@@ -1260,7 +2365,7 @@ define i16 @test_v2i16(<2 x i16> %a0) {
; SSE2-NEXT: paddw %xmm0, %xmm1
; SSE2-NEXT: movd %xmm1, %eax
; SSE2-NEXT: # kill: def $ax killed $ax killed $eax
-; SSE2-NEXT: retq
+; SSE2-NEXT: ret{{[l|q]}}
;
; SSE4-LABEL: test_v2i16:
; SSE4: # %bb.0:
@@ -1269,7 +2374,7 @@ define i16 @test_v2i16(<2 x i16> %a0) {
; SSE4-NEXT: pmaxuw %xmm0, %xmm1
; SSE4-NEXT: movd %xmm1, %eax
; SSE4-NEXT: # kill: def $ax killed $ax killed $eax
-; SSE4-NEXT: retq
+; SSE4-NEXT: ret{{[l|q]}}
;
; AVX-LABEL: test_v2i16:
; AVX: # %bb.0:
@@ -1277,20 +2382,12 @@ define i16 @test_v2i16(<2 x i16> %a0) {
; AVX-NEXT: vpmaxuw %xmm1, %xmm0, %xmm0
; AVX-NEXT: vmovd %xmm0, %eax
; AVX-NEXT: # kill: def $ax killed $ax killed $eax
-; AVX-NEXT: retq
-;
-; AVX512-LABEL: test_v2i16:
-; AVX512: # %bb.0:
-; AVX512-NEXT: vpsrld $16, %xmm0, %xmm1
-; AVX512-NEXT: vpmaxuw %xmm1, %xmm0, %xmm0
-; AVX512-NEXT: vmovd %xmm0, %eax
-; AVX512-NEXT: # kill: def $ax killed $ax killed $eax
-; AVX512-NEXT: retq
+; AVX-NEXT: ret{{[l|q]}}
%1 = call i16 @llvm.vector.reduce.umax.v2i16(<2 x i16> %a0)
ret i16 %1
}
-define i16 @test_v4i16(<4 x i16> %a0) {
+define i16 @test_v4i16(<4 x i16> %a0) nounwind {
; SSE2-LABEL: test_v4i16:
; SSE2: # %bb.0:
; SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
@@ -1302,7 +2399,7 @@ define i16 @test_v4i16(<4 x i16> %a0) {
; SSE2-NEXT: paddw %xmm1, %xmm0
; SSE2-NEXT: movd %xmm0, %eax
; SSE2-NEXT: # kill: def $ax killed $ax killed $eax
-; SSE2-NEXT: retq
+; SSE2-NEXT: ret{{[l|q]}}
;
; SSE4-LABEL: test_v4i16:
; SSE4: # %bb.0:
@@ -1313,7 +2410,7 @@ define i16 @test_v4i16(<4 x i16> %a0) {
; SSE4-NEXT: pmaxuw %xmm1, %xmm0
; SSE4-NEXT: movd %xmm0, %eax
; SSE4-NEXT: # kill: def $ax killed $ax killed $eax
-; SSE4-NEXT: retq
+; SSE4-NEXT: ret{{[l|q]}}
;
; AVX-LABEL: test_v4i16:
; AVX: # %bb.0:
@@ -1323,22 +2420,12 @@ define i16 @test_v4i16(<4 x i16> %a0) {
; AVX-NEXT: vpmaxuw %xmm1, %xmm0, %xmm0
; AVX-NEXT: vmovd %xmm0, %eax
; AVX-NEXT: # kill: def $ax killed $ax killed $eax
-; AVX-NEXT: retq
-;
-; AVX512-LABEL: test_v4i16:
-; AVX512: # %bb.0:
-; AVX512-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
-; AVX512-NEXT: vpmaxuw %xmm1, %xmm0, %xmm0
-; AVX512-NEXT: vpsrld $16, %xmm0, %xmm1
-; AVX512-NEXT: vpmaxuw %xmm1, %xmm0, %xmm0
-; AVX512-NEXT: vmovd %xmm0, %eax
-; AVX512-NEXT: # kill: def $ax killed $ax killed $eax
-; AVX512-NEXT: retq
+; AVX-NEXT: ret{{[l|q]}}
%1 = call i16 @llvm.vector.reduce.umax.v4i16(<4 x i16> %a0)
ret i16 %1
}
-define i16 @test_v8i16(<8 x i16> %a0) {
+define i16 @test_v8i16(<8 x i16> %a0) nounwind {
; SSE2-LABEL: test_v8i16:
; SSE2: # %bb.0:
; SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
@@ -1353,7 +2440,7 @@ define i16 @test_v8i16(<8 x i16> %a0) {
; SSE2-NEXT: paddw %xmm0, %xmm1
; SSE2-NEXT: movd %xmm1, %eax
; SSE2-NEXT: # kill: def $ax killed $ax killed $eax
-; SSE2-NEXT: retq
+; SSE2-NEXT: ret{{[l|q]}}
;
; SSE4-LABEL: test_v8i16:
; SSE4: # %bb.0:
@@ -1363,17 +2450,27 @@ define i16 @test_v8i16(<8 x i16> %a0) {
; SSE4-NEXT: movd %xmm0, %eax
; SSE4-NEXT: notl %eax
; SSE4-NEXT: # kill: def $ax killed $ax killed $eax
-; SSE4-NEXT: retq
+; SSE4-NEXT: ret{{[l|q]}}
;
-; AVX-LABEL: test_v8i16:
-; AVX: # %bb.0:
-; AVX-NEXT: vpcmpeqd %xmm1, %xmm1, %xmm1
-; AVX-NEXT: vpxor %xmm1, %xmm0, %xmm0
-; AVX-NEXT: vphminposuw %xmm0, %xmm0
-; AVX-NEXT: vmovd %xmm0, %eax
-; AVX-NEXT: notl %eax
-; AVX-NEXT: # kill: def $ax killed $ax killed $eax
-; AVX-NEXT: retq
+; AVX1-LABEL: test_v8i16:
+; AVX1: # %bb.0:
+; AVX1-NEXT: vpcmpeqd %xmm1, %xmm1, %xmm1
+; AVX1-NEXT: vpxor %xmm1, %xmm0, %xmm0
+; AVX1-NEXT: vphminposuw %xmm0, %xmm0
+; AVX1-NEXT: vmovd %xmm0, %eax
+; AVX1-NEXT: notl %eax
+; AVX1-NEXT: # kill: def $ax killed $ax killed $eax
+; AVX1-NEXT: ret{{[l|q]}}
+;
+; AVX2-LABEL: test_v8i16:
+; AVX2: # %bb.0:
+; AVX2-NEXT: vpcmpeqd %xmm1, %xmm1, %xmm1
+; AVX2-NEXT: vpxor %xmm1, %xmm0, %xmm0
+; AVX2-NEXT: vphminposuw %xmm0, %xmm0
+; AVX2-NEXT: vmovd %xmm0, %eax
+; AVX2-NEXT: notl %eax
+; AVX2-NEXT: # kill: def $ax killed $ax killed $eax
+; AVX2-NEXT: ret{{[l|q]}}
;
; AVX512BW-LABEL: test_v8i16:
; AVX512BW: # %bb.0:
@@ -1398,7 +2495,7 @@ define i16 @test_v8i16(<8 x i16> %a0) {
ret i16 %1
}
-define i16 @test_v16i16(<16 x i16> %a0) {
+define i16 @test_v16i16(<16 x i16> %a0) nounwind {
; SSE2-LABEL: test_v16i16:
; SSE2: # %bb.0:
; SSE2-NEXT: psubusw %xmm0, %xmm1
@@ -1415,7 +2512,7 @@ define i16 @test_v16i16(<16 x i16> %a0) {
; SSE2-NEXT: paddw %xmm1, %xmm0
; SSE2-NEXT: movd %xmm0, %eax
; SSE2-NEXT: # kill: def $ax killed $ax killed $eax
-; SSE2-NEXT: retq
+; SSE2-NEXT: ret{{[l|q]}}
;
; SSE4-LABEL: test_v16i16:
; SSE4: # %bb.0:
@@ -1426,7 +2523,7 @@ define i16 @test_v16i16(<16 x i16> %a0) {
; SSE4-NEXT: movd %xmm0, %eax
; SSE4-NEXT: notl %eax
; SSE4-NEXT: # kill: def $ax killed $ax killed $eax
-; SSE4-NEXT: retq
+; SSE4-NEXT: ret{{[l|q]}}
;
; AVX1-LABEL: test_v16i16:
; AVX1: # %bb.0:
@@ -1439,7 +2536,7 @@ define i16 @test_v16i16(<16 x i16> %a0) {
; AVX1-NEXT: notl %eax
; AVX1-NEXT: # kill: def $ax killed $ax killed $eax
; AVX1-NEXT: vzeroupper
-; AVX1-NEXT: retq
+; AVX1-NEXT: ret{{[l|q]}}
;
; AVX2-LABEL: test_v16i16:
; AVX2: # %bb.0:
@@ -1452,7 +2549,7 @@ define i16 @test_v16i16(<16 x i16> %a0) {
; AVX2-NEXT: notl %eax
; AVX2-NEXT: # kill: def $ax killed $ax killed $eax
; AVX2-NEXT: vzeroupper
-; AVX2-NEXT: retq
+; AVX2-NEXT: ret{{[l|q]}}
;
; AVX512BW-LABEL: test_v16i16:
; AVX512BW: # %bb.0:
@@ -1481,41 +2578,89 @@ define i16 @test_v16i16(<16 x i16> %a0) {
ret i16 %1
}
-define i16 @test_v32i16(<32 x i16> %a0) {
-; SSE2-LABEL: test_v32i16:
-; SSE2: # %bb.0:
-; SSE2-NEXT: psubusw %xmm0, %xmm2
-; SSE2-NEXT: paddw %xmm0, %xmm2
-; SSE2-NEXT: psubusw %xmm1, %xmm3
-; SSE2-NEXT: paddw %xmm1, %xmm3
-; SSE2-NEXT: psubusw %xmm2, %xmm3
-; SSE2-NEXT: paddw %xmm2, %xmm3
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm3[2,3,2,3]
-; SSE2-NEXT: psubusw %xmm3, %xmm0
-; SSE2-NEXT: paddw %xmm3, %xmm0
-; SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
-; SSE2-NEXT: psubusw %xmm0, %xmm1
-; SSE2-NEXT: paddw %xmm0, %xmm1
-; SSE2-NEXT: movdqa %xmm1, %xmm0
-; SSE2-NEXT: psrld $16, %xmm0
-; SSE2-NEXT: psubusw %xmm1, %xmm0
-; SSE2-NEXT: paddw %xmm1, %xmm0
-; SSE2-NEXT: movd %xmm0, %eax
-; SSE2-NEXT: # kill: def $ax killed $ax killed $eax
-; SSE2-NEXT: retq
-;
-; SSE4-LABEL: test_v32i16:
-; SSE4: # %bb.0:
-; SSE4-NEXT: pmaxuw %xmm3, %xmm1
-; SSE4-NEXT: pmaxuw %xmm2, %xmm0
-; SSE4-NEXT: pmaxuw %xmm1, %xmm0
-; SSE4-NEXT: pcmpeqd %xmm1, %xmm1
-; SSE4-NEXT: pxor %xmm0, %xmm1
-; SSE4-NEXT: phminposuw %xmm1, %xmm0
-; SSE4-NEXT: movd %xmm0, %eax
-; SSE4-NEXT: notl %eax
-; SSE4-NEXT: # kill: def $ax killed $ax killed $eax
-; SSE4-NEXT: retq
+define i16 @test_v32i16(<32 x i16> %a0) nounwind {
+; X86-SSE2-LABEL: test_v32i16:
+; X86-SSE2: # %bb.0:
+; X86-SSE2-NEXT: pushl %ebp
+; X86-SSE2-NEXT: movl %esp, %ebp
+; X86-SSE2-NEXT: andl $-16, %esp
+; X86-SSE2-NEXT: subl $16, %esp
+; X86-SSE2-NEXT: movdqa 8(%ebp), %xmm3
+; X86-SSE2-NEXT: psubusw %xmm0, %xmm2
+; X86-SSE2-NEXT: paddw %xmm0, %xmm2
+; X86-SSE2-NEXT: psubusw %xmm1, %xmm3
+; X86-SSE2-NEXT: paddw %xmm1, %xmm3
+; X86-SSE2-NEXT: psubusw %xmm2, %xmm3
+; X86-SSE2-NEXT: paddw %xmm2, %xmm3
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm3[2,3,2,3]
+; X86-SSE2-NEXT: psubusw %xmm3, %xmm0
+; X86-SSE2-NEXT: paddw %xmm3, %xmm0
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; X86-SSE2-NEXT: psubusw %xmm0, %xmm1
+; X86-SSE2-NEXT: paddw %xmm0, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE2-NEXT: psrld $16, %xmm0
+; X86-SSE2-NEXT: psubusw %xmm1, %xmm0
+; X86-SSE2-NEXT: paddw %xmm1, %xmm0
+; X86-SSE2-NEXT: movd %xmm0, %eax
+; X86-SSE2-NEXT: # kill: def $ax killed $ax killed $eax
+; X86-SSE2-NEXT: movl %ebp, %esp
+; X86-SSE2-NEXT: popl %ebp
+; X86-SSE2-NEXT: retl
+;
+; X64-SSE2-LABEL: test_v32i16:
+; X64-SSE2: # %bb.0:
+; X64-SSE2-NEXT: psubusw %xmm0, %xmm2
+; X64-SSE2-NEXT: paddw %xmm0, %xmm2
+; X64-SSE2-NEXT: psubusw %xmm1, %xmm3
+; X64-SSE2-NEXT: paddw %xmm1, %xmm3
+; X64-SSE2-NEXT: psubusw %xmm2, %xmm3
+; X64-SSE2-NEXT: paddw %xmm2, %xmm3
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm3[2,3,2,3]
+; X64-SSE2-NEXT: psubusw %xmm3, %xmm0
+; X64-SSE2-NEXT: paddw %xmm3, %xmm0
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; X64-SSE2-NEXT: psubusw %xmm0, %xmm1
+; X64-SSE2-NEXT: paddw %xmm0, %xmm1
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X64-SSE2-NEXT: psrld $16, %xmm0
+; X64-SSE2-NEXT: psubusw %xmm1, %xmm0
+; X64-SSE2-NEXT: paddw %xmm1, %xmm0
+; X64-SSE2-NEXT: movd %xmm0, %eax
+; X64-SSE2-NEXT: # kill: def $ax killed $ax killed $eax
+; X64-SSE2-NEXT: retq
+;
+; X86-SSE4-LABEL: test_v32i16:
+; X86-SSE4: # %bb.0:
+; X86-SSE4-NEXT: pushl %ebp
+; X86-SSE4-NEXT: movl %esp, %ebp
+; X86-SSE4-NEXT: andl $-16, %esp
+; X86-SSE4-NEXT: subl $16, %esp
+; X86-SSE4-NEXT: pmaxuw %xmm2, %xmm0
+; X86-SSE4-NEXT: pmaxuw 8(%ebp), %xmm1
+; X86-SSE4-NEXT: pmaxuw %xmm0, %xmm1
+; X86-SSE4-NEXT: pcmpeqd %xmm0, %xmm0
+; X86-SSE4-NEXT: pxor %xmm1, %xmm0
+; X86-SSE4-NEXT: phminposuw %xmm0, %xmm0
+; X86-SSE4-NEXT: movd %xmm0, %eax
+; X86-SSE4-NEXT: notl %eax
+; X86-SSE4-NEXT: # kill: def $ax killed $ax killed $eax
+; X86-SSE4-NEXT: movl %ebp, %esp
+; X86-SSE4-NEXT: popl %ebp
+; X86-SSE4-NEXT: retl
+;
+; X64-SSE4-LABEL: test_v32i16:
+; X64-SSE4: # %bb.0:
+; X64-SSE4-NEXT: pmaxuw %xmm3, %xmm1
+; X64-SSE4-NEXT: pmaxuw %xmm2, %xmm0
+; X64-SSE4-NEXT: pmaxuw %xmm1, %xmm0
+; X64-SSE4-NEXT: pcmpeqd %xmm1, %xmm1
+; X64-SSE4-NEXT: pxor %xmm0, %xmm1
+; X64-SSE4-NEXT: phminposuw %xmm1, %xmm0
+; X64-SSE4-NEXT: movd %xmm0, %eax
+; X64-SSE4-NEXT: notl %eax
+; X64-SSE4-NEXT: # kill: def $ax killed $ax killed $eax
+; X64-SSE4-NEXT: retq
;
; AVX1-LABEL: test_v32i16:
; AVX1: # %bb.0:
@@ -1531,7 +2676,7 @@ define i16 @test_v32i16(<32 x i16> %a0) {
; AVX1-NEXT: notl %eax
; AVX1-NEXT: # kill: def $ax killed $ax killed $eax
; AVX1-NEXT: vzeroupper
-; AVX1-NEXT: retq
+; AVX1-NEXT: ret{{[l|q]}}
;
; AVX2-LABEL: test_v32i16:
; AVX2: # %bb.0:
@@ -1545,7 +2690,7 @@ define i16 @test_v32i16(<32 x i16> %a0) {
; AVX2-NEXT: notl %eax
; AVX2-NEXT: # kill: def $ax killed $ax killed $eax
; AVX2-NEXT: vzeroupper
-; AVX2-NEXT: retq
+; AVX2-NEXT: ret{{[l|q]}}
;
; AVX512BW-LABEL: test_v32i16:
; AVX512BW: # %bb.0:
@@ -1578,91 +2723,205 @@ define i16 @test_v32i16(<32 x i16> %a0) {
ret i16 %1
}
-define i16 @test_v64i16(<64 x i16> %a0) {
-; SSE2-LABEL: test_v64i16:
-; SSE2: # %bb.0:
-; SSE2-NEXT: psubusw %xmm0, %xmm4
-; SSE2-NEXT: paddw %xmm0, %xmm4
-; SSE2-NEXT: psubusw %xmm2, %xmm6
-; SSE2-NEXT: paddw %xmm2, %xmm6
-; SSE2-NEXT: psubusw %xmm4, %xmm6
-; SSE2-NEXT: paddw %xmm4, %xmm6
-; SSE2-NEXT: psubusw %xmm1, %xmm5
-; SSE2-NEXT: paddw %xmm1, %xmm5
-; SSE2-NEXT: psubusw %xmm3, %xmm7
-; SSE2-NEXT: paddw %xmm3, %xmm7
-; SSE2-NEXT: psubusw %xmm5, %xmm7
-; SSE2-NEXT: paddw %xmm5, %xmm7
-; SSE2-NEXT: psubusw %xmm6, %xmm7
-; SSE2-NEXT: paddw %xmm6, %xmm7
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm7[2,3,2,3]
-; SSE2-NEXT: psubusw %xmm7, %xmm0
-; SSE2-NEXT: paddw %xmm7, %xmm0
-; SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
-; SSE2-NEXT: psubusw %xmm0, %xmm1
-; SSE2-NEXT: paddw %xmm0, %xmm1
-; SSE2-NEXT: movdqa %xmm1, %xmm0
-; SSE2-NEXT: psrld $16, %xmm0
-; SSE2-NEXT: psubusw %xmm1, %xmm0
-; SSE2-NEXT: paddw %xmm1, %xmm0
-; SSE2-NEXT: movd %xmm0, %eax
-; SSE2-NEXT: # kill: def $ax killed $ax killed $eax
-; SSE2-NEXT: retq
-;
-; SSE4-LABEL: test_v64i16:
-; SSE4: # %bb.0:
-; SSE4-NEXT: pmaxuw %xmm7, %xmm3
-; SSE4-NEXT: pmaxuw %xmm5, %xmm1
-; SSE4-NEXT: pmaxuw %xmm3, %xmm1
-; SSE4-NEXT: pmaxuw %xmm6, %xmm2
-; SSE4-NEXT: pmaxuw %xmm4, %xmm0
-; SSE4-NEXT: pmaxuw %xmm2, %xmm0
-; SSE4-NEXT: pmaxuw %xmm1, %xmm0
-; SSE4-NEXT: pcmpeqd %xmm1, %xmm1
-; SSE4-NEXT: pxor %xmm0, %xmm1
-; SSE4-NEXT: phminposuw %xmm1, %xmm0
-; SSE4-NEXT: movd %xmm0, %eax
-; SSE4-NEXT: notl %eax
-; SSE4-NEXT: # kill: def $ax killed $ax killed $eax
-; SSE4-NEXT: retq
-;
-; AVX1-LABEL: test_v64i16:
-; AVX1: # %bb.0:
-; AVX1-NEXT: vextractf128 $1, %ymm3, %xmm4
-; AVX1-NEXT: vextractf128 $1, %ymm1, %xmm5
-; AVX1-NEXT: vpmaxuw %xmm4, %xmm5, %xmm4
-; AVX1-NEXT: vextractf128 $1, %ymm2, %xmm5
-; AVX1-NEXT: vextractf128 $1, %ymm0, %xmm6
-; AVX1-NEXT: vpmaxuw %xmm5, %xmm6, %xmm5
-; AVX1-NEXT: vpmaxuw %xmm4, %xmm5, %xmm4
-; AVX1-NEXT: vpmaxuw %xmm3, %xmm1, %xmm1
-; AVX1-NEXT: vpmaxuw %xmm2, %xmm0, %xmm0
-; AVX1-NEXT: vpmaxuw %xmm1, %xmm0, %xmm0
-; AVX1-NEXT: vpmaxuw %xmm4, %xmm0, %xmm0
-; AVX1-NEXT: vpcmpeqd %xmm1, %xmm1, %xmm1
-; AVX1-NEXT: vpxor %xmm1, %xmm0, %xmm0
-; AVX1-NEXT: vphminposuw %xmm0, %xmm0
-; AVX1-NEXT: vmovd %xmm0, %eax
-; AVX1-NEXT: notl %eax
-; AVX1-NEXT: # kill: def $ax killed $ax killed $eax
-; AVX1-NEXT: vzeroupper
-; AVX1-NEXT: retq
-;
-; AVX2-LABEL: test_v64i16:
-; AVX2: # %bb.0:
-; AVX2-NEXT: vpmaxuw %ymm3, %ymm1, %ymm1
-; AVX2-NEXT: vpmaxuw %ymm2, %ymm0, %ymm0
-; AVX2-NEXT: vpmaxuw %ymm1, %ymm0, %ymm0
-; AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
-; AVX2-NEXT: vpmaxuw %xmm1, %xmm0, %xmm0
-; AVX2-NEXT: vpcmpeqd %xmm1, %xmm1, %xmm1
-; AVX2-NEXT: vpxor %xmm1, %xmm0, %xmm0
-; AVX2-NEXT: vphminposuw %xmm0, %xmm0
-; AVX2-NEXT: vmovd %xmm0, %eax
-; AVX2-NEXT: notl %eax
-; AVX2-NEXT: # kill: def $ax killed $ax killed $eax
-; AVX2-NEXT: vzeroupper
-; AVX2-NEXT: retq
+define i16 @test_v64i16(<64 x i16> %a0) nounwind {
+; X86-SSE2-LABEL: test_v64i16:
+; X86-SSE2: # %bb.0:
+; X86-SSE2-NEXT: pushl %ebp
+; X86-SSE2-NEXT: movl %esp, %ebp
+; X86-SSE2-NEXT: andl $-16, %esp
+; X86-SSE2-NEXT: subl $16, %esp
+; X86-SSE2-NEXT: movdqa 8(%ebp), %xmm6
+; X86-SSE2-NEXT: movdqa 72(%ebp), %xmm3
+; X86-SSE2-NEXT: movdqa 40(%ebp), %xmm5
+; X86-SSE2-NEXT: movdqa 56(%ebp), %xmm4
+; X86-SSE2-NEXT: movdqa 24(%ebp), %xmm7
+; X86-SSE2-NEXT: psubusw %xmm0, %xmm7
+; X86-SSE2-NEXT: paddw %xmm0, %xmm7
+; X86-SSE2-NEXT: psubusw %xmm2, %xmm4
+; X86-SSE2-NEXT: paddw %xmm2, %xmm4
+; X86-SSE2-NEXT: psubusw %xmm7, %xmm4
+; X86-SSE2-NEXT: paddw %xmm7, %xmm4
+; X86-SSE2-NEXT: psubusw %xmm1, %xmm5
+; X86-SSE2-NEXT: paddw %xmm1, %xmm5
+; X86-SSE2-NEXT: psubusw %xmm6, %xmm3
+; X86-SSE2-NEXT: paddw %xmm6, %xmm3
+; X86-SSE2-NEXT: psubusw %xmm5, %xmm3
+; X86-SSE2-NEXT: paddw %xmm5, %xmm3
+; X86-SSE2-NEXT: psubusw %xmm4, %xmm3
+; X86-SSE2-NEXT: paddw %xmm4, %xmm3
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm3[2,3,2,3]
+; X86-SSE2-NEXT: psubusw %xmm3, %xmm0
+; X86-SSE2-NEXT: paddw %xmm3, %xmm0
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; X86-SSE2-NEXT: psubusw %xmm0, %xmm1
+; X86-SSE2-NEXT: paddw %xmm0, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE2-NEXT: psrld $16, %xmm0
+; X86-SSE2-NEXT: psubusw %xmm1, %xmm0
+; X86-SSE2-NEXT: paddw %xmm1, %xmm0
+; X86-SSE2-NEXT: movd %xmm0, %eax
+; X86-SSE2-NEXT: # kill: def $ax killed $ax killed $eax
+; X86-SSE2-NEXT: movl %ebp, %esp
+; X86-SSE2-NEXT: popl %ebp
+; X86-SSE2-NEXT: retl
+;
+; X64-SSE2-LABEL: test_v64i16:
+; X64-SSE2: # %bb.0:
+; X64-SSE2-NEXT: psubusw %xmm0, %xmm4
+; X64-SSE2-NEXT: paddw %xmm0, %xmm4
+; X64-SSE2-NEXT: psubusw %xmm2, %xmm6
+; X64-SSE2-NEXT: paddw %xmm2, %xmm6
+; X64-SSE2-NEXT: psubusw %xmm4, %xmm6
+; X64-SSE2-NEXT: paddw %xmm4, %xmm6
+; X64-SSE2-NEXT: psubusw %xmm1, %xmm5
+; X64-SSE2-NEXT: paddw %xmm1, %xmm5
+; X64-SSE2-NEXT: psubusw %xmm3, %xmm7
+; X64-SSE2-NEXT: paddw %xmm3, %xmm7
+; X64-SSE2-NEXT: psubusw %xmm5, %xmm7
+; X64-SSE2-NEXT: paddw %xmm5, %xmm7
+; X64-SSE2-NEXT: psubusw %xmm6, %xmm7
+; X64-SSE2-NEXT: paddw %xmm6, %xmm7
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm7[2,3,2,3]
+; X64-SSE2-NEXT: psubusw %xmm7, %xmm0
+; X64-SSE2-NEXT: paddw %xmm7, %xmm0
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; X64-SSE2-NEXT: psubusw %xmm0, %xmm1
+; X64-SSE2-NEXT: paddw %xmm0, %xmm1
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X64-SSE2-NEXT: psrld $16, %xmm0
+; X64-SSE2-NEXT: psubusw %xmm1, %xmm0
+; X64-SSE2-NEXT: paddw %xmm1, %xmm0
+; X64-SSE2-NEXT: movd %xmm0, %eax
+; X64-SSE2-NEXT: # kill: def $ax killed $ax killed $eax
+; X64-SSE2-NEXT: retq
+;
+; X86-SSE4-LABEL: test_v64i16:
+; X86-SSE4: # %bb.0:
+; X86-SSE4-NEXT: pushl %ebp
+; X86-SSE4-NEXT: movl %esp, %ebp
+; X86-SSE4-NEXT: andl $-16, %esp
+; X86-SSE4-NEXT: subl $16, %esp
+; X86-SSE4-NEXT: movdqa 8(%ebp), %xmm3
+; X86-SSE4-NEXT: pmaxuw 72(%ebp), %xmm3
+; X86-SSE4-NEXT: pmaxuw 40(%ebp), %xmm1
+; X86-SSE4-NEXT: pmaxuw %xmm3, %xmm1
+; X86-SSE4-NEXT: pmaxuw 56(%ebp), %xmm2
+; X86-SSE4-NEXT: pmaxuw 24(%ebp), %xmm0
+; X86-SSE4-NEXT: pmaxuw %xmm2, %xmm0
+; X86-SSE4-NEXT: pmaxuw %xmm1, %xmm0
+; X86-SSE4-NEXT: pcmpeqd %xmm1, %xmm1
+; X86-SSE4-NEXT: pxor %xmm0, %xmm1
+; X86-SSE4-NEXT: phminposuw %xmm1, %xmm0
+; X86-SSE4-NEXT: movd %xmm0, %eax
+; X86-SSE4-NEXT: notl %eax
+; X86-SSE4-NEXT: # kill: def $ax killed $ax killed $eax
+; X86-SSE4-NEXT: movl %ebp, %esp
+; X86-SSE4-NEXT: popl %ebp
+; X86-SSE4-NEXT: retl
+;
+; X64-SSE4-LABEL: test_v64i16:
+; X64-SSE4: # %bb.0:
+; X64-SSE4-NEXT: pmaxuw %xmm7, %xmm3
+; X64-SSE4-NEXT: pmaxuw %xmm5, %xmm1
+; X64-SSE4-NEXT: pmaxuw %xmm3, %xmm1
+; X64-SSE4-NEXT: pmaxuw %xmm6, %xmm2
+; X64-SSE4-NEXT: pmaxuw %xmm4, %xmm0
+; X64-SSE4-NEXT: pmaxuw %xmm2, %xmm0
+; X64-SSE4-NEXT: pmaxuw %xmm1, %xmm0
+; X64-SSE4-NEXT: pcmpeqd %xmm1, %xmm1
+; X64-SSE4-NEXT: pxor %xmm0, %xmm1
+; X64-SSE4-NEXT: phminposuw %xmm1, %xmm0
+; X64-SSE4-NEXT: movd %xmm0, %eax
+; X64-SSE4-NEXT: notl %eax
+; X64-SSE4-NEXT: # kill: def $ax killed $ax killed $eax
+; X64-SSE4-NEXT: retq
+;
+; X86-AVX1-LABEL: test_v64i16:
+; X86-AVX1: # %bb.0:
+; X86-AVX1-NEXT: pushl %ebp
+; X86-AVX1-NEXT: movl %esp, %ebp
+; X86-AVX1-NEXT: andl $-32, %esp
+; X86-AVX1-NEXT: subl $32, %esp
+; X86-AVX1-NEXT: vextractf128 $1, %ymm2, %xmm3
+; X86-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm4
+; X86-AVX1-NEXT: vpmaxuw %xmm3, %xmm4, %xmm3
+; X86-AVX1-NEXT: vextractf128 $1, %ymm1, %xmm4
+; X86-AVX1-NEXT: vpmaxuw 24(%ebp), %xmm4, %xmm4
+; X86-AVX1-NEXT: vpmaxuw %xmm4, %xmm3, %xmm3
+; X86-AVX1-NEXT: vpmaxuw %xmm2, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpmaxuw 8(%ebp), %xmm1, %xmm1
+; X86-AVX1-NEXT: vpmaxuw %xmm1, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpmaxuw %xmm3, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpcmpeqd %xmm1, %xmm1, %xmm1
+; X86-AVX1-NEXT: vpxor %xmm1, %xmm0, %xmm0
+; X86-AVX1-NEXT: vphminposuw %xmm0, %xmm0
+; X86-AVX1-NEXT: vmovd %xmm0, %eax
+; X86-AVX1-NEXT: notl %eax
+; X86-AVX1-NEXT: # kill: def $ax killed $ax killed $eax
+; X86-AVX1-NEXT: movl %ebp, %esp
+; X86-AVX1-NEXT: popl %ebp
+; X86-AVX1-NEXT: vzeroupper
+; X86-AVX1-NEXT: retl
+;
+; X64-AVX1-LABEL: test_v64i16:
+; X64-AVX1: # %bb.0:
+; X64-AVX1-NEXT: vextractf128 $1, %ymm3, %xmm4
+; X64-AVX1-NEXT: vextractf128 $1, %ymm1, %xmm5
+; X64-AVX1-NEXT: vpmaxuw %xmm4, %xmm5, %xmm4
+; X64-AVX1-NEXT: vextractf128 $1, %ymm2, %xmm5
+; X64-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm6
+; X64-AVX1-NEXT: vpmaxuw %xmm5, %xmm6, %xmm5
+; X64-AVX1-NEXT: vpmaxuw %xmm4, %xmm5, %xmm4
+; X64-AVX1-NEXT: vpmaxuw %xmm3, %xmm1, %xmm1
+; X64-AVX1-NEXT: vpmaxuw %xmm2, %xmm0, %xmm0
+; X64-AVX1-NEXT: vpmaxuw %xmm1, %xmm0, %xmm0
+; X64-AVX1-NEXT: vpmaxuw %xmm4, %xmm0, %xmm0
+; X64-AVX1-NEXT: vpcmpeqd %xmm1, %xmm1, %xmm1
+; X64-AVX1-NEXT: vpxor %xmm1, %xmm0, %xmm0
+; X64-AVX1-NEXT: vphminposuw %xmm0, %xmm0
+; X64-AVX1-NEXT: vmovd %xmm0, %eax
+; X64-AVX1-NEXT: notl %eax
+; X64-AVX1-NEXT: # kill: def $ax killed $ax killed $eax
+; X64-AVX1-NEXT: vzeroupper
+; X64-AVX1-NEXT: retq
+;
+; X86-AVX2-LABEL: test_v64i16:
+; X86-AVX2: # %bb.0:
+; X86-AVX2-NEXT: pushl %ebp
+; X86-AVX2-NEXT: movl %esp, %ebp
+; X86-AVX2-NEXT: andl $-32, %esp
+; X86-AVX2-NEXT: subl $32, %esp
+; X86-AVX2-NEXT: vpmaxuw %ymm2, %ymm0, %ymm0
+; X86-AVX2-NEXT: vpmaxuw 8(%ebp), %ymm1, %ymm1
+; X86-AVX2-NEXT: vpmaxuw %ymm1, %ymm0, %ymm0
+; X86-AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
+; X86-AVX2-NEXT: vpmaxuw %xmm1, %xmm0, %xmm0
+; X86-AVX2-NEXT: vpcmpeqd %xmm1, %xmm1, %xmm1
+; X86-AVX2-NEXT: vpxor %xmm1, %xmm0, %xmm0
+; X86-AVX2-NEXT: vphminposuw %xmm0, %xmm0
+; X86-AVX2-NEXT: vmovd %xmm0, %eax
+; X86-AVX2-NEXT: notl %eax
+; X86-AVX2-NEXT: # kill: def $ax killed $ax killed $eax
+; X86-AVX2-NEXT: movl %ebp, %esp
+; X86-AVX2-NEXT: popl %ebp
+; X86-AVX2-NEXT: vzeroupper
+; X86-AVX2-NEXT: retl
+;
+; X64-AVX2-LABEL: test_v64i16:
+; X64-AVX2: # %bb.0:
+; X64-AVX2-NEXT: vpmaxuw %ymm3, %ymm1, %ymm1
+; X64-AVX2-NEXT: vpmaxuw %ymm2, %ymm0, %ymm0
+; X64-AVX2-NEXT: vpmaxuw %ymm1, %ymm0, %ymm0
+; X64-AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
+; X64-AVX2-NEXT: vpmaxuw %xmm1, %xmm0, %xmm0
+; X64-AVX2-NEXT: vpcmpeqd %xmm1, %xmm1, %xmm1
+; X64-AVX2-NEXT: vpxor %xmm1, %xmm0, %xmm0
+; X64-AVX2-NEXT: vphminposuw %xmm0, %xmm0
+; X64-AVX2-NEXT: vmovd %xmm0, %eax
+; X64-AVX2-NEXT: notl %eax
+; X64-AVX2-NEXT: # kill: def $ax killed $ax killed $eax
+; X64-AVX2-NEXT: vzeroupper
+; X64-AVX2-NEXT: retq
;
; AVX512BW-LABEL: test_v64i16:
; AVX512BW: # %bb.0:
@@ -1701,7 +2960,7 @@ define i16 @test_v64i16(<64 x i16> %a0) {
; vXi8
;
-define i8 @test_v2i8(<2 x i8> %a0) {
+define i8 @test_v2i8(<2 x i8> %a0) nounwind {
; SSE-LABEL: test_v2i8:
; SSE: # %bb.0:
; SSE-NEXT: movdqa %xmm0, %xmm1
@@ -1709,7 +2968,7 @@ define i8 @test_v2i8(<2 x i8> %a0) {
; SSE-NEXT: pmaxub %xmm0, %xmm1
; SSE-NEXT: movd %xmm1, %eax
; SSE-NEXT: # kill: def $al killed $al killed $eax
-; SSE-NEXT: retq
+; SSE-NEXT: ret{{[l|q]}}
;
; AVX-LABEL: test_v2i8:
; AVX: # %bb.0:
@@ -1717,20 +2976,12 @@ define i8 @test_v2i8(<2 x i8> %a0) {
; AVX-NEXT: vpmaxub %xmm1, %xmm0, %xmm0
; AVX-NEXT: vmovd %xmm0, %eax
; AVX-NEXT: # kill: def $al killed $al killed $eax
-; AVX-NEXT: retq
-;
-; AVX512-LABEL: test_v2i8:
-; AVX512: # %bb.0:
-; AVX512-NEXT: vpsrlw $8, %xmm0, %xmm1
-; AVX512-NEXT: vpmaxub %xmm1, %xmm0, %xmm0
-; AVX512-NEXT: vmovd %xmm0, %eax
-; AVX512-NEXT: # kill: def $al killed $al killed $eax
-; AVX512-NEXT: retq
+; AVX-NEXT: ret{{[l|q]}}
%1 = call i8 @llvm.vector.reduce.umax.v2i8(<2 x i8> %a0)
ret i8 %1
}
-define i8 @test_v4i8(<4 x i8> %a0) {
+define i8 @test_v4i8(<4 x i8> %a0) nounwind {
; SSE-LABEL: test_v4i8:
; SSE: # %bb.0:
; SSE-NEXT: movdqa %xmm0, %xmm1
@@ -1741,7 +2992,7 @@ define i8 @test_v4i8(<4 x i8> %a0) {
; SSE-NEXT: pmaxub %xmm1, %xmm0
; SSE-NEXT: movd %xmm0, %eax
; SSE-NEXT: # kill: def $al killed $al killed $eax
-; SSE-NEXT: retq
+; SSE-NEXT: ret{{[l|q]}}
;
; AVX-LABEL: test_v4i8:
; AVX: # %bb.0:
@@ -1751,22 +3002,12 @@ define i8 @test_v4i8(<4 x i8> %a0) {
; AVX-NEXT: vpmaxub %xmm1, %xmm0, %xmm0
; AVX-NEXT: vmovd %xmm0, %eax
; AVX-NEXT: # kill: def $al killed $al killed $eax
-; AVX-NEXT: retq
-;
-; AVX512-LABEL: test_v4i8:
-; AVX512: # %bb.0:
-; AVX512-NEXT: vpsrld $16, %xmm0, %xmm1
-; AVX512-NEXT: vpmaxub %xmm1, %xmm0, %xmm0
-; AVX512-NEXT: vpsrlw $8, %xmm0, %xmm1
-; AVX512-NEXT: vpmaxub %xmm1, %xmm0, %xmm0
-; AVX512-NEXT: vmovd %xmm0, %eax
-; AVX512-NEXT: # kill: def $al killed $al killed $eax
-; AVX512-NEXT: retq
+; AVX-NEXT: ret{{[l|q]}}
%1 = call i8 @llvm.vector.reduce.umax.v4i8(<4 x i8> %a0)
ret i8 %1
}
-define i8 @test_v8i8(<8 x i8> %a0) {
+define i8 @test_v8i8(<8 x i8> %a0) nounwind {
; SSE-LABEL: test_v8i8:
; SSE: # %bb.0:
; SSE-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
@@ -1779,7 +3020,7 @@ define i8 @test_v8i8(<8 x i8> %a0) {
; SSE-NEXT: pmaxub %xmm0, %xmm1
; SSE-NEXT: movd %xmm1, %eax
; SSE-NEXT: # kill: def $al killed $al killed $eax
-; SSE-NEXT: retq
+; SSE-NEXT: ret{{[l|q]}}
;
; AVX-LABEL: test_v8i8:
; AVX: # %bb.0:
@@ -1791,24 +3032,12 @@ define i8 @test_v8i8(<8 x i8> %a0) {
; AVX-NEXT: vpmaxub %xmm1, %xmm0, %xmm0
; AVX-NEXT: vmovd %xmm0, %eax
; AVX-NEXT: # kill: def $al killed $al killed $eax
-; AVX-NEXT: retq
-;
-; AVX512-LABEL: test_v8i8:
-; AVX512: # %bb.0:
-; AVX512-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
-; AVX512-NEXT: vpmaxub %xmm1, %xmm0, %xmm0
-; AVX512-NEXT: vpsrld $16, %xmm0, %xmm1
-; AVX512-NEXT: vpmaxub %xmm1, %xmm0, %xmm0
-; AVX512-NEXT: vpsrlw $8, %xmm0, %xmm1
-; AVX512-NEXT: vpmaxub %xmm1, %xmm0, %xmm0
-; AVX512-NEXT: vmovd %xmm0, %eax
-; AVX512-NEXT: # kill: def $al killed $al killed $eax
-; AVX512-NEXT: retq
+; AVX-NEXT: ret{{[l|q]}}
%1 = call i8 @llvm.vector.reduce.umax.v8i8(<8 x i8> %a0)
ret i8 %1
}
-define i8 @test_v16i8(<16 x i8> %a0) {
+define i8 @test_v16i8(<16 x i8> %a0) nounwind {
; SSE2-LABEL: test_v16i8:
; SSE2: # %bb.0:
; SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
@@ -1823,7 +3052,7 @@ define i8 @test_v16i8(<16 x i8> %a0) {
; SSE2-NEXT: pmaxub %xmm1, %xmm0
; SSE2-NEXT: movd %xmm0, %eax
; SSE2-NEXT: # kill: def $al killed $al killed $eax
-; SSE2-NEXT: retq
+; SSE2-NEXT: ret{{[l|q]}}
;
; SSE4-LABEL: test_v16i8:
; SSE4: # %bb.0:
@@ -1836,19 +3065,31 @@ define i8 @test_v16i8(<16 x i8> %a0) {
; SSE4-NEXT: movd %xmm0, %eax
; SSE4-NEXT: notb %al
; SSE4-NEXT: # kill: def $al killed $al killed $eax
-; SSE4-NEXT: retq
+; SSE4-NEXT: ret{{[l|q]}}
;
-; AVX-LABEL: test_v16i8:
-; AVX: # %bb.0:
-; AVX-NEXT: vpcmpeqd %xmm1, %xmm1, %xmm1
-; AVX-NEXT: vpxor %xmm1, %xmm0, %xmm0
-; AVX-NEXT: vpsrlw $8, %xmm0, %xmm1
-; AVX-NEXT: vpminub %xmm1, %xmm0, %xmm0
-; AVX-NEXT: vphminposuw %xmm0, %xmm0
-; AVX-NEXT: vmovd %xmm0, %eax
-; AVX-NEXT: notb %al
-; AVX-NEXT: # kill: def $al killed $al killed $eax
-; AVX-NEXT: retq
+; AVX1-LABEL: test_v16i8:
+; AVX1: # %bb.0:
+; AVX1-NEXT: vpcmpeqd %xmm1, %xmm1, %xmm1
+; AVX1-NEXT: vpxor %xmm1, %xmm0, %xmm0
+; AVX1-NEXT: vpsrlw $8, %xmm0, %xmm1
+; AVX1-NEXT: vpminub %xmm1, %xmm0, %xmm0
+; AVX1-NEXT: vphminposuw %xmm0, %xmm0
+; AVX1-NEXT: vmovd %xmm0, %eax
+; AVX1-NEXT: notb %al
+; AVX1-NEXT: # kill: def $al killed $al killed $eax
+; AVX1-NEXT: ret{{[l|q]}}
+;
+; AVX2-LABEL: test_v16i8:
+; AVX2: # %bb.0:
+; AVX2-NEXT: vpcmpeqd %xmm1, %xmm1, %xmm1
+; AVX2-NEXT: vpxor %xmm1, %xmm0, %xmm0
+; AVX2-NEXT: vpsrlw $8, %xmm0, %xmm1
+; AVX2-NEXT: vpminub %xmm1, %xmm0, %xmm0
+; AVX2-NEXT: vphminposuw %xmm0, %xmm0
+; AVX2-NEXT: vmovd %xmm0, %eax
+; AVX2-NEXT: notb %al
+; AVX2-NEXT: # kill: def $al killed $al killed $eax
+; AVX2-NEXT: ret{{[l|q]}}
;
; AVX512BW-LABEL: test_v16i8:
; AVX512BW: # %bb.0:
@@ -1877,7 +3118,7 @@ define i8 @test_v16i8(<16 x i8> %a0) {
ret i8 %1
}
-define i8 @test_v32i8(<32 x i8> %a0) {
+define i8 @test_v32i8(<32 x i8> %a0) nounwind {
; SSE2-LABEL: test_v32i8:
; SSE2: # %bb.0:
; SSE2-NEXT: pmaxub %xmm1, %xmm0
@@ -1893,7 +3134,7 @@ define i8 @test_v32i8(<32 x i8> %a0) {
; SSE2-NEXT: pmaxub %xmm1, %xmm0
; SSE2-NEXT: movd %xmm0, %eax
; SSE2-NEXT: # kill: def $al killed $al killed $eax
-; SSE2-NEXT: retq
+; SSE2-NEXT: ret{{[l|q]}}
;
; SSE4-LABEL: test_v32i8:
; SSE4: # %bb.0:
@@ -1907,7 +3148,7 @@ define i8 @test_v32i8(<32 x i8> %a0) {
; SSE4-NEXT: movd %xmm0, %eax
; SSE4-NEXT: notb %al
; SSE4-NEXT: # kill: def $al killed $al killed $eax
-; SSE4-NEXT: retq
+; SSE4-NEXT: ret{{[l|q]}}
;
; AVX1-LABEL: test_v32i8:
; AVX1: # %bb.0:
@@ -1922,7 +3163,7 @@ define i8 @test_v32i8(<32 x i8> %a0) {
; AVX1-NEXT: notb %al
; AVX1-NEXT: # kill: def $al killed $al killed $eax
; AVX1-NEXT: vzeroupper
-; AVX1-NEXT: retq
+; AVX1-NEXT: ret{{[l|q]}}
;
; AVX2-LABEL: test_v32i8:
; AVX2: # %bb.0:
@@ -1937,7 +3178,7 @@ define i8 @test_v32i8(<32 x i8> %a0) {
; AVX2-NEXT: notb %al
; AVX2-NEXT: # kill: def $al killed $al killed $eax
; AVX2-NEXT: vzeroupper
-; AVX2-NEXT: retq
+; AVX2-NEXT: ret{{[l|q]}}
;
; AVX512BW-LABEL: test_v32i8:
; AVX512BW: # %bb.0:
@@ -1970,41 +3211,88 @@ define i8 @test_v32i8(<32 x i8> %a0) {
ret i8 %1
}
-define i8 @test_v64i8(<64 x i8> %a0) {
-; SSE2-LABEL: test_v64i8:
-; SSE2: # %bb.0:
-; SSE2-NEXT: pmaxub %xmm3, %xmm1
-; SSE2-NEXT: pmaxub %xmm2, %xmm0
-; SSE2-NEXT: pmaxub %xmm1, %xmm0
-; SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
-; SSE2-NEXT: pmaxub %xmm0, %xmm1
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
-; SSE2-NEXT: pmaxub %xmm1, %xmm0
-; SSE2-NEXT: movdqa %xmm0, %xmm1
-; SSE2-NEXT: psrld $16, %xmm1
-; SSE2-NEXT: pmaxub %xmm0, %xmm1
-; SSE2-NEXT: movdqa %xmm1, %xmm0
-; SSE2-NEXT: psrlw $8, %xmm0
-; SSE2-NEXT: pmaxub %xmm1, %xmm0
-; SSE2-NEXT: movd %xmm0, %eax
-; SSE2-NEXT: # kill: def $al killed $al killed $eax
-; SSE2-NEXT: retq
-;
-; SSE4-LABEL: test_v64i8:
-; SSE4: # %bb.0:
-; SSE4-NEXT: pmaxub %xmm3, %xmm1
-; SSE4-NEXT: pmaxub %xmm2, %xmm0
-; SSE4-NEXT: pmaxub %xmm1, %xmm0
-; SSE4-NEXT: pcmpeqd %xmm1, %xmm1
-; SSE4-NEXT: pxor %xmm0, %xmm1
-; SSE4-NEXT: movdqa %xmm1, %xmm0
-; SSE4-NEXT: psrlw $8, %xmm0
-; SSE4-NEXT: pminub %xmm1, %xmm0
-; SSE4-NEXT: phminposuw %xmm0, %xmm0
-; SSE4-NEXT: movd %xmm0, %eax
-; SSE4-NEXT: notb %al
-; SSE4-NEXT: # kill: def $al killed $al killed $eax
-; SSE4-NEXT: retq
+define i8 @test_v64i8(<64 x i8> %a0) nounwind {
+; X86-SSE2-LABEL: test_v64i8:
+; X86-SSE2: # %bb.0:
+; X86-SSE2-NEXT: pushl %ebp
+; X86-SSE2-NEXT: movl %esp, %ebp
+; X86-SSE2-NEXT: andl $-16, %esp
+; X86-SSE2-NEXT: subl $16, %esp
+; X86-SSE2-NEXT: pmaxub %xmm2, %xmm0
+; X86-SSE2-NEXT: pmaxub 8(%ebp), %xmm1
+; X86-SSE2-NEXT: pmaxub %xmm0, %xmm1
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
+; X86-SSE2-NEXT: pmaxub %xmm1, %xmm0
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; X86-SSE2-NEXT: pmaxub %xmm0, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE2-NEXT: psrld $16, %xmm0
+; X86-SSE2-NEXT: pmaxub %xmm1, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X86-SSE2-NEXT: psrlw $8, %xmm1
+; X86-SSE2-NEXT: pmaxub %xmm0, %xmm1
+; X86-SSE2-NEXT: movd %xmm1, %eax
+; X86-SSE2-NEXT: # kill: def $al killed $al killed $eax
+; X86-SSE2-NEXT: movl %ebp, %esp
+; X86-SSE2-NEXT: popl %ebp
+; X86-SSE2-NEXT: retl
+;
+; X64-SSE2-LABEL: test_v64i8:
+; X64-SSE2: # %bb.0:
+; X64-SSE2-NEXT: pmaxub %xmm3, %xmm1
+; X64-SSE2-NEXT: pmaxub %xmm2, %xmm0
+; X64-SSE2-NEXT: pmaxub %xmm1, %xmm0
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X64-SSE2-NEXT: pmaxub %xmm0, %xmm1
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
+; X64-SSE2-NEXT: pmaxub %xmm1, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X64-SSE2-NEXT: psrld $16, %xmm1
+; X64-SSE2-NEXT: pmaxub %xmm0, %xmm1
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X64-SSE2-NEXT: psrlw $8, %xmm0
+; X64-SSE2-NEXT: pmaxub %xmm1, %xmm0
+; X64-SSE2-NEXT: movd %xmm0, %eax
+; X64-SSE2-NEXT: # kill: def $al killed $al killed $eax
+; X64-SSE2-NEXT: retq
+;
+; X86-SSE4-LABEL: test_v64i8:
+; X86-SSE4: # %bb.0:
+; X86-SSE4-NEXT: pushl %ebp
+; X86-SSE4-NEXT: movl %esp, %ebp
+; X86-SSE4-NEXT: andl $-16, %esp
+; X86-SSE4-NEXT: subl $16, %esp
+; X86-SSE4-NEXT: pmaxub %xmm2, %xmm0
+; X86-SSE4-NEXT: pmaxub 8(%ebp), %xmm1
+; X86-SSE4-NEXT: pmaxub %xmm0, %xmm1
+; X86-SSE4-NEXT: pcmpeqd %xmm0, %xmm0
+; X86-SSE4-NEXT: pxor %xmm1, %xmm0
+; X86-SSE4-NEXT: movdqa %xmm0, %xmm1
+; X86-SSE4-NEXT: psrlw $8, %xmm1
+; X86-SSE4-NEXT: pminub %xmm0, %xmm1
+; X86-SSE4-NEXT: phminposuw %xmm1, %xmm0
+; X86-SSE4-NEXT: movd %xmm0, %eax
+; X86-SSE4-NEXT: notb %al
+; X86-SSE4-NEXT: # kill: def $al killed $al killed $eax
+; X86-SSE4-NEXT: movl %ebp, %esp
+; X86-SSE4-NEXT: popl %ebp
+; X86-SSE4-NEXT: retl
+;
+; X64-SSE4-LABEL: test_v64i8:
+; X64-SSE4: # %bb.0:
+; X64-SSE4-NEXT: pmaxub %xmm3, %xmm1
+; X64-SSE4-NEXT: pmaxub %xmm2, %xmm0
+; X64-SSE4-NEXT: pmaxub %xmm1, %xmm0
+; X64-SSE4-NEXT: pcmpeqd %xmm1, %xmm1
+; X64-SSE4-NEXT: pxor %xmm0, %xmm1
+; X64-SSE4-NEXT: movdqa %xmm1, %xmm0
+; X64-SSE4-NEXT: psrlw $8, %xmm0
+; X64-SSE4-NEXT: pminub %xmm1, %xmm0
+; X64-SSE4-NEXT: phminposuw %xmm0, %xmm0
+; X64-SSE4-NEXT: movd %xmm0, %eax
+; X64-SSE4-NEXT: notb %al
+; X64-SSE4-NEXT: # kill: def $al killed $al killed $eax
+; X64-SSE4-NEXT: retq
;
; AVX1-LABEL: test_v64i8:
; AVX1: # %bb.0:
@@ -2022,7 +3310,7 @@ define i8 @test_v64i8(<64 x i8> %a0) {
; AVX1-NEXT: notb %al
; AVX1-NEXT: # kill: def $al killed $al killed $eax
; AVX1-NEXT: vzeroupper
-; AVX1-NEXT: retq
+; AVX1-NEXT: ret{{[l|q]}}
;
; AVX2-LABEL: test_v64i8:
; AVX2: # %bb.0:
@@ -2038,7 +3326,7 @@ define i8 @test_v64i8(<64 x i8> %a0) {
; AVX2-NEXT: notb %al
; AVX2-NEXT: # kill: def $al killed $al killed $eax
; AVX2-NEXT: vzeroupper
-; AVX2-NEXT: retq
+; AVX2-NEXT: ret{{[l|q]}}
;
; AVX512BW-LABEL: test_v64i8:
; AVX512BW: # %bb.0:
@@ -2075,91 +3363,201 @@ define i8 @test_v64i8(<64 x i8> %a0) {
ret i8 %1
}
-define i8 @test_v128i8(<128 x i8> %a0) {
-; SSE2-LABEL: test_v128i8:
-; SSE2: # %bb.0:
-; SSE2-NEXT: pmaxub %xmm7, %xmm3
-; SSE2-NEXT: pmaxub %xmm5, %xmm1
-; SSE2-NEXT: pmaxub %xmm3, %xmm1
-; SSE2-NEXT: pmaxub %xmm6, %xmm2
-; SSE2-NEXT: pmaxub %xmm4, %xmm0
-; SSE2-NEXT: pmaxub %xmm2, %xmm0
-; SSE2-NEXT: pmaxub %xmm1, %xmm0
-; SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
-; SSE2-NEXT: pmaxub %xmm0, %xmm1
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
-; SSE2-NEXT: pmaxub %xmm1, %xmm0
-; SSE2-NEXT: movdqa %xmm0, %xmm1
-; SSE2-NEXT: psrld $16, %xmm1
-; SSE2-NEXT: pmaxub %xmm0, %xmm1
-; SSE2-NEXT: movdqa %xmm1, %xmm0
-; SSE2-NEXT: psrlw $8, %xmm0
-; SSE2-NEXT: pmaxub %xmm1, %xmm0
-; SSE2-NEXT: movd %xmm0, %eax
-; SSE2-NEXT: # kill: def $al killed $al killed $eax
-; SSE2-NEXT: retq
-;
-; SSE4-LABEL: test_v128i8:
-; SSE4: # %bb.0:
-; SSE4-NEXT: pmaxub %xmm7, %xmm3
-; SSE4-NEXT: pmaxub %xmm5, %xmm1
-; SSE4-NEXT: pmaxub %xmm3, %xmm1
-; SSE4-NEXT: pmaxub %xmm6, %xmm2
-; SSE4-NEXT: pmaxub %xmm4, %xmm0
-; SSE4-NEXT: pmaxub %xmm2, %xmm0
-; SSE4-NEXT: pmaxub %xmm1, %xmm0
-; SSE4-NEXT: pcmpeqd %xmm1, %xmm1
-; SSE4-NEXT: pxor %xmm0, %xmm1
-; SSE4-NEXT: movdqa %xmm1, %xmm0
-; SSE4-NEXT: psrlw $8, %xmm0
-; SSE4-NEXT: pminub %xmm1, %xmm0
-; SSE4-NEXT: phminposuw %xmm0, %xmm0
-; SSE4-NEXT: movd %xmm0, %eax
-; SSE4-NEXT: notb %al
-; SSE4-NEXT: # kill: def $al killed $al killed $eax
-; SSE4-NEXT: retq
-;
-; AVX1-LABEL: test_v128i8:
-; AVX1: # %bb.0:
-; AVX1-NEXT: vextractf128 $1, %ymm3, %xmm4
-; AVX1-NEXT: vextractf128 $1, %ymm1, %xmm5
-; AVX1-NEXT: vpmaxub %xmm4, %xmm5, %xmm4
-; AVX1-NEXT: vextractf128 $1, %ymm2, %xmm5
-; AVX1-NEXT: vextractf128 $1, %ymm0, %xmm6
-; AVX1-NEXT: vpmaxub %xmm5, %xmm6, %xmm5
-; AVX1-NEXT: vpmaxub %xmm4, %xmm5, %xmm4
-; AVX1-NEXT: vpmaxub %xmm3, %xmm1, %xmm1
-; AVX1-NEXT: vpmaxub %xmm2, %xmm0, %xmm0
-; AVX1-NEXT: vpmaxub %xmm1, %xmm0, %xmm0
-; AVX1-NEXT: vpmaxub %xmm4, %xmm0, %xmm0
-; AVX1-NEXT: vpcmpeqd %xmm1, %xmm1, %xmm1
-; AVX1-NEXT: vpxor %xmm1, %xmm0, %xmm0
-; AVX1-NEXT: vpsrlw $8, %xmm0, %xmm1
-; AVX1-NEXT: vpminub %xmm1, %xmm0, %xmm0
-; AVX1-NEXT: vphminposuw %xmm0, %xmm0
-; AVX1-NEXT: vmovd %xmm0, %eax
-; AVX1-NEXT: notb %al
-; AVX1-NEXT: # kill: def $al killed $al killed $eax
-; AVX1-NEXT: vzeroupper
-; AVX1-NEXT: retq
-;
-; AVX2-LABEL: test_v128i8:
-; AVX2: # %bb.0:
-; AVX2-NEXT: vpmaxub %ymm3, %ymm1, %ymm1
-; AVX2-NEXT: vpmaxub %ymm2, %ymm0, %ymm0
-; AVX2-NEXT: vpmaxub %ymm1, %ymm0, %ymm0
-; AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
-; AVX2-NEXT: vpmaxub %xmm1, %xmm0, %xmm0
-; AVX2-NEXT: vpcmpeqd %xmm1, %xmm1, %xmm1
-; AVX2-NEXT: vpxor %xmm1, %xmm0, %xmm0
-; AVX2-NEXT: vpsrlw $8, %xmm0, %xmm1
-; AVX2-NEXT: vpminub %xmm1, %xmm0, %xmm0
-; AVX2-NEXT: vphminposuw %xmm0, %xmm0
-; AVX2-NEXT: vmovd %xmm0, %eax
-; AVX2-NEXT: notb %al
-; AVX2-NEXT: # kill: def $al killed $al killed $eax
-; AVX2-NEXT: vzeroupper
-; AVX2-NEXT: retq
+define i8 @test_v128i8(<128 x i8> %a0) nounwind {
+; X86-SSE2-LABEL: test_v128i8:
+; X86-SSE2: # %bb.0:
+; X86-SSE2-NEXT: pushl %ebp
+; X86-SSE2-NEXT: movl %esp, %ebp
+; X86-SSE2-NEXT: andl $-16, %esp
+; X86-SSE2-NEXT: subl $16, %esp
+; X86-SSE2-NEXT: movdqa 8(%ebp), %xmm3
+; X86-SSE2-NEXT: pmaxub 72(%ebp), %xmm3
+; X86-SSE2-NEXT: pmaxub 40(%ebp), %xmm1
+; X86-SSE2-NEXT: pmaxub %xmm3, %xmm1
+; X86-SSE2-NEXT: pmaxub 56(%ebp), %xmm2
+; X86-SSE2-NEXT: pmaxub 24(%ebp), %xmm0
+; X86-SSE2-NEXT: pmaxub %xmm2, %xmm0
+; X86-SSE2-NEXT: pmaxub %xmm1, %xmm0
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-SSE2-NEXT: pmaxub %xmm0, %xmm1
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
+; X86-SSE2-NEXT: pmaxub %xmm1, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X86-SSE2-NEXT: psrld $16, %xmm1
+; X86-SSE2-NEXT: pmaxub %xmm0, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE2-NEXT: psrlw $8, %xmm0
+; X86-SSE2-NEXT: pmaxub %xmm1, %xmm0
+; X86-SSE2-NEXT: movd %xmm0, %eax
+; X86-SSE2-NEXT: # kill: def $al killed $al killed $eax
+; X86-SSE2-NEXT: movl %ebp, %esp
+; X86-SSE2-NEXT: popl %ebp
+; X86-SSE2-NEXT: retl
+;
+; X64-SSE2-LABEL: test_v128i8:
+; X64-SSE2: # %bb.0:
+; X64-SSE2-NEXT: pmaxub %xmm7, %xmm3
+; X64-SSE2-NEXT: pmaxub %xmm5, %xmm1
+; X64-SSE2-NEXT: pmaxub %xmm3, %xmm1
+; X64-SSE2-NEXT: pmaxub %xmm6, %xmm2
+; X64-SSE2-NEXT: pmaxub %xmm4, %xmm0
+; X64-SSE2-NEXT: pmaxub %xmm2, %xmm0
+; X64-SSE2-NEXT: pmaxub %xmm1, %xmm0
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X64-SSE2-NEXT: pmaxub %xmm0, %xmm1
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
+; X64-SSE2-NEXT: pmaxub %xmm1, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X64-SSE2-NEXT: psrld $16, %xmm1
+; X64-SSE2-NEXT: pmaxub %xmm0, %xmm1
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X64-SSE2-NEXT: psrlw $8, %xmm0
+; X64-SSE2-NEXT: pmaxub %xmm1, %xmm0
+; X64-SSE2-NEXT: movd %xmm0, %eax
+; X64-SSE2-NEXT: # kill: def $al killed $al killed $eax
+; X64-SSE2-NEXT: retq
+;
+; X86-SSE4-LABEL: test_v128i8:
+; X86-SSE4: # %bb.0:
+; X86-SSE4-NEXT: pushl %ebp
+; X86-SSE4-NEXT: movl %esp, %ebp
+; X86-SSE4-NEXT: andl $-16, %esp
+; X86-SSE4-NEXT: subl $16, %esp
+; X86-SSE4-NEXT: movdqa 8(%ebp), %xmm3
+; X86-SSE4-NEXT: pmaxub 72(%ebp), %xmm3
+; X86-SSE4-NEXT: pmaxub 40(%ebp), %xmm1
+; X86-SSE4-NEXT: pmaxub %xmm3, %xmm1
+; X86-SSE4-NEXT: pmaxub 56(%ebp), %xmm2
+; X86-SSE4-NEXT: pmaxub 24(%ebp), %xmm0
+; X86-SSE4-NEXT: pmaxub %xmm2, %xmm0
+; X86-SSE4-NEXT: pmaxub %xmm1, %xmm0
+; X86-SSE4-NEXT: pcmpeqd %xmm1, %xmm1
+; X86-SSE4-NEXT: pxor %xmm0, %xmm1
+; X86-SSE4-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE4-NEXT: psrlw $8, %xmm0
+; X86-SSE4-NEXT: pminub %xmm1, %xmm0
+; X86-SSE4-NEXT: phminposuw %xmm0, %xmm0
+; X86-SSE4-NEXT: movd %xmm0, %eax
+; X86-SSE4-NEXT: notb %al
+; X86-SSE4-NEXT: # kill: def $al killed $al killed $eax
+; X86-SSE4-NEXT: movl %ebp, %esp
+; X86-SSE4-NEXT: popl %ebp
+; X86-SSE4-NEXT: retl
+;
+; X64-SSE4-LABEL: test_v128i8:
+; X64-SSE4: # %bb.0:
+; X64-SSE4-NEXT: pmaxub %xmm7, %xmm3
+; X64-SSE4-NEXT: pmaxub %xmm5, %xmm1
+; X64-SSE4-NEXT: pmaxub %xmm3, %xmm1
+; X64-SSE4-NEXT: pmaxub %xmm6, %xmm2
+; X64-SSE4-NEXT: pmaxub %xmm4, %xmm0
+; X64-SSE4-NEXT: pmaxub %xmm2, %xmm0
+; X64-SSE4-NEXT: pmaxub %xmm1, %xmm0
+; X64-SSE4-NEXT: pcmpeqd %xmm1, %xmm1
+; X64-SSE4-NEXT: pxor %xmm0, %xmm1
+; X64-SSE4-NEXT: movdqa %xmm1, %xmm0
+; X64-SSE4-NEXT: psrlw $8, %xmm0
+; X64-SSE4-NEXT: pminub %xmm1, %xmm0
+; X64-SSE4-NEXT: phminposuw %xmm0, %xmm0
+; X64-SSE4-NEXT: movd %xmm0, %eax
+; X64-SSE4-NEXT: notb %al
+; X64-SSE4-NEXT: # kill: def $al killed $al killed $eax
+; X64-SSE4-NEXT: retq
+;
+; X86-AVX1-LABEL: test_v128i8:
+; X86-AVX1: # %bb.0:
+; X86-AVX1-NEXT: pushl %ebp
+; X86-AVX1-NEXT: movl %esp, %ebp
+; X86-AVX1-NEXT: andl $-32, %esp
+; X86-AVX1-NEXT: subl $32, %esp
+; X86-AVX1-NEXT: vextractf128 $1, %ymm2, %xmm3
+; X86-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm4
+; X86-AVX1-NEXT: vpmaxub %xmm3, %xmm4, %xmm3
+; X86-AVX1-NEXT: vextractf128 $1, %ymm1, %xmm4
+; X86-AVX1-NEXT: vpmaxub 24(%ebp), %xmm4, %xmm4
+; X86-AVX1-NEXT: vpmaxub %xmm4, %xmm3, %xmm3
+; X86-AVX1-NEXT: vpmaxub %xmm2, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpmaxub 8(%ebp), %xmm1, %xmm1
+; X86-AVX1-NEXT: vpmaxub %xmm1, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpmaxub %xmm3, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpcmpeqd %xmm1, %xmm1, %xmm1
+; X86-AVX1-NEXT: vpxor %xmm1, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpsrlw $8, %xmm0, %xmm1
+; X86-AVX1-NEXT: vpminub %xmm1, %xmm0, %xmm0
+; X86-AVX1-NEXT: vphminposuw %xmm0, %xmm0
+; X86-AVX1-NEXT: vmovd %xmm0, %eax
+; X86-AVX1-NEXT: notb %al
+; X86-AVX1-NEXT: # kill: def $al killed $al killed $eax
+; X86-AVX1-NEXT: movl %ebp, %esp
+; X86-AVX1-NEXT: popl %ebp
+; X86-AVX1-NEXT: vzeroupper
+; X86-AVX1-NEXT: retl
+;
+; X64-AVX1-LABEL: test_v128i8:
+; X64-AVX1: # %bb.0:
+; X64-AVX1-NEXT: vextractf128 $1, %ymm3, %xmm4
+; X64-AVX1-NEXT: vextractf128 $1, %ymm1, %xmm5
+; X64-AVX1-NEXT: vpmaxub %xmm4, %xmm5, %xmm4
+; X64-AVX1-NEXT: vextractf128 $1, %ymm2, %xmm5
+; X64-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm6
+; X64-AVX1-NEXT: vpmaxub %xmm5, %xmm6, %xmm5
+; X64-AVX1-NEXT: vpmaxub %xmm4, %xmm5, %xmm4
+; X64-AVX1-NEXT: vpmaxub %xmm3, %xmm1, %xmm1
+; X64-AVX1-NEXT: vpmaxub %xmm2, %xmm0, %xmm0
+; X64-AVX1-NEXT: vpmaxub %xmm1, %xmm0, %xmm0
+; X64-AVX1-NEXT: vpmaxub %xmm4, %xmm0, %xmm0
+; X64-AVX1-NEXT: vpcmpeqd %xmm1, %xmm1, %xmm1
+; X64-AVX1-NEXT: vpxor %xmm1, %xmm0, %xmm0
+; X64-AVX1-NEXT: vpsrlw $8, %xmm0, %xmm1
+; X64-AVX1-NEXT: vpminub %xmm1, %xmm0, %xmm0
+; X64-AVX1-NEXT: vphminposuw %xmm0, %xmm0
+; X64-AVX1-NEXT: vmovd %xmm0, %eax
+; X64-AVX1-NEXT: notb %al
+; X64-AVX1-NEXT: # kill: def $al killed $al killed $eax
+; X64-AVX1-NEXT: vzeroupper
+; X64-AVX1-NEXT: retq
+;
+; X86-AVX2-LABEL: test_v128i8:
+; X86-AVX2: # %bb.0:
+; X86-AVX2-NEXT: pushl %ebp
+; X86-AVX2-NEXT: movl %esp, %ebp
+; X86-AVX2-NEXT: andl $-32, %esp
+; X86-AVX2-NEXT: subl $32, %esp
+; X86-AVX2-NEXT: vpmaxub %ymm2, %ymm0, %ymm0
+; X86-AVX2-NEXT: vpmaxub 8(%ebp), %ymm1, %ymm1
+; X86-AVX2-NEXT: vpmaxub %ymm1, %ymm0, %ymm0
+; X86-AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
+; X86-AVX2-NEXT: vpmaxub %xmm1, %xmm0, %xmm0
+; X86-AVX2-NEXT: vpcmpeqd %xmm1, %xmm1, %xmm1
+; X86-AVX2-NEXT: vpxor %xmm1, %xmm0, %xmm0
+; X86-AVX2-NEXT: vpsrlw $8, %xmm0, %xmm1
+; X86-AVX2-NEXT: vpminub %xmm1, %xmm0, %xmm0
+; X86-AVX2-NEXT: vphminposuw %xmm0, %xmm0
+; X86-AVX2-NEXT: vmovd %xmm0, %eax
+; X86-AVX2-NEXT: notb %al
+; X86-AVX2-NEXT: # kill: def $al killed $al killed $eax
+; X86-AVX2-NEXT: movl %ebp, %esp
+; X86-AVX2-NEXT: popl %ebp
+; X86-AVX2-NEXT: vzeroupper
+; X86-AVX2-NEXT: retl
+;
+; X64-AVX2-LABEL: test_v128i8:
+; X64-AVX2: # %bb.0:
+; X64-AVX2-NEXT: vpmaxub %ymm3, %ymm1, %ymm1
+; X64-AVX2-NEXT: vpmaxub %ymm2, %ymm0, %ymm0
+; X64-AVX2-NEXT: vpmaxub %ymm1, %ymm0, %ymm0
+; X64-AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
+; X64-AVX2-NEXT: vpmaxub %xmm1, %xmm0, %xmm0
+; X64-AVX2-NEXT: vpcmpeqd %xmm1, %xmm1, %xmm1
+; X64-AVX2-NEXT: vpxor %xmm1, %xmm0, %xmm0
+; X64-AVX2-NEXT: vpsrlw $8, %xmm0, %xmm1
+; X64-AVX2-NEXT: vpminub %xmm1, %xmm0, %xmm0
+; X64-AVX2-NEXT: vphminposuw %xmm0, %xmm0
+; X64-AVX2-NEXT: vmovd %xmm0, %eax
+; X64-AVX2-NEXT: notb %al
+; X64-AVX2-NEXT: # kill: def $al killed $al killed $eax
+; X64-AVX2-NEXT: vzeroupper
+; X64-AVX2-NEXT: retq
;
; AVX512BW-LABEL: test_v128i8:
; AVX512BW: # %bb.0:
diff --git a/llvm/test/CodeGen/X86/vector-reduce-umin.ll b/llvm/test/CodeGen/X86/vector-reduce-umin.ll
index b8cbcfba688f0..84315e6c60895 100644
--- a/llvm/test/CodeGen/X86/vector-reduce-umin.ll
+++ b/llvm/test/CodeGen/X86/vector-reduce-umin.ll
@@ -1,81 +1,169 @@
; NOTE: Assertions have been autogenerated by utils/update_llc_test_checks.py
-; RUN: llc < %s -mtriple=x86_64-unknown-unknown -mattr=+sse2 | FileCheck %s --check-prefixes=SSE,SSE2
-; RUN: llc < %s -mtriple=x86_64-unknown-unknown -mattr=+sse4.1 | FileCheck %s --check-prefixes=SSE,SSE4,SSE41
-; RUN: llc < %s -mtriple=x86_64-unknown-unknown -mattr=+sse4.2 | FileCheck %s --check-prefixes=SSE,SSE4,SSE42
-; RUN: llc < %s -mtriple=x86_64-unknown-unknown -mattr=+avx | FileCheck %s --check-prefixes=AVX,AVX1
-; RUN: llc < %s -mtriple=x86_64-unknown-unknown -mattr=+avx2 | FileCheck %s --check-prefixes=AVX,AVX2
-; RUN: llc < %s -mtriple=x86_64-unknown-unknown -mattr=+avx512f,+avx512bw | FileCheck %s --check-prefixes=AVX512,AVX512BW
-; RUN: llc < %s -mtriple=x86_64-unknown-unknown -mattr=+avx512f,+avx512bw,+avx512vl | FileCheck %s --check-prefixes=AVX512,AVX512VL
+; RUN: llc < %s -mtriple=i686-- -mattr=+sse2 | FileCheck %s --check-prefixes=SSE,SSE2,X86-SSE2
+; RUN: llc < %s -mtriple=x86_64-- -mattr=+sse2 | FileCheck %s --check-prefixes=SSE,SSE2,X64-SSE2
+; RUN: llc < %s -mtriple=i686-- -mattr=+sse4.1 | FileCheck %s --check-prefixes=SSE,SSE4,X86-SSE4,X86-SSE41
+; RUN: llc < %s -mtriple=x86_64-- -mattr=+sse4.1 | FileCheck %s --check-prefixes=SSE,SSE4,X64-SSE4,X64-SSE41
+; RUN: llc < %s -mtriple=i686-- -mattr=+sse4.2 | FileCheck %s --check-prefixes=SSE,SSE4,X86-SSE4,X86-SSE42
+; RUN: llc < %s -mtriple=x86_64-- -mattr=+sse4.2 | FileCheck %s --check-prefixes=SSE,SSE4,X64-SSE4,X64-SSE42
+; RUN: llc < %s -mtriple=i686-- -mattr=+avx | FileCheck %s --check-prefixes=AVX,AVX1,X86-AVX1
+; RUN: llc < %s -mtriple=x86_64-- -mattr=+avx | FileCheck %s --check-prefixes=AVX,AVX1,X64-AVX1
+; RUN: llc < %s -mtriple=i686-- -mattr=+avx2 | FileCheck %s --check-prefixes=AVX,AVX2,X86-AVX2
+; RUN: llc < %s -mtriple=x86_64-- -mattr=+avx2 | FileCheck %s --check-prefixes=AVX,AVX2,X64-AVX2
+; RUN: llc < %s -mtriple=x86_64-- -mattr=+avx512f,+avx512bw | FileCheck %s --check-prefixes=AVX,AVX512,AVX512BW
+; RUN: llc < %s -mtriple=x86_64-- -mattr=+avx512f,+avx512bw,+avx512dq,+avx512vl | FileCheck %s --check-prefixes=AVX,AVX512,AVX512VL
;
; vXi64
;
-define i64 @test_v2i64(<2 x i64> %a0) {
-; SSE2-LABEL: test_v2i64:
-; SSE2: # %bb.0:
-; SSE2-NEXT: movq %xmm0, %rcx
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm0[2,3,2,3]
-; SSE2-NEXT: movq %xmm0, %rax
-; SSE2-NEXT: cmpq %rax, %rcx
-; SSE2-NEXT: cmovbq %rcx, %rax
-; SSE2-NEXT: retq
-;
-; SSE41-LABEL: test_v2i64:
-; SSE41: # %bb.0:
-; SSE41-NEXT: movdqa %xmm0, %xmm1
-; SSE41-NEXT: movdqa {{.*#+}} xmm0 = [9223372039002259456,9223372039002259456]
-; SSE41-NEXT: movdqa %xmm1, %xmm2
-; SSE41-NEXT: pxor %xmm0, %xmm2
-; SSE41-NEXT: pshufd {{.*#+}} xmm3 = xmm1[2,3,2,3]
-; SSE41-NEXT: pxor %xmm3, %xmm0
-; SSE41-NEXT: movdqa %xmm0, %xmm4
-; SSE41-NEXT: pcmpgtd %xmm2, %xmm4
-; SSE41-NEXT: pmovsxdq %xmm4, %xmm5
-; SSE41-NEXT: pcmpeqd %xmm2, %xmm0
-; SSE41-NEXT: pshufd {{.*#+}} xmm2 = xmm0[1,1,3,3]
-; SSE41-NEXT: pand %xmm5, %xmm2
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm4[1,1,3,3]
-; SSE41-NEXT: por %xmm2, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm1, %xmm3
-; SSE41-NEXT: movq %xmm3, %rax
-; SSE41-NEXT: retq
-;
-; SSE42-LABEL: test_v2i64:
-; SSE42: # %bb.0:
-; SSE42-NEXT: movdqa %xmm0, %xmm1
-; SSE42-NEXT: movdqa {{.*#+}} xmm0 = [9223372036854775808,9223372036854775808]
-; SSE42-NEXT: movdqa %xmm1, %xmm2
-; SSE42-NEXT: pxor %xmm0, %xmm2
-; SSE42-NEXT: pshufd {{.*#+}} xmm3 = xmm1[2,3,2,3]
-; SSE42-NEXT: pxor %xmm3, %xmm0
-; SSE42-NEXT: pcmpgtq %xmm2, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm1, %xmm3
-; SSE42-NEXT: movq %xmm3, %rax
-; SSE42-NEXT: retq
-;
-; AVX1-LABEL: test_v2i64:
-; AVX1: # %bb.0:
-; AVX1-NEXT: vmovddup {{.*#+}} xmm1 = [9223372036854775808,9223372036854775808]
-; AVX1-NEXT: # xmm1 = mem[0,0]
-; AVX1-NEXT: vpxor %xmm1, %xmm0, %xmm2
-; AVX1-NEXT: vpshufd {{.*#+}} xmm3 = xmm0[2,3,2,3]
-; AVX1-NEXT: vpxor %xmm1, %xmm3, %xmm1
-; AVX1-NEXT: vpcmpgtq %xmm2, %xmm1, %xmm1
-; AVX1-NEXT: vblendvpd %xmm1, %xmm0, %xmm3, %xmm0
-; AVX1-NEXT: vmovq %xmm0, %rax
-; AVX1-NEXT: retq
-;
-; AVX2-LABEL: test_v2i64:
-; AVX2: # %bb.0:
-; AVX2-NEXT: vpbroadcastq {{.*#+}} xmm1 = [9223372036854775808,9223372036854775808]
-; AVX2-NEXT: vpxor %xmm1, %xmm0, %xmm2
-; AVX2-NEXT: vpshufd {{.*#+}} xmm3 = xmm0[2,3,2,3]
-; AVX2-NEXT: vpxor %xmm1, %xmm3, %xmm1
-; AVX2-NEXT: vpcmpgtq %xmm2, %xmm1, %xmm1
-; AVX2-NEXT: vblendvpd %xmm1, %xmm0, %xmm3, %xmm0
-; AVX2-NEXT: vmovq %xmm0, %rax
-; AVX2-NEXT: retq
+define i64 @test_v2i64(<2 x i64> %a0) nounwind {
+; X86-SSE2-LABEL: test_v2i64:
+; X86-SSE2: # %bb.0:
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-SSE2-NEXT: movdqa {{.*#+}} xmm2 = [2147483648,2147483648,2147483648,2147483648]
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm3
+; X86-SSE2-NEXT: pxor %xmm2, %xmm3
+; X86-SSE2-NEXT: pxor %xmm1, %xmm2
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm4
+; X86-SSE2-NEXT: pcmpgtd %xmm3, %xmm4
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm5 = xmm4[0,0,2,2]
+; X86-SSE2-NEXT: pcmpeqd %xmm3, %xmm2
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm2[1,1,3,3]
+; X86-SSE2-NEXT: pand %xmm5, %xmm2
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm3 = xmm4[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm2, %xmm3
+; X86-SSE2-NEXT: pand %xmm3, %xmm0
+; X86-SSE2-NEXT: pandn %xmm1, %xmm3
+; X86-SSE2-NEXT: por %xmm0, %xmm3
+; X86-SSE2-NEXT: movd %xmm3, %eax
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm3[1,1,1,1]
+; X86-SSE2-NEXT: movd %xmm0, %edx
+; X86-SSE2-NEXT: retl
+;
+; X64-SSE2-LABEL: test_v2i64:
+; X64-SSE2: # %bb.0:
+; X64-SSE2-NEXT: movq %xmm0, %rcx
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm0[2,3,2,3]
+; X64-SSE2-NEXT: movq %xmm0, %rax
+; X64-SSE2-NEXT: cmpq %rax, %rcx
+; X64-SSE2-NEXT: cmovbq %rcx, %rax
+; X64-SSE2-NEXT: retq
+;
+; X86-SSE41-LABEL: test_v2i64:
+; X86-SSE41: # %bb.0:
+; X86-SSE41-NEXT: movdqa %xmm0, %xmm1
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm2 = xmm0[2,3,2,3]
+; X86-SSE41-NEXT: movdqa {{.*#+}} xmm0 = [2147483648,2147483648,2147483648,2147483648]
+; X86-SSE41-NEXT: movdqa %xmm1, %xmm3
+; X86-SSE41-NEXT: pxor %xmm0, %xmm3
+; X86-SSE41-NEXT: pxor %xmm2, %xmm0
+; X86-SSE41-NEXT: movdqa %xmm0, %xmm4
+; X86-SSE41-NEXT: pcmpgtd %xmm3, %xmm4
+; X86-SSE41-NEXT: pmovsxdq %xmm4, %xmm5
+; X86-SSE41-NEXT: pcmpeqd %xmm3, %xmm0
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm3 = xmm0[1,1,3,3]
+; X86-SSE41-NEXT: pand %xmm5, %xmm3
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm4[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm3, %xmm0
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm1, %xmm2
+; X86-SSE41-NEXT: movd %xmm2, %eax
+; X86-SSE41-NEXT: pextrd $1, %xmm2, %edx
+; X86-SSE41-NEXT: retl
+;
+; X64-SSE41-LABEL: test_v2i64:
+; X64-SSE41: # %bb.0:
+; X64-SSE41-NEXT: movdqa %xmm0, %xmm1
+; X64-SSE41-NEXT: movdqa {{.*#+}} xmm0 = [9223372039002259456,9223372039002259456]
+; X64-SSE41-NEXT: movdqa %xmm1, %xmm2
+; X64-SSE41-NEXT: pxor %xmm0, %xmm2
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm3 = xmm1[2,3,2,3]
+; X64-SSE41-NEXT: pxor %xmm3, %xmm0
+; X64-SSE41-NEXT: movdqa %xmm0, %xmm4
+; X64-SSE41-NEXT: pcmpgtd %xmm2, %xmm4
+; X64-SSE41-NEXT: pmovsxdq %xmm4, %xmm5
+; X64-SSE41-NEXT: pcmpeqd %xmm2, %xmm0
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm2 = xmm0[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm5, %xmm2
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm4[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm2, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm1, %xmm3
+; X64-SSE41-NEXT: movq %xmm3, %rax
+; X64-SSE41-NEXT: retq
+;
+; X86-SSE42-LABEL: test_v2i64:
+; X86-SSE42: # %bb.0:
+; X86-SSE42-NEXT: movdqa %xmm0, %xmm1
+; X86-SSE42-NEXT: pshufd {{.*#+}} xmm2 = xmm0[2,3,2,3]
+; X86-SSE42-NEXT: movdqa {{.*#+}} xmm0 = [0,2147483648,0,2147483648]
+; X86-SSE42-NEXT: movdqa %xmm1, %xmm3
+; X86-SSE42-NEXT: pxor %xmm0, %xmm3
+; X86-SSE42-NEXT: pxor %xmm2, %xmm0
+; X86-SSE42-NEXT: pcmpgtq %xmm3, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm1, %xmm2
+; X86-SSE42-NEXT: movd %xmm2, %eax
+; X86-SSE42-NEXT: pextrd $1, %xmm2, %edx
+; X86-SSE42-NEXT: retl
+;
+; X64-SSE42-LABEL: test_v2i64:
+; X64-SSE42: # %bb.0:
+; X64-SSE42-NEXT: movdqa %xmm0, %xmm1
+; X64-SSE42-NEXT: movdqa {{.*#+}} xmm0 = [9223372036854775808,9223372036854775808]
+; X64-SSE42-NEXT: movdqa %xmm1, %xmm2
+; X64-SSE42-NEXT: pxor %xmm0, %xmm2
+; X64-SSE42-NEXT: pshufd {{.*#+}} xmm3 = xmm1[2,3,2,3]
+; X64-SSE42-NEXT: pxor %xmm3, %xmm0
+; X64-SSE42-NEXT: pcmpgtq %xmm2, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm1, %xmm3
+; X64-SSE42-NEXT: movq %xmm3, %rax
+; X64-SSE42-NEXT: retq
+;
+; X86-AVX1-LABEL: test_v2i64:
+; X86-AVX1: # %bb.0:
+; X86-AVX1-NEXT: vshufps {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-AVX1-NEXT: vmovddup {{.*#+}} xmm2 = [0,2147483648,0,2147483648]
+; X86-AVX1-NEXT: # xmm2 = mem[0,0]
+; X86-AVX1-NEXT: vxorps %xmm2, %xmm0, %xmm3
+; X86-AVX1-NEXT: vxorps %xmm2, %xmm1, %xmm2
+; X86-AVX1-NEXT: vpcmpgtq %xmm3, %xmm2, %xmm2
+; X86-AVX1-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X86-AVX1-NEXT: vmovd %xmm0, %eax
+; X86-AVX1-NEXT: vpextrd $1, %xmm0, %edx
+; X86-AVX1-NEXT: retl
+;
+; X64-AVX1-LABEL: test_v2i64:
+; X64-AVX1: # %bb.0:
+; X64-AVX1-NEXT: vmovddup {{.*#+}} xmm1 = [9223372036854775808,9223372036854775808]
+; X64-AVX1-NEXT: # xmm1 = mem[0,0]
+; X64-AVX1-NEXT: vpxor %xmm1, %xmm0, %xmm2
+; X64-AVX1-NEXT: vpshufd {{.*#+}} xmm3 = xmm0[2,3,2,3]
+; X64-AVX1-NEXT: vpxor %xmm1, %xmm3, %xmm1
+; X64-AVX1-NEXT: vpcmpgtq %xmm2, %xmm1, %xmm1
+; X64-AVX1-NEXT: vblendvpd %xmm1, %xmm0, %xmm3, %xmm0
+; X64-AVX1-NEXT: vmovq %xmm0, %rax
+; X64-AVX1-NEXT: retq
+;
+; X86-AVX2-LABEL: test_v2i64:
+; X86-AVX2: # %bb.0:
+; X86-AVX2-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-AVX2-NEXT: vpbroadcastq {{.*#+}} xmm2 = [0,2147483648,0,2147483648]
+; X86-AVX2-NEXT: vpxor %xmm2, %xmm0, %xmm3
+; X86-AVX2-NEXT: vpxor %xmm2, %xmm1, %xmm2
+; X86-AVX2-NEXT: vpcmpgtq %xmm3, %xmm2, %xmm2
+; X86-AVX2-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X86-AVX2-NEXT: vmovd %xmm0, %eax
+; X86-AVX2-NEXT: vpextrd $1, %xmm0, %edx
+; X86-AVX2-NEXT: retl
+;
+; X64-AVX2-LABEL: test_v2i64:
+; X64-AVX2: # %bb.0:
+; X64-AVX2-NEXT: vpbroadcastq {{.*#+}} xmm1 = [9223372036854775808,9223372036854775808]
+; X64-AVX2-NEXT: vpxor %xmm1, %xmm0, %xmm2
+; X64-AVX2-NEXT: vpshufd {{.*#+}} xmm3 = xmm0[2,3,2,3]
+; X64-AVX2-NEXT: vpxor %xmm1, %xmm3, %xmm1
+; X64-AVX2-NEXT: vpcmpgtq %xmm2, %xmm1, %xmm1
+; X64-AVX2-NEXT: vblendvpd %xmm1, %xmm0, %xmm3, %xmm0
+; X64-AVX2-NEXT: vmovq %xmm0, %rax
+; X64-AVX2-NEXT: retq
;
; AVX512BW-LABEL: test_v2i64:
; AVX512BW: # %bb.0:
@@ -96,117 +184,246 @@ define i64 @test_v2i64(<2 x i64> %a0) {
ret i64 %1
}
-define i64 @test_v4i64(<4 x i64> %a0) {
-; SSE2-LABEL: test_v4i64:
-; SSE2: # %bb.0:
-; SSE2-NEXT: movdqa {{.*#+}} xmm2 = [9223372039002259456,9223372039002259456]
-; SSE2-NEXT: movdqa %xmm0, %xmm3
-; SSE2-NEXT: pxor %xmm2, %xmm3
-; SSE2-NEXT: pxor %xmm1, %xmm2
-; SSE2-NEXT: movdqa %xmm2, %xmm4
-; SSE2-NEXT: pcmpgtd %xmm3, %xmm4
-; SSE2-NEXT: pshufd {{.*#+}} xmm5 = xmm4[0,0,2,2]
-; SSE2-NEXT: pcmpeqd %xmm3, %xmm2
-; SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm2[1,1,3,3]
-; SSE2-NEXT: pand %xmm5, %xmm2
-; SSE2-NEXT: pshufd {{.*#+}} xmm3 = xmm4[1,1,3,3]
-; SSE2-NEXT: por %xmm2, %xmm3
-; SSE2-NEXT: pand %xmm3, %xmm0
-; SSE2-NEXT: pandn %xmm1, %xmm3
-; SSE2-NEXT: por %xmm0, %xmm3
-; SSE2-NEXT: movq %xmm3, %rcx
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm3[2,3,2,3]
-; SSE2-NEXT: movq %xmm0, %rax
-; SSE2-NEXT: cmpq %rax, %rcx
-; SSE2-NEXT: cmovbq %rcx, %rax
-; SSE2-NEXT: retq
-;
-; SSE41-LABEL: test_v4i64:
-; SSE41: # %bb.0:
-; SSE41-NEXT: movdqa %xmm0, %xmm2
-; SSE41-NEXT: movdqa {{.*#+}} xmm3 = [9223372039002259456,9223372039002259456]
-; SSE41-NEXT: pxor %xmm3, %xmm0
-; SSE41-NEXT: movdqa %xmm1, %xmm4
-; SSE41-NEXT: pxor %xmm3, %xmm4
-; SSE41-NEXT: movdqa %xmm4, %xmm5
-; SSE41-NEXT: pcmpgtd %xmm0, %xmm5
-; SSE41-NEXT: pshufd {{.*#+}} xmm6 = xmm5[0,0,2,2]
-; SSE41-NEXT: pcmpeqd %xmm0, %xmm4
-; SSE41-NEXT: pshufd {{.*#+}} xmm4 = xmm4[1,1,3,3]
-; SSE41-NEXT: pand %xmm6, %xmm4
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm5[1,1,3,3]
-; SSE41-NEXT: por %xmm4, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm2, %xmm1
-; SSE41-NEXT: movapd %xmm1, %xmm0
-; SSE41-NEXT: xorpd %xmm3, %xmm0
-; SSE41-NEXT: pshufd {{.*#+}} xmm2 = xmm1[2,3,2,3]
-; SSE41-NEXT: pxor %xmm2, %xmm3
-; SSE41-NEXT: movdqa %xmm3, %xmm4
-; SSE41-NEXT: pcmpgtd %xmm0, %xmm4
-; SSE41-NEXT: pmovsxdq %xmm4, %xmm5
-; SSE41-NEXT: pcmpeqd %xmm0, %xmm3
-; SSE41-NEXT: pshufd {{.*#+}} xmm3 = xmm3[1,1,3,3]
-; SSE41-NEXT: pand %xmm5, %xmm3
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm4[1,1,3,3]
-; SSE41-NEXT: por %xmm3, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm1, %xmm2
-; SSE41-NEXT: movq %xmm2, %rax
-; SSE41-NEXT: retq
-;
-; SSE42-LABEL: test_v4i64:
-; SSE42: # %bb.0:
-; SSE42-NEXT: movdqa %xmm0, %xmm2
-; SSE42-NEXT: movdqa {{.*#+}} xmm3 = [9223372036854775808,9223372036854775808]
-; SSE42-NEXT: movdqa %xmm0, %xmm4
-; SSE42-NEXT: pxor %xmm3, %xmm4
-; SSE42-NEXT: movdqa %xmm1, %xmm0
-; SSE42-NEXT: pxor %xmm3, %xmm0
-; SSE42-NEXT: pcmpgtq %xmm4, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm2, %xmm1
-; SSE42-NEXT: movapd %xmm1, %xmm0
-; SSE42-NEXT: xorpd %xmm3, %xmm0
-; SSE42-NEXT: pshufd {{.*#+}} xmm2 = xmm1[2,3,2,3]
-; SSE42-NEXT: pxor %xmm2, %xmm3
-; SSE42-NEXT: pcmpgtq %xmm0, %xmm3
-; SSE42-NEXT: movdqa %xmm3, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm1, %xmm2
-; SSE42-NEXT: movq %xmm2, %rax
-; SSE42-NEXT: retq
-;
-; AVX1-LABEL: test_v4i64:
-; AVX1: # %bb.0:
-; AVX1-NEXT: vmovddup {{.*#+}} xmm1 = [9223372036854775808,9223372036854775808]
-; AVX1-NEXT: # xmm1 = mem[0,0]
-; AVX1-NEXT: vpxor %xmm1, %xmm0, %xmm2
-; AVX1-NEXT: vextractf128 $1, %ymm0, %xmm3
-; AVX1-NEXT: vpxor %xmm1, %xmm3, %xmm4
-; AVX1-NEXT: vpcmpgtq %xmm2, %xmm4, %xmm2
-; AVX1-NEXT: vblendvpd %xmm2, %xmm0, %xmm3, %xmm0
-; AVX1-NEXT: vxorpd %xmm1, %xmm0, %xmm2
-; AVX1-NEXT: vshufps {{.*#+}} xmm3 = xmm0[2,3,2,3]
-; AVX1-NEXT: vxorpd %xmm1, %xmm3, %xmm1
-; AVX1-NEXT: vpcmpgtq %xmm2, %xmm1, %xmm1
-; AVX1-NEXT: vblendvpd %xmm1, %xmm0, %xmm3, %xmm0
-; AVX1-NEXT: vmovq %xmm0, %rax
-; AVX1-NEXT: vzeroupper
-; AVX1-NEXT: retq
-;
-; AVX2-LABEL: test_v4i64:
-; AVX2: # %bb.0:
-; AVX2-NEXT: vpbroadcastq {{.*#+}} xmm1 = [9223372036854775808,9223372036854775808]
-; AVX2-NEXT: vpxor %xmm1, %xmm0, %xmm2
-; AVX2-NEXT: vextracti128 $1, %ymm0, %xmm3
-; AVX2-NEXT: vpxor %xmm1, %xmm3, %xmm4
-; AVX2-NEXT: vpcmpgtq %xmm2, %xmm4, %xmm2
-; AVX2-NEXT: vblendvpd %xmm2, %xmm0, %xmm3, %xmm0
-; AVX2-NEXT: vxorpd %xmm1, %xmm0, %xmm2
-; AVX2-NEXT: vshufps {{.*#+}} xmm3 = xmm0[2,3,2,3]
-; AVX2-NEXT: vxorpd %xmm1, %xmm3, %xmm1
-; AVX2-NEXT: vpcmpgtq %xmm2, %xmm1, %xmm1
-; AVX2-NEXT: vblendvpd %xmm1, %xmm0, %xmm3, %xmm0
-; AVX2-NEXT: vmovq %xmm0, %rax
-; AVX2-NEXT: vzeroupper
-; AVX2-NEXT: retq
+define i64 @test_v4i64(<4 x i64> %a0) nounwind {
+; X86-SSE2-LABEL: test_v4i64:
+; X86-SSE2: # %bb.0:
+; X86-SSE2-NEXT: movdqa {{.*#+}} xmm2 = [2147483648,2147483648,2147483648,2147483648]
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm3
+; X86-SSE2-NEXT: pxor %xmm2, %xmm3
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm4
+; X86-SSE2-NEXT: pxor %xmm2, %xmm4
+; X86-SSE2-NEXT: movdqa %xmm4, %xmm5
+; X86-SSE2-NEXT: pcmpgtd %xmm3, %xmm5
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm6 = xmm5[0,0,2,2]
+; X86-SSE2-NEXT: pcmpeqd %xmm3, %xmm4
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm4 = xmm4[1,1,3,3]
+; X86-SSE2-NEXT: pand %xmm6, %xmm4
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm3 = xmm5[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm4, %xmm3
+; X86-SSE2-NEXT: pand %xmm3, %xmm0
+; X86-SSE2-NEXT: pandn %xmm1, %xmm3
+; X86-SSE2-NEXT: por %xmm0, %xmm3
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm3[2,3,2,3]
+; X86-SSE2-NEXT: movdqa %xmm3, %xmm1
+; X86-SSE2-NEXT: pxor %xmm2, %xmm1
+; X86-SSE2-NEXT: pxor %xmm0, %xmm2
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm4
+; X86-SSE2-NEXT: pcmpgtd %xmm1, %xmm4
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm5 = xmm4[0,0,2,2]
+; X86-SSE2-NEXT: pcmpeqd %xmm1, %xmm2
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm2[1,1,3,3]
+; X86-SSE2-NEXT: pand %xmm5, %xmm1
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm4[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm1, %xmm2
+; X86-SSE2-NEXT: pand %xmm2, %xmm3
+; X86-SSE2-NEXT: pandn %xmm0, %xmm2
+; X86-SSE2-NEXT: por %xmm3, %xmm2
+; X86-SSE2-NEXT: movd %xmm2, %eax
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,1,1]
+; X86-SSE2-NEXT: movd %xmm0, %edx
+; X86-SSE2-NEXT: retl
+;
+; X64-SSE2-LABEL: test_v4i64:
+; X64-SSE2: # %bb.0:
+; X64-SSE2-NEXT: movdqa {{.*#+}} xmm2 = [9223372039002259456,9223372039002259456]
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm3
+; X64-SSE2-NEXT: pxor %xmm2, %xmm3
+; X64-SSE2-NEXT: pxor %xmm1, %xmm2
+; X64-SSE2-NEXT: movdqa %xmm2, %xmm4
+; X64-SSE2-NEXT: pcmpgtd %xmm3, %xmm4
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm5 = xmm4[0,0,2,2]
+; X64-SSE2-NEXT: pcmpeqd %xmm3, %xmm2
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm2[1,1,3,3]
+; X64-SSE2-NEXT: pand %xmm5, %xmm2
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm3 = xmm4[1,1,3,3]
+; X64-SSE2-NEXT: por %xmm2, %xmm3
+; X64-SSE2-NEXT: pand %xmm3, %xmm0
+; X64-SSE2-NEXT: pandn %xmm1, %xmm3
+; X64-SSE2-NEXT: por %xmm0, %xmm3
+; X64-SSE2-NEXT: movq %xmm3, %rcx
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm3[2,3,2,3]
+; X64-SSE2-NEXT: movq %xmm0, %rax
+; X64-SSE2-NEXT: cmpq %rax, %rcx
+; X64-SSE2-NEXT: cmovbq %rcx, %rax
+; X64-SSE2-NEXT: retq
+;
+; X86-SSE41-LABEL: test_v4i64:
+; X86-SSE41: # %bb.0:
+; X86-SSE41-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE41-NEXT: movdqa {{.*#+}} xmm3 = [2147483648,2147483648,2147483648,2147483648]
+; X86-SSE41-NEXT: pxor %xmm3, %xmm0
+; X86-SSE41-NEXT: movdqa %xmm1, %xmm4
+; X86-SSE41-NEXT: pxor %xmm3, %xmm4
+; X86-SSE41-NEXT: movdqa %xmm4, %xmm5
+; X86-SSE41-NEXT: pcmpgtd %xmm0, %xmm5
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm6 = xmm5[0,0,2,2]
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm4
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm4 = xmm4[1,1,3,3]
+; X86-SSE41-NEXT: pand %xmm6, %xmm4
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm5[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm4, %xmm0
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm2, %xmm1
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm2 = xmm1[2,3,2,3]
+; X86-SSE41-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE41-NEXT: pxor %xmm3, %xmm0
+; X86-SSE41-NEXT: pxor %xmm2, %xmm3
+; X86-SSE41-NEXT: movdqa %xmm3, %xmm4
+; X86-SSE41-NEXT: pcmpgtd %xmm0, %xmm4
+; X86-SSE41-NEXT: pmovsxdq %xmm4, %xmm5
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm3
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm3 = xmm3[1,1,3,3]
+; X86-SSE41-NEXT: pand %xmm5, %xmm3
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm4[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm3, %xmm0
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm1, %xmm2
+; X86-SSE41-NEXT: movd %xmm2, %eax
+; X86-SSE41-NEXT: pextrd $1, %xmm2, %edx
+; X86-SSE41-NEXT: retl
+;
+; X64-SSE41-LABEL: test_v4i64:
+; X64-SSE41: # %bb.0:
+; X64-SSE41-NEXT: movdqa %xmm0, %xmm2
+; X64-SSE41-NEXT: movdqa {{.*#+}} xmm3 = [9223372039002259456,9223372039002259456]
+; X64-SSE41-NEXT: pxor %xmm3, %xmm0
+; X64-SSE41-NEXT: movdqa %xmm1, %xmm4
+; X64-SSE41-NEXT: pxor %xmm3, %xmm4
+; X64-SSE41-NEXT: movdqa %xmm4, %xmm5
+; X64-SSE41-NEXT: pcmpgtd %xmm0, %xmm5
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm6 = xmm5[0,0,2,2]
+; X64-SSE41-NEXT: pcmpeqd %xmm0, %xmm4
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm4 = xmm4[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm6, %xmm4
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm5[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm4, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm2, %xmm1
+; X64-SSE41-NEXT: movapd %xmm1, %xmm0
+; X64-SSE41-NEXT: xorpd %xmm3, %xmm0
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm2 = xmm1[2,3,2,3]
+; X64-SSE41-NEXT: pxor %xmm2, %xmm3
+; X64-SSE41-NEXT: movdqa %xmm3, %xmm4
+; X64-SSE41-NEXT: pcmpgtd %xmm0, %xmm4
+; X64-SSE41-NEXT: pmovsxdq %xmm4, %xmm5
+; X64-SSE41-NEXT: pcmpeqd %xmm0, %xmm3
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm3 = xmm3[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm5, %xmm3
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm4[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm3, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm1, %xmm2
+; X64-SSE41-NEXT: movq %xmm2, %rax
+; X64-SSE41-NEXT: retq
+;
+; X86-SSE42-LABEL: test_v4i64:
+; X86-SSE42: # %bb.0:
+; X86-SSE42-NEXT: movdqa %xmm0, %xmm3
+; X86-SSE42-NEXT: movdqa {{.*#+}} xmm2 = [0,2147483648,0,2147483648]
+; X86-SSE42-NEXT: movdqa %xmm0, %xmm4
+; X86-SSE42-NEXT: pxor %xmm2, %xmm4
+; X86-SSE42-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE42-NEXT: pxor %xmm2, %xmm0
+; X86-SSE42-NEXT: pcmpgtq %xmm4, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm3, %xmm1
+; X86-SSE42-NEXT: pshufd {{.*#+}} xmm3 = xmm1[2,3,2,3]
+; X86-SSE42-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE42-NEXT: pxor %xmm2, %xmm0
+; X86-SSE42-NEXT: pxor %xmm3, %xmm2
+; X86-SSE42-NEXT: pcmpgtq %xmm0, %xmm2
+; X86-SSE42-NEXT: movdqa %xmm2, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm1, %xmm3
+; X86-SSE42-NEXT: movd %xmm3, %eax
+; X86-SSE42-NEXT: pextrd $1, %xmm3, %edx
+; X86-SSE42-NEXT: retl
+;
+; X64-SSE42-LABEL: test_v4i64:
+; X64-SSE42: # %bb.0:
+; X64-SSE42-NEXT: movdqa %xmm0, %xmm2
+; X64-SSE42-NEXT: movdqa {{.*#+}} xmm3 = [9223372036854775808,9223372036854775808]
+; X64-SSE42-NEXT: movdqa %xmm0, %xmm4
+; X64-SSE42-NEXT: pxor %xmm3, %xmm4
+; X64-SSE42-NEXT: movdqa %xmm1, %xmm0
+; X64-SSE42-NEXT: pxor %xmm3, %xmm0
+; X64-SSE42-NEXT: pcmpgtq %xmm4, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm2, %xmm1
+; X64-SSE42-NEXT: movapd %xmm1, %xmm0
+; X64-SSE42-NEXT: xorpd %xmm3, %xmm0
+; X64-SSE42-NEXT: pshufd {{.*#+}} xmm2 = xmm1[2,3,2,3]
+; X64-SSE42-NEXT: pxor %xmm2, %xmm3
+; X64-SSE42-NEXT: pcmpgtq %xmm0, %xmm3
+; X64-SSE42-NEXT: movdqa %xmm3, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm1, %xmm2
+; X64-SSE42-NEXT: movq %xmm2, %rax
+; X64-SSE42-NEXT: retq
+;
+; X86-AVX1-LABEL: test_v4i64:
+; X86-AVX1: # %bb.0:
+; X86-AVX1-NEXT: vmovddup {{.*#+}} xmm1 = [0,2147483648,0,2147483648]
+; X86-AVX1-NEXT: # xmm1 = mem[0,0]
+; X86-AVX1-NEXT: vxorps %xmm1, %xmm0, %xmm2
+; X86-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm3
+; X86-AVX1-NEXT: vxorps %xmm1, %xmm3, %xmm4
+; X86-AVX1-NEXT: vpcmpgtq %xmm2, %xmm4, %xmm2
+; X86-AVX1-NEXT: vblendvpd %xmm2, %xmm0, %xmm3, %xmm0
+; X86-AVX1-NEXT: vshufps {{.*#+}} xmm2 = xmm0[2,3,2,3]
+; X86-AVX1-NEXT: vxorpd %xmm1, %xmm0, %xmm3
+; X86-AVX1-NEXT: vxorpd %xmm1, %xmm2, %xmm1
+; X86-AVX1-NEXT: vpcmpgtq %xmm3, %xmm1, %xmm1
+; X86-AVX1-NEXT: vblendvpd %xmm1, %xmm0, %xmm2, %xmm0
+; X86-AVX1-NEXT: vmovd %xmm0, %eax
+; X86-AVX1-NEXT: vpextrd $1, %xmm0, %edx
+; X86-AVX1-NEXT: vzeroupper
+; X86-AVX1-NEXT: retl
+;
+; X64-AVX1-LABEL: test_v4i64:
+; X64-AVX1: # %bb.0:
+; X64-AVX1-NEXT: vmovddup {{.*#+}} xmm1 = [9223372036854775808,9223372036854775808]
+; X64-AVX1-NEXT: # xmm1 = mem[0,0]
+; X64-AVX1-NEXT: vpxor %xmm1, %xmm0, %xmm2
+; X64-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm3
+; X64-AVX1-NEXT: vpxor %xmm1, %xmm3, %xmm4
+; X64-AVX1-NEXT: vpcmpgtq %xmm2, %xmm4, %xmm2
+; X64-AVX1-NEXT: vblendvpd %xmm2, %xmm0, %xmm3, %xmm0
+; X64-AVX1-NEXT: vxorpd %xmm1, %xmm0, %xmm2
+; X64-AVX1-NEXT: vshufps {{.*#+}} xmm3 = xmm0[2,3,2,3]
+; X64-AVX1-NEXT: vxorpd %xmm1, %xmm3, %xmm1
+; X64-AVX1-NEXT: vpcmpgtq %xmm2, %xmm1, %xmm1
+; X64-AVX1-NEXT: vblendvpd %xmm1, %xmm0, %xmm3, %xmm0
+; X64-AVX1-NEXT: vmovq %xmm0, %rax
+; X64-AVX1-NEXT: vzeroupper
+; X64-AVX1-NEXT: retq
+;
+; X86-AVX2-LABEL: test_v4i64:
+; X86-AVX2: # %bb.0:
+; X86-AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
+; X86-AVX2-NEXT: vpbroadcastq {{.*#+}} xmm2 = [0,2147483648,0,2147483648]
+; X86-AVX2-NEXT: vpxor %xmm2, %xmm0, %xmm3
+; X86-AVX2-NEXT: vpxor %xmm2, %xmm1, %xmm4
+; X86-AVX2-NEXT: vpcmpgtq %xmm3, %xmm4, %xmm3
+; X86-AVX2-NEXT: vblendvpd %xmm3, %xmm0, %xmm1, %xmm0
+; X86-AVX2-NEXT: vshufps {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-AVX2-NEXT: vxorpd %xmm2, %xmm0, %xmm3
+; X86-AVX2-NEXT: vxorpd %xmm2, %xmm1, %xmm2
+; X86-AVX2-NEXT: vpcmpgtq %xmm3, %xmm2, %xmm2
+; X86-AVX2-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X86-AVX2-NEXT: vmovd %xmm0, %eax
+; X86-AVX2-NEXT: vpextrd $1, %xmm0, %edx
+; X86-AVX2-NEXT: vzeroupper
+; X86-AVX2-NEXT: retl
+;
+; X64-AVX2-LABEL: test_v4i64:
+; X64-AVX2: # %bb.0:
+; X64-AVX2-NEXT: vpbroadcastq {{.*#+}} xmm1 = [9223372036854775808,9223372036854775808]
+; X64-AVX2-NEXT: vpxor %xmm1, %xmm0, %xmm2
+; X64-AVX2-NEXT: vextracti128 $1, %ymm0, %xmm3
+; X64-AVX2-NEXT: vpxor %xmm1, %xmm3, %xmm4
+; X64-AVX2-NEXT: vpcmpgtq %xmm2, %xmm4, %xmm2
+; X64-AVX2-NEXT: vblendvpd %xmm2, %xmm0, %xmm3, %xmm0
+; X64-AVX2-NEXT: vxorpd %xmm1, %xmm0, %xmm2
+; X64-AVX2-NEXT: vshufps {{.*#+}} xmm3 = xmm0[2,3,2,3]
+; X64-AVX2-NEXT: vxorpd %xmm1, %xmm3, %xmm1
+; X64-AVX2-NEXT: vpcmpgtq %xmm2, %xmm1, %xmm1
+; X64-AVX2-NEXT: vblendvpd %xmm1, %xmm0, %xmm3, %xmm0
+; X64-AVX2-NEXT: vmovq %xmm0, %rax
+; X64-AVX2-NEXT: vzeroupper
+; X64-AVX2-NEXT: retq
;
; AVX512BW-LABEL: test_v4i64:
; AVX512BW: # %bb.0:
@@ -232,198 +449,430 @@ define i64 @test_v4i64(<4 x i64> %a0) {
ret i64 %1
}
-define i64 @test_v8i64(<8 x i64> %a0) {
-; SSE2-LABEL: test_v8i64:
-; SSE2: # %bb.0:
-; SSE2-NEXT: movdqa {{.*#+}} xmm4 = [9223372039002259456,9223372039002259456]
-; SSE2-NEXT: movdqa %xmm0, %xmm5
-; SSE2-NEXT: pxor %xmm4, %xmm5
-; SSE2-NEXT: movdqa %xmm2, %xmm6
-; SSE2-NEXT: pxor %xmm4, %xmm6
-; SSE2-NEXT: movdqa %xmm6, %xmm7
-; SSE2-NEXT: pcmpgtd %xmm5, %xmm7
-; SSE2-NEXT: pshufd {{.*#+}} xmm8 = xmm7[0,0,2,2]
-; SSE2-NEXT: pcmpeqd %xmm5, %xmm6
-; SSE2-NEXT: pshufd {{.*#+}} xmm6 = xmm6[1,1,3,3]
-; SSE2-NEXT: pand %xmm8, %xmm6
-; SSE2-NEXT: pshufd {{.*#+}} xmm5 = xmm7[1,1,3,3]
-; SSE2-NEXT: por %xmm6, %xmm5
-; SSE2-NEXT: pand %xmm5, %xmm0
-; SSE2-NEXT: pandn %xmm2, %xmm5
-; SSE2-NEXT: por %xmm0, %xmm5
-; SSE2-NEXT: movdqa %xmm5, %xmm0
-; SSE2-NEXT: pxor %xmm4, %xmm0
-; SSE2-NEXT: movdqa %xmm1, %xmm2
-; SSE2-NEXT: pxor %xmm4, %xmm2
-; SSE2-NEXT: movdqa %xmm3, %xmm6
-; SSE2-NEXT: pxor %xmm4, %xmm6
-; SSE2-NEXT: movdqa %xmm6, %xmm7
-; SSE2-NEXT: pcmpgtd %xmm2, %xmm7
-; SSE2-NEXT: pshufd {{.*#+}} xmm8 = xmm7[0,0,2,2]
-; SSE2-NEXT: pcmpeqd %xmm2, %xmm6
-; SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm6[1,1,3,3]
-; SSE2-NEXT: pand %xmm8, %xmm2
-; SSE2-NEXT: pshufd {{.*#+}} xmm6 = xmm7[1,1,3,3]
-; SSE2-NEXT: por %xmm2, %xmm6
-; SSE2-NEXT: pand %xmm6, %xmm1
-; SSE2-NEXT: pandn %xmm3, %xmm6
-; SSE2-NEXT: por %xmm1, %xmm6
-; SSE2-NEXT: pxor %xmm6, %xmm4
-; SSE2-NEXT: movdqa %xmm4, %xmm1
-; SSE2-NEXT: pcmpgtd %xmm0, %xmm1
-; SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm1[0,0,2,2]
-; SSE2-NEXT: pcmpeqd %xmm0, %xmm4
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm4[1,1,3,3]
-; SSE2-NEXT: pand %xmm2, %xmm0
-; SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm1[1,1,3,3]
-; SSE2-NEXT: por %xmm0, %xmm1
-; SSE2-NEXT: pand %xmm1, %xmm5
-; SSE2-NEXT: pandn %xmm6, %xmm1
-; SSE2-NEXT: por %xmm5, %xmm1
-; SSE2-NEXT: movq %xmm1, %rcx
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
-; SSE2-NEXT: movq %xmm0, %rax
-; SSE2-NEXT: cmpq %rax, %rcx
-; SSE2-NEXT: cmovbq %rcx, %rax
-; SSE2-NEXT: retq
-;
-; SSE41-LABEL: test_v8i64:
-; SSE41: # %bb.0:
-; SSE41-NEXT: movdqa %xmm0, %xmm4
-; SSE41-NEXT: movdqa {{.*#+}} xmm5 = [9223372039002259456,9223372039002259456]
-; SSE41-NEXT: pxor %xmm5, %xmm0
-; SSE41-NEXT: movdqa %xmm2, %xmm6
-; SSE41-NEXT: pxor %xmm5, %xmm6
-; SSE41-NEXT: movdqa %xmm6, %xmm7
-; SSE41-NEXT: pcmpgtd %xmm0, %xmm7
-; SSE41-NEXT: pshufd {{.*#+}} xmm8 = xmm7[0,0,2,2]
-; SSE41-NEXT: pcmpeqd %xmm0, %xmm6
-; SSE41-NEXT: pshufd {{.*#+}} xmm6 = xmm6[1,1,3,3]
-; SSE41-NEXT: pand %xmm8, %xmm6
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm7[1,1,3,3]
-; SSE41-NEXT: por %xmm6, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm4, %xmm2
-; SSE41-NEXT: movapd %xmm2, %xmm4
-; SSE41-NEXT: xorpd %xmm5, %xmm4
-; SSE41-NEXT: movdqa %xmm1, %xmm0
-; SSE41-NEXT: pxor %xmm5, %xmm0
-; SSE41-NEXT: movdqa %xmm3, %xmm6
-; SSE41-NEXT: pxor %xmm5, %xmm6
-; SSE41-NEXT: movdqa %xmm6, %xmm7
-; SSE41-NEXT: pcmpgtd %xmm0, %xmm7
-; SSE41-NEXT: pshufd {{.*#+}} xmm8 = xmm7[0,0,2,2]
-; SSE41-NEXT: pcmpeqd %xmm0, %xmm6
-; SSE41-NEXT: pshufd {{.*#+}} xmm6 = xmm6[1,1,3,3]
-; SSE41-NEXT: pand %xmm8, %xmm6
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm7[1,1,3,3]
-; SSE41-NEXT: por %xmm6, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm1, %xmm3
-; SSE41-NEXT: movapd %xmm3, %xmm0
-; SSE41-NEXT: xorpd %xmm5, %xmm0
-; SSE41-NEXT: movapd %xmm0, %xmm1
-; SSE41-NEXT: pcmpgtd %xmm4, %xmm1
-; SSE41-NEXT: pshufd {{.*#+}} xmm6 = xmm1[0,0,2,2]
-; SSE41-NEXT: pcmpeqd %xmm4, %xmm0
-; SSE41-NEXT: pshufd {{.*#+}} xmm4 = xmm0[1,1,3,3]
-; SSE41-NEXT: pand %xmm6, %xmm4
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,3,3]
-; SSE41-NEXT: por %xmm4, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm2, %xmm3
-; SSE41-NEXT: movapd %xmm3, %xmm0
-; SSE41-NEXT: xorpd %xmm5, %xmm0
-; SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm3[2,3,2,3]
-; SSE41-NEXT: pxor %xmm1, %xmm5
-; SSE41-NEXT: movdqa %xmm5, %xmm2
-; SSE41-NEXT: pcmpgtd %xmm0, %xmm2
-; SSE41-NEXT: pmovsxdq %xmm2, %xmm4
-; SSE41-NEXT: pcmpeqd %xmm0, %xmm5
-; SSE41-NEXT: pshufd {{.*#+}} xmm5 = xmm5[1,1,3,3]
-; SSE41-NEXT: pand %xmm4, %xmm5
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,3,3]
-; SSE41-NEXT: por %xmm5, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm3, %xmm1
-; SSE41-NEXT: movq %xmm1, %rax
-; SSE41-NEXT: retq
-;
-; SSE42-LABEL: test_v8i64:
-; SSE42: # %bb.0:
-; SSE42-NEXT: movdqa %xmm0, %xmm5
-; SSE42-NEXT: movdqa {{.*#+}} xmm4 = [9223372036854775808,9223372036854775808]
-; SSE42-NEXT: movdqa %xmm0, %xmm6
-; SSE42-NEXT: pxor %xmm4, %xmm6
-; SSE42-NEXT: movdqa %xmm2, %xmm0
-; SSE42-NEXT: pxor %xmm4, %xmm0
-; SSE42-NEXT: pcmpgtq %xmm6, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm5, %xmm2
-; SSE42-NEXT: movapd %xmm2, %xmm5
-; SSE42-NEXT: xorpd %xmm4, %xmm5
-; SSE42-NEXT: movdqa %xmm1, %xmm6
-; SSE42-NEXT: pxor %xmm4, %xmm6
-; SSE42-NEXT: movdqa %xmm3, %xmm0
-; SSE42-NEXT: pxor %xmm4, %xmm0
-; SSE42-NEXT: pcmpgtq %xmm6, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm1, %xmm3
-; SSE42-NEXT: movapd %xmm3, %xmm0
-; SSE42-NEXT: xorpd %xmm4, %xmm0
-; SSE42-NEXT: pcmpgtq %xmm5, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm2, %xmm3
-; SSE42-NEXT: movapd %xmm3, %xmm0
-; SSE42-NEXT: xorpd %xmm4, %xmm0
-; SSE42-NEXT: pshufd {{.*#+}} xmm1 = xmm3[2,3,2,3]
-; SSE42-NEXT: pxor %xmm1, %xmm4
-; SSE42-NEXT: pcmpgtq %xmm0, %xmm4
-; SSE42-NEXT: movdqa %xmm4, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm3, %xmm1
-; SSE42-NEXT: movq %xmm1, %rax
-; SSE42-NEXT: retq
-;
-; AVX1-LABEL: test_v8i64:
-; AVX1: # %bb.0:
-; AVX1-NEXT: vmovddup {{.*#+}} xmm2 = [9223372036854775808,9223372036854775808]
-; AVX1-NEXT: # xmm2 = mem[0,0]
-; AVX1-NEXT: vpxor %xmm2, %xmm0, %xmm3
-; AVX1-NEXT: vpxor %xmm2, %xmm1, %xmm4
-; AVX1-NEXT: vpcmpgtq %xmm3, %xmm4, %xmm3
-; AVX1-NEXT: vblendvpd %xmm3, %xmm0, %xmm1, %xmm3
-; AVX1-NEXT: vxorpd %xmm2, %xmm3, %xmm4
-; AVX1-NEXT: vextractf128 $1, %ymm0, %xmm0
-; AVX1-NEXT: vpxor %xmm2, %xmm0, %xmm5
-; AVX1-NEXT: vextractf128 $1, %ymm1, %xmm1
-; AVX1-NEXT: vpxor %xmm2, %xmm1, %xmm6
-; AVX1-NEXT: vpcmpgtq %xmm5, %xmm6, %xmm5
-; AVX1-NEXT: vblendvpd %xmm5, %xmm0, %xmm1, %xmm0
-; AVX1-NEXT: vxorpd %xmm2, %xmm0, %xmm1
-; AVX1-NEXT: vpcmpgtq %xmm4, %xmm1, %xmm1
-; AVX1-NEXT: vblendvpd %xmm1, %xmm3, %xmm0, %xmm0
-; AVX1-NEXT: vxorpd %xmm2, %xmm0, %xmm1
-; AVX1-NEXT: vshufps {{.*#+}} xmm3 = xmm0[2,3,2,3]
-; AVX1-NEXT: vxorpd %xmm2, %xmm3, %xmm2
-; AVX1-NEXT: vpcmpgtq %xmm1, %xmm2, %xmm1
-; AVX1-NEXT: vblendvpd %xmm1, %xmm0, %xmm3, %xmm0
-; AVX1-NEXT: vmovq %xmm0, %rax
-; AVX1-NEXT: vzeroupper
-; AVX1-NEXT: retq
-;
-; AVX2-LABEL: test_v8i64:
-; AVX2: # %bb.0:
-; AVX2-NEXT: vpbroadcastq {{.*#+}} ymm2 = [9223372036854775808,9223372036854775808,9223372036854775808,9223372036854775808]
-; AVX2-NEXT: vpxor %ymm2, %ymm0, %ymm3
-; AVX2-NEXT: vpxor %ymm2, %ymm1, %ymm4
-; AVX2-NEXT: vpcmpgtq %ymm3, %ymm4, %ymm3
-; AVX2-NEXT: vblendvpd %ymm3, %ymm0, %ymm1, %ymm0
-; AVX2-NEXT: vxorpd %xmm2, %xmm0, %xmm1
-; AVX2-NEXT: vextractf128 $1, %ymm0, %xmm3
-; AVX2-NEXT: vxorpd %xmm2, %xmm3, %xmm4
-; AVX2-NEXT: vpcmpgtq %xmm1, %xmm4, %xmm1
-; AVX2-NEXT: vblendvpd %xmm1, %xmm0, %xmm3, %xmm0
-; AVX2-NEXT: vxorpd %xmm2, %xmm0, %xmm1
-; AVX2-NEXT: vshufps {{.*#+}} xmm3 = xmm0[2,3,2,3]
-; AVX2-NEXT: vxorpd %xmm2, %xmm3, %xmm2
-; AVX2-NEXT: vpcmpgtq %xmm1, %xmm2, %xmm1
-; AVX2-NEXT: vblendvpd %xmm1, %xmm0, %xmm3, %xmm0
-; AVX2-NEXT: vmovq %xmm0, %rax
-; AVX2-NEXT: vzeroupper
-; AVX2-NEXT: retq
+define i64 @test_v8i64(<8 x i64> %a0) nounwind {
+; X86-SSE2-LABEL: test_v8i64:
+; X86-SSE2: # %bb.0:
+; X86-SSE2-NEXT: pushl %ebp
+; X86-SSE2-NEXT: movl %esp, %ebp
+; X86-SSE2-NEXT: andl $-16, %esp
+; X86-SSE2-NEXT: subl $16, %esp
+; X86-SSE2-NEXT: movdqa 8(%ebp), %xmm5
+; X86-SSE2-NEXT: movdqa {{.*#+}} xmm3 = [2147483648,2147483648,2147483648,2147483648]
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm4
+; X86-SSE2-NEXT: pxor %xmm3, %xmm4
+; X86-SSE2-NEXT: movdqa %xmm5, %xmm6
+; X86-SSE2-NEXT: pxor %xmm3, %xmm6
+; X86-SSE2-NEXT: movdqa %xmm6, %xmm7
+; X86-SSE2-NEXT: pcmpgtd %xmm4, %xmm7
+; X86-SSE2-NEXT: pcmpeqd %xmm4, %xmm6
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm4 = xmm7[0,0,2,2]
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm6 = xmm6[1,1,3,3]
+; X86-SSE2-NEXT: pand %xmm4, %xmm6
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm4 = xmm7[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm6, %xmm4
+; X86-SSE2-NEXT: pand %xmm4, %xmm1
+; X86-SSE2-NEXT: pandn %xmm5, %xmm4
+; X86-SSE2-NEXT: por %xmm1, %xmm4
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X86-SSE2-NEXT: pxor %xmm3, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm5
+; X86-SSE2-NEXT: pxor %xmm3, %xmm5
+; X86-SSE2-NEXT: movdqa %xmm5, %xmm6
+; X86-SSE2-NEXT: pcmpgtd %xmm1, %xmm6
+; X86-SSE2-NEXT: pcmpeqd %xmm1, %xmm5
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm6[0,0,2,2]
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm5 = xmm5[1,1,3,3]
+; X86-SSE2-NEXT: pand %xmm1, %xmm5
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm6[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm5, %xmm1
+; X86-SSE2-NEXT: pand %xmm1, %xmm0
+; X86-SSE2-NEXT: pandn %xmm2, %xmm1
+; X86-SSE2-NEXT: por %xmm0, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE2-NEXT: pxor %xmm3, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm4, %xmm2
+; X86-SSE2-NEXT: pxor %xmm3, %xmm2
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm5
+; X86-SSE2-NEXT: pcmpgtd %xmm0, %xmm5
+; X86-SSE2-NEXT: pcmpeqd %xmm0, %xmm2
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm5[0,0,2,2]
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm2[1,1,3,3]
+; X86-SSE2-NEXT: pand %xmm0, %xmm2
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm5[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm2, %xmm0
+; X86-SSE2-NEXT: pand %xmm0, %xmm1
+; X86-SSE2-NEXT: pandn %xmm4, %xmm0
+; X86-SSE2-NEXT: por %xmm1, %xmm0
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE2-NEXT: pxor %xmm3, %xmm2
+; X86-SSE2-NEXT: pxor %xmm1, %xmm3
+; X86-SSE2-NEXT: movdqa %xmm3, %xmm4
+; X86-SSE2-NEXT: pcmpgtd %xmm2, %xmm4
+; X86-SSE2-NEXT: pcmpeqd %xmm2, %xmm3
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm4[0,0,2,2]
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm3 = xmm3[1,1,3,3]
+; X86-SSE2-NEXT: pand %xmm2, %xmm3
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm4[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm3, %xmm2
+; X86-SSE2-NEXT: pand %xmm2, %xmm0
+; X86-SSE2-NEXT: pandn %xmm1, %xmm2
+; X86-SSE2-NEXT: por %xmm0, %xmm2
+; X86-SSE2-NEXT: movd %xmm2, %eax
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,1,1]
+; X86-SSE2-NEXT: movd %xmm0, %edx
+; X86-SSE2-NEXT: movl %ebp, %esp
+; X86-SSE2-NEXT: popl %ebp
+; X86-SSE2-NEXT: retl
+;
+; X64-SSE2-LABEL: test_v8i64:
+; X64-SSE2: # %bb.0:
+; X64-SSE2-NEXT: movdqa {{.*#+}} xmm4 = [9223372039002259456,9223372039002259456]
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm5
+; X64-SSE2-NEXT: pxor %xmm4, %xmm5
+; X64-SSE2-NEXT: movdqa %xmm2, %xmm6
+; X64-SSE2-NEXT: pxor %xmm4, %xmm6
+; X64-SSE2-NEXT: movdqa %xmm6, %xmm7
+; X64-SSE2-NEXT: pcmpgtd %xmm5, %xmm7
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm8 = xmm7[0,0,2,2]
+; X64-SSE2-NEXT: pcmpeqd %xmm5, %xmm6
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm6 = xmm6[1,1,3,3]
+; X64-SSE2-NEXT: pand %xmm8, %xmm6
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm5 = xmm7[1,1,3,3]
+; X64-SSE2-NEXT: por %xmm6, %xmm5
+; X64-SSE2-NEXT: pand %xmm5, %xmm0
+; X64-SSE2-NEXT: pandn %xmm2, %xmm5
+; X64-SSE2-NEXT: por %xmm0, %xmm5
+; X64-SSE2-NEXT: movdqa %xmm5, %xmm0
+; X64-SSE2-NEXT: pxor %xmm4, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm2
+; X64-SSE2-NEXT: pxor %xmm4, %xmm2
+; X64-SSE2-NEXT: movdqa %xmm3, %xmm6
+; X64-SSE2-NEXT: pxor %xmm4, %xmm6
+; X64-SSE2-NEXT: movdqa %xmm6, %xmm7
+; X64-SSE2-NEXT: pcmpgtd %xmm2, %xmm7
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm8 = xmm7[0,0,2,2]
+; X64-SSE2-NEXT: pcmpeqd %xmm2, %xmm6
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm6[1,1,3,3]
+; X64-SSE2-NEXT: pand %xmm8, %xmm2
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm6 = xmm7[1,1,3,3]
+; X64-SSE2-NEXT: por %xmm2, %xmm6
+; X64-SSE2-NEXT: pand %xmm6, %xmm1
+; X64-SSE2-NEXT: pandn %xmm3, %xmm6
+; X64-SSE2-NEXT: por %xmm1, %xmm6
+; X64-SSE2-NEXT: pxor %xmm6, %xmm4
+; X64-SSE2-NEXT: movdqa %xmm4, %xmm1
+; X64-SSE2-NEXT: pcmpgtd %xmm0, %xmm1
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm1[0,0,2,2]
+; X64-SSE2-NEXT: pcmpeqd %xmm0, %xmm4
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm4[1,1,3,3]
+; X64-SSE2-NEXT: pand %xmm2, %xmm0
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm1[1,1,3,3]
+; X64-SSE2-NEXT: por %xmm0, %xmm1
+; X64-SSE2-NEXT: pand %xmm1, %xmm5
+; X64-SSE2-NEXT: pandn %xmm6, %xmm1
+; X64-SSE2-NEXT: por %xmm5, %xmm1
+; X64-SSE2-NEXT: movq %xmm1, %rcx
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
+; X64-SSE2-NEXT: movq %xmm0, %rax
+; X64-SSE2-NEXT: cmpq %rax, %rcx
+; X64-SSE2-NEXT: cmovbq %rcx, %rax
+; X64-SSE2-NEXT: retq
+;
+; X86-SSE41-LABEL: test_v8i64:
+; X86-SSE41: # %bb.0:
+; X86-SSE41-NEXT: pushl %ebp
+; X86-SSE41-NEXT: movl %esp, %ebp
+; X86-SSE41-NEXT: andl $-16, %esp
+; X86-SSE41-NEXT: subl $16, %esp
+; X86-SSE41-NEXT: movdqa %xmm0, %xmm3
+; X86-SSE41-NEXT: movdqa 8(%ebp), %xmm4
+; X86-SSE41-NEXT: movdqa {{.*#+}} xmm5 = [2147483648,2147483648,2147483648,2147483648]
+; X86-SSE41-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE41-NEXT: pxor %xmm5, %xmm0
+; X86-SSE41-NEXT: movdqa %xmm4, %xmm6
+; X86-SSE41-NEXT: pxor %xmm5, %xmm6
+; X86-SSE41-NEXT: movdqa %xmm6, %xmm7
+; X86-SSE41-NEXT: pcmpgtd %xmm0, %xmm7
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm6
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm7[0,0,2,2]
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm6 = xmm6[1,1,3,3]
+; X86-SSE41-NEXT: pand %xmm0, %xmm6
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm7[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm6, %xmm0
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm1, %xmm4
+; X86-SSE41-NEXT: movdqa %xmm3, %xmm0
+; X86-SSE41-NEXT: pxor %xmm5, %xmm0
+; X86-SSE41-NEXT: movdqa %xmm2, %xmm1
+; X86-SSE41-NEXT: pxor %xmm5, %xmm1
+; X86-SSE41-NEXT: movdqa %xmm1, %xmm6
+; X86-SSE41-NEXT: pcmpgtd %xmm0, %xmm6
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm1
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm6[0,0,2,2]
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm1[1,1,3,3]
+; X86-SSE41-NEXT: pand %xmm0, %xmm1
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm6[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm1, %xmm0
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm3, %xmm2
+; X86-SSE41-NEXT: movapd %xmm2, %xmm0
+; X86-SSE41-NEXT: xorpd %xmm5, %xmm0
+; X86-SSE41-NEXT: movapd %xmm4, %xmm1
+; X86-SSE41-NEXT: xorpd %xmm5, %xmm1
+; X86-SSE41-NEXT: movapd %xmm1, %xmm3
+; X86-SSE41-NEXT: pcmpgtd %xmm0, %xmm3
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm1
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm3[0,0,2,2]
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm1[1,1,3,3]
+; X86-SSE41-NEXT: pand %xmm0, %xmm1
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm3[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm1, %xmm0
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm2, %xmm4
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm4[2,3,2,3]
+; X86-SSE41-NEXT: movdqa %xmm4, %xmm0
+; X86-SSE41-NEXT: pxor %xmm5, %xmm0
+; X86-SSE41-NEXT: pxor %xmm1, %xmm5
+; X86-SSE41-NEXT: movdqa %xmm5, %xmm2
+; X86-SSE41-NEXT: pcmpgtd %xmm0, %xmm2
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm5
+; X86-SSE41-NEXT: pmovsxdq %xmm2, %xmm0
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm3 = xmm5[1,1,3,3]
+; X86-SSE41-NEXT: pand %xmm0, %xmm3
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm3, %xmm0
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm4, %xmm1
+; X86-SSE41-NEXT: movd %xmm1, %eax
+; X86-SSE41-NEXT: pextrd $1, %xmm1, %edx
+; X86-SSE41-NEXT: movl %ebp, %esp
+; X86-SSE41-NEXT: popl %ebp
+; X86-SSE41-NEXT: retl
+;
+; X64-SSE41-LABEL: test_v8i64:
+; X64-SSE41: # %bb.0:
+; X64-SSE41-NEXT: movdqa %xmm0, %xmm4
+; X64-SSE41-NEXT: movdqa {{.*#+}} xmm5 = [9223372039002259456,9223372039002259456]
+; X64-SSE41-NEXT: pxor %xmm5, %xmm0
+; X64-SSE41-NEXT: movdqa %xmm2, %xmm6
+; X64-SSE41-NEXT: pxor %xmm5, %xmm6
+; X64-SSE41-NEXT: movdqa %xmm6, %xmm7
+; X64-SSE41-NEXT: pcmpgtd %xmm0, %xmm7
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm8 = xmm7[0,0,2,2]
+; X64-SSE41-NEXT: pcmpeqd %xmm0, %xmm6
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm6 = xmm6[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm8, %xmm6
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm7[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm6, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm4, %xmm2
+; X64-SSE41-NEXT: movapd %xmm2, %xmm4
+; X64-SSE41-NEXT: xorpd %xmm5, %xmm4
+; X64-SSE41-NEXT: movdqa %xmm1, %xmm0
+; X64-SSE41-NEXT: pxor %xmm5, %xmm0
+; X64-SSE41-NEXT: movdqa %xmm3, %xmm6
+; X64-SSE41-NEXT: pxor %xmm5, %xmm6
+; X64-SSE41-NEXT: movdqa %xmm6, %xmm7
+; X64-SSE41-NEXT: pcmpgtd %xmm0, %xmm7
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm8 = xmm7[0,0,2,2]
+; X64-SSE41-NEXT: pcmpeqd %xmm0, %xmm6
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm6 = xmm6[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm8, %xmm6
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm7[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm6, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm1, %xmm3
+; X64-SSE41-NEXT: movapd %xmm3, %xmm0
+; X64-SSE41-NEXT: xorpd %xmm5, %xmm0
+; X64-SSE41-NEXT: movapd %xmm0, %xmm1
+; X64-SSE41-NEXT: pcmpgtd %xmm4, %xmm1
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm6 = xmm1[0,0,2,2]
+; X64-SSE41-NEXT: pcmpeqd %xmm4, %xmm0
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm4 = xmm0[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm6, %xmm4
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm4, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm2, %xmm3
+; X64-SSE41-NEXT: movapd %xmm3, %xmm0
+; X64-SSE41-NEXT: xorpd %xmm5, %xmm0
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm3[2,3,2,3]
+; X64-SSE41-NEXT: pxor %xmm1, %xmm5
+; X64-SSE41-NEXT: movdqa %xmm5, %xmm2
+; X64-SSE41-NEXT: pcmpgtd %xmm0, %xmm2
+; X64-SSE41-NEXT: pmovsxdq %xmm2, %xmm4
+; X64-SSE41-NEXT: pcmpeqd %xmm0, %xmm5
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm5 = xmm5[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm4, %xmm5
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm5, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm3, %xmm1
+; X64-SSE41-NEXT: movq %xmm1, %rax
+; X64-SSE41-NEXT: retq
+;
+; X86-SSE42-LABEL: test_v8i64:
+; X86-SSE42: # %bb.0:
+; X86-SSE42-NEXT: pushl %ebp
+; X86-SSE42-NEXT: movl %esp, %ebp
+; X86-SSE42-NEXT: andl $-16, %esp
+; X86-SSE42-NEXT: subl $16, %esp
+; X86-SSE42-NEXT: movdqa %xmm0, %xmm3
+; X86-SSE42-NEXT: movdqa 8(%ebp), %xmm5
+; X86-SSE42-NEXT: movdqa {{.*#+}} xmm4 = [0,2147483648,0,2147483648]
+; X86-SSE42-NEXT: movdqa %xmm1, %xmm6
+; X86-SSE42-NEXT: pxor %xmm4, %xmm6
+; X86-SSE42-NEXT: movdqa %xmm5, %xmm0
+; X86-SSE42-NEXT: pxor %xmm4, %xmm0
+; X86-SSE42-NEXT: pcmpgtq %xmm6, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm1, %xmm5
+; X86-SSE42-NEXT: movdqa %xmm3, %xmm1
+; X86-SSE42-NEXT: pxor %xmm4, %xmm1
+; X86-SSE42-NEXT: movdqa %xmm2, %xmm0
+; X86-SSE42-NEXT: pxor %xmm4, %xmm0
+; X86-SSE42-NEXT: pcmpgtq %xmm1, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm3, %xmm2
+; X86-SSE42-NEXT: movapd %xmm2, %xmm1
+; X86-SSE42-NEXT: xorpd %xmm4, %xmm1
+; X86-SSE42-NEXT: movapd %xmm5, %xmm0
+; X86-SSE42-NEXT: xorpd %xmm4, %xmm0
+; X86-SSE42-NEXT: pcmpgtq %xmm1, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm2, %xmm5
+; X86-SSE42-NEXT: pshufd {{.*#+}} xmm1 = xmm5[2,3,2,3]
+; X86-SSE42-NEXT: movdqa %xmm5, %xmm0
+; X86-SSE42-NEXT: pxor %xmm4, %xmm0
+; X86-SSE42-NEXT: pxor %xmm1, %xmm4
+; X86-SSE42-NEXT: pcmpgtq %xmm0, %xmm4
+; X86-SSE42-NEXT: movdqa %xmm4, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm5, %xmm1
+; X86-SSE42-NEXT: movd %xmm1, %eax
+; X86-SSE42-NEXT: pextrd $1, %xmm1, %edx
+; X86-SSE42-NEXT: movl %ebp, %esp
+; X86-SSE42-NEXT: popl %ebp
+; X86-SSE42-NEXT: retl
+;
+; X64-SSE42-LABEL: test_v8i64:
+; X64-SSE42: # %bb.0:
+; X64-SSE42-NEXT: movdqa %xmm0, %xmm5
+; X64-SSE42-NEXT: movdqa {{.*#+}} xmm4 = [9223372036854775808,9223372036854775808]
+; X64-SSE42-NEXT: movdqa %xmm0, %xmm6
+; X64-SSE42-NEXT: pxor %xmm4, %xmm6
+; X64-SSE42-NEXT: movdqa %xmm2, %xmm0
+; X64-SSE42-NEXT: pxor %xmm4, %xmm0
+; X64-SSE42-NEXT: pcmpgtq %xmm6, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm5, %xmm2
+; X64-SSE42-NEXT: movapd %xmm2, %xmm5
+; X64-SSE42-NEXT: xorpd %xmm4, %xmm5
+; X64-SSE42-NEXT: movdqa %xmm1, %xmm6
+; X64-SSE42-NEXT: pxor %xmm4, %xmm6
+; X64-SSE42-NEXT: movdqa %xmm3, %xmm0
+; X64-SSE42-NEXT: pxor %xmm4, %xmm0
+; X64-SSE42-NEXT: pcmpgtq %xmm6, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm1, %xmm3
+; X64-SSE42-NEXT: movapd %xmm3, %xmm0
+; X64-SSE42-NEXT: xorpd %xmm4, %xmm0
+; X64-SSE42-NEXT: pcmpgtq %xmm5, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm2, %xmm3
+; X64-SSE42-NEXT: movapd %xmm3, %xmm0
+; X64-SSE42-NEXT: xorpd %xmm4, %xmm0
+; X64-SSE42-NEXT: pshufd {{.*#+}} xmm1 = xmm3[2,3,2,3]
+; X64-SSE42-NEXT: pxor %xmm1, %xmm4
+; X64-SSE42-NEXT: pcmpgtq %xmm0, %xmm4
+; X64-SSE42-NEXT: movdqa %xmm4, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm3, %xmm1
+; X64-SSE42-NEXT: movq %xmm1, %rax
+; X64-SSE42-NEXT: retq
+;
+; X86-AVX1-LABEL: test_v8i64:
+; X86-AVX1: # %bb.0:
+; X86-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm3
+; X86-AVX1-NEXT: vmovddup {{.*#+}} xmm2 = [0,2147483648,0,2147483648]
+; X86-AVX1-NEXT: # xmm2 = mem[0,0]
+; X86-AVX1-NEXT: vxorps %xmm2, %xmm3, %xmm4
+; X86-AVX1-NEXT: vextractf128 $1, %ymm1, %xmm5
+; X86-AVX1-NEXT: vxorps %xmm2, %xmm5, %xmm6
+; X86-AVX1-NEXT: vpcmpgtq %xmm4, %xmm6, %xmm4
+; X86-AVX1-NEXT: vblendvpd %xmm4, %xmm3, %xmm5, %xmm3
+; X86-AVX1-NEXT: vxorps %xmm2, %xmm0, %xmm4
+; X86-AVX1-NEXT: vxorps %xmm2, %xmm1, %xmm5
+; X86-AVX1-NEXT: vpcmpgtq %xmm4, %xmm5, %xmm4
+; X86-AVX1-NEXT: vblendvpd %xmm4, %xmm0, %xmm1, %xmm0
+; X86-AVX1-NEXT: vxorpd %xmm2, %xmm0, %xmm1
+; X86-AVX1-NEXT: vxorpd %xmm2, %xmm3, %xmm4
+; X86-AVX1-NEXT: vpcmpgtq %xmm1, %xmm4, %xmm1
+; X86-AVX1-NEXT: vblendvpd %xmm1, %xmm0, %xmm3, %xmm0
+; X86-AVX1-NEXT: vshufps {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-AVX1-NEXT: vxorpd %xmm2, %xmm0, %xmm3
+; X86-AVX1-NEXT: vxorpd %xmm2, %xmm1, %xmm2
+; X86-AVX1-NEXT: vpcmpgtq %xmm3, %xmm2, %xmm2
+; X86-AVX1-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X86-AVX1-NEXT: vmovd %xmm0, %eax
+; X86-AVX1-NEXT: vpextrd $1, %xmm0, %edx
+; X86-AVX1-NEXT: vzeroupper
+; X86-AVX1-NEXT: retl
+;
+; X64-AVX1-LABEL: test_v8i64:
+; X64-AVX1: # %bb.0:
+; X64-AVX1-NEXT: vmovddup {{.*#+}} xmm2 = [9223372036854775808,9223372036854775808]
+; X64-AVX1-NEXT: # xmm2 = mem[0,0]
+; X64-AVX1-NEXT: vpxor %xmm2, %xmm0, %xmm3
+; X64-AVX1-NEXT: vpxor %xmm2, %xmm1, %xmm4
+; X64-AVX1-NEXT: vpcmpgtq %xmm3, %xmm4, %xmm3
+; X64-AVX1-NEXT: vblendvpd %xmm3, %xmm0, %xmm1, %xmm3
+; X64-AVX1-NEXT: vxorpd %xmm2, %xmm3, %xmm4
+; X64-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm0
+; X64-AVX1-NEXT: vpxor %xmm2, %xmm0, %xmm5
+; X64-AVX1-NEXT: vextractf128 $1, %ymm1, %xmm1
+; X64-AVX1-NEXT: vpxor %xmm2, %xmm1, %xmm6
+; X64-AVX1-NEXT: vpcmpgtq %xmm5, %xmm6, %xmm5
+; X64-AVX1-NEXT: vblendvpd %xmm5, %xmm0, %xmm1, %xmm0
+; X64-AVX1-NEXT: vxorpd %xmm2, %xmm0, %xmm1
+; X64-AVX1-NEXT: vpcmpgtq %xmm4, %xmm1, %xmm1
+; X64-AVX1-NEXT: vblendvpd %xmm1, %xmm3, %xmm0, %xmm0
+; X64-AVX1-NEXT: vxorpd %xmm2, %xmm0, %xmm1
+; X64-AVX1-NEXT: vshufps {{.*#+}} xmm3 = xmm0[2,3,2,3]
+; X64-AVX1-NEXT: vxorpd %xmm2, %xmm3, %xmm2
+; X64-AVX1-NEXT: vpcmpgtq %xmm1, %xmm2, %xmm1
+; X64-AVX1-NEXT: vblendvpd %xmm1, %xmm0, %xmm3, %xmm0
+; X64-AVX1-NEXT: vmovq %xmm0, %rax
+; X64-AVX1-NEXT: vzeroupper
+; X64-AVX1-NEXT: retq
+;
+; X86-AVX2-LABEL: test_v8i64:
+; X86-AVX2: # %bb.0:
+; X86-AVX2-NEXT: vpbroadcastq {{.*#+}} ymm2 = [0,2147483648,0,2147483648,0,2147483648,0,2147483648]
+; X86-AVX2-NEXT: vpxor %ymm2, %ymm0, %ymm3
+; X86-AVX2-NEXT: vpxor %ymm2, %ymm1, %ymm4
+; X86-AVX2-NEXT: vpcmpgtq %ymm3, %ymm4, %ymm3
+; X86-AVX2-NEXT: vblendvpd %ymm3, %ymm0, %ymm1, %ymm0
+; X86-AVX2-NEXT: vextractf128 $1, %ymm0, %xmm1
+; X86-AVX2-NEXT: vxorpd %xmm2, %xmm0, %xmm3
+; X86-AVX2-NEXT: vxorpd %xmm2, %xmm1, %xmm4
+; X86-AVX2-NEXT: vpcmpgtq %xmm3, %xmm4, %xmm3
+; X86-AVX2-NEXT: vblendvpd %xmm3, %xmm0, %xmm1, %xmm0
+; X86-AVX2-NEXT: vshufps {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-AVX2-NEXT: vxorpd %xmm2, %xmm0, %xmm3
+; X86-AVX2-NEXT: vxorpd %xmm2, %xmm1, %xmm2
+; X86-AVX2-NEXT: vpcmpgtq %xmm3, %xmm2, %xmm2
+; X86-AVX2-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X86-AVX2-NEXT: vmovd %xmm0, %eax
+; X86-AVX2-NEXT: vpextrd $1, %xmm0, %edx
+; X86-AVX2-NEXT: vzeroupper
+; X86-AVX2-NEXT: retl
+;
+; X64-AVX2-LABEL: test_v8i64:
+; X64-AVX2: # %bb.0:
+; X64-AVX2-NEXT: vpbroadcastq {{.*#+}} ymm2 = [9223372036854775808,9223372036854775808,9223372036854775808,9223372036854775808]
+; X64-AVX2-NEXT: vpxor %ymm2, %ymm0, %ymm3
+; X64-AVX2-NEXT: vpxor %ymm2, %ymm1, %ymm4
+; X64-AVX2-NEXT: vpcmpgtq %ymm3, %ymm4, %ymm3
+; X64-AVX2-NEXT: vblendvpd %ymm3, %ymm0, %ymm1, %ymm0
+; X64-AVX2-NEXT: vxorpd %xmm2, %xmm0, %xmm1
+; X64-AVX2-NEXT: vextractf128 $1, %ymm0, %xmm3
+; X64-AVX2-NEXT: vxorpd %xmm2, %xmm3, %xmm4
+; X64-AVX2-NEXT: vpcmpgtq %xmm1, %xmm4, %xmm1
+; X64-AVX2-NEXT: vblendvpd %xmm1, %xmm0, %xmm3, %xmm0
+; X64-AVX2-NEXT: vxorpd %xmm2, %xmm0, %xmm1
+; X64-AVX2-NEXT: vshufps {{.*#+}} xmm3 = xmm0[2,3,2,3]
+; X64-AVX2-NEXT: vxorpd %xmm2, %xmm3, %xmm2
+; X64-AVX2-NEXT: vpcmpgtq %xmm1, %xmm2, %xmm1
+; X64-AVX2-NEXT: vblendvpd %xmm1, %xmm0, %xmm3, %xmm0
+; X64-AVX2-NEXT: vmovq %xmm0, %rax
+; X64-AVX2-NEXT: vzeroupper
+; X64-AVX2-NEXT: retq
;
; AVX512BW-LABEL: test_v8i64:
; AVX512BW: # %bb.0:
@@ -452,360 +901,794 @@ define i64 @test_v8i64(<8 x i64> %a0) {
ret i64 %1
}
-define i64 @test_v16i64(<16 x i64> %a0) {
-; SSE2-LABEL: test_v16i64:
-; SSE2: # %bb.0:
-; SSE2-NEXT: movdqa {{.*#+}} xmm8 = [9223372039002259456,9223372039002259456]
-; SSE2-NEXT: movdqa %xmm0, %xmm9
-; SSE2-NEXT: pxor %xmm8, %xmm9
-; SSE2-NEXT: movdqa %xmm4, %xmm10
-; SSE2-NEXT: pxor %xmm8, %xmm10
-; SSE2-NEXT: movdqa %xmm10, %xmm11
-; SSE2-NEXT: pcmpgtd %xmm9, %xmm11
-; SSE2-NEXT: pshufd {{.*#+}} xmm12 = xmm11[0,0,2,2]
-; SSE2-NEXT: pcmpeqd %xmm9, %xmm10
-; SSE2-NEXT: pshufd {{.*#+}} xmm10 = xmm10[1,1,3,3]
-; SSE2-NEXT: pand %xmm12, %xmm10
-; SSE2-NEXT: pshufd {{.*#+}} xmm9 = xmm11[1,1,3,3]
-; SSE2-NEXT: por %xmm10, %xmm9
-; SSE2-NEXT: pand %xmm9, %xmm0
-; SSE2-NEXT: pandn %xmm4, %xmm9
-; SSE2-NEXT: por %xmm0, %xmm9
-; SSE2-NEXT: movdqa %xmm9, %xmm0
-; SSE2-NEXT: pxor %xmm8, %xmm0
-; SSE2-NEXT: movdqa %xmm2, %xmm4
-; SSE2-NEXT: pxor %xmm8, %xmm4
-; SSE2-NEXT: movdqa %xmm6, %xmm10
-; SSE2-NEXT: pxor %xmm8, %xmm10
-; SSE2-NEXT: movdqa %xmm10, %xmm11
-; SSE2-NEXT: pcmpgtd %xmm4, %xmm11
-; SSE2-NEXT: pshufd {{.*#+}} xmm12 = xmm11[0,0,2,2]
-; SSE2-NEXT: pcmpeqd %xmm4, %xmm10
-; SSE2-NEXT: pshufd {{.*#+}} xmm4 = xmm10[1,1,3,3]
-; SSE2-NEXT: pand %xmm12, %xmm4
-; SSE2-NEXT: pshufd {{.*#+}} xmm10 = xmm11[1,1,3,3]
-; SSE2-NEXT: por %xmm4, %xmm10
-; SSE2-NEXT: pand %xmm10, %xmm2
-; SSE2-NEXT: pandn %xmm6, %xmm10
-; SSE2-NEXT: por %xmm2, %xmm10
-; SSE2-NEXT: movdqa %xmm10, %xmm2
-; SSE2-NEXT: pxor %xmm8, %xmm2
-; SSE2-NEXT: movdqa %xmm2, %xmm4
-; SSE2-NEXT: pcmpgtd %xmm0, %xmm4
-; SSE2-NEXT: pshufd {{.*#+}} xmm6 = xmm4[0,0,2,2]
-; SSE2-NEXT: pcmpeqd %xmm0, %xmm2
-; SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm2[1,1,3,3]
-; SSE2-NEXT: pand %xmm6, %xmm2
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm4[1,1,3,3]
-; SSE2-NEXT: por %xmm2, %xmm0
-; SSE2-NEXT: pand %xmm0, %xmm9
-; SSE2-NEXT: pandn %xmm10, %xmm0
-; SSE2-NEXT: por %xmm9, %xmm0
-; SSE2-NEXT: movdqa %xmm0, %xmm2
-; SSE2-NEXT: pxor %xmm8, %xmm2
-; SSE2-NEXT: movdqa %xmm1, %xmm4
-; SSE2-NEXT: pxor %xmm8, %xmm4
-; SSE2-NEXT: movdqa %xmm5, %xmm6
-; SSE2-NEXT: pxor %xmm8, %xmm6
-; SSE2-NEXT: movdqa %xmm6, %xmm9
-; SSE2-NEXT: pcmpgtd %xmm4, %xmm9
-; SSE2-NEXT: pshufd {{.*#+}} xmm10 = xmm9[0,0,2,2]
-; SSE2-NEXT: pcmpeqd %xmm4, %xmm6
-; SSE2-NEXT: pshufd {{.*#+}} xmm6 = xmm6[1,1,3,3]
-; SSE2-NEXT: pand %xmm10, %xmm6
-; SSE2-NEXT: pshufd {{.*#+}} xmm4 = xmm9[1,1,3,3]
-; SSE2-NEXT: por %xmm6, %xmm4
-; SSE2-NEXT: pand %xmm4, %xmm1
-; SSE2-NEXT: pandn %xmm5, %xmm4
-; SSE2-NEXT: por %xmm1, %xmm4
-; SSE2-NEXT: movdqa %xmm4, %xmm1
-; SSE2-NEXT: pxor %xmm8, %xmm1
-; SSE2-NEXT: movdqa %xmm3, %xmm5
-; SSE2-NEXT: pxor %xmm8, %xmm5
-; SSE2-NEXT: movdqa %xmm7, %xmm6
-; SSE2-NEXT: pxor %xmm8, %xmm6
-; SSE2-NEXT: movdqa %xmm6, %xmm9
-; SSE2-NEXT: pcmpgtd %xmm5, %xmm9
-; SSE2-NEXT: pshufd {{.*#+}} xmm10 = xmm9[0,0,2,2]
-; SSE2-NEXT: pcmpeqd %xmm5, %xmm6
-; SSE2-NEXT: pshufd {{.*#+}} xmm5 = xmm6[1,1,3,3]
-; SSE2-NEXT: pand %xmm10, %xmm5
-; SSE2-NEXT: pshufd {{.*#+}} xmm6 = xmm9[1,1,3,3]
-; SSE2-NEXT: por %xmm5, %xmm6
-; SSE2-NEXT: pand %xmm6, %xmm3
-; SSE2-NEXT: pandn %xmm7, %xmm6
-; SSE2-NEXT: por %xmm3, %xmm6
-; SSE2-NEXT: movdqa %xmm6, %xmm3
-; SSE2-NEXT: pxor %xmm8, %xmm3
-; SSE2-NEXT: movdqa %xmm3, %xmm5
-; SSE2-NEXT: pcmpgtd %xmm1, %xmm5
-; SSE2-NEXT: pshufd {{.*#+}} xmm7 = xmm5[0,0,2,2]
-; SSE2-NEXT: pcmpeqd %xmm1, %xmm3
-; SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm3[1,1,3,3]
-; SSE2-NEXT: pand %xmm7, %xmm1
-; SSE2-NEXT: pshufd {{.*#+}} xmm3 = xmm5[1,1,3,3]
-; SSE2-NEXT: por %xmm1, %xmm3
-; SSE2-NEXT: pand %xmm3, %xmm4
-; SSE2-NEXT: pandn %xmm6, %xmm3
-; SSE2-NEXT: por %xmm4, %xmm3
-; SSE2-NEXT: pxor %xmm3, %xmm8
-; SSE2-NEXT: movdqa %xmm8, %xmm1
-; SSE2-NEXT: pcmpgtd %xmm2, %xmm1
-; SSE2-NEXT: pshufd {{.*#+}} xmm4 = xmm1[0,0,2,2]
-; SSE2-NEXT: pcmpeqd %xmm2, %xmm8
-; SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm8[1,1,3,3]
-; SSE2-NEXT: pand %xmm4, %xmm2
-; SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm1[1,1,3,3]
-; SSE2-NEXT: por %xmm2, %xmm1
-; SSE2-NEXT: pand %xmm1, %xmm0
-; SSE2-NEXT: pandn %xmm3, %xmm1
-; SSE2-NEXT: por %xmm0, %xmm1
-; SSE2-NEXT: movq %xmm1, %rcx
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
-; SSE2-NEXT: movq %xmm0, %rax
-; SSE2-NEXT: cmpq %rax, %rcx
-; SSE2-NEXT: cmovbq %rcx, %rax
-; SSE2-NEXT: retq
-;
-; SSE41-LABEL: test_v16i64:
-; SSE41: # %bb.0:
-; SSE41-NEXT: movdqa %xmm0, %xmm8
-; SSE41-NEXT: movdqa {{.*#+}} xmm9 = [9223372039002259456,9223372039002259456]
-; SSE41-NEXT: pxor %xmm9, %xmm0
-; SSE41-NEXT: movdqa %xmm4, %xmm10
-; SSE41-NEXT: pxor %xmm9, %xmm10
-; SSE41-NEXT: movdqa %xmm10, %xmm11
-; SSE41-NEXT: pcmpgtd %xmm0, %xmm11
-; SSE41-NEXT: pshufd {{.*#+}} xmm12 = xmm11[0,0,2,2]
-; SSE41-NEXT: pcmpeqd %xmm0, %xmm10
-; SSE41-NEXT: pshufd {{.*#+}} xmm10 = xmm10[1,1,3,3]
-; SSE41-NEXT: pand %xmm12, %xmm10
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm11[1,1,3,3]
-; SSE41-NEXT: por %xmm10, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm8, %xmm4
-; SSE41-NEXT: movapd %xmm4, %xmm8
-; SSE41-NEXT: xorpd %xmm9, %xmm8
-; SSE41-NEXT: movdqa %xmm2, %xmm0
-; SSE41-NEXT: pxor %xmm9, %xmm0
-; SSE41-NEXT: movdqa %xmm6, %xmm10
-; SSE41-NEXT: pxor %xmm9, %xmm10
-; SSE41-NEXT: movdqa %xmm10, %xmm11
-; SSE41-NEXT: pcmpgtd %xmm0, %xmm11
-; SSE41-NEXT: pshufd {{.*#+}} xmm12 = xmm11[0,0,2,2]
-; SSE41-NEXT: pcmpeqd %xmm0, %xmm10
-; SSE41-NEXT: pshufd {{.*#+}} xmm10 = xmm10[1,1,3,3]
-; SSE41-NEXT: pand %xmm12, %xmm10
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm11[1,1,3,3]
-; SSE41-NEXT: por %xmm10, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm2, %xmm6
-; SSE41-NEXT: movapd %xmm6, %xmm0
-; SSE41-NEXT: xorpd %xmm9, %xmm0
-; SSE41-NEXT: movapd %xmm0, %xmm2
-; SSE41-NEXT: pcmpgtd %xmm8, %xmm2
-; SSE41-NEXT: pshufd {{.*#+}} xmm10 = xmm2[0,0,2,2]
-; SSE41-NEXT: pcmpeqd %xmm8, %xmm0
-; SSE41-NEXT: pshufd {{.*#+}} xmm8 = xmm0[1,1,3,3]
-; SSE41-NEXT: pand %xmm10, %xmm8
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,3,3]
-; SSE41-NEXT: por %xmm8, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm4, %xmm6
-; SSE41-NEXT: movapd %xmm6, %xmm2
-; SSE41-NEXT: xorpd %xmm9, %xmm2
-; SSE41-NEXT: movdqa %xmm1, %xmm0
-; SSE41-NEXT: pxor %xmm9, %xmm0
-; SSE41-NEXT: movdqa %xmm5, %xmm4
-; SSE41-NEXT: pxor %xmm9, %xmm4
-; SSE41-NEXT: movdqa %xmm4, %xmm8
-; SSE41-NEXT: pcmpgtd %xmm0, %xmm8
-; SSE41-NEXT: pshufd {{.*#+}} xmm10 = xmm8[0,0,2,2]
-; SSE41-NEXT: pcmpeqd %xmm0, %xmm4
-; SSE41-NEXT: pshufd {{.*#+}} xmm4 = xmm4[1,1,3,3]
-; SSE41-NEXT: pand %xmm10, %xmm4
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm8[1,1,3,3]
-; SSE41-NEXT: por %xmm4, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm1, %xmm5
-; SSE41-NEXT: movapd %xmm5, %xmm1
-; SSE41-NEXT: xorpd %xmm9, %xmm1
-; SSE41-NEXT: movdqa %xmm3, %xmm0
-; SSE41-NEXT: pxor %xmm9, %xmm0
-; SSE41-NEXT: movdqa %xmm7, %xmm4
-; SSE41-NEXT: pxor %xmm9, %xmm4
-; SSE41-NEXT: movdqa %xmm4, %xmm8
-; SSE41-NEXT: pcmpgtd %xmm0, %xmm8
-; SSE41-NEXT: pshufd {{.*#+}} xmm10 = xmm8[0,0,2,2]
-; SSE41-NEXT: pcmpeqd %xmm0, %xmm4
-; SSE41-NEXT: pshufd {{.*#+}} xmm4 = xmm4[1,1,3,3]
-; SSE41-NEXT: pand %xmm10, %xmm4
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm8[1,1,3,3]
-; SSE41-NEXT: por %xmm4, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm3, %xmm7
-; SSE41-NEXT: movapd %xmm7, %xmm0
-; SSE41-NEXT: xorpd %xmm9, %xmm0
-; SSE41-NEXT: movapd %xmm0, %xmm3
-; SSE41-NEXT: pcmpgtd %xmm1, %xmm3
-; SSE41-NEXT: pshufd {{.*#+}} xmm4 = xmm3[0,0,2,2]
-; SSE41-NEXT: pcmpeqd %xmm1, %xmm0
-; SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,3,3]
-; SSE41-NEXT: pand %xmm4, %xmm1
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm3[1,1,3,3]
-; SSE41-NEXT: por %xmm1, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm5, %xmm7
-; SSE41-NEXT: movapd %xmm7, %xmm0
-; SSE41-NEXT: xorpd %xmm9, %xmm0
-; SSE41-NEXT: movapd %xmm0, %xmm1
-; SSE41-NEXT: pcmpgtd %xmm2, %xmm1
-; SSE41-NEXT: pshufd {{.*#+}} xmm3 = xmm1[0,0,2,2]
-; SSE41-NEXT: pcmpeqd %xmm2, %xmm0
-; SSE41-NEXT: pshufd {{.*#+}} xmm2 = xmm0[1,1,3,3]
-; SSE41-NEXT: pand %xmm3, %xmm2
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,3,3]
-; SSE41-NEXT: por %xmm2, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm6, %xmm7
-; SSE41-NEXT: movapd %xmm7, %xmm0
-; SSE41-NEXT: xorpd %xmm9, %xmm0
-; SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm7[2,3,2,3]
-; SSE41-NEXT: pxor %xmm1, %xmm9
-; SSE41-NEXT: movdqa %xmm9, %xmm2
-; SSE41-NEXT: pcmpgtd %xmm0, %xmm2
-; SSE41-NEXT: pmovsxdq %xmm2, %xmm3
-; SSE41-NEXT: pcmpeqd %xmm0, %xmm9
-; SSE41-NEXT: pshufd {{.*#+}} xmm4 = xmm9[1,1,3,3]
-; SSE41-NEXT: pand %xmm3, %xmm4
-; SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,3,3]
-; SSE41-NEXT: por %xmm4, %xmm0
-; SSE41-NEXT: blendvpd %xmm0, %xmm7, %xmm1
-; SSE41-NEXT: movq %xmm1, %rax
-; SSE41-NEXT: retq
-;
-; SSE42-LABEL: test_v16i64:
-; SSE42: # %bb.0:
-; SSE42-NEXT: movdqa %xmm0, %xmm9
-; SSE42-NEXT: movdqa {{.*#+}} xmm8 = [9223372036854775808,9223372036854775808]
-; SSE42-NEXT: movdqa %xmm0, %xmm10
-; SSE42-NEXT: pxor %xmm8, %xmm10
-; SSE42-NEXT: movdqa %xmm4, %xmm0
-; SSE42-NEXT: pxor %xmm8, %xmm0
-; SSE42-NEXT: pcmpgtq %xmm10, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm9, %xmm4
-; SSE42-NEXT: movapd %xmm4, %xmm9
-; SSE42-NEXT: xorpd %xmm8, %xmm9
-; SSE42-NEXT: movdqa %xmm2, %xmm10
-; SSE42-NEXT: pxor %xmm8, %xmm10
-; SSE42-NEXT: movdqa %xmm6, %xmm0
-; SSE42-NEXT: pxor %xmm8, %xmm0
-; SSE42-NEXT: pcmpgtq %xmm10, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm2, %xmm6
-; SSE42-NEXT: movapd %xmm6, %xmm0
-; SSE42-NEXT: xorpd %xmm8, %xmm0
-; SSE42-NEXT: pcmpgtq %xmm9, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm4, %xmm6
-; SSE42-NEXT: movapd %xmm6, %xmm2
-; SSE42-NEXT: xorpd %xmm8, %xmm2
-; SSE42-NEXT: movdqa %xmm1, %xmm4
-; SSE42-NEXT: pxor %xmm8, %xmm4
-; SSE42-NEXT: movdqa %xmm5, %xmm0
-; SSE42-NEXT: pxor %xmm8, %xmm0
-; SSE42-NEXT: pcmpgtq %xmm4, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm1, %xmm5
-; SSE42-NEXT: movapd %xmm5, %xmm1
-; SSE42-NEXT: xorpd %xmm8, %xmm1
-; SSE42-NEXT: movdqa %xmm3, %xmm4
-; SSE42-NEXT: pxor %xmm8, %xmm4
-; SSE42-NEXT: movdqa %xmm7, %xmm0
-; SSE42-NEXT: pxor %xmm8, %xmm0
-; SSE42-NEXT: pcmpgtq %xmm4, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm3, %xmm7
-; SSE42-NEXT: movapd %xmm7, %xmm0
-; SSE42-NEXT: xorpd %xmm8, %xmm0
-; SSE42-NEXT: pcmpgtq %xmm1, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm5, %xmm7
-; SSE42-NEXT: movapd %xmm7, %xmm0
-; SSE42-NEXT: xorpd %xmm8, %xmm0
-; SSE42-NEXT: pcmpgtq %xmm2, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm6, %xmm7
-; SSE42-NEXT: movapd %xmm7, %xmm0
-; SSE42-NEXT: xorpd %xmm8, %xmm0
-; SSE42-NEXT: pshufd {{.*#+}} xmm1 = xmm7[2,3,2,3]
-; SSE42-NEXT: pxor %xmm1, %xmm8
-; SSE42-NEXT: pcmpgtq %xmm0, %xmm8
-; SSE42-NEXT: movdqa %xmm8, %xmm0
-; SSE42-NEXT: blendvpd %xmm0, %xmm7, %xmm1
-; SSE42-NEXT: movq %xmm1, %rax
-; SSE42-NEXT: retq
-;
-; AVX1-LABEL: test_v16i64:
-; AVX1: # %bb.0:
-; AVX1-NEXT: vmovddup {{.*#+}} xmm4 = [9223372036854775808,9223372036854775808]
-; AVX1-NEXT: # xmm4 = mem[0,0]
-; AVX1-NEXT: vpxor %xmm4, %xmm0, %xmm5
-; AVX1-NEXT: vpxor %xmm4, %xmm2, %xmm6
-; AVX1-NEXT: vpcmpgtq %xmm5, %xmm6, %xmm5
-; AVX1-NEXT: vblendvpd %xmm5, %xmm0, %xmm2, %xmm5
-; AVX1-NEXT: vxorpd %xmm4, %xmm5, %xmm6
-; AVX1-NEXT: vpxor %xmm4, %xmm1, %xmm7
-; AVX1-NEXT: vpxor %xmm4, %xmm3, %xmm8
-; AVX1-NEXT: vpcmpgtq %xmm7, %xmm8, %xmm7
-; AVX1-NEXT: vblendvpd %xmm7, %xmm1, %xmm3, %xmm7
-; AVX1-NEXT: vxorpd %xmm4, %xmm7, %xmm8
-; AVX1-NEXT: vpcmpgtq %xmm6, %xmm8, %xmm6
-; AVX1-NEXT: vblendvpd %xmm6, %xmm5, %xmm7, %xmm5
-; AVX1-NEXT: vxorpd %xmm4, %xmm5, %xmm6
-; AVX1-NEXT: vextractf128 $1, %ymm0, %xmm0
-; AVX1-NEXT: vpxor %xmm4, %xmm0, %xmm7
-; AVX1-NEXT: vextractf128 $1, %ymm2, %xmm2
-; AVX1-NEXT: vpxor %xmm4, %xmm2, %xmm8
-; AVX1-NEXT: vpcmpgtq %xmm7, %xmm8, %xmm7
-; AVX1-NEXT: vblendvpd %xmm7, %xmm0, %xmm2, %xmm0
-; AVX1-NEXT: vxorpd %xmm4, %xmm0, %xmm2
-; AVX1-NEXT: vextractf128 $1, %ymm1, %xmm1
-; AVX1-NEXT: vpxor %xmm4, %xmm1, %xmm7
-; AVX1-NEXT: vextractf128 $1, %ymm3, %xmm3
-; AVX1-NEXT: vpxor %xmm4, %xmm3, %xmm8
-; AVX1-NEXT: vpcmpgtq %xmm7, %xmm8, %xmm7
-; AVX1-NEXT: vblendvpd %xmm7, %xmm1, %xmm3, %xmm1
-; AVX1-NEXT: vxorpd %xmm4, %xmm1, %xmm3
-; AVX1-NEXT: vpcmpgtq %xmm2, %xmm3, %xmm2
-; AVX1-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
-; AVX1-NEXT: vxorpd %xmm4, %xmm0, %xmm1
-; AVX1-NEXT: vpcmpgtq %xmm6, %xmm1, %xmm1
-; AVX1-NEXT: vblendvpd %xmm1, %xmm5, %xmm0, %xmm0
-; AVX1-NEXT: vxorpd %xmm4, %xmm0, %xmm1
-; AVX1-NEXT: vshufps {{.*#+}} xmm2 = xmm0[2,3,2,3]
-; AVX1-NEXT: vxorpd %xmm4, %xmm2, %xmm3
-; AVX1-NEXT: vpcmpgtq %xmm1, %xmm3, %xmm1
-; AVX1-NEXT: vblendvpd %xmm1, %xmm0, %xmm2, %xmm0
-; AVX1-NEXT: vmovq %xmm0, %rax
-; AVX1-NEXT: vzeroupper
-; AVX1-NEXT: retq
-;
-; AVX2-LABEL: test_v16i64:
-; AVX2: # %bb.0:
-; AVX2-NEXT: vpbroadcastq {{.*#+}} ymm4 = [9223372036854775808,9223372036854775808,9223372036854775808,9223372036854775808]
-; AVX2-NEXT: vpxor %ymm4, %ymm0, %ymm5
-; AVX2-NEXT: vpxor %ymm4, %ymm2, %ymm6
-; AVX2-NEXT: vpcmpgtq %ymm5, %ymm6, %ymm5
-; AVX2-NEXT: vblendvpd %ymm5, %ymm0, %ymm2, %ymm0
-; AVX2-NEXT: vxorpd %ymm4, %ymm0, %ymm2
-; AVX2-NEXT: vpxor %ymm4, %ymm1, %ymm5
-; AVX2-NEXT: vpxor %ymm4, %ymm3, %ymm6
-; AVX2-NEXT: vpcmpgtq %ymm5, %ymm6, %ymm5
-; AVX2-NEXT: vblendvpd %ymm5, %ymm1, %ymm3, %ymm1
-; AVX2-NEXT: vxorpd %ymm4, %ymm1, %ymm3
-; AVX2-NEXT: vpcmpgtq %ymm2, %ymm3, %ymm2
-; AVX2-NEXT: vblendvpd %ymm2, %ymm0, %ymm1, %ymm0
-; AVX2-NEXT: vxorpd %xmm4, %xmm0, %xmm1
-; AVX2-NEXT: vextractf128 $1, %ymm0, %xmm2
-; AVX2-NEXT: vxorpd %xmm4, %xmm2, %xmm3
-; AVX2-NEXT: vpcmpgtq %xmm1, %xmm3, %xmm1
-; AVX2-NEXT: vblendvpd %xmm1, %xmm0, %xmm2, %xmm0
-; AVX2-NEXT: vxorpd %xmm4, %xmm0, %xmm1
-; AVX2-NEXT: vshufps {{.*#+}} xmm2 = xmm0[2,3,2,3]
-; AVX2-NEXT: vxorpd %xmm4, %xmm2, %xmm3
-; AVX2-NEXT: vpcmpgtq %xmm1, %xmm3, %xmm1
-; AVX2-NEXT: vblendvpd %xmm1, %xmm0, %xmm2, %xmm0
-; AVX2-NEXT: vmovq %xmm0, %rax
-; AVX2-NEXT: vzeroupper
-; AVX2-NEXT: retq
+define i64 @test_v16i64(<16 x i64> %a0) nounwind {
+; X86-SSE2-LABEL: test_v16i64:
+; X86-SSE2: # %bb.0:
+; X86-SSE2-NEXT: pushl %ebp
+; X86-SSE2-NEXT: movl %esp, %ebp
+; X86-SSE2-NEXT: andl $-16, %esp
+; X86-SSE2-NEXT: subl $48, %esp
+; X86-SSE2-NEXT: movaps %xmm1, (%esp) # 16-byte Spill
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X86-SSE2-NEXT: movdqa 56(%ebp), %xmm5
+; X86-SSE2-NEXT: movdqa {{.*#+}} xmm3 = [2147483648,2147483648,2147483648,2147483648]
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm4
+; X86-SSE2-NEXT: pxor %xmm3, %xmm4
+; X86-SSE2-NEXT: movdqa %xmm5, %xmm6
+; X86-SSE2-NEXT: pxor %xmm3, %xmm6
+; X86-SSE2-NEXT: movdqa %xmm6, %xmm7
+; X86-SSE2-NEXT: pcmpgtd %xmm4, %xmm7
+; X86-SSE2-NEXT: pcmpeqd %xmm4, %xmm6
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm4 = xmm7[0,0,2,2]
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm6[1,1,3,3]
+; X86-SSE2-NEXT: pand %xmm4, %xmm0
+; X86-SSE2-NEXT: movdqa 24(%ebp), %xmm6
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm4 = xmm7[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm0, %xmm4
+; X86-SSE2-NEXT: pand %xmm4, %xmm2
+; X86-SSE2-NEXT: pandn %xmm5, %xmm4
+; X86-SSE2-NEXT: por %xmm2, %xmm4
+; X86-SSE2-NEXT: movdqa %xmm4, {{[-0-9]+}}(%e{{[sb]}}p) # 16-byte Spill
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE2-NEXT: pxor %xmm3, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm6, %xmm2
+; X86-SSE2-NEXT: pxor %xmm3, %xmm2
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm7
+; X86-SSE2-NEXT: pcmpgtd %xmm0, %xmm7
+; X86-SSE2-NEXT: pcmpeqd %xmm0, %xmm2
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm5 = xmm7[0,0,2,2]
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,3,3]
+; X86-SSE2-NEXT: pand %xmm5, %xmm0
+; X86-SSE2-NEXT: movdqa 72(%ebp), %xmm5
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm7[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm0, %xmm2
+; X86-SSE2-NEXT: movdqa 8(%ebp), %xmm7
+; X86-SSE2-NEXT: pand %xmm2, %xmm1
+; X86-SSE2-NEXT: pandn %xmm6, %xmm2
+; X86-SSE2-NEXT: por %xmm1, %xmm2
+; X86-SSE2-NEXT: movdqa %xmm7, %xmm0
+; X86-SSE2-NEXT: pxor %xmm3, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm5, %xmm1
+; X86-SSE2-NEXT: pxor %xmm3, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm6
+; X86-SSE2-NEXT: pcmpgtd %xmm0, %xmm6
+; X86-SSE2-NEXT: pcmpeqd %xmm0, %xmm1
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm1[1,1,3,3]
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm6[0,0,2,2]
+; X86-SSE2-NEXT: pand %xmm0, %xmm1
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm6[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm1, %xmm0
+; X86-SSE2-NEXT: movdqa 40(%ebp), %xmm6
+; X86-SSE2-NEXT: pand %xmm0, %xmm7
+; X86-SSE2-NEXT: pandn %xmm5, %xmm0
+; X86-SSE2-NEXT: por %xmm7, %xmm0
+; X86-SSE2-NEXT: movdqa (%esp), %xmm4 # 16-byte Reload
+; X86-SSE2-NEXT: movdqa %xmm4, %xmm1
+; X86-SSE2-NEXT: pxor %xmm3, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm6, %xmm5
+; X86-SSE2-NEXT: pxor %xmm3, %xmm5
+; X86-SSE2-NEXT: movdqa %xmm5, %xmm7
+; X86-SSE2-NEXT: pcmpgtd %xmm1, %xmm7
+; X86-SSE2-NEXT: pcmpeqd %xmm1, %xmm5
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm5[1,1,3,3]
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm5 = xmm7[0,0,2,2]
+; X86-SSE2-NEXT: pand %xmm5, %xmm1
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm5 = xmm7[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm1, %xmm5
+; X86-SSE2-NEXT: pand %xmm5, %xmm4
+; X86-SSE2-NEXT: pandn %xmm6, %xmm5
+; X86-SSE2-NEXT: por %xmm4, %xmm5
+; X86-SSE2-NEXT: movdqa %xmm5, %xmm1
+; X86-SSE2-NEXT: pxor %xmm3, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm6
+; X86-SSE2-NEXT: pxor %xmm3, %xmm6
+; X86-SSE2-NEXT: movdqa %xmm6, %xmm7
+; X86-SSE2-NEXT: pcmpgtd %xmm1, %xmm7
+; X86-SSE2-NEXT: pcmpeqd %xmm1, %xmm6
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm7[0,0,2,2]
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm6 = xmm6[1,1,3,3]
+; X86-SSE2-NEXT: pand %xmm1, %xmm6
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm7[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm6, %xmm1
+; X86-SSE2-NEXT: pand %xmm1, %xmm5
+; X86-SSE2-NEXT: pandn %xmm0, %xmm1
+; X86-SSE2-NEXT: por %xmm5, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm0
+; X86-SSE2-NEXT: pxor %xmm3, %xmm0
+; X86-SSE2-NEXT: movdqa {{[-0-9]+}}(%e{{[sb]}}p), %xmm4 # 16-byte Reload
+; X86-SSE2-NEXT: movdqa %xmm4, %xmm5
+; X86-SSE2-NEXT: pxor %xmm3, %xmm5
+; X86-SSE2-NEXT: movdqa %xmm5, %xmm6
+; X86-SSE2-NEXT: pcmpgtd %xmm0, %xmm6
+; X86-SSE2-NEXT: pcmpeqd %xmm0, %xmm5
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm6[0,0,2,2]
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm7 = xmm5[1,1,3,3]
+; X86-SSE2-NEXT: pand %xmm0, %xmm7
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm5 = xmm6[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm7, %xmm5
+; X86-SSE2-NEXT: pand %xmm5, %xmm2
+; X86-SSE2-NEXT: pandn %xmm4, %xmm5
+; X86-SSE2-NEXT: por %xmm2, %xmm5
+; X86-SSE2-NEXT: movdqa %xmm5, %xmm0
+; X86-SSE2-NEXT: pxor %xmm3, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm2
+; X86-SSE2-NEXT: pxor %xmm3, %xmm2
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm4
+; X86-SSE2-NEXT: pcmpgtd %xmm0, %xmm4
+; X86-SSE2-NEXT: pcmpeqd %xmm0, %xmm2
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm4[0,0,2,2]
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm2[1,1,3,3]
+; X86-SSE2-NEXT: pand %xmm0, %xmm2
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm4[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm2, %xmm0
+; X86-SSE2-NEXT: pand %xmm0, %xmm5
+; X86-SSE2-NEXT: pandn %xmm1, %xmm0
+; X86-SSE2-NEXT: por %xmm5, %xmm0
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE2-NEXT: pxor %xmm3, %xmm2
+; X86-SSE2-NEXT: pxor %xmm1, %xmm3
+; X86-SSE2-NEXT: movdqa %xmm3, %xmm4
+; X86-SSE2-NEXT: pcmpgtd %xmm2, %xmm4
+; X86-SSE2-NEXT: pcmpeqd %xmm2, %xmm3
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm4[0,0,2,2]
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm3 = xmm3[1,1,3,3]
+; X86-SSE2-NEXT: pand %xmm2, %xmm3
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm4[1,1,3,3]
+; X86-SSE2-NEXT: por %xmm3, %xmm2
+; X86-SSE2-NEXT: pand %xmm2, %xmm0
+; X86-SSE2-NEXT: pandn %xmm1, %xmm2
+; X86-SSE2-NEXT: por %xmm0, %xmm2
+; X86-SSE2-NEXT: movd %xmm2, %eax
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,1,1]
+; X86-SSE2-NEXT: movd %xmm0, %edx
+; X86-SSE2-NEXT: movl %ebp, %esp
+; X86-SSE2-NEXT: popl %ebp
+; X86-SSE2-NEXT: retl
+;
+; X64-SSE2-LABEL: test_v16i64:
+; X64-SSE2: # %bb.0:
+; X64-SSE2-NEXT: movdqa {{.*#+}} xmm8 = [9223372039002259456,9223372039002259456]
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm9
+; X64-SSE2-NEXT: pxor %xmm8, %xmm9
+; X64-SSE2-NEXT: movdqa %xmm4, %xmm10
+; X64-SSE2-NEXT: pxor %xmm8, %xmm10
+; X64-SSE2-NEXT: movdqa %xmm10, %xmm11
+; X64-SSE2-NEXT: pcmpgtd %xmm9, %xmm11
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm12 = xmm11[0,0,2,2]
+; X64-SSE2-NEXT: pcmpeqd %xmm9, %xmm10
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm10 = xmm10[1,1,3,3]
+; X64-SSE2-NEXT: pand %xmm12, %xmm10
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm9 = xmm11[1,1,3,3]
+; X64-SSE2-NEXT: por %xmm10, %xmm9
+; X64-SSE2-NEXT: pand %xmm9, %xmm0
+; X64-SSE2-NEXT: pandn %xmm4, %xmm9
+; X64-SSE2-NEXT: por %xmm0, %xmm9
+; X64-SSE2-NEXT: movdqa %xmm9, %xmm0
+; X64-SSE2-NEXT: pxor %xmm8, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm2, %xmm4
+; X64-SSE2-NEXT: pxor %xmm8, %xmm4
+; X64-SSE2-NEXT: movdqa %xmm6, %xmm10
+; X64-SSE2-NEXT: pxor %xmm8, %xmm10
+; X64-SSE2-NEXT: movdqa %xmm10, %xmm11
+; X64-SSE2-NEXT: pcmpgtd %xmm4, %xmm11
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm12 = xmm11[0,0,2,2]
+; X64-SSE2-NEXT: pcmpeqd %xmm4, %xmm10
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm4 = xmm10[1,1,3,3]
+; X64-SSE2-NEXT: pand %xmm12, %xmm4
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm10 = xmm11[1,1,3,3]
+; X64-SSE2-NEXT: por %xmm4, %xmm10
+; X64-SSE2-NEXT: pand %xmm10, %xmm2
+; X64-SSE2-NEXT: pandn %xmm6, %xmm10
+; X64-SSE2-NEXT: por %xmm2, %xmm10
+; X64-SSE2-NEXT: movdqa %xmm10, %xmm2
+; X64-SSE2-NEXT: pxor %xmm8, %xmm2
+; X64-SSE2-NEXT: movdqa %xmm2, %xmm4
+; X64-SSE2-NEXT: pcmpgtd %xmm0, %xmm4
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm6 = xmm4[0,0,2,2]
+; X64-SSE2-NEXT: pcmpeqd %xmm0, %xmm2
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm2[1,1,3,3]
+; X64-SSE2-NEXT: pand %xmm6, %xmm2
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm4[1,1,3,3]
+; X64-SSE2-NEXT: por %xmm2, %xmm0
+; X64-SSE2-NEXT: pand %xmm0, %xmm9
+; X64-SSE2-NEXT: pandn %xmm10, %xmm0
+; X64-SSE2-NEXT: por %xmm9, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X64-SSE2-NEXT: pxor %xmm8, %xmm2
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm4
+; X64-SSE2-NEXT: pxor %xmm8, %xmm4
+; X64-SSE2-NEXT: movdqa %xmm5, %xmm6
+; X64-SSE2-NEXT: pxor %xmm8, %xmm6
+; X64-SSE2-NEXT: movdqa %xmm6, %xmm9
+; X64-SSE2-NEXT: pcmpgtd %xmm4, %xmm9
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm10 = xmm9[0,0,2,2]
+; X64-SSE2-NEXT: pcmpeqd %xmm4, %xmm6
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm6 = xmm6[1,1,3,3]
+; X64-SSE2-NEXT: pand %xmm10, %xmm6
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm4 = xmm9[1,1,3,3]
+; X64-SSE2-NEXT: por %xmm6, %xmm4
+; X64-SSE2-NEXT: pand %xmm4, %xmm1
+; X64-SSE2-NEXT: pandn %xmm5, %xmm4
+; X64-SSE2-NEXT: por %xmm1, %xmm4
+; X64-SSE2-NEXT: movdqa %xmm4, %xmm1
+; X64-SSE2-NEXT: pxor %xmm8, %xmm1
+; X64-SSE2-NEXT: movdqa %xmm3, %xmm5
+; X64-SSE2-NEXT: pxor %xmm8, %xmm5
+; X64-SSE2-NEXT: movdqa %xmm7, %xmm6
+; X64-SSE2-NEXT: pxor %xmm8, %xmm6
+; X64-SSE2-NEXT: movdqa %xmm6, %xmm9
+; X64-SSE2-NEXT: pcmpgtd %xmm5, %xmm9
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm10 = xmm9[0,0,2,2]
+; X64-SSE2-NEXT: pcmpeqd %xmm5, %xmm6
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm5 = xmm6[1,1,3,3]
+; X64-SSE2-NEXT: pand %xmm10, %xmm5
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm6 = xmm9[1,1,3,3]
+; X64-SSE2-NEXT: por %xmm5, %xmm6
+; X64-SSE2-NEXT: pand %xmm6, %xmm3
+; X64-SSE2-NEXT: pandn %xmm7, %xmm6
+; X64-SSE2-NEXT: por %xmm3, %xmm6
+; X64-SSE2-NEXT: movdqa %xmm6, %xmm3
+; X64-SSE2-NEXT: pxor %xmm8, %xmm3
+; X64-SSE2-NEXT: movdqa %xmm3, %xmm5
+; X64-SSE2-NEXT: pcmpgtd %xmm1, %xmm5
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm7 = xmm5[0,0,2,2]
+; X64-SSE2-NEXT: pcmpeqd %xmm1, %xmm3
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm3[1,1,3,3]
+; X64-SSE2-NEXT: pand %xmm7, %xmm1
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm3 = xmm5[1,1,3,3]
+; X64-SSE2-NEXT: por %xmm1, %xmm3
+; X64-SSE2-NEXT: pand %xmm3, %xmm4
+; X64-SSE2-NEXT: pandn %xmm6, %xmm3
+; X64-SSE2-NEXT: por %xmm4, %xmm3
+; X64-SSE2-NEXT: pxor %xmm3, %xmm8
+; X64-SSE2-NEXT: movdqa %xmm8, %xmm1
+; X64-SSE2-NEXT: pcmpgtd %xmm2, %xmm1
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm4 = xmm1[0,0,2,2]
+; X64-SSE2-NEXT: pcmpeqd %xmm2, %xmm8
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm8[1,1,3,3]
+; X64-SSE2-NEXT: pand %xmm4, %xmm2
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm1[1,1,3,3]
+; X64-SSE2-NEXT: por %xmm2, %xmm1
+; X64-SSE2-NEXT: pand %xmm1, %xmm0
+; X64-SSE2-NEXT: pandn %xmm3, %xmm1
+; X64-SSE2-NEXT: por %xmm0, %xmm1
+; X64-SSE2-NEXT: movq %xmm1, %rcx
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
+; X64-SSE2-NEXT: movq %xmm0, %rax
+; X64-SSE2-NEXT: cmpq %rax, %rcx
+; X64-SSE2-NEXT: cmovbq %rcx, %rax
+; X64-SSE2-NEXT: retq
+;
+; X86-SSE41-LABEL: test_v16i64:
+; X86-SSE41: # %bb.0:
+; X86-SSE41-NEXT: pushl %ebp
+; X86-SSE41-NEXT: movl %esp, %ebp
+; X86-SSE41-NEXT: andl $-16, %esp
+; X86-SSE41-NEXT: subl $48, %esp
+; X86-SSE41-NEXT: movaps %xmm1, (%esp) # 16-byte Spill
+; X86-SSE41-NEXT: movdqa %xmm0, %xmm3
+; X86-SSE41-NEXT: movdqa 56(%ebp), %xmm1
+; X86-SSE41-NEXT: movdqa {{.*#+}} xmm4 = [2147483648,2147483648,2147483648,2147483648]
+; X86-SSE41-NEXT: movdqa %xmm2, %xmm0
+; X86-SSE41-NEXT: pxor %xmm4, %xmm0
+; X86-SSE41-NEXT: movdqa %xmm1, %xmm6
+; X86-SSE41-NEXT: movdqa %xmm1, %xmm5
+; X86-SSE41-NEXT: pxor %xmm4, %xmm6
+; X86-SSE41-NEXT: movdqa %xmm6, %xmm7
+; X86-SSE41-NEXT: pcmpgtd %xmm0, %xmm7
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm6
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm7[0,0,2,2]
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm6[1,1,3,3]
+; X86-SSE41-NEXT: pand %xmm0, %xmm1
+; X86-SSE41-NEXT: movdqa 24(%ebp), %xmm6
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm7[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm1, %xmm0
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm2, %xmm5
+; X86-SSE41-NEXT: movapd %xmm5, {{[-0-9]+}}(%e{{[sb]}}p) # 16-byte Spill
+; X86-SSE41-NEXT: movdqa %xmm3, %xmm0
+; X86-SSE41-NEXT: pxor %xmm4, %xmm0
+; X86-SSE41-NEXT: movdqa %xmm6, %xmm1
+; X86-SSE41-NEXT: pxor %xmm4, %xmm1
+; X86-SSE41-NEXT: movdqa %xmm1, %xmm7
+; X86-SSE41-NEXT: pcmpgtd %xmm0, %xmm7
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm1
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm7[0,0,2,2]
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm1[1,1,3,3]
+; X86-SSE41-NEXT: pand %xmm0, %xmm1
+; X86-SSE41-NEXT: movdqa 72(%ebp), %xmm2
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm7[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm1, %xmm0
+; X86-SSE41-NEXT: movdqa 8(%ebp), %xmm7
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm3, %xmm6
+; X86-SSE41-NEXT: movdqa %xmm7, %xmm0
+; X86-SSE41-NEXT: pxor %xmm4, %xmm0
+; X86-SSE41-NEXT: movdqa %xmm2, %xmm1
+; X86-SSE41-NEXT: pxor %xmm4, %xmm1
+; X86-SSE41-NEXT: movdqa %xmm1, %xmm3
+; X86-SSE41-NEXT: pcmpgtd %xmm0, %xmm3
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm1
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm1[1,1,3,3]
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm3[0,0,2,2]
+; X86-SSE41-NEXT: pand %xmm0, %xmm1
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm3[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm1, %xmm0
+; X86-SSE41-NEXT: movdqa 40(%ebp), %xmm3
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm7, %xmm2
+; X86-SSE41-NEXT: movdqa (%esp), %xmm5 # 16-byte Reload
+; X86-SSE41-NEXT: movdqa %xmm5, %xmm0
+; X86-SSE41-NEXT: pxor %xmm4, %xmm0
+; X86-SSE41-NEXT: movdqa %xmm3, %xmm1
+; X86-SSE41-NEXT: pxor %xmm4, %xmm1
+; X86-SSE41-NEXT: movdqa %xmm1, %xmm7
+; X86-SSE41-NEXT: pcmpgtd %xmm0, %xmm7
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm1
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm1[1,1,3,3]
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm7[0,0,2,2]
+; X86-SSE41-NEXT: pand %xmm0, %xmm1
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm7[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm1, %xmm0
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm5, %xmm3
+; X86-SSE41-NEXT: movapd %xmm3, %xmm0
+; X86-SSE41-NEXT: xorpd %xmm4, %xmm0
+; X86-SSE41-NEXT: movapd %xmm2, %xmm1
+; X86-SSE41-NEXT: xorpd %xmm4, %xmm1
+; X86-SSE41-NEXT: movapd %xmm1, %xmm7
+; X86-SSE41-NEXT: pcmpgtd %xmm0, %xmm7
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm1
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm7[0,0,2,2]
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm1[1,1,3,3]
+; X86-SSE41-NEXT: pand %xmm0, %xmm1
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm7[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm1, %xmm0
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm3, %xmm2
+; X86-SSE41-NEXT: movapd %xmm6, %xmm0
+; X86-SSE41-NEXT: xorpd %xmm4, %xmm0
+; X86-SSE41-NEXT: movdqa {{[-0-9]+}}(%e{{[sb]}}p), %xmm5 # 16-byte Reload
+; X86-SSE41-NEXT: movdqa %xmm5, %xmm1
+; X86-SSE41-NEXT: pxor %xmm4, %xmm1
+; X86-SSE41-NEXT: movdqa %xmm1, %xmm3
+; X86-SSE41-NEXT: pcmpgtd %xmm0, %xmm3
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm1
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm3[0,0,2,2]
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm1[1,1,3,3]
+; X86-SSE41-NEXT: pand %xmm0, %xmm1
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm3[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm1, %xmm0
+; X86-SSE41-NEXT: movdqa %xmm5, %xmm1
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm6, %xmm1
+; X86-SSE41-NEXT: movapd %xmm1, %xmm0
+; X86-SSE41-NEXT: movapd %xmm1, %xmm5
+; X86-SSE41-NEXT: xorpd %xmm4, %xmm0
+; X86-SSE41-NEXT: movapd %xmm2, %xmm1
+; X86-SSE41-NEXT: xorpd %xmm4, %xmm1
+; X86-SSE41-NEXT: movapd %xmm1, %xmm3
+; X86-SSE41-NEXT: pcmpgtd %xmm0, %xmm3
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm1
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm3[0,0,2,2]
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm1[1,1,3,3]
+; X86-SSE41-NEXT: pand %xmm0, %xmm1
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm3[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm1, %xmm0
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm5, %xmm2
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm2[2,3,2,3]
+; X86-SSE41-NEXT: movdqa %xmm2, %xmm0
+; X86-SSE41-NEXT: pxor %xmm4, %xmm0
+; X86-SSE41-NEXT: pxor %xmm1, %xmm4
+; X86-SSE41-NEXT: movdqa %xmm4, %xmm3
+; X86-SSE41-NEXT: pcmpgtd %xmm0, %xmm3
+; X86-SSE41-NEXT: pcmpeqd %xmm0, %xmm4
+; X86-SSE41-NEXT: pmovsxdq %xmm3, %xmm0
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm4 = xmm4[1,1,3,3]
+; X86-SSE41-NEXT: pand %xmm0, %xmm4
+; X86-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm3[1,1,3,3]
+; X86-SSE41-NEXT: por %xmm4, %xmm0
+; X86-SSE41-NEXT: blendvpd %xmm0, %xmm2, %xmm1
+; X86-SSE41-NEXT: movd %xmm1, %eax
+; X86-SSE41-NEXT: pextrd $1, %xmm1, %edx
+; X86-SSE41-NEXT: movl %ebp, %esp
+; X86-SSE41-NEXT: popl %ebp
+; X86-SSE41-NEXT: retl
+;
+; X64-SSE41-LABEL: test_v16i64:
+; X64-SSE41: # %bb.0:
+; X64-SSE41-NEXT: movdqa %xmm0, %xmm8
+; X64-SSE41-NEXT: movdqa {{.*#+}} xmm9 = [9223372039002259456,9223372039002259456]
+; X64-SSE41-NEXT: pxor %xmm9, %xmm0
+; X64-SSE41-NEXT: movdqa %xmm4, %xmm10
+; X64-SSE41-NEXT: pxor %xmm9, %xmm10
+; X64-SSE41-NEXT: movdqa %xmm10, %xmm11
+; X64-SSE41-NEXT: pcmpgtd %xmm0, %xmm11
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm12 = xmm11[0,0,2,2]
+; X64-SSE41-NEXT: pcmpeqd %xmm0, %xmm10
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm10 = xmm10[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm12, %xmm10
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm11[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm10, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm8, %xmm4
+; X64-SSE41-NEXT: movapd %xmm4, %xmm8
+; X64-SSE41-NEXT: xorpd %xmm9, %xmm8
+; X64-SSE41-NEXT: movdqa %xmm2, %xmm0
+; X64-SSE41-NEXT: pxor %xmm9, %xmm0
+; X64-SSE41-NEXT: movdqa %xmm6, %xmm10
+; X64-SSE41-NEXT: pxor %xmm9, %xmm10
+; X64-SSE41-NEXT: movdqa %xmm10, %xmm11
+; X64-SSE41-NEXT: pcmpgtd %xmm0, %xmm11
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm12 = xmm11[0,0,2,2]
+; X64-SSE41-NEXT: pcmpeqd %xmm0, %xmm10
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm10 = xmm10[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm12, %xmm10
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm11[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm10, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm2, %xmm6
+; X64-SSE41-NEXT: movapd %xmm6, %xmm0
+; X64-SSE41-NEXT: xorpd %xmm9, %xmm0
+; X64-SSE41-NEXT: movapd %xmm0, %xmm2
+; X64-SSE41-NEXT: pcmpgtd %xmm8, %xmm2
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm10 = xmm2[0,0,2,2]
+; X64-SSE41-NEXT: pcmpeqd %xmm8, %xmm0
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm8 = xmm0[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm10, %xmm8
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm8, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm4, %xmm6
+; X64-SSE41-NEXT: movapd %xmm6, %xmm2
+; X64-SSE41-NEXT: xorpd %xmm9, %xmm2
+; X64-SSE41-NEXT: movdqa %xmm1, %xmm0
+; X64-SSE41-NEXT: pxor %xmm9, %xmm0
+; X64-SSE41-NEXT: movdqa %xmm5, %xmm4
+; X64-SSE41-NEXT: pxor %xmm9, %xmm4
+; X64-SSE41-NEXT: movdqa %xmm4, %xmm8
+; X64-SSE41-NEXT: pcmpgtd %xmm0, %xmm8
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm10 = xmm8[0,0,2,2]
+; X64-SSE41-NEXT: pcmpeqd %xmm0, %xmm4
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm4 = xmm4[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm10, %xmm4
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm8[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm4, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm1, %xmm5
+; X64-SSE41-NEXT: movapd %xmm5, %xmm1
+; X64-SSE41-NEXT: xorpd %xmm9, %xmm1
+; X64-SSE41-NEXT: movdqa %xmm3, %xmm0
+; X64-SSE41-NEXT: pxor %xmm9, %xmm0
+; X64-SSE41-NEXT: movdqa %xmm7, %xmm4
+; X64-SSE41-NEXT: pxor %xmm9, %xmm4
+; X64-SSE41-NEXT: movdqa %xmm4, %xmm8
+; X64-SSE41-NEXT: pcmpgtd %xmm0, %xmm8
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm10 = xmm8[0,0,2,2]
+; X64-SSE41-NEXT: pcmpeqd %xmm0, %xmm4
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm4 = xmm4[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm10, %xmm4
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm8[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm4, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm3, %xmm7
+; X64-SSE41-NEXT: movapd %xmm7, %xmm0
+; X64-SSE41-NEXT: xorpd %xmm9, %xmm0
+; X64-SSE41-NEXT: movapd %xmm0, %xmm3
+; X64-SSE41-NEXT: pcmpgtd %xmm1, %xmm3
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm4 = xmm3[0,0,2,2]
+; X64-SSE41-NEXT: pcmpeqd %xmm1, %xmm0
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm4, %xmm1
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm3[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm1, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm5, %xmm7
+; X64-SSE41-NEXT: movapd %xmm7, %xmm0
+; X64-SSE41-NEXT: xorpd %xmm9, %xmm0
+; X64-SSE41-NEXT: movapd %xmm0, %xmm1
+; X64-SSE41-NEXT: pcmpgtd %xmm2, %xmm1
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm3 = xmm1[0,0,2,2]
+; X64-SSE41-NEXT: pcmpeqd %xmm2, %xmm0
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm2 = xmm0[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm3, %xmm2
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm2, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm6, %xmm7
+; X64-SSE41-NEXT: movapd %xmm7, %xmm0
+; X64-SSE41-NEXT: xorpd %xmm9, %xmm0
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm1 = xmm7[2,3,2,3]
+; X64-SSE41-NEXT: pxor %xmm1, %xmm9
+; X64-SSE41-NEXT: movdqa %xmm9, %xmm2
+; X64-SSE41-NEXT: pcmpgtd %xmm0, %xmm2
+; X64-SSE41-NEXT: pmovsxdq %xmm2, %xmm3
+; X64-SSE41-NEXT: pcmpeqd %xmm0, %xmm9
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm4 = xmm9[1,1,3,3]
+; X64-SSE41-NEXT: pand %xmm3, %xmm4
+; X64-SSE41-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,3,3]
+; X64-SSE41-NEXT: por %xmm4, %xmm0
+; X64-SSE41-NEXT: blendvpd %xmm0, %xmm7, %xmm1
+; X64-SSE41-NEXT: movq %xmm1, %rax
+; X64-SSE41-NEXT: retq
+;
+; X86-SSE42-LABEL: test_v16i64:
+; X86-SSE42: # %bb.0:
+; X86-SSE42-NEXT: pushl %ebp
+; X86-SSE42-NEXT: movl %esp, %ebp
+; X86-SSE42-NEXT: andl $-16, %esp
+; X86-SSE42-NEXT: subl $32, %esp
+; X86-SSE42-NEXT: movaps %xmm1, (%esp) # 16-byte Spill
+; X86-SSE42-NEXT: movdqa %xmm0, %xmm3
+; X86-SSE42-NEXT: movdqa 72(%ebp), %xmm5
+; X86-SSE42-NEXT: movdqa 56(%ebp), %xmm6
+; X86-SSE42-NEXT: movdqa {{.*#+}} xmm4 = [0,2147483648,0,2147483648]
+; X86-SSE42-NEXT: movdqa %xmm2, %xmm7
+; X86-SSE42-NEXT: pxor %xmm4, %xmm7
+; X86-SSE42-NEXT: movdqa %xmm6, %xmm0
+; X86-SSE42-NEXT: pxor %xmm4, %xmm0
+; X86-SSE42-NEXT: pcmpgtq %xmm7, %xmm0
+; X86-SSE42-NEXT: movdqa 24(%ebp), %xmm7
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm2, %xmm6
+; X86-SSE42-NEXT: movdqa %xmm3, %xmm2
+; X86-SSE42-NEXT: pxor %xmm4, %xmm2
+; X86-SSE42-NEXT: movdqa %xmm7, %xmm0
+; X86-SSE42-NEXT: pxor %xmm4, %xmm0
+; X86-SSE42-NEXT: pcmpgtq %xmm2, %xmm0
+; X86-SSE42-NEXT: movdqa 8(%ebp), %xmm1
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm3, %xmm7
+; X86-SSE42-NEXT: movdqa %xmm1, %xmm2
+; X86-SSE42-NEXT: pxor %xmm4, %xmm2
+; X86-SSE42-NEXT: movdqa %xmm5, %xmm0
+; X86-SSE42-NEXT: pxor %xmm4, %xmm0
+; X86-SSE42-NEXT: pcmpgtq %xmm2, %xmm0
+; X86-SSE42-NEXT: movdqa 40(%ebp), %xmm2
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm1, %xmm5
+; X86-SSE42-NEXT: movdqa (%esp), %xmm1 # 16-byte Reload
+; X86-SSE42-NEXT: movdqa %xmm1, %xmm3
+; X86-SSE42-NEXT: pxor %xmm4, %xmm3
+; X86-SSE42-NEXT: movdqa %xmm2, %xmm0
+; X86-SSE42-NEXT: pxor %xmm4, %xmm0
+; X86-SSE42-NEXT: pcmpgtq %xmm3, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm1, %xmm2
+; X86-SSE42-NEXT: movapd %xmm2, %xmm1
+; X86-SSE42-NEXT: xorpd %xmm4, %xmm1
+; X86-SSE42-NEXT: movapd %xmm5, %xmm0
+; X86-SSE42-NEXT: xorpd %xmm4, %xmm0
+; X86-SSE42-NEXT: pcmpgtq %xmm1, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm2, %xmm5
+; X86-SSE42-NEXT: movapd %xmm7, %xmm1
+; X86-SSE42-NEXT: xorpd %xmm4, %xmm1
+; X86-SSE42-NEXT: movapd %xmm6, %xmm0
+; X86-SSE42-NEXT: xorpd %xmm4, %xmm0
+; X86-SSE42-NEXT: pcmpgtq %xmm1, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm7, %xmm6
+; X86-SSE42-NEXT: movapd %xmm6, %xmm1
+; X86-SSE42-NEXT: xorpd %xmm4, %xmm1
+; X86-SSE42-NEXT: movapd %xmm5, %xmm0
+; X86-SSE42-NEXT: xorpd %xmm4, %xmm0
+; X86-SSE42-NEXT: pcmpgtq %xmm1, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm6, %xmm5
+; X86-SSE42-NEXT: pshufd {{.*#+}} xmm1 = xmm5[2,3,2,3]
+; X86-SSE42-NEXT: movdqa %xmm5, %xmm0
+; X86-SSE42-NEXT: pxor %xmm4, %xmm0
+; X86-SSE42-NEXT: pxor %xmm1, %xmm4
+; X86-SSE42-NEXT: pcmpgtq %xmm0, %xmm4
+; X86-SSE42-NEXT: movdqa %xmm4, %xmm0
+; X86-SSE42-NEXT: blendvpd %xmm0, %xmm5, %xmm1
+; X86-SSE42-NEXT: movd %xmm1, %eax
+; X86-SSE42-NEXT: pextrd $1, %xmm1, %edx
+; X86-SSE42-NEXT: movl %ebp, %esp
+; X86-SSE42-NEXT: popl %ebp
+; X86-SSE42-NEXT: retl
+;
+; X64-SSE42-LABEL: test_v16i64:
+; X64-SSE42: # %bb.0:
+; X64-SSE42-NEXT: movdqa %xmm0, %xmm9
+; X64-SSE42-NEXT: movdqa {{.*#+}} xmm8 = [9223372036854775808,9223372036854775808]
+; X64-SSE42-NEXT: movdqa %xmm0, %xmm10
+; X64-SSE42-NEXT: pxor %xmm8, %xmm10
+; X64-SSE42-NEXT: movdqa %xmm4, %xmm0
+; X64-SSE42-NEXT: pxor %xmm8, %xmm0
+; X64-SSE42-NEXT: pcmpgtq %xmm10, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm9, %xmm4
+; X64-SSE42-NEXT: movapd %xmm4, %xmm9
+; X64-SSE42-NEXT: xorpd %xmm8, %xmm9
+; X64-SSE42-NEXT: movdqa %xmm2, %xmm10
+; X64-SSE42-NEXT: pxor %xmm8, %xmm10
+; X64-SSE42-NEXT: movdqa %xmm6, %xmm0
+; X64-SSE42-NEXT: pxor %xmm8, %xmm0
+; X64-SSE42-NEXT: pcmpgtq %xmm10, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm2, %xmm6
+; X64-SSE42-NEXT: movapd %xmm6, %xmm0
+; X64-SSE42-NEXT: xorpd %xmm8, %xmm0
+; X64-SSE42-NEXT: pcmpgtq %xmm9, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm4, %xmm6
+; X64-SSE42-NEXT: movapd %xmm6, %xmm2
+; X64-SSE42-NEXT: xorpd %xmm8, %xmm2
+; X64-SSE42-NEXT: movdqa %xmm1, %xmm4
+; X64-SSE42-NEXT: pxor %xmm8, %xmm4
+; X64-SSE42-NEXT: movdqa %xmm5, %xmm0
+; X64-SSE42-NEXT: pxor %xmm8, %xmm0
+; X64-SSE42-NEXT: pcmpgtq %xmm4, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm1, %xmm5
+; X64-SSE42-NEXT: movapd %xmm5, %xmm1
+; X64-SSE42-NEXT: xorpd %xmm8, %xmm1
+; X64-SSE42-NEXT: movdqa %xmm3, %xmm4
+; X64-SSE42-NEXT: pxor %xmm8, %xmm4
+; X64-SSE42-NEXT: movdqa %xmm7, %xmm0
+; X64-SSE42-NEXT: pxor %xmm8, %xmm0
+; X64-SSE42-NEXT: pcmpgtq %xmm4, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm3, %xmm7
+; X64-SSE42-NEXT: movapd %xmm7, %xmm0
+; X64-SSE42-NEXT: xorpd %xmm8, %xmm0
+; X64-SSE42-NEXT: pcmpgtq %xmm1, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm5, %xmm7
+; X64-SSE42-NEXT: movapd %xmm7, %xmm0
+; X64-SSE42-NEXT: xorpd %xmm8, %xmm0
+; X64-SSE42-NEXT: pcmpgtq %xmm2, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm6, %xmm7
+; X64-SSE42-NEXT: movapd %xmm7, %xmm0
+; X64-SSE42-NEXT: xorpd %xmm8, %xmm0
+; X64-SSE42-NEXT: pshufd {{.*#+}} xmm1 = xmm7[2,3,2,3]
+; X64-SSE42-NEXT: pxor %xmm1, %xmm8
+; X64-SSE42-NEXT: pcmpgtq %xmm0, %xmm8
+; X64-SSE42-NEXT: movdqa %xmm8, %xmm0
+; X64-SSE42-NEXT: blendvpd %xmm0, %xmm7, %xmm1
+; X64-SSE42-NEXT: movq %xmm1, %rax
+; X64-SSE42-NEXT: retq
+;
+; X86-AVX1-LABEL: test_v16i64:
+; X86-AVX1: # %bb.0:
+; X86-AVX1-NEXT: pushl %ebp
+; X86-AVX1-NEXT: movl %esp, %ebp
+; X86-AVX1-NEXT: andl $-32, %esp
+; X86-AVX1-NEXT: subl $32, %esp
+; X86-AVX1-NEXT: vmovddup {{.*#+}} xmm3 = [0,2147483648,0,2147483648]
+; X86-AVX1-NEXT: # xmm3 = mem[0,0]
+; X86-AVX1-NEXT: vmovaps 8(%ebp), %xmm4
+; X86-AVX1-NEXT: vxorps %xmm3, %xmm4, %xmm6
+; X86-AVX1-NEXT: vxorps %xmm3, %xmm1, %xmm7
+; X86-AVX1-NEXT: vpcmpgtq %xmm7, %xmm6, %xmm6
+; X86-AVX1-NEXT: vblendvpd %xmm6, %xmm1, %xmm4, %xmm4
+; X86-AVX1-NEXT: vxorps %xmm3, %xmm0, %xmm6
+; X86-AVX1-NEXT: vxorps %xmm3, %xmm2, %xmm7
+; X86-AVX1-NEXT: vpcmpgtq %xmm6, %xmm7, %xmm6
+; X86-AVX1-NEXT: vxorps 24(%ebp), %xmm3, %xmm7
+; X86-AVX1-NEXT: vextractf128 $1, %ymm1, %xmm1
+; X86-AVX1-NEXT: vxorps %xmm3, %xmm1, %xmm5
+; X86-AVX1-NEXT: vpcmpgtq %xmm5, %xmm7, %xmm5
+; X86-AVX1-NEXT: vblendvpd %xmm6, %xmm0, %xmm2, %xmm6
+; X86-AVX1-NEXT: vmovapd 24(%ebp), %xmm7
+; X86-AVX1-NEXT: vblendvpd %xmm5, %xmm1, %xmm7, %xmm1
+; X86-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm0
+; X86-AVX1-NEXT: vxorps %xmm3, %xmm0, %xmm5
+; X86-AVX1-NEXT: vextractf128 $1, %ymm2, %xmm2
+; X86-AVX1-NEXT: vxorps %xmm3, %xmm2, %xmm7
+; X86-AVX1-NEXT: vpcmpgtq %xmm5, %xmm7, %xmm5
+; X86-AVX1-NEXT: vblendvpd %xmm5, %xmm0, %xmm2, %xmm0
+; X86-AVX1-NEXT: vxorpd %xmm3, %xmm0, %xmm2
+; X86-AVX1-NEXT: vxorpd %xmm3, %xmm1, %xmm5
+; X86-AVX1-NEXT: vpcmpgtq %xmm2, %xmm5, %xmm2
+; X86-AVX1-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X86-AVX1-NEXT: vxorpd %xmm3, %xmm6, %xmm1
+; X86-AVX1-NEXT: vxorpd %xmm3, %xmm4, %xmm2
+; X86-AVX1-NEXT: vpcmpgtq %xmm1, %xmm2, %xmm1
+; X86-AVX1-NEXT: vblendvpd %xmm1, %xmm6, %xmm4, %xmm1
+; X86-AVX1-NEXT: vxorpd %xmm3, %xmm1, %xmm2
+; X86-AVX1-NEXT: vxorpd %xmm3, %xmm0, %xmm4
+; X86-AVX1-NEXT: vpcmpgtq %xmm2, %xmm4, %xmm2
+; X86-AVX1-NEXT: vblendvpd %xmm2, %xmm1, %xmm0, %xmm0
+; X86-AVX1-NEXT: vshufps {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-AVX1-NEXT: vxorpd %xmm3, %xmm0, %xmm2
+; X86-AVX1-NEXT: vxorpd %xmm3, %xmm1, %xmm3
+; X86-AVX1-NEXT: vpcmpgtq %xmm2, %xmm3, %xmm2
+; X86-AVX1-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X86-AVX1-NEXT: vmovd %xmm0, %eax
+; X86-AVX1-NEXT: vpextrd $1, %xmm0, %edx
+; X86-AVX1-NEXT: movl %ebp, %esp
+; X86-AVX1-NEXT: popl %ebp
+; X86-AVX1-NEXT: vzeroupper
+; X86-AVX1-NEXT: retl
+;
+; X64-AVX1-LABEL: test_v16i64:
+; X64-AVX1: # %bb.0:
+; X64-AVX1-NEXT: vmovddup {{.*#+}} xmm4 = [9223372036854775808,9223372036854775808]
+; X64-AVX1-NEXT: # xmm4 = mem[0,0]
+; X64-AVX1-NEXT: vpxor %xmm4, %xmm0, %xmm5
+; X64-AVX1-NEXT: vpxor %xmm4, %xmm2, %xmm6
+; X64-AVX1-NEXT: vpcmpgtq %xmm5, %xmm6, %xmm5
+; X64-AVX1-NEXT: vblendvpd %xmm5, %xmm0, %xmm2, %xmm5
+; X64-AVX1-NEXT: vxorpd %xmm4, %xmm5, %xmm6
+; X64-AVX1-NEXT: vpxor %xmm4, %xmm1, %xmm7
+; X64-AVX1-NEXT: vpxor %xmm4, %xmm3, %xmm8
+; X64-AVX1-NEXT: vpcmpgtq %xmm7, %xmm8, %xmm7
+; X64-AVX1-NEXT: vblendvpd %xmm7, %xmm1, %xmm3, %xmm7
+; X64-AVX1-NEXT: vxorpd %xmm4, %xmm7, %xmm8
+; X64-AVX1-NEXT: vpcmpgtq %xmm6, %xmm8, %xmm6
+; X64-AVX1-NEXT: vblendvpd %xmm6, %xmm5, %xmm7, %xmm5
+; X64-AVX1-NEXT: vxorpd %xmm4, %xmm5, %xmm6
+; X64-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm0
+; X64-AVX1-NEXT: vpxor %xmm4, %xmm0, %xmm7
+; X64-AVX1-NEXT: vextractf128 $1, %ymm2, %xmm2
+; X64-AVX1-NEXT: vpxor %xmm4, %xmm2, %xmm8
+; X64-AVX1-NEXT: vpcmpgtq %xmm7, %xmm8, %xmm7
+; X64-AVX1-NEXT: vblendvpd %xmm7, %xmm0, %xmm2, %xmm0
+; X64-AVX1-NEXT: vxorpd %xmm4, %xmm0, %xmm2
+; X64-AVX1-NEXT: vextractf128 $1, %ymm1, %xmm1
+; X64-AVX1-NEXT: vpxor %xmm4, %xmm1, %xmm7
+; X64-AVX1-NEXT: vextractf128 $1, %ymm3, %xmm3
+; X64-AVX1-NEXT: vpxor %xmm4, %xmm3, %xmm8
+; X64-AVX1-NEXT: vpcmpgtq %xmm7, %xmm8, %xmm7
+; X64-AVX1-NEXT: vblendvpd %xmm7, %xmm1, %xmm3, %xmm1
+; X64-AVX1-NEXT: vxorpd %xmm4, %xmm1, %xmm3
+; X64-AVX1-NEXT: vpcmpgtq %xmm2, %xmm3, %xmm2
+; X64-AVX1-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X64-AVX1-NEXT: vxorpd %xmm4, %xmm0, %xmm1
+; X64-AVX1-NEXT: vpcmpgtq %xmm6, %xmm1, %xmm1
+; X64-AVX1-NEXT: vblendvpd %xmm1, %xmm5, %xmm0, %xmm0
+; X64-AVX1-NEXT: vxorpd %xmm4, %xmm0, %xmm1
+; X64-AVX1-NEXT: vshufps {{.*#+}} xmm2 = xmm0[2,3,2,3]
+; X64-AVX1-NEXT: vxorpd %xmm4, %xmm2, %xmm3
+; X64-AVX1-NEXT: vpcmpgtq %xmm1, %xmm3, %xmm1
+; X64-AVX1-NEXT: vblendvpd %xmm1, %xmm0, %xmm2, %xmm0
+; X64-AVX1-NEXT: vmovq %xmm0, %rax
+; X64-AVX1-NEXT: vzeroupper
+; X64-AVX1-NEXT: retq
+;
+; X86-AVX2-LABEL: test_v16i64:
+; X86-AVX2: # %bb.0:
+; X86-AVX2-NEXT: pushl %ebp
+; X86-AVX2-NEXT: movl %esp, %ebp
+; X86-AVX2-NEXT: andl $-32, %esp
+; X86-AVX2-NEXT: subl $32, %esp
+; X86-AVX2-NEXT: vmovdqa 8(%ebp), %ymm4
+; X86-AVX2-NEXT: vpbroadcastq {{.*#+}} ymm3 = [0,2147483648,0,2147483648,0,2147483648,0,2147483648]
+; X86-AVX2-NEXT: vpxor %ymm3, %ymm1, %ymm5
+; X86-AVX2-NEXT: vpxor %ymm3, %ymm4, %ymm6
+; X86-AVX2-NEXT: vpcmpgtq %ymm5, %ymm6, %ymm5
+; X86-AVX2-NEXT: vblendvpd %ymm5, %ymm1, %ymm4, %ymm1
+; X86-AVX2-NEXT: vpxor %ymm3, %ymm0, %ymm4
+; X86-AVX2-NEXT: vpxor %ymm3, %ymm2, %ymm5
+; X86-AVX2-NEXT: vpcmpgtq %ymm4, %ymm5, %ymm4
+; X86-AVX2-NEXT: vblendvpd %ymm4, %ymm0, %ymm2, %ymm0
+; X86-AVX2-NEXT: vxorpd %ymm3, %ymm0, %ymm2
+; X86-AVX2-NEXT: vxorpd %ymm3, %ymm1, %ymm4
+; X86-AVX2-NEXT: vpcmpgtq %ymm2, %ymm4, %ymm2
+; X86-AVX2-NEXT: vblendvpd %ymm2, %ymm0, %ymm1, %ymm0
+; X86-AVX2-NEXT: vextractf128 $1, %ymm0, %xmm1
+; X86-AVX2-NEXT: vxorpd %xmm3, %xmm0, %xmm2
+; X86-AVX2-NEXT: vxorpd %xmm3, %xmm1, %xmm4
+; X86-AVX2-NEXT: vpcmpgtq %xmm2, %xmm4, %xmm2
+; X86-AVX2-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X86-AVX2-NEXT: vshufps {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-AVX2-NEXT: vxorpd %xmm3, %xmm0, %xmm2
+; X86-AVX2-NEXT: vxorpd %xmm3, %xmm1, %xmm3
+; X86-AVX2-NEXT: vpcmpgtq %xmm2, %xmm3, %xmm2
+; X86-AVX2-NEXT: vblendvpd %xmm2, %xmm0, %xmm1, %xmm0
+; X86-AVX2-NEXT: vmovd %xmm0, %eax
+; X86-AVX2-NEXT: vpextrd $1, %xmm0, %edx
+; X86-AVX2-NEXT: movl %ebp, %esp
+; X86-AVX2-NEXT: popl %ebp
+; X86-AVX2-NEXT: vzeroupper
+; X86-AVX2-NEXT: retl
+;
+; X64-AVX2-LABEL: test_v16i64:
+; X64-AVX2: # %bb.0:
+; X64-AVX2-NEXT: vpbroadcastq {{.*#+}} ymm4 = [9223372036854775808,9223372036854775808,9223372036854775808,9223372036854775808]
+; X64-AVX2-NEXT: vpxor %ymm4, %ymm0, %ymm5
+; X64-AVX2-NEXT: vpxor %ymm4, %ymm2, %ymm6
+; X64-AVX2-NEXT: vpcmpgtq %ymm5, %ymm6, %ymm5
+; X64-AVX2-NEXT: vblendvpd %ymm5, %ymm0, %ymm2, %ymm0
+; X64-AVX2-NEXT: vxorpd %ymm4, %ymm0, %ymm2
+; X64-AVX2-NEXT: vpxor %ymm4, %ymm1, %ymm5
+; X64-AVX2-NEXT: vpxor %ymm4, %ymm3, %ymm6
+; X64-AVX2-NEXT: vpcmpgtq %ymm5, %ymm6, %ymm5
+; X64-AVX2-NEXT: vblendvpd %ymm5, %ymm1, %ymm3, %ymm1
+; X64-AVX2-NEXT: vxorpd %ymm4, %ymm1, %ymm3
+; X64-AVX2-NEXT: vpcmpgtq %ymm2, %ymm3, %ymm2
+; X64-AVX2-NEXT: vblendvpd %ymm2, %ymm0, %ymm1, %ymm0
+; X64-AVX2-NEXT: vxorpd %xmm4, %xmm0, %xmm1
+; X64-AVX2-NEXT: vextractf128 $1, %ymm0, %xmm2
+; X64-AVX2-NEXT: vxorpd %xmm4, %xmm2, %xmm3
+; X64-AVX2-NEXT: vpcmpgtq %xmm1, %xmm3, %xmm1
+; X64-AVX2-NEXT: vblendvpd %xmm1, %xmm0, %xmm2, %xmm0
+; X64-AVX2-NEXT: vxorpd %xmm4, %xmm0, %xmm1
+; X64-AVX2-NEXT: vshufps {{.*#+}} xmm2 = xmm0[2,3,2,3]
+; X64-AVX2-NEXT: vxorpd %xmm4, %xmm2, %xmm3
+; X64-AVX2-NEXT: vpcmpgtq %xmm1, %xmm3, %xmm1
+; X64-AVX2-NEXT: vblendvpd %xmm1, %xmm0, %xmm2, %xmm0
+; X64-AVX2-NEXT: vmovq %xmm0, %rax
+; X64-AVX2-NEXT: vzeroupper
+; X64-AVX2-NEXT: retq
;
; AVX512BW-LABEL: test_v16i64:
; AVX512BW: # %bb.0:
@@ -840,7 +1723,7 @@ define i64 @test_v16i64(<16 x i64> %a0) {
; vXi32
;
-define i32 @test_v2i32(<2 x i32> %a0) {
+define i32 @test_v2i32(<2 x i32> %a0) nounwind {
; SSE2-LABEL: test_v2i32:
; SSE2: # %bb.0:
; SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
@@ -853,33 +1736,26 @@ define i32 @test_v2i32(<2 x i32> %a0) {
; SSE2-NEXT: pandn %xmm1, %xmm2
; SSE2-NEXT: por %xmm0, %xmm2
; SSE2-NEXT: movd %xmm2, %eax
-; SSE2-NEXT: retq
+; SSE2-NEXT: ret{{[l|q]}}
;
; SSE4-LABEL: test_v2i32:
; SSE4: # %bb.0:
; SSE4-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
; SSE4-NEXT: pminud %xmm0, %xmm1
; SSE4-NEXT: movd %xmm1, %eax
-; SSE4-NEXT: retq
+; SSE4-NEXT: ret{{[l|q]}}
;
; AVX-LABEL: test_v2i32:
; AVX: # %bb.0:
; AVX-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
; AVX-NEXT: vpminud %xmm1, %xmm0, %xmm0
; AVX-NEXT: vmovd %xmm0, %eax
-; AVX-NEXT: retq
-;
-; AVX512-LABEL: test_v2i32:
-; AVX512: # %bb.0:
-; AVX512-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
-; AVX512-NEXT: vpminud %xmm1, %xmm0, %xmm0
-; AVX512-NEXT: vmovd %xmm0, %eax
-; AVX512-NEXT: retq
+; AVX-NEXT: ret{{[l|q]}}
%1 = call i32 @llvm.vector.reduce.umin.v2i32(<2 x i32> %a0)
ret i32 %1
}
-define i32 @test_v4i32(<4 x i32> %a0) {
+define i32 @test_v4i32(<4 x i32> %a0) nounwind {
; SSE2-LABEL: test_v4i32:
; SSE2: # %bb.0:
; SSE2-NEXT: movdqa {{.*#+}} xmm1 = [2147483648,2147483648,2147483648,2147483648]
@@ -896,7 +1772,7 @@ define i32 @test_v4i32(<4 x i32> %a0) {
; SSE2-NEXT: movd %xmm0, %eax
; SSE2-NEXT: cmpl %eax, %ecx
; SSE2-NEXT: cmovbl %ecx, %eax
-; SSE2-NEXT: retq
+; SSE2-NEXT: ret{{[l|q]}}
;
; SSE4-LABEL: test_v4i32:
; SSE4: # %bb.0:
@@ -905,7 +1781,7 @@ define i32 @test_v4i32(<4 x i32> %a0) {
; SSE4-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
; SSE4-NEXT: pminud %xmm1, %xmm0
; SSE4-NEXT: movd %xmm0, %eax
-; SSE4-NEXT: retq
+; SSE4-NEXT: ret{{[l|q]}}
;
; AVX-LABEL: test_v4i32:
; AVX: # %bb.0:
@@ -914,46 +1790,63 @@ define i32 @test_v4i32(<4 x i32> %a0) {
; AVX-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
; AVX-NEXT: vpminud %xmm1, %xmm0, %xmm0
; AVX-NEXT: vmovd %xmm0, %eax
-; AVX-NEXT: retq
-;
-; AVX512-LABEL: test_v4i32:
-; AVX512: # %bb.0:
-; AVX512-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
-; AVX512-NEXT: vpminud %xmm1, %xmm0, %xmm0
-; AVX512-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
-; AVX512-NEXT: vpminud %xmm1, %xmm0, %xmm0
-; AVX512-NEXT: vmovd %xmm0, %eax
-; AVX512-NEXT: retq
+; AVX-NEXT: ret{{[l|q]}}
%1 = call i32 @llvm.vector.reduce.umin.v4i32(<4 x i32> %a0)
ret i32 %1
}
-define i32 @test_v8i32(<8 x i32> %a0) {
-; SSE2-LABEL: test_v8i32:
-; SSE2: # %bb.0:
-; SSE2-NEXT: movdqa {{.*#+}} xmm2 = [2147483648,2147483648,2147483648,2147483648]
-; SSE2-NEXT: movdqa %xmm0, %xmm3
-; SSE2-NEXT: pxor %xmm2, %xmm3
-; SSE2-NEXT: movdqa %xmm1, %xmm4
-; SSE2-NEXT: pxor %xmm2, %xmm4
-; SSE2-NEXT: pcmpgtd %xmm3, %xmm4
-; SSE2-NEXT: pand %xmm4, %xmm0
-; SSE2-NEXT: pandn %xmm1, %xmm4
-; SSE2-NEXT: por %xmm0, %xmm4
-; SSE2-NEXT: movdqa %xmm4, %xmm0
-; SSE2-NEXT: pxor %xmm2, %xmm0
-; SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm4[2,3,2,3]
-; SSE2-NEXT: pxor %xmm1, %xmm2
-; SSE2-NEXT: pcmpgtd %xmm0, %xmm2
-; SSE2-NEXT: pand %xmm2, %xmm4
-; SSE2-NEXT: pandn %xmm1, %xmm2
-; SSE2-NEXT: por %xmm4, %xmm2
-; SSE2-NEXT: movd %xmm2, %ecx
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,1,1]
-; SSE2-NEXT: movd %xmm0, %eax
-; SSE2-NEXT: cmpl %eax, %ecx
-; SSE2-NEXT: cmovbl %ecx, %eax
-; SSE2-NEXT: retq
+define i32 @test_v8i32(<8 x i32> %a0) nounwind {
+; X86-SSE2-LABEL: test_v8i32:
+; X86-SSE2: # %bb.0:
+; X86-SSE2-NEXT: movdqa {{.*#+}} xmm2 = [2147483648,2147483648,2147483648,2147483648]
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm4
+; X86-SSE2-NEXT: pxor %xmm2, %xmm4
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm3
+; X86-SSE2-NEXT: pxor %xmm2, %xmm3
+; X86-SSE2-NEXT: pcmpgtd %xmm4, %xmm3
+; X86-SSE2-NEXT: pand %xmm3, %xmm0
+; X86-SSE2-NEXT: pandn %xmm1, %xmm3
+; X86-SSE2-NEXT: por %xmm0, %xmm3
+; X86-SSE2-NEXT: movdqa %xmm3, %xmm0
+; X86-SSE2-NEXT: pxor %xmm2, %xmm0
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm3[2,3,2,3]
+; X86-SSE2-NEXT: pxor %xmm1, %xmm2
+; X86-SSE2-NEXT: pcmpgtd %xmm0, %xmm2
+; X86-SSE2-NEXT: pand %xmm2, %xmm3
+; X86-SSE2-NEXT: pandn %xmm1, %xmm2
+; X86-SSE2-NEXT: por %xmm3, %xmm2
+; X86-SSE2-NEXT: movd %xmm2, %ecx
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,1,1]
+; X86-SSE2-NEXT: movd %xmm0, %eax
+; X86-SSE2-NEXT: cmpl %eax, %ecx
+; X86-SSE2-NEXT: cmovbl %ecx, %eax
+; X86-SSE2-NEXT: retl
+;
+; X64-SSE2-LABEL: test_v8i32:
+; X64-SSE2: # %bb.0:
+; X64-SSE2-NEXT: movdqa {{.*#+}} xmm2 = [2147483648,2147483648,2147483648,2147483648]
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm3
+; X64-SSE2-NEXT: pxor %xmm2, %xmm3
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm4
+; X64-SSE2-NEXT: pxor %xmm2, %xmm4
+; X64-SSE2-NEXT: pcmpgtd %xmm3, %xmm4
+; X64-SSE2-NEXT: pand %xmm4, %xmm0
+; X64-SSE2-NEXT: pandn %xmm1, %xmm4
+; X64-SSE2-NEXT: por %xmm0, %xmm4
+; X64-SSE2-NEXT: movdqa %xmm4, %xmm0
+; X64-SSE2-NEXT: pxor %xmm2, %xmm0
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm4[2,3,2,3]
+; X64-SSE2-NEXT: pxor %xmm1, %xmm2
+; X64-SSE2-NEXT: pcmpgtd %xmm0, %xmm2
+; X64-SSE2-NEXT: pand %xmm2, %xmm4
+; X64-SSE2-NEXT: pandn %xmm1, %xmm2
+; X64-SSE2-NEXT: por %xmm4, %xmm2
+; X64-SSE2-NEXT: movd %xmm2, %ecx
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm2[1,1,1,1]
+; X64-SSE2-NEXT: movd %xmm0, %eax
+; X64-SSE2-NEXT: cmpl %eax, %ecx
+; X64-SSE2-NEXT: cmovbl %ecx, %eax
+; X64-SSE2-NEXT: retq
;
; SSE4-LABEL: test_v8i32:
; SSE4: # %bb.0:
@@ -963,7 +1856,7 @@ define i32 @test_v8i32(<8 x i32> %a0) {
; SSE4-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
; SSE4-NEXT: pminud %xmm1, %xmm0
; SSE4-NEXT: movd %xmm0, %eax
-; SSE4-NEXT: retq
+; SSE4-NEXT: ret{{[l|q]}}
;
; AVX1-LABEL: test_v8i32:
; AVX1: # %bb.0:
@@ -975,7 +1868,7 @@ define i32 @test_v8i32(<8 x i32> %a0) {
; AVX1-NEXT: vpminud %xmm1, %xmm0, %xmm0
; AVX1-NEXT: vmovd %xmm0, %eax
; AVX1-NEXT: vzeroupper
-; AVX1-NEXT: retq
+; AVX1-NEXT: ret{{[l|q]}}
;
; AVX2-LABEL: test_v8i32:
; AVX2: # %bb.0:
@@ -987,7 +1880,7 @@ define i32 @test_v8i32(<8 x i32> %a0) {
; AVX2-NEXT: vpminud %xmm1, %xmm0, %xmm0
; AVX2-NEXT: vmovd %xmm0, %eax
; AVX2-NEXT: vzeroupper
-; AVX2-NEXT: retq
+; AVX2-NEXT: ret{{[l|q]}}
;
; AVX512-LABEL: test_v8i32:
; AVX512: # %bb.0:
@@ -1004,60 +1897,127 @@ define i32 @test_v8i32(<8 x i32> %a0) {
ret i32 %1
}
-define i32 @test_v16i32(<16 x i32> %a0) {
-; SSE2-LABEL: test_v16i32:
-; SSE2: # %bb.0:
-; SSE2-NEXT: movdqa {{.*#+}} xmm4 = [2147483648,2147483648,2147483648,2147483648]
-; SSE2-NEXT: movdqa %xmm0, %xmm6
-; SSE2-NEXT: pxor %xmm4, %xmm6
-; SSE2-NEXT: movdqa %xmm2, %xmm5
-; SSE2-NEXT: pxor %xmm4, %xmm5
-; SSE2-NEXT: pcmpgtd %xmm6, %xmm5
-; SSE2-NEXT: pand %xmm5, %xmm0
-; SSE2-NEXT: pandn %xmm2, %xmm5
-; SSE2-NEXT: por %xmm0, %xmm5
-; SSE2-NEXT: movdqa %xmm5, %xmm0
-; SSE2-NEXT: pxor %xmm4, %xmm0
-; SSE2-NEXT: movdqa %xmm1, %xmm2
-; SSE2-NEXT: pxor %xmm4, %xmm2
-; SSE2-NEXT: movdqa %xmm3, %xmm6
-; SSE2-NEXT: pxor %xmm4, %xmm6
-; SSE2-NEXT: pcmpgtd %xmm2, %xmm6
-; SSE2-NEXT: pand %xmm6, %xmm1
-; SSE2-NEXT: pandn %xmm3, %xmm6
-; SSE2-NEXT: por %xmm1, %xmm6
-; SSE2-NEXT: movdqa %xmm6, %xmm1
-; SSE2-NEXT: pxor %xmm4, %xmm1
-; SSE2-NEXT: pcmpgtd %xmm0, %xmm1
-; SSE2-NEXT: pand %xmm1, %xmm5
-; SSE2-NEXT: pandn %xmm6, %xmm1
-; SSE2-NEXT: por %xmm5, %xmm1
-; SSE2-NEXT: movdqa %xmm1, %xmm0
-; SSE2-NEXT: pxor %xmm4, %xmm0
-; SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm1[2,3,2,3]
-; SSE2-NEXT: pxor %xmm2, %xmm4
-; SSE2-NEXT: pcmpgtd %xmm0, %xmm4
-; SSE2-NEXT: pand %xmm4, %xmm1
-; SSE2-NEXT: pandn %xmm2, %xmm4
-; SSE2-NEXT: por %xmm1, %xmm4
-; SSE2-NEXT: movd %xmm4, %ecx
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm4[1,1,1,1]
-; SSE2-NEXT: movd %xmm0, %eax
-; SSE2-NEXT: cmpl %eax, %ecx
-; SSE2-NEXT: cmovbl %ecx, %eax
-; SSE2-NEXT: retq
-;
-; SSE4-LABEL: test_v16i32:
-; SSE4: # %bb.0:
-; SSE4-NEXT: pminud %xmm3, %xmm1
-; SSE4-NEXT: pminud %xmm2, %xmm0
-; SSE4-NEXT: pminud %xmm1, %xmm0
-; SSE4-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
-; SSE4-NEXT: pminud %xmm0, %xmm1
-; SSE4-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
-; SSE4-NEXT: pminud %xmm1, %xmm0
-; SSE4-NEXT: movd %xmm0, %eax
-; SSE4-NEXT: retq
+define i32 @test_v16i32(<16 x i32> %a0) nounwind {
+; X86-SSE2-LABEL: test_v16i32:
+; X86-SSE2: # %bb.0:
+; X86-SSE2-NEXT: pushl %ebp
+; X86-SSE2-NEXT: movl %esp, %ebp
+; X86-SSE2-NEXT: andl $-16, %esp
+; X86-SSE2-NEXT: subl $16, %esp
+; X86-SSE2-NEXT: movdqa 8(%ebp), %xmm5
+; X86-SSE2-NEXT: movdqa {{.*#+}} xmm3 = [2147483648,2147483648,2147483648,2147483648]
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm6
+; X86-SSE2-NEXT: pxor %xmm3, %xmm6
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm4
+; X86-SSE2-NEXT: pxor %xmm3, %xmm4
+; X86-SSE2-NEXT: pcmpgtd %xmm6, %xmm4
+; X86-SSE2-NEXT: pand %xmm4, %xmm0
+; X86-SSE2-NEXT: pandn %xmm2, %xmm4
+; X86-SSE2-NEXT: por %xmm0, %xmm4
+; X86-SSE2-NEXT: movdqa %xmm4, %xmm2
+; X86-SSE2-NEXT: pxor %xmm3, %xmm2
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE2-NEXT: pxor %xmm3, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm5, %xmm6
+; X86-SSE2-NEXT: pxor %xmm3, %xmm6
+; X86-SSE2-NEXT: pcmpgtd %xmm0, %xmm6
+; X86-SSE2-NEXT: pand %xmm6, %xmm1
+; X86-SSE2-NEXT: pandn %xmm5, %xmm6
+; X86-SSE2-NEXT: por %xmm1, %xmm6
+; X86-SSE2-NEXT: movdqa %xmm6, %xmm0
+; X86-SSE2-NEXT: pxor %xmm3, %xmm0
+; X86-SSE2-NEXT: pcmpgtd %xmm2, %xmm0
+; X86-SSE2-NEXT: pand %xmm0, %xmm4
+; X86-SSE2-NEXT: pandn %xmm6, %xmm0
+; X86-SSE2-NEXT: por %xmm4, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X86-SSE2-NEXT: pxor %xmm3, %xmm1
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm0[2,3,2,3]
+; X86-SSE2-NEXT: pxor %xmm2, %xmm3
+; X86-SSE2-NEXT: pcmpgtd %xmm1, %xmm3
+; X86-SSE2-NEXT: pand %xmm3, %xmm0
+; X86-SSE2-NEXT: pandn %xmm2, %xmm3
+; X86-SSE2-NEXT: por %xmm0, %xmm3
+; X86-SSE2-NEXT: movd %xmm3, %ecx
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm3[1,1,1,1]
+; X86-SSE2-NEXT: movd %xmm0, %eax
+; X86-SSE2-NEXT: cmpl %eax, %ecx
+; X86-SSE2-NEXT: cmovbl %ecx, %eax
+; X86-SSE2-NEXT: movl %ebp, %esp
+; X86-SSE2-NEXT: popl %ebp
+; X86-SSE2-NEXT: retl
+;
+; X64-SSE2-LABEL: test_v16i32:
+; X64-SSE2: # %bb.0:
+; X64-SSE2-NEXT: movdqa {{.*#+}} xmm4 = [2147483648,2147483648,2147483648,2147483648]
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm6
+; X64-SSE2-NEXT: pxor %xmm4, %xmm6
+; X64-SSE2-NEXT: movdqa %xmm2, %xmm5
+; X64-SSE2-NEXT: pxor %xmm4, %xmm5
+; X64-SSE2-NEXT: pcmpgtd %xmm6, %xmm5
+; X64-SSE2-NEXT: pand %xmm5, %xmm0
+; X64-SSE2-NEXT: pandn %xmm2, %xmm5
+; X64-SSE2-NEXT: por %xmm0, %xmm5
+; X64-SSE2-NEXT: movdqa %xmm5, %xmm0
+; X64-SSE2-NEXT: pxor %xmm4, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm2
+; X64-SSE2-NEXT: pxor %xmm4, %xmm2
+; X64-SSE2-NEXT: movdqa %xmm3, %xmm6
+; X64-SSE2-NEXT: pxor %xmm4, %xmm6
+; X64-SSE2-NEXT: pcmpgtd %xmm2, %xmm6
+; X64-SSE2-NEXT: pand %xmm6, %xmm1
+; X64-SSE2-NEXT: pandn %xmm3, %xmm6
+; X64-SSE2-NEXT: por %xmm1, %xmm6
+; X64-SSE2-NEXT: movdqa %xmm6, %xmm1
+; X64-SSE2-NEXT: pxor %xmm4, %xmm1
+; X64-SSE2-NEXT: pcmpgtd %xmm0, %xmm1
+; X64-SSE2-NEXT: pand %xmm1, %xmm5
+; X64-SSE2-NEXT: pandn %xmm6, %xmm1
+; X64-SSE2-NEXT: por %xmm5, %xmm1
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X64-SSE2-NEXT: pxor %xmm4, %xmm0
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm1[2,3,2,3]
+; X64-SSE2-NEXT: pxor %xmm2, %xmm4
+; X64-SSE2-NEXT: pcmpgtd %xmm0, %xmm4
+; X64-SSE2-NEXT: pand %xmm4, %xmm1
+; X64-SSE2-NEXT: pandn %xmm2, %xmm4
+; X64-SSE2-NEXT: por %xmm1, %xmm4
+; X64-SSE2-NEXT: movd %xmm4, %ecx
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm4[1,1,1,1]
+; X64-SSE2-NEXT: movd %xmm0, %eax
+; X64-SSE2-NEXT: cmpl %eax, %ecx
+; X64-SSE2-NEXT: cmovbl %ecx, %eax
+; X64-SSE2-NEXT: retq
+;
+; X86-SSE4-LABEL: test_v16i32:
+; X86-SSE4: # %bb.0:
+; X86-SSE4-NEXT: pushl %ebp
+; X86-SSE4-NEXT: movl %esp, %ebp
+; X86-SSE4-NEXT: andl $-16, %esp
+; X86-SSE4-NEXT: subl $16, %esp
+; X86-SSE4-NEXT: pminud %xmm2, %xmm0
+; X86-SSE4-NEXT: pminud 8(%ebp), %xmm1
+; X86-SSE4-NEXT: pminud %xmm0, %xmm1
+; X86-SSE4-NEXT: pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
+; X86-SSE4-NEXT: pminud %xmm1, %xmm0
+; X86-SSE4-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; X86-SSE4-NEXT: pminud %xmm0, %xmm1
+; X86-SSE4-NEXT: movd %xmm1, %eax
+; X86-SSE4-NEXT: movl %ebp, %esp
+; X86-SSE4-NEXT: popl %ebp
+; X86-SSE4-NEXT: retl
+;
+; X64-SSE4-LABEL: test_v16i32:
+; X64-SSE4: # %bb.0:
+; X64-SSE4-NEXT: pminud %xmm3, %xmm1
+; X64-SSE4-NEXT: pminud %xmm2, %xmm0
+; X64-SSE4-NEXT: pminud %xmm1, %xmm0
+; X64-SSE4-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X64-SSE4-NEXT: pminud %xmm0, %xmm1
+; X64-SSE4-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
+; X64-SSE4-NEXT: pminud %xmm1, %xmm0
+; X64-SSE4-NEXT: movd %xmm0, %eax
+; X64-SSE4-NEXT: retq
;
; AVX1-LABEL: test_v16i32:
; AVX1: # %bb.0:
@@ -1072,7 +2032,7 @@ define i32 @test_v16i32(<16 x i32> %a0) {
; AVX1-NEXT: vpminud %xmm1, %xmm0, %xmm0
; AVX1-NEXT: vmovd %xmm0, %eax
; AVX1-NEXT: vzeroupper
-; AVX1-NEXT: retq
+; AVX1-NEXT: ret{{[l|q]}}
;
; AVX2-LABEL: test_v16i32:
; AVX2: # %bb.0:
@@ -1085,7 +2045,7 @@ define i32 @test_v16i32(<16 x i32> %a0) {
; AVX2-NEXT: vpminud %xmm1, %xmm0, %xmm0
; AVX2-NEXT: vmovd %xmm0, %eax
; AVX2-NEXT: vzeroupper
-; AVX2-NEXT: retq
+; AVX2-NEXT: ret{{[l|q]}}
;
; AVX512-LABEL: test_v16i32:
; AVX512: # %bb.0:
@@ -1104,132 +2064,287 @@ define i32 @test_v16i32(<16 x i32> %a0) {
ret i32 %1
}
-define i32 @test_v32i32(<32 x i32> %a0) {
-; SSE2-LABEL: test_v32i32:
-; SSE2: # %bb.0:
-; SSE2-NEXT: movdqa {{.*#+}} xmm8 = [2147483648,2147483648,2147483648,2147483648]
-; SSE2-NEXT: movdqa %xmm0, %xmm10
-; SSE2-NEXT: pxor %xmm8, %xmm10
-; SSE2-NEXT: movdqa %xmm4, %xmm9
-; SSE2-NEXT: pxor %xmm8, %xmm9
-; SSE2-NEXT: pcmpgtd %xmm10, %xmm9
-; SSE2-NEXT: pand %xmm9, %xmm0
-; SSE2-NEXT: pandn %xmm4, %xmm9
-; SSE2-NEXT: por %xmm0, %xmm9
-; SSE2-NEXT: movdqa %xmm9, %xmm4
-; SSE2-NEXT: pxor %xmm8, %xmm4
-; SSE2-NEXT: movdqa %xmm2, %xmm0
-; SSE2-NEXT: pxor %xmm8, %xmm0
-; SSE2-NEXT: movdqa %xmm6, %xmm10
-; SSE2-NEXT: pxor %xmm8, %xmm10
-; SSE2-NEXT: pcmpgtd %xmm0, %xmm10
-; SSE2-NEXT: pand %xmm10, %xmm2
-; SSE2-NEXT: pandn %xmm6, %xmm10
-; SSE2-NEXT: por %xmm2, %xmm10
-; SSE2-NEXT: movdqa %xmm10, %xmm0
-; SSE2-NEXT: pxor %xmm8, %xmm0
-; SSE2-NEXT: pcmpgtd %xmm4, %xmm0
-; SSE2-NEXT: pand %xmm0, %xmm9
-; SSE2-NEXT: pandn %xmm10, %xmm0
-; SSE2-NEXT: por %xmm9, %xmm0
-; SSE2-NEXT: movdqa %xmm0, %xmm2
-; SSE2-NEXT: pxor %xmm8, %xmm2
-; SSE2-NEXT: movdqa %xmm1, %xmm6
-; SSE2-NEXT: pxor %xmm8, %xmm6
-; SSE2-NEXT: movdqa %xmm5, %xmm4
-; SSE2-NEXT: pxor %xmm8, %xmm4
-; SSE2-NEXT: pcmpgtd %xmm6, %xmm4
-; SSE2-NEXT: pand %xmm4, %xmm1
-; SSE2-NEXT: pandn %xmm5, %xmm4
-; SSE2-NEXT: por %xmm1, %xmm4
-; SSE2-NEXT: movdqa %xmm4, %xmm1
-; SSE2-NEXT: pxor %xmm8, %xmm1
-; SSE2-NEXT: movdqa %xmm3, %xmm5
-; SSE2-NEXT: pxor %xmm8, %xmm5
-; SSE2-NEXT: movdqa %xmm7, %xmm6
-; SSE2-NEXT: pxor %xmm8, %xmm6
-; SSE2-NEXT: pcmpgtd %xmm5, %xmm6
-; SSE2-NEXT: pand %xmm6, %xmm3
-; SSE2-NEXT: pandn %xmm7, %xmm6
-; SSE2-NEXT: por %xmm3, %xmm6
-; SSE2-NEXT: movdqa %xmm6, %xmm3
-; SSE2-NEXT: pxor %xmm8, %xmm3
-; SSE2-NEXT: pcmpgtd %xmm1, %xmm3
-; SSE2-NEXT: pand %xmm3, %xmm4
-; SSE2-NEXT: pandn %xmm6, %xmm3
-; SSE2-NEXT: por %xmm4, %xmm3
-; SSE2-NEXT: movdqa %xmm3, %xmm1
-; SSE2-NEXT: pxor %xmm8, %xmm1
-; SSE2-NEXT: pcmpgtd %xmm2, %xmm1
-; SSE2-NEXT: pand %xmm1, %xmm0
-; SSE2-NEXT: pandn %xmm3, %xmm1
-; SSE2-NEXT: por %xmm0, %xmm1
-; SSE2-NEXT: movdqa %xmm1, %xmm0
-; SSE2-NEXT: pxor %xmm8, %xmm0
-; SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm1[2,3,2,3]
-; SSE2-NEXT: pxor %xmm2, %xmm8
-; SSE2-NEXT: pcmpgtd %xmm0, %xmm8
-; SSE2-NEXT: pand %xmm8, %xmm1
-; SSE2-NEXT: pandn %xmm2, %xmm8
-; SSE2-NEXT: por %xmm1, %xmm8
-; SSE2-NEXT: movd %xmm8, %ecx
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm8[1,1,1,1]
-; SSE2-NEXT: movd %xmm0, %eax
-; SSE2-NEXT: cmpl %eax, %ecx
-; SSE2-NEXT: cmovbl %ecx, %eax
-; SSE2-NEXT: retq
-;
-; SSE4-LABEL: test_v32i32:
-; SSE4: # %bb.0:
-; SSE4-NEXT: pminud %xmm7, %xmm3
-; SSE4-NEXT: pminud %xmm5, %xmm1
-; SSE4-NEXT: pminud %xmm3, %xmm1
-; SSE4-NEXT: pminud %xmm6, %xmm2
-; SSE4-NEXT: pminud %xmm4, %xmm0
-; SSE4-NEXT: pminud %xmm2, %xmm0
-; SSE4-NEXT: pminud %xmm1, %xmm0
-; SSE4-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
-; SSE4-NEXT: pminud %xmm0, %xmm1
-; SSE4-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
-; SSE4-NEXT: pminud %xmm1, %xmm0
-; SSE4-NEXT: movd %xmm0, %eax
-; SSE4-NEXT: retq
-;
-; AVX1-LABEL: test_v32i32:
-; AVX1: # %bb.0:
-; AVX1-NEXT: vextractf128 $1, %ymm3, %xmm4
-; AVX1-NEXT: vextractf128 $1, %ymm1, %xmm5
-; AVX1-NEXT: vpminud %xmm4, %xmm5, %xmm4
-; AVX1-NEXT: vextractf128 $1, %ymm2, %xmm5
-; AVX1-NEXT: vextractf128 $1, %ymm0, %xmm6
-; AVX1-NEXT: vpminud %xmm5, %xmm6, %xmm5
-; AVX1-NEXT: vpminud %xmm4, %xmm5, %xmm4
-; AVX1-NEXT: vpminud %xmm3, %xmm1, %xmm1
-; AVX1-NEXT: vpminud %xmm2, %xmm0, %xmm0
-; AVX1-NEXT: vpminud %xmm1, %xmm0, %xmm0
-; AVX1-NEXT: vpminud %xmm4, %xmm0, %xmm0
-; AVX1-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
-; AVX1-NEXT: vpminud %xmm1, %xmm0, %xmm0
-; AVX1-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
-; AVX1-NEXT: vpminud %xmm1, %xmm0, %xmm0
-; AVX1-NEXT: vmovd %xmm0, %eax
-; AVX1-NEXT: vzeroupper
-; AVX1-NEXT: retq
-;
-; AVX2-LABEL: test_v32i32:
-; AVX2: # %bb.0:
-; AVX2-NEXT: vpminud %ymm3, %ymm1, %ymm1
-; AVX2-NEXT: vpminud %ymm2, %ymm0, %ymm0
-; AVX2-NEXT: vpminud %ymm1, %ymm0, %ymm0
-; AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
-; AVX2-NEXT: vpminud %xmm1, %xmm0, %xmm0
-; AVX2-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
-; AVX2-NEXT: vpminud %xmm1, %xmm0, %xmm0
-; AVX2-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
-; AVX2-NEXT: vpminud %xmm1, %xmm0, %xmm0
-; AVX2-NEXT: vmovd %xmm0, %eax
-; AVX2-NEXT: vzeroupper
-; AVX2-NEXT: retq
+define i32 @test_v32i32(<32 x i32> %a0) nounwind {
+; X86-SSE2-LABEL: test_v32i32:
+; X86-SSE2: # %bb.0:
+; X86-SSE2-NEXT: pushl %ebp
+; X86-SSE2-NEXT: movl %esp, %ebp
+; X86-SSE2-NEXT: andl $-16, %esp
+; X86-SSE2-NEXT: subl $16, %esp
+; X86-SSE2-NEXT: movdqa 24(%ebp), %xmm4
+; X86-SSE2-NEXT: movdqa {{.*#+}} xmm3 = [2147483648,2147483648,2147483648,2147483648]
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm6
+; X86-SSE2-NEXT: pxor %xmm3, %xmm6
+; X86-SSE2-NEXT: movdqa %xmm4, %xmm5
+; X86-SSE2-NEXT: pxor %xmm3, %xmm5
+; X86-SSE2-NEXT: pcmpgtd %xmm6, %xmm5
+; X86-SSE2-NEXT: movdqa 56(%ebp), %xmm7
+; X86-SSE2-NEXT: pand %xmm5, %xmm0
+; X86-SSE2-NEXT: pandn %xmm4, %xmm5
+; X86-SSE2-NEXT: por %xmm0, %xmm5
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm0
+; X86-SSE2-NEXT: pxor %xmm3, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm7, %xmm6
+; X86-SSE2-NEXT: pxor %xmm3, %xmm6
+; X86-SSE2-NEXT: pcmpgtd %xmm0, %xmm6
+; X86-SSE2-NEXT: movdqa 72(%ebp), %xmm4
+; X86-SSE2-NEXT: pand %xmm6, %xmm2
+; X86-SSE2-NEXT: pandn %xmm7, %xmm6
+; X86-SSE2-NEXT: movdqa %xmm5, %xmm7
+; X86-SSE2-NEXT: pxor %xmm3, %xmm7
+; X86-SSE2-NEXT: por %xmm2, %xmm6
+; X86-SSE2-NEXT: movdqa %xmm6, %xmm0
+; X86-SSE2-NEXT: pxor %xmm3, %xmm0
+; X86-SSE2-NEXT: pcmpgtd %xmm7, %xmm0
+; X86-SSE2-NEXT: movdqa 40(%ebp), %xmm7
+; X86-SSE2-NEXT: pand %xmm0, %xmm5
+; X86-SSE2-NEXT: pandn %xmm6, %xmm0
+; X86-SSE2-NEXT: por %xmm5, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm5
+; X86-SSE2-NEXT: pxor %xmm3, %xmm5
+; X86-SSE2-NEXT: movdqa %xmm7, %xmm2
+; X86-SSE2-NEXT: pxor %xmm3, %xmm2
+; X86-SSE2-NEXT: pcmpgtd %xmm5, %xmm2
+; X86-SSE2-NEXT: movdqa 8(%ebp), %xmm5
+; X86-SSE2-NEXT: pand %xmm2, %xmm1
+; X86-SSE2-NEXT: pandn %xmm7, %xmm2
+; X86-SSE2-NEXT: por %xmm1, %xmm2
+; X86-SSE2-NEXT: movdqa %xmm5, %xmm6
+; X86-SSE2-NEXT: pxor %xmm3, %xmm6
+; X86-SSE2-NEXT: movdqa %xmm4, %xmm1
+; X86-SSE2-NEXT: pxor %xmm3, %xmm1
+; X86-SSE2-NEXT: pcmpgtd %xmm6, %xmm1
+; X86-SSE2-NEXT: pand %xmm1, %xmm5
+; X86-SSE2-NEXT: pandn %xmm4, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm6
+; X86-SSE2-NEXT: pxor %xmm3, %xmm6
+; X86-SSE2-NEXT: por %xmm5, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm4
+; X86-SSE2-NEXT: pxor %xmm3, %xmm4
+; X86-SSE2-NEXT: pcmpgtd %xmm6, %xmm4
+; X86-SSE2-NEXT: pand %xmm4, %xmm2
+; X86-SSE2-NEXT: pandn %xmm1, %xmm4
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm5
+; X86-SSE2-NEXT: pxor %xmm3, %xmm5
+; X86-SSE2-NEXT: por %xmm2, %xmm4
+; X86-SSE2-NEXT: movdqa %xmm4, %xmm1
+; X86-SSE2-NEXT: pxor %xmm3, %xmm1
+; X86-SSE2-NEXT: pcmpgtd %xmm5, %xmm1
+; X86-SSE2-NEXT: pand %xmm1, %xmm0
+; X86-SSE2-NEXT: pandn %xmm4, %xmm1
+; X86-SSE2-NEXT: por %xmm0, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE2-NEXT: pxor %xmm3, %xmm0
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm1[2,3,2,3]
+; X86-SSE2-NEXT: pxor %xmm2, %xmm3
+; X86-SSE2-NEXT: pcmpgtd %xmm0, %xmm3
+; X86-SSE2-NEXT: pand %xmm3, %xmm1
+; X86-SSE2-NEXT: pandn %xmm2, %xmm3
+; X86-SSE2-NEXT: por %xmm1, %xmm3
+; X86-SSE2-NEXT: movd %xmm3, %ecx
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm3[1,1,1,1]
+; X86-SSE2-NEXT: movd %xmm0, %eax
+; X86-SSE2-NEXT: cmpl %eax, %ecx
+; X86-SSE2-NEXT: cmovbl %ecx, %eax
+; X86-SSE2-NEXT: movl %ebp, %esp
+; X86-SSE2-NEXT: popl %ebp
+; X86-SSE2-NEXT: retl
+;
+; X64-SSE2-LABEL: test_v32i32:
+; X64-SSE2: # %bb.0:
+; X64-SSE2-NEXT: movdqa {{.*#+}} xmm8 = [2147483648,2147483648,2147483648,2147483648]
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm10
+; X64-SSE2-NEXT: pxor %xmm8, %xmm10
+; X64-SSE2-NEXT: movdqa %xmm4, %xmm9
+; X64-SSE2-NEXT: pxor %xmm8, %xmm9
+; X64-SSE2-NEXT: pcmpgtd %xmm10, %xmm9
+; X64-SSE2-NEXT: pand %xmm9, %xmm0
+; X64-SSE2-NEXT: pandn %xmm4, %xmm9
+; X64-SSE2-NEXT: por %xmm0, %xmm9
+; X64-SSE2-NEXT: movdqa %xmm9, %xmm4
+; X64-SSE2-NEXT: pxor %xmm8, %xmm4
+; X64-SSE2-NEXT: movdqa %xmm2, %xmm0
+; X64-SSE2-NEXT: pxor %xmm8, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm6, %xmm10
+; X64-SSE2-NEXT: pxor %xmm8, %xmm10
+; X64-SSE2-NEXT: pcmpgtd %xmm0, %xmm10
+; X64-SSE2-NEXT: pand %xmm10, %xmm2
+; X64-SSE2-NEXT: pandn %xmm6, %xmm10
+; X64-SSE2-NEXT: por %xmm2, %xmm10
+; X64-SSE2-NEXT: movdqa %xmm10, %xmm0
+; X64-SSE2-NEXT: pxor %xmm8, %xmm0
+; X64-SSE2-NEXT: pcmpgtd %xmm4, %xmm0
+; X64-SSE2-NEXT: pand %xmm0, %xmm9
+; X64-SSE2-NEXT: pandn %xmm10, %xmm0
+; X64-SSE2-NEXT: por %xmm9, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X64-SSE2-NEXT: pxor %xmm8, %xmm2
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm6
+; X64-SSE2-NEXT: pxor %xmm8, %xmm6
+; X64-SSE2-NEXT: movdqa %xmm5, %xmm4
+; X64-SSE2-NEXT: pxor %xmm8, %xmm4
+; X64-SSE2-NEXT: pcmpgtd %xmm6, %xmm4
+; X64-SSE2-NEXT: pand %xmm4, %xmm1
+; X64-SSE2-NEXT: pandn %xmm5, %xmm4
+; X64-SSE2-NEXT: por %xmm1, %xmm4
+; X64-SSE2-NEXT: movdqa %xmm4, %xmm1
+; X64-SSE2-NEXT: pxor %xmm8, %xmm1
+; X64-SSE2-NEXT: movdqa %xmm3, %xmm5
+; X64-SSE2-NEXT: pxor %xmm8, %xmm5
+; X64-SSE2-NEXT: movdqa %xmm7, %xmm6
+; X64-SSE2-NEXT: pxor %xmm8, %xmm6
+; X64-SSE2-NEXT: pcmpgtd %xmm5, %xmm6
+; X64-SSE2-NEXT: pand %xmm6, %xmm3
+; X64-SSE2-NEXT: pandn %xmm7, %xmm6
+; X64-SSE2-NEXT: por %xmm3, %xmm6
+; X64-SSE2-NEXT: movdqa %xmm6, %xmm3
+; X64-SSE2-NEXT: pxor %xmm8, %xmm3
+; X64-SSE2-NEXT: pcmpgtd %xmm1, %xmm3
+; X64-SSE2-NEXT: pand %xmm3, %xmm4
+; X64-SSE2-NEXT: pandn %xmm6, %xmm3
+; X64-SSE2-NEXT: por %xmm4, %xmm3
+; X64-SSE2-NEXT: movdqa %xmm3, %xmm1
+; X64-SSE2-NEXT: pxor %xmm8, %xmm1
+; X64-SSE2-NEXT: pcmpgtd %xmm2, %xmm1
+; X64-SSE2-NEXT: pand %xmm1, %xmm0
+; X64-SSE2-NEXT: pandn %xmm3, %xmm1
+; X64-SSE2-NEXT: por %xmm0, %xmm1
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X64-SSE2-NEXT: pxor %xmm8, %xmm0
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm2 = xmm1[2,3,2,3]
+; X64-SSE2-NEXT: pxor %xmm2, %xmm8
+; X64-SSE2-NEXT: pcmpgtd %xmm0, %xmm8
+; X64-SSE2-NEXT: pand %xmm8, %xmm1
+; X64-SSE2-NEXT: pandn %xmm2, %xmm8
+; X64-SSE2-NEXT: por %xmm1, %xmm8
+; X64-SSE2-NEXT: movd %xmm8, %ecx
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm8[1,1,1,1]
+; X64-SSE2-NEXT: movd %xmm0, %eax
+; X64-SSE2-NEXT: cmpl %eax, %ecx
+; X64-SSE2-NEXT: cmovbl %ecx, %eax
+; X64-SSE2-NEXT: retq
+;
+; X86-SSE4-LABEL: test_v32i32:
+; X86-SSE4: # %bb.0:
+; X86-SSE4-NEXT: pushl %ebp
+; X86-SSE4-NEXT: movl %esp, %ebp
+; X86-SSE4-NEXT: andl $-16, %esp
+; X86-SSE4-NEXT: subl $16, %esp
+; X86-SSE4-NEXT: movdqa 8(%ebp), %xmm3
+; X86-SSE4-NEXT: pminud 72(%ebp), %xmm3
+; X86-SSE4-NEXT: pminud 40(%ebp), %xmm1
+; X86-SSE4-NEXT: pminud %xmm3, %xmm1
+; X86-SSE4-NEXT: pminud 56(%ebp), %xmm2
+; X86-SSE4-NEXT: pminud 24(%ebp), %xmm0
+; X86-SSE4-NEXT: pminud %xmm2, %xmm0
+; X86-SSE4-NEXT: pminud %xmm1, %xmm0
+; X86-SSE4-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-SSE4-NEXT: pminud %xmm0, %xmm1
+; X86-SSE4-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
+; X86-SSE4-NEXT: pminud %xmm1, %xmm0
+; X86-SSE4-NEXT: movd %xmm0, %eax
+; X86-SSE4-NEXT: movl %ebp, %esp
+; X86-SSE4-NEXT: popl %ebp
+; X86-SSE4-NEXT: retl
+;
+; X64-SSE4-LABEL: test_v32i32:
+; X64-SSE4: # %bb.0:
+; X64-SSE4-NEXT: pminud %xmm7, %xmm3
+; X64-SSE4-NEXT: pminud %xmm5, %xmm1
+; X64-SSE4-NEXT: pminud %xmm3, %xmm1
+; X64-SSE4-NEXT: pminud %xmm6, %xmm2
+; X64-SSE4-NEXT: pminud %xmm4, %xmm0
+; X64-SSE4-NEXT: pminud %xmm2, %xmm0
+; X64-SSE4-NEXT: pminud %xmm1, %xmm0
+; X64-SSE4-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X64-SSE4-NEXT: pminud %xmm0, %xmm1
+; X64-SSE4-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
+; X64-SSE4-NEXT: pminud %xmm1, %xmm0
+; X64-SSE4-NEXT: movd %xmm0, %eax
+; X64-SSE4-NEXT: retq
+;
+; X86-AVX1-LABEL: test_v32i32:
+; X86-AVX1: # %bb.0:
+; X86-AVX1-NEXT: pushl %ebp
+; X86-AVX1-NEXT: movl %esp, %ebp
+; X86-AVX1-NEXT: andl $-32, %esp
+; X86-AVX1-NEXT: subl $32, %esp
+; X86-AVX1-NEXT: vextractf128 $1, %ymm2, %xmm3
+; X86-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm4
+; X86-AVX1-NEXT: vpminud %xmm3, %xmm4, %xmm3
+; X86-AVX1-NEXT: vextractf128 $1, %ymm1, %xmm4
+; X86-AVX1-NEXT: vpminud 24(%ebp), %xmm4, %xmm4
+; X86-AVX1-NEXT: vpminud %xmm4, %xmm3, %xmm3
+; X86-AVX1-NEXT: vpminud %xmm2, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpminud 8(%ebp), %xmm1, %xmm1
+; X86-AVX1-NEXT: vpminud %xmm1, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpminud %xmm3, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-AVX1-NEXT: vpminud %xmm1, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; X86-AVX1-NEXT: vpminud %xmm1, %xmm0, %xmm0
+; X86-AVX1-NEXT: vmovd %xmm0, %eax
+; X86-AVX1-NEXT: movl %ebp, %esp
+; X86-AVX1-NEXT: popl %ebp
+; X86-AVX1-NEXT: vzeroupper
+; X86-AVX1-NEXT: retl
+;
+; X64-AVX1-LABEL: test_v32i32:
+; X64-AVX1: # %bb.0:
+; X64-AVX1-NEXT: vextractf128 $1, %ymm3, %xmm4
+; X64-AVX1-NEXT: vextractf128 $1, %ymm1, %xmm5
+; X64-AVX1-NEXT: vpminud %xmm4, %xmm5, %xmm4
+; X64-AVX1-NEXT: vextractf128 $1, %ymm2, %xmm5
+; X64-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm6
+; X64-AVX1-NEXT: vpminud %xmm5, %xmm6, %xmm5
+; X64-AVX1-NEXT: vpminud %xmm4, %xmm5, %xmm4
+; X64-AVX1-NEXT: vpminud %xmm3, %xmm1, %xmm1
+; X64-AVX1-NEXT: vpminud %xmm2, %xmm0, %xmm0
+; X64-AVX1-NEXT: vpminud %xmm1, %xmm0, %xmm0
+; X64-AVX1-NEXT: vpminud %xmm4, %xmm0, %xmm0
+; X64-AVX1-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X64-AVX1-NEXT: vpminud %xmm1, %xmm0, %xmm0
+; X64-AVX1-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; X64-AVX1-NEXT: vpminud %xmm1, %xmm0, %xmm0
+; X64-AVX1-NEXT: vmovd %xmm0, %eax
+; X64-AVX1-NEXT: vzeroupper
+; X64-AVX1-NEXT: retq
+;
+; X86-AVX2-LABEL: test_v32i32:
+; X86-AVX2: # %bb.0:
+; X86-AVX2-NEXT: pushl %ebp
+; X86-AVX2-NEXT: movl %esp, %ebp
+; X86-AVX2-NEXT: andl $-32, %esp
+; X86-AVX2-NEXT: subl $32, %esp
+; X86-AVX2-NEXT: vpminud %ymm2, %ymm0, %ymm0
+; X86-AVX2-NEXT: vpminud 8(%ebp), %ymm1, %ymm1
+; X86-AVX2-NEXT: vpminud %ymm1, %ymm0, %ymm0
+; X86-AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
+; X86-AVX2-NEXT: vpminud %xmm1, %xmm0, %xmm0
+; X86-AVX2-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-AVX2-NEXT: vpminud %xmm1, %xmm0, %xmm0
+; X86-AVX2-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; X86-AVX2-NEXT: vpminud %xmm1, %xmm0, %xmm0
+; X86-AVX2-NEXT: vmovd %xmm0, %eax
+; X86-AVX2-NEXT: movl %ebp, %esp
+; X86-AVX2-NEXT: popl %ebp
+; X86-AVX2-NEXT: vzeroupper
+; X86-AVX2-NEXT: retl
+;
+; X64-AVX2-LABEL: test_v32i32:
+; X64-AVX2: # %bb.0:
+; X64-AVX2-NEXT: vpminud %ymm3, %ymm1, %ymm1
+; X64-AVX2-NEXT: vpminud %ymm2, %ymm0, %ymm0
+; X64-AVX2-NEXT: vpminud %ymm1, %ymm0, %ymm0
+; X64-AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
+; X64-AVX2-NEXT: vpminud %xmm1, %xmm0, %xmm0
+; X64-AVX2-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X64-AVX2-NEXT: vpminud %xmm1, %xmm0, %xmm0
+; X64-AVX2-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; X64-AVX2-NEXT: vpminud %xmm1, %xmm0, %xmm0
+; X64-AVX2-NEXT: vmovd %xmm0, %eax
+; X64-AVX2-NEXT: vzeroupper
+; X64-AVX2-NEXT: retq
;
; AVX512-LABEL: test_v32i32:
; AVX512: # %bb.0:
@@ -1253,7 +2368,7 @@ define i32 @test_v32i32(<32 x i32> %a0) {
; vXi16
;
-define i16 @test_v2i16(<2 x i16> %a0) {
+define i16 @test_v2i16(<2 x i16> %a0) nounwind {
; SSE2-LABEL: test_v2i16:
; SSE2: # %bb.0:
; SSE2-NEXT: movdqa %xmm0, %xmm1
@@ -1263,7 +2378,7 @@ define i16 @test_v2i16(<2 x i16> %a0) {
; SSE2-NEXT: psubw %xmm2, %xmm0
; SSE2-NEXT: movd %xmm0, %eax
; SSE2-NEXT: # kill: def $ax killed $ax killed $eax
-; SSE2-NEXT: retq
+; SSE2-NEXT: ret{{[l|q]}}
;
; SSE4-LABEL: test_v2i16:
; SSE4: # %bb.0:
@@ -1272,7 +2387,7 @@ define i16 @test_v2i16(<2 x i16> %a0) {
; SSE4-NEXT: pminuw %xmm0, %xmm1
; SSE4-NEXT: movd %xmm1, %eax
; SSE4-NEXT: # kill: def $ax killed $ax killed $eax
-; SSE4-NEXT: retq
+; SSE4-NEXT: ret{{[l|q]}}
;
; AVX-LABEL: test_v2i16:
; AVX: # %bb.0:
@@ -1280,20 +2395,12 @@ define i16 @test_v2i16(<2 x i16> %a0) {
; AVX-NEXT: vpminuw %xmm1, %xmm0, %xmm0
; AVX-NEXT: vmovd %xmm0, %eax
; AVX-NEXT: # kill: def $ax killed $ax killed $eax
-; AVX-NEXT: retq
-;
-; AVX512-LABEL: test_v2i16:
-; AVX512: # %bb.0:
-; AVX512-NEXT: vpsrld $16, %xmm0, %xmm1
-; AVX512-NEXT: vpminuw %xmm1, %xmm0, %xmm0
-; AVX512-NEXT: vmovd %xmm0, %eax
-; AVX512-NEXT: # kill: def $ax killed $ax killed $eax
-; AVX512-NEXT: retq
+; AVX-NEXT: ret{{[l|q]}}
%1 = call i16 @llvm.vector.reduce.umin.v2i16(<2 x i16> %a0)
ret i16 %1
}
-define i16 @test_v4i16(<4 x i16> %a0) {
+define i16 @test_v4i16(<4 x i16> %a0) nounwind {
; SSE2-LABEL: test_v4i16:
; SSE2: # %bb.0:
; SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
@@ -1307,7 +2414,7 @@ define i16 @test_v4i16(<4 x i16> %a0) {
; SSE2-NEXT: psubw %xmm2, %xmm0
; SSE2-NEXT: movd %xmm0, %eax
; SSE2-NEXT: # kill: def $ax killed $ax killed $eax
-; SSE2-NEXT: retq
+; SSE2-NEXT: ret{{[l|q]}}
;
; SSE4-LABEL: test_v4i16:
; SSE4: # %bb.0:
@@ -1318,7 +2425,7 @@ define i16 @test_v4i16(<4 x i16> %a0) {
; SSE4-NEXT: pminuw %xmm1, %xmm0
; SSE4-NEXT: movd %xmm0, %eax
; SSE4-NEXT: # kill: def $ax killed $ax killed $eax
-; SSE4-NEXT: retq
+; SSE4-NEXT: ret{{[l|q]}}
;
; AVX-LABEL: test_v4i16:
; AVX: # %bb.0:
@@ -1328,22 +2435,12 @@ define i16 @test_v4i16(<4 x i16> %a0) {
; AVX-NEXT: vpminuw %xmm1, %xmm0, %xmm0
; AVX-NEXT: vmovd %xmm0, %eax
; AVX-NEXT: # kill: def $ax killed $ax killed $eax
-; AVX-NEXT: retq
-;
-; AVX512-LABEL: test_v4i16:
-; AVX512: # %bb.0:
-; AVX512-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
-; AVX512-NEXT: vpminuw %xmm1, %xmm0, %xmm0
-; AVX512-NEXT: vpsrld $16, %xmm0, %xmm1
-; AVX512-NEXT: vpminuw %xmm1, %xmm0, %xmm0
-; AVX512-NEXT: vmovd %xmm0, %eax
-; AVX512-NEXT: # kill: def $ax killed $ax killed $eax
-; AVX512-NEXT: retq
+; AVX-NEXT: ret{{[l|q]}}
%1 = call i16 @llvm.vector.reduce.umin.v4i16(<4 x i16> %a0)
ret i16 %1
}
-define i16 @test_v8i16(<8 x i16> %a0) {
+define i16 @test_v8i16(<8 x i16> %a0) nounwind {
; SSE2-LABEL: test_v8i16:
; SSE2: # %bb.0:
; SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
@@ -1361,33 +2458,26 @@ define i16 @test_v8i16(<8 x i16> %a0) {
; SSE2-NEXT: psubw %xmm2, %xmm0
; SSE2-NEXT: movd %xmm0, %eax
; SSE2-NEXT: # kill: def $ax killed $ax killed $eax
-; SSE2-NEXT: retq
+; SSE2-NEXT: ret{{[l|q]}}
;
; SSE4-LABEL: test_v8i16:
; SSE4: # %bb.0:
; SSE4-NEXT: phminposuw %xmm0, %xmm0
; SSE4-NEXT: movd %xmm0, %eax
; SSE4-NEXT: # kill: def $ax killed $ax killed $eax
-; SSE4-NEXT: retq
+; SSE4-NEXT: ret{{[l|q]}}
;
; AVX-LABEL: test_v8i16:
; AVX: # %bb.0:
; AVX-NEXT: vphminposuw %xmm0, %xmm0
; AVX-NEXT: vmovd %xmm0, %eax
; AVX-NEXT: # kill: def $ax killed $ax killed $eax
-; AVX-NEXT: retq
-;
-; AVX512-LABEL: test_v8i16:
-; AVX512: # %bb.0:
-; AVX512-NEXT: vphminposuw %xmm0, %xmm0
-; AVX512-NEXT: vmovd %xmm0, %eax
-; AVX512-NEXT: # kill: def $ax killed $ax killed $eax
-; AVX512-NEXT: retq
+; AVX-NEXT: ret{{[l|q]}}
%1 = call i16 @llvm.vector.reduce.umin.v8i16(<8 x i16> %a0)
ret i16 %1
}
-define i16 @test_v16i16(<16 x i16> %a0) {
+define i16 @test_v16i16(<16 x i16> %a0) nounwind {
; SSE2-LABEL: test_v16i16:
; SSE2: # %bb.0:
; SSE2-NEXT: movdqa %xmm0, %xmm2
@@ -1408,7 +2498,7 @@ define i16 @test_v16i16(<16 x i16> %a0) {
; SSE2-NEXT: psubw %xmm2, %xmm0
; SSE2-NEXT: movd %xmm0, %eax
; SSE2-NEXT: # kill: def $ax killed $ax killed $eax
-; SSE2-NEXT: retq
+; SSE2-NEXT: ret{{[l|q]}}
;
; SSE4-LABEL: test_v16i16:
; SSE4: # %bb.0:
@@ -1416,7 +2506,7 @@ define i16 @test_v16i16(<16 x i16> %a0) {
; SSE4-NEXT: phminposuw %xmm0, %xmm0
; SSE4-NEXT: movd %xmm0, %eax
; SSE4-NEXT: # kill: def $ax killed $ax killed $eax
-; SSE4-NEXT: retq
+; SSE4-NEXT: ret{{[l|q]}}
;
; AVX1-LABEL: test_v16i16:
; AVX1: # %bb.0:
@@ -1426,7 +2516,7 @@ define i16 @test_v16i16(<16 x i16> %a0) {
; AVX1-NEXT: vmovd %xmm0, %eax
; AVX1-NEXT: # kill: def $ax killed $ax killed $eax
; AVX1-NEXT: vzeroupper
-; AVX1-NEXT: retq
+; AVX1-NEXT: ret{{[l|q]}}
;
; AVX2-LABEL: test_v16i16:
; AVX2: # %bb.0:
@@ -1436,7 +2526,7 @@ define i16 @test_v16i16(<16 x i16> %a0) {
; AVX2-NEXT: vmovd %xmm0, %eax
; AVX2-NEXT: # kill: def $ax killed $ax killed $eax
; AVX2-NEXT: vzeroupper
-; AVX2-NEXT: retq
+; AVX2-NEXT: ret{{[l|q]}}
;
; AVX512-LABEL: test_v16i16:
; AVX512: # %bb.0:
@@ -1451,44 +2541,94 @@ define i16 @test_v16i16(<16 x i16> %a0) {
ret i16 %1
}
-define i16 @test_v32i16(<32 x i16> %a0) {
-; SSE2-LABEL: test_v32i16:
-; SSE2: # %bb.0:
-; SSE2-NEXT: movdqa %xmm1, %xmm4
-; SSE2-NEXT: psubusw %xmm3, %xmm4
-; SSE2-NEXT: psubw %xmm4, %xmm1
-; SSE2-NEXT: movdqa %xmm0, %xmm3
-; SSE2-NEXT: psubusw %xmm2, %xmm3
-; SSE2-NEXT: psubw %xmm3, %xmm0
-; SSE2-NEXT: movdqa %xmm0, %xmm2
-; SSE2-NEXT: psubusw %xmm1, %xmm2
-; SSE2-NEXT: psubw %xmm2, %xmm0
-; SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
-; SSE2-NEXT: movdqa %xmm0, %xmm2
-; SSE2-NEXT: psubusw %xmm1, %xmm2
-; SSE2-NEXT: psubw %xmm2, %xmm0
-; SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
-; SSE2-NEXT: movdqa %xmm0, %xmm2
-; SSE2-NEXT: psubusw %xmm1, %xmm2
-; SSE2-NEXT: psubw %xmm2, %xmm0
-; SSE2-NEXT: movdqa %xmm0, %xmm1
-; SSE2-NEXT: psrld $16, %xmm1
-; SSE2-NEXT: movdqa %xmm0, %xmm2
-; SSE2-NEXT: psubusw %xmm1, %xmm2
-; SSE2-NEXT: psubw %xmm2, %xmm0
-; SSE2-NEXT: movd %xmm0, %eax
-; SSE2-NEXT: # kill: def $ax killed $ax killed $eax
-; SSE2-NEXT: retq
-;
-; SSE4-LABEL: test_v32i16:
-; SSE4: # %bb.0:
-; SSE4-NEXT: pminuw %xmm3, %xmm1
-; SSE4-NEXT: pminuw %xmm2, %xmm0
-; SSE4-NEXT: pminuw %xmm1, %xmm0
-; SSE4-NEXT: phminposuw %xmm0, %xmm0
-; SSE4-NEXT: movd %xmm0, %eax
-; SSE4-NEXT: # kill: def $ax killed $ax killed $eax
-; SSE4-NEXT: retq
+define i16 @test_v32i16(<32 x i16> %a0) nounwind {
+; X86-SSE2-LABEL: test_v32i16:
+; X86-SSE2: # %bb.0:
+; X86-SSE2-NEXT: pushl %ebp
+; X86-SSE2-NEXT: movl %esp, %ebp
+; X86-SSE2-NEXT: andl $-16, %esp
+; X86-SSE2-NEXT: subl $16, %esp
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm3
+; X86-SSE2-NEXT: psubusw 8(%ebp), %xmm3
+; X86-SSE2-NEXT: psubw %xmm3, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm3
+; X86-SSE2-NEXT: psubusw %xmm2, %xmm3
+; X86-SSE2-NEXT: psubw %xmm3, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE2-NEXT: psubusw %xmm1, %xmm2
+; X86-SSE2-NEXT: psubw %xmm2, %xmm0
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE2-NEXT: psubusw %xmm1, %xmm2
+; X86-SSE2-NEXT: psubw %xmm2, %xmm0
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE2-NEXT: psubusw %xmm1, %xmm2
+; X86-SSE2-NEXT: psubw %xmm2, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X86-SSE2-NEXT: psrld $16, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE2-NEXT: psubusw %xmm1, %xmm2
+; X86-SSE2-NEXT: psubw %xmm2, %xmm0
+; X86-SSE2-NEXT: movd %xmm0, %eax
+; X86-SSE2-NEXT: # kill: def $ax killed $ax killed $eax
+; X86-SSE2-NEXT: movl %ebp, %esp
+; X86-SSE2-NEXT: popl %ebp
+; X86-SSE2-NEXT: retl
+;
+; X64-SSE2-LABEL: test_v32i16:
+; X64-SSE2: # %bb.0:
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm4
+; X64-SSE2-NEXT: psubusw %xmm3, %xmm4
+; X64-SSE2-NEXT: psubw %xmm4, %xmm1
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm3
+; X64-SSE2-NEXT: psubusw %xmm2, %xmm3
+; X64-SSE2-NEXT: psubw %xmm3, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X64-SSE2-NEXT: psubusw %xmm1, %xmm2
+; X64-SSE2-NEXT: psubw %xmm2, %xmm0
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X64-SSE2-NEXT: psubusw %xmm1, %xmm2
+; X64-SSE2-NEXT: psubw %xmm2, %xmm0
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X64-SSE2-NEXT: psubusw %xmm1, %xmm2
+; X64-SSE2-NEXT: psubw %xmm2, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X64-SSE2-NEXT: psrld $16, %xmm1
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X64-SSE2-NEXT: psubusw %xmm1, %xmm2
+; X64-SSE2-NEXT: psubw %xmm2, %xmm0
+; X64-SSE2-NEXT: movd %xmm0, %eax
+; X64-SSE2-NEXT: # kill: def $ax killed $ax killed $eax
+; X64-SSE2-NEXT: retq
+;
+; X86-SSE4-LABEL: test_v32i16:
+; X86-SSE4: # %bb.0:
+; X86-SSE4-NEXT: pushl %ebp
+; X86-SSE4-NEXT: movl %esp, %ebp
+; X86-SSE4-NEXT: andl $-16, %esp
+; X86-SSE4-NEXT: subl $16, %esp
+; X86-SSE4-NEXT: pminuw %xmm2, %xmm0
+; X86-SSE4-NEXT: pminuw 8(%ebp), %xmm1
+; X86-SSE4-NEXT: pminuw %xmm0, %xmm1
+; X86-SSE4-NEXT: phminposuw %xmm1, %xmm0
+; X86-SSE4-NEXT: movd %xmm0, %eax
+; X86-SSE4-NEXT: # kill: def $ax killed $ax killed $eax
+; X86-SSE4-NEXT: movl %ebp, %esp
+; X86-SSE4-NEXT: popl %ebp
+; X86-SSE4-NEXT: retl
+;
+; X64-SSE4-LABEL: test_v32i16:
+; X64-SSE4: # %bb.0:
+; X64-SSE4-NEXT: pminuw %xmm3, %xmm1
+; X64-SSE4-NEXT: pminuw %xmm2, %xmm0
+; X64-SSE4-NEXT: pminuw %xmm1, %xmm0
+; X64-SSE4-NEXT: phminposuw %xmm0, %xmm0
+; X64-SSE4-NEXT: movd %xmm0, %eax
+; X64-SSE4-NEXT: # kill: def $ax killed $ax killed $eax
+; X64-SSE4-NEXT: retq
;
; AVX1-LABEL: test_v32i16:
; AVX1: # %bb.0:
@@ -1501,7 +2641,7 @@ define i16 @test_v32i16(<32 x i16> %a0) {
; AVX1-NEXT: vmovd %xmm0, %eax
; AVX1-NEXT: # kill: def $ax killed $ax killed $eax
; AVX1-NEXT: vzeroupper
-; AVX1-NEXT: retq
+; AVX1-NEXT: ret{{[l|q]}}
;
; AVX2-LABEL: test_v32i16:
; AVX2: # %bb.0:
@@ -1512,7 +2652,7 @@ define i16 @test_v32i16(<32 x i16> %a0) {
; AVX2-NEXT: vmovd %xmm0, %eax
; AVX2-NEXT: # kill: def $ax killed $ax killed $eax
; AVX2-NEXT: vzeroupper
-; AVX2-NEXT: retq
+; AVX2-NEXT: ret{{[l|q]}}
;
; AVX512-LABEL: test_v32i16:
; AVX512: # %bb.0:
@@ -1529,92 +2669,203 @@ define i16 @test_v32i16(<32 x i16> %a0) {
ret i16 %1
}
-define i16 @test_v64i16(<64 x i16> %a0) {
-; SSE2-LABEL: test_v64i16:
-; SSE2: # %bb.0:
-; SSE2-NEXT: movdqa %xmm3, %xmm8
-; SSE2-NEXT: psubusw %xmm7, %xmm8
-; SSE2-NEXT: psubw %xmm8, %xmm3
-; SSE2-NEXT: movdqa %xmm1, %xmm7
-; SSE2-NEXT: psubusw %xmm5, %xmm7
-; SSE2-NEXT: psubw %xmm7, %xmm1
-; SSE2-NEXT: movdqa %xmm1, %xmm5
-; SSE2-NEXT: psubusw %xmm3, %xmm5
-; SSE2-NEXT: psubw %xmm5, %xmm1
-; SSE2-NEXT: movdqa %xmm2, %xmm3
-; SSE2-NEXT: psubusw %xmm6, %xmm3
-; SSE2-NEXT: psubw %xmm3, %xmm2
-; SSE2-NEXT: movdqa %xmm0, %xmm3
-; SSE2-NEXT: psubusw %xmm4, %xmm3
-; SSE2-NEXT: psubw %xmm3, %xmm0
-; SSE2-NEXT: movdqa %xmm0, %xmm3
-; SSE2-NEXT: psubusw %xmm2, %xmm3
-; SSE2-NEXT: psubw %xmm3, %xmm0
-; SSE2-NEXT: movdqa %xmm0, %xmm2
-; SSE2-NEXT: psubusw %xmm1, %xmm2
-; SSE2-NEXT: psubw %xmm2, %xmm0
-; SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
-; SSE2-NEXT: movdqa %xmm0, %xmm2
-; SSE2-NEXT: psubusw %xmm1, %xmm2
-; SSE2-NEXT: psubw %xmm2, %xmm0
-; SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
-; SSE2-NEXT: movdqa %xmm0, %xmm2
-; SSE2-NEXT: psubusw %xmm1, %xmm2
-; SSE2-NEXT: psubw %xmm2, %xmm0
-; SSE2-NEXT: movdqa %xmm0, %xmm1
-; SSE2-NEXT: psrld $16, %xmm1
-; SSE2-NEXT: movdqa %xmm0, %xmm2
-; SSE2-NEXT: psubusw %xmm1, %xmm2
-; SSE2-NEXT: psubw %xmm2, %xmm0
-; SSE2-NEXT: movd %xmm0, %eax
-; SSE2-NEXT: # kill: def $ax killed $ax killed $eax
-; SSE2-NEXT: retq
-;
-; SSE4-LABEL: test_v64i16:
-; SSE4: # %bb.0:
-; SSE4-NEXT: pminuw %xmm7, %xmm3
-; SSE4-NEXT: pminuw %xmm5, %xmm1
-; SSE4-NEXT: pminuw %xmm3, %xmm1
-; SSE4-NEXT: pminuw %xmm6, %xmm2
-; SSE4-NEXT: pminuw %xmm4, %xmm0
-; SSE4-NEXT: pminuw %xmm2, %xmm0
-; SSE4-NEXT: pminuw %xmm1, %xmm0
-; SSE4-NEXT: phminposuw %xmm0, %xmm0
-; SSE4-NEXT: movd %xmm0, %eax
-; SSE4-NEXT: # kill: def $ax killed $ax killed $eax
-; SSE4-NEXT: retq
-;
-; AVX1-LABEL: test_v64i16:
-; AVX1: # %bb.0:
-; AVX1-NEXT: vextractf128 $1, %ymm3, %xmm4
-; AVX1-NEXT: vextractf128 $1, %ymm1, %xmm5
-; AVX1-NEXT: vpminuw %xmm4, %xmm5, %xmm4
-; AVX1-NEXT: vextractf128 $1, %ymm2, %xmm5
-; AVX1-NEXT: vextractf128 $1, %ymm0, %xmm6
-; AVX1-NEXT: vpminuw %xmm5, %xmm6, %xmm5
-; AVX1-NEXT: vpminuw %xmm4, %xmm5, %xmm4
-; AVX1-NEXT: vpminuw %xmm3, %xmm1, %xmm1
-; AVX1-NEXT: vpminuw %xmm2, %xmm0, %xmm0
-; AVX1-NEXT: vpminuw %xmm1, %xmm0, %xmm0
-; AVX1-NEXT: vpminuw %xmm4, %xmm0, %xmm0
-; AVX1-NEXT: vphminposuw %xmm0, %xmm0
-; AVX1-NEXT: vmovd %xmm0, %eax
-; AVX1-NEXT: # kill: def $ax killed $ax killed $eax
-; AVX1-NEXT: vzeroupper
-; AVX1-NEXT: retq
-;
-; AVX2-LABEL: test_v64i16:
-; AVX2: # %bb.0:
-; AVX2-NEXT: vpminuw %ymm3, %ymm1, %ymm1
-; AVX2-NEXT: vpminuw %ymm2, %ymm0, %ymm0
-; AVX2-NEXT: vpminuw %ymm1, %ymm0, %ymm0
-; AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
-; AVX2-NEXT: vpminuw %xmm1, %xmm0, %xmm0
-; AVX2-NEXT: vphminposuw %xmm0, %xmm0
-; AVX2-NEXT: vmovd %xmm0, %eax
-; AVX2-NEXT: # kill: def $ax killed $ax killed $eax
-; AVX2-NEXT: vzeroupper
-; AVX2-NEXT: retq
+define i16 @test_v64i16(<64 x i16> %a0) nounwind {
+; X86-SSE2-LABEL: test_v64i16:
+; X86-SSE2: # %bb.0:
+; X86-SSE2-NEXT: pushl %ebp
+; X86-SSE2-NEXT: movl %esp, %ebp
+; X86-SSE2-NEXT: andl $-16, %esp
+; X86-SSE2-NEXT: subl $16, %esp
+; X86-SSE2-NEXT: movdqa 8(%ebp), %xmm3
+; X86-SSE2-NEXT: movdqa %xmm3, %xmm4
+; X86-SSE2-NEXT: psubusw 72(%ebp), %xmm4
+; X86-SSE2-NEXT: psubw %xmm4, %xmm3
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm4
+; X86-SSE2-NEXT: psubusw 40(%ebp), %xmm4
+; X86-SSE2-NEXT: psubw %xmm4, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm4
+; X86-SSE2-NEXT: psubusw %xmm3, %xmm4
+; X86-SSE2-NEXT: psubw %xmm4, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm2, %xmm3
+; X86-SSE2-NEXT: psubusw 56(%ebp), %xmm3
+; X86-SSE2-NEXT: psubw %xmm3, %xmm2
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm3
+; X86-SSE2-NEXT: psubusw 24(%ebp), %xmm3
+; X86-SSE2-NEXT: psubw %xmm3, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm3
+; X86-SSE2-NEXT: psubusw %xmm2, %xmm3
+; X86-SSE2-NEXT: psubw %xmm3, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE2-NEXT: psubusw %xmm1, %xmm2
+; X86-SSE2-NEXT: psubw %xmm2, %xmm0
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE2-NEXT: psubusw %xmm1, %xmm2
+; X86-SSE2-NEXT: psubw %xmm2, %xmm0
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE2-NEXT: psubusw %xmm1, %xmm2
+; X86-SSE2-NEXT: psubw %xmm2, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X86-SSE2-NEXT: psrld $16, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X86-SSE2-NEXT: psubusw %xmm1, %xmm2
+; X86-SSE2-NEXT: psubw %xmm2, %xmm0
+; X86-SSE2-NEXT: movd %xmm0, %eax
+; X86-SSE2-NEXT: # kill: def $ax killed $ax killed $eax
+; X86-SSE2-NEXT: movl %ebp, %esp
+; X86-SSE2-NEXT: popl %ebp
+; X86-SSE2-NEXT: retl
+;
+; X64-SSE2-LABEL: test_v64i16:
+; X64-SSE2: # %bb.0:
+; X64-SSE2-NEXT: movdqa %xmm3, %xmm8
+; X64-SSE2-NEXT: psubusw %xmm7, %xmm8
+; X64-SSE2-NEXT: psubw %xmm8, %xmm3
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm7
+; X64-SSE2-NEXT: psubusw %xmm5, %xmm7
+; X64-SSE2-NEXT: psubw %xmm7, %xmm1
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm5
+; X64-SSE2-NEXT: psubusw %xmm3, %xmm5
+; X64-SSE2-NEXT: psubw %xmm5, %xmm1
+; X64-SSE2-NEXT: movdqa %xmm2, %xmm3
+; X64-SSE2-NEXT: psubusw %xmm6, %xmm3
+; X64-SSE2-NEXT: psubw %xmm3, %xmm2
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm3
+; X64-SSE2-NEXT: psubusw %xmm4, %xmm3
+; X64-SSE2-NEXT: psubw %xmm3, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm3
+; X64-SSE2-NEXT: psubusw %xmm2, %xmm3
+; X64-SSE2-NEXT: psubw %xmm3, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X64-SSE2-NEXT: psubusw %xmm1, %xmm2
+; X64-SSE2-NEXT: psubw %xmm2, %xmm0
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X64-SSE2-NEXT: psubusw %xmm1, %xmm2
+; X64-SSE2-NEXT: psubw %xmm2, %xmm0
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X64-SSE2-NEXT: psubusw %xmm1, %xmm2
+; X64-SSE2-NEXT: psubw %xmm2, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X64-SSE2-NEXT: psrld $16, %xmm1
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm2
+; X64-SSE2-NEXT: psubusw %xmm1, %xmm2
+; X64-SSE2-NEXT: psubw %xmm2, %xmm0
+; X64-SSE2-NEXT: movd %xmm0, %eax
+; X64-SSE2-NEXT: # kill: def $ax killed $ax killed $eax
+; X64-SSE2-NEXT: retq
+;
+; X86-SSE4-LABEL: test_v64i16:
+; X86-SSE4: # %bb.0:
+; X86-SSE4-NEXT: pushl %ebp
+; X86-SSE4-NEXT: movl %esp, %ebp
+; X86-SSE4-NEXT: andl $-16, %esp
+; X86-SSE4-NEXT: subl $16, %esp
+; X86-SSE4-NEXT: movdqa 8(%ebp), %xmm3
+; X86-SSE4-NEXT: pminuw 72(%ebp), %xmm3
+; X86-SSE4-NEXT: pminuw 40(%ebp), %xmm1
+; X86-SSE4-NEXT: pminuw %xmm3, %xmm1
+; X86-SSE4-NEXT: pminuw 56(%ebp), %xmm2
+; X86-SSE4-NEXT: pminuw 24(%ebp), %xmm0
+; X86-SSE4-NEXT: pminuw %xmm2, %xmm0
+; X86-SSE4-NEXT: pminuw %xmm1, %xmm0
+; X86-SSE4-NEXT: phminposuw %xmm0, %xmm0
+; X86-SSE4-NEXT: movd %xmm0, %eax
+; X86-SSE4-NEXT: # kill: def $ax killed $ax killed $eax
+; X86-SSE4-NEXT: movl %ebp, %esp
+; X86-SSE4-NEXT: popl %ebp
+; X86-SSE4-NEXT: retl
+;
+; X64-SSE4-LABEL: test_v64i16:
+; X64-SSE4: # %bb.0:
+; X64-SSE4-NEXT: pminuw %xmm7, %xmm3
+; X64-SSE4-NEXT: pminuw %xmm5, %xmm1
+; X64-SSE4-NEXT: pminuw %xmm3, %xmm1
+; X64-SSE4-NEXT: pminuw %xmm6, %xmm2
+; X64-SSE4-NEXT: pminuw %xmm4, %xmm0
+; X64-SSE4-NEXT: pminuw %xmm2, %xmm0
+; X64-SSE4-NEXT: pminuw %xmm1, %xmm0
+; X64-SSE4-NEXT: phminposuw %xmm0, %xmm0
+; X64-SSE4-NEXT: movd %xmm0, %eax
+; X64-SSE4-NEXT: # kill: def $ax killed $ax killed $eax
+; X64-SSE4-NEXT: retq
+;
+; X86-AVX1-LABEL: test_v64i16:
+; X86-AVX1: # %bb.0:
+; X86-AVX1-NEXT: pushl %ebp
+; X86-AVX1-NEXT: movl %esp, %ebp
+; X86-AVX1-NEXT: andl $-32, %esp
+; X86-AVX1-NEXT: subl $32, %esp
+; X86-AVX1-NEXT: vextractf128 $1, %ymm2, %xmm3
+; X86-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm4
+; X86-AVX1-NEXT: vpminuw %xmm3, %xmm4, %xmm3
+; X86-AVX1-NEXT: vextractf128 $1, %ymm1, %xmm4
+; X86-AVX1-NEXT: vpminuw 24(%ebp), %xmm4, %xmm4
+; X86-AVX1-NEXT: vpminuw %xmm4, %xmm3, %xmm3
+; X86-AVX1-NEXT: vpminuw %xmm2, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpminuw 8(%ebp), %xmm1, %xmm1
+; X86-AVX1-NEXT: vpminuw %xmm1, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpminuw %xmm3, %xmm0, %xmm0
+; X86-AVX1-NEXT: vphminposuw %xmm0, %xmm0
+; X86-AVX1-NEXT: vmovd %xmm0, %eax
+; X86-AVX1-NEXT: # kill: def $ax killed $ax killed $eax
+; X86-AVX1-NEXT: movl %ebp, %esp
+; X86-AVX1-NEXT: popl %ebp
+; X86-AVX1-NEXT: vzeroupper
+; X86-AVX1-NEXT: retl
+;
+; X64-AVX1-LABEL: test_v64i16:
+; X64-AVX1: # %bb.0:
+; X64-AVX1-NEXT: vextractf128 $1, %ymm3, %xmm4
+; X64-AVX1-NEXT: vextractf128 $1, %ymm1, %xmm5
+; X64-AVX1-NEXT: vpminuw %xmm4, %xmm5, %xmm4
+; X64-AVX1-NEXT: vextractf128 $1, %ymm2, %xmm5
+; X64-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm6
+; X64-AVX1-NEXT: vpminuw %xmm5, %xmm6, %xmm5
+; X64-AVX1-NEXT: vpminuw %xmm4, %xmm5, %xmm4
+; X64-AVX1-NEXT: vpminuw %xmm3, %xmm1, %xmm1
+; X64-AVX1-NEXT: vpminuw %xmm2, %xmm0, %xmm0
+; X64-AVX1-NEXT: vpminuw %xmm1, %xmm0, %xmm0
+; X64-AVX1-NEXT: vpminuw %xmm4, %xmm0, %xmm0
+; X64-AVX1-NEXT: vphminposuw %xmm0, %xmm0
+; X64-AVX1-NEXT: vmovd %xmm0, %eax
+; X64-AVX1-NEXT: # kill: def $ax killed $ax killed $eax
+; X64-AVX1-NEXT: vzeroupper
+; X64-AVX1-NEXT: retq
+;
+; X86-AVX2-LABEL: test_v64i16:
+; X86-AVX2: # %bb.0:
+; X86-AVX2-NEXT: pushl %ebp
+; X86-AVX2-NEXT: movl %esp, %ebp
+; X86-AVX2-NEXT: andl $-32, %esp
+; X86-AVX2-NEXT: subl $32, %esp
+; X86-AVX2-NEXT: vpminuw %ymm2, %ymm0, %ymm0
+; X86-AVX2-NEXT: vpminuw 8(%ebp), %ymm1, %ymm1
+; X86-AVX2-NEXT: vpminuw %ymm1, %ymm0, %ymm0
+; X86-AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
+; X86-AVX2-NEXT: vpminuw %xmm1, %xmm0, %xmm0
+; X86-AVX2-NEXT: vphminposuw %xmm0, %xmm0
+; X86-AVX2-NEXT: vmovd %xmm0, %eax
+; X86-AVX2-NEXT: # kill: def $ax killed $ax killed $eax
+; X86-AVX2-NEXT: movl %ebp, %esp
+; X86-AVX2-NEXT: popl %ebp
+; X86-AVX2-NEXT: vzeroupper
+; X86-AVX2-NEXT: retl
+;
+; X64-AVX2-LABEL: test_v64i16:
+; X64-AVX2: # %bb.0:
+; X64-AVX2-NEXT: vpminuw %ymm3, %ymm1, %ymm1
+; X64-AVX2-NEXT: vpminuw %ymm2, %ymm0, %ymm0
+; X64-AVX2-NEXT: vpminuw %ymm1, %ymm0, %ymm0
+; X64-AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
+; X64-AVX2-NEXT: vpminuw %xmm1, %xmm0, %xmm0
+; X64-AVX2-NEXT: vphminposuw %xmm0, %xmm0
+; X64-AVX2-NEXT: vmovd %xmm0, %eax
+; X64-AVX2-NEXT: # kill: def $ax killed $ax killed $eax
+; X64-AVX2-NEXT: vzeroupper
+; X64-AVX2-NEXT: retq
;
; AVX512-LABEL: test_v64i16:
; AVX512: # %bb.0:
@@ -1636,7 +2887,7 @@ define i16 @test_v64i16(<64 x i16> %a0) {
; vXi8
;
-define i8 @test_v2i8(<2 x i8> %a0) {
+define i8 @test_v2i8(<2 x i8> %a0) nounwind {
; SSE-LABEL: test_v2i8:
; SSE: # %bb.0:
; SSE-NEXT: movdqa %xmm0, %xmm1
@@ -1644,7 +2895,7 @@ define i8 @test_v2i8(<2 x i8> %a0) {
; SSE-NEXT: pminub %xmm0, %xmm1
; SSE-NEXT: movd %xmm1, %eax
; SSE-NEXT: # kill: def $al killed $al killed $eax
-; SSE-NEXT: retq
+; SSE-NEXT: ret{{[l|q]}}
;
; AVX-LABEL: test_v2i8:
; AVX: # %bb.0:
@@ -1652,20 +2903,12 @@ define i8 @test_v2i8(<2 x i8> %a0) {
; AVX-NEXT: vpminub %xmm1, %xmm0, %xmm0
; AVX-NEXT: vmovd %xmm0, %eax
; AVX-NEXT: # kill: def $al killed $al killed $eax
-; AVX-NEXT: retq
-;
-; AVX512-LABEL: test_v2i8:
-; AVX512: # %bb.0:
-; AVX512-NEXT: vpsrlw $8, %xmm0, %xmm1
-; AVX512-NEXT: vpminub %xmm1, %xmm0, %xmm0
-; AVX512-NEXT: vmovd %xmm0, %eax
-; AVX512-NEXT: # kill: def $al killed $al killed $eax
-; AVX512-NEXT: retq
+; AVX-NEXT: ret{{[l|q]}}
%1 = call i8 @llvm.vector.reduce.umin.v2i8(<2 x i8> %a0)
ret i8 %1
}
-define i8 @test_v4i8(<4 x i8> %a0) {
+define i8 @test_v4i8(<4 x i8> %a0) nounwind {
; SSE-LABEL: test_v4i8:
; SSE: # %bb.0:
; SSE-NEXT: movdqa %xmm0, %xmm1
@@ -1676,7 +2919,7 @@ define i8 @test_v4i8(<4 x i8> %a0) {
; SSE-NEXT: pminub %xmm1, %xmm0
; SSE-NEXT: movd %xmm0, %eax
; SSE-NEXT: # kill: def $al killed $al killed $eax
-; SSE-NEXT: retq
+; SSE-NEXT: ret{{[l|q]}}
;
; AVX-LABEL: test_v4i8:
; AVX: # %bb.0:
@@ -1686,22 +2929,12 @@ define i8 @test_v4i8(<4 x i8> %a0) {
; AVX-NEXT: vpminub %xmm1, %xmm0, %xmm0
; AVX-NEXT: vmovd %xmm0, %eax
; AVX-NEXT: # kill: def $al killed $al killed $eax
-; AVX-NEXT: retq
-;
-; AVX512-LABEL: test_v4i8:
-; AVX512: # %bb.0:
-; AVX512-NEXT: vpsrld $16, %xmm0, %xmm1
-; AVX512-NEXT: vpminub %xmm1, %xmm0, %xmm0
-; AVX512-NEXT: vpsrlw $8, %xmm0, %xmm1
-; AVX512-NEXT: vpminub %xmm1, %xmm0, %xmm0
-; AVX512-NEXT: vmovd %xmm0, %eax
-; AVX512-NEXT: # kill: def $al killed $al killed $eax
-; AVX512-NEXT: retq
+; AVX-NEXT: ret{{[l|q]}}
%1 = call i8 @llvm.vector.reduce.umin.v4i8(<4 x i8> %a0)
ret i8 %1
}
-define i8 @test_v8i8(<8 x i8> %a0) {
+define i8 @test_v8i8(<8 x i8> %a0) nounwind {
; SSE-LABEL: test_v8i8:
; SSE: # %bb.0:
; SSE-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
@@ -1714,7 +2947,7 @@ define i8 @test_v8i8(<8 x i8> %a0) {
; SSE-NEXT: pminub %xmm0, %xmm1
; SSE-NEXT: movd %xmm1, %eax
; SSE-NEXT: # kill: def $al killed $al killed $eax
-; SSE-NEXT: retq
+; SSE-NEXT: ret{{[l|q]}}
;
; AVX-LABEL: test_v8i8:
; AVX: # %bb.0:
@@ -1726,24 +2959,12 @@ define i8 @test_v8i8(<8 x i8> %a0) {
; AVX-NEXT: vpminub %xmm1, %xmm0, %xmm0
; AVX-NEXT: vmovd %xmm0, %eax
; AVX-NEXT: # kill: def $al killed $al killed $eax
-; AVX-NEXT: retq
-;
-; AVX512-LABEL: test_v8i8:
-; AVX512: # %bb.0:
-; AVX512-NEXT: vpshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
-; AVX512-NEXT: vpminub %xmm1, %xmm0, %xmm0
-; AVX512-NEXT: vpsrld $16, %xmm0, %xmm1
-; AVX512-NEXT: vpminub %xmm1, %xmm0, %xmm0
-; AVX512-NEXT: vpsrlw $8, %xmm0, %xmm1
-; AVX512-NEXT: vpminub %xmm1, %xmm0, %xmm0
-; AVX512-NEXT: vmovd %xmm0, %eax
-; AVX512-NEXT: # kill: def $al killed $al killed $eax
-; AVX512-NEXT: retq
+; AVX-NEXT: ret{{[l|q]}}
%1 = call i8 @llvm.vector.reduce.umin.v8i8(<8 x i8> %a0)
ret i8 %1
}
-define i8 @test_v16i8(<16 x i8> %a0) {
+define i8 @test_v16i8(<16 x i8> %a0) nounwind {
; SSE2-LABEL: test_v16i8:
; SSE2: # %bb.0:
; SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
@@ -1758,7 +2979,7 @@ define i8 @test_v16i8(<16 x i8> %a0) {
; SSE2-NEXT: pminub %xmm1, %xmm0
; SSE2-NEXT: movd %xmm0, %eax
; SSE2-NEXT: # kill: def $al killed $al killed $eax
-; SSE2-NEXT: retq
+; SSE2-NEXT: ret{{[l|q]}}
;
; SSE4-LABEL: test_v16i8:
; SSE4: # %bb.0:
@@ -1768,7 +2989,7 @@ define i8 @test_v16i8(<16 x i8> %a0) {
; SSE4-NEXT: phminposuw %xmm1, %xmm0
; SSE4-NEXT: movd %xmm0, %eax
; SSE4-NEXT: # kill: def $al killed $al killed $eax
-; SSE4-NEXT: retq
+; SSE4-NEXT: ret{{[l|q]}}
;
; AVX-LABEL: test_v16i8:
; AVX: # %bb.0:
@@ -1777,21 +2998,12 @@ define i8 @test_v16i8(<16 x i8> %a0) {
; AVX-NEXT: vphminposuw %xmm0, %xmm0
; AVX-NEXT: vmovd %xmm0, %eax
; AVX-NEXT: # kill: def $al killed $al killed $eax
-; AVX-NEXT: retq
-;
-; AVX512-LABEL: test_v16i8:
-; AVX512: # %bb.0:
-; AVX512-NEXT: vpsrlw $8, %xmm0, %xmm1
-; AVX512-NEXT: vpminub %xmm1, %xmm0, %xmm0
-; AVX512-NEXT: vphminposuw %xmm0, %xmm0
-; AVX512-NEXT: vmovd %xmm0, %eax
-; AVX512-NEXT: # kill: def $al killed $al killed $eax
-; AVX512-NEXT: retq
+; AVX-NEXT: ret{{[l|q]}}
%1 = call i8 @llvm.vector.reduce.umin.v16i8(<16 x i8> %a0)
ret i8 %1
}
-define i8 @test_v32i8(<32 x i8> %a0) {
+define i8 @test_v32i8(<32 x i8> %a0) nounwind {
; SSE2-LABEL: test_v32i8:
; SSE2: # %bb.0:
; SSE2-NEXT: pminub %xmm1, %xmm0
@@ -1807,7 +3019,7 @@ define i8 @test_v32i8(<32 x i8> %a0) {
; SSE2-NEXT: pminub %xmm1, %xmm0
; SSE2-NEXT: movd %xmm0, %eax
; SSE2-NEXT: # kill: def $al killed $al killed $eax
-; SSE2-NEXT: retq
+; SSE2-NEXT: ret{{[l|q]}}
;
; SSE4-LABEL: test_v32i8:
; SSE4: # %bb.0:
@@ -1818,7 +3030,7 @@ define i8 @test_v32i8(<32 x i8> %a0) {
; SSE4-NEXT: phminposuw %xmm1, %xmm0
; SSE4-NEXT: movd %xmm0, %eax
; SSE4-NEXT: # kill: def $al killed $al killed $eax
-; SSE4-NEXT: retq
+; SSE4-NEXT: ret{{[l|q]}}
;
; AVX1-LABEL: test_v32i8:
; AVX1: # %bb.0:
@@ -1830,7 +3042,7 @@ define i8 @test_v32i8(<32 x i8> %a0) {
; AVX1-NEXT: vmovd %xmm0, %eax
; AVX1-NEXT: # kill: def $al killed $al killed $eax
; AVX1-NEXT: vzeroupper
-; AVX1-NEXT: retq
+; AVX1-NEXT: ret{{[l|q]}}
;
; AVX2-LABEL: test_v32i8:
; AVX2: # %bb.0:
@@ -1842,7 +3054,7 @@ define i8 @test_v32i8(<32 x i8> %a0) {
; AVX2-NEXT: vmovd %xmm0, %eax
; AVX2-NEXT: # kill: def $al killed $al killed $eax
; AVX2-NEXT: vzeroupper
-; AVX2-NEXT: retq
+; AVX2-NEXT: ret{{[l|q]}}
;
; AVX512-LABEL: test_v32i8:
; AVX512: # %bb.0:
@@ -1859,38 +3071,82 @@ define i8 @test_v32i8(<32 x i8> %a0) {
ret i8 %1
}
-define i8 @test_v64i8(<64 x i8> %a0) {
-; SSE2-LABEL: test_v64i8:
-; SSE2: # %bb.0:
-; SSE2-NEXT: pminub %xmm3, %xmm1
-; SSE2-NEXT: pminub %xmm2, %xmm0
-; SSE2-NEXT: pminub %xmm1, %xmm0
-; SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
-; SSE2-NEXT: pminub %xmm0, %xmm1
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
-; SSE2-NEXT: pminub %xmm1, %xmm0
-; SSE2-NEXT: movdqa %xmm0, %xmm1
-; SSE2-NEXT: psrld $16, %xmm1
-; SSE2-NEXT: pminub %xmm0, %xmm1
-; SSE2-NEXT: movdqa %xmm1, %xmm0
-; SSE2-NEXT: psrlw $8, %xmm0
-; SSE2-NEXT: pminub %xmm1, %xmm0
-; SSE2-NEXT: movd %xmm0, %eax
-; SSE2-NEXT: # kill: def $al killed $al killed $eax
-; SSE2-NEXT: retq
-;
-; SSE4-LABEL: test_v64i8:
-; SSE4: # %bb.0:
-; SSE4-NEXT: pminub %xmm3, %xmm1
-; SSE4-NEXT: pminub %xmm2, %xmm0
-; SSE4-NEXT: pminub %xmm1, %xmm0
-; SSE4-NEXT: movdqa %xmm0, %xmm1
-; SSE4-NEXT: psrlw $8, %xmm1
-; SSE4-NEXT: pminub %xmm0, %xmm1
-; SSE4-NEXT: phminposuw %xmm1, %xmm0
-; SSE4-NEXT: movd %xmm0, %eax
-; SSE4-NEXT: # kill: def $al killed $al killed $eax
-; SSE4-NEXT: retq
+define i8 @test_v64i8(<64 x i8> %a0) nounwind {
+; X86-SSE2-LABEL: test_v64i8:
+; X86-SSE2: # %bb.0:
+; X86-SSE2-NEXT: pushl %ebp
+; X86-SSE2-NEXT: movl %esp, %ebp
+; X86-SSE2-NEXT: andl $-16, %esp
+; X86-SSE2-NEXT: subl $16, %esp
+; X86-SSE2-NEXT: pminub %xmm2, %xmm0
+; X86-SSE2-NEXT: pminub 8(%ebp), %xmm1
+; X86-SSE2-NEXT: pminub %xmm0, %xmm1
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
+; X86-SSE2-NEXT: pminub %xmm1, %xmm0
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; X86-SSE2-NEXT: pminub %xmm0, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE2-NEXT: psrld $16, %xmm0
+; X86-SSE2-NEXT: pminub %xmm1, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X86-SSE2-NEXT: psrlw $8, %xmm1
+; X86-SSE2-NEXT: pminub %xmm0, %xmm1
+; X86-SSE2-NEXT: movd %xmm1, %eax
+; X86-SSE2-NEXT: # kill: def $al killed $al killed $eax
+; X86-SSE2-NEXT: movl %ebp, %esp
+; X86-SSE2-NEXT: popl %ebp
+; X86-SSE2-NEXT: retl
+;
+; X64-SSE2-LABEL: test_v64i8:
+; X64-SSE2: # %bb.0:
+; X64-SSE2-NEXT: pminub %xmm3, %xmm1
+; X64-SSE2-NEXT: pminub %xmm2, %xmm0
+; X64-SSE2-NEXT: pminub %xmm1, %xmm0
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X64-SSE2-NEXT: pminub %xmm0, %xmm1
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
+; X64-SSE2-NEXT: pminub %xmm1, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X64-SSE2-NEXT: psrld $16, %xmm1
+; X64-SSE2-NEXT: pminub %xmm0, %xmm1
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X64-SSE2-NEXT: psrlw $8, %xmm0
+; X64-SSE2-NEXT: pminub %xmm1, %xmm0
+; X64-SSE2-NEXT: movd %xmm0, %eax
+; X64-SSE2-NEXT: # kill: def $al killed $al killed $eax
+; X64-SSE2-NEXT: retq
+;
+; X86-SSE4-LABEL: test_v64i8:
+; X86-SSE4: # %bb.0:
+; X86-SSE4-NEXT: pushl %ebp
+; X86-SSE4-NEXT: movl %esp, %ebp
+; X86-SSE4-NEXT: andl $-16, %esp
+; X86-SSE4-NEXT: subl $16, %esp
+; X86-SSE4-NEXT: pminub %xmm2, %xmm0
+; X86-SSE4-NEXT: pminub 8(%ebp), %xmm1
+; X86-SSE4-NEXT: pminub %xmm0, %xmm1
+; X86-SSE4-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE4-NEXT: psrlw $8, %xmm0
+; X86-SSE4-NEXT: pminub %xmm1, %xmm0
+; X86-SSE4-NEXT: phminposuw %xmm0, %xmm0
+; X86-SSE4-NEXT: movd %xmm0, %eax
+; X86-SSE4-NEXT: # kill: def $al killed $al killed $eax
+; X86-SSE4-NEXT: movl %ebp, %esp
+; X86-SSE4-NEXT: popl %ebp
+; X86-SSE4-NEXT: retl
+;
+; X64-SSE4-LABEL: test_v64i8:
+; X64-SSE4: # %bb.0:
+; X64-SSE4-NEXT: pminub %xmm3, %xmm1
+; X64-SSE4-NEXT: pminub %xmm2, %xmm0
+; X64-SSE4-NEXT: pminub %xmm1, %xmm0
+; X64-SSE4-NEXT: movdqa %xmm0, %xmm1
+; X64-SSE4-NEXT: psrlw $8, %xmm1
+; X64-SSE4-NEXT: pminub %xmm0, %xmm1
+; X64-SSE4-NEXT: phminposuw %xmm1, %xmm0
+; X64-SSE4-NEXT: movd %xmm0, %eax
+; X64-SSE4-NEXT: # kill: def $al killed $al killed $eax
+; X64-SSE4-NEXT: retq
;
; AVX1-LABEL: test_v64i8:
; AVX1: # %bb.0:
@@ -1905,7 +3161,7 @@ define i8 @test_v64i8(<64 x i8> %a0) {
; AVX1-NEXT: vmovd %xmm0, %eax
; AVX1-NEXT: # kill: def $al killed $al killed $eax
; AVX1-NEXT: vzeroupper
-; AVX1-NEXT: retq
+; AVX1-NEXT: ret{{[l|q]}}
;
; AVX2-LABEL: test_v64i8:
; AVX2: # %bb.0:
@@ -1918,7 +3174,7 @@ define i8 @test_v64i8(<64 x i8> %a0) {
; AVX2-NEXT: vmovd %xmm0, %eax
; AVX2-NEXT: # kill: def $al killed $al killed $eax
; AVX2-NEXT: vzeroupper
-; AVX2-NEXT: retq
+; AVX2-NEXT: ret{{[l|q]}}
;
; AVX512-LABEL: test_v64i8:
; AVX512: # %bb.0:
@@ -1937,82 +3193,183 @@ define i8 @test_v64i8(<64 x i8> %a0) {
ret i8 %1
}
-define i8 @test_v128i8(<128 x i8> %a0) {
-; SSE2-LABEL: test_v128i8:
-; SSE2: # %bb.0:
-; SSE2-NEXT: pminub %xmm7, %xmm3
-; SSE2-NEXT: pminub %xmm5, %xmm1
-; SSE2-NEXT: pminub %xmm3, %xmm1
-; SSE2-NEXT: pminub %xmm6, %xmm2
-; SSE2-NEXT: pminub %xmm4, %xmm0
-; SSE2-NEXT: pminub %xmm2, %xmm0
-; SSE2-NEXT: pminub %xmm1, %xmm0
-; SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
-; SSE2-NEXT: pminub %xmm0, %xmm1
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
-; SSE2-NEXT: pminub %xmm1, %xmm0
-; SSE2-NEXT: movdqa %xmm0, %xmm1
-; SSE2-NEXT: psrld $16, %xmm1
-; SSE2-NEXT: pminub %xmm0, %xmm1
-; SSE2-NEXT: movdqa %xmm1, %xmm0
-; SSE2-NEXT: psrlw $8, %xmm0
-; SSE2-NEXT: pminub %xmm1, %xmm0
-; SSE2-NEXT: movd %xmm0, %eax
-; SSE2-NEXT: # kill: def $al killed $al killed $eax
-; SSE2-NEXT: retq
-;
-; SSE4-LABEL: test_v128i8:
-; SSE4: # %bb.0:
-; SSE4-NEXT: pminub %xmm7, %xmm3
-; SSE4-NEXT: pminub %xmm5, %xmm1
-; SSE4-NEXT: pminub %xmm3, %xmm1
-; SSE4-NEXT: pminub %xmm6, %xmm2
-; SSE4-NEXT: pminub %xmm4, %xmm0
-; SSE4-NEXT: pminub %xmm2, %xmm0
-; SSE4-NEXT: pminub %xmm1, %xmm0
-; SSE4-NEXT: movdqa %xmm0, %xmm1
-; SSE4-NEXT: psrlw $8, %xmm1
-; SSE4-NEXT: pminub %xmm0, %xmm1
-; SSE4-NEXT: phminposuw %xmm1, %xmm0
-; SSE4-NEXT: movd %xmm0, %eax
-; SSE4-NEXT: # kill: def $al killed $al killed $eax
-; SSE4-NEXT: retq
-;
-; AVX1-LABEL: test_v128i8:
-; AVX1: # %bb.0:
-; AVX1-NEXT: vextractf128 $1, %ymm3, %xmm4
-; AVX1-NEXT: vextractf128 $1, %ymm1, %xmm5
-; AVX1-NEXT: vpminub %xmm4, %xmm5, %xmm4
-; AVX1-NEXT: vextractf128 $1, %ymm2, %xmm5
-; AVX1-NEXT: vextractf128 $1, %ymm0, %xmm6
-; AVX1-NEXT: vpminub %xmm5, %xmm6, %xmm5
-; AVX1-NEXT: vpminub %xmm4, %xmm5, %xmm4
-; AVX1-NEXT: vpminub %xmm3, %xmm1, %xmm1
-; AVX1-NEXT: vpminub %xmm2, %xmm0, %xmm0
-; AVX1-NEXT: vpminub %xmm1, %xmm0, %xmm0
-; AVX1-NEXT: vpminub %xmm4, %xmm0, %xmm0
-; AVX1-NEXT: vpsrlw $8, %xmm0, %xmm1
-; AVX1-NEXT: vpminub %xmm1, %xmm0, %xmm0
-; AVX1-NEXT: vphminposuw %xmm0, %xmm0
-; AVX1-NEXT: vmovd %xmm0, %eax
-; AVX1-NEXT: # kill: def $al killed $al killed $eax
-; AVX1-NEXT: vzeroupper
-; AVX1-NEXT: retq
-;
-; AVX2-LABEL: test_v128i8:
-; AVX2: # %bb.0:
-; AVX2-NEXT: vpminub %ymm3, %ymm1, %ymm1
-; AVX2-NEXT: vpminub %ymm2, %ymm0, %ymm0
-; AVX2-NEXT: vpminub %ymm1, %ymm0, %ymm0
-; AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
-; AVX2-NEXT: vpminub %xmm1, %xmm0, %xmm0
-; AVX2-NEXT: vpsrlw $8, %xmm0, %xmm1
-; AVX2-NEXT: vpminub %xmm1, %xmm0, %xmm0
-; AVX2-NEXT: vphminposuw %xmm0, %xmm0
-; AVX2-NEXT: vmovd %xmm0, %eax
-; AVX2-NEXT: # kill: def $al killed $al killed $eax
-; AVX2-NEXT: vzeroupper
-; AVX2-NEXT: retq
+define i8 @test_v128i8(<128 x i8> %a0) nounwind {
+; X86-SSE2-LABEL: test_v128i8:
+; X86-SSE2: # %bb.0:
+; X86-SSE2-NEXT: pushl %ebp
+; X86-SSE2-NEXT: movl %esp, %ebp
+; X86-SSE2-NEXT: andl $-16, %esp
+; X86-SSE2-NEXT: subl $16, %esp
+; X86-SSE2-NEXT: movdqa 8(%ebp), %xmm3
+; X86-SSE2-NEXT: pminub 72(%ebp), %xmm3
+; X86-SSE2-NEXT: pminub 40(%ebp), %xmm1
+; X86-SSE2-NEXT: pminub %xmm3, %xmm1
+; X86-SSE2-NEXT: pminub 56(%ebp), %xmm2
+; X86-SSE2-NEXT: pminub 24(%ebp), %xmm0
+; X86-SSE2-NEXT: pminub %xmm2, %xmm0
+; X86-SSE2-NEXT: pminub %xmm1, %xmm0
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X86-SSE2-NEXT: pminub %xmm0, %xmm1
+; X86-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
+; X86-SSE2-NEXT: pminub %xmm1, %xmm0
+; X86-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X86-SSE2-NEXT: psrld $16, %xmm1
+; X86-SSE2-NEXT: pminub %xmm0, %xmm1
+; X86-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X86-SSE2-NEXT: psrlw $8, %xmm0
+; X86-SSE2-NEXT: pminub %xmm1, %xmm0
+; X86-SSE2-NEXT: movd %xmm0, %eax
+; X86-SSE2-NEXT: # kill: def $al killed $al killed $eax
+; X86-SSE2-NEXT: movl %ebp, %esp
+; X86-SSE2-NEXT: popl %ebp
+; X86-SSE2-NEXT: retl
+;
+; X64-SSE2-LABEL: test_v128i8:
+; X64-SSE2: # %bb.0:
+; X64-SSE2-NEXT: pminub %xmm7, %xmm3
+; X64-SSE2-NEXT: pminub %xmm5, %xmm1
+; X64-SSE2-NEXT: pminub %xmm3, %xmm1
+; X64-SSE2-NEXT: pminub %xmm6, %xmm2
+; X64-SSE2-NEXT: pminub %xmm4, %xmm0
+; X64-SSE2-NEXT: pminub %xmm2, %xmm0
+; X64-SSE2-NEXT: pminub %xmm1, %xmm0
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; X64-SSE2-NEXT: pminub %xmm0, %xmm1
+; X64-SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
+; X64-SSE2-NEXT: pminub %xmm1, %xmm0
+; X64-SSE2-NEXT: movdqa %xmm0, %xmm1
+; X64-SSE2-NEXT: psrld $16, %xmm1
+; X64-SSE2-NEXT: pminub %xmm0, %xmm1
+; X64-SSE2-NEXT: movdqa %xmm1, %xmm0
+; X64-SSE2-NEXT: psrlw $8, %xmm0
+; X64-SSE2-NEXT: pminub %xmm1, %xmm0
+; X64-SSE2-NEXT: movd %xmm0, %eax
+; X64-SSE2-NEXT: # kill: def $al killed $al killed $eax
+; X64-SSE2-NEXT: retq
+;
+; X86-SSE4-LABEL: test_v128i8:
+; X86-SSE4: # %bb.0:
+; X86-SSE4-NEXT: pushl %ebp
+; X86-SSE4-NEXT: movl %esp, %ebp
+; X86-SSE4-NEXT: andl $-16, %esp
+; X86-SSE4-NEXT: subl $16, %esp
+; X86-SSE4-NEXT: movdqa 8(%ebp), %xmm3
+; X86-SSE4-NEXT: pminub 72(%ebp), %xmm3
+; X86-SSE4-NEXT: pminub 40(%ebp), %xmm1
+; X86-SSE4-NEXT: pminub %xmm3, %xmm1
+; X86-SSE4-NEXT: pminub 56(%ebp), %xmm2
+; X86-SSE4-NEXT: pminub 24(%ebp), %xmm0
+; X86-SSE4-NEXT: pminub %xmm2, %xmm0
+; X86-SSE4-NEXT: pminub %xmm1, %xmm0
+; X86-SSE4-NEXT: movdqa %xmm0, %xmm1
+; X86-SSE4-NEXT: psrlw $8, %xmm1
+; X86-SSE4-NEXT: pminub %xmm0, %xmm1
+; X86-SSE4-NEXT: phminposuw %xmm1, %xmm0
+; X86-SSE4-NEXT: movd %xmm0, %eax
+; X86-SSE4-NEXT: # kill: def $al killed $al killed $eax
+; X86-SSE4-NEXT: movl %ebp, %esp
+; X86-SSE4-NEXT: popl %ebp
+; X86-SSE4-NEXT: retl
+;
+; X64-SSE4-LABEL: test_v128i8:
+; X64-SSE4: # %bb.0:
+; X64-SSE4-NEXT: pminub %xmm7, %xmm3
+; X64-SSE4-NEXT: pminub %xmm5, %xmm1
+; X64-SSE4-NEXT: pminub %xmm3, %xmm1
+; X64-SSE4-NEXT: pminub %xmm6, %xmm2
+; X64-SSE4-NEXT: pminub %xmm4, %xmm0
+; X64-SSE4-NEXT: pminub %xmm2, %xmm0
+; X64-SSE4-NEXT: pminub %xmm1, %xmm0
+; X64-SSE4-NEXT: movdqa %xmm0, %xmm1
+; X64-SSE4-NEXT: psrlw $8, %xmm1
+; X64-SSE4-NEXT: pminub %xmm0, %xmm1
+; X64-SSE4-NEXT: phminposuw %xmm1, %xmm0
+; X64-SSE4-NEXT: movd %xmm0, %eax
+; X64-SSE4-NEXT: # kill: def $al killed $al killed $eax
+; X64-SSE4-NEXT: retq
+;
+; X86-AVX1-LABEL: test_v128i8:
+; X86-AVX1: # %bb.0:
+; X86-AVX1-NEXT: pushl %ebp
+; X86-AVX1-NEXT: movl %esp, %ebp
+; X86-AVX1-NEXT: andl $-32, %esp
+; X86-AVX1-NEXT: subl $32, %esp
+; X86-AVX1-NEXT: vextractf128 $1, %ymm2, %xmm3
+; X86-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm4
+; X86-AVX1-NEXT: vpminub %xmm3, %xmm4, %xmm3
+; X86-AVX1-NEXT: vextractf128 $1, %ymm1, %xmm4
+; X86-AVX1-NEXT: vpminub 24(%ebp), %xmm4, %xmm4
+; X86-AVX1-NEXT: vpminub %xmm4, %xmm3, %xmm3
+; X86-AVX1-NEXT: vpminub %xmm2, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpminub 8(%ebp), %xmm1, %xmm1
+; X86-AVX1-NEXT: vpminub %xmm1, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpminub %xmm3, %xmm0, %xmm0
+; X86-AVX1-NEXT: vpsrlw $8, %xmm0, %xmm1
+; X86-AVX1-NEXT: vpminub %xmm1, %xmm0, %xmm0
+; X86-AVX1-NEXT: vphminposuw %xmm0, %xmm0
+; X86-AVX1-NEXT: vmovd %xmm0, %eax
+; X86-AVX1-NEXT: # kill: def $al killed $al killed $eax
+; X86-AVX1-NEXT: movl %ebp, %esp
+; X86-AVX1-NEXT: popl %ebp
+; X86-AVX1-NEXT: vzeroupper
+; X86-AVX1-NEXT: retl
+;
+; X64-AVX1-LABEL: test_v128i8:
+; X64-AVX1: # %bb.0:
+; X64-AVX1-NEXT: vextractf128 $1, %ymm3, %xmm4
+; X64-AVX1-NEXT: vextractf128 $1, %ymm1, %xmm5
+; X64-AVX1-NEXT: vpminub %xmm4, %xmm5, %xmm4
+; X64-AVX1-NEXT: vextractf128 $1, %ymm2, %xmm5
+; X64-AVX1-NEXT: vextractf128 $1, %ymm0, %xmm6
+; X64-AVX1-NEXT: vpminub %xmm5, %xmm6, %xmm5
+; X64-AVX1-NEXT: vpminub %xmm4, %xmm5, %xmm4
+; X64-AVX1-NEXT: vpminub %xmm3, %xmm1, %xmm1
+; X64-AVX1-NEXT: vpminub %xmm2, %xmm0, %xmm0
+; X64-AVX1-NEXT: vpminub %xmm1, %xmm0, %xmm0
+; X64-AVX1-NEXT: vpminub %xmm4, %xmm0, %xmm0
+; X64-AVX1-NEXT: vpsrlw $8, %xmm0, %xmm1
+; X64-AVX1-NEXT: vpminub %xmm1, %xmm0, %xmm0
+; X64-AVX1-NEXT: vphminposuw %xmm0, %xmm0
+; X64-AVX1-NEXT: vmovd %xmm0, %eax
+; X64-AVX1-NEXT: # kill: def $al killed $al killed $eax
+; X64-AVX1-NEXT: vzeroupper
+; X64-AVX1-NEXT: retq
+;
+; X86-AVX2-LABEL: test_v128i8:
+; X86-AVX2: # %bb.0:
+; X86-AVX2-NEXT: pushl %ebp
+; X86-AVX2-NEXT: movl %esp, %ebp
+; X86-AVX2-NEXT: andl $-32, %esp
+; X86-AVX2-NEXT: subl $32, %esp
+; X86-AVX2-NEXT: vpminub %ymm2, %ymm0, %ymm0
+; X86-AVX2-NEXT: vpminub 8(%ebp), %ymm1, %ymm1
+; X86-AVX2-NEXT: vpminub %ymm1, %ymm0, %ymm0
+; X86-AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
+; X86-AVX2-NEXT: vpminub %xmm1, %xmm0, %xmm0
+; X86-AVX2-NEXT: vpsrlw $8, %xmm0, %xmm1
+; X86-AVX2-NEXT: vpminub %xmm1, %xmm0, %xmm0
+; X86-AVX2-NEXT: vphminposuw %xmm0, %xmm0
+; X86-AVX2-NEXT: vmovd %xmm0, %eax
+; X86-AVX2-NEXT: # kill: def $al killed $al killed $eax
+; X86-AVX2-NEXT: movl %ebp, %esp
+; X86-AVX2-NEXT: popl %ebp
+; X86-AVX2-NEXT: vzeroupper
+; X86-AVX2-NEXT: retl
+;
+; X64-AVX2-LABEL: test_v128i8:
+; X64-AVX2: # %bb.0:
+; X64-AVX2-NEXT: vpminub %ymm3, %ymm1, %ymm1
+; X64-AVX2-NEXT: vpminub %ymm2, %ymm0, %ymm0
+; X64-AVX2-NEXT: vpminub %ymm1, %ymm0, %ymm0
+; X64-AVX2-NEXT: vextracti128 $1, %ymm0, %xmm1
+; X64-AVX2-NEXT: vpminub %xmm1, %xmm0, %xmm0
+; X64-AVX2-NEXT: vpsrlw $8, %xmm0, %xmm1
+; X64-AVX2-NEXT: vpminub %xmm1, %xmm0, %xmm0
+; X64-AVX2-NEXT: vphminposuw %xmm0, %xmm0
+; X64-AVX2-NEXT: vmovd %xmm0, %eax
+; X64-AVX2-NEXT: # kill: def $al killed $al killed $eax
+; X64-AVX2-NEXT: vzeroupper
+; X64-AVX2-NEXT: retq
;
; AVX512-LABEL: test_v128i8:
; AVX512: # %bb.0:
More information about the llvm-commits
mailing list