[llvm] [X86] madd.ll - add SSE42 test coverage (PR #205299)
Simon Pilgrim via llvm-commits
llvm-commits at lists.llvm.org
Tue Jun 23 01:58:07 PDT 2026
https://github.com/RKSimon updated https://github.com/llvm/llvm-project/pull/205299
>From 993fb2f9687367b67a046bcc38ee4e4f726bd13a Mon Sep 17 00:00:00 2001
From: Simon Pilgrim <llvm-dev at redking.me.uk>
Date: Tue, 23 Jun 2026 09:51:22 +0100
Subject: [PATCH] [X86] madd.ll - add SSE42 test coverage
---
llvm/test/CodeGen/X86/madd.ll | 1032 +++++++++++++++++++++++----------
1 file changed, 730 insertions(+), 302 deletions(-)
diff --git a/llvm/test/CodeGen/X86/madd.ll b/llvm/test/CodeGen/X86/madd.ll
index 201a0900e6eb9..39fbe706ff369 100644
--- a/llvm/test/CodeGen/X86/madd.ll
+++ b/llvm/test/CodeGen/X86/madd.ll
@@ -1,5 +1,6 @@
; NOTE: Assertions have been autogenerated by utils/update_llc_test_checks.py
-; RUN: llc < %s -mtriple=x86_64-unknown-unknown -mattr=+sse2 | FileCheck %s --check-prefix=SSE2
+; RUN: llc < %s -mtriple=x86_64-unknown-unknown -mattr=+sse2 | FileCheck %s --check-prefixes=SSE,SSE2
+; RUN: llc < %s -mtriple=x86_64-unknown-unknown -mattr=+sse4.2 | FileCheck %s --check-prefixes=SSE,SSE42
; RUN: llc < %s -mtriple=x86_64-unknown-unknown -mattr=+avx | FileCheck %s --check-prefixes=AVX,AVX1
; RUN: llc < %s -mtriple=x86_64-unknown-unknown -mattr=+avx2 | FileCheck %s --check-prefixes=AVX,AVX256,AVX2
; RUN: llc < %s -mtriple=x86_64-unknown-unknown -mattr=+avx512f | FileCheck %s --check-prefixes=AVX,AVX256,AVX512,AVX512F
@@ -32,6 +33,29 @@ define i32 @_Z10test_shortPsS_i_128(ptr nocapture readonly, ptr nocapture readon
; SSE2-NEXT: movd %xmm1, %eax
; SSE2-NEXT: retq
;
+; SSE42-LABEL: _Z10test_shortPsS_i_128:
+; SSE42: # %bb.0: # %entry
+; SSE42-NEXT: movl %edx, %eax
+; SSE42-NEXT: pxor %xmm0, %xmm0
+; SSE42-NEXT: xorl %ecx, %ecx
+; SSE42-NEXT: .p2align 4
+; SSE42-NEXT: .LBB0_1: # %vector.body
+; SSE42-NEXT: # =>This Inner Loop Header: Depth=1
+; SSE42-NEXT: pmovzxwd {{.*#+}} xmm1 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT: pmovzxwd {{.*#+}} xmm2 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT: pmaddwd %xmm1, %xmm2
+; SSE42-NEXT: paddd %xmm2, %xmm0
+; SSE42-NEXT: addq $8, %rcx
+; SSE42-NEXT: cmpq %rcx, %rax
+; SSE42-NEXT: jne .LBB0_1
+; SSE42-NEXT: # %bb.2: # %middle.block
+; SSE42-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; SSE42-NEXT: paddd %xmm0, %xmm1
+; SSE42-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
+; SSE42-NEXT: paddd %xmm1, %xmm0
+; SSE42-NEXT: movd %xmm0, %eax
+; SSE42-NEXT: retq
+;
; AVX-LABEL: _Z10test_shortPsS_i_128:
; AVX: # %bb.0: # %entry
; AVX-NEXT: movl %edx, %eax
@@ -81,30 +105,30 @@ middle.block:
}
define i32 @_Z10test_shortPsS_i_256(ptr nocapture readonly, ptr nocapture readonly, i32) local_unnamed_addr #0 {
-; SSE2-LABEL: _Z10test_shortPsS_i_256:
-; SSE2: # %bb.0: # %entry
-; SSE2-NEXT: movl %edx, %eax
-; SSE2-NEXT: pxor %xmm0, %xmm0
-; SSE2-NEXT: xorl %ecx, %ecx
-; SSE2-NEXT: pxor %xmm1, %xmm1
-; SSE2-NEXT: .p2align 4
-; SSE2-NEXT: .LBB1_1: # %vector.body
-; SSE2-NEXT: # =>This Inner Loop Header: Depth=1
-; SSE2-NEXT: movdqu (%rdi,%rcx,2), %xmm2
-; SSE2-NEXT: movdqu (%rsi,%rcx,2), %xmm3
-; SSE2-NEXT: pmaddwd %xmm2, %xmm3
-; SSE2-NEXT: paddd %xmm3, %xmm1
-; SSE2-NEXT: addq $8, %rcx
-; SSE2-NEXT: cmpq %rcx, %rax
-; SSE2-NEXT: jne .LBB1_1
-; SSE2-NEXT: # %bb.2: # %middle.block
-; SSE2-NEXT: paddd %xmm0, %xmm1
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
-; SSE2-NEXT: paddd %xmm1, %xmm0
-; SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
-; SSE2-NEXT: paddd %xmm0, %xmm1
-; SSE2-NEXT: movd %xmm1, %eax
-; SSE2-NEXT: retq
+; SSE-LABEL: _Z10test_shortPsS_i_256:
+; SSE: # %bb.0: # %entry
+; SSE-NEXT: movl %edx, %eax
+; SSE-NEXT: pxor %xmm0, %xmm0
+; SSE-NEXT: xorl %ecx, %ecx
+; SSE-NEXT: pxor %xmm1, %xmm1
+; SSE-NEXT: .p2align 4
+; SSE-NEXT: .LBB1_1: # %vector.body
+; SSE-NEXT: # =>This Inner Loop Header: Depth=1
+; SSE-NEXT: movdqu (%rdi,%rcx,2), %xmm2
+; SSE-NEXT: movdqu (%rsi,%rcx,2), %xmm3
+; SSE-NEXT: pmaddwd %xmm2, %xmm3
+; SSE-NEXT: paddd %xmm3, %xmm1
+; SSE-NEXT: addq $8, %rcx
+; SSE-NEXT: cmpq %rcx, %rax
+; SSE-NEXT: jne .LBB1_1
+; SSE-NEXT: # %bb.2: # %middle.block
+; SSE-NEXT: paddd %xmm0, %xmm1
+; SSE-NEXT: pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
+; SSE-NEXT: paddd %xmm1, %xmm0
+; SSE-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; SSE-NEXT: paddd %xmm0, %xmm1
+; SSE-NEXT: movd %xmm1, %eax
+; SSE-NEXT: retq
;
; AVX1-LABEL: _Z10test_shortPsS_i_256:
; AVX1: # %bb.0: # %entry
@@ -183,37 +207,37 @@ middle.block:
}
define i32 @_Z10test_shortPsS_i_512(ptr nocapture readonly, ptr nocapture readonly, i32) local_unnamed_addr #0 {
-; SSE2-LABEL: _Z10test_shortPsS_i_512:
-; SSE2: # %bb.0: # %entry
-; SSE2-NEXT: movl %edx, %eax
-; SSE2-NEXT: pxor %xmm0, %xmm0
-; SSE2-NEXT: xorl %ecx, %ecx
-; SSE2-NEXT: pxor %xmm2, %xmm2
-; SSE2-NEXT: pxor %xmm1, %xmm1
-; SSE2-NEXT: .p2align 4
-; SSE2-NEXT: .LBB2_1: # %vector.body
-; SSE2-NEXT: # =>This Inner Loop Header: Depth=1
-; SSE2-NEXT: movdqu (%rdi,%rcx,2), %xmm3
-; SSE2-NEXT: movdqu 16(%rdi,%rcx,2), %xmm4
-; SSE2-NEXT: movdqu (%rsi,%rcx,2), %xmm5
-; SSE2-NEXT: pmaddwd %xmm3, %xmm5
-; SSE2-NEXT: paddd %xmm5, %xmm2
-; SSE2-NEXT: movdqu 16(%rsi,%rcx,2), %xmm3
-; SSE2-NEXT: pmaddwd %xmm4, %xmm3
-; SSE2-NEXT: paddd %xmm3, %xmm1
-; SSE2-NEXT: addq $16, %rcx
-; SSE2-NEXT: cmpq %rcx, %rax
-; SSE2-NEXT: jne .LBB2_1
-; SSE2-NEXT: # %bb.2: # %middle.block
-; SSE2-NEXT: paddd %xmm0, %xmm2
-; SSE2-NEXT: paddd %xmm0, %xmm1
-; SSE2-NEXT: paddd %xmm2, %xmm1
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
-; SSE2-NEXT: paddd %xmm1, %xmm0
-; SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
-; SSE2-NEXT: paddd %xmm0, %xmm1
-; SSE2-NEXT: movd %xmm1, %eax
-; SSE2-NEXT: retq
+; SSE-LABEL: _Z10test_shortPsS_i_512:
+; SSE: # %bb.0: # %entry
+; SSE-NEXT: movl %edx, %eax
+; SSE-NEXT: pxor %xmm0, %xmm0
+; SSE-NEXT: xorl %ecx, %ecx
+; SSE-NEXT: pxor %xmm2, %xmm2
+; SSE-NEXT: pxor %xmm1, %xmm1
+; SSE-NEXT: .p2align 4
+; SSE-NEXT: .LBB2_1: # %vector.body
+; SSE-NEXT: # =>This Inner Loop Header: Depth=1
+; SSE-NEXT: movdqu (%rdi,%rcx,2), %xmm3
+; SSE-NEXT: movdqu 16(%rdi,%rcx,2), %xmm4
+; SSE-NEXT: movdqu (%rsi,%rcx,2), %xmm5
+; SSE-NEXT: pmaddwd %xmm3, %xmm5
+; SSE-NEXT: paddd %xmm5, %xmm2
+; SSE-NEXT: movdqu 16(%rsi,%rcx,2), %xmm3
+; SSE-NEXT: pmaddwd %xmm4, %xmm3
+; SSE-NEXT: paddd %xmm3, %xmm1
+; SSE-NEXT: addq $16, %rcx
+; SSE-NEXT: cmpq %rcx, %rax
+; SSE-NEXT: jne .LBB2_1
+; SSE-NEXT: # %bb.2: # %middle.block
+; SSE-NEXT: paddd %xmm0, %xmm2
+; SSE-NEXT: paddd %xmm0, %xmm1
+; SSE-NEXT: paddd %xmm2, %xmm1
+; SSE-NEXT: pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
+; SSE-NEXT: paddd %xmm1, %xmm0
+; SSE-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; SSE-NEXT: paddd %xmm0, %xmm1
+; SSE-NEXT: movd %xmm1, %eax
+; SSE-NEXT: retq
;
; AVX1-LABEL: _Z10test_shortPsS_i_512:
; AVX1: # %bb.0: # %entry
@@ -329,51 +353,51 @@ middle.block:
}
define i32 @_Z10test_shortPsS_i_1024(ptr nocapture readonly, ptr nocapture readonly, i32) local_unnamed_addr #0 {
-; SSE2-LABEL: _Z10test_shortPsS_i_1024:
-; SSE2: # %bb.0: # %entry
-; SSE2-NEXT: movl %edx, %eax
-; SSE2-NEXT: pxor %xmm0, %xmm0
-; SSE2-NEXT: xorl %ecx, %ecx
-; SSE2-NEXT: pxor %xmm2, %xmm2
-; SSE2-NEXT: pxor %xmm4, %xmm4
-; SSE2-NEXT: pxor %xmm1, %xmm1
-; SSE2-NEXT: pxor %xmm3, %xmm3
-; SSE2-NEXT: .p2align 4
-; SSE2-NEXT: .LBB3_1: # %vector.body
-; SSE2-NEXT: # =>This Inner Loop Header: Depth=1
-; SSE2-NEXT: movdqu (%rdi,%rcx,2), %xmm5
-; SSE2-NEXT: movdqu 16(%rdi,%rcx,2), %xmm6
-; SSE2-NEXT: movdqu 32(%rdi,%rcx,2), %xmm7
-; SSE2-NEXT: movdqu 48(%rdi,%rcx,2), %xmm8
-; SSE2-NEXT: movdqu (%rsi,%rcx,2), %xmm9
-; SSE2-NEXT: pmaddwd %xmm5, %xmm9
-; SSE2-NEXT: paddd %xmm9, %xmm2
-; SSE2-NEXT: movdqu 16(%rsi,%rcx,2), %xmm5
-; SSE2-NEXT: pmaddwd %xmm6, %xmm5
-; SSE2-NEXT: paddd %xmm5, %xmm4
-; SSE2-NEXT: movdqu 32(%rsi,%rcx,2), %xmm5
-; SSE2-NEXT: pmaddwd %xmm7, %xmm5
-; SSE2-NEXT: paddd %xmm5, %xmm1
-; SSE2-NEXT: movdqu 48(%rsi,%rcx,2), %xmm5
-; SSE2-NEXT: pmaddwd %xmm8, %xmm5
-; SSE2-NEXT: paddd %xmm5, %xmm3
-; SSE2-NEXT: addq $16, %rcx
-; SSE2-NEXT: cmpq %rcx, %rax
-; SSE2-NEXT: jne .LBB3_1
-; SSE2-NEXT: # %bb.2: # %middle.block
-; SSE2-NEXT: paddd %xmm0, %xmm4
-; SSE2-NEXT: paddd %xmm0, %xmm3
-; SSE2-NEXT: paddd %xmm4, %xmm3
-; SSE2-NEXT: paddd %xmm0, %xmm2
-; SSE2-NEXT: paddd %xmm0, %xmm1
-; SSE2-NEXT: paddd %xmm2, %xmm1
-; SSE2-NEXT: paddd %xmm3, %xmm1
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
-; SSE2-NEXT: paddd %xmm1, %xmm0
-; SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
-; SSE2-NEXT: paddd %xmm0, %xmm1
-; SSE2-NEXT: movd %xmm1, %eax
-; SSE2-NEXT: retq
+; SSE-LABEL: _Z10test_shortPsS_i_1024:
+; SSE: # %bb.0: # %entry
+; SSE-NEXT: movl %edx, %eax
+; SSE-NEXT: pxor %xmm0, %xmm0
+; SSE-NEXT: xorl %ecx, %ecx
+; SSE-NEXT: pxor %xmm2, %xmm2
+; SSE-NEXT: pxor %xmm4, %xmm4
+; SSE-NEXT: pxor %xmm1, %xmm1
+; SSE-NEXT: pxor %xmm3, %xmm3
+; SSE-NEXT: .p2align 4
+; SSE-NEXT: .LBB3_1: # %vector.body
+; SSE-NEXT: # =>This Inner Loop Header: Depth=1
+; SSE-NEXT: movdqu (%rdi,%rcx,2), %xmm5
+; SSE-NEXT: movdqu 16(%rdi,%rcx,2), %xmm6
+; SSE-NEXT: movdqu 32(%rdi,%rcx,2), %xmm7
+; SSE-NEXT: movdqu 48(%rdi,%rcx,2), %xmm8
+; SSE-NEXT: movdqu (%rsi,%rcx,2), %xmm9
+; SSE-NEXT: pmaddwd %xmm5, %xmm9
+; SSE-NEXT: paddd %xmm9, %xmm2
+; SSE-NEXT: movdqu 16(%rsi,%rcx,2), %xmm5
+; SSE-NEXT: pmaddwd %xmm6, %xmm5
+; SSE-NEXT: paddd %xmm5, %xmm4
+; SSE-NEXT: movdqu 32(%rsi,%rcx,2), %xmm5
+; SSE-NEXT: pmaddwd %xmm7, %xmm5
+; SSE-NEXT: paddd %xmm5, %xmm1
+; SSE-NEXT: movdqu 48(%rsi,%rcx,2), %xmm5
+; SSE-NEXT: pmaddwd %xmm8, %xmm5
+; SSE-NEXT: paddd %xmm5, %xmm3
+; SSE-NEXT: addq $16, %rcx
+; SSE-NEXT: cmpq %rcx, %rax
+; SSE-NEXT: jne .LBB3_1
+; SSE-NEXT: # %bb.2: # %middle.block
+; SSE-NEXT: paddd %xmm0, %xmm4
+; SSE-NEXT: paddd %xmm0, %xmm3
+; SSE-NEXT: paddd %xmm4, %xmm3
+; SSE-NEXT: paddd %xmm0, %xmm2
+; SSE-NEXT: paddd %xmm0, %xmm1
+; SSE-NEXT: paddd %xmm2, %xmm1
+; SSE-NEXT: paddd %xmm3, %xmm1
+; SSE-NEXT: pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
+; SSE-NEXT: paddd %xmm1, %xmm0
+; SSE-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; SSE-NEXT: paddd %xmm0, %xmm1
+; SSE-NEXT: movd %xmm1, %eax
+; SSE-NEXT: retq
;
; AVX1-LABEL: _Z10test_shortPsS_i_1024:
; AVX1: # %bb.0: # %entry
@@ -572,6 +596,29 @@ define i32 @_Z9test_charPcS_i_128(ptr nocapture readonly, ptr nocapture readonly
; SSE2-NEXT: movd %xmm0, %eax
; SSE2-NEXT: retq
;
+; SSE42-LABEL: _Z9test_charPcS_i_128:
+; SSE42: # %bb.0: # %entry
+; SSE42-NEXT: movl %edx, %eax
+; SSE42-NEXT: pxor %xmm0, %xmm0
+; SSE42-NEXT: xorl %ecx, %ecx
+; SSE42-NEXT: .p2align 4
+; SSE42-NEXT: .LBB4_1: # %vector.body
+; SSE42-NEXT: # =>This Inner Loop Header: Depth=1
+; SSE42-NEXT: pmovsxbd (%rdi,%rcx), %xmm1
+; SSE42-NEXT: pmovsxbd (%rsi,%rcx), %xmm2
+; SSE42-NEXT: pmulld %xmm1, %xmm2
+; SSE42-NEXT: paddd %xmm2, %xmm0
+; SSE42-NEXT: addq $16, %rcx
+; SSE42-NEXT: cmpq %rcx, %rax
+; SSE42-NEXT: jne .LBB4_1
+; SSE42-NEXT: # %bb.2: # %middle.block
+; SSE42-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; SSE42-NEXT: paddd %xmm0, %xmm1
+; SSE42-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
+; SSE42-NEXT: paddd %xmm1, %xmm0
+; SSE42-NEXT: movd %xmm0, %eax
+; SSE42-NEXT: retq
+;
; AVX-LABEL: _Z9test_charPcS_i_128:
; AVX: # %bb.0: # %entry
; AVX-NEXT: movl %edx, %eax
@@ -650,6 +697,31 @@ define i32 @_Z9test_charPcS_i_256(ptr nocapture readonly, ptr nocapture readonly
; SSE2-NEXT: movd %xmm1, %eax
; SSE2-NEXT: retq
;
+; SSE42-LABEL: _Z9test_charPcS_i_256:
+; SSE42: # %bb.0: # %entry
+; SSE42-NEXT: movl %edx, %eax
+; SSE42-NEXT: pxor %xmm0, %xmm0
+; SSE42-NEXT: xorl %ecx, %ecx
+; SSE42-NEXT: pxor %xmm1, %xmm1
+; SSE42-NEXT: .p2align 4
+; SSE42-NEXT: .LBB5_1: # %vector.body
+; SSE42-NEXT: # =>This Inner Loop Header: Depth=1
+; SSE42-NEXT: pmovsxbw (%rdi,%rcx), %xmm2
+; SSE42-NEXT: pmovsxbw (%rsi,%rcx), %xmm3
+; SSE42-NEXT: pmaddwd %xmm2, %xmm3
+; SSE42-NEXT: paddd %xmm3, %xmm1
+; SSE42-NEXT: addq $16, %rcx
+; SSE42-NEXT: cmpq %rcx, %rax
+; SSE42-NEXT: jne .LBB5_1
+; SSE42-NEXT: # %bb.2: # %middle.block
+; SSE42-NEXT: paddd %xmm0, %xmm1
+; SSE42-NEXT: pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
+; SSE42-NEXT: paddd %xmm1, %xmm0
+; SSE42-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; SSE42-NEXT: paddd %xmm0, %xmm1
+; SSE42-NEXT: movd %xmm1, %eax
+; SSE42-NEXT: retq
+;
; AVX1-LABEL: _Z9test_charPcS_i_256:
; AVX1: # %bb.0: # %entry
; AVX1-NEXT: movl %edx, %eax
@@ -767,6 +839,38 @@ define i32 @_Z9test_charPcS_i_512(ptr nocapture readonly, ptr nocapture readonly
; SSE2-NEXT: movd %xmm1, %eax
; SSE2-NEXT: retq
;
+; SSE42-LABEL: _Z9test_charPcS_i_512:
+; SSE42: # %bb.0: # %entry
+; SSE42-NEXT: movl %edx, %eax
+; SSE42-NEXT: pxor %xmm0, %xmm0
+; SSE42-NEXT: xorl %ecx, %ecx
+; SSE42-NEXT: pxor %xmm2, %xmm2
+; SSE42-NEXT: pxor %xmm1, %xmm1
+; SSE42-NEXT: .p2align 4
+; SSE42-NEXT: .LBB6_1: # %vector.body
+; SSE42-NEXT: # =>This Inner Loop Header: Depth=1
+; SSE42-NEXT: pmovsxbw 8(%rdi,%rcx), %xmm3
+; SSE42-NEXT: pmovsxbw (%rdi,%rcx), %xmm4
+; SSE42-NEXT: pmovsxbw 8(%rsi,%rcx), %xmm5
+; SSE42-NEXT: pmaddwd %xmm3, %xmm5
+; SSE42-NEXT: paddd %xmm5, %xmm1
+; SSE42-NEXT: pmovsxbw (%rsi,%rcx), %xmm3
+; SSE42-NEXT: pmaddwd %xmm4, %xmm3
+; SSE42-NEXT: paddd %xmm3, %xmm2
+; SSE42-NEXT: addq $16, %rcx
+; SSE42-NEXT: cmpq %rcx, %rax
+; SSE42-NEXT: jne .LBB6_1
+; SSE42-NEXT: # %bb.2: # %middle.block
+; SSE42-NEXT: paddd %xmm0, %xmm2
+; SSE42-NEXT: paddd %xmm0, %xmm1
+; SSE42-NEXT: paddd %xmm2, %xmm1
+; SSE42-NEXT: pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
+; SSE42-NEXT: paddd %xmm1, %xmm0
+; SSE42-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; SSE42-NEXT: paddd %xmm0, %xmm1
+; SSE42-NEXT: movd %xmm1, %eax
+; SSE42-NEXT: retq
+;
; AVX1-LABEL: _Z9test_charPcS_i_512:
; AVX1: # %bb.0: # %entry
; AVX1-NEXT: movl %edx, %eax
@@ -943,6 +1047,52 @@ define i32 @_Z9test_charPcS_i_1024(ptr nocapture readonly, ptr nocapture readonl
; SSE2-NEXT: movd %xmm1, %eax
; SSE2-NEXT: retq
;
+; SSE42-LABEL: _Z9test_charPcS_i_1024:
+; SSE42: # %bb.0: # %entry
+; SSE42-NEXT: movl %edx, %eax
+; SSE42-NEXT: pxor %xmm0, %xmm0
+; SSE42-NEXT: xorl %ecx, %ecx
+; SSE42-NEXT: pxor %xmm2, %xmm2
+; SSE42-NEXT: pxor %xmm4, %xmm4
+; SSE42-NEXT: pxor %xmm1, %xmm1
+; SSE42-NEXT: pxor %xmm3, %xmm3
+; SSE42-NEXT: .p2align 4
+; SSE42-NEXT: .LBB7_1: # %vector.body
+; SSE42-NEXT: # =>This Inner Loop Header: Depth=1
+; SSE42-NEXT: pmovsxbw 16(%rdi,%rcx), %xmm5
+; SSE42-NEXT: pmovsxbw 8(%rdi,%rcx), %xmm6
+; SSE42-NEXT: pmovsxbw (%rdi,%rcx), %xmm7
+; SSE42-NEXT: pmovsxbw 24(%rdi,%rcx), %xmm8
+; SSE42-NEXT: pmovsxbw 16(%rsi,%rcx), %xmm9
+; SSE42-NEXT: pmaddwd %xmm5, %xmm9
+; SSE42-NEXT: paddd %xmm9, %xmm1
+; SSE42-NEXT: pmovsxbw 8(%rsi,%rcx), %xmm5
+; SSE42-NEXT: pmaddwd %xmm6, %xmm5
+; SSE42-NEXT: paddd %xmm5, %xmm4
+; SSE42-NEXT: pmovsxbw (%rsi,%rcx), %xmm5
+; SSE42-NEXT: pmaddwd %xmm7, %xmm5
+; SSE42-NEXT: paddd %xmm5, %xmm2
+; SSE42-NEXT: pmovsxbw 24(%rsi,%rcx), %xmm5
+; SSE42-NEXT: pmaddwd %xmm8, %xmm5
+; SSE42-NEXT: paddd %xmm5, %xmm3
+; SSE42-NEXT: addq $32, %rcx
+; SSE42-NEXT: cmpq %rcx, %rax
+; SSE42-NEXT: jne .LBB7_1
+; SSE42-NEXT: # %bb.2: # %middle.block
+; SSE42-NEXT: paddd %xmm0, %xmm4
+; SSE42-NEXT: paddd %xmm0, %xmm3
+; SSE42-NEXT: paddd %xmm4, %xmm3
+; SSE42-NEXT: paddd %xmm0, %xmm2
+; SSE42-NEXT: paddd %xmm0, %xmm1
+; SSE42-NEXT: paddd %xmm2, %xmm1
+; SSE42-NEXT: paddd %xmm3, %xmm1
+; SSE42-NEXT: pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
+; SSE42-NEXT: paddd %xmm1, %xmm0
+; SSE42-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; SSE42-NEXT: paddd %xmm0, %xmm1
+; SSE42-NEXT: movd %xmm1, %eax
+; SSE42-NEXT: retq
+;
; AVX1-LABEL: _Z9test_charPcS_i_1024:
; AVX1: # %bb.0: # %entry
; AVX1-NEXT: movl %edx, %eax
@@ -1146,6 +1296,29 @@ define i32 @test_unsigned_short_128(ptr nocapture readonly, ptr nocapture readon
; SSE2-NEXT: movd %xmm0, %eax
; SSE2-NEXT: retq
;
+; SSE42-LABEL: test_unsigned_short_128:
+; SSE42: # %bb.0: # %entry
+; SSE42-NEXT: movl %edx, %eax
+; SSE42-NEXT: pxor %xmm0, %xmm0
+; SSE42-NEXT: xorl %ecx, %ecx
+; SSE42-NEXT: .p2align 4
+; SSE42-NEXT: .LBB8_1: # %vector.body
+; SSE42-NEXT: # =>This Inner Loop Header: Depth=1
+; SSE42-NEXT: pmovzxwd {{.*#+}} xmm1 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT: pmovzxwd {{.*#+}} xmm2 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT: pmulld %xmm1, %xmm2
+; SSE42-NEXT: paddd %xmm2, %xmm0
+; SSE42-NEXT: addq $16, %rcx
+; SSE42-NEXT: cmpq %rcx, %rax
+; SSE42-NEXT: jne .LBB8_1
+; SSE42-NEXT: # %bb.2: # %middle.block
+; SSE42-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; SSE42-NEXT: paddd %xmm0, %xmm1
+; SSE42-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
+; SSE42-NEXT: paddd %xmm1, %xmm0
+; SSE42-NEXT: movd %xmm0, %eax
+; SSE42-NEXT: retq
+;
; AVX-LABEL: test_unsigned_short_128:
; AVX: # %bb.0: # %entry
; AVX-NEXT: movl %edx, %eax
@@ -1226,6 +1399,35 @@ define i32 @test_unsigned_short_256(ptr nocapture readonly, ptr nocapture readon
; SSE2-NEXT: movd %xmm0, %eax
; SSE2-NEXT: retq
;
+; SSE42-LABEL: test_unsigned_short_256:
+; SSE42: # %bb.0: # %entry
+; SSE42-NEXT: movl %edx, %eax
+; SSE42-NEXT: pxor %xmm0, %xmm0
+; SSE42-NEXT: xorl %ecx, %ecx
+; SSE42-NEXT: pxor %xmm1, %xmm1
+; SSE42-NEXT: .p2align 4
+; SSE42-NEXT: .LBB9_1: # %vector.body
+; SSE42-NEXT: # =>This Inner Loop Header: Depth=1
+; SSE42-NEXT: pmovzxwd {{.*#+}} xmm2 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT: pmovzxwd {{.*#+}} xmm3 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT: pmovzxwd {{.*#+}} xmm4 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT: pmulld %xmm2, %xmm4
+; SSE42-NEXT: paddd %xmm4, %xmm1
+; SSE42-NEXT: pmovzxwd {{.*#+}} xmm2 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT: pmulld %xmm3, %xmm2
+; SSE42-NEXT: paddd %xmm2, %xmm0
+; SSE42-NEXT: addq $16, %rcx
+; SSE42-NEXT: cmpq %rcx, %rax
+; SSE42-NEXT: jne .LBB9_1
+; SSE42-NEXT: # %bb.2: # %middle.block
+; SSE42-NEXT: paddd %xmm1, %xmm0
+; SSE42-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; SSE42-NEXT: paddd %xmm0, %xmm1
+; SSE42-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
+; SSE42-NEXT: paddd %xmm1, %xmm0
+; SSE42-NEXT: movd %xmm0, %eax
+; SSE42-NEXT: retq
+;
; AVX1-LABEL: test_unsigned_short_256:
; AVX1: # %bb.0: # %entry
; AVX1-NEXT: movl %edx, %eax
@@ -1355,6 +1557,47 @@ define i32 @test_unsigned_short_512(ptr nocapture readonly, ptr nocapture readon
; SSE2-NEXT: movd %xmm1, %eax
; SSE2-NEXT: retq
;
+; SSE42-LABEL: test_unsigned_short_512:
+; SSE42: # %bb.0: # %entry
+; SSE42-NEXT: movl %edx, %eax
+; SSE42-NEXT: pxor %xmm0, %xmm0
+; SSE42-NEXT: xorl %ecx, %ecx
+; SSE42-NEXT: pxor %xmm1, %xmm1
+; SSE42-NEXT: pxor %xmm3, %xmm3
+; SSE42-NEXT: pxor %xmm2, %xmm2
+; SSE42-NEXT: .p2align 4
+; SSE42-NEXT: .LBB10_1: # %vector.body
+; SSE42-NEXT: # =>This Inner Loop Header: Depth=1
+; SSE42-NEXT: pmovzxwd {{.*#+}} xmm4 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT: pmovzxwd {{.*#+}} xmm5 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT: pmovzxwd {{.*#+}} xmm6 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT: pmovzxwd {{.*#+}} xmm7 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT: pmovzxwd {{.*#+}} xmm8 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT: pmulld %xmm4, %xmm8
+; SSE42-NEXT: paddd %xmm8, %xmm3
+; SSE42-NEXT: pmovzxwd {{.*#+}} xmm4 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT: pmulld %xmm5, %xmm4
+; SSE42-NEXT: paddd %xmm4, %xmm1
+; SSE42-NEXT: pmovzxwd {{.*#+}} xmm4 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT: pmulld %xmm6, %xmm4
+; SSE42-NEXT: paddd %xmm4, %xmm0
+; SSE42-NEXT: pmovzxwd {{.*#+}} xmm4 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT: pmulld %xmm7, %xmm4
+; SSE42-NEXT: paddd %xmm4, %xmm2
+; SSE42-NEXT: addq $16, %rcx
+; SSE42-NEXT: cmpq %rcx, %rax
+; SSE42-NEXT: jne .LBB10_1
+; SSE42-NEXT: # %bb.2: # %middle.block
+; SSE42-NEXT: paddd %xmm3, %xmm0
+; SSE42-NEXT: paddd %xmm2, %xmm1
+; SSE42-NEXT: paddd %xmm0, %xmm1
+; SSE42-NEXT: pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
+; SSE42-NEXT: paddd %xmm1, %xmm0
+; SSE42-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; SSE42-NEXT: paddd %xmm0, %xmm1
+; SSE42-NEXT: movd %xmm1, %eax
+; SSE42-NEXT: retq
+;
; AVX1-LABEL: test_unsigned_short_512:
; AVX1: # %bb.0: # %entry
; AVX1-NEXT: movl %edx, %eax
@@ -1560,6 +1803,71 @@ define i32 @test_unsigned_short_1024(ptr nocapture readonly, ptr nocapture reado
; SSE2-NEXT: movd %xmm1, %eax
; SSE2-NEXT: retq
;
+; SSE42-LABEL: test_unsigned_short_1024:
+; SSE42: # %bb.0: # %entry
+; SSE42-NEXT: movl %edx, %eax
+; SSE42-NEXT: pxor %xmm0, %xmm0
+; SSE42-NEXT: xorl %ecx, %ecx
+; SSE42-NEXT: pxor %xmm3, %xmm3
+; SSE42-NEXT: pxor %xmm1, %xmm1
+; SSE42-NEXT: pxor %xmm2, %xmm2
+; SSE42-NEXT: pxor %xmm4, %xmm4
+; SSE42-NEXT: pxor %xmm6, %xmm6
+; SSE42-NEXT: pxor %xmm5, %xmm5
+; SSE42-NEXT: pxor %xmm7, %xmm7
+; SSE42-NEXT: .p2align 4
+; SSE42-NEXT: .LBB11_1: # %vector.body
+; SSE42-NEXT: # =>This Inner Loop Header: Depth=1
+; SSE42-NEXT: pmovzxwd {{.*#+}} xmm8 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT: pmovzxwd {{.*#+}} xmm9 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT: pmulld %xmm8, %xmm9
+; SSE42-NEXT: pmovzxwd {{.*#+}} xmm8 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT: paddd %xmm9, %xmm1
+; SSE42-NEXT: pmovzxwd {{.*#+}} xmm9 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT: pmulld %xmm8, %xmm9
+; SSE42-NEXT: pmovzxwd {{.*#+}} xmm8 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT: paddd %xmm9, %xmm3
+; SSE42-NEXT: pmovzxwd {{.*#+}} xmm9 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT: pmulld %xmm8, %xmm9
+; SSE42-NEXT: pmovzxwd {{.*#+}} xmm8 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT: paddd %xmm9, %xmm0
+; SSE42-NEXT: pmovzxwd {{.*#+}} xmm9 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT: pmulld %xmm8, %xmm9
+; SSE42-NEXT: pmovzxwd {{.*#+}} xmm8 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT: paddd %xmm9, %xmm2
+; SSE42-NEXT: pmovzxwd {{.*#+}} xmm9 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT: pmulld %xmm8, %xmm9
+; SSE42-NEXT: pmovzxwd {{.*#+}} xmm8 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT: paddd %xmm9, %xmm4
+; SSE42-NEXT: pmovzxwd {{.*#+}} xmm9 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT: pmulld %xmm8, %xmm9
+; SSE42-NEXT: pmovzxwd {{.*#+}} xmm8 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT: paddd %xmm9, %xmm6
+; SSE42-NEXT: pmovzxwd {{.*#+}} xmm9 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT: pmulld %xmm8, %xmm9
+; SSE42-NEXT: pmovzxwd {{.*#+}} xmm8 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT: paddd %xmm9, %xmm5
+; SSE42-NEXT: pmovzxwd {{.*#+}} xmm9 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero
+; SSE42-NEXT: pmulld %xmm8, %xmm9
+; SSE42-NEXT: paddd %xmm9, %xmm7
+; SSE42-NEXT: addq $16, %rcx
+; SSE42-NEXT: cmpq %rcx, %rax
+; SSE42-NEXT: jne .LBB11_1
+; SSE42-NEXT: # %bb.2: # %middle.block
+; SSE42-NEXT: paddd %xmm6, %xmm3
+; SSE42-NEXT: paddd %xmm7, %xmm2
+; SSE42-NEXT: paddd %xmm3, %xmm2
+; SSE42-NEXT: paddd %xmm4, %xmm0
+; SSE42-NEXT: paddd %xmm5, %xmm1
+; SSE42-NEXT: paddd %xmm0, %xmm1
+; SSE42-NEXT: paddd %xmm2, %xmm1
+; SSE42-NEXT: pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
+; SSE42-NEXT: paddd %xmm1, %xmm0
+; SSE42-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; SSE42-NEXT: paddd %xmm0, %xmm1
+; SSE42-NEXT: movd %xmm1, %eax
+; SSE42-NEXT: retq
+;
; AVX1-LABEL: test_unsigned_short_1024:
; AVX1: # %bb.0: # %entry
; AVX1-NEXT: movl %edx, %eax
@@ -1738,10 +2046,10 @@ middle.block:
}
define <4 x i32> @pmaddwd_8(<8 x i16> %A, <8 x i16> %B) {
-; SSE2-LABEL: pmaddwd_8:
-; SSE2: # %bb.0:
-; SSE2-NEXT: pmaddwd %xmm1, %xmm0
-; SSE2-NEXT: retq
+; SSE-LABEL: pmaddwd_8:
+; SSE: # %bb.0:
+; SSE-NEXT: pmaddwd %xmm1, %xmm0
+; SSE-NEXT: retq
;
; AVX-LABEL: pmaddwd_8:
; AVX: # %bb.0:
@@ -1757,10 +2065,10 @@ define <4 x i32> @pmaddwd_8(<8 x i16> %A, <8 x i16> %B) {
}
define <4 x i32> @pmaddwd_8_swapped(<8 x i16> %A, <8 x i16> %B) {
-; SSE2-LABEL: pmaddwd_8_swapped:
-; SSE2: # %bb.0:
-; SSE2-NEXT: pmaddwd %xmm1, %xmm0
-; SSE2-NEXT: retq
+; SSE-LABEL: pmaddwd_8_swapped:
+; SSE: # %bb.0:
+; SSE-NEXT: pmaddwd %xmm1, %xmm0
+; SSE-NEXT: retq
;
; AVX-LABEL: pmaddwd_8_swapped:
; AVX: # %bb.0:
@@ -1775,7 +2083,7 @@ define <4 x i32> @pmaddwd_8_swapped(<8 x i16> %A, <8 x i16> %B) {
ret <4 x i32> %ret
}
-; FIXME: SSE fails to match PMADDWD
+; FIXME: SSE2 fails to match PMADDWD
define <4 x i32> @larger_mul(<16 x i16> %A, <16 x i16> %B) {
; SSE2-LABEL: larger_mul:
; SSE2: # %bb.0:
@@ -1791,6 +2099,19 @@ define <4 x i32> @larger_mul(<16 x i16> %A, <16 x i16> %B) {
; SSE2-NEXT: paddd %xmm1, %xmm0
; SSE2-NEXT: retq
;
+; SSE42-LABEL: larger_mul:
+; SSE42: # %bb.0:
+; SSE42-NEXT: pxor %xmm1, %xmm1
+; SSE42-NEXT: pmovzxwd {{.*#+}} xmm3 = xmm2[0],zero,xmm2[1],zero,xmm2[2],zero,xmm2[3],zero
+; SSE42-NEXT: punpckhwd {{.*#+}} xmm2 = xmm2[4],xmm1[4],xmm2[5],xmm1[5],xmm2[6],xmm1[6],xmm2[7],xmm1[7]
+; SSE42-NEXT: pmovzxwd {{.*#+}} xmm1 = xmm0[0],zero,xmm0[1],zero,xmm0[2],zero,xmm0[3],zero
+; SSE42-NEXT: punpckhwd {{.*#+}} xmm0 = xmm0[4,4,5,5,6,6,7,7]
+; SSE42-NEXT: pmaddwd %xmm2, %xmm0
+; SSE42-NEXT: pmaddwd %xmm3, %xmm1
+; SSE42-NEXT: phaddd %xmm0, %xmm1
+; SSE42-NEXT: movdqa %xmm1, %xmm0
+; SSE42-NEXT: retq
+;
; AVX1-LABEL: larger_mul:
; AVX1: # %bb.0:
; AVX1-NEXT: vpmaddwd %xmm1, %xmm0, %xmm0
@@ -1822,11 +2143,11 @@ define <4 x i32> @larger_mul(<16 x i16> %A, <16 x i16> %B) {
}
define <8 x i32> @pmaddwd_16(<16 x i16> %A, <16 x i16> %B) {
-; SSE2-LABEL: pmaddwd_16:
-; SSE2: # %bb.0:
-; SSE2-NEXT: pmaddwd %xmm2, %xmm0
-; SSE2-NEXT: pmaddwd %xmm3, %xmm1
-; SSE2-NEXT: retq
+; SSE-LABEL: pmaddwd_16:
+; SSE: # %bb.0:
+; SSE-NEXT: pmaddwd %xmm2, %xmm0
+; SSE-NEXT: pmaddwd %xmm3, %xmm1
+; SSE-NEXT: retq
;
; AVX1-LABEL: pmaddwd_16:
; AVX1: # %bb.0:
@@ -1851,13 +2172,13 @@ define <8 x i32> @pmaddwd_16(<16 x i16> %A, <16 x i16> %B) {
}
define <16 x i32> @pmaddwd_32(<32 x i16> %A, <32 x i16> %B) {
-; SSE2-LABEL: pmaddwd_32:
-; SSE2: # %bb.0:
-; SSE2-NEXT: pmaddwd %xmm4, %xmm0
-; SSE2-NEXT: pmaddwd %xmm5, %xmm1
-; SSE2-NEXT: pmaddwd %xmm6, %xmm2
-; SSE2-NEXT: pmaddwd %xmm7, %xmm3
-; SSE2-NEXT: retq
+; SSE-LABEL: pmaddwd_32:
+; SSE: # %bb.0:
+; SSE-NEXT: pmaddwd %xmm4, %xmm0
+; SSE-NEXT: pmaddwd %xmm5, %xmm1
+; SSE-NEXT: pmaddwd %xmm6, %xmm2
+; SSE-NEXT: pmaddwd %xmm7, %xmm3
+; SSE-NEXT: retq
;
; AVX1-LABEL: pmaddwd_32:
; AVX1: # %bb.0:
@@ -1902,10 +2223,10 @@ define <16 x i32> @pmaddwd_32(<32 x i16> %A, <32 x i16> %B) {
}
define <4 x i32> @pmaddwd_const(<8 x i16> %A) {
-; SSE2-LABEL: pmaddwd_const:
-; SSE2: # %bb.0:
-; SSE2-NEXT: pmaddwd {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0 # [32767,32768,0,0,1,7,42,32]
-; SSE2-NEXT: retq
+; SSE-LABEL: pmaddwd_const:
+; SSE: # %bb.0:
+; SSE-NEXT: pmaddwd {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0 # [32767,32768,0,0,1,7,42,32]
+; SSE-NEXT: retq
;
; AVX-LABEL: pmaddwd_const:
; AVX: # %bb.0:
@@ -1935,6 +2256,19 @@ define <4 x i32> @pmaddwd_negative1(<8 x i16> %A, <8 x i16> %B) {
; SSE2-NEXT: paddd %xmm2, %xmm0
; SSE2-NEXT: retq
;
+; SSE42-LABEL: pmaddwd_negative1:
+; SSE42: # %bb.0:
+; SSE42-NEXT: pxor %xmm3, %xmm3
+; SSE42-NEXT: pmovzxwd {{.*#+}} xmm4 = xmm0[0],zero,xmm0[1],zero,xmm0[2],zero,xmm0[3],zero
+; SSE42-NEXT: punpckhwd {{.*#+}} xmm0 = xmm0[4],xmm3[4],xmm0[5],xmm3[5],xmm0[6],xmm3[6],xmm0[7],xmm3[7]
+; SSE42-NEXT: pmovzxwd {{.*#+}} xmm2 = xmm1[0],zero,xmm1[1],zero,xmm1[2],zero,xmm1[3],zero
+; SSE42-NEXT: punpckhwd {{.*#+}} xmm1 = xmm1[4],xmm3[4],xmm1[5],xmm3[5],xmm1[6],xmm3[6],xmm1[7],xmm3[7]
+; SSE42-NEXT: pmulld %xmm0, %xmm1
+; SSE42-NEXT: pmulld %xmm4, %xmm2
+; SSE42-NEXT: phaddd %xmm1, %xmm2
+; SSE42-NEXT: movdqa %xmm2, %xmm0
+; SSE42-NEXT: retq
+;
; AVX1-LABEL: pmaddwd_negative1:
; AVX1: # %bb.0:
; AVX1-NEXT: vpxor %xmm2, %xmm2, %xmm2
@@ -1983,6 +2317,16 @@ define <4 x i32> @pmaddwd_negative2(<8 x i16> %A) {
; SSE2-NEXT: movdqa %xmm1, %xmm0
; SSE2-NEXT: retq
;
+; SSE42-LABEL: pmaddwd_negative2:
+; SSE42: # %bb.0:
+; SSE42-NEXT: pmovsxwd %xmm0, %xmm1
+; SSE42-NEXT: punpckhwd {{.*#+}} xmm0 = xmm0[4,4,5,5,6,6,7,7]
+; SSE42-NEXT: pmaddwd {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm0 # [1,0,7,0,42,0,32,0]
+; SSE42-NEXT: pmulld {{\.?LCPI[0-9]+_[0-9]+}}(%rip), %xmm1 # [32768,4294934528,0,0]
+; SSE42-NEXT: phaddd %xmm0, %xmm1
+; SSE42-NEXT: movdqa %xmm1, %xmm0
+; SSE42-NEXT: retq
+;
; AVX1-LABEL: pmaddwd_negative2:
; AVX1: # %bb.0:
; AVX1-NEXT: vpmovsxwd %xmm0, %xmm1
@@ -2009,10 +2353,10 @@ define <4 x i32> @pmaddwd_negative2(<8 x i16> %A) {
}
define <4 x i32> @jumbled_indices4(<8 x i16> %A, <8 x i16> %B) {
-; SSE2-LABEL: jumbled_indices4:
-; SSE2: # %bb.0:
-; SSE2-NEXT: pmaddwd %xmm1, %xmm0
-; SSE2-NEXT: retq
+; SSE-LABEL: jumbled_indices4:
+; SSE: # %bb.0:
+; SSE-NEXT: pmaddwd %xmm1, %xmm0
+; SSE-NEXT: retq
;
; AVX-LABEL: jumbled_indices4:
; AVX: # %bb.0:
@@ -2028,11 +2372,11 @@ define <4 x i32> @jumbled_indices4(<8 x i16> %A, <8 x i16> %B) {
}
define <8 x i32> @jumbled_indices8(<16 x i16> %A, <16 x i16> %B) {
-; SSE2-LABEL: jumbled_indices8:
-; SSE2: # %bb.0:
-; SSE2-NEXT: pmaddwd %xmm2, %xmm0
-; SSE2-NEXT: pmaddwd %xmm3, %xmm1
-; SSE2-NEXT: retq
+; SSE-LABEL: jumbled_indices8:
+; SSE: # %bb.0:
+; SSE-NEXT: pmaddwd %xmm2, %xmm0
+; SSE-NEXT: pmaddwd %xmm3, %xmm1
+; SSE-NEXT: retq
;
; AVX1-LABEL: jumbled_indices8:
; AVX1: # %bb.0:
@@ -2057,13 +2401,13 @@ define <8 x i32> @jumbled_indices8(<16 x i16> %A, <16 x i16> %B) {
}
define <16 x i32> @jumbled_indices16(<32 x i16> %A, <32 x i16> %B) {
-; SSE2-LABEL: jumbled_indices16:
-; SSE2: # %bb.0:
-; SSE2-NEXT: pmaddwd %xmm4, %xmm0
-; SSE2-NEXT: pmaddwd %xmm5, %xmm1
-; SSE2-NEXT: pmaddwd %xmm6, %xmm2
-; SSE2-NEXT: pmaddwd %xmm7, %xmm3
-; SSE2-NEXT: retq
+; SSE-LABEL: jumbled_indices16:
+; SSE: # %bb.0:
+; SSE-NEXT: pmaddwd %xmm4, %xmm0
+; SSE-NEXT: pmaddwd %xmm5, %xmm1
+; SSE-NEXT: pmaddwd %xmm6, %xmm2
+; SSE-NEXT: pmaddwd %xmm7, %xmm3
+; SSE-NEXT: retq
;
; AVX1-LABEL: jumbled_indices16:
; AVX1: # %bb.0:
@@ -2108,26 +2452,26 @@ define <16 x i32> @jumbled_indices16(<32 x i16> %A, <32 x i16> %B) {
}
define <32 x i32> @jumbled_indices32(<64 x i16> %A, <64 x i16> %B) {
-; SSE2-LABEL: jumbled_indices32:
-; SSE2: # %bb.0:
-; SSE2-NEXT: movq %rdi, %rax
-; SSE2-NEXT: pmaddwd {{[0-9]+}}(%rsp), %xmm0
-; SSE2-NEXT: pmaddwd {{[0-9]+}}(%rsp), %xmm1
-; SSE2-NEXT: pmaddwd {{[0-9]+}}(%rsp), %xmm2
-; SSE2-NEXT: pmaddwd {{[0-9]+}}(%rsp), %xmm3
-; SSE2-NEXT: pmaddwd {{[0-9]+}}(%rsp), %xmm4
-; SSE2-NEXT: pmaddwd {{[0-9]+}}(%rsp), %xmm5
-; SSE2-NEXT: pmaddwd {{[0-9]+}}(%rsp), %xmm6
-; SSE2-NEXT: pmaddwd {{[0-9]+}}(%rsp), %xmm7
-; SSE2-NEXT: movdqa %xmm7, 112(%rdi)
-; SSE2-NEXT: movdqa %xmm6, 96(%rdi)
-; SSE2-NEXT: movdqa %xmm5, 80(%rdi)
-; SSE2-NEXT: movdqa %xmm4, 64(%rdi)
-; SSE2-NEXT: movdqa %xmm3, 48(%rdi)
-; SSE2-NEXT: movdqa %xmm2, 32(%rdi)
-; SSE2-NEXT: movdqa %xmm1, 16(%rdi)
-; SSE2-NEXT: movdqa %xmm0, (%rdi)
-; SSE2-NEXT: retq
+; SSE-LABEL: jumbled_indices32:
+; SSE: # %bb.0:
+; SSE-NEXT: movq %rdi, %rax
+; SSE-NEXT: pmaddwd {{[0-9]+}}(%rsp), %xmm0
+; SSE-NEXT: pmaddwd {{[0-9]+}}(%rsp), %xmm1
+; SSE-NEXT: pmaddwd {{[0-9]+}}(%rsp), %xmm2
+; SSE-NEXT: pmaddwd {{[0-9]+}}(%rsp), %xmm3
+; SSE-NEXT: pmaddwd {{[0-9]+}}(%rsp), %xmm4
+; SSE-NEXT: pmaddwd {{[0-9]+}}(%rsp), %xmm5
+; SSE-NEXT: pmaddwd {{[0-9]+}}(%rsp), %xmm6
+; SSE-NEXT: pmaddwd {{[0-9]+}}(%rsp), %xmm7
+; SSE-NEXT: movdqa %xmm7, 112(%rdi)
+; SSE-NEXT: movdqa %xmm6, 96(%rdi)
+; SSE-NEXT: movdqa %xmm5, 80(%rdi)
+; SSE-NEXT: movdqa %xmm4, 64(%rdi)
+; SSE-NEXT: movdqa %xmm3, 48(%rdi)
+; SSE-NEXT: movdqa %xmm2, 32(%rdi)
+; SSE-NEXT: movdqa %xmm1, 16(%rdi)
+; SSE-NEXT: movdqa %xmm0, (%rdi)
+; SSE-NEXT: retq
;
; AVX1-LABEL: jumbled_indices32:
; AVX1: # %bb.0:
@@ -2192,11 +2536,11 @@ define <32 x i32> @jumbled_indices32(<64 x i16> %A, <64 x i16> %B) {
; NOTE: We're testing with loads because ABI lowering creates a concat_vectors that extract_vector_elt creation can see through.
; This would require the combine to recreate the concat_vectors.
define <4 x i32> @pmaddwd_128(ptr %Aptr, ptr %Bptr) {
-; SSE2-LABEL: pmaddwd_128:
-; SSE2: # %bb.0:
-; SSE2-NEXT: movdqa (%rdi), %xmm0
-; SSE2-NEXT: pmaddwd (%rsi), %xmm0
-; SSE2-NEXT: retq
+; SSE-LABEL: pmaddwd_128:
+; SSE: # %bb.0:
+; SSE-NEXT: movdqa (%rdi), %xmm0
+; SSE-NEXT: pmaddwd (%rsi), %xmm0
+; SSE-NEXT: retq
;
; AVX-LABEL: pmaddwd_128:
; AVX: # %bb.0:
@@ -2220,13 +2564,13 @@ define <4 x i32> @pmaddwd_128(ptr %Aptr, ptr %Bptr) {
}
define <8 x i32> @pmaddwd_256(ptr %Aptr, ptr %Bptr) {
-; SSE2-LABEL: pmaddwd_256:
-; SSE2: # %bb.0:
-; SSE2-NEXT: movdqa (%rdi), %xmm0
-; SSE2-NEXT: movdqa 16(%rdi), %xmm1
-; SSE2-NEXT: pmaddwd (%rsi), %xmm0
-; SSE2-NEXT: pmaddwd 16(%rsi), %xmm1
-; SSE2-NEXT: retq
+; SSE-LABEL: pmaddwd_256:
+; SSE: # %bb.0:
+; SSE-NEXT: movdqa (%rdi), %xmm0
+; SSE-NEXT: movdqa 16(%rdi), %xmm1
+; SSE-NEXT: pmaddwd (%rsi), %xmm0
+; SSE-NEXT: pmaddwd 16(%rsi), %xmm1
+; SSE-NEXT: retq
;
; AVX1-LABEL: pmaddwd_256:
; AVX1: # %bb.0:
@@ -2259,17 +2603,17 @@ define <8 x i32> @pmaddwd_256(ptr %Aptr, ptr %Bptr) {
}
define <16 x i32> @pmaddwd_512(ptr %Aptr, ptr %Bptr) {
-; SSE2-LABEL: pmaddwd_512:
-; SSE2: # %bb.0:
-; SSE2-NEXT: movdqa (%rdi), %xmm0
-; SSE2-NEXT: movdqa 16(%rdi), %xmm1
-; SSE2-NEXT: movdqa 32(%rdi), %xmm2
-; SSE2-NEXT: movdqa 48(%rdi), %xmm3
-; SSE2-NEXT: pmaddwd (%rsi), %xmm0
-; SSE2-NEXT: pmaddwd 16(%rsi), %xmm1
-; SSE2-NEXT: pmaddwd 32(%rsi), %xmm2
-; SSE2-NEXT: pmaddwd 48(%rsi), %xmm3
-; SSE2-NEXT: retq
+; SSE-LABEL: pmaddwd_512:
+; SSE: # %bb.0:
+; SSE-NEXT: movdqa (%rdi), %xmm0
+; SSE-NEXT: movdqa 16(%rdi), %xmm1
+; SSE-NEXT: movdqa 32(%rdi), %xmm2
+; SSE-NEXT: movdqa 48(%rdi), %xmm3
+; SSE-NEXT: pmaddwd (%rsi), %xmm0
+; SSE-NEXT: pmaddwd 16(%rsi), %xmm1
+; SSE-NEXT: pmaddwd 32(%rsi), %xmm2
+; SSE-NEXT: pmaddwd 48(%rsi), %xmm3
+; SSE-NEXT: retq
;
; AVX1-LABEL: pmaddwd_512:
; AVX1: # %bb.0:
@@ -2324,34 +2668,34 @@ define <16 x i32> @pmaddwd_512(ptr %Aptr, ptr %Bptr) {
}
define <32 x i32> @pmaddwd_1024(ptr %Aptr, ptr %Bptr) {
-; SSE2-LABEL: pmaddwd_1024:
-; SSE2: # %bb.0:
-; SSE2-NEXT: movq %rdi, %rax
-; SSE2-NEXT: movdqa (%rsi), %xmm0
-; SSE2-NEXT: movdqa 16(%rsi), %xmm1
-; SSE2-NEXT: movdqa 32(%rsi), %xmm2
-; SSE2-NEXT: movdqa 48(%rsi), %xmm3
-; SSE2-NEXT: pmaddwd (%rdx), %xmm0
-; SSE2-NEXT: pmaddwd 16(%rdx), %xmm1
-; SSE2-NEXT: pmaddwd 32(%rdx), %xmm2
-; SSE2-NEXT: pmaddwd 48(%rdx), %xmm3
-; SSE2-NEXT: movdqa 64(%rsi), %xmm4
-; SSE2-NEXT: pmaddwd 64(%rdx), %xmm4
-; SSE2-NEXT: movdqa 80(%rsi), %xmm5
-; SSE2-NEXT: pmaddwd 80(%rdx), %xmm5
-; SSE2-NEXT: movdqa 96(%rsi), %xmm6
-; SSE2-NEXT: pmaddwd 96(%rdx), %xmm6
-; SSE2-NEXT: movdqa 112(%rsi), %xmm7
-; SSE2-NEXT: pmaddwd 112(%rdx), %xmm7
-; SSE2-NEXT: movdqa %xmm7, 112(%rdi)
-; SSE2-NEXT: movdqa %xmm6, 96(%rdi)
-; SSE2-NEXT: movdqa %xmm5, 80(%rdi)
-; SSE2-NEXT: movdqa %xmm4, 64(%rdi)
-; SSE2-NEXT: movdqa %xmm3, 48(%rdi)
-; SSE2-NEXT: movdqa %xmm2, 32(%rdi)
-; SSE2-NEXT: movdqa %xmm1, 16(%rdi)
-; SSE2-NEXT: movdqa %xmm0, (%rdi)
-; SSE2-NEXT: retq
+; SSE-LABEL: pmaddwd_1024:
+; SSE: # %bb.0:
+; SSE-NEXT: movq %rdi, %rax
+; SSE-NEXT: movdqa (%rsi), %xmm0
+; SSE-NEXT: movdqa 16(%rsi), %xmm1
+; SSE-NEXT: movdqa 32(%rsi), %xmm2
+; SSE-NEXT: movdqa 48(%rsi), %xmm3
+; SSE-NEXT: pmaddwd (%rdx), %xmm0
+; SSE-NEXT: pmaddwd 16(%rdx), %xmm1
+; SSE-NEXT: pmaddwd 32(%rdx), %xmm2
+; SSE-NEXT: pmaddwd 48(%rdx), %xmm3
+; SSE-NEXT: movdqa 64(%rsi), %xmm4
+; SSE-NEXT: pmaddwd 64(%rdx), %xmm4
+; SSE-NEXT: movdqa 80(%rsi), %xmm5
+; SSE-NEXT: pmaddwd 80(%rdx), %xmm5
+; SSE-NEXT: movdqa 96(%rsi), %xmm6
+; SSE-NEXT: pmaddwd 96(%rdx), %xmm6
+; SSE-NEXT: movdqa 112(%rsi), %xmm7
+; SSE-NEXT: pmaddwd 112(%rdx), %xmm7
+; SSE-NEXT: movdqa %xmm7, 112(%rdi)
+; SSE-NEXT: movdqa %xmm6, 96(%rdi)
+; SSE-NEXT: movdqa %xmm5, 80(%rdi)
+; SSE-NEXT: movdqa %xmm4, 64(%rdi)
+; SSE-NEXT: movdqa %xmm3, 48(%rdi)
+; SSE-NEXT: movdqa %xmm2, 32(%rdi)
+; SSE-NEXT: movdqa %xmm1, 16(%rdi)
+; SSE-NEXT: movdqa %xmm0, (%rdi)
+; SSE-NEXT: retq
;
; AVX1-LABEL: pmaddwd_1024:
; AVX1: # %bb.0:
@@ -2427,11 +2771,11 @@ define <32 x i32> @pmaddwd_1024(ptr %Aptr, ptr %Bptr) {
}
define <4 x i32> @pmaddwd_commuted_mul(ptr %Aptr, ptr %Bptr) {
-; SSE2-LABEL: pmaddwd_commuted_mul:
-; SSE2: # %bb.0:
-; SSE2-NEXT: movdqa (%rdi), %xmm0
-; SSE2-NEXT: pmaddwd (%rsi), %xmm0
-; SSE2-NEXT: retq
+; SSE-LABEL: pmaddwd_commuted_mul:
+; SSE: # %bb.0:
+; SSE-NEXT: movdqa (%rdi), %xmm0
+; SSE-NEXT: pmaddwd (%rsi), %xmm0
+; SSE-NEXT: retq
;
; AVX-LABEL: pmaddwd_commuted_mul:
; AVX: # %bb.0:
@@ -2455,11 +2799,11 @@ define <4 x i32> @pmaddwd_commuted_mul(ptr %Aptr, ptr %Bptr) {
}
define <4 x i32> @pmaddwd_swapped_indices(ptr %Aptr, ptr %Bptr) {
-; SSE2-LABEL: pmaddwd_swapped_indices:
-; SSE2: # %bb.0:
-; SSE2-NEXT: movdqa (%rdi), %xmm0
-; SSE2-NEXT: pmaddwd (%rsi), %xmm0
-; SSE2-NEXT: retq
+; SSE-LABEL: pmaddwd_swapped_indices:
+; SSE: # %bb.0:
+; SSE-NEXT: movdqa (%rdi), %xmm0
+; SSE-NEXT: pmaddwd (%rsi), %xmm0
+; SSE-NEXT: retq
;
; AVX-LABEL: pmaddwd_swapped_indices:
; AVX: # %bb.0:
@@ -2484,12 +2828,12 @@ define <4 x i32> @pmaddwd_swapped_indices(ptr %Aptr, ptr %Bptr) {
; Negative test where indices aren't paired properly
define <4 x i32> @pmaddwd_bad_indices(ptr %Aptr, ptr %Bptr) {
-; SSE2-LABEL: pmaddwd_bad_indices:
-; SSE2: # %bb.0:
-; SSE2-NEXT: pshuflw {{.*#+}} xmm0 = mem[1,0,2,3,4,5,6,7]
-; SSE2-NEXT: pshufhw {{.*#+}} xmm0 = xmm0[0,1,2,3,5,4,6,7]
-; SSE2-NEXT: pmaddwd (%rsi), %xmm0
-; SSE2-NEXT: retq
+; SSE-LABEL: pmaddwd_bad_indices:
+; SSE: # %bb.0:
+; SSE-NEXT: pshuflw {{.*#+}} xmm0 = mem[1,0,2,3,4,5,6,7]
+; SSE-NEXT: pshufhw {{.*#+}} xmm0 = xmm0[0,1,2,3,5,4,6,7]
+; SSE-NEXT: pmaddwd (%rsi), %xmm0
+; SSE-NEXT: retq
;
; AVX-LABEL: pmaddwd_bad_indices:
; AVX: # %bb.0:
@@ -2516,21 +2860,21 @@ define <4 x i32> @pmaddwd_bad_indices(ptr %Aptr, ptr %Bptr) {
; This test contains two multiplies joined by an add. The result of that add is then reduced to a single element.
; SelectionDAGBuilder should tag the joining add as a vector reduction. We need to recognize that both sides can use pmaddwd
define i32 @madd_double_reduction(ptr %arg, ptr %arg1, ptr %arg2, ptr %arg3) {
-; SSE2-LABEL: madd_double_reduction:
-; SSE2: # %bb.0:
-; SSE2-NEXT: movdqu (%rdi), %xmm0
-; SSE2-NEXT: movdqu (%rsi), %xmm1
-; SSE2-NEXT: pmaddwd %xmm0, %xmm1
-; SSE2-NEXT: movdqu (%rdx), %xmm0
-; SSE2-NEXT: movdqu (%rcx), %xmm2
-; SSE2-NEXT: pmaddwd %xmm0, %xmm2
-; SSE2-NEXT: paddd %xmm1, %xmm2
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm2[2,3,2,3]
-; SSE2-NEXT: paddd %xmm2, %xmm0
-; SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
-; SSE2-NEXT: paddd %xmm0, %xmm1
-; SSE2-NEXT: movd %xmm1, %eax
-; SSE2-NEXT: retq
+; SSE-LABEL: madd_double_reduction:
+; SSE: # %bb.0:
+; SSE-NEXT: movdqu (%rdi), %xmm0
+; SSE-NEXT: movdqu (%rsi), %xmm1
+; SSE-NEXT: pmaddwd %xmm0, %xmm1
+; SSE-NEXT: movdqu (%rdx), %xmm0
+; SSE-NEXT: movdqu (%rcx), %xmm2
+; SSE-NEXT: pmaddwd %xmm0, %xmm2
+; SSE-NEXT: paddd %xmm1, %xmm2
+; SSE-NEXT: pshufd {{.*#+}} xmm0 = xmm2[2,3,2,3]
+; SSE-NEXT: paddd %xmm2, %xmm0
+; SSE-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; SSE-NEXT: paddd %xmm0, %xmm1
+; SSE-NEXT: movd %xmm1, %eax
+; SSE-NEXT: retq
;
; AVX-LABEL: madd_double_reduction:
; AVX: # %bb.0:
@@ -2561,31 +2905,31 @@ define i32 @madd_double_reduction(ptr %arg, ptr %arg1, ptr %arg2, ptr %arg3) {
}
define i32 @madd_quad_reduction(ptr %arg, ptr %arg1, ptr %arg2, ptr %arg3, ptr %arg4, ptr %arg5, ptr %arg6, ptr %arg7) {
-; SSE2-LABEL: madd_quad_reduction:
-; SSE2: # %bb.0:
-; SSE2-NEXT: movq {{[0-9]+}}(%rsp), %rax
-; SSE2-NEXT: movq {{[0-9]+}}(%rsp), %r10
-; SSE2-NEXT: movdqu (%rdi), %xmm0
-; SSE2-NEXT: movdqu (%rsi), %xmm1
-; SSE2-NEXT: pmaddwd %xmm0, %xmm1
-; SSE2-NEXT: movdqu (%rdx), %xmm0
-; SSE2-NEXT: movdqu (%rcx), %xmm2
-; SSE2-NEXT: pmaddwd %xmm0, %xmm2
-; SSE2-NEXT: paddd %xmm1, %xmm2
-; SSE2-NEXT: movdqu (%r8), %xmm0
-; SSE2-NEXT: movdqu (%r9), %xmm1
-; SSE2-NEXT: pmaddwd %xmm0, %xmm1
-; SSE2-NEXT: paddd %xmm2, %xmm1
-; SSE2-NEXT: movdqu (%r10), %xmm0
-; SSE2-NEXT: movdqu (%rax), %xmm2
-; SSE2-NEXT: pmaddwd %xmm0, %xmm2
-; SSE2-NEXT: paddd %xmm1, %xmm2
-; SSE2-NEXT: pshufd {{.*#+}} xmm0 = xmm2[2,3,2,3]
-; SSE2-NEXT: paddd %xmm2, %xmm0
-; SSE2-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
-; SSE2-NEXT: paddd %xmm0, %xmm1
-; SSE2-NEXT: movd %xmm1, %eax
-; SSE2-NEXT: retq
+; SSE-LABEL: madd_quad_reduction:
+; SSE: # %bb.0:
+; SSE-NEXT: movq {{[0-9]+}}(%rsp), %rax
+; SSE-NEXT: movq {{[0-9]+}}(%rsp), %r10
+; SSE-NEXT: movdqu (%rdi), %xmm0
+; SSE-NEXT: movdqu (%rsi), %xmm1
+; SSE-NEXT: pmaddwd %xmm0, %xmm1
+; SSE-NEXT: movdqu (%rdx), %xmm0
+; SSE-NEXT: movdqu (%rcx), %xmm2
+; SSE-NEXT: pmaddwd %xmm0, %xmm2
+; SSE-NEXT: paddd %xmm1, %xmm2
+; SSE-NEXT: movdqu (%r8), %xmm0
+; SSE-NEXT: movdqu (%r9), %xmm1
+; SSE-NEXT: pmaddwd %xmm0, %xmm1
+; SSE-NEXT: paddd %xmm2, %xmm1
+; SSE-NEXT: movdqu (%r10), %xmm0
+; SSE-NEXT: movdqu (%rax), %xmm2
+; SSE-NEXT: pmaddwd %xmm0, %xmm2
+; SSE-NEXT: paddd %xmm1, %xmm2
+; SSE-NEXT: pshufd {{.*#+}} xmm0 = xmm2[2,3,2,3]
+; SSE-NEXT: paddd %xmm2, %xmm0
+; SSE-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; SSE-NEXT: paddd %xmm0, %xmm1
+; SSE-NEXT: movd %xmm1, %eax
+; SSE-NEXT: retq
;
; AVX-LABEL: madd_quad_reduction:
; AVX: # %bb.0:
@@ -2679,6 +3023,44 @@ define i64 @sum_and_sum_of_squares(ptr %a, i32 %n) {
; SSE2-NEXT: orq %rcx, %rax
; SSE2-NEXT: retq
;
+; SSE42-LABEL: sum_and_sum_of_squares:
+; SSE42: # %bb.0: # %entry
+; SSE42-NEXT: movl %esi, %eax
+; SSE42-NEXT: pxor %xmm0, %xmm0
+; SSE42-NEXT: pxor %xmm1, %xmm1
+; SSE42-NEXT: pxor %xmm2, %xmm2
+; SSE42-NEXT: pxor %xmm3, %xmm3
+; SSE42-NEXT: .p2align 4
+; SSE42-NEXT: .LBB33_1: # %vector.body
+; SSE42-NEXT: # =>This Inner Loop Header: Depth=1
+; SSE42-NEXT: pmovzxbd {{.*#+}} xmm4 = mem[0],zero,zero,zero,mem[1],zero,zero,zero,mem[2],zero,zero,zero,mem[3],zero,zero,zero
+; SSE42-NEXT: pmovzxbd {{.*#+}} xmm5 = mem[0],zero,zero,zero,mem[1],zero,zero,zero,mem[2],zero,zero,zero,mem[3],zero,zero,zero
+; SSE42-NEXT: paddd %xmm5, %xmm3
+; SSE42-NEXT: paddd %xmm4, %xmm2
+; SSE42-NEXT: pmaddwd %xmm4, %xmm4
+; SSE42-NEXT: paddd %xmm4, %xmm0
+; SSE42-NEXT: pmaddwd %xmm5, %xmm5
+; SSE42-NEXT: paddd %xmm5, %xmm1
+; SSE42-NEXT: addq $8, %rdi
+; SSE42-NEXT: addq $-8, %rax
+; SSE42-NEXT: jne .LBB33_1
+; SSE42-NEXT: # %bb.2: # %middle.block
+; SSE42-NEXT: paddd %xmm3, %xmm2
+; SSE42-NEXT: pshufd {{.*#+}} xmm3 = xmm2[2,3,2,3]
+; SSE42-NEXT: paddd %xmm2, %xmm3
+; SSE42-NEXT: pshufd {{.*#+}} xmm2 = xmm3[1,1,1,1]
+; SSE42-NEXT: paddd %xmm3, %xmm2
+; SSE42-NEXT: movd %xmm2, %ecx
+; SSE42-NEXT: paddd %xmm1, %xmm0
+; SSE42-NEXT: pshufd {{.*#+}} xmm1 = xmm0[2,3,2,3]
+; SSE42-NEXT: paddd %xmm0, %xmm1
+; SSE42-NEXT: pshufd {{.*#+}} xmm0 = xmm1[1,1,1,1]
+; SSE42-NEXT: paddd %xmm1, %xmm0
+; SSE42-NEXT: movd %xmm0, %eax
+; SSE42-NEXT: shlq $32, %rcx
+; SSE42-NEXT: orq %rcx, %rax
+; SSE42-NEXT: retq
+;
; AVX1-LABEL: sum_and_sum_of_squares:
; AVX1: # %bb.0: # %entry
; AVX1-NEXT: movl %esi, %eax
@@ -2814,6 +3196,32 @@ define i32 @sum_of_square_differences(ptr %a, ptr %b, i32 %n) {
; SSE2-NEXT: movd %xmm1, %eax
; SSE2-NEXT: retq
;
+; SSE42-LABEL: sum_of_square_differences:
+; SSE42: # %bb.0: # %entry
+; SSE42-NEXT: movl %edx, %eax
+; SSE42-NEXT: pxor %xmm0, %xmm0
+; SSE42-NEXT: xorl %ecx, %ecx
+; SSE42-NEXT: pxor %xmm1, %xmm1
+; SSE42-NEXT: .p2align 4
+; SSE42-NEXT: .LBB34_1: # %vector.body
+; SSE42-NEXT: # =>This Inner Loop Header: Depth=1
+; SSE42-NEXT: pmovzxbw {{.*#+}} xmm2 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero,mem[4],zero,mem[5],zero,mem[6],zero,mem[7],zero
+; SSE42-NEXT: pmovzxbw {{.*#+}} xmm3 = mem[0],zero,mem[1],zero,mem[2],zero,mem[3],zero,mem[4],zero,mem[5],zero,mem[6],zero,mem[7],zero
+; SSE42-NEXT: psubw %xmm2, %xmm3
+; SSE42-NEXT: pmaddwd %xmm3, %xmm3
+; SSE42-NEXT: paddd %xmm3, %xmm1
+; SSE42-NEXT: addq $8, %rcx
+; SSE42-NEXT: cmpq %rcx, %rax
+; SSE42-NEXT: jne .LBB34_1
+; SSE42-NEXT: # %bb.2: # %middle.block
+; SSE42-NEXT: paddd %xmm0, %xmm1
+; SSE42-NEXT: pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
+; SSE42-NEXT: paddd %xmm1, %xmm0
+; SSE42-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; SSE42-NEXT: paddd %xmm0, %xmm1
+; SSE42-NEXT: movd %xmm1, %eax
+; SSE42-NEXT: retq
+;
; AVX1-LABEL: sum_of_square_differences:
; AVX1: # %bb.0: # %entry
; AVX1-NEXT: movl %edx, %eax
@@ -2898,10 +3306,10 @@ middle.block:
; PR49716 - https://llvm.org/PR49716
define <4 x i32> @input_size_mismatch(<16 x i16> %x, ptr %p) {
-; SSE2-LABEL: input_size_mismatch:
-; SSE2: # %bb.0:
-; SSE2-NEXT: pmaddwd (%rdi), %xmm0
-; SSE2-NEXT: retq
+; SSE-LABEL: input_size_mismatch:
+; SSE: # %bb.0:
+; SSE-NEXT: pmaddwd (%rdi), %xmm0
+; SSE-NEXT: retq
;
; AVX-LABEL: input_size_mismatch:
; AVX: # %bb.0:
@@ -2924,10 +3332,10 @@ define <4 x i32> @input_size_mismatch(<16 x i16> %x, ptr %p) {
}
define <4 x i32> @output_size_mismatch(<16 x i16> %x, <16 x i16> %y) {
-; SSE2-LABEL: output_size_mismatch:
-; SSE2: # %bb.0:
-; SSE2-NEXT: pmaddwd %xmm2, %xmm0
-; SSE2-NEXT: retq
+; SSE-LABEL: output_size_mismatch:
+; SSE: # %bb.0:
+; SSE-NEXT: pmaddwd %xmm2, %xmm0
+; SSE-NEXT: retq
;
; AVX-LABEL: output_size_mismatch:
; AVX: # %bb.0:
@@ -2949,11 +3357,11 @@ define <4 x i32> @output_size_mismatch(<16 x i16> %x, <16 x i16> %y) {
}
define <4 x i32> @output_size_mismatch_high_subvector(<16 x i16> %x, <16 x i16> %y) {
-; SSE2-LABEL: output_size_mismatch_high_subvector:
-; SSE2: # %bb.0:
-; SSE2-NEXT: movdqa %xmm1, %xmm0
-; SSE2-NEXT: pmaddwd %xmm2, %xmm0
-; SSE2-NEXT: retq
+; SSE-LABEL: output_size_mismatch_high_subvector:
+; SSE: # %bb.0:
+; SSE-NEXT: movdqa %xmm1, %xmm0
+; SSE-NEXT: pmaddwd %xmm2, %xmm0
+; SSE-NEXT: retq
;
; AVX1-LABEL: output_size_mismatch_high_subvector:
; AVX1: # %bb.0:
@@ -3022,6 +3430,39 @@ define i32 @add_used_by_loop_phi(ptr %a, ptr %b, i64 %offset_a, i64 %offset_b, i
; SSE2-NEXT: movd %xmm1, %eax
; SSE2-NEXT: retq
;
+; SSE42-LABEL: add_used_by_loop_phi:
+; SSE42: # %bb.0: # %entry
+; SSE42-NEXT: addq %rdx, %rdi
+; SSE42-NEXT: addq %rcx, %rsi
+; SSE42-NEXT: pxor %xmm0, %xmm0
+; SSE42-NEXT: xorl %eax, %eax
+; SSE42-NEXT: pxor %xmm2, %xmm2
+; SSE42-NEXT: pxor %xmm1, %xmm1
+; SSE42-NEXT: .p2align 4
+; SSE42-NEXT: .LBB38_1: # %loop
+; SSE42-NEXT: # =>This Inner Loop Header: Depth=1
+; SSE42-NEXT: pmovsxbw 8(%rdi,%rax), %xmm3
+; SSE42-NEXT: pmovsxbw (%rdi,%rax), %xmm4
+; SSE42-NEXT: pmovsxbw 8(%rsi,%rax), %xmm5
+; SSE42-NEXT: pmaddwd %xmm3, %xmm5
+; SSE42-NEXT: paddd %xmm5, %xmm1
+; SSE42-NEXT: pmovsxbw (%rsi,%rax), %xmm3
+; SSE42-NEXT: pmaddwd %xmm4, %xmm3
+; SSE42-NEXT: paddd %xmm3, %xmm2
+; SSE42-NEXT: addq $16, %rax
+; SSE42-NEXT: cmpq %r8, %rax
+; SSE42-NEXT: jb .LBB38_1
+; SSE42-NEXT: # %bb.2: # %afterloop
+; SSE42-NEXT: paddd %xmm0, %xmm2
+; SSE42-NEXT: paddd %xmm0, %xmm1
+; SSE42-NEXT: paddd %xmm2, %xmm1
+; SSE42-NEXT: pshufd {{.*#+}} xmm0 = xmm1[2,3,2,3]
+; SSE42-NEXT: paddd %xmm1, %xmm0
+; SSE42-NEXT: pshufd {{.*#+}} xmm1 = xmm0[1,1,1,1]
+; SSE42-NEXT: paddd %xmm0, %xmm1
+; SSE42-NEXT: movd %xmm1, %eax
+; SSE42-NEXT: retq
+;
; AVX1-LABEL: add_used_by_loop_phi:
; AVX1: # %bb.0: # %entry
; AVX1-NEXT: addq %rdx, %rdi
@@ -3145,26 +3586,13 @@ afterloop:
}
define <16 x i32> @extract_concat_pmaddwd(<32 x i16> %a, <32 x i16> %b) {
-; CHECK-LABEL: extract_concat_pmaddwd:
-; CHECK: # %bb.0:
-; CHECK-NEXT: vextractf128 $1, %ymm2, %xmm4
-; CHECK-NEXT: vextractf128 $1, %ymm0, %xmm5
-; CHECK-NEXT: vpmaddwd %xmm4, %xmm5, %xmm4
-; CHECK-NEXT: vpmaddwd %xmm2, %xmm0, %xmm0
-; CHECK-NEXT: vinsertf128 $1, %xmm4, %ymm0, %ymm0
-; CHECK-NEXT: vextractf128 $1, %ymm3, %xmm2
-; CHECK-NEXT: vextractf128 $1, %ymm1, %xmm4
-; CHECK-NEXT: vpmaddwd %xmm2, %xmm4, %xmm2
-; CHECK-NEXT: vpmaddwd %xmm3, %xmm1, %xmm1
-; CHECK-NEXT: vinsertf128 $1, %xmm2, %ymm1, %ymm1
-; CHECK-NEXT: retq
-; SSE2-LABEL: extract_concat_pmaddwd:
-; SSE2: # %bb.0:
-; SSE2-NEXT: pmaddwd %xmm4, %xmm0
-; SSE2-NEXT: pmaddwd %xmm5, %xmm1
-; SSE2-NEXT: pmaddwd %xmm6, %xmm2
-; SSE2-NEXT: pmaddwd %xmm7, %xmm3
-; SSE2-NEXT: retq
+; SSE-LABEL: extract_concat_pmaddwd:
+; SSE: # %bb.0:
+; SSE-NEXT: pmaddwd %xmm4, %xmm0
+; SSE-NEXT: pmaddwd %xmm5, %xmm1
+; SSE-NEXT: pmaddwd %xmm6, %xmm2
+; SSE-NEXT: pmaddwd %xmm7, %xmm3
+; SSE-NEXT: retq
;
; AVX1-LABEL: extract_concat_pmaddwd:
; AVX1: # %bb.0:
More information about the llvm-commits
mailing list