1; NOTE: Assertions have been autogenerated by utils/update_llc_test_checks.py 2; RUN: llc -mcpu=pwr9 -O3 -verify-machineinstrs -ppc-vsr-nums-as-vr \ 3; RUN: -ppc-asm-full-reg-names -mtriple=powerpc64le-unknown-linux-gnu \ 4; RUN: < %s | FileCheck %s 5 6; RUN: llc -mcpu=pwr9 -O3 -verify-machineinstrs -ppc-vsr-nums-as-vr \ 7; RUN: -ppc-asm-full-reg-names -mtriple=powerpc64-unknown-linux-gnu \ 8; RUN: < %s | FileCheck %s --check-prefix=P9BE 9 10; Function Attrs: norecurse nounwind readonly 11define signext i32 @test_pre_inc_disable_1(i8* nocapture readonly %pix1, i32 signext %i_stride_pix1, i8* nocapture readonly %pix2) { 12; CHECK-LABEL: test_pre_inc_disable_1: 13; CHECK: # %bb.0: # %entry 14; CHECK-NEXT: lxsd v5, 0(r5) 15; CHECK-NEXT: addis r5, r2, .LCPI0_0@toc@ha 16; CHECK-NEXT: xxlxor v3, v3, v3 17; CHECK-NEXT: li r6, 0 18; CHECK-NEXT: addi r5, r5, .LCPI0_0@toc@l 19; CHECK-NEXT: lxvx v2, 0, r5 20; CHECK-NEXT: addis r5, r2, .LCPI0_1@toc@ha 21; CHECK-NEXT: addi r5, r5, .LCPI0_1@toc@l 22; CHECK-NEXT: lxvx v4, 0, r5 23; CHECK-NEXT: li r5, 4 24; CHECK-NEXT: vperm v0, v3, v5, v2 25; CHECK-NEXT: mtctr r5 26; CHECK-NEXT: li r5, 0 27; CHECK-NEXT: vperm v1, v3, v5, v4 28; CHECK-NEXT: xvnegsp v5, v0 29; CHECK-NEXT: xvnegsp v0, v1 30; CHECK-NEXT: .p2align 4 31; CHECK-NEXT: .LBB0_1: # %for.cond1.preheader 32; CHECK-NEXT: # 33; CHECK-NEXT: lxsd v1, 0(r3) 34; CHECK-NEXT: add r7, r3, r4 35; CHECK-NEXT: vperm v6, v3, v1, v4 36; CHECK-NEXT: vperm v1, v3, v1, v2 37; CHECK-NEXT: xvnegsp v1, v1 38; CHECK-NEXT: xvnegsp v6, v6 39; CHECK-NEXT: vabsduw v1, v1, v5 40; CHECK-NEXT: vabsduw v6, v6, v0 41; CHECK-NEXT: vadduwm v1, v6, v1 42; CHECK-NEXT: xxswapd v6, v1 43; CHECK-NEXT: vadduwm v1, v1, v6 44; CHECK-NEXT: xxspltw v6, v1, 2 45; CHECK-NEXT: vadduwm v1, v1, v6 46; CHECK-NEXT: lxsdx v6, r3, r4 47; CHECK-NEXT: vextuwrx r3, r5, v1 48; CHECK-NEXT: vperm v7, v3, v6, v4 49; CHECK-NEXT: vperm v6, v3, v6, v2 50; CHECK-NEXT: add r6, r3, r6 51; CHECK-NEXT: add r3, r7, r4 52; CHECK-NEXT: xvnegsp v6, v6 53; CHECK-NEXT: xvnegsp v1, v7 54; CHECK-NEXT: vabsduw v6, v6, v5 55; CHECK-NEXT: vabsduw v1, v1, v0 56; CHECK-NEXT: vadduwm v1, v1, v6 57; CHECK-NEXT: xxswapd v6, v1 58; CHECK-NEXT: vadduwm v1, v1, v6 59; CHECK-NEXT: xxspltw v6, v1, 2 60; CHECK-NEXT: vadduwm v1, v1, v6 61; CHECK-NEXT: vextuwrx r8, r5, v1 62; CHECK-NEXT: add r6, r8, r6 63; CHECK-NEXT: bdnz .LBB0_1 64; CHECK-NEXT: # %bb.2: # %for.cond.cleanup 65; CHECK-NEXT: extsw r3, r6 66; CHECK-NEXT: blr 67; 68; P9BE-LABEL: test_pre_inc_disable_1: 69; P9BE: # %bb.0: # %entry 70; P9BE-NEXT: lxsd v5, 0(r5) 71; P9BE-NEXT: addis r5, r2, .LCPI0_0@toc@ha 72; P9BE-NEXT: xxlxor v3, v3, v3 73; P9BE-NEXT: li r6, 0 74; P9BE-NEXT: addi r5, r5, .LCPI0_0@toc@l 75; P9BE-NEXT: lxvx v2, 0, r5 76; P9BE-NEXT: addis r5, r2, .LCPI0_1@toc@ha 77; P9BE-NEXT: addi r5, r5, .LCPI0_1@toc@l 78; P9BE-NEXT: lxvx v4, 0, r5 79; P9BE-NEXT: li r5, 4 80; P9BE-NEXT: vperm v0, v3, v5, v2 81; P9BE-NEXT: mtctr r5 82; P9BE-NEXT: li r5, 0 83; P9BE-NEXT: vperm v1, v3, v5, v4 84; P9BE-NEXT: xvnegsp v5, v0 85; P9BE-NEXT: xvnegsp v0, v1 86; P9BE-NEXT: .p2align 4 87; P9BE-NEXT: .LBB0_1: # %for.cond1.preheader 88; P9BE-NEXT: # 89; P9BE-NEXT: lxsd v1, 0(r3) 90; P9BE-NEXT: add r7, r3, r4 91; P9BE-NEXT: vperm v6, v3, v1, v4 92; P9BE-NEXT: vperm v1, v3, v1, v2 93; P9BE-NEXT: xvnegsp v1, v1 94; P9BE-NEXT: xvnegsp v6, v6 95; P9BE-NEXT: vabsduw v1, v1, v5 96; P9BE-NEXT: vabsduw v6, v6, v0 97; P9BE-NEXT: vadduwm v1, v6, v1 98; P9BE-NEXT: xxswapd v6, v1 99; P9BE-NEXT: vadduwm v1, v1, v6 100; P9BE-NEXT: xxspltw v6, v1, 1 101; P9BE-NEXT: vadduwm v1, v1, v6 102; P9BE-NEXT: lxsdx v6, r3, r4 103; P9BE-NEXT: vextuwlx r3, r5, v1 104; P9BE-NEXT: vperm v7, v3, v6, v4 105; P9BE-NEXT: vperm v6, v3, v6, v2 106; P9BE-NEXT: add r6, r3, r6 107; P9BE-NEXT: add r3, r7, r4 108; P9BE-NEXT: xvnegsp v6, v6 109; P9BE-NEXT: xvnegsp v1, v7 110; P9BE-NEXT: vabsduw v6, v6, v5 111; P9BE-NEXT: vabsduw v1, v1, v0 112; P9BE-NEXT: vadduwm v1, v1, v6 113; P9BE-NEXT: xxswapd v6, v1 114; P9BE-NEXT: vadduwm v1, v1, v6 115; P9BE-NEXT: xxspltw v6, v1, 1 116; P9BE-NEXT: vadduwm v1, v1, v6 117; P9BE-NEXT: vextuwlx r8, r5, v1 118; P9BE-NEXT: add r6, r8, r6 119; P9BE-NEXT: bdnz .LBB0_1 120; P9BE-NEXT: # %bb.2: # %for.cond.cleanup 121; P9BE-NEXT: extsw r3, r6 122; P9BE-NEXT: blr 123entry: 124 %idx.ext = sext i32 %i_stride_pix1 to i64 125 %0 = bitcast i8* %pix2 to <8 x i8>* 126 %1 = load <8 x i8>, <8 x i8>* %0, align 1 127 %2 = zext <8 x i8> %1 to <8 x i32> 128 br label %for.cond1.preheader 129 130for.cond1.preheader: ; preds = %for.cond1.preheader, %entry 131 %y.024 = phi i32 [ 0, %entry ], [ %inc9.1, %for.cond1.preheader ] 132 %i_sum.023 = phi i32 [ 0, %entry ], [ %op.extra.1, %for.cond1.preheader ] 133 %pix1.addr.022 = phi i8* [ %pix1, %entry ], [ %add.ptr.1, %for.cond1.preheader ] 134 %3 = bitcast i8* %pix1.addr.022 to <8 x i8>* 135 %4 = load <8 x i8>, <8 x i8>* %3, align 1 136 %5 = zext <8 x i8> %4 to <8 x i32> 137 %6 = sub nsw <8 x i32> %5, %2 138 %7 = icmp slt <8 x i32> %6, zeroinitializer 139 %8 = sub nsw <8 x i32> zeroinitializer, %6 140 %9 = select <8 x i1> %7, <8 x i32> %8, <8 x i32> %6 141 %rdx.shuf = shufflevector <8 x i32> %9, <8 x i32> undef, <8 x i32> <i32 4, i32 5, i32 6, i32 7, i32 undef, i32 undef, i32 undef, i32 undef> 142 %bin.rdx = add nsw <8 x i32> %9, %rdx.shuf 143 %rdx.shuf32 = shufflevector <8 x i32> %bin.rdx, <8 x i32> undef, <8 x i32> <i32 2, i32 3, i32 undef, i32 undef, i32 undef, i32 undef, i32 undef, i32 undef> 144 %bin.rdx33 = add nsw <8 x i32> %bin.rdx, %rdx.shuf32 145 %rdx.shuf34 = shufflevector <8 x i32> %bin.rdx33, <8 x i32> undef, <8 x i32> <i32 1, i32 undef, i32 undef, i32 undef, i32 undef, i32 undef, i32 undef, i32 undef> 146 %bin.rdx35 = add nsw <8 x i32> %bin.rdx33, %rdx.shuf34 147 %10 = extractelement <8 x i32> %bin.rdx35, i32 0 148 %op.extra = add nsw i32 %10, %i_sum.023 149 %add.ptr = getelementptr inbounds i8, i8* %pix1.addr.022, i64 %idx.ext 150 %11 = bitcast i8* %add.ptr to <8 x i8>* 151 %12 = load <8 x i8>, <8 x i8>* %11, align 1 152 %13 = zext <8 x i8> %12 to <8 x i32> 153 %14 = sub nsw <8 x i32> %13, %2 154 %15 = icmp slt <8 x i32> %14, zeroinitializer 155 %16 = sub nsw <8 x i32> zeroinitializer, %14 156 %17 = select <8 x i1> %15, <8 x i32> %16, <8 x i32> %14 157 %rdx.shuf.1 = shufflevector <8 x i32> %17, <8 x i32> undef, <8 x i32> <i32 4, i32 5, i32 6, i32 7, i32 undef, i32 undef, i32 undef, i32 undef> 158 %bin.rdx.1 = add nsw <8 x i32> %17, %rdx.shuf.1 159 %rdx.shuf32.1 = shufflevector <8 x i32> %bin.rdx.1, <8 x i32> undef, <8 x i32> <i32 2, i32 3, i32 undef, i32 undef, i32 undef, i32 undef, i32 undef, i32 undef> 160 %bin.rdx33.1 = add nsw <8 x i32> %bin.rdx.1, %rdx.shuf32.1 161 %rdx.shuf34.1 = shufflevector <8 x i32> %bin.rdx33.1, <8 x i32> undef, <8 x i32> <i32 1, i32 undef, i32 undef, i32 undef, i32 undef, i32 undef, i32 undef, i32 undef> 162 %bin.rdx35.1 = add nsw <8 x i32> %bin.rdx33.1, %rdx.shuf34.1 163 %18 = extractelement <8 x i32> %bin.rdx35.1, i32 0 164 %op.extra.1 = add nsw i32 %18, %op.extra 165 %add.ptr.1 = getelementptr inbounds i8, i8* %add.ptr, i64 %idx.ext 166 %inc9.1 = add nuw nsw i32 %y.024, 2 167 %exitcond.1 = icmp eq i32 %inc9.1, 8 168 br i1 %exitcond.1, label %for.cond.cleanup, label %for.cond1.preheader 169 170for.cond.cleanup: ; preds = %for.cond1.preheader 171 ret i32 %op.extra.1 172} 173 174; Function Attrs: norecurse nounwind readonly 175define signext i32 @test_pre_inc_disable_2(i8* nocapture readonly %pix1, i8* nocapture readonly %pix2) { 176; CHECK-LABEL: test_pre_inc_disable_2: 177; CHECK: # %bb.0: # %entry 178; CHECK-NEXT: lxsd v2, 0(r3) 179; CHECK-NEXT: addis r3, r2, .LCPI1_0@toc@ha 180; CHECK-NEXT: lxsd v1, 0(r4) 181; CHECK-NEXT: xxlxor v3, v3, v3 182; CHECK-NEXT: addi r3, r3, .LCPI1_0@toc@l 183; CHECK-NEXT: lxvx v4, 0, r3 184; CHECK-NEXT: addis r3, r2, .LCPI1_1@toc@ha 185; CHECK-NEXT: addi r3, r3, .LCPI1_1@toc@l 186; CHECK-NEXT: lxvx v0, 0, r3 187; CHECK-NEXT: li r3, 0 188; CHECK-NEXT: vperm v5, v3, v2, v4 189; CHECK-NEXT: vperm v2, v3, v2, v0 190; CHECK-NEXT: vperm v0, v3, v1, v0 191; CHECK-NEXT: vperm v3, v3, v1, v4 192; CHECK-NEXT: vabsduw v2, v2, v0 193; CHECK-NEXT: vabsduw v3, v5, v3 194; CHECK-NEXT: vadduwm v2, v3, v2 195; CHECK-NEXT: xxswapd v3, v2 196; CHECK-NEXT: vadduwm v2, v2, v3 197; CHECK-NEXT: xxspltw v3, v2, 2 198; CHECK-NEXT: vadduwm v2, v2, v3 199; CHECK-NEXT: vextuwrx r3, r3, v2 200; CHECK-NEXT: extsw r3, r3 201; CHECK-NEXT: blr 202; 203; P9BE-LABEL: test_pre_inc_disable_2: 204; P9BE: # %bb.0: # %entry 205; P9BE-NEXT: lxsd v2, 0(r3) 206; P9BE-NEXT: addis r3, r2, .LCPI1_0@toc@ha 207; P9BE-NEXT: lxsd v1, 0(r4) 208; P9BE-NEXT: xxlxor v3, v3, v3 209; P9BE-NEXT: addi r3, r3, .LCPI1_0@toc@l 210; P9BE-NEXT: lxvx v4, 0, r3 211; P9BE-NEXT: addis r3, r2, .LCPI1_1@toc@ha 212; P9BE-NEXT: addi r3, r3, .LCPI1_1@toc@l 213; P9BE-NEXT: lxvx v0, 0, r3 214; P9BE-NEXT: li r3, 0 215; P9BE-NEXT: vperm v5, v3, v2, v4 216; P9BE-NEXT: vperm v2, v3, v2, v0 217; P9BE-NEXT: vperm v0, v3, v1, v0 218; P9BE-NEXT: vperm v3, v3, v1, v4 219; P9BE-NEXT: vabsduw v2, v2, v0 220; P9BE-NEXT: vabsduw v3, v5, v3 221; P9BE-NEXT: vadduwm v2, v3, v2 222; P9BE-NEXT: xxswapd v3, v2 223; P9BE-NEXT: vadduwm v2, v2, v3 224; P9BE-NEXT: xxspltw v3, v2, 1 225; P9BE-NEXT: vadduwm v2, v2, v3 226; P9BE-NEXT: vextuwlx r3, r3, v2 227; P9BE-NEXT: extsw r3, r3 228; P9BE-NEXT: blr 229entry: 230 %0 = bitcast i8* %pix1 to <8 x i8>* 231 %1 = load <8 x i8>, <8 x i8>* %0, align 1 232 %2 = zext <8 x i8> %1 to <8 x i32> 233 %3 = bitcast i8* %pix2 to <8 x i8>* 234 %4 = load <8 x i8>, <8 x i8>* %3, align 1 235 %5 = zext <8 x i8> %4 to <8 x i32> 236 %6 = sub nsw <8 x i32> %2, %5 237 %7 = icmp slt <8 x i32> %6, zeroinitializer 238 %8 = sub nsw <8 x i32> zeroinitializer, %6 239 %9 = select <8 x i1> %7, <8 x i32> %8, <8 x i32> %6 240 %rdx.shuf = shufflevector <8 x i32> %9, <8 x i32> undef, <8 x i32> <i32 4, i32 5, i32 6, i32 7, i32 undef, i32 undef, i32 undef, i32 undef> 241 %bin.rdx = add nsw <8 x i32> %9, %rdx.shuf 242 %rdx.shuf12 = shufflevector <8 x i32> %bin.rdx, <8 x i32> undef, <8 x i32> <i32 2, i32 3, i32 undef, i32 undef, i32 undef, i32 undef, i32 undef, i32 undef> 243 %bin.rdx13 = add nsw <8 x i32> %bin.rdx, %rdx.shuf12 244 %rdx.shuf14 = shufflevector <8 x i32> %bin.rdx13, <8 x i32> undef, <8 x i32> <i32 1, i32 undef, i32 undef, i32 undef, i32 undef, i32 undef, i32 undef, i32 undef> 245 %bin.rdx15 = add nsw <8 x i32> %bin.rdx13, %rdx.shuf14 246 %10 = extractelement <8 x i32> %bin.rdx15, i32 0 247 ret i32 %10 248} 249 250 251; Generated from C source: 252; 253;#include <stdint.h> 254;#include <stdlib.h> 255;int test_pre_inc_disable_1( uint8_t *pix1, int i_stride_pix1, uint8_t *pix2 ) { 256; int i_sum = 0; 257; for( int y = 0; y < 8; y++ ) { 258; for( int x = 0; x < 8; x++) { 259; i_sum += abs( pix1[x] - pix2[x] ) 260; } 261; pix1 += i_stride_pix1; 262; } 263; return i_sum; 264;} 265 266;int test_pre_inc_disable_2( uint8_t *pix1, uint8_t *pix2 ) { 267; int i_sum = 0; 268; for( int x = 0; x < 8; x++ ) { 269; i_sum += abs( pix1[x] - pix2[x] ); 270; } 271; 272; return i_sum; 273;} 274 275define void @test32(i8* nocapture readonly %pix2, i32 signext %i_pix2) { 276; CHECK-LABEL: test32: 277; CHECK: # %bb.0: # %entry 278; CHECK-NEXT: add r5, r3, r4 279; CHECK-NEXT: lxsiwzx v2, r3, r4 280; CHECK-NEXT: addis r3, r2, .LCPI2_0@toc@ha 281; CHECK-NEXT: xxlxor v3, v3, v3 282; CHECK-NEXT: addi r3, r3, .LCPI2_0@toc@l 283; CHECK-NEXT: lxvx v4, 0, r3 284; CHECK-NEXT: li r3, 4 285; CHECK-NEXT: lxsiwzx v5, r5, r3 286; CHECK-NEXT: vperm v2, v2, v3, v4 287; CHECK-NEXT: vperm v3, v5, v3, v4 288; CHECK-NEXT: vspltisw v4, 8 289; CHECK-NEXT: vnegw v3, v3 290; CHECK-NEXT: vadduwm v4, v4, v4 291; CHECK-NEXT: vslw v3, v3, v4 292; CHECK-NEXT: vsubuwm v2, v3, v2 293; CHECK-NEXT: xxswapd vs0, v2 294; CHECK-NEXT: stxvx vs0, 0, r3 295; CHECK-NEXT: blr 296; 297; P9BE-LABEL: test32: 298; P9BE: # %bb.0: # %entry 299; P9BE-NEXT: add r5, r3, r4 300; P9BE-NEXT: lfiwzx f0, r3, r4 301; P9BE-NEXT: addis r3, r2, .LCPI2_0@toc@ha 302; P9BE-NEXT: xxlxor v3, v3, v3 303; P9BE-NEXT: xxsldwi v2, f0, f0, 1 304; P9BE-NEXT: addi r3, r3, .LCPI2_0@toc@l 305; P9BE-NEXT: lxvx v4, 0, r3 306; P9BE-NEXT: li r3, 4 307; P9BE-NEXT: lfiwzx f0, r5, r3 308; P9BE-NEXT: vperm v2, v3, v2, v4 309; P9BE-NEXT: xxsldwi v5, f0, f0, 1 310; P9BE-NEXT: vperm v3, v3, v5, v4 311; P9BE-NEXT: vspltisw v4, 8 312; P9BE-NEXT: vnegw v3, v3 313; P9BE-NEXT: vadduwm v4, v4, v4 314; P9BE-NEXT: vslw v3, v3, v4 315; P9BE-NEXT: vsubuwm v2, v3, v2 316; P9BE-NEXT: xxswapd vs0, v2 317; P9BE-NEXT: stxvx vs0, 0, r3 318; P9BE-NEXT: blr 319entry: 320 %idx.ext63 = sext i32 %i_pix2 to i64 321 %add.ptr64 = getelementptr inbounds i8, i8* %pix2, i64 %idx.ext63 322 %arrayidx5.1 = getelementptr inbounds i8, i8* %add.ptr64, i64 4 323 %0 = bitcast i8* %add.ptr64 to <4 x i8>* 324 %1 = load <4 x i8>, <4 x i8>* %0, align 1 325 %reorder_shuffle117 = shufflevector <4 x i8> %1, <4 x i8> undef, <4 x i32> <i32 3, i32 2, i32 1, i32 0> 326 %2 = zext <4 x i8> %reorder_shuffle117 to <4 x i32> 327 %3 = sub nsw <4 x i32> zeroinitializer, %2 328 %4 = bitcast i8* %arrayidx5.1 to <4 x i8>* 329 %5 = load <4 x i8>, <4 x i8>* %4, align 1 330 %reorder_shuffle115 = shufflevector <4 x i8> %5, <4 x i8> undef, <4 x i32> <i32 3, i32 2, i32 1, i32 0> 331 %6 = zext <4 x i8> %reorder_shuffle115 to <4 x i32> 332 %7 = sub nsw <4 x i32> zeroinitializer, %6 333 %8 = shl nsw <4 x i32> %7, <i32 16, i32 16, i32 16, i32 16> 334 %9 = add nsw <4 x i32> %8, %3 335 %10 = sub nsw <4 x i32> %9, zeroinitializer 336 %11 = shufflevector <4 x i32> undef, <4 x i32> %10, <4 x i32> <i32 2, i32 7, i32 0, i32 5> 337 %12 = add nsw <4 x i32> zeroinitializer, %11 338 %13 = shufflevector <4 x i32> %12, <4 x i32> undef, <4 x i32> <i32 0, i32 1, i32 6, i32 7> 339 store <4 x i32> %13, <4 x i32>* undef, align 16 340 ret void 341} 342 343define void @test16(i16* nocapture readonly %sums, i32 signext %delta, i32 signext %thresh) { 344; CHECK-LABEL: test16: 345; CHECK: # %bb.0: # %entry 346; CHECK-NEXT: sldi r4, r4, 1 347; CHECK-NEXT: li r7, 16 348; CHECK-NEXT: add r6, r3, r4 349; CHECK-NEXT: lxsihzx v4, r3, r4 350; CHECK-NEXT: addis r3, r2, .LCPI3_0@toc@ha 351; CHECK-NEXT: lxsihzx v2, r6, r7 352; CHECK-NEXT: li r6, 0 353; CHECK-NEXT: addi r3, r3, .LCPI3_0@toc@l 354; CHECK-NEXT: mtvsrd v3, r6 355; CHECK-NEXT: vsplth v4, v4, 3 356; CHECK-NEXT: vsplth v2, v2, 3 357; CHECK-NEXT: vmrghh v4, v3, v4 358; CHECK-NEXT: vmrghh v2, v3, v2 359; CHECK-NEXT: vsplth v3, v3, 3 360; CHECK-NEXT: vmrglw v3, v4, v3 361; CHECK-NEXT: lxvx v4, 0, r3 362; CHECK-NEXT: li r3, 0 363; CHECK-NEXT: vperm v2, v2, v3, v4 364; CHECK-NEXT: xxspltw v3, v2, 2 365; CHECK-NEXT: vadduwm v2, v2, v3 366; CHECK-NEXT: vextuwrx r3, r3, v2 367; CHECK-NEXT: cmpw r3, r5 368; CHECK-NEXT: bgelr+ cr0 369; CHECK-NEXT: # %bb.1: # %if.then 370; 371; P9BE-LABEL: test16: 372; P9BE: # %bb.0: # %entry 373; P9BE-NEXT: sldi r4, r4, 1 374; P9BE-NEXT: li r7, 16 375; P9BE-NEXT: add r6, r3, r4 376; P9BE-NEXT: lxsihzx v4, r3, r4 377; P9BE-NEXT: addis r3, r2, .LCPI3_0@toc@ha 378; P9BE-NEXT: lxsihzx v2, r6, r7 379; P9BE-NEXT: li r6, 0 380; P9BE-NEXT: addi r3, r3, .LCPI3_0@toc@l 381; P9BE-NEXT: sldi r6, r6, 48 382; P9BE-NEXT: vsplth v4, v4, 3 383; P9BE-NEXT: mtvsrd v3, r6 384; P9BE-NEXT: vsplth v2, v2, 3 385; P9BE-NEXT: vmrghh v4, v3, v4 386; P9BE-NEXT: vmrghh v2, v3, v2 387; P9BE-NEXT: vsplth v3, v3, 0 388; P9BE-NEXT: vmrghw v3, v3, v4 389; P9BE-NEXT: lxvx v4, 0, r3 390; P9BE-NEXT: li r3, 0 391; P9BE-NEXT: vperm v2, v3, v2, v4 392; P9BE-NEXT: xxspltw v3, v2, 1 393; P9BE-NEXT: vadduwm v2, v2, v3 394; P9BE-NEXT: vextuwlx r3, r3, v2 395; P9BE-NEXT: cmpw r3, r5 396; P9BE-NEXT: bgelr+ cr0 397; P9BE-NEXT: # %bb.1: # %if.then 398entry: 399 %idxprom = sext i32 %delta to i64 400 %add14 = add nsw i32 %delta, 8 401 %idxprom15 = sext i32 %add14 to i64 402 br label %for.body 403 404for.body: ; preds = %entry 405 %arrayidx8 = getelementptr inbounds i16, i16* %sums, i64 %idxprom 406 %0 = load i16, i16* %arrayidx8, align 2 407 %arrayidx16 = getelementptr inbounds i16, i16* %sums, i64 %idxprom15 408 %1 = load i16, i16* %arrayidx16, align 2 409 %2 = insertelement <4 x i16> undef, i16 %0, i32 2 410 %3 = insertelement <4 x i16> %2, i16 %1, i32 3 411 %4 = zext <4 x i16> %3 to <4 x i32> 412 %5 = sub nsw <4 x i32> zeroinitializer, %4 413 %6 = sub nsw <4 x i32> zeroinitializer, %5 414 %7 = select <4 x i1> undef, <4 x i32> %6, <4 x i32> %5 415 %bin.rdx = add <4 x i32> %7, zeroinitializer 416 %rdx.shuf54 = shufflevector <4 x i32> %bin.rdx, <4 x i32> undef, <4 x i32> <i32 1, i32 undef, i32 undef, i32 undef> 417 %bin.rdx55 = add <4 x i32> %bin.rdx, %rdx.shuf54 418 %8 = extractelement <4 x i32> %bin.rdx55, i32 0 419 %op.extra = add nuw i32 %8, 0 420 %cmp25 = icmp slt i32 %op.extra, %thresh 421 br i1 %cmp25, label %if.then, label %if.end 422 423if.then: ; preds = %for.body 424 unreachable 425 426if.end: ; preds = %for.body 427 ret void 428} 429 430define void @test8(i8* nocapture readonly %sums, i32 signext %delta, i32 signext %thresh) { 431; CHECK-LABEL: test8: 432; CHECK: # %bb.0: # %entry 433; CHECK-NEXT: add r6, r3, r4 434; CHECK-NEXT: lxsibzx v2, r3, r4 435; CHECK-NEXT: li r3, 0 436; CHECK-NEXT: mtvsrd v3, r3 437; CHECK-NEXT: li r3, 8 438; CHECK-NEXT: lxsibzx v5, r6, r3 439; CHECK-NEXT: vspltb v4, v3, 7 440; CHECK-NEXT: addis r3, r2, .LCPI4_0@toc@ha 441; CHECK-NEXT: vspltb v2, v2, 7 442; CHECK-NEXT: addi r3, r3, .LCPI4_0@toc@l 443; CHECK-NEXT: vmrghb v2, v3, v2 444; CHECK-NEXT: vspltb v5, v5, 7 445; CHECK-NEXT: vmrglh v2, v2, v4 446; CHECK-NEXT: vmrghb v3, v3, v5 447; CHECK-NEXT: vmrglw v2, v2, v4 448; CHECK-NEXT: vmrglh v3, v3, v4 449; CHECK-NEXT: vmrglw v3, v4, v3 450; CHECK-NEXT: lxvx v4, 0, r3 451; CHECK-NEXT: li r3, 0 452; CHECK-NEXT: vperm v2, v3, v2, v4 453; CHECK-NEXT: xxspltw v3, v2, 2 454; CHECK-NEXT: vadduwm v2, v2, v3 455; CHECK-NEXT: vextuwrx r3, r3, v2 456; CHECK-NEXT: cmpw r3, r5 457; CHECK-NEXT: bgelr+ cr0 458; CHECK-NEXT: # %bb.1: # %if.then 459; 460; P9BE-LABEL: test8: 461; P9BE: # %bb.0: # %entry 462; P9BE-NEXT: add r6, r3, r4 463; P9BE-NEXT: li r7, 8 464; P9BE-NEXT: lxsibzx v4, r3, r4 465; P9BE-NEXT: addis r3, r2, .LCPI4_0@toc@ha 466; P9BE-NEXT: lxsibzx v2, r6, r7 467; P9BE-NEXT: li r6, 0 468; P9BE-NEXT: addi r3, r3, .LCPI4_0@toc@l 469; P9BE-NEXT: sldi r6, r6, 56 470; P9BE-NEXT: vspltb v4, v4, 7 471; P9BE-NEXT: mtvsrd v3, r6 472; P9BE-NEXT: vspltb v2, v2, 7 473; P9BE-NEXT: vmrghb v4, v3, v4 474; P9BE-NEXT: vmrghb v2, v3, v2 475; P9BE-NEXT: vspltb v3, v3, 0 476; P9BE-NEXT: vmrghh v4, v4, v3 477; P9BE-NEXT: xxspltw v3, v3, 0 478; P9BE-NEXT: vmrghw v2, v4, v2 479; P9BE-NEXT: lxvx v4, 0, r3 480; P9BE-NEXT: li r3, 0 481; P9BE-NEXT: vperm v2, v3, v2, v4 482; P9BE-NEXT: xxspltw v3, v2, 1 483; P9BE-NEXT: vadduwm v2, v2, v3 484; P9BE-NEXT: vextuwlx r3, r3, v2 485; P9BE-NEXT: cmpw r3, r5 486; P9BE-NEXT: bgelr+ cr0 487; P9BE-NEXT: # %bb.1: # %if.then 488entry: 489 %idxprom = sext i32 %delta to i64 490 %add14 = add nsw i32 %delta, 8 491 %idxprom15 = sext i32 %add14 to i64 492 br label %for.body 493 494for.body: ; preds = %entry 495 %arrayidx8 = getelementptr inbounds i8, i8* %sums, i64 %idxprom 496 %0 = load i8, i8* %arrayidx8, align 2 497 %arrayidx16 = getelementptr inbounds i8, i8* %sums, i64 %idxprom15 498 %1 = load i8, i8* %arrayidx16, align 2 499 %2 = insertelement <4 x i8> undef, i8 %0, i32 2 500 %3 = insertelement <4 x i8> %2, i8 %1, i32 3 501 %4 = zext <4 x i8> %3 to <4 x i32> 502 %5 = sub nsw <4 x i32> zeroinitializer, %4 503 %6 = sub nsw <4 x i32> zeroinitializer, %5 504 %7 = select <4 x i1> undef, <4 x i32> %6, <4 x i32> %5 505 %bin.rdx = add <4 x i32> %7, zeroinitializer 506 %rdx.shuf54 = shufflevector <4 x i32> %bin.rdx, <4 x i32> undef, <4 x i32> <i32 1, i32 undef, i32 undef, i32 undef> 507 %bin.rdx55 = add <4 x i32> %bin.rdx, %rdx.shuf54 508 %8 = extractelement <4 x i32> %bin.rdx55, i32 0 509 %op.extra = add nuw i32 %8, 0 510 %cmp25 = icmp slt i32 %op.extra, %thresh 511 br i1 %cmp25, label %if.then, label %if.end 512 513if.then: ; preds = %for.body 514 unreachable 515 516if.end: ; preds = %for.body 517 ret void 518} 519