1; NOTE: Assertions have been autogenerated by utils/update_test_checks.py
2; RUN: opt -S -mtriple=amdgcn-amd-amdhsa -amdgpu-promote-alloca < %s | FileCheck %s
3
4; Make sure that array alloca loaded and stored as multi-element aggregates are handled correctly
5; Strictly the promote-alloca pass shouldn't have to deal with this case as it is non-canonical, but
6; the pass should handle it gracefully if it is
7; The checks look for lines that previously caused issues in PromoteAlloca (non-canonical). Opt
8; should now leave these unchanged
9
10%Block = type { [1 x float], i32 }
11%gl_PerVertex = type { <4 x float>, float, [1 x float], [1 x float] }
12%struct = type { i32, i32 }
13
14@block = external addrspace(1) global %Block
15@pv = external addrspace(1) global %gl_PerVertex
16
17define amdgpu_vs void @promote_1d_aggr() #0 {
18; CHECK-LABEL: @promote_1d_aggr(
19; CHECK-NEXT:    [[I:%.*]] = alloca i32, align 4
20; CHECK-NEXT:    [[F1:%.*]] = alloca [1 x float], align 4
21; CHECK-NEXT:    [[FOO:%.*]] = getelementptr [[BLOCK:%.*]], [[BLOCK]] addrspace(1)* @block, i32 0, i32 1
22; CHECK-NEXT:    [[FOO1:%.*]] = load i32, i32 addrspace(1)* [[FOO]], align 4
23; CHECK-NEXT:    store i32 [[FOO1]], i32* [[I]], align 4
24; CHECK-NEXT:    [[FOO2:%.*]] = getelementptr [[BLOCK]], [[BLOCK]] addrspace(1)* @block, i32 0, i32 0
25; CHECK-NEXT:    [[FOO3:%.*]] = load [1 x float], [1 x float] addrspace(1)* [[FOO2]], align 4
26; CHECK-NEXT:    store [1 x float] [[FOO3]], [1 x float]* [[F1]], align 4
27; CHECK-NEXT:    [[FOO4:%.*]] = load i32, i32* [[I]], align 4
28; CHECK-NEXT:    [[FOO5:%.*]] = getelementptr [1 x float], [1 x float]* [[F1]], i32 0, i32 [[FOO4]]
29; CHECK-NEXT:    [[FOO6:%.*]] = load float, float* [[FOO5]], align 4
30; CHECK-NEXT:    [[FOO7:%.*]] = alloca <4 x float>, align 16
31; CHECK-NEXT:    [[FOO8:%.*]] = load <4 x float>, <4 x float>* [[FOO7]], align 16
32; CHECK-NEXT:    [[FOO9:%.*]] = insertelement <4 x float> [[FOO8]], float [[FOO6]], i32 0
33; CHECK-NEXT:    [[FOO10:%.*]] = insertelement <4 x float> [[FOO9]], float [[FOO6]], i32 1
34; CHECK-NEXT:    [[FOO11:%.*]] = insertelement <4 x float> [[FOO10]], float [[FOO6]], i32 2
35; CHECK-NEXT:    [[FOO12:%.*]] = insertelement <4 x float> [[FOO11]], float [[FOO6]], i32 3
36; CHECK-NEXT:    [[FOO13:%.*]] = getelementptr [[GL_PERVERTEX:%.*]], [[GL_PERVERTEX]] addrspace(1)* @pv, i32 0, i32 0
37; CHECK-NEXT:    store <4 x float> [[FOO12]], <4 x float> addrspace(1)* [[FOO13]], align 16
38; CHECK-NEXT:    ret void
39;
40  %i = alloca i32
41  %f1 = alloca [1 x float]
42  %foo = getelementptr %Block, %Block addrspace(1)* @block, i32 0, i32 1
43  %foo1 = load i32, i32 addrspace(1)* %foo
44  store i32 %foo1, i32* %i
45  %foo2 = getelementptr %Block, %Block addrspace(1)* @block, i32 0, i32 0
46  %foo3 = load [1 x float], [1 x float] addrspace(1)* %foo2
47  store [1 x float] %foo3, [1 x float]* %f1
48  %foo4 = load i32, i32* %i
49  %foo5 = getelementptr [1 x float], [1 x float]* %f1, i32 0, i32 %foo4
50  %foo6 = load float, float* %foo5
51  %foo7 = alloca <4 x float>
52  %foo8 = load <4 x float>, <4 x float>* %foo7
53  %foo9 = insertelement <4 x float> %foo8, float %foo6, i32 0
54  %foo10 = insertelement <4 x float> %foo9, float %foo6, i32 1
55  %foo11 = insertelement <4 x float> %foo10, float %foo6, i32 2
56  %foo12 = insertelement <4 x float> %foo11, float %foo6, i32 3
57  %foo13 = getelementptr %gl_PerVertex, %gl_PerVertex addrspace(1)* @pv, i32 0, i32 0
58  store <4 x float> %foo12, <4 x float> addrspace(1)* %foo13
59  ret void
60}
61
62%Block2 = type { i32, [2 x float] }
63@block2 = external addrspace(1) global %Block2
64
65define amdgpu_vs void @promote_store_aggr() #0 {
66; CHECK-LABEL: @promote_store_aggr(
67; CHECK-NEXT:    [[I:%.*]] = alloca i32, align 4
68; CHECK-NEXT:    [[F1:%.*]] = alloca [2 x float], align 4
69; CHECK-NEXT:    [[FOO:%.*]] = getelementptr [[BLOCK2:%.*]], [[BLOCK2]] addrspace(1)* @block2, i32 0, i32 0
70; CHECK-NEXT:    [[FOO1:%.*]] = load i32, i32 addrspace(1)* [[FOO]], align 4
71; CHECK-NEXT:    store i32 [[FOO1]], i32* [[I]], align 4
72; CHECK-NEXT:    [[FOO2:%.*]] = load i32, i32* [[I]], align 4
73; CHECK-NEXT:    [[FOO3:%.*]] = sitofp i32 [[FOO2]] to float
74; CHECK-NEXT:    [[FOO4:%.*]] = getelementptr [2 x float], [2 x float]* [[F1]], i32 0, i32 0
75; CHECK-NEXT:    store float [[FOO3]], float* [[FOO4]], align 4
76; CHECK-NEXT:    [[FOO5:%.*]] = getelementptr [2 x float], [2 x float]* [[F1]], i32 0, i32 1
77; CHECK-NEXT:    store float 2.000000e+00, float* [[FOO5]], align 4
78; CHECK-NEXT:    [[FOO6:%.*]] = load [2 x float], [2 x float]* [[F1]], align 4
79; CHECK-NEXT:    [[FOO7:%.*]] = getelementptr [[BLOCK2]], [[BLOCK2]] addrspace(1)* @block2, i32 0, i32 1
80; CHECK-NEXT:    store [2 x float] [[FOO6]], [2 x float] addrspace(1)* [[FOO7]], align 4
81; CHECK-NEXT:    [[FOO8:%.*]] = getelementptr [[GL_PERVERTEX:%.*]], [[GL_PERVERTEX]] addrspace(1)* @pv, i32 0, i32 0
82; CHECK-NEXT:    store <4 x float> <float 1.000000e+00, float 1.000000e+00, float 1.000000e+00, float 1.000000e+00>, <4 x float> addrspace(1)* [[FOO8]], align 16
83; CHECK-NEXT:    ret void
84;
85  %i = alloca i32
86  %f1 = alloca [2 x float]
87  %foo = getelementptr %Block2, %Block2 addrspace(1)* @block2, i32 0, i32 0
88  %foo1 = load i32, i32 addrspace(1)* %foo
89  store i32 %foo1, i32* %i
90  %foo2 = load i32, i32* %i
91  %foo3 = sitofp i32 %foo2 to float
92  %foo4 = getelementptr [2 x float], [2 x float]* %f1, i32 0, i32 0
93  store float %foo3, float* %foo4
94  %foo5 = getelementptr [2 x float], [2 x float]* %f1, i32 0, i32 1
95  store float 2.000000e+00, float* %foo5
96  %foo6 = load [2 x float], [2 x float]* %f1
97  %foo7 = getelementptr %Block2, %Block2 addrspace(1)* @block2, i32 0, i32 1
98  store [2 x float] %foo6, [2 x float] addrspace(1)* %foo7
99  %foo8 = getelementptr %gl_PerVertex, %gl_PerVertex addrspace(1)* @pv, i32 0, i32 0
100  store <4 x float> <float 1.000000e+00, float 1.000000e+00, float 1.000000e+00, float 1.000000e+00>, <4 x float> addrspace(1)* %foo8
101  ret void
102}
103
104%Block3 = type { [2 x float], i32 }
105@block3 = external addrspace(1) global %Block3
106
107define amdgpu_vs void @promote_load_from_store_aggr() #0 {
108; CHECK-LABEL: @promote_load_from_store_aggr(
109; CHECK-NEXT:    [[I:%.*]] = alloca i32, align 4
110; CHECK-NEXT:    [[F1:%.*]] = alloca [2 x float], align 4
111; CHECK-NEXT:    [[FOO:%.*]] = getelementptr [[BLOCK3:%.*]], [[BLOCK3]] addrspace(1)* @block3, i32 0, i32 1
112; CHECK-NEXT:    [[FOO1:%.*]] = load i32, i32 addrspace(1)* [[FOO]], align 4
113; CHECK-NEXT:    store i32 [[FOO1]], i32* [[I]], align 4
114; CHECK-NEXT:    [[FOO2:%.*]] = getelementptr [[BLOCK3]], [[BLOCK3]] addrspace(1)* @block3, i32 0, i32 0
115; CHECK-NEXT:    [[FOO3:%.*]] = load [2 x float], [2 x float] addrspace(1)* [[FOO2]], align 4
116; CHECK-NEXT:    store [2 x float] [[FOO3]], [2 x float]* [[F1]], align 4
117; CHECK-NEXT:    [[FOO4:%.*]] = load i32, i32* [[I]], align 4
118; CHECK-NEXT:    [[FOO5:%.*]] = getelementptr [2 x float], [2 x float]* [[F1]], i32 0, i32 [[FOO4]]
119; CHECK-NEXT:    [[FOO6:%.*]] = load float, float* [[FOO5]], align 4
120; CHECK-NEXT:    [[FOO7:%.*]] = alloca <4 x float>, align 16
121; CHECK-NEXT:    [[FOO8:%.*]] = load <4 x float>, <4 x float>* [[FOO7]], align 16
122; CHECK-NEXT:    [[FOO9:%.*]] = insertelement <4 x float> [[FOO8]], float [[FOO6]], i32 0
123; CHECK-NEXT:    [[FOO10:%.*]] = insertelement <4 x float> [[FOO9]], float [[FOO6]], i32 1
124; CHECK-NEXT:    [[FOO11:%.*]] = insertelement <4 x float> [[FOO10]], float [[FOO6]], i32 2
125; CHECK-NEXT:    [[FOO12:%.*]] = insertelement <4 x float> [[FOO11]], float [[FOO6]], i32 3
126; CHECK-NEXT:    [[FOO13:%.*]] = getelementptr [[GL_PERVERTEX:%.*]], [[GL_PERVERTEX]] addrspace(1)* @pv, i32 0, i32 0
127; CHECK-NEXT:    store <4 x float> [[FOO12]], <4 x float> addrspace(1)* [[FOO13]], align 16
128; CHECK-NEXT:    ret void
129;
130  %i = alloca i32
131  %f1 = alloca [2 x float]
132  %foo = getelementptr %Block3, %Block3 addrspace(1)* @block3, i32 0, i32 1
133  %foo1 = load i32, i32 addrspace(1)* %foo
134  store i32 %foo1, i32* %i
135  %foo2 = getelementptr %Block3, %Block3 addrspace(1)* @block3, i32 0, i32 0
136  %foo3 = load [2 x float], [2 x float] addrspace(1)* %foo2
137  store [2 x float] %foo3, [2 x float]* %f1
138  %foo4 = load i32, i32* %i
139  %foo5 = getelementptr [2 x float], [2 x float]* %f1, i32 0, i32 %foo4
140  %foo6 = load float, float* %foo5
141  %foo7 = alloca <4 x float>
142  %foo8 = load <4 x float>, <4 x float>* %foo7
143  %foo9 = insertelement <4 x float> %foo8, float %foo6, i32 0
144  %foo10 = insertelement <4 x float> %foo9, float %foo6, i32 1
145  %foo11 = insertelement <4 x float> %foo10, float %foo6, i32 2
146  %foo12 = insertelement <4 x float> %foo11, float %foo6, i32 3
147  %foo13 = getelementptr %gl_PerVertex, %gl_PerVertex addrspace(1)* @pv, i32 0, i32 0
148  store <4 x float> %foo12, <4 x float> addrspace(1)* %foo13
149  ret void
150}
151
152@tmp_g = external addrspace(1) global { [4 x double], <2 x double>, <3 x double>, <4 x double> }
153@frag_color = external addrspace(1) global <4 x float>
154
155define amdgpu_ps void @promote_double_aggr() #0 {
156; CHECK-LABEL: @promote_double_aggr(
157; CHECK-NEXT:    [[S:%.*]] = alloca [2 x double], align 8
158; CHECK-NEXT:    [[FOO:%.*]] = getelementptr { [4 x double], <2 x double>, <3 x double>, <4 x double> }, { [4 x double], <2 x double>, <3 x double>, <4 x double> } addrspace(1)* @tmp_g, i32 0, i32 0, i32 0
159; CHECK-NEXT:    [[FOO1:%.*]] = load double, double addrspace(1)* [[FOO]], align 8
160; CHECK-NEXT:    [[FOO2:%.*]] = getelementptr { [4 x double], <2 x double>, <3 x double>, <4 x double> }, { [4 x double], <2 x double>, <3 x double>, <4 x double> } addrspace(1)* @tmp_g, i32 0, i32 0, i32 1
161; CHECK-NEXT:    [[FOO3:%.*]] = load double, double addrspace(1)* [[FOO2]], align 8
162; CHECK-NEXT:    [[FOO4:%.*]] = insertvalue [2 x double] undef, double [[FOO1]], 0
163; CHECK-NEXT:    [[FOO5:%.*]] = insertvalue [2 x double] [[FOO4]], double [[FOO3]], 1
164; CHECK-NEXT:    store [2 x double] [[FOO5]], [2 x double]* [[S]], align 8
165; CHECK-NEXT:    [[FOO6:%.*]] = getelementptr [2 x double], [2 x double]* [[S]], i32 0, i32 1
166; CHECK-NEXT:    [[FOO7:%.*]] = load double, double* [[FOO6]], align 8
167; CHECK-NEXT:    [[FOO8:%.*]] = getelementptr [2 x double], [2 x double]* [[S]], i32 0, i32 1
168; CHECK-NEXT:    [[FOO9:%.*]] = load double, double* [[FOO8]], align 8
169; CHECK-NEXT:    [[FOO10:%.*]] = fadd double [[FOO7]], [[FOO9]]
170; CHECK-NEXT:    [[FOO11:%.*]] = getelementptr [2 x double], [2 x double]* [[S]], i32 0, i32 0
171; CHECK-NEXT:    store double [[FOO10]], double* [[FOO11]], align 8
172; CHECK-NEXT:    [[FOO12:%.*]] = getelementptr [2 x double], [2 x double]* [[S]], i32 0, i32 0
173; CHECK-NEXT:    [[FOO13:%.*]] = load double, double* [[FOO12]], align 8
174; CHECK-NEXT:    [[FOO14:%.*]] = getelementptr [2 x double], [2 x double]* [[S]], i32 0, i32 1
175; CHECK-NEXT:    [[FOO15:%.*]] = load double, double* [[FOO14]], align 8
176; CHECK-NEXT:    [[FOO16:%.*]] = fadd double [[FOO13]], [[FOO15]]
177; CHECK-NEXT:    [[FOO17:%.*]] = fptrunc double [[FOO16]] to float
178; CHECK-NEXT:    [[FOO18:%.*]] = insertelement <4 x float> undef, float [[FOO17]], i32 0
179; CHECK-NEXT:    [[FOO19:%.*]] = insertelement <4 x float> [[FOO18]], float [[FOO17]], i32 1
180; CHECK-NEXT:    [[FOO20:%.*]] = insertelement <4 x float> [[FOO19]], float [[FOO17]], i32 2
181; CHECK-NEXT:    [[FOO21:%.*]] = insertelement <4 x float> [[FOO20]], float [[FOO17]], i32 3
182; CHECK-NEXT:    store <4 x float> [[FOO21]], <4 x float> addrspace(1)* @frag_color, align 16
183; CHECK-NEXT:    ret void
184;
185  %s = alloca [2 x double]
186  %foo = getelementptr { [4 x double], <2 x double>, <3 x double>, <4 x double> }, { [4 x double], <2 x double>, <3 x double>, <4 x double> } addrspace(1)* @tmp_g, i32 0, i32 0, i32 0
187  %foo1 = load double, double addrspace(1)* %foo
188  %foo2 = getelementptr { [4 x double], <2 x double>, <3 x double>, <4 x double> }, { [4 x double], <2 x double>, <3 x double>, <4 x double> } addrspace(1)* @tmp_g, i32 0, i32 0, i32 1
189  %foo3 = load double, double addrspace(1)* %foo2
190  %foo4 = insertvalue [2 x double] undef, double %foo1, 0
191  %foo5 = insertvalue [2 x double] %foo4, double %foo3, 1
192  store [2 x double] %foo5, [2 x double]* %s
193  %foo6 = getelementptr [2 x double], [2 x double]* %s, i32 0, i32 1
194  %foo7 = load double, double* %foo6
195  %foo8 = getelementptr [2 x double], [2 x double]* %s, i32 0, i32 1
196  %foo9 = load double, double* %foo8
197  %foo10 = fadd double %foo7, %foo9
198  %foo11 = getelementptr [2 x double], [2 x double]* %s, i32 0, i32 0
199  store double %foo10, double* %foo11
200  %foo12 = getelementptr [2 x double], [2 x double]* %s, i32 0, i32 0
201  %foo13 = load double, double* %foo12
202  %foo14 = getelementptr [2 x double], [2 x double]* %s, i32 0, i32 1
203  %foo15 = load double, double* %foo14
204  %foo16 = fadd double %foo13, %foo15
205  %foo17 = fptrunc double %foo16 to float
206  %foo18 = insertelement <4 x float> undef, float %foo17, i32 0
207  %foo19 = insertelement <4 x float> %foo18, float %foo17, i32 1
208  %foo20 = insertelement <4 x float> %foo19, float %foo17, i32 2
209  %foo21 = insertelement <4 x float> %foo20, float %foo17, i32 3
210  store <4 x float> %foo21, <4 x float> addrspace(1)* @frag_color
211  ret void
212}
213
214; Don't crash on a type that isn't a valid vector element.
215define amdgpu_kernel void @alloca_struct() #0 {
216; CHECK-LABEL: @alloca_struct(
217; CHECK-NEXT:  entry:
218; CHECK-NEXT:    [[TMP0:%.*]] = call noalias nonnull dereferenceable(64) i8 addrspace(4)* @llvm.amdgcn.dispatch.ptr()
219; CHECK-NEXT:    [[TMP1:%.*]] = bitcast i8 addrspace(4)* [[TMP0]] to i32 addrspace(4)*
220; CHECK-NEXT:    [[TMP2:%.*]] = getelementptr inbounds i32, i32 addrspace(4)* [[TMP1]], i64 1
221; CHECK-NEXT:    [[TMP3:%.*]] = load i32, i32 addrspace(4)* [[TMP2]], align 4, !invariant.load !0
222; CHECK-NEXT:    [[TMP4:%.*]] = getelementptr inbounds i32, i32 addrspace(4)* [[TMP1]], i64 2
223; CHECK-NEXT:    [[TMP5:%.*]] = load i32, i32 addrspace(4)* [[TMP4]], align 4, !range [[RNG1:![0-9]+]], !invariant.load !0
224; CHECK-NEXT:    [[TMP6:%.*]] = lshr i32 [[TMP3]], 16
225; CHECK-NEXT:    [[TMP7:%.*]] = call i32 @llvm.amdgcn.workitem.id.x(), !range [[RNG2:![0-9]+]]
226; CHECK-NEXT:    [[TMP8:%.*]] = call i32 @llvm.amdgcn.workitem.id.y(), !range [[RNG2]]
227; CHECK-NEXT:    [[TMP9:%.*]] = call i32 @llvm.amdgcn.workitem.id.z(), !range [[RNG2]]
228; CHECK-NEXT:    [[TMP10:%.*]] = mul nuw nsw i32 [[TMP6]], [[TMP5]]
229; CHECK-NEXT:    [[TMP11:%.*]] = mul i32 [[TMP10]], [[TMP7]]
230; CHECK-NEXT:    [[TMP12:%.*]] = mul nuw nsw i32 [[TMP8]], [[TMP5]]
231; CHECK-NEXT:    [[TMP13:%.*]] = add i32 [[TMP11]], [[TMP12]]
232; CHECK-NEXT:    [[TMP14:%.*]] = add i32 [[TMP13]], [[TMP9]]
233; CHECK-NEXT:    [[TMP15:%.*]] = getelementptr inbounds [1024 x [2 x %struct]], [1024 x [2 x %struct]] addrspace(3)* @alloca_struct.alloca, i32 0, i32 [[TMP14]]
234; CHECK-NEXT:    ret void
235;
236entry:
237  %alloca = alloca [2 x %struct], align 4
238  ret void
239}
240