1 //===---- CGBuiltin.cpp - Emit LLVM Code for builtins ---------------------===//
2 //
3 //                     The LLVM Compiler Infrastructure
4 //
5 // This file is distributed under the University of Illinois Open Source
6 // License. See LICENSE.TXT for details.
7 //
8 //===----------------------------------------------------------------------===//
9 //
10 // This contains code to emit Builtin calls as LLVM code.
11 //
12 //===----------------------------------------------------------------------===//
13 
14 #include "CodeGenFunction.h"
15 #include "CGCXXABI.h"
16 #include "CGObjCRuntime.h"
17 #include "CodeGenModule.h"
18 #include "TargetInfo.h"
19 #include "clang/AST/ASTContext.h"
20 #include "clang/AST/Decl.h"
21 #include "clang/Basic/TargetBuiltins.h"
22 #include "clang/Basic/TargetInfo.h"
23 #include "clang/CodeGen/CGFunctionInfo.h"
24 #include "llvm/ADT/StringExtras.h"
25 #include "llvm/IR/CallSite.h"
26 #include "llvm/IR/DataLayout.h"
27 #include "llvm/IR/InlineAsm.h"
28 #include "llvm/IR/Intrinsics.h"
29 #include <sstream>
30 
31 using namespace clang;
32 using namespace CodeGen;
33 using namespace llvm;
34 
35 /// getBuiltinLibFunction - Given a builtin id for a function like
36 /// "__builtin_fabsf", return a Function* for "fabsf".
37 llvm::Value *CodeGenModule::getBuiltinLibFunction(const FunctionDecl *FD,
38                                                   unsigned BuiltinID) {
39   assert(Context.BuiltinInfo.isLibFunction(BuiltinID));
40 
41   // Get the name, skip over the __builtin_ prefix (if necessary).
42   StringRef Name;
43   GlobalDecl D(FD);
44 
45   // If the builtin has been declared explicitly with an assembler label,
46   // use the mangled name. This differs from the plain label on platforms
47   // that prefix labels.
48   if (FD->hasAttr<AsmLabelAttr>())
49     Name = getMangledName(D);
50   else
51     Name = Context.BuiltinInfo.getName(BuiltinID) + 10;
52 
53   llvm::FunctionType *Ty =
54     cast<llvm::FunctionType>(getTypes().ConvertType(FD->getType()));
55 
56   return GetOrCreateLLVMFunction(Name, Ty, D, /*ForVTable=*/false);
57 }
58 
59 /// Emit the conversions required to turn the given value into an
60 /// integer of the given size.
61 static Value *EmitToInt(CodeGenFunction &CGF, llvm::Value *V,
62                         QualType T, llvm::IntegerType *IntType) {
63   V = CGF.EmitToMemory(V, T);
64 
65   if (V->getType()->isPointerTy())
66     return CGF.Builder.CreatePtrToInt(V, IntType);
67 
68   assert(V->getType() == IntType);
69   return V;
70 }
71 
72 static Value *EmitFromInt(CodeGenFunction &CGF, llvm::Value *V,
73                           QualType T, llvm::Type *ResultType) {
74   V = CGF.EmitFromMemory(V, T);
75 
76   if (ResultType->isPointerTy())
77     return CGF.Builder.CreateIntToPtr(V, ResultType);
78 
79   assert(V->getType() == ResultType);
80   return V;
81 }
82 
83 /// Utility to insert an atomic instruction based on Instrinsic::ID
84 /// and the expression node.
85 static Value *MakeBinaryAtomicValue(CodeGenFunction &CGF,
86                                     llvm::AtomicRMWInst::BinOp Kind,
87                                     const CallExpr *E) {
88   QualType T = E->getType();
89   assert(E->getArg(0)->getType()->isPointerType());
90   assert(CGF.getContext().hasSameUnqualifiedType(T,
91                                   E->getArg(0)->getType()->getPointeeType()));
92   assert(CGF.getContext().hasSameUnqualifiedType(T, E->getArg(1)->getType()));
93 
94   llvm::Value *DestPtr = CGF.EmitScalarExpr(E->getArg(0));
95   unsigned AddrSpace = DestPtr->getType()->getPointerAddressSpace();
96 
97   llvm::IntegerType *IntType =
98     llvm::IntegerType::get(CGF.getLLVMContext(),
99                            CGF.getContext().getTypeSize(T));
100   llvm::Type *IntPtrType = IntType->getPointerTo(AddrSpace);
101 
102   llvm::Value *Args[2];
103   Args[0] = CGF.Builder.CreateBitCast(DestPtr, IntPtrType);
104   Args[1] = CGF.EmitScalarExpr(E->getArg(1));
105   llvm::Type *ValueType = Args[1]->getType();
106   Args[1] = EmitToInt(CGF, Args[1], T, IntType);
107 
108   llvm::Value *Result =
109       CGF.Builder.CreateAtomicRMW(Kind, Args[0], Args[1],
110                                   llvm::SequentiallyConsistent);
111   return EmitFromInt(CGF, Result, T, ValueType);
112 }
113 
114 static Value *EmitNontemporalStore(CodeGenFunction &CGF, const CallExpr *E) {
115   Value *Val = CGF.EmitScalarExpr(E->getArg(0));
116   Value *Address = CGF.EmitScalarExpr(E->getArg(1));
117 
118   // Convert the type of the pointer to a pointer to the stored type.
119   Val = CGF.EmitToMemory(Val, E->getArg(0)->getType());
120   Value *BC = CGF.Builder.CreateBitCast(
121       Address, llvm::PointerType::getUnqual(Val->getType()), "cast");
122   LValue LV = CGF.MakeNaturalAlignAddrLValue(BC, E->getArg(0)->getType());
123   LV.setNontemporal(true);
124   CGF.EmitStoreOfScalar(Val, LV, false);
125   return nullptr;
126 }
127 
128 static Value *EmitNontemporalLoad(CodeGenFunction &CGF, const CallExpr *E) {
129   Value *Address = CGF.EmitScalarExpr(E->getArg(0));
130 
131   LValue LV = CGF.MakeNaturalAlignAddrLValue(Address, E->getType());
132   LV.setNontemporal(true);
133   return CGF.EmitLoadOfScalar(LV, E->getExprLoc());
134 }
135 
136 static RValue EmitBinaryAtomic(CodeGenFunction &CGF,
137                                llvm::AtomicRMWInst::BinOp Kind,
138                                const CallExpr *E) {
139   return RValue::get(MakeBinaryAtomicValue(CGF, Kind, E));
140 }
141 
142 /// Utility to insert an atomic instruction based Instrinsic::ID and
143 /// the expression node, where the return value is the result of the
144 /// operation.
145 static RValue EmitBinaryAtomicPost(CodeGenFunction &CGF,
146                                    llvm::AtomicRMWInst::BinOp Kind,
147                                    const CallExpr *E,
148                                    Instruction::BinaryOps Op,
149                                    bool Invert = false) {
150   QualType T = E->getType();
151   assert(E->getArg(0)->getType()->isPointerType());
152   assert(CGF.getContext().hasSameUnqualifiedType(T,
153                                   E->getArg(0)->getType()->getPointeeType()));
154   assert(CGF.getContext().hasSameUnqualifiedType(T, E->getArg(1)->getType()));
155 
156   llvm::Value *DestPtr = CGF.EmitScalarExpr(E->getArg(0));
157   unsigned AddrSpace = DestPtr->getType()->getPointerAddressSpace();
158 
159   llvm::IntegerType *IntType =
160     llvm::IntegerType::get(CGF.getLLVMContext(),
161                            CGF.getContext().getTypeSize(T));
162   llvm::Type *IntPtrType = IntType->getPointerTo(AddrSpace);
163 
164   llvm::Value *Args[2];
165   Args[1] = CGF.EmitScalarExpr(E->getArg(1));
166   llvm::Type *ValueType = Args[1]->getType();
167   Args[1] = EmitToInt(CGF, Args[1], T, IntType);
168   Args[0] = CGF.Builder.CreateBitCast(DestPtr, IntPtrType);
169 
170   llvm::Value *Result =
171       CGF.Builder.CreateAtomicRMW(Kind, Args[0], Args[1],
172                                   llvm::SequentiallyConsistent);
173   Result = CGF.Builder.CreateBinOp(Op, Result, Args[1]);
174   if (Invert)
175     Result = CGF.Builder.CreateBinOp(llvm::Instruction::Xor, Result,
176                                      llvm::ConstantInt::get(IntType, -1));
177   Result = EmitFromInt(CGF, Result, T, ValueType);
178   return RValue::get(Result);
179 }
180 
181 /// @brief Utility to insert an atomic cmpxchg instruction.
182 ///
183 /// @param CGF The current codegen function.
184 /// @param E   Builtin call expression to convert to cmpxchg.
185 ///            arg0 - address to operate on
186 ///            arg1 - value to compare with
187 ///            arg2 - new value
188 /// @param ReturnBool Specifies whether to return success flag of
189 ///                   cmpxchg result or the old value.
190 ///
191 /// @returns result of cmpxchg, according to ReturnBool
192 static Value *MakeAtomicCmpXchgValue(CodeGenFunction &CGF, const CallExpr *E,
193                                      bool ReturnBool) {
194   QualType T = ReturnBool ? E->getArg(1)->getType() : E->getType();
195   llvm::Value *DestPtr = CGF.EmitScalarExpr(E->getArg(0));
196   unsigned AddrSpace = DestPtr->getType()->getPointerAddressSpace();
197 
198   llvm::IntegerType *IntType = llvm::IntegerType::get(
199       CGF.getLLVMContext(), CGF.getContext().getTypeSize(T));
200   llvm::Type *IntPtrType = IntType->getPointerTo(AddrSpace);
201 
202   Value *Args[3];
203   Args[0] = CGF.Builder.CreateBitCast(DestPtr, IntPtrType);
204   Args[1] = CGF.EmitScalarExpr(E->getArg(1));
205   llvm::Type *ValueType = Args[1]->getType();
206   Args[1] = EmitToInt(CGF, Args[1], T, IntType);
207   Args[2] = EmitToInt(CGF, CGF.EmitScalarExpr(E->getArg(2)), T, IntType);
208 
209   Value *Pair = CGF.Builder.CreateAtomicCmpXchg(Args[0], Args[1], Args[2],
210                                                 llvm::SequentiallyConsistent,
211                                                 llvm::SequentiallyConsistent);
212   if (ReturnBool)
213     // Extract boolean success flag and zext it to int.
214     return CGF.Builder.CreateZExt(CGF.Builder.CreateExtractValue(Pair, 1),
215                                   CGF.ConvertType(E->getType()));
216   else
217     // Extract old value and emit it using the same type as compare value.
218     return EmitFromInt(CGF, CGF.Builder.CreateExtractValue(Pair, 0), T,
219                        ValueType);
220 }
221 
222 /// EmitFAbs - Emit a call to @llvm.fabs().
223 static Value *EmitFAbs(CodeGenFunction &CGF, Value *V) {
224   Value *F = CGF.CGM.getIntrinsic(Intrinsic::fabs, V->getType());
225   llvm::CallInst *Call = CGF.Builder.CreateCall(F, V);
226   Call->setDoesNotAccessMemory();
227   return Call;
228 }
229 
230 /// Emit the computation of the sign bit for a floating point value. Returns
231 /// the i1 sign bit value.
232 static Value *EmitSignBit(CodeGenFunction &CGF, Value *V) {
233   LLVMContext &C = CGF.CGM.getLLVMContext();
234 
235   llvm::Type *Ty = V->getType();
236   int Width = Ty->getPrimitiveSizeInBits();
237   llvm::Type *IntTy = llvm::IntegerType::get(C, Width);
238   V = CGF.Builder.CreateBitCast(V, IntTy);
239   if (Ty->isPPC_FP128Ty()) {
240     // We want the sign bit of the higher-order double. The bitcast we just
241     // did works as if the double-double was stored to memory and then
242     // read as an i128. The "store" will put the higher-order double in the
243     // lower address in both little- and big-Endian modes, but the "load"
244     // will treat those bits as a different part of the i128: the low bits in
245     // little-Endian, the high bits in big-Endian. Therefore, on big-Endian
246     // we need to shift the high bits down to the low before truncating.
247     Width >>= 1;
248     if (CGF.getTarget().isBigEndian()) {
249       Value *ShiftCst = llvm::ConstantInt::get(IntTy, Width);
250       V = CGF.Builder.CreateLShr(V, ShiftCst);
251     }
252     // We are truncating value in order to extract the higher-order
253     // double, which we will be using to extract the sign from.
254     IntTy = llvm::IntegerType::get(C, Width);
255     V = CGF.Builder.CreateTrunc(V, IntTy);
256   }
257   Value *Zero = llvm::Constant::getNullValue(IntTy);
258   return CGF.Builder.CreateICmpSLT(V, Zero);
259 }
260 
261 static RValue emitLibraryCall(CodeGenFunction &CGF, const FunctionDecl *Fn,
262                               const CallExpr *E, llvm::Value *calleeValue) {
263   return CGF.EmitCall(E->getCallee()->getType(), calleeValue, E,
264                       ReturnValueSlot(), Fn);
265 }
266 
267 /// \brief Emit a call to llvm.{sadd,uadd,ssub,usub,smul,umul}.with.overflow.*
268 /// depending on IntrinsicID.
269 ///
270 /// \arg CGF The current codegen function.
271 /// \arg IntrinsicID The ID for the Intrinsic we wish to generate.
272 /// \arg X The first argument to the llvm.*.with.overflow.*.
273 /// \arg Y The second argument to the llvm.*.with.overflow.*.
274 /// \arg Carry The carry returned by the llvm.*.with.overflow.*.
275 /// \returns The result (i.e. sum/product) returned by the intrinsic.
276 static llvm::Value *EmitOverflowIntrinsic(CodeGenFunction &CGF,
277                                           const llvm::Intrinsic::ID IntrinsicID,
278                                           llvm::Value *X, llvm::Value *Y,
279                                           llvm::Value *&Carry) {
280   // Make sure we have integers of the same width.
281   assert(X->getType() == Y->getType() &&
282          "Arguments must be the same type. (Did you forget to make sure both "
283          "arguments have the same integer width?)");
284 
285   llvm::Value *Callee = CGF.CGM.getIntrinsic(IntrinsicID, X->getType());
286   llvm::Value *Tmp = CGF.Builder.CreateCall(Callee, {X, Y});
287   Carry = CGF.Builder.CreateExtractValue(Tmp, 1);
288   return CGF.Builder.CreateExtractValue(Tmp, 0);
289 }
290 
291 // Emit a simple mangled intrinsic that has 1 argument and a return type
292 // matching the argument type.
293 static Value *emitUnaryBuiltin(CodeGenFunction &CGF,
294                                const CallExpr *E,
295                                unsigned IntrinsicID) {
296   llvm::Value *Src0 = CGF.EmitScalarExpr(E->getArg(0));
297 
298   Value *F = CGF.CGM.getIntrinsic(IntrinsicID, Src0->getType());
299   return CGF.Builder.CreateCall(F, Src0);
300 }
301 
302 // Emit an intrinsic that has 3 float or double operands.
303 static Value *emitTernaryFPBuiltin(CodeGenFunction &CGF,
304                                    const CallExpr *E,
305                                    unsigned IntrinsicID) {
306   llvm::Value *Src0 = CGF.EmitScalarExpr(E->getArg(0));
307   llvm::Value *Src1 = CGF.EmitScalarExpr(E->getArg(1));
308   llvm::Value *Src2 = CGF.EmitScalarExpr(E->getArg(2));
309 
310   Value *F = CGF.CGM.getIntrinsic(IntrinsicID, Src0->getType());
311   return CGF.Builder.CreateCall(F, {Src0, Src1, Src2});
312 }
313 
314 // Emit an intrinsic that has 1 float or double operand, and 1 integer.
315 static Value *emitFPIntBuiltin(CodeGenFunction &CGF,
316                                const CallExpr *E,
317                                unsigned IntrinsicID) {
318   llvm::Value *Src0 = CGF.EmitScalarExpr(E->getArg(0));
319   llvm::Value *Src1 = CGF.EmitScalarExpr(E->getArg(1));
320 
321   Value *F = CGF.CGM.getIntrinsic(IntrinsicID, Src0->getType());
322   return CGF.Builder.CreateCall(F, {Src0, Src1});
323 }
324 
325 namespace {
326   struct WidthAndSignedness {
327     unsigned Width;
328     bool Signed;
329   };
330 }
331 
332 static WidthAndSignedness
333 getIntegerWidthAndSignedness(const clang::ASTContext &context,
334                              const clang::QualType Type) {
335   assert(Type->isIntegerType() && "Given type is not an integer.");
336   unsigned Width = Type->isBooleanType() ? 1 : context.getTypeInfo(Type).Width;
337   bool Signed = Type->isSignedIntegerType();
338   return {Width, Signed};
339 }
340 
341 // Given one or more integer types, this function produces an integer type that
342 // encompasses them: any value in one of the given types could be expressed in
343 // the encompassing type.
344 static struct WidthAndSignedness
345 EncompassingIntegerType(ArrayRef<struct WidthAndSignedness> Types) {
346   assert(Types.size() > 0 && "Empty list of types.");
347 
348   // If any of the given types is signed, we must return a signed type.
349   bool Signed = false;
350   for (const auto &Type : Types) {
351     Signed |= Type.Signed;
352   }
353 
354   // The encompassing type must have a width greater than or equal to the width
355   // of the specified types.  Aditionally, if the encompassing type is signed,
356   // its width must be strictly greater than the width of any unsigned types
357   // given.
358   unsigned Width = 0;
359   for (const auto &Type : Types) {
360     unsigned MinWidth = Type.Width + (Signed && !Type.Signed);
361     if (Width < MinWidth) {
362       Width = MinWidth;
363     }
364   }
365 
366   return {Width, Signed};
367 }
368 
369 Value *CodeGenFunction::EmitVAStartEnd(Value *ArgValue, bool IsStart) {
370   llvm::Type *DestType = Int8PtrTy;
371   if (ArgValue->getType() != DestType)
372     ArgValue =
373         Builder.CreateBitCast(ArgValue, DestType, ArgValue->getName().data());
374 
375   Intrinsic::ID inst = IsStart ? Intrinsic::vastart : Intrinsic::vaend;
376   return Builder.CreateCall(CGM.getIntrinsic(inst), ArgValue);
377 }
378 
379 /// Checks if using the result of __builtin_object_size(p, @p From) in place of
380 /// __builtin_object_size(p, @p To) is correct
381 static bool areBOSTypesCompatible(int From, int To) {
382   // Note: Our __builtin_object_size implementation currently treats Type=0 and
383   // Type=2 identically. Encoding this implementation detail here may make
384   // improving __builtin_object_size difficult in the future, so it's omitted.
385   return From == To || (From == 0 && To == 1) || (From == 3 && To == 2);
386 }
387 
388 static llvm::Value *
389 getDefaultBuiltinObjectSizeResult(unsigned Type, llvm::IntegerType *ResType) {
390   return ConstantInt::get(ResType, (Type & 2) ? 0 : -1, /*isSigned=*/true);
391 }
392 
393 llvm::Value *
394 CodeGenFunction::evaluateOrEmitBuiltinObjectSize(const Expr *E, unsigned Type,
395                                                  llvm::IntegerType *ResType) {
396   uint64_t ObjectSize;
397   if (!E->tryEvaluateObjectSize(ObjectSize, getContext(), Type))
398     return emitBuiltinObjectSize(E, Type, ResType);
399   return ConstantInt::get(ResType, ObjectSize, /*isSigned=*/true);
400 }
401 
402 /// Returns a Value corresponding to the size of the given expression.
403 /// This Value may be either of the following:
404 ///   - A llvm::Argument (if E is a param with the pass_object_size attribute on
405 ///     it)
406 ///   - A call to the @llvm.objectsize intrinsic
407 llvm::Value *
408 CodeGenFunction::emitBuiltinObjectSize(const Expr *E, unsigned Type,
409                                        llvm::IntegerType *ResType) {
410   // We need to reference an argument if the pointer is a parameter with the
411   // pass_object_size attribute.
412   if (auto *D = dyn_cast<DeclRefExpr>(E->IgnoreParenImpCasts())) {
413     auto *Param = dyn_cast<ParmVarDecl>(D->getDecl());
414     auto *PS = D->getDecl()->getAttr<PassObjectSizeAttr>();
415     if (Param != nullptr && PS != nullptr &&
416         areBOSTypesCompatible(PS->getType(), Type)) {
417       auto Iter = SizeArguments.find(Param);
418       assert(Iter != SizeArguments.end());
419 
420       const ImplicitParamDecl *D = Iter->second;
421       auto DIter = LocalDeclMap.find(D);
422       assert(DIter != LocalDeclMap.end());
423 
424       return EmitLoadOfScalar(DIter->second, /*volatile=*/false,
425                               getContext().getSizeType(), E->getLocStart());
426     }
427   }
428 
429   // LLVM can't handle Type=3 appropriately, and __builtin_object_size shouldn't
430   // evaluate E for side-effects. In either case, we shouldn't lower to
431   // @llvm.objectsize.
432   if (Type == 3 || E->HasSideEffects(getContext()))
433     return getDefaultBuiltinObjectSizeResult(Type, ResType);
434 
435   // LLVM only supports 0 and 2, make sure that we pass along that
436   // as a boolean.
437   auto *CI = ConstantInt::get(Builder.getInt1Ty(), (Type & 2) >> 1);
438   // FIXME: Get right address space.
439   llvm::Type *Tys[] = {ResType, Builder.getInt8PtrTy(0)};
440   Value *F = CGM.getIntrinsic(Intrinsic::objectsize, Tys);
441   return Builder.CreateCall(F, {EmitScalarExpr(E), CI});
442 }
443 
444 RValue CodeGenFunction::EmitBuiltinExpr(const FunctionDecl *FD,
445                                         unsigned BuiltinID, const CallExpr *E,
446                                         ReturnValueSlot ReturnValue) {
447   // See if we can constant fold this builtin.  If so, don't emit it at all.
448   Expr::EvalResult Result;
449   if (E->EvaluateAsRValue(Result, CGM.getContext()) &&
450       !Result.hasSideEffects()) {
451     if (Result.Val.isInt())
452       return RValue::get(llvm::ConstantInt::get(getLLVMContext(),
453                                                 Result.Val.getInt()));
454     if (Result.Val.isFloat())
455       return RValue::get(llvm::ConstantFP::get(getLLVMContext(),
456                                                Result.Val.getFloat()));
457   }
458 
459   switch (BuiltinID) {
460   default: break;  // Handle intrinsics and libm functions below.
461   case Builtin::BI__builtin___CFStringMakeConstantString:
462   case Builtin::BI__builtin___NSStringMakeConstantString:
463     return RValue::get(CGM.EmitConstantExpr(E, E->getType(), nullptr));
464   case Builtin::BI__builtin_stdarg_start:
465   case Builtin::BI__builtin_va_start:
466   case Builtin::BI__va_start:
467   case Builtin::BI__builtin_va_end:
468     return RValue::get(
469         EmitVAStartEnd(BuiltinID == Builtin::BI__va_start
470                            ? EmitScalarExpr(E->getArg(0))
471                            : EmitVAListRef(E->getArg(0)).getPointer(),
472                        BuiltinID != Builtin::BI__builtin_va_end));
473   case Builtin::BI__builtin_va_copy: {
474     Value *DstPtr = EmitVAListRef(E->getArg(0)).getPointer();
475     Value *SrcPtr = EmitVAListRef(E->getArg(1)).getPointer();
476 
477     llvm::Type *Type = Int8PtrTy;
478 
479     DstPtr = Builder.CreateBitCast(DstPtr, Type);
480     SrcPtr = Builder.CreateBitCast(SrcPtr, Type);
481     return RValue::get(Builder.CreateCall(CGM.getIntrinsic(Intrinsic::vacopy),
482                                           {DstPtr, SrcPtr}));
483   }
484   case Builtin::BI__builtin_abs:
485   case Builtin::BI__builtin_labs:
486   case Builtin::BI__builtin_llabs: {
487     Value *ArgValue = EmitScalarExpr(E->getArg(0));
488 
489     Value *NegOp = Builder.CreateNeg(ArgValue, "neg");
490     Value *CmpResult =
491     Builder.CreateICmpSGE(ArgValue,
492                           llvm::Constant::getNullValue(ArgValue->getType()),
493                                                             "abscond");
494     Value *Result =
495       Builder.CreateSelect(CmpResult, ArgValue, NegOp, "abs");
496 
497     return RValue::get(Result);
498   }
499   case Builtin::BI__builtin_fabs:
500   case Builtin::BI__builtin_fabsf:
501   case Builtin::BI__builtin_fabsl: {
502     Value *Arg1 = EmitScalarExpr(E->getArg(0));
503     Value *Result = EmitFAbs(*this, Arg1);
504     return RValue::get(Result);
505   }
506   case Builtin::BI__builtin_fmod:
507   case Builtin::BI__builtin_fmodf:
508   case Builtin::BI__builtin_fmodl: {
509     Value *Arg1 = EmitScalarExpr(E->getArg(0));
510     Value *Arg2 = EmitScalarExpr(E->getArg(1));
511     Value *Result = Builder.CreateFRem(Arg1, Arg2, "fmod");
512     return RValue::get(Result);
513   }
514 
515   case Builtin::BI__builtin_conj:
516   case Builtin::BI__builtin_conjf:
517   case Builtin::BI__builtin_conjl: {
518     ComplexPairTy ComplexVal = EmitComplexExpr(E->getArg(0));
519     Value *Real = ComplexVal.first;
520     Value *Imag = ComplexVal.second;
521     Value *Zero =
522       Imag->getType()->isFPOrFPVectorTy()
523         ? llvm::ConstantFP::getZeroValueForNegation(Imag->getType())
524         : llvm::Constant::getNullValue(Imag->getType());
525 
526     Imag = Builder.CreateFSub(Zero, Imag, "sub");
527     return RValue::getComplex(std::make_pair(Real, Imag));
528   }
529   case Builtin::BI__builtin_creal:
530   case Builtin::BI__builtin_crealf:
531   case Builtin::BI__builtin_creall:
532   case Builtin::BIcreal:
533   case Builtin::BIcrealf:
534   case Builtin::BIcreall: {
535     ComplexPairTy ComplexVal = EmitComplexExpr(E->getArg(0));
536     return RValue::get(ComplexVal.first);
537   }
538 
539   case Builtin::BI__builtin_cimag:
540   case Builtin::BI__builtin_cimagf:
541   case Builtin::BI__builtin_cimagl:
542   case Builtin::BIcimag:
543   case Builtin::BIcimagf:
544   case Builtin::BIcimagl: {
545     ComplexPairTy ComplexVal = EmitComplexExpr(E->getArg(0));
546     return RValue::get(ComplexVal.second);
547   }
548 
549   case Builtin::BI__builtin_ctzs:
550   case Builtin::BI__builtin_ctz:
551   case Builtin::BI__builtin_ctzl:
552   case Builtin::BI__builtin_ctzll: {
553     Value *ArgValue = EmitScalarExpr(E->getArg(0));
554 
555     llvm::Type *ArgType = ArgValue->getType();
556     Value *F = CGM.getIntrinsic(Intrinsic::cttz, ArgType);
557 
558     llvm::Type *ResultType = ConvertType(E->getType());
559     Value *ZeroUndef = Builder.getInt1(getTarget().isCLZForZeroUndef());
560     Value *Result = Builder.CreateCall(F, {ArgValue, ZeroUndef});
561     if (Result->getType() != ResultType)
562       Result = Builder.CreateIntCast(Result, ResultType, /*isSigned*/true,
563                                      "cast");
564     return RValue::get(Result);
565   }
566   case Builtin::BI__builtin_clzs:
567   case Builtin::BI__builtin_clz:
568   case Builtin::BI__builtin_clzl:
569   case Builtin::BI__builtin_clzll: {
570     Value *ArgValue = EmitScalarExpr(E->getArg(0));
571 
572     llvm::Type *ArgType = ArgValue->getType();
573     Value *F = CGM.getIntrinsic(Intrinsic::ctlz, ArgType);
574 
575     llvm::Type *ResultType = ConvertType(E->getType());
576     Value *ZeroUndef = Builder.getInt1(getTarget().isCLZForZeroUndef());
577     Value *Result = Builder.CreateCall(F, {ArgValue, ZeroUndef});
578     if (Result->getType() != ResultType)
579       Result = Builder.CreateIntCast(Result, ResultType, /*isSigned*/true,
580                                      "cast");
581     return RValue::get(Result);
582   }
583   case Builtin::BI__builtin_ffs:
584   case Builtin::BI__builtin_ffsl:
585   case Builtin::BI__builtin_ffsll: {
586     // ffs(x) -> x ? cttz(x) + 1 : 0
587     Value *ArgValue = EmitScalarExpr(E->getArg(0));
588 
589     llvm::Type *ArgType = ArgValue->getType();
590     Value *F = CGM.getIntrinsic(Intrinsic::cttz, ArgType);
591 
592     llvm::Type *ResultType = ConvertType(E->getType());
593     Value *Tmp =
594         Builder.CreateAdd(Builder.CreateCall(F, {ArgValue, Builder.getTrue()}),
595                           llvm::ConstantInt::get(ArgType, 1));
596     Value *Zero = llvm::Constant::getNullValue(ArgType);
597     Value *IsZero = Builder.CreateICmpEQ(ArgValue, Zero, "iszero");
598     Value *Result = Builder.CreateSelect(IsZero, Zero, Tmp, "ffs");
599     if (Result->getType() != ResultType)
600       Result = Builder.CreateIntCast(Result, ResultType, /*isSigned*/true,
601                                      "cast");
602     return RValue::get(Result);
603   }
604   case Builtin::BI__builtin_parity:
605   case Builtin::BI__builtin_parityl:
606   case Builtin::BI__builtin_parityll: {
607     // parity(x) -> ctpop(x) & 1
608     Value *ArgValue = EmitScalarExpr(E->getArg(0));
609 
610     llvm::Type *ArgType = ArgValue->getType();
611     Value *F = CGM.getIntrinsic(Intrinsic::ctpop, ArgType);
612 
613     llvm::Type *ResultType = ConvertType(E->getType());
614     Value *Tmp = Builder.CreateCall(F, ArgValue);
615     Value *Result = Builder.CreateAnd(Tmp, llvm::ConstantInt::get(ArgType, 1));
616     if (Result->getType() != ResultType)
617       Result = Builder.CreateIntCast(Result, ResultType, /*isSigned*/true,
618                                      "cast");
619     return RValue::get(Result);
620   }
621   case Builtin::BI__builtin_popcount:
622   case Builtin::BI__builtin_popcountl:
623   case Builtin::BI__builtin_popcountll: {
624     Value *ArgValue = EmitScalarExpr(E->getArg(0));
625 
626     llvm::Type *ArgType = ArgValue->getType();
627     Value *F = CGM.getIntrinsic(Intrinsic::ctpop, ArgType);
628 
629     llvm::Type *ResultType = ConvertType(E->getType());
630     Value *Result = Builder.CreateCall(F, ArgValue);
631     if (Result->getType() != ResultType)
632       Result = Builder.CreateIntCast(Result, ResultType, /*isSigned*/true,
633                                      "cast");
634     return RValue::get(Result);
635   }
636   case Builtin::BI__builtin_unpredictable: {
637     // Always return the argument of __builtin_unpredictable. LLVM does not
638     // handle this builtin. Metadata for this builtin should be added directly
639     // to instructions such as branches or switches that use it.
640     return RValue::get(EmitScalarExpr(E->getArg(0)));
641   }
642   case Builtin::BI__builtin_expect: {
643     Value *ArgValue = EmitScalarExpr(E->getArg(0));
644     llvm::Type *ArgType = ArgValue->getType();
645 
646     Value *ExpectedValue = EmitScalarExpr(E->getArg(1));
647     // Don't generate llvm.expect on -O0 as the backend won't use it for
648     // anything.
649     // Note, we still IRGen ExpectedValue because it could have side-effects.
650     if (CGM.getCodeGenOpts().OptimizationLevel == 0)
651       return RValue::get(ArgValue);
652 
653     Value *FnExpect = CGM.getIntrinsic(Intrinsic::expect, ArgType);
654     Value *Result =
655         Builder.CreateCall(FnExpect, {ArgValue, ExpectedValue}, "expval");
656     return RValue::get(Result);
657   }
658   case Builtin::BI__builtin_assume_aligned: {
659     Value *PtrValue = EmitScalarExpr(E->getArg(0));
660     Value *OffsetValue =
661       (E->getNumArgs() > 2) ? EmitScalarExpr(E->getArg(2)) : nullptr;
662 
663     Value *AlignmentValue = EmitScalarExpr(E->getArg(1));
664     ConstantInt *AlignmentCI = cast<ConstantInt>(AlignmentValue);
665     unsigned Alignment = (unsigned) AlignmentCI->getZExtValue();
666 
667     EmitAlignmentAssumption(PtrValue, Alignment, OffsetValue);
668     return RValue::get(PtrValue);
669   }
670   case Builtin::BI__assume:
671   case Builtin::BI__builtin_assume: {
672     if (E->getArg(0)->HasSideEffects(getContext()))
673       return RValue::get(nullptr);
674 
675     Value *ArgValue = EmitScalarExpr(E->getArg(0));
676     Value *FnAssume = CGM.getIntrinsic(Intrinsic::assume);
677     return RValue::get(Builder.CreateCall(FnAssume, ArgValue));
678   }
679   case Builtin::BI__builtin_bswap16:
680   case Builtin::BI__builtin_bswap32:
681   case Builtin::BI__builtin_bswap64: {
682     return RValue::get(emitUnaryBuiltin(*this, E, Intrinsic::bswap));
683   }
684   case Builtin::BI__builtin_bitreverse16:
685   case Builtin::BI__builtin_bitreverse32:
686   case Builtin::BI__builtin_bitreverse64: {
687     return RValue::get(emitUnaryBuiltin(*this, E, Intrinsic::bitreverse));
688   }
689   case Builtin::BI__builtin_object_size: {
690     unsigned Type =
691         E->getArg(1)->EvaluateKnownConstInt(getContext()).getZExtValue();
692     auto *ResType = cast<llvm::IntegerType>(ConvertType(E->getType()));
693 
694     // We pass this builtin onto the optimizer so that it can figure out the
695     // object size in more complex cases.
696     return RValue::get(emitBuiltinObjectSize(E->getArg(0), Type, ResType));
697   }
698   case Builtin::BI__builtin_prefetch: {
699     Value *Locality, *RW, *Address = EmitScalarExpr(E->getArg(0));
700     // FIXME: Technically these constants should of type 'int', yes?
701     RW = (E->getNumArgs() > 1) ? EmitScalarExpr(E->getArg(1)) :
702       llvm::ConstantInt::get(Int32Ty, 0);
703     Locality = (E->getNumArgs() > 2) ? EmitScalarExpr(E->getArg(2)) :
704       llvm::ConstantInt::get(Int32Ty, 3);
705     Value *Data = llvm::ConstantInt::get(Int32Ty, 1);
706     Value *F = CGM.getIntrinsic(Intrinsic::prefetch);
707     return RValue::get(Builder.CreateCall(F, {Address, RW, Locality, Data}));
708   }
709   case Builtin::BI__builtin_readcyclecounter: {
710     Value *F = CGM.getIntrinsic(Intrinsic::readcyclecounter);
711     return RValue::get(Builder.CreateCall(F));
712   }
713   case Builtin::BI__builtin___clear_cache: {
714     Value *Begin = EmitScalarExpr(E->getArg(0));
715     Value *End = EmitScalarExpr(E->getArg(1));
716     Value *F = CGM.getIntrinsic(Intrinsic::clear_cache);
717     return RValue::get(Builder.CreateCall(F, {Begin, End}));
718   }
719   case Builtin::BI__builtin_trap:
720     return RValue::get(EmitTrapCall(Intrinsic::trap));
721   case Builtin::BI__debugbreak:
722     return RValue::get(EmitTrapCall(Intrinsic::debugtrap));
723   case Builtin::BI__builtin_unreachable: {
724     if (SanOpts.has(SanitizerKind::Unreachable)) {
725       SanitizerScope SanScope(this);
726       EmitCheck(std::make_pair(static_cast<llvm::Value *>(Builder.getFalse()),
727                                SanitizerKind::Unreachable),
728                 "builtin_unreachable", EmitCheckSourceLocation(E->getExprLoc()),
729                 None);
730     } else
731       Builder.CreateUnreachable();
732 
733     // We do need to preserve an insertion point.
734     EmitBlock(createBasicBlock("unreachable.cont"));
735 
736     return RValue::get(nullptr);
737   }
738 
739   case Builtin::BI__builtin_powi:
740   case Builtin::BI__builtin_powif:
741   case Builtin::BI__builtin_powil: {
742     Value *Base = EmitScalarExpr(E->getArg(0));
743     Value *Exponent = EmitScalarExpr(E->getArg(1));
744     llvm::Type *ArgType = Base->getType();
745     Value *F = CGM.getIntrinsic(Intrinsic::powi, ArgType);
746     return RValue::get(Builder.CreateCall(F, {Base, Exponent}));
747   }
748 
749   case Builtin::BI__builtin_isgreater:
750   case Builtin::BI__builtin_isgreaterequal:
751   case Builtin::BI__builtin_isless:
752   case Builtin::BI__builtin_islessequal:
753   case Builtin::BI__builtin_islessgreater:
754   case Builtin::BI__builtin_isunordered: {
755     // Ordered comparisons: we know the arguments to these are matching scalar
756     // floating point values.
757     Value *LHS = EmitScalarExpr(E->getArg(0));
758     Value *RHS = EmitScalarExpr(E->getArg(1));
759 
760     switch (BuiltinID) {
761     default: llvm_unreachable("Unknown ordered comparison");
762     case Builtin::BI__builtin_isgreater:
763       LHS = Builder.CreateFCmpOGT(LHS, RHS, "cmp");
764       break;
765     case Builtin::BI__builtin_isgreaterequal:
766       LHS = Builder.CreateFCmpOGE(LHS, RHS, "cmp");
767       break;
768     case Builtin::BI__builtin_isless:
769       LHS = Builder.CreateFCmpOLT(LHS, RHS, "cmp");
770       break;
771     case Builtin::BI__builtin_islessequal:
772       LHS = Builder.CreateFCmpOLE(LHS, RHS, "cmp");
773       break;
774     case Builtin::BI__builtin_islessgreater:
775       LHS = Builder.CreateFCmpONE(LHS, RHS, "cmp");
776       break;
777     case Builtin::BI__builtin_isunordered:
778       LHS = Builder.CreateFCmpUNO(LHS, RHS, "cmp");
779       break;
780     }
781     // ZExt bool to int type.
782     return RValue::get(Builder.CreateZExt(LHS, ConvertType(E->getType())));
783   }
784   case Builtin::BI__builtin_isnan: {
785     Value *V = EmitScalarExpr(E->getArg(0));
786     V = Builder.CreateFCmpUNO(V, V, "cmp");
787     return RValue::get(Builder.CreateZExt(V, ConvertType(E->getType())));
788   }
789 
790   case Builtin::BI__builtin_isinf: {
791     // isinf(x) --> fabs(x) == infinity
792     Value *V = EmitScalarExpr(E->getArg(0));
793     V = EmitFAbs(*this, V);
794 
795     V = Builder.CreateFCmpOEQ(V, ConstantFP::getInfinity(V->getType()),"isinf");
796     return RValue::get(Builder.CreateZExt(V, ConvertType(E->getType())));
797   }
798 
799   case Builtin::BI__builtin_isinf_sign: {
800     // isinf_sign(x) -> fabs(x) == infinity ? (signbit(x) ? -1 : 1) : 0
801     Value *Arg = EmitScalarExpr(E->getArg(0));
802     Value *AbsArg = EmitFAbs(*this, Arg);
803     Value *IsInf = Builder.CreateFCmpOEQ(
804         AbsArg, ConstantFP::getInfinity(Arg->getType()), "isinf");
805     Value *IsNeg = EmitSignBit(*this, Arg);
806 
807     llvm::Type *IntTy = ConvertType(E->getType());
808     Value *Zero = Constant::getNullValue(IntTy);
809     Value *One = ConstantInt::get(IntTy, 1);
810     Value *NegativeOne = ConstantInt::get(IntTy, -1);
811     Value *SignResult = Builder.CreateSelect(IsNeg, NegativeOne, One);
812     Value *Result = Builder.CreateSelect(IsInf, SignResult, Zero);
813     return RValue::get(Result);
814   }
815 
816   case Builtin::BI__builtin_isnormal: {
817     // isnormal(x) --> x == x && fabsf(x) < infinity && fabsf(x) >= float_min
818     Value *V = EmitScalarExpr(E->getArg(0));
819     Value *Eq = Builder.CreateFCmpOEQ(V, V, "iseq");
820 
821     Value *Abs = EmitFAbs(*this, V);
822     Value *IsLessThanInf =
823       Builder.CreateFCmpULT(Abs, ConstantFP::getInfinity(V->getType()),"isinf");
824     APFloat Smallest = APFloat::getSmallestNormalized(
825                    getContext().getFloatTypeSemantics(E->getArg(0)->getType()));
826     Value *IsNormal =
827       Builder.CreateFCmpUGE(Abs, ConstantFP::get(V->getContext(), Smallest),
828                             "isnormal");
829     V = Builder.CreateAnd(Eq, IsLessThanInf, "and");
830     V = Builder.CreateAnd(V, IsNormal, "and");
831     return RValue::get(Builder.CreateZExt(V, ConvertType(E->getType())));
832   }
833 
834   case Builtin::BI__builtin_isfinite: {
835     // isfinite(x) --> x == x && fabs(x) != infinity;
836     Value *V = EmitScalarExpr(E->getArg(0));
837     Value *Eq = Builder.CreateFCmpOEQ(V, V, "iseq");
838 
839     Value *Abs = EmitFAbs(*this, V);
840     Value *IsNotInf =
841       Builder.CreateFCmpUNE(Abs, ConstantFP::getInfinity(V->getType()),"isinf");
842 
843     V = Builder.CreateAnd(Eq, IsNotInf, "and");
844     return RValue::get(Builder.CreateZExt(V, ConvertType(E->getType())));
845   }
846 
847   case Builtin::BI__builtin_fpclassify: {
848     Value *V = EmitScalarExpr(E->getArg(5));
849     llvm::Type *Ty = ConvertType(E->getArg(5)->getType());
850 
851     // Create Result
852     BasicBlock *Begin = Builder.GetInsertBlock();
853     BasicBlock *End = createBasicBlock("fpclassify_end", this->CurFn);
854     Builder.SetInsertPoint(End);
855     PHINode *Result =
856       Builder.CreatePHI(ConvertType(E->getArg(0)->getType()), 4,
857                         "fpclassify_result");
858 
859     // if (V==0) return FP_ZERO
860     Builder.SetInsertPoint(Begin);
861     Value *IsZero = Builder.CreateFCmpOEQ(V, Constant::getNullValue(Ty),
862                                           "iszero");
863     Value *ZeroLiteral = EmitScalarExpr(E->getArg(4));
864     BasicBlock *NotZero = createBasicBlock("fpclassify_not_zero", this->CurFn);
865     Builder.CreateCondBr(IsZero, End, NotZero);
866     Result->addIncoming(ZeroLiteral, Begin);
867 
868     // if (V != V) return FP_NAN
869     Builder.SetInsertPoint(NotZero);
870     Value *IsNan = Builder.CreateFCmpUNO(V, V, "cmp");
871     Value *NanLiteral = EmitScalarExpr(E->getArg(0));
872     BasicBlock *NotNan = createBasicBlock("fpclassify_not_nan", this->CurFn);
873     Builder.CreateCondBr(IsNan, End, NotNan);
874     Result->addIncoming(NanLiteral, NotZero);
875 
876     // if (fabs(V) == infinity) return FP_INFINITY
877     Builder.SetInsertPoint(NotNan);
878     Value *VAbs = EmitFAbs(*this, V);
879     Value *IsInf =
880       Builder.CreateFCmpOEQ(VAbs, ConstantFP::getInfinity(V->getType()),
881                             "isinf");
882     Value *InfLiteral = EmitScalarExpr(E->getArg(1));
883     BasicBlock *NotInf = createBasicBlock("fpclassify_not_inf", this->CurFn);
884     Builder.CreateCondBr(IsInf, End, NotInf);
885     Result->addIncoming(InfLiteral, NotNan);
886 
887     // if (fabs(V) >= MIN_NORMAL) return FP_NORMAL else FP_SUBNORMAL
888     Builder.SetInsertPoint(NotInf);
889     APFloat Smallest = APFloat::getSmallestNormalized(
890         getContext().getFloatTypeSemantics(E->getArg(5)->getType()));
891     Value *IsNormal =
892       Builder.CreateFCmpUGE(VAbs, ConstantFP::get(V->getContext(), Smallest),
893                             "isnormal");
894     Value *NormalResult =
895       Builder.CreateSelect(IsNormal, EmitScalarExpr(E->getArg(2)),
896                            EmitScalarExpr(E->getArg(3)));
897     Builder.CreateBr(End);
898     Result->addIncoming(NormalResult, NotInf);
899 
900     // return Result
901     Builder.SetInsertPoint(End);
902     return RValue::get(Result);
903   }
904 
905   case Builtin::BIalloca:
906   case Builtin::BI_alloca:
907   case Builtin::BI__builtin_alloca: {
908     Value *Size = EmitScalarExpr(E->getArg(0));
909     return RValue::get(Builder.CreateAlloca(Builder.getInt8Ty(), Size));
910   }
911   case Builtin::BIbzero:
912   case Builtin::BI__builtin_bzero: {
913     Address Dest = EmitPointerWithAlignment(E->getArg(0));
914     Value *SizeVal = EmitScalarExpr(E->getArg(1));
915     EmitNonNullArgCheck(RValue::get(Dest.getPointer()), E->getArg(0)->getType(),
916                         E->getArg(0)->getExprLoc(), FD, 0);
917     Builder.CreateMemSet(Dest, Builder.getInt8(0), SizeVal, false);
918     return RValue::get(Dest.getPointer());
919   }
920   case Builtin::BImemcpy:
921   case Builtin::BI__builtin_memcpy: {
922     Address Dest = EmitPointerWithAlignment(E->getArg(0));
923     Address Src = EmitPointerWithAlignment(E->getArg(1));
924     Value *SizeVal = EmitScalarExpr(E->getArg(2));
925     EmitNonNullArgCheck(RValue::get(Dest.getPointer()), E->getArg(0)->getType(),
926                         E->getArg(0)->getExprLoc(), FD, 0);
927     EmitNonNullArgCheck(RValue::get(Src.getPointer()), E->getArg(1)->getType(),
928                         E->getArg(1)->getExprLoc(), FD, 1);
929     Builder.CreateMemCpy(Dest, Src, SizeVal, false);
930     return RValue::get(Dest.getPointer());
931   }
932 
933   case Builtin::BI__builtin___memcpy_chk: {
934     // fold __builtin_memcpy_chk(x, y, cst1, cst2) to memcpy iff cst1<=cst2.
935     llvm::APSInt Size, DstSize;
936     if (!E->getArg(2)->EvaluateAsInt(Size, CGM.getContext()) ||
937         !E->getArg(3)->EvaluateAsInt(DstSize, CGM.getContext()))
938       break;
939     if (Size.ugt(DstSize))
940       break;
941     Address Dest = EmitPointerWithAlignment(E->getArg(0));
942     Address Src = EmitPointerWithAlignment(E->getArg(1));
943     Value *SizeVal = llvm::ConstantInt::get(Builder.getContext(), Size);
944     Builder.CreateMemCpy(Dest, Src, SizeVal, false);
945     return RValue::get(Dest.getPointer());
946   }
947 
948   case Builtin::BI__builtin_objc_memmove_collectable: {
949     Address DestAddr = EmitPointerWithAlignment(E->getArg(0));
950     Address SrcAddr = EmitPointerWithAlignment(E->getArg(1));
951     Value *SizeVal = EmitScalarExpr(E->getArg(2));
952     CGM.getObjCRuntime().EmitGCMemmoveCollectable(*this,
953                                                   DestAddr, SrcAddr, SizeVal);
954     return RValue::get(DestAddr.getPointer());
955   }
956 
957   case Builtin::BI__builtin___memmove_chk: {
958     // fold __builtin_memmove_chk(x, y, cst1, cst2) to memmove iff cst1<=cst2.
959     llvm::APSInt Size, DstSize;
960     if (!E->getArg(2)->EvaluateAsInt(Size, CGM.getContext()) ||
961         !E->getArg(3)->EvaluateAsInt(DstSize, CGM.getContext()))
962       break;
963     if (Size.ugt(DstSize))
964       break;
965     Address Dest = EmitPointerWithAlignment(E->getArg(0));
966     Address Src = EmitPointerWithAlignment(E->getArg(1));
967     Value *SizeVal = llvm::ConstantInt::get(Builder.getContext(), Size);
968     Builder.CreateMemMove(Dest, Src, SizeVal, false);
969     return RValue::get(Dest.getPointer());
970   }
971 
972   case Builtin::BImemmove:
973   case Builtin::BI__builtin_memmove: {
974     Address Dest = EmitPointerWithAlignment(E->getArg(0));
975     Address Src = EmitPointerWithAlignment(E->getArg(1));
976     Value *SizeVal = EmitScalarExpr(E->getArg(2));
977     EmitNonNullArgCheck(RValue::get(Dest.getPointer()), E->getArg(0)->getType(),
978                         E->getArg(0)->getExprLoc(), FD, 0);
979     EmitNonNullArgCheck(RValue::get(Src.getPointer()), E->getArg(1)->getType(),
980                         E->getArg(1)->getExprLoc(), FD, 1);
981     Builder.CreateMemMove(Dest, Src, SizeVal, false);
982     return RValue::get(Dest.getPointer());
983   }
984   case Builtin::BImemset:
985   case Builtin::BI__builtin_memset: {
986     Address Dest = EmitPointerWithAlignment(E->getArg(0));
987     Value *ByteVal = Builder.CreateTrunc(EmitScalarExpr(E->getArg(1)),
988                                          Builder.getInt8Ty());
989     Value *SizeVal = EmitScalarExpr(E->getArg(2));
990     EmitNonNullArgCheck(RValue::get(Dest.getPointer()), E->getArg(0)->getType(),
991                         E->getArg(0)->getExprLoc(), FD, 0);
992     Builder.CreateMemSet(Dest, ByteVal, SizeVal, false);
993     return RValue::get(Dest.getPointer());
994   }
995   case Builtin::BI__builtin___memset_chk: {
996     // fold __builtin_memset_chk(x, y, cst1, cst2) to memset iff cst1<=cst2.
997     llvm::APSInt Size, DstSize;
998     if (!E->getArg(2)->EvaluateAsInt(Size, CGM.getContext()) ||
999         !E->getArg(3)->EvaluateAsInt(DstSize, CGM.getContext()))
1000       break;
1001     if (Size.ugt(DstSize))
1002       break;
1003     Address Dest = EmitPointerWithAlignment(E->getArg(0));
1004     Value *ByteVal = Builder.CreateTrunc(EmitScalarExpr(E->getArg(1)),
1005                                          Builder.getInt8Ty());
1006     Value *SizeVal = llvm::ConstantInt::get(Builder.getContext(), Size);
1007     Builder.CreateMemSet(Dest, ByteVal, SizeVal, false);
1008     return RValue::get(Dest.getPointer());
1009   }
1010   case Builtin::BI__builtin_dwarf_cfa: {
1011     // The offset in bytes from the first argument to the CFA.
1012     //
1013     // Why on earth is this in the frontend?  Is there any reason at
1014     // all that the backend can't reasonably determine this while
1015     // lowering llvm.eh.dwarf.cfa()?
1016     //
1017     // TODO: If there's a satisfactory reason, add a target hook for
1018     // this instead of hard-coding 0, which is correct for most targets.
1019     int32_t Offset = 0;
1020 
1021     Value *F = CGM.getIntrinsic(Intrinsic::eh_dwarf_cfa);
1022     return RValue::get(Builder.CreateCall(F,
1023                                       llvm::ConstantInt::get(Int32Ty, Offset)));
1024   }
1025   case Builtin::BI__builtin_return_address: {
1026     Value *Depth =
1027         CGM.EmitConstantExpr(E->getArg(0), getContext().UnsignedIntTy, this);
1028     Value *F = CGM.getIntrinsic(Intrinsic::returnaddress);
1029     return RValue::get(Builder.CreateCall(F, Depth));
1030   }
1031   case Builtin::BI__builtin_frame_address: {
1032     Value *Depth =
1033         CGM.EmitConstantExpr(E->getArg(0), getContext().UnsignedIntTy, this);
1034     Value *F = CGM.getIntrinsic(Intrinsic::frameaddress);
1035     return RValue::get(Builder.CreateCall(F, Depth));
1036   }
1037   case Builtin::BI__builtin_extract_return_addr: {
1038     Value *Address = EmitScalarExpr(E->getArg(0));
1039     Value *Result = getTargetHooks().decodeReturnAddress(*this, Address);
1040     return RValue::get(Result);
1041   }
1042   case Builtin::BI__builtin_frob_return_addr: {
1043     Value *Address = EmitScalarExpr(E->getArg(0));
1044     Value *Result = getTargetHooks().encodeReturnAddress(*this, Address);
1045     return RValue::get(Result);
1046   }
1047   case Builtin::BI__builtin_dwarf_sp_column: {
1048     llvm::IntegerType *Ty
1049       = cast<llvm::IntegerType>(ConvertType(E->getType()));
1050     int Column = getTargetHooks().getDwarfEHStackPointer(CGM);
1051     if (Column == -1) {
1052       CGM.ErrorUnsupported(E, "__builtin_dwarf_sp_column");
1053       return RValue::get(llvm::UndefValue::get(Ty));
1054     }
1055     return RValue::get(llvm::ConstantInt::get(Ty, Column, true));
1056   }
1057   case Builtin::BI__builtin_init_dwarf_reg_size_table: {
1058     Value *Address = EmitScalarExpr(E->getArg(0));
1059     if (getTargetHooks().initDwarfEHRegSizeTable(*this, Address))
1060       CGM.ErrorUnsupported(E, "__builtin_init_dwarf_reg_size_table");
1061     return RValue::get(llvm::UndefValue::get(ConvertType(E->getType())));
1062   }
1063   case Builtin::BI__builtin_eh_return: {
1064     Value *Int = EmitScalarExpr(E->getArg(0));
1065     Value *Ptr = EmitScalarExpr(E->getArg(1));
1066 
1067     llvm::IntegerType *IntTy = cast<llvm::IntegerType>(Int->getType());
1068     assert((IntTy->getBitWidth() == 32 || IntTy->getBitWidth() == 64) &&
1069            "LLVM's __builtin_eh_return only supports 32- and 64-bit variants");
1070     Value *F = CGM.getIntrinsic(IntTy->getBitWidth() == 32
1071                                   ? Intrinsic::eh_return_i32
1072                                   : Intrinsic::eh_return_i64);
1073     Builder.CreateCall(F, {Int, Ptr});
1074     Builder.CreateUnreachable();
1075 
1076     // We do need to preserve an insertion point.
1077     EmitBlock(createBasicBlock("builtin_eh_return.cont"));
1078 
1079     return RValue::get(nullptr);
1080   }
1081   case Builtin::BI__builtin_unwind_init: {
1082     Value *F = CGM.getIntrinsic(Intrinsic::eh_unwind_init);
1083     return RValue::get(Builder.CreateCall(F));
1084   }
1085   case Builtin::BI__builtin_extend_pointer: {
1086     // Extends a pointer to the size of an _Unwind_Word, which is
1087     // uint64_t on all platforms.  Generally this gets poked into a
1088     // register and eventually used as an address, so if the
1089     // addressing registers are wider than pointers and the platform
1090     // doesn't implicitly ignore high-order bits when doing
1091     // addressing, we need to make sure we zext / sext based on
1092     // the platform's expectations.
1093     //
1094     // See: http://gcc.gnu.org/ml/gcc-bugs/2002-02/msg00237.html
1095 
1096     // Cast the pointer to intptr_t.
1097     Value *Ptr = EmitScalarExpr(E->getArg(0));
1098     Value *Result = Builder.CreatePtrToInt(Ptr, IntPtrTy, "extend.cast");
1099 
1100     // If that's 64 bits, we're done.
1101     if (IntPtrTy->getBitWidth() == 64)
1102       return RValue::get(Result);
1103 
1104     // Otherwise, ask the codegen data what to do.
1105     if (getTargetHooks().extendPointerWithSExt())
1106       return RValue::get(Builder.CreateSExt(Result, Int64Ty, "extend.sext"));
1107     else
1108       return RValue::get(Builder.CreateZExt(Result, Int64Ty, "extend.zext"));
1109   }
1110   case Builtin::BI__builtin_setjmp: {
1111     // Buffer is a void**.
1112     Address Buf = EmitPointerWithAlignment(E->getArg(0));
1113 
1114     // Store the frame pointer to the setjmp buffer.
1115     Value *FrameAddr =
1116       Builder.CreateCall(CGM.getIntrinsic(Intrinsic::frameaddress),
1117                          ConstantInt::get(Int32Ty, 0));
1118     Builder.CreateStore(FrameAddr, Buf);
1119 
1120     // Store the stack pointer to the setjmp buffer.
1121     Value *StackAddr =
1122         Builder.CreateCall(CGM.getIntrinsic(Intrinsic::stacksave));
1123     Address StackSaveSlot =
1124       Builder.CreateConstInBoundsGEP(Buf, 2, getPointerSize());
1125     Builder.CreateStore(StackAddr, StackSaveSlot);
1126 
1127     // Call LLVM's EH setjmp, which is lightweight.
1128     Value *F = CGM.getIntrinsic(Intrinsic::eh_sjlj_setjmp);
1129     Buf = Builder.CreateBitCast(Buf, Int8PtrTy);
1130     return RValue::get(Builder.CreateCall(F, Buf.getPointer()));
1131   }
1132   case Builtin::BI__builtin_longjmp: {
1133     Value *Buf = EmitScalarExpr(E->getArg(0));
1134     Buf = Builder.CreateBitCast(Buf, Int8PtrTy);
1135 
1136     // Call LLVM's EH longjmp, which is lightweight.
1137     Builder.CreateCall(CGM.getIntrinsic(Intrinsic::eh_sjlj_longjmp), Buf);
1138 
1139     // longjmp doesn't return; mark this as unreachable.
1140     Builder.CreateUnreachable();
1141 
1142     // We do need to preserve an insertion point.
1143     EmitBlock(createBasicBlock("longjmp.cont"));
1144 
1145     return RValue::get(nullptr);
1146   }
1147   case Builtin::BI__sync_fetch_and_add:
1148   case Builtin::BI__sync_fetch_and_sub:
1149   case Builtin::BI__sync_fetch_and_or:
1150   case Builtin::BI__sync_fetch_and_and:
1151   case Builtin::BI__sync_fetch_and_xor:
1152   case Builtin::BI__sync_fetch_and_nand:
1153   case Builtin::BI__sync_add_and_fetch:
1154   case Builtin::BI__sync_sub_and_fetch:
1155   case Builtin::BI__sync_and_and_fetch:
1156   case Builtin::BI__sync_or_and_fetch:
1157   case Builtin::BI__sync_xor_and_fetch:
1158   case Builtin::BI__sync_nand_and_fetch:
1159   case Builtin::BI__sync_val_compare_and_swap:
1160   case Builtin::BI__sync_bool_compare_and_swap:
1161   case Builtin::BI__sync_lock_test_and_set:
1162   case Builtin::BI__sync_lock_release:
1163   case Builtin::BI__sync_swap:
1164     llvm_unreachable("Shouldn't make it through sema");
1165   case Builtin::BI__sync_fetch_and_add_1:
1166   case Builtin::BI__sync_fetch_and_add_2:
1167   case Builtin::BI__sync_fetch_and_add_4:
1168   case Builtin::BI__sync_fetch_and_add_8:
1169   case Builtin::BI__sync_fetch_and_add_16:
1170     return EmitBinaryAtomic(*this, llvm::AtomicRMWInst::Add, E);
1171   case Builtin::BI__sync_fetch_and_sub_1:
1172   case Builtin::BI__sync_fetch_and_sub_2:
1173   case Builtin::BI__sync_fetch_and_sub_4:
1174   case Builtin::BI__sync_fetch_and_sub_8:
1175   case Builtin::BI__sync_fetch_and_sub_16:
1176     return EmitBinaryAtomic(*this, llvm::AtomicRMWInst::Sub, E);
1177   case Builtin::BI__sync_fetch_and_or_1:
1178   case Builtin::BI__sync_fetch_and_or_2:
1179   case Builtin::BI__sync_fetch_and_or_4:
1180   case Builtin::BI__sync_fetch_and_or_8:
1181   case Builtin::BI__sync_fetch_and_or_16:
1182     return EmitBinaryAtomic(*this, llvm::AtomicRMWInst::Or, E);
1183   case Builtin::BI__sync_fetch_and_and_1:
1184   case Builtin::BI__sync_fetch_and_and_2:
1185   case Builtin::BI__sync_fetch_and_and_4:
1186   case Builtin::BI__sync_fetch_and_and_8:
1187   case Builtin::BI__sync_fetch_and_and_16:
1188     return EmitBinaryAtomic(*this, llvm::AtomicRMWInst::And, E);
1189   case Builtin::BI__sync_fetch_and_xor_1:
1190   case Builtin::BI__sync_fetch_and_xor_2:
1191   case Builtin::BI__sync_fetch_and_xor_4:
1192   case Builtin::BI__sync_fetch_and_xor_8:
1193   case Builtin::BI__sync_fetch_and_xor_16:
1194     return EmitBinaryAtomic(*this, llvm::AtomicRMWInst::Xor, E);
1195   case Builtin::BI__sync_fetch_and_nand_1:
1196   case Builtin::BI__sync_fetch_and_nand_2:
1197   case Builtin::BI__sync_fetch_and_nand_4:
1198   case Builtin::BI__sync_fetch_and_nand_8:
1199   case Builtin::BI__sync_fetch_and_nand_16:
1200     return EmitBinaryAtomic(*this, llvm::AtomicRMWInst::Nand, E);
1201 
1202   // Clang extensions: not overloaded yet.
1203   case Builtin::BI__sync_fetch_and_min:
1204     return EmitBinaryAtomic(*this, llvm::AtomicRMWInst::Min, E);
1205   case Builtin::BI__sync_fetch_and_max:
1206     return EmitBinaryAtomic(*this, llvm::AtomicRMWInst::Max, E);
1207   case Builtin::BI__sync_fetch_and_umin:
1208     return EmitBinaryAtomic(*this, llvm::AtomicRMWInst::UMin, E);
1209   case Builtin::BI__sync_fetch_and_umax:
1210     return EmitBinaryAtomic(*this, llvm::AtomicRMWInst::UMax, E);
1211 
1212   case Builtin::BI__sync_add_and_fetch_1:
1213   case Builtin::BI__sync_add_and_fetch_2:
1214   case Builtin::BI__sync_add_and_fetch_4:
1215   case Builtin::BI__sync_add_and_fetch_8:
1216   case Builtin::BI__sync_add_and_fetch_16:
1217     return EmitBinaryAtomicPost(*this, llvm::AtomicRMWInst::Add, E,
1218                                 llvm::Instruction::Add);
1219   case Builtin::BI__sync_sub_and_fetch_1:
1220   case Builtin::BI__sync_sub_and_fetch_2:
1221   case Builtin::BI__sync_sub_and_fetch_4:
1222   case Builtin::BI__sync_sub_and_fetch_8:
1223   case Builtin::BI__sync_sub_and_fetch_16:
1224     return EmitBinaryAtomicPost(*this, llvm::AtomicRMWInst::Sub, E,
1225                                 llvm::Instruction::Sub);
1226   case Builtin::BI__sync_and_and_fetch_1:
1227   case Builtin::BI__sync_and_and_fetch_2:
1228   case Builtin::BI__sync_and_and_fetch_4:
1229   case Builtin::BI__sync_and_and_fetch_8:
1230   case Builtin::BI__sync_and_and_fetch_16:
1231     return EmitBinaryAtomicPost(*this, llvm::AtomicRMWInst::And, E,
1232                                 llvm::Instruction::And);
1233   case Builtin::BI__sync_or_and_fetch_1:
1234   case Builtin::BI__sync_or_and_fetch_2:
1235   case Builtin::BI__sync_or_and_fetch_4:
1236   case Builtin::BI__sync_or_and_fetch_8:
1237   case Builtin::BI__sync_or_and_fetch_16:
1238     return EmitBinaryAtomicPost(*this, llvm::AtomicRMWInst::Or, E,
1239                                 llvm::Instruction::Or);
1240   case Builtin::BI__sync_xor_and_fetch_1:
1241   case Builtin::BI__sync_xor_and_fetch_2:
1242   case Builtin::BI__sync_xor_and_fetch_4:
1243   case Builtin::BI__sync_xor_and_fetch_8:
1244   case Builtin::BI__sync_xor_and_fetch_16:
1245     return EmitBinaryAtomicPost(*this, llvm::AtomicRMWInst::Xor, E,
1246                                 llvm::Instruction::Xor);
1247   case Builtin::BI__sync_nand_and_fetch_1:
1248   case Builtin::BI__sync_nand_and_fetch_2:
1249   case Builtin::BI__sync_nand_and_fetch_4:
1250   case Builtin::BI__sync_nand_and_fetch_8:
1251   case Builtin::BI__sync_nand_and_fetch_16:
1252     return EmitBinaryAtomicPost(*this, llvm::AtomicRMWInst::Nand, E,
1253                                 llvm::Instruction::And, true);
1254 
1255   case Builtin::BI__sync_val_compare_and_swap_1:
1256   case Builtin::BI__sync_val_compare_and_swap_2:
1257   case Builtin::BI__sync_val_compare_and_swap_4:
1258   case Builtin::BI__sync_val_compare_and_swap_8:
1259   case Builtin::BI__sync_val_compare_and_swap_16:
1260     return RValue::get(MakeAtomicCmpXchgValue(*this, E, false));
1261 
1262   case Builtin::BI__sync_bool_compare_and_swap_1:
1263   case Builtin::BI__sync_bool_compare_and_swap_2:
1264   case Builtin::BI__sync_bool_compare_and_swap_4:
1265   case Builtin::BI__sync_bool_compare_and_swap_8:
1266   case Builtin::BI__sync_bool_compare_and_swap_16:
1267     return RValue::get(MakeAtomicCmpXchgValue(*this, E, true));
1268 
1269   case Builtin::BI__sync_swap_1:
1270   case Builtin::BI__sync_swap_2:
1271   case Builtin::BI__sync_swap_4:
1272   case Builtin::BI__sync_swap_8:
1273   case Builtin::BI__sync_swap_16:
1274     return EmitBinaryAtomic(*this, llvm::AtomicRMWInst::Xchg, E);
1275 
1276   case Builtin::BI__sync_lock_test_and_set_1:
1277   case Builtin::BI__sync_lock_test_and_set_2:
1278   case Builtin::BI__sync_lock_test_and_set_4:
1279   case Builtin::BI__sync_lock_test_and_set_8:
1280   case Builtin::BI__sync_lock_test_and_set_16:
1281     return EmitBinaryAtomic(*this, llvm::AtomicRMWInst::Xchg, E);
1282 
1283   case Builtin::BI__sync_lock_release_1:
1284   case Builtin::BI__sync_lock_release_2:
1285   case Builtin::BI__sync_lock_release_4:
1286   case Builtin::BI__sync_lock_release_8:
1287   case Builtin::BI__sync_lock_release_16: {
1288     Value *Ptr = EmitScalarExpr(E->getArg(0));
1289     QualType ElTy = E->getArg(0)->getType()->getPointeeType();
1290     CharUnits StoreSize = getContext().getTypeSizeInChars(ElTy);
1291     llvm::Type *ITy = llvm::IntegerType::get(getLLVMContext(),
1292                                              StoreSize.getQuantity() * 8);
1293     Ptr = Builder.CreateBitCast(Ptr, ITy->getPointerTo());
1294     llvm::StoreInst *Store =
1295       Builder.CreateAlignedStore(llvm::Constant::getNullValue(ITy), Ptr,
1296                                  StoreSize);
1297     Store->setAtomic(llvm::Release);
1298     return RValue::get(nullptr);
1299   }
1300 
1301   case Builtin::BI__sync_synchronize: {
1302     // We assume this is supposed to correspond to a C++0x-style
1303     // sequentially-consistent fence (i.e. this is only usable for
1304     // synchonization, not device I/O or anything like that). This intrinsic
1305     // is really badly designed in the sense that in theory, there isn't
1306     // any way to safely use it... but in practice, it mostly works
1307     // to use it with non-atomic loads and stores to get acquire/release
1308     // semantics.
1309     Builder.CreateFence(llvm::SequentiallyConsistent);
1310     return RValue::get(nullptr);
1311   }
1312 
1313   case Builtin::BI__builtin_nontemporal_load:
1314     return RValue::get(EmitNontemporalLoad(*this, E));
1315   case Builtin::BI__builtin_nontemporal_store:
1316     return RValue::get(EmitNontemporalStore(*this, E));
1317   case Builtin::BI__c11_atomic_is_lock_free:
1318   case Builtin::BI__atomic_is_lock_free: {
1319     // Call "bool __atomic_is_lock_free(size_t size, void *ptr)". For the
1320     // __c11 builtin, ptr is 0 (indicating a properly-aligned object), since
1321     // _Atomic(T) is always properly-aligned.
1322     const char *LibCallName = "__atomic_is_lock_free";
1323     CallArgList Args;
1324     Args.add(RValue::get(EmitScalarExpr(E->getArg(0))),
1325              getContext().getSizeType());
1326     if (BuiltinID == Builtin::BI__atomic_is_lock_free)
1327       Args.add(RValue::get(EmitScalarExpr(E->getArg(1))),
1328                getContext().VoidPtrTy);
1329     else
1330       Args.add(RValue::get(llvm::Constant::getNullValue(VoidPtrTy)),
1331                getContext().VoidPtrTy);
1332     const CGFunctionInfo &FuncInfo =
1333         CGM.getTypes().arrangeFreeFunctionCall(E->getType(), Args,
1334                                                FunctionType::ExtInfo(),
1335                                                RequiredArgs::All);
1336     llvm::FunctionType *FTy = CGM.getTypes().GetFunctionType(FuncInfo);
1337     llvm::Constant *Func = CGM.CreateRuntimeFunction(FTy, LibCallName);
1338     return EmitCall(FuncInfo, Func, ReturnValueSlot(), Args);
1339   }
1340 
1341   case Builtin::BI__atomic_test_and_set: {
1342     // Look at the argument type to determine whether this is a volatile
1343     // operation. The parameter type is always volatile.
1344     QualType PtrTy = E->getArg(0)->IgnoreImpCasts()->getType();
1345     bool Volatile =
1346         PtrTy->castAs<PointerType>()->getPointeeType().isVolatileQualified();
1347 
1348     Value *Ptr = EmitScalarExpr(E->getArg(0));
1349     unsigned AddrSpace = Ptr->getType()->getPointerAddressSpace();
1350     Ptr = Builder.CreateBitCast(Ptr, Int8Ty->getPointerTo(AddrSpace));
1351     Value *NewVal = Builder.getInt8(1);
1352     Value *Order = EmitScalarExpr(E->getArg(1));
1353     if (isa<llvm::ConstantInt>(Order)) {
1354       int ord = cast<llvm::ConstantInt>(Order)->getZExtValue();
1355       AtomicRMWInst *Result = nullptr;
1356       switch (ord) {
1357       case 0:  // memory_order_relaxed
1358       default: // invalid order
1359         Result = Builder.CreateAtomicRMW(llvm::AtomicRMWInst::Xchg,
1360                                          Ptr, NewVal,
1361                                          llvm::Monotonic);
1362         break;
1363       case 1:  // memory_order_consume
1364       case 2:  // memory_order_acquire
1365         Result = Builder.CreateAtomicRMW(llvm::AtomicRMWInst::Xchg,
1366                                          Ptr, NewVal,
1367                                          llvm::Acquire);
1368         break;
1369       case 3:  // memory_order_release
1370         Result = Builder.CreateAtomicRMW(llvm::AtomicRMWInst::Xchg,
1371                                          Ptr, NewVal,
1372                                          llvm::Release);
1373         break;
1374       case 4:  // memory_order_acq_rel
1375         Result = Builder.CreateAtomicRMW(llvm::AtomicRMWInst::Xchg,
1376                                          Ptr, NewVal,
1377                                          llvm::AcquireRelease);
1378         break;
1379       case 5:  // memory_order_seq_cst
1380         Result = Builder.CreateAtomicRMW(llvm::AtomicRMWInst::Xchg,
1381                                          Ptr, NewVal,
1382                                          llvm::SequentiallyConsistent);
1383         break;
1384       }
1385       Result->setVolatile(Volatile);
1386       return RValue::get(Builder.CreateIsNotNull(Result, "tobool"));
1387     }
1388 
1389     llvm::BasicBlock *ContBB = createBasicBlock("atomic.continue", CurFn);
1390 
1391     llvm::BasicBlock *BBs[5] = {
1392       createBasicBlock("monotonic", CurFn),
1393       createBasicBlock("acquire", CurFn),
1394       createBasicBlock("release", CurFn),
1395       createBasicBlock("acqrel", CurFn),
1396       createBasicBlock("seqcst", CurFn)
1397     };
1398     llvm::AtomicOrdering Orders[5] = {
1399       llvm::Monotonic, llvm::Acquire, llvm::Release,
1400       llvm::AcquireRelease, llvm::SequentiallyConsistent
1401     };
1402 
1403     Order = Builder.CreateIntCast(Order, Builder.getInt32Ty(), false);
1404     llvm::SwitchInst *SI = Builder.CreateSwitch(Order, BBs[0]);
1405 
1406     Builder.SetInsertPoint(ContBB);
1407     PHINode *Result = Builder.CreatePHI(Int8Ty, 5, "was_set");
1408 
1409     for (unsigned i = 0; i < 5; ++i) {
1410       Builder.SetInsertPoint(BBs[i]);
1411       AtomicRMWInst *RMW = Builder.CreateAtomicRMW(llvm::AtomicRMWInst::Xchg,
1412                                                    Ptr, NewVal, Orders[i]);
1413       RMW->setVolatile(Volatile);
1414       Result->addIncoming(RMW, BBs[i]);
1415       Builder.CreateBr(ContBB);
1416     }
1417 
1418     SI->addCase(Builder.getInt32(0), BBs[0]);
1419     SI->addCase(Builder.getInt32(1), BBs[1]);
1420     SI->addCase(Builder.getInt32(2), BBs[1]);
1421     SI->addCase(Builder.getInt32(3), BBs[2]);
1422     SI->addCase(Builder.getInt32(4), BBs[3]);
1423     SI->addCase(Builder.getInt32(5), BBs[4]);
1424 
1425     Builder.SetInsertPoint(ContBB);
1426     return RValue::get(Builder.CreateIsNotNull(Result, "tobool"));
1427   }
1428 
1429   case Builtin::BI__atomic_clear: {
1430     QualType PtrTy = E->getArg(0)->IgnoreImpCasts()->getType();
1431     bool Volatile =
1432         PtrTy->castAs<PointerType>()->getPointeeType().isVolatileQualified();
1433 
1434     Address Ptr = EmitPointerWithAlignment(E->getArg(0));
1435     unsigned AddrSpace = Ptr.getPointer()->getType()->getPointerAddressSpace();
1436     Ptr = Builder.CreateBitCast(Ptr, Int8Ty->getPointerTo(AddrSpace));
1437     Value *NewVal = Builder.getInt8(0);
1438     Value *Order = EmitScalarExpr(E->getArg(1));
1439     if (isa<llvm::ConstantInt>(Order)) {
1440       int ord = cast<llvm::ConstantInt>(Order)->getZExtValue();
1441       StoreInst *Store = Builder.CreateStore(NewVal, Ptr, Volatile);
1442       switch (ord) {
1443       case 0:  // memory_order_relaxed
1444       default: // invalid order
1445         Store->setOrdering(llvm::Monotonic);
1446         break;
1447       case 3:  // memory_order_release
1448         Store->setOrdering(llvm::Release);
1449         break;
1450       case 5:  // memory_order_seq_cst
1451         Store->setOrdering(llvm::SequentiallyConsistent);
1452         break;
1453       }
1454       return RValue::get(nullptr);
1455     }
1456 
1457     llvm::BasicBlock *ContBB = createBasicBlock("atomic.continue", CurFn);
1458 
1459     llvm::BasicBlock *BBs[3] = {
1460       createBasicBlock("monotonic", CurFn),
1461       createBasicBlock("release", CurFn),
1462       createBasicBlock("seqcst", CurFn)
1463     };
1464     llvm::AtomicOrdering Orders[3] = {
1465       llvm::Monotonic, llvm::Release, llvm::SequentiallyConsistent
1466     };
1467 
1468     Order = Builder.CreateIntCast(Order, Builder.getInt32Ty(), false);
1469     llvm::SwitchInst *SI = Builder.CreateSwitch(Order, BBs[0]);
1470 
1471     for (unsigned i = 0; i < 3; ++i) {
1472       Builder.SetInsertPoint(BBs[i]);
1473       StoreInst *Store = Builder.CreateStore(NewVal, Ptr, Volatile);
1474       Store->setOrdering(Orders[i]);
1475       Builder.CreateBr(ContBB);
1476     }
1477 
1478     SI->addCase(Builder.getInt32(0), BBs[0]);
1479     SI->addCase(Builder.getInt32(3), BBs[1]);
1480     SI->addCase(Builder.getInt32(5), BBs[2]);
1481 
1482     Builder.SetInsertPoint(ContBB);
1483     return RValue::get(nullptr);
1484   }
1485 
1486   case Builtin::BI__atomic_thread_fence:
1487   case Builtin::BI__atomic_signal_fence:
1488   case Builtin::BI__c11_atomic_thread_fence:
1489   case Builtin::BI__c11_atomic_signal_fence: {
1490     llvm::SynchronizationScope Scope;
1491     if (BuiltinID == Builtin::BI__atomic_signal_fence ||
1492         BuiltinID == Builtin::BI__c11_atomic_signal_fence)
1493       Scope = llvm::SingleThread;
1494     else
1495       Scope = llvm::CrossThread;
1496     Value *Order = EmitScalarExpr(E->getArg(0));
1497     if (isa<llvm::ConstantInt>(Order)) {
1498       int ord = cast<llvm::ConstantInt>(Order)->getZExtValue();
1499       switch (ord) {
1500       case 0:  // memory_order_relaxed
1501       default: // invalid order
1502         break;
1503       case 1:  // memory_order_consume
1504       case 2:  // memory_order_acquire
1505         Builder.CreateFence(llvm::Acquire, Scope);
1506         break;
1507       case 3:  // memory_order_release
1508         Builder.CreateFence(llvm::Release, Scope);
1509         break;
1510       case 4:  // memory_order_acq_rel
1511         Builder.CreateFence(llvm::AcquireRelease, Scope);
1512         break;
1513       case 5:  // memory_order_seq_cst
1514         Builder.CreateFence(llvm::SequentiallyConsistent, Scope);
1515         break;
1516       }
1517       return RValue::get(nullptr);
1518     }
1519 
1520     llvm::BasicBlock *AcquireBB, *ReleaseBB, *AcqRelBB, *SeqCstBB;
1521     AcquireBB = createBasicBlock("acquire", CurFn);
1522     ReleaseBB = createBasicBlock("release", CurFn);
1523     AcqRelBB = createBasicBlock("acqrel", CurFn);
1524     SeqCstBB = createBasicBlock("seqcst", CurFn);
1525     llvm::BasicBlock *ContBB = createBasicBlock("atomic.continue", CurFn);
1526 
1527     Order = Builder.CreateIntCast(Order, Builder.getInt32Ty(), false);
1528     llvm::SwitchInst *SI = Builder.CreateSwitch(Order, ContBB);
1529 
1530     Builder.SetInsertPoint(AcquireBB);
1531     Builder.CreateFence(llvm::Acquire, Scope);
1532     Builder.CreateBr(ContBB);
1533     SI->addCase(Builder.getInt32(1), AcquireBB);
1534     SI->addCase(Builder.getInt32(2), AcquireBB);
1535 
1536     Builder.SetInsertPoint(ReleaseBB);
1537     Builder.CreateFence(llvm::Release, Scope);
1538     Builder.CreateBr(ContBB);
1539     SI->addCase(Builder.getInt32(3), ReleaseBB);
1540 
1541     Builder.SetInsertPoint(AcqRelBB);
1542     Builder.CreateFence(llvm::AcquireRelease, Scope);
1543     Builder.CreateBr(ContBB);
1544     SI->addCase(Builder.getInt32(4), AcqRelBB);
1545 
1546     Builder.SetInsertPoint(SeqCstBB);
1547     Builder.CreateFence(llvm::SequentiallyConsistent, Scope);
1548     Builder.CreateBr(ContBB);
1549     SI->addCase(Builder.getInt32(5), SeqCstBB);
1550 
1551     Builder.SetInsertPoint(ContBB);
1552     return RValue::get(nullptr);
1553   }
1554 
1555     // Library functions with special handling.
1556   case Builtin::BIsqrt:
1557   case Builtin::BIsqrtf:
1558   case Builtin::BIsqrtl: {
1559     // Transform a call to sqrt* into a @llvm.sqrt.* intrinsic call, but only
1560     // in finite- or unsafe-math mode (the intrinsic has different semantics
1561     // for handling negative numbers compared to the library function, so
1562     // -fmath-errno=0 is not enough).
1563     if (!FD->hasAttr<ConstAttr>())
1564       break;
1565     if (!(CGM.getCodeGenOpts().UnsafeFPMath ||
1566           CGM.getCodeGenOpts().NoNaNsFPMath))
1567       break;
1568     Value *Arg0 = EmitScalarExpr(E->getArg(0));
1569     llvm::Type *ArgType = Arg0->getType();
1570     Value *F = CGM.getIntrinsic(Intrinsic::sqrt, ArgType);
1571     return RValue::get(Builder.CreateCall(F, Arg0));
1572   }
1573 
1574   case Builtin::BI__builtin_pow:
1575   case Builtin::BI__builtin_powf:
1576   case Builtin::BI__builtin_powl:
1577   case Builtin::BIpow:
1578   case Builtin::BIpowf:
1579   case Builtin::BIpowl: {
1580     // Transform a call to pow* into a @llvm.pow.* intrinsic call.
1581     if (!FD->hasAttr<ConstAttr>())
1582       break;
1583     Value *Base = EmitScalarExpr(E->getArg(0));
1584     Value *Exponent = EmitScalarExpr(E->getArg(1));
1585     llvm::Type *ArgType = Base->getType();
1586     Value *F = CGM.getIntrinsic(Intrinsic::pow, ArgType);
1587     return RValue::get(Builder.CreateCall(F, {Base, Exponent}));
1588   }
1589 
1590   case Builtin::BIfma:
1591   case Builtin::BIfmaf:
1592   case Builtin::BIfmal:
1593   case Builtin::BI__builtin_fma:
1594   case Builtin::BI__builtin_fmaf:
1595   case Builtin::BI__builtin_fmal: {
1596     // Rewrite fma to intrinsic.
1597     Value *FirstArg = EmitScalarExpr(E->getArg(0));
1598     llvm::Type *ArgType = FirstArg->getType();
1599     Value *F = CGM.getIntrinsic(Intrinsic::fma, ArgType);
1600     return RValue::get(
1601         Builder.CreateCall(F, {FirstArg, EmitScalarExpr(E->getArg(1)),
1602                                EmitScalarExpr(E->getArg(2))}));
1603   }
1604 
1605   case Builtin::BI__builtin_signbit:
1606   case Builtin::BI__builtin_signbitf:
1607   case Builtin::BI__builtin_signbitl: {
1608     return RValue::get(
1609         Builder.CreateZExt(EmitSignBit(*this, EmitScalarExpr(E->getArg(0))),
1610                            ConvertType(E->getType())));
1611   }
1612   case Builtin::BI__builtin_annotation: {
1613     llvm::Value *AnnVal = EmitScalarExpr(E->getArg(0));
1614     llvm::Value *F = CGM.getIntrinsic(llvm::Intrinsic::annotation,
1615                                       AnnVal->getType());
1616 
1617     // Get the annotation string, go through casts. Sema requires this to be a
1618     // non-wide string literal, potentially casted, so the cast<> is safe.
1619     const Expr *AnnotationStrExpr = E->getArg(1)->IgnoreParenCasts();
1620     StringRef Str = cast<StringLiteral>(AnnotationStrExpr)->getString();
1621     return RValue::get(EmitAnnotationCall(F, AnnVal, Str, E->getExprLoc()));
1622   }
1623   case Builtin::BI__builtin_addcb:
1624   case Builtin::BI__builtin_addcs:
1625   case Builtin::BI__builtin_addc:
1626   case Builtin::BI__builtin_addcl:
1627   case Builtin::BI__builtin_addcll:
1628   case Builtin::BI__builtin_subcb:
1629   case Builtin::BI__builtin_subcs:
1630   case Builtin::BI__builtin_subc:
1631   case Builtin::BI__builtin_subcl:
1632   case Builtin::BI__builtin_subcll: {
1633 
1634     // We translate all of these builtins from expressions of the form:
1635     //   int x = ..., y = ..., carryin = ..., carryout, result;
1636     //   result = __builtin_addc(x, y, carryin, &carryout);
1637     //
1638     // to LLVM IR of the form:
1639     //
1640     //   %tmp1 = call {i32, i1} @llvm.uadd.with.overflow.i32(i32 %x, i32 %y)
1641     //   %tmpsum1 = extractvalue {i32, i1} %tmp1, 0
1642     //   %carry1 = extractvalue {i32, i1} %tmp1, 1
1643     //   %tmp2 = call {i32, i1} @llvm.uadd.with.overflow.i32(i32 %tmpsum1,
1644     //                                                       i32 %carryin)
1645     //   %result = extractvalue {i32, i1} %tmp2, 0
1646     //   %carry2 = extractvalue {i32, i1} %tmp2, 1
1647     //   %tmp3 = or i1 %carry1, %carry2
1648     //   %tmp4 = zext i1 %tmp3 to i32
1649     //   store i32 %tmp4, i32* %carryout
1650 
1651     // Scalarize our inputs.
1652     llvm::Value *X = EmitScalarExpr(E->getArg(0));
1653     llvm::Value *Y = EmitScalarExpr(E->getArg(1));
1654     llvm::Value *Carryin = EmitScalarExpr(E->getArg(2));
1655     Address CarryOutPtr = EmitPointerWithAlignment(E->getArg(3));
1656 
1657     // Decide if we are lowering to a uadd.with.overflow or usub.with.overflow.
1658     llvm::Intrinsic::ID IntrinsicId;
1659     switch (BuiltinID) {
1660     default: llvm_unreachable("Unknown multiprecision builtin id.");
1661     case Builtin::BI__builtin_addcb:
1662     case Builtin::BI__builtin_addcs:
1663     case Builtin::BI__builtin_addc:
1664     case Builtin::BI__builtin_addcl:
1665     case Builtin::BI__builtin_addcll:
1666       IntrinsicId = llvm::Intrinsic::uadd_with_overflow;
1667       break;
1668     case Builtin::BI__builtin_subcb:
1669     case Builtin::BI__builtin_subcs:
1670     case Builtin::BI__builtin_subc:
1671     case Builtin::BI__builtin_subcl:
1672     case Builtin::BI__builtin_subcll:
1673       IntrinsicId = llvm::Intrinsic::usub_with_overflow;
1674       break;
1675     }
1676 
1677     // Construct our resulting LLVM IR expression.
1678     llvm::Value *Carry1;
1679     llvm::Value *Sum1 = EmitOverflowIntrinsic(*this, IntrinsicId,
1680                                               X, Y, Carry1);
1681     llvm::Value *Carry2;
1682     llvm::Value *Sum2 = EmitOverflowIntrinsic(*this, IntrinsicId,
1683                                               Sum1, Carryin, Carry2);
1684     llvm::Value *CarryOut = Builder.CreateZExt(Builder.CreateOr(Carry1, Carry2),
1685                                                X->getType());
1686     Builder.CreateStore(CarryOut, CarryOutPtr);
1687     return RValue::get(Sum2);
1688   }
1689 
1690   case Builtin::BI__builtin_add_overflow:
1691   case Builtin::BI__builtin_sub_overflow:
1692   case Builtin::BI__builtin_mul_overflow: {
1693     const clang::Expr *LeftArg = E->getArg(0);
1694     const clang::Expr *RightArg = E->getArg(1);
1695     const clang::Expr *ResultArg = E->getArg(2);
1696 
1697     clang::QualType ResultQTy =
1698         ResultArg->getType()->castAs<PointerType>()->getPointeeType();
1699 
1700     WidthAndSignedness LeftInfo =
1701         getIntegerWidthAndSignedness(CGM.getContext(), LeftArg->getType());
1702     WidthAndSignedness RightInfo =
1703         getIntegerWidthAndSignedness(CGM.getContext(), RightArg->getType());
1704     WidthAndSignedness ResultInfo =
1705         getIntegerWidthAndSignedness(CGM.getContext(), ResultQTy);
1706     WidthAndSignedness EncompassingInfo =
1707         EncompassingIntegerType({LeftInfo, RightInfo, ResultInfo});
1708 
1709     llvm::Type *EncompassingLLVMTy =
1710         llvm::IntegerType::get(CGM.getLLVMContext(), EncompassingInfo.Width);
1711 
1712     llvm::Type *ResultLLVMTy = CGM.getTypes().ConvertType(ResultQTy);
1713 
1714     llvm::Intrinsic::ID IntrinsicId;
1715     switch (BuiltinID) {
1716     default:
1717       llvm_unreachable("Unknown overflow builtin id.");
1718     case Builtin::BI__builtin_add_overflow:
1719       IntrinsicId = EncompassingInfo.Signed
1720                         ? llvm::Intrinsic::sadd_with_overflow
1721                         : llvm::Intrinsic::uadd_with_overflow;
1722       break;
1723     case Builtin::BI__builtin_sub_overflow:
1724       IntrinsicId = EncompassingInfo.Signed
1725                         ? llvm::Intrinsic::ssub_with_overflow
1726                         : llvm::Intrinsic::usub_with_overflow;
1727       break;
1728     case Builtin::BI__builtin_mul_overflow:
1729       IntrinsicId = EncompassingInfo.Signed
1730                         ? llvm::Intrinsic::smul_with_overflow
1731                         : llvm::Intrinsic::umul_with_overflow;
1732       break;
1733     }
1734 
1735     llvm::Value *Left = EmitScalarExpr(LeftArg);
1736     llvm::Value *Right = EmitScalarExpr(RightArg);
1737     Address ResultPtr = EmitPointerWithAlignment(ResultArg);
1738 
1739     // Extend each operand to the encompassing type.
1740     Left = Builder.CreateIntCast(Left, EncompassingLLVMTy, LeftInfo.Signed);
1741     Right = Builder.CreateIntCast(Right, EncompassingLLVMTy, RightInfo.Signed);
1742 
1743     // Perform the operation on the extended values.
1744     llvm::Value *Overflow, *Result;
1745     Result = EmitOverflowIntrinsic(*this, IntrinsicId, Left, Right, Overflow);
1746 
1747     if (EncompassingInfo.Width > ResultInfo.Width) {
1748       // The encompassing type is wider than the result type, so we need to
1749       // truncate it.
1750       llvm::Value *ResultTrunc = Builder.CreateTrunc(Result, ResultLLVMTy);
1751 
1752       // To see if the truncation caused an overflow, we will extend
1753       // the result and then compare it to the original result.
1754       llvm::Value *ResultTruncExt = Builder.CreateIntCast(
1755           ResultTrunc, EncompassingLLVMTy, ResultInfo.Signed);
1756       llvm::Value *TruncationOverflow =
1757           Builder.CreateICmpNE(Result, ResultTruncExt);
1758 
1759       Overflow = Builder.CreateOr(Overflow, TruncationOverflow);
1760       Result = ResultTrunc;
1761     }
1762 
1763     // Finally, store the result using the pointer.
1764     bool isVolatile =
1765       ResultArg->getType()->getPointeeType().isVolatileQualified();
1766     Builder.CreateStore(EmitToMemory(Result, ResultQTy), ResultPtr, isVolatile);
1767 
1768     return RValue::get(Overflow);
1769   }
1770 
1771   case Builtin::BI__builtin_uadd_overflow:
1772   case Builtin::BI__builtin_uaddl_overflow:
1773   case Builtin::BI__builtin_uaddll_overflow:
1774   case Builtin::BI__builtin_usub_overflow:
1775   case Builtin::BI__builtin_usubl_overflow:
1776   case Builtin::BI__builtin_usubll_overflow:
1777   case Builtin::BI__builtin_umul_overflow:
1778   case Builtin::BI__builtin_umull_overflow:
1779   case Builtin::BI__builtin_umulll_overflow:
1780   case Builtin::BI__builtin_sadd_overflow:
1781   case Builtin::BI__builtin_saddl_overflow:
1782   case Builtin::BI__builtin_saddll_overflow:
1783   case Builtin::BI__builtin_ssub_overflow:
1784   case Builtin::BI__builtin_ssubl_overflow:
1785   case Builtin::BI__builtin_ssubll_overflow:
1786   case Builtin::BI__builtin_smul_overflow:
1787   case Builtin::BI__builtin_smull_overflow:
1788   case Builtin::BI__builtin_smulll_overflow: {
1789 
1790     // We translate all of these builtins directly to the relevant llvm IR node.
1791 
1792     // Scalarize our inputs.
1793     llvm::Value *X = EmitScalarExpr(E->getArg(0));
1794     llvm::Value *Y = EmitScalarExpr(E->getArg(1));
1795     Address SumOutPtr = EmitPointerWithAlignment(E->getArg(2));
1796 
1797     // Decide which of the overflow intrinsics we are lowering to:
1798     llvm::Intrinsic::ID IntrinsicId;
1799     switch (BuiltinID) {
1800     default: llvm_unreachable("Unknown overflow builtin id.");
1801     case Builtin::BI__builtin_uadd_overflow:
1802     case Builtin::BI__builtin_uaddl_overflow:
1803     case Builtin::BI__builtin_uaddll_overflow:
1804       IntrinsicId = llvm::Intrinsic::uadd_with_overflow;
1805       break;
1806     case Builtin::BI__builtin_usub_overflow:
1807     case Builtin::BI__builtin_usubl_overflow:
1808     case Builtin::BI__builtin_usubll_overflow:
1809       IntrinsicId = llvm::Intrinsic::usub_with_overflow;
1810       break;
1811     case Builtin::BI__builtin_umul_overflow:
1812     case Builtin::BI__builtin_umull_overflow:
1813     case Builtin::BI__builtin_umulll_overflow:
1814       IntrinsicId = llvm::Intrinsic::umul_with_overflow;
1815       break;
1816     case Builtin::BI__builtin_sadd_overflow:
1817     case Builtin::BI__builtin_saddl_overflow:
1818     case Builtin::BI__builtin_saddll_overflow:
1819       IntrinsicId = llvm::Intrinsic::sadd_with_overflow;
1820       break;
1821     case Builtin::BI__builtin_ssub_overflow:
1822     case Builtin::BI__builtin_ssubl_overflow:
1823     case Builtin::BI__builtin_ssubll_overflow:
1824       IntrinsicId = llvm::Intrinsic::ssub_with_overflow;
1825       break;
1826     case Builtin::BI__builtin_smul_overflow:
1827     case Builtin::BI__builtin_smull_overflow:
1828     case Builtin::BI__builtin_smulll_overflow:
1829       IntrinsicId = llvm::Intrinsic::smul_with_overflow;
1830       break;
1831     }
1832 
1833 
1834     llvm::Value *Carry;
1835     llvm::Value *Sum = EmitOverflowIntrinsic(*this, IntrinsicId, X, Y, Carry);
1836     Builder.CreateStore(Sum, SumOutPtr);
1837 
1838     return RValue::get(Carry);
1839   }
1840   case Builtin::BI__builtin_addressof:
1841     return RValue::get(EmitLValue(E->getArg(0)).getPointer());
1842   case Builtin::BI__builtin_operator_new:
1843     return EmitBuiltinNewDeleteCall(FD->getType()->castAs<FunctionProtoType>(),
1844                                     E->getArg(0), false);
1845   case Builtin::BI__builtin_operator_delete:
1846     return EmitBuiltinNewDeleteCall(FD->getType()->castAs<FunctionProtoType>(),
1847                                     E->getArg(0), true);
1848   case Builtin::BI__noop:
1849     // __noop always evaluates to an integer literal zero.
1850     return RValue::get(ConstantInt::get(IntTy, 0));
1851   case Builtin::BI__builtin_call_with_static_chain: {
1852     const CallExpr *Call = cast<CallExpr>(E->getArg(0));
1853     const Expr *Chain = E->getArg(1);
1854     return EmitCall(Call->getCallee()->getType(),
1855                     EmitScalarExpr(Call->getCallee()), Call, ReturnValue,
1856                     Call->getCalleeDecl(), EmitScalarExpr(Chain));
1857   }
1858   case Builtin::BI_InterlockedExchange:
1859   case Builtin::BI_InterlockedExchangePointer:
1860     return EmitBinaryAtomic(*this, llvm::AtomicRMWInst::Xchg, E);
1861   case Builtin::BI_InterlockedCompareExchangePointer: {
1862     llvm::Type *RTy;
1863     llvm::IntegerType *IntType =
1864       IntegerType::get(getLLVMContext(),
1865                        getContext().getTypeSize(E->getType()));
1866     llvm::Type *IntPtrType = IntType->getPointerTo();
1867 
1868     llvm::Value *Destination =
1869       Builder.CreateBitCast(EmitScalarExpr(E->getArg(0)), IntPtrType);
1870 
1871     llvm::Value *Exchange = EmitScalarExpr(E->getArg(1));
1872     RTy = Exchange->getType();
1873     Exchange = Builder.CreatePtrToInt(Exchange, IntType);
1874 
1875     llvm::Value *Comparand =
1876       Builder.CreatePtrToInt(EmitScalarExpr(E->getArg(2)), IntType);
1877 
1878     auto Result = Builder.CreateAtomicCmpXchg(Destination, Comparand, Exchange,
1879                                               SequentiallyConsistent,
1880                                               SequentiallyConsistent);
1881     Result->setVolatile(true);
1882 
1883     return RValue::get(Builder.CreateIntToPtr(Builder.CreateExtractValue(Result,
1884                                                                          0),
1885                                               RTy));
1886   }
1887   case Builtin::BI_InterlockedCompareExchange: {
1888     AtomicCmpXchgInst *CXI = Builder.CreateAtomicCmpXchg(
1889         EmitScalarExpr(E->getArg(0)),
1890         EmitScalarExpr(E->getArg(2)),
1891         EmitScalarExpr(E->getArg(1)),
1892         SequentiallyConsistent,
1893         SequentiallyConsistent);
1894       CXI->setVolatile(true);
1895       return RValue::get(Builder.CreateExtractValue(CXI, 0));
1896   }
1897   case Builtin::BI_InterlockedIncrement: {
1898     AtomicRMWInst *RMWI = Builder.CreateAtomicRMW(
1899       AtomicRMWInst::Add,
1900       EmitScalarExpr(E->getArg(0)),
1901       ConstantInt::get(Int32Ty, 1),
1902       llvm::SequentiallyConsistent);
1903     RMWI->setVolatile(true);
1904     return RValue::get(Builder.CreateAdd(RMWI, ConstantInt::get(Int32Ty, 1)));
1905   }
1906   case Builtin::BI_InterlockedDecrement: {
1907     AtomicRMWInst *RMWI = Builder.CreateAtomicRMW(
1908       AtomicRMWInst::Sub,
1909       EmitScalarExpr(E->getArg(0)),
1910       ConstantInt::get(Int32Ty, 1),
1911       llvm::SequentiallyConsistent);
1912     RMWI->setVolatile(true);
1913     return RValue::get(Builder.CreateSub(RMWI, ConstantInt::get(Int32Ty, 1)));
1914   }
1915   case Builtin::BI_InterlockedExchangeAdd: {
1916     AtomicRMWInst *RMWI = Builder.CreateAtomicRMW(
1917       AtomicRMWInst::Add,
1918       EmitScalarExpr(E->getArg(0)),
1919       EmitScalarExpr(E->getArg(1)),
1920       llvm::SequentiallyConsistent);
1921     RMWI->setVolatile(true);
1922     return RValue::get(RMWI);
1923   }
1924   case Builtin::BI__readfsdword: {
1925     Value *IntToPtr =
1926       Builder.CreateIntToPtr(EmitScalarExpr(E->getArg(0)),
1927                              llvm::PointerType::get(CGM.Int32Ty, 257));
1928     LoadInst *Load =
1929         Builder.CreateAlignedLoad(IntToPtr, /*Align=*/4, /*isVolatile=*/true);
1930     return RValue::get(Load);
1931   }
1932 
1933   case Builtin::BI__exception_code:
1934   case Builtin::BI_exception_code:
1935     return RValue::get(EmitSEHExceptionCode());
1936   case Builtin::BI__exception_info:
1937   case Builtin::BI_exception_info:
1938     return RValue::get(EmitSEHExceptionInfo());
1939   case Builtin::BI__abnormal_termination:
1940   case Builtin::BI_abnormal_termination:
1941     return RValue::get(EmitSEHAbnormalTermination());
1942   case Builtin::BI_setjmpex: {
1943     if (getTarget().getTriple().isOSMSVCRT()) {
1944       llvm::Type *ArgTypes[] = {Int8PtrTy, Int8PtrTy};
1945       llvm::AttributeSet ReturnsTwiceAttr =
1946           AttributeSet::get(getLLVMContext(), llvm::AttributeSet::FunctionIndex,
1947                             llvm::Attribute::ReturnsTwice);
1948       llvm::Constant *SetJmpEx = CGM.CreateRuntimeFunction(
1949           llvm::FunctionType::get(IntTy, ArgTypes, /*isVarArg=*/false),
1950           "_setjmpex", ReturnsTwiceAttr);
1951       llvm::Value *Buf = Builder.CreateBitOrPointerCast(
1952           EmitScalarExpr(E->getArg(0)), Int8PtrTy);
1953       llvm::Value *FrameAddr =
1954           Builder.CreateCall(CGM.getIntrinsic(Intrinsic::frameaddress),
1955                              ConstantInt::get(Int32Ty, 0));
1956       llvm::Value *Args[] = {Buf, FrameAddr};
1957       llvm::CallSite CS = EmitRuntimeCallOrInvoke(SetJmpEx, Args);
1958       CS.setAttributes(ReturnsTwiceAttr);
1959       return RValue::get(CS.getInstruction());
1960     }
1961     break;
1962   }
1963   case Builtin::BI_setjmp: {
1964     if (getTarget().getTriple().isOSMSVCRT()) {
1965       llvm::AttributeSet ReturnsTwiceAttr =
1966           AttributeSet::get(getLLVMContext(), llvm::AttributeSet::FunctionIndex,
1967                             llvm::Attribute::ReturnsTwice);
1968       llvm::Value *Buf = Builder.CreateBitOrPointerCast(
1969           EmitScalarExpr(E->getArg(0)), Int8PtrTy);
1970       llvm::CallSite CS;
1971       if (getTarget().getTriple().getArch() == llvm::Triple::x86) {
1972         llvm::Type *ArgTypes[] = {Int8PtrTy, IntTy};
1973         llvm::Constant *SetJmp3 = CGM.CreateRuntimeFunction(
1974             llvm::FunctionType::get(IntTy, ArgTypes, /*isVarArg=*/true),
1975             "_setjmp3", ReturnsTwiceAttr);
1976         llvm::Value *Count = ConstantInt::get(IntTy, 0);
1977         llvm::Value *Args[] = {Buf, Count};
1978         CS = EmitRuntimeCallOrInvoke(SetJmp3, Args);
1979       } else {
1980         llvm::Type *ArgTypes[] = {Int8PtrTy, Int8PtrTy};
1981         llvm::Constant *SetJmp = CGM.CreateRuntimeFunction(
1982             llvm::FunctionType::get(IntTy, ArgTypes, /*isVarArg=*/false),
1983             "_setjmp", ReturnsTwiceAttr);
1984         llvm::Value *FrameAddr =
1985             Builder.CreateCall(CGM.getIntrinsic(Intrinsic::frameaddress),
1986                                ConstantInt::get(Int32Ty, 0));
1987         llvm::Value *Args[] = {Buf, FrameAddr};
1988         CS = EmitRuntimeCallOrInvoke(SetJmp, Args);
1989       }
1990       CS.setAttributes(ReturnsTwiceAttr);
1991       return RValue::get(CS.getInstruction());
1992     }
1993     break;
1994   }
1995 
1996   case Builtin::BI__GetExceptionInfo: {
1997     if (llvm::GlobalVariable *GV =
1998             CGM.getCXXABI().getThrowInfo(FD->getParamDecl(0)->getType()))
1999       return RValue::get(llvm::ConstantExpr::getBitCast(GV, CGM.Int8PtrTy));
2000     break;
2001   }
2002 
2003   // OpenCL v2.0 s6.13.16.2, Built-in pipe read and write functions
2004   case Builtin::BIread_pipe:
2005   case Builtin::BIwrite_pipe: {
2006     Value *Arg0 = EmitScalarExpr(E->getArg(0)),
2007           *Arg1 = EmitScalarExpr(E->getArg(1));
2008 
2009     // Type of the generic packet parameter.
2010     unsigned GenericAS =
2011         getContext().getTargetAddressSpace(LangAS::opencl_generic);
2012     llvm::Type *I8PTy = llvm::PointerType::get(
2013         llvm::Type::getInt8Ty(getLLVMContext()), GenericAS);
2014 
2015     // Testing which overloaded version we should generate the call for.
2016     if (2U == E->getNumArgs()) {
2017       const char *Name = (BuiltinID == Builtin::BIread_pipe) ? "__read_pipe_2"
2018                                                              : "__write_pipe_2";
2019       // Creating a generic function type to be able to call with any builtin or
2020       // user defined type.
2021       llvm::Type *ArgTys[] = {Arg0->getType(), I8PTy};
2022       llvm::FunctionType *FTy = llvm::FunctionType::get(
2023           Int32Ty, llvm::ArrayRef<llvm::Type *>(ArgTys), false);
2024       Value *BCast = Builder.CreatePointerCast(Arg1, I8PTy);
2025       return RValue::get(Builder.CreateCall(
2026           CGM.CreateRuntimeFunction(FTy, Name), {Arg0, BCast}));
2027     } else {
2028       assert(4 == E->getNumArgs() &&
2029              "Illegal number of parameters to pipe function");
2030       const char *Name = (BuiltinID == Builtin::BIread_pipe) ? "__read_pipe_4"
2031                                                              : "__write_pipe_4";
2032 
2033       llvm::Type *ArgTys[] = {Arg0->getType(), Arg1->getType(), Int32Ty, I8PTy};
2034       Value *Arg2 = EmitScalarExpr(E->getArg(2)),
2035             *Arg3 = EmitScalarExpr(E->getArg(3));
2036       llvm::FunctionType *FTy = llvm::FunctionType::get(
2037           Int32Ty, llvm::ArrayRef<llvm::Type *>(ArgTys), false);
2038       Value *BCast = Builder.CreatePointerCast(Arg3, I8PTy);
2039       // We know the third argument is an integer type, but we may need to cast
2040       // it to i32.
2041       if (Arg2->getType() != Int32Ty)
2042         Arg2 = Builder.CreateZExtOrTrunc(Arg2, Int32Ty);
2043       return RValue::get(Builder.CreateCall(
2044           CGM.CreateRuntimeFunction(FTy, Name), {Arg0, Arg1, Arg2, BCast}));
2045     }
2046   }
2047   // OpenCL v2.0 s6.13.16 ,s9.17.3.5 - Built-in pipe reserve read and write
2048   // functions
2049   case Builtin::BIreserve_read_pipe:
2050   case Builtin::BIreserve_write_pipe:
2051   case Builtin::BIwork_group_reserve_read_pipe:
2052   case Builtin::BIwork_group_reserve_write_pipe:
2053   case Builtin::BIsub_group_reserve_read_pipe:
2054   case Builtin::BIsub_group_reserve_write_pipe: {
2055     // Composing the mangled name for the function.
2056     const char *Name;
2057     if (BuiltinID == Builtin::BIreserve_read_pipe)
2058       Name = "__reserve_read_pipe";
2059     else if (BuiltinID == Builtin::BIreserve_write_pipe)
2060       Name = "__reserve_write_pipe";
2061     else if (BuiltinID == Builtin::BIwork_group_reserve_read_pipe)
2062       Name = "__work_group_reserve_read_pipe";
2063     else if (BuiltinID == Builtin::BIwork_group_reserve_write_pipe)
2064       Name = "__work_group_reserve_write_pipe";
2065     else if (BuiltinID == Builtin::BIsub_group_reserve_read_pipe)
2066       Name = "__sub_group_reserve_read_pipe";
2067     else
2068       Name = "__sub_group_reserve_write_pipe";
2069 
2070     Value *Arg0 = EmitScalarExpr(E->getArg(0)),
2071           *Arg1 = EmitScalarExpr(E->getArg(1));
2072     llvm::Type *ReservedIDTy = ConvertType(getContext().OCLReserveIDTy);
2073 
2074     // Building the generic function prototype.
2075     llvm::Type *ArgTys[] = {Arg0->getType(), Int32Ty};
2076     llvm::FunctionType *FTy = llvm::FunctionType::get(
2077         ReservedIDTy, llvm::ArrayRef<llvm::Type *>(ArgTys), false);
2078     // We know the second argument is an integer type, but we may need to cast
2079     // it to i32.
2080     if (Arg1->getType() != Int32Ty)
2081       Arg1 = Builder.CreateZExtOrTrunc(Arg1, Int32Ty);
2082     return RValue::get(
2083         Builder.CreateCall(CGM.CreateRuntimeFunction(FTy, Name), {Arg0, Arg1}));
2084   }
2085   // OpenCL v2.0 s6.13.16 ,s9.17.3.5 - Built-in pipe commit read and write
2086   // functions
2087   case Builtin::BIcommit_read_pipe:
2088   case Builtin::BIcommit_write_pipe:
2089   case Builtin::BIwork_group_commit_read_pipe:
2090   case Builtin::BIwork_group_commit_write_pipe:
2091   case Builtin::BIsub_group_commit_read_pipe:
2092   case Builtin::BIsub_group_commit_write_pipe: {
2093     const char *Name;
2094     if (BuiltinID == Builtin::BIcommit_read_pipe)
2095       Name = "__commit_read_pipe";
2096     else if (BuiltinID == Builtin::BIcommit_write_pipe)
2097       Name = "__commit_write_pipe";
2098     else if (BuiltinID == Builtin::BIwork_group_commit_read_pipe)
2099       Name = "__work_group_commit_read_pipe";
2100     else if (BuiltinID == Builtin::BIwork_group_commit_write_pipe)
2101       Name = "__work_group_commit_write_pipe";
2102     else if (BuiltinID == Builtin::BIsub_group_commit_read_pipe)
2103       Name = "__sub_group_commit_read_pipe";
2104     else
2105       Name = "__sub_group_commit_write_pipe";
2106 
2107     Value *Arg0 = EmitScalarExpr(E->getArg(0)),
2108           *Arg1 = EmitScalarExpr(E->getArg(1));
2109 
2110     // Building the generic function prototype.
2111     llvm::Type *ArgTys[] = {Arg0->getType(), Arg1->getType()};
2112     llvm::FunctionType *FTy =
2113         llvm::FunctionType::get(llvm::Type::getVoidTy(getLLVMContext()),
2114                                 llvm::ArrayRef<llvm::Type *>(ArgTys), false);
2115 
2116     return RValue::get(
2117         Builder.CreateCall(CGM.CreateRuntimeFunction(FTy, Name), {Arg0, Arg1}));
2118   }
2119   // OpenCL v2.0 s6.13.16.4 Built-in pipe query functions
2120   case Builtin::BIget_pipe_num_packets:
2121   case Builtin::BIget_pipe_max_packets: {
2122     const char *Name;
2123     if (BuiltinID == Builtin::BIget_pipe_num_packets)
2124       Name = "__get_pipe_num_packets";
2125     else
2126       Name = "__get_pipe_max_packets";
2127 
2128     // Building the generic function prototype.
2129     Value *Arg0 = EmitScalarExpr(E->getArg(0));
2130     llvm::Type *ArgTys[] = {Arg0->getType()};
2131     llvm::FunctionType *FTy = llvm::FunctionType::get(
2132         Int32Ty, llvm::ArrayRef<llvm::Type *>(ArgTys), false);
2133 
2134     return RValue::get(
2135         Builder.CreateCall(CGM.CreateRuntimeFunction(FTy, Name), {Arg0}));
2136   }
2137 
2138   case Builtin::BIprintf:
2139     if (getLangOpts().CUDA && getLangOpts().CUDAIsDevice)
2140       return EmitCUDADevicePrintfCallExpr(E, ReturnValue);
2141     break;
2142   case Builtin::BI__builtin_canonicalize:
2143   case Builtin::BI__builtin_canonicalizef:
2144   case Builtin::BI__builtin_canonicalizel:
2145     return RValue::get(emitUnaryBuiltin(*this, E, Intrinsic::canonicalize));
2146   }
2147 
2148   // If this is an alias for a lib function (e.g. __builtin_sin), emit
2149   // the call using the normal call path, but using the unmangled
2150   // version of the function name.
2151   if (getContext().BuiltinInfo.isLibFunction(BuiltinID))
2152     return emitLibraryCall(*this, FD, E,
2153                            CGM.getBuiltinLibFunction(FD, BuiltinID));
2154 
2155   // If this is a predefined lib function (e.g. malloc), emit the call
2156   // using exactly the normal call path.
2157   if (getContext().BuiltinInfo.isPredefinedLibFunction(BuiltinID))
2158     return emitLibraryCall(*this, FD, E, EmitScalarExpr(E->getCallee()));
2159 
2160   // Check that a call to a target specific builtin has the correct target
2161   // features.
2162   // This is down here to avoid non-target specific builtins, however, if
2163   // generic builtins start to require generic target features then we
2164   // can move this up to the beginning of the function.
2165   checkTargetFeatures(E, FD);
2166 
2167   // See if we have a target specific intrinsic.
2168   const char *Name = getContext().BuiltinInfo.getName(BuiltinID);
2169   Intrinsic::ID IntrinsicID = Intrinsic::not_intrinsic;
2170   if (const char *Prefix =
2171           llvm::Triple::getArchTypePrefix(getTarget().getTriple().getArch())) {
2172     IntrinsicID = Intrinsic::getIntrinsicForGCCBuiltin(Prefix, Name);
2173     // NOTE we dont need to perform a compatibility flag check here since the
2174     // intrinsics are declared in Builtins*.def via LANGBUILTIN which filter the
2175     // MS builtins via ALL_MS_LANGUAGES and are filtered earlier.
2176     if (IntrinsicID == Intrinsic::not_intrinsic)
2177       IntrinsicID = Intrinsic::getIntrinsicForMSBuiltin(Prefix, Name);
2178   }
2179 
2180   if (IntrinsicID != Intrinsic::not_intrinsic) {
2181     SmallVector<Value*, 16> Args;
2182 
2183     // Find out if any arguments are required to be integer constant
2184     // expressions.
2185     unsigned ICEArguments = 0;
2186     ASTContext::GetBuiltinTypeError Error;
2187     getContext().GetBuiltinType(BuiltinID, Error, &ICEArguments);
2188     assert(Error == ASTContext::GE_None && "Should not codegen an error");
2189 
2190     Function *F = CGM.getIntrinsic(IntrinsicID);
2191     llvm::FunctionType *FTy = F->getFunctionType();
2192 
2193     for (unsigned i = 0, e = E->getNumArgs(); i != e; ++i) {
2194       Value *ArgValue;
2195       // If this is a normal argument, just emit it as a scalar.
2196       if ((ICEArguments & (1 << i)) == 0) {
2197         ArgValue = EmitScalarExpr(E->getArg(i));
2198       } else {
2199         // If this is required to be a constant, constant fold it so that we
2200         // know that the generated intrinsic gets a ConstantInt.
2201         llvm::APSInt Result;
2202         bool IsConst = E->getArg(i)->isIntegerConstantExpr(Result,getContext());
2203         assert(IsConst && "Constant arg isn't actually constant?");
2204         (void)IsConst;
2205         ArgValue = llvm::ConstantInt::get(getLLVMContext(), Result);
2206       }
2207 
2208       // If the intrinsic arg type is different from the builtin arg type
2209       // we need to do a bit cast.
2210       llvm::Type *PTy = FTy->getParamType(i);
2211       if (PTy != ArgValue->getType()) {
2212         assert(PTy->canLosslesslyBitCastTo(FTy->getParamType(i)) &&
2213                "Must be able to losslessly bit cast to param");
2214         ArgValue = Builder.CreateBitCast(ArgValue, PTy);
2215       }
2216 
2217       Args.push_back(ArgValue);
2218     }
2219 
2220     Value *V = Builder.CreateCall(F, Args);
2221     QualType BuiltinRetType = E->getType();
2222 
2223     llvm::Type *RetTy = VoidTy;
2224     if (!BuiltinRetType->isVoidType())
2225       RetTy = ConvertType(BuiltinRetType);
2226 
2227     if (RetTy != V->getType()) {
2228       assert(V->getType()->canLosslesslyBitCastTo(RetTy) &&
2229              "Must be able to losslessly bit cast result type");
2230       V = Builder.CreateBitCast(V, RetTy);
2231     }
2232 
2233     return RValue::get(V);
2234   }
2235 
2236   // See if we have a target specific builtin that needs to be lowered.
2237   if (Value *V = EmitTargetBuiltinExpr(BuiltinID, E))
2238     return RValue::get(V);
2239 
2240   ErrorUnsupported(E, "builtin function");
2241 
2242   // Unknown builtin, for now just dump it out and return undef.
2243   return GetUndefRValue(E->getType());
2244 }
2245 
2246 static Value *EmitTargetArchBuiltinExpr(CodeGenFunction *CGF,
2247                                         unsigned BuiltinID, const CallExpr *E,
2248                                         llvm::Triple::ArchType Arch) {
2249   switch (Arch) {
2250   case llvm::Triple::arm:
2251   case llvm::Triple::armeb:
2252   case llvm::Triple::thumb:
2253   case llvm::Triple::thumbeb:
2254     return CGF->EmitARMBuiltinExpr(BuiltinID, E);
2255   case llvm::Triple::aarch64:
2256   case llvm::Triple::aarch64_be:
2257     return CGF->EmitAArch64BuiltinExpr(BuiltinID, E);
2258   case llvm::Triple::x86:
2259   case llvm::Triple::x86_64:
2260     return CGF->EmitX86BuiltinExpr(BuiltinID, E);
2261   case llvm::Triple::ppc:
2262   case llvm::Triple::ppc64:
2263   case llvm::Triple::ppc64le:
2264     return CGF->EmitPPCBuiltinExpr(BuiltinID, E);
2265   case llvm::Triple::r600:
2266   case llvm::Triple::amdgcn:
2267     return CGF->EmitAMDGPUBuiltinExpr(BuiltinID, E);
2268   case llvm::Triple::systemz:
2269     return CGF->EmitSystemZBuiltinExpr(BuiltinID, E);
2270   case llvm::Triple::nvptx:
2271   case llvm::Triple::nvptx64:
2272     return CGF->EmitNVPTXBuiltinExpr(BuiltinID, E);
2273   case llvm::Triple::wasm32:
2274   case llvm::Triple::wasm64:
2275     return CGF->EmitWebAssemblyBuiltinExpr(BuiltinID, E);
2276   default:
2277     return nullptr;
2278   }
2279 }
2280 
2281 Value *CodeGenFunction::EmitTargetBuiltinExpr(unsigned BuiltinID,
2282                                               const CallExpr *E) {
2283   if (getContext().BuiltinInfo.isAuxBuiltinID(BuiltinID)) {
2284     assert(getContext().getAuxTargetInfo() && "Missing aux target info");
2285     return EmitTargetArchBuiltinExpr(
2286         this, getContext().BuiltinInfo.getAuxBuiltinID(BuiltinID), E,
2287         getContext().getAuxTargetInfo()->getTriple().getArch());
2288   }
2289 
2290   return EmitTargetArchBuiltinExpr(this, BuiltinID, E,
2291                                    getTarget().getTriple().getArch());
2292 }
2293 
2294 static llvm::VectorType *GetNeonType(CodeGenFunction *CGF,
2295                                      NeonTypeFlags TypeFlags,
2296                                      bool V1Ty=false) {
2297   int IsQuad = TypeFlags.isQuad();
2298   switch (TypeFlags.getEltType()) {
2299   case NeonTypeFlags::Int8:
2300   case NeonTypeFlags::Poly8:
2301     return llvm::VectorType::get(CGF->Int8Ty, V1Ty ? 1 : (8 << IsQuad));
2302   case NeonTypeFlags::Int16:
2303   case NeonTypeFlags::Poly16:
2304   case NeonTypeFlags::Float16:
2305     return llvm::VectorType::get(CGF->Int16Ty, V1Ty ? 1 : (4 << IsQuad));
2306   case NeonTypeFlags::Int32:
2307     return llvm::VectorType::get(CGF->Int32Ty, V1Ty ? 1 : (2 << IsQuad));
2308   case NeonTypeFlags::Int64:
2309   case NeonTypeFlags::Poly64:
2310     return llvm::VectorType::get(CGF->Int64Ty, V1Ty ? 1 : (1 << IsQuad));
2311   case NeonTypeFlags::Poly128:
2312     // FIXME: i128 and f128 doesn't get fully support in Clang and llvm.
2313     // There is a lot of i128 and f128 API missing.
2314     // so we use v16i8 to represent poly128 and get pattern matched.
2315     return llvm::VectorType::get(CGF->Int8Ty, 16);
2316   case NeonTypeFlags::Float32:
2317     return llvm::VectorType::get(CGF->FloatTy, V1Ty ? 1 : (2 << IsQuad));
2318   case NeonTypeFlags::Float64:
2319     return llvm::VectorType::get(CGF->DoubleTy, V1Ty ? 1 : (1 << IsQuad));
2320   }
2321   llvm_unreachable("Unknown vector element type!");
2322 }
2323 
2324 static llvm::VectorType *GetFloatNeonType(CodeGenFunction *CGF,
2325                                           NeonTypeFlags IntTypeFlags) {
2326   int IsQuad = IntTypeFlags.isQuad();
2327   switch (IntTypeFlags.getEltType()) {
2328   case NeonTypeFlags::Int32:
2329     return llvm::VectorType::get(CGF->FloatTy, (2 << IsQuad));
2330   case NeonTypeFlags::Int64:
2331     return llvm::VectorType::get(CGF->DoubleTy, (1 << IsQuad));
2332   default:
2333     llvm_unreachable("Type can't be converted to floating-point!");
2334   }
2335 }
2336 
2337 Value *CodeGenFunction::EmitNeonSplat(Value *V, Constant *C) {
2338   unsigned nElts = cast<llvm::VectorType>(V->getType())->getNumElements();
2339   Value* SV = llvm::ConstantVector::getSplat(nElts, C);
2340   return Builder.CreateShuffleVector(V, V, SV, "lane");
2341 }
2342 
2343 Value *CodeGenFunction::EmitNeonCall(Function *F, SmallVectorImpl<Value*> &Ops,
2344                                      const char *name,
2345                                      unsigned shift, bool rightshift) {
2346   unsigned j = 0;
2347   for (Function::const_arg_iterator ai = F->arg_begin(), ae = F->arg_end();
2348        ai != ae; ++ai, ++j)
2349     if (shift > 0 && shift == j)
2350       Ops[j] = EmitNeonShiftVector(Ops[j], ai->getType(), rightshift);
2351     else
2352       Ops[j] = Builder.CreateBitCast(Ops[j], ai->getType(), name);
2353 
2354   return Builder.CreateCall(F, Ops, name);
2355 }
2356 
2357 Value *CodeGenFunction::EmitNeonShiftVector(Value *V, llvm::Type *Ty,
2358                                             bool neg) {
2359   int SV = cast<ConstantInt>(V)->getSExtValue();
2360   return ConstantInt::get(Ty, neg ? -SV : SV);
2361 }
2362 
2363 // \brief Right-shift a vector by a constant.
2364 Value *CodeGenFunction::EmitNeonRShiftImm(Value *Vec, Value *Shift,
2365                                           llvm::Type *Ty, bool usgn,
2366                                           const char *name) {
2367   llvm::VectorType *VTy = cast<llvm::VectorType>(Ty);
2368 
2369   int ShiftAmt = cast<ConstantInt>(Shift)->getSExtValue();
2370   int EltSize = VTy->getScalarSizeInBits();
2371 
2372   Vec = Builder.CreateBitCast(Vec, Ty);
2373 
2374   // lshr/ashr are undefined when the shift amount is equal to the vector
2375   // element size.
2376   if (ShiftAmt == EltSize) {
2377     if (usgn) {
2378       // Right-shifting an unsigned value by its size yields 0.
2379       return llvm::ConstantAggregateZero::get(VTy);
2380     } else {
2381       // Right-shifting a signed value by its size is equivalent
2382       // to a shift of size-1.
2383       --ShiftAmt;
2384       Shift = ConstantInt::get(VTy->getElementType(), ShiftAmt);
2385     }
2386   }
2387 
2388   Shift = EmitNeonShiftVector(Shift, Ty, false);
2389   if (usgn)
2390     return Builder.CreateLShr(Vec, Shift, name);
2391   else
2392     return Builder.CreateAShr(Vec, Shift, name);
2393 }
2394 
2395 enum {
2396   AddRetType = (1 << 0),
2397   Add1ArgType = (1 << 1),
2398   Add2ArgTypes = (1 << 2),
2399 
2400   VectorizeRetType = (1 << 3),
2401   VectorizeArgTypes = (1 << 4),
2402 
2403   InventFloatType = (1 << 5),
2404   UnsignedAlts = (1 << 6),
2405 
2406   Use64BitVectors = (1 << 7),
2407   Use128BitVectors = (1 << 8),
2408 
2409   Vectorize1ArgType = Add1ArgType | VectorizeArgTypes,
2410   VectorRet = AddRetType | VectorizeRetType,
2411   VectorRetGetArgs01 =
2412       AddRetType | Add2ArgTypes | VectorizeRetType | VectorizeArgTypes,
2413   FpCmpzModifiers =
2414       AddRetType | VectorizeRetType | Add1ArgType | InventFloatType
2415 };
2416 
2417 namespace {
2418 struct NeonIntrinsicInfo {
2419   const char *NameHint;
2420   unsigned BuiltinID;
2421   unsigned LLVMIntrinsic;
2422   unsigned AltLLVMIntrinsic;
2423   unsigned TypeModifier;
2424 
2425   bool operator<(unsigned RHSBuiltinID) const {
2426     return BuiltinID < RHSBuiltinID;
2427   }
2428   bool operator<(const NeonIntrinsicInfo &TE) const {
2429     return BuiltinID < TE.BuiltinID;
2430   }
2431 };
2432 } // end anonymous namespace
2433 
2434 #define NEONMAP0(NameBase) \
2435   { #NameBase, NEON::BI__builtin_neon_ ## NameBase, 0, 0, 0 }
2436 
2437 #define NEONMAP1(NameBase, LLVMIntrinsic, TypeModifier) \
2438   { #NameBase, NEON:: BI__builtin_neon_ ## NameBase, \
2439       Intrinsic::LLVMIntrinsic, 0, TypeModifier }
2440 
2441 #define NEONMAP2(NameBase, LLVMIntrinsic, AltLLVMIntrinsic, TypeModifier) \
2442   { #NameBase, NEON:: BI__builtin_neon_ ## NameBase, \
2443       Intrinsic::LLVMIntrinsic, Intrinsic::AltLLVMIntrinsic, \
2444       TypeModifier }
2445 
2446 static const NeonIntrinsicInfo ARMSIMDIntrinsicMap [] = {
2447   NEONMAP2(vabd_v, arm_neon_vabdu, arm_neon_vabds, Add1ArgType | UnsignedAlts),
2448   NEONMAP2(vabdq_v, arm_neon_vabdu, arm_neon_vabds, Add1ArgType | UnsignedAlts),
2449   NEONMAP1(vabs_v, arm_neon_vabs, 0),
2450   NEONMAP1(vabsq_v, arm_neon_vabs, 0),
2451   NEONMAP0(vaddhn_v),
2452   NEONMAP1(vaesdq_v, arm_neon_aesd, 0),
2453   NEONMAP1(vaeseq_v, arm_neon_aese, 0),
2454   NEONMAP1(vaesimcq_v, arm_neon_aesimc, 0),
2455   NEONMAP1(vaesmcq_v, arm_neon_aesmc, 0),
2456   NEONMAP1(vbsl_v, arm_neon_vbsl, AddRetType),
2457   NEONMAP1(vbslq_v, arm_neon_vbsl, AddRetType),
2458   NEONMAP1(vcage_v, arm_neon_vacge, 0),
2459   NEONMAP1(vcageq_v, arm_neon_vacge, 0),
2460   NEONMAP1(vcagt_v, arm_neon_vacgt, 0),
2461   NEONMAP1(vcagtq_v, arm_neon_vacgt, 0),
2462   NEONMAP1(vcale_v, arm_neon_vacge, 0),
2463   NEONMAP1(vcaleq_v, arm_neon_vacge, 0),
2464   NEONMAP1(vcalt_v, arm_neon_vacgt, 0),
2465   NEONMAP1(vcaltq_v, arm_neon_vacgt, 0),
2466   NEONMAP1(vcls_v, arm_neon_vcls, Add1ArgType),
2467   NEONMAP1(vclsq_v, arm_neon_vcls, Add1ArgType),
2468   NEONMAP1(vclz_v, ctlz, Add1ArgType),
2469   NEONMAP1(vclzq_v, ctlz, Add1ArgType),
2470   NEONMAP1(vcnt_v, ctpop, Add1ArgType),
2471   NEONMAP1(vcntq_v, ctpop, Add1ArgType),
2472   NEONMAP1(vcvt_f16_f32, arm_neon_vcvtfp2hf, 0),
2473   NEONMAP1(vcvt_f32_f16, arm_neon_vcvthf2fp, 0),
2474   NEONMAP0(vcvt_f32_v),
2475   NEONMAP2(vcvt_n_f32_v, arm_neon_vcvtfxu2fp, arm_neon_vcvtfxs2fp, 0),
2476   NEONMAP1(vcvt_n_s32_v, arm_neon_vcvtfp2fxs, 0),
2477   NEONMAP1(vcvt_n_s64_v, arm_neon_vcvtfp2fxs, 0),
2478   NEONMAP1(vcvt_n_u32_v, arm_neon_vcvtfp2fxu, 0),
2479   NEONMAP1(vcvt_n_u64_v, arm_neon_vcvtfp2fxu, 0),
2480   NEONMAP0(vcvt_s32_v),
2481   NEONMAP0(vcvt_s64_v),
2482   NEONMAP0(vcvt_u32_v),
2483   NEONMAP0(vcvt_u64_v),
2484   NEONMAP1(vcvta_s32_v, arm_neon_vcvtas, 0),
2485   NEONMAP1(vcvta_s64_v, arm_neon_vcvtas, 0),
2486   NEONMAP1(vcvta_u32_v, arm_neon_vcvtau, 0),
2487   NEONMAP1(vcvta_u64_v, arm_neon_vcvtau, 0),
2488   NEONMAP1(vcvtaq_s32_v, arm_neon_vcvtas, 0),
2489   NEONMAP1(vcvtaq_s64_v, arm_neon_vcvtas, 0),
2490   NEONMAP1(vcvtaq_u32_v, arm_neon_vcvtau, 0),
2491   NEONMAP1(vcvtaq_u64_v, arm_neon_vcvtau, 0),
2492   NEONMAP1(vcvtm_s32_v, arm_neon_vcvtms, 0),
2493   NEONMAP1(vcvtm_s64_v, arm_neon_vcvtms, 0),
2494   NEONMAP1(vcvtm_u32_v, arm_neon_vcvtmu, 0),
2495   NEONMAP1(vcvtm_u64_v, arm_neon_vcvtmu, 0),
2496   NEONMAP1(vcvtmq_s32_v, arm_neon_vcvtms, 0),
2497   NEONMAP1(vcvtmq_s64_v, arm_neon_vcvtms, 0),
2498   NEONMAP1(vcvtmq_u32_v, arm_neon_vcvtmu, 0),
2499   NEONMAP1(vcvtmq_u64_v, arm_neon_vcvtmu, 0),
2500   NEONMAP1(vcvtn_s32_v, arm_neon_vcvtns, 0),
2501   NEONMAP1(vcvtn_s64_v, arm_neon_vcvtns, 0),
2502   NEONMAP1(vcvtn_u32_v, arm_neon_vcvtnu, 0),
2503   NEONMAP1(vcvtn_u64_v, arm_neon_vcvtnu, 0),
2504   NEONMAP1(vcvtnq_s32_v, arm_neon_vcvtns, 0),
2505   NEONMAP1(vcvtnq_s64_v, arm_neon_vcvtns, 0),
2506   NEONMAP1(vcvtnq_u32_v, arm_neon_vcvtnu, 0),
2507   NEONMAP1(vcvtnq_u64_v, arm_neon_vcvtnu, 0),
2508   NEONMAP1(vcvtp_s32_v, arm_neon_vcvtps, 0),
2509   NEONMAP1(vcvtp_s64_v, arm_neon_vcvtps, 0),
2510   NEONMAP1(vcvtp_u32_v, arm_neon_vcvtpu, 0),
2511   NEONMAP1(vcvtp_u64_v, arm_neon_vcvtpu, 0),
2512   NEONMAP1(vcvtpq_s32_v, arm_neon_vcvtps, 0),
2513   NEONMAP1(vcvtpq_s64_v, arm_neon_vcvtps, 0),
2514   NEONMAP1(vcvtpq_u32_v, arm_neon_vcvtpu, 0),
2515   NEONMAP1(vcvtpq_u64_v, arm_neon_vcvtpu, 0),
2516   NEONMAP0(vcvtq_f32_v),
2517   NEONMAP2(vcvtq_n_f32_v, arm_neon_vcvtfxu2fp, arm_neon_vcvtfxs2fp, 0),
2518   NEONMAP1(vcvtq_n_s32_v, arm_neon_vcvtfp2fxs, 0),
2519   NEONMAP1(vcvtq_n_s64_v, arm_neon_vcvtfp2fxs, 0),
2520   NEONMAP1(vcvtq_n_u32_v, arm_neon_vcvtfp2fxu, 0),
2521   NEONMAP1(vcvtq_n_u64_v, arm_neon_vcvtfp2fxu, 0),
2522   NEONMAP0(vcvtq_s32_v),
2523   NEONMAP0(vcvtq_s64_v),
2524   NEONMAP0(vcvtq_u32_v),
2525   NEONMAP0(vcvtq_u64_v),
2526   NEONMAP0(vext_v),
2527   NEONMAP0(vextq_v),
2528   NEONMAP0(vfma_v),
2529   NEONMAP0(vfmaq_v),
2530   NEONMAP2(vhadd_v, arm_neon_vhaddu, arm_neon_vhadds, Add1ArgType | UnsignedAlts),
2531   NEONMAP2(vhaddq_v, arm_neon_vhaddu, arm_neon_vhadds, Add1ArgType | UnsignedAlts),
2532   NEONMAP2(vhsub_v, arm_neon_vhsubu, arm_neon_vhsubs, Add1ArgType | UnsignedAlts),
2533   NEONMAP2(vhsubq_v, arm_neon_vhsubu, arm_neon_vhsubs, Add1ArgType | UnsignedAlts),
2534   NEONMAP0(vld1_dup_v),
2535   NEONMAP1(vld1_v, arm_neon_vld1, 0),
2536   NEONMAP0(vld1q_dup_v),
2537   NEONMAP1(vld1q_v, arm_neon_vld1, 0),
2538   NEONMAP1(vld2_lane_v, arm_neon_vld2lane, 0),
2539   NEONMAP1(vld2_v, arm_neon_vld2, 0),
2540   NEONMAP1(vld2q_lane_v, arm_neon_vld2lane, 0),
2541   NEONMAP1(vld2q_v, arm_neon_vld2, 0),
2542   NEONMAP1(vld3_lane_v, arm_neon_vld3lane, 0),
2543   NEONMAP1(vld3_v, arm_neon_vld3, 0),
2544   NEONMAP1(vld3q_lane_v, arm_neon_vld3lane, 0),
2545   NEONMAP1(vld3q_v, arm_neon_vld3, 0),
2546   NEONMAP1(vld4_lane_v, arm_neon_vld4lane, 0),
2547   NEONMAP1(vld4_v, arm_neon_vld4, 0),
2548   NEONMAP1(vld4q_lane_v, arm_neon_vld4lane, 0),
2549   NEONMAP1(vld4q_v, arm_neon_vld4, 0),
2550   NEONMAP2(vmax_v, arm_neon_vmaxu, arm_neon_vmaxs, Add1ArgType | UnsignedAlts),
2551   NEONMAP1(vmaxnm_v, arm_neon_vmaxnm, Add1ArgType),
2552   NEONMAP1(vmaxnmq_v, arm_neon_vmaxnm, Add1ArgType),
2553   NEONMAP2(vmaxq_v, arm_neon_vmaxu, arm_neon_vmaxs, Add1ArgType | UnsignedAlts),
2554   NEONMAP2(vmin_v, arm_neon_vminu, arm_neon_vmins, Add1ArgType | UnsignedAlts),
2555   NEONMAP1(vminnm_v, arm_neon_vminnm, Add1ArgType),
2556   NEONMAP1(vminnmq_v, arm_neon_vminnm, Add1ArgType),
2557   NEONMAP2(vminq_v, arm_neon_vminu, arm_neon_vmins, Add1ArgType | UnsignedAlts),
2558   NEONMAP0(vmovl_v),
2559   NEONMAP0(vmovn_v),
2560   NEONMAP1(vmul_v, arm_neon_vmulp, Add1ArgType),
2561   NEONMAP0(vmull_v),
2562   NEONMAP1(vmulq_v, arm_neon_vmulp, Add1ArgType),
2563   NEONMAP2(vpadal_v, arm_neon_vpadalu, arm_neon_vpadals, UnsignedAlts),
2564   NEONMAP2(vpadalq_v, arm_neon_vpadalu, arm_neon_vpadals, UnsignedAlts),
2565   NEONMAP1(vpadd_v, arm_neon_vpadd, Add1ArgType),
2566   NEONMAP2(vpaddl_v, arm_neon_vpaddlu, arm_neon_vpaddls, UnsignedAlts),
2567   NEONMAP2(vpaddlq_v, arm_neon_vpaddlu, arm_neon_vpaddls, UnsignedAlts),
2568   NEONMAP1(vpaddq_v, arm_neon_vpadd, Add1ArgType),
2569   NEONMAP2(vpmax_v, arm_neon_vpmaxu, arm_neon_vpmaxs, Add1ArgType | UnsignedAlts),
2570   NEONMAP2(vpmin_v, arm_neon_vpminu, arm_neon_vpmins, Add1ArgType | UnsignedAlts),
2571   NEONMAP1(vqabs_v, arm_neon_vqabs, Add1ArgType),
2572   NEONMAP1(vqabsq_v, arm_neon_vqabs, Add1ArgType),
2573   NEONMAP2(vqadd_v, arm_neon_vqaddu, arm_neon_vqadds, Add1ArgType | UnsignedAlts),
2574   NEONMAP2(vqaddq_v, arm_neon_vqaddu, arm_neon_vqadds, Add1ArgType | UnsignedAlts),
2575   NEONMAP2(vqdmlal_v, arm_neon_vqdmull, arm_neon_vqadds, 0),
2576   NEONMAP2(vqdmlsl_v, arm_neon_vqdmull, arm_neon_vqsubs, 0),
2577   NEONMAP1(vqdmulh_v, arm_neon_vqdmulh, Add1ArgType),
2578   NEONMAP1(vqdmulhq_v, arm_neon_vqdmulh, Add1ArgType),
2579   NEONMAP1(vqdmull_v, arm_neon_vqdmull, Add1ArgType),
2580   NEONMAP2(vqmovn_v, arm_neon_vqmovnu, arm_neon_vqmovns, Add1ArgType | UnsignedAlts),
2581   NEONMAP1(vqmovun_v, arm_neon_vqmovnsu, Add1ArgType),
2582   NEONMAP1(vqneg_v, arm_neon_vqneg, Add1ArgType),
2583   NEONMAP1(vqnegq_v, arm_neon_vqneg, Add1ArgType),
2584   NEONMAP1(vqrdmulh_v, arm_neon_vqrdmulh, Add1ArgType),
2585   NEONMAP1(vqrdmulhq_v, arm_neon_vqrdmulh, Add1ArgType),
2586   NEONMAP2(vqrshl_v, arm_neon_vqrshiftu, arm_neon_vqrshifts, Add1ArgType | UnsignedAlts),
2587   NEONMAP2(vqrshlq_v, arm_neon_vqrshiftu, arm_neon_vqrshifts, Add1ArgType | UnsignedAlts),
2588   NEONMAP2(vqshl_n_v, arm_neon_vqshiftu, arm_neon_vqshifts, UnsignedAlts),
2589   NEONMAP2(vqshl_v, arm_neon_vqshiftu, arm_neon_vqshifts, Add1ArgType | UnsignedAlts),
2590   NEONMAP2(vqshlq_n_v, arm_neon_vqshiftu, arm_neon_vqshifts, UnsignedAlts),
2591   NEONMAP2(vqshlq_v, arm_neon_vqshiftu, arm_neon_vqshifts, Add1ArgType | UnsignedAlts),
2592   NEONMAP1(vqshlu_n_v, arm_neon_vqshiftsu, 0),
2593   NEONMAP1(vqshluq_n_v, arm_neon_vqshiftsu, 0),
2594   NEONMAP2(vqsub_v, arm_neon_vqsubu, arm_neon_vqsubs, Add1ArgType | UnsignedAlts),
2595   NEONMAP2(vqsubq_v, arm_neon_vqsubu, arm_neon_vqsubs, Add1ArgType | UnsignedAlts),
2596   NEONMAP1(vraddhn_v, arm_neon_vraddhn, Add1ArgType),
2597   NEONMAP2(vrecpe_v, arm_neon_vrecpe, arm_neon_vrecpe, 0),
2598   NEONMAP2(vrecpeq_v, arm_neon_vrecpe, arm_neon_vrecpe, 0),
2599   NEONMAP1(vrecps_v, arm_neon_vrecps, Add1ArgType),
2600   NEONMAP1(vrecpsq_v, arm_neon_vrecps, Add1ArgType),
2601   NEONMAP2(vrhadd_v, arm_neon_vrhaddu, arm_neon_vrhadds, Add1ArgType | UnsignedAlts),
2602   NEONMAP2(vrhaddq_v, arm_neon_vrhaddu, arm_neon_vrhadds, Add1ArgType | UnsignedAlts),
2603   NEONMAP1(vrnd_v, arm_neon_vrintz, Add1ArgType),
2604   NEONMAP1(vrnda_v, arm_neon_vrinta, Add1ArgType),
2605   NEONMAP1(vrndaq_v, arm_neon_vrinta, Add1ArgType),
2606   NEONMAP1(vrndm_v, arm_neon_vrintm, Add1ArgType),
2607   NEONMAP1(vrndmq_v, arm_neon_vrintm, Add1ArgType),
2608   NEONMAP1(vrndn_v, arm_neon_vrintn, Add1ArgType),
2609   NEONMAP1(vrndnq_v, arm_neon_vrintn, Add1ArgType),
2610   NEONMAP1(vrndp_v, arm_neon_vrintp, Add1ArgType),
2611   NEONMAP1(vrndpq_v, arm_neon_vrintp, Add1ArgType),
2612   NEONMAP1(vrndq_v, arm_neon_vrintz, Add1ArgType),
2613   NEONMAP1(vrndx_v, arm_neon_vrintx, Add1ArgType),
2614   NEONMAP1(vrndxq_v, arm_neon_vrintx, Add1ArgType),
2615   NEONMAP2(vrshl_v, arm_neon_vrshiftu, arm_neon_vrshifts, Add1ArgType | UnsignedAlts),
2616   NEONMAP2(vrshlq_v, arm_neon_vrshiftu, arm_neon_vrshifts, Add1ArgType | UnsignedAlts),
2617   NEONMAP2(vrshr_n_v, arm_neon_vrshiftu, arm_neon_vrshifts, UnsignedAlts),
2618   NEONMAP2(vrshrq_n_v, arm_neon_vrshiftu, arm_neon_vrshifts, UnsignedAlts),
2619   NEONMAP2(vrsqrte_v, arm_neon_vrsqrte, arm_neon_vrsqrte, 0),
2620   NEONMAP2(vrsqrteq_v, arm_neon_vrsqrte, arm_neon_vrsqrte, 0),
2621   NEONMAP1(vrsqrts_v, arm_neon_vrsqrts, Add1ArgType),
2622   NEONMAP1(vrsqrtsq_v, arm_neon_vrsqrts, Add1ArgType),
2623   NEONMAP1(vrsubhn_v, arm_neon_vrsubhn, Add1ArgType),
2624   NEONMAP1(vsha1su0q_v, arm_neon_sha1su0, 0),
2625   NEONMAP1(vsha1su1q_v, arm_neon_sha1su1, 0),
2626   NEONMAP1(vsha256h2q_v, arm_neon_sha256h2, 0),
2627   NEONMAP1(vsha256hq_v, arm_neon_sha256h, 0),
2628   NEONMAP1(vsha256su0q_v, arm_neon_sha256su0, 0),
2629   NEONMAP1(vsha256su1q_v, arm_neon_sha256su1, 0),
2630   NEONMAP0(vshl_n_v),
2631   NEONMAP2(vshl_v, arm_neon_vshiftu, arm_neon_vshifts, Add1ArgType | UnsignedAlts),
2632   NEONMAP0(vshll_n_v),
2633   NEONMAP0(vshlq_n_v),
2634   NEONMAP2(vshlq_v, arm_neon_vshiftu, arm_neon_vshifts, Add1ArgType | UnsignedAlts),
2635   NEONMAP0(vshr_n_v),
2636   NEONMAP0(vshrn_n_v),
2637   NEONMAP0(vshrq_n_v),
2638   NEONMAP1(vst1_v, arm_neon_vst1, 0),
2639   NEONMAP1(vst1q_v, arm_neon_vst1, 0),
2640   NEONMAP1(vst2_lane_v, arm_neon_vst2lane, 0),
2641   NEONMAP1(vst2_v, arm_neon_vst2, 0),
2642   NEONMAP1(vst2q_lane_v, arm_neon_vst2lane, 0),
2643   NEONMAP1(vst2q_v, arm_neon_vst2, 0),
2644   NEONMAP1(vst3_lane_v, arm_neon_vst3lane, 0),
2645   NEONMAP1(vst3_v, arm_neon_vst3, 0),
2646   NEONMAP1(vst3q_lane_v, arm_neon_vst3lane, 0),
2647   NEONMAP1(vst3q_v, arm_neon_vst3, 0),
2648   NEONMAP1(vst4_lane_v, arm_neon_vst4lane, 0),
2649   NEONMAP1(vst4_v, arm_neon_vst4, 0),
2650   NEONMAP1(vst4q_lane_v, arm_neon_vst4lane, 0),
2651   NEONMAP1(vst4q_v, arm_neon_vst4, 0),
2652   NEONMAP0(vsubhn_v),
2653   NEONMAP0(vtrn_v),
2654   NEONMAP0(vtrnq_v),
2655   NEONMAP0(vtst_v),
2656   NEONMAP0(vtstq_v),
2657   NEONMAP0(vuzp_v),
2658   NEONMAP0(vuzpq_v),
2659   NEONMAP0(vzip_v),
2660   NEONMAP0(vzipq_v)
2661 };
2662 
2663 static const NeonIntrinsicInfo AArch64SIMDIntrinsicMap[] = {
2664   NEONMAP1(vabs_v, aarch64_neon_abs, 0),
2665   NEONMAP1(vabsq_v, aarch64_neon_abs, 0),
2666   NEONMAP0(vaddhn_v),
2667   NEONMAP1(vaesdq_v, aarch64_crypto_aesd, 0),
2668   NEONMAP1(vaeseq_v, aarch64_crypto_aese, 0),
2669   NEONMAP1(vaesimcq_v, aarch64_crypto_aesimc, 0),
2670   NEONMAP1(vaesmcq_v, aarch64_crypto_aesmc, 0),
2671   NEONMAP1(vcage_v, aarch64_neon_facge, 0),
2672   NEONMAP1(vcageq_v, aarch64_neon_facge, 0),
2673   NEONMAP1(vcagt_v, aarch64_neon_facgt, 0),
2674   NEONMAP1(vcagtq_v, aarch64_neon_facgt, 0),
2675   NEONMAP1(vcale_v, aarch64_neon_facge, 0),
2676   NEONMAP1(vcaleq_v, aarch64_neon_facge, 0),
2677   NEONMAP1(vcalt_v, aarch64_neon_facgt, 0),
2678   NEONMAP1(vcaltq_v, aarch64_neon_facgt, 0),
2679   NEONMAP1(vcls_v, aarch64_neon_cls, Add1ArgType),
2680   NEONMAP1(vclsq_v, aarch64_neon_cls, Add1ArgType),
2681   NEONMAP1(vclz_v, ctlz, Add1ArgType),
2682   NEONMAP1(vclzq_v, ctlz, Add1ArgType),
2683   NEONMAP1(vcnt_v, ctpop, Add1ArgType),
2684   NEONMAP1(vcntq_v, ctpop, Add1ArgType),
2685   NEONMAP1(vcvt_f16_f32, aarch64_neon_vcvtfp2hf, 0),
2686   NEONMAP1(vcvt_f32_f16, aarch64_neon_vcvthf2fp, 0),
2687   NEONMAP0(vcvt_f32_v),
2688   NEONMAP2(vcvt_n_f32_v, aarch64_neon_vcvtfxu2fp, aarch64_neon_vcvtfxs2fp, 0),
2689   NEONMAP2(vcvt_n_f64_v, aarch64_neon_vcvtfxu2fp, aarch64_neon_vcvtfxs2fp, 0),
2690   NEONMAP1(vcvt_n_s32_v, aarch64_neon_vcvtfp2fxs, 0),
2691   NEONMAP1(vcvt_n_s64_v, aarch64_neon_vcvtfp2fxs, 0),
2692   NEONMAP1(vcvt_n_u32_v, aarch64_neon_vcvtfp2fxu, 0),
2693   NEONMAP1(vcvt_n_u64_v, aarch64_neon_vcvtfp2fxu, 0),
2694   NEONMAP0(vcvtq_f32_v),
2695   NEONMAP2(vcvtq_n_f32_v, aarch64_neon_vcvtfxu2fp, aarch64_neon_vcvtfxs2fp, 0),
2696   NEONMAP2(vcvtq_n_f64_v, aarch64_neon_vcvtfxu2fp, aarch64_neon_vcvtfxs2fp, 0),
2697   NEONMAP1(vcvtq_n_s32_v, aarch64_neon_vcvtfp2fxs, 0),
2698   NEONMAP1(vcvtq_n_s64_v, aarch64_neon_vcvtfp2fxs, 0),
2699   NEONMAP1(vcvtq_n_u32_v, aarch64_neon_vcvtfp2fxu, 0),
2700   NEONMAP1(vcvtq_n_u64_v, aarch64_neon_vcvtfp2fxu, 0),
2701   NEONMAP1(vcvtx_f32_v, aarch64_neon_fcvtxn, AddRetType | Add1ArgType),
2702   NEONMAP0(vext_v),
2703   NEONMAP0(vextq_v),
2704   NEONMAP0(vfma_v),
2705   NEONMAP0(vfmaq_v),
2706   NEONMAP2(vhadd_v, aarch64_neon_uhadd, aarch64_neon_shadd, Add1ArgType | UnsignedAlts),
2707   NEONMAP2(vhaddq_v, aarch64_neon_uhadd, aarch64_neon_shadd, Add1ArgType | UnsignedAlts),
2708   NEONMAP2(vhsub_v, aarch64_neon_uhsub, aarch64_neon_shsub, Add1ArgType | UnsignedAlts),
2709   NEONMAP2(vhsubq_v, aarch64_neon_uhsub, aarch64_neon_shsub, Add1ArgType | UnsignedAlts),
2710   NEONMAP0(vmovl_v),
2711   NEONMAP0(vmovn_v),
2712   NEONMAP1(vmul_v, aarch64_neon_pmul, Add1ArgType),
2713   NEONMAP1(vmulq_v, aarch64_neon_pmul, Add1ArgType),
2714   NEONMAP1(vpadd_v, aarch64_neon_addp, Add1ArgType),
2715   NEONMAP2(vpaddl_v, aarch64_neon_uaddlp, aarch64_neon_saddlp, UnsignedAlts),
2716   NEONMAP2(vpaddlq_v, aarch64_neon_uaddlp, aarch64_neon_saddlp, UnsignedAlts),
2717   NEONMAP1(vpaddq_v, aarch64_neon_addp, Add1ArgType),
2718   NEONMAP1(vqabs_v, aarch64_neon_sqabs, Add1ArgType),
2719   NEONMAP1(vqabsq_v, aarch64_neon_sqabs, Add1ArgType),
2720   NEONMAP2(vqadd_v, aarch64_neon_uqadd, aarch64_neon_sqadd, Add1ArgType | UnsignedAlts),
2721   NEONMAP2(vqaddq_v, aarch64_neon_uqadd, aarch64_neon_sqadd, Add1ArgType | UnsignedAlts),
2722   NEONMAP2(vqdmlal_v, aarch64_neon_sqdmull, aarch64_neon_sqadd, 0),
2723   NEONMAP2(vqdmlsl_v, aarch64_neon_sqdmull, aarch64_neon_sqsub, 0),
2724   NEONMAP1(vqdmulh_v, aarch64_neon_sqdmulh, Add1ArgType),
2725   NEONMAP1(vqdmulhq_v, aarch64_neon_sqdmulh, Add1ArgType),
2726   NEONMAP1(vqdmull_v, aarch64_neon_sqdmull, Add1ArgType),
2727   NEONMAP2(vqmovn_v, aarch64_neon_uqxtn, aarch64_neon_sqxtn, Add1ArgType | UnsignedAlts),
2728   NEONMAP1(vqmovun_v, aarch64_neon_sqxtun, Add1ArgType),
2729   NEONMAP1(vqneg_v, aarch64_neon_sqneg, Add1ArgType),
2730   NEONMAP1(vqnegq_v, aarch64_neon_sqneg, Add1ArgType),
2731   NEONMAP1(vqrdmulh_v, aarch64_neon_sqrdmulh, Add1ArgType),
2732   NEONMAP1(vqrdmulhq_v, aarch64_neon_sqrdmulh, Add1ArgType),
2733   NEONMAP2(vqrshl_v, aarch64_neon_uqrshl, aarch64_neon_sqrshl, Add1ArgType | UnsignedAlts),
2734   NEONMAP2(vqrshlq_v, aarch64_neon_uqrshl, aarch64_neon_sqrshl, Add1ArgType | UnsignedAlts),
2735   NEONMAP2(vqshl_n_v, aarch64_neon_uqshl, aarch64_neon_sqshl, UnsignedAlts),
2736   NEONMAP2(vqshl_v, aarch64_neon_uqshl, aarch64_neon_sqshl, Add1ArgType | UnsignedAlts),
2737   NEONMAP2(vqshlq_n_v, aarch64_neon_uqshl, aarch64_neon_sqshl,UnsignedAlts),
2738   NEONMAP2(vqshlq_v, aarch64_neon_uqshl, aarch64_neon_sqshl, Add1ArgType | UnsignedAlts),
2739   NEONMAP1(vqshlu_n_v, aarch64_neon_sqshlu, 0),
2740   NEONMAP1(vqshluq_n_v, aarch64_neon_sqshlu, 0),
2741   NEONMAP2(vqsub_v, aarch64_neon_uqsub, aarch64_neon_sqsub, Add1ArgType | UnsignedAlts),
2742   NEONMAP2(vqsubq_v, aarch64_neon_uqsub, aarch64_neon_sqsub, Add1ArgType | UnsignedAlts),
2743   NEONMAP1(vraddhn_v, aarch64_neon_raddhn, Add1ArgType),
2744   NEONMAP2(vrecpe_v, aarch64_neon_frecpe, aarch64_neon_urecpe, 0),
2745   NEONMAP2(vrecpeq_v, aarch64_neon_frecpe, aarch64_neon_urecpe, 0),
2746   NEONMAP1(vrecps_v, aarch64_neon_frecps, Add1ArgType),
2747   NEONMAP1(vrecpsq_v, aarch64_neon_frecps, Add1ArgType),
2748   NEONMAP2(vrhadd_v, aarch64_neon_urhadd, aarch64_neon_srhadd, Add1ArgType | UnsignedAlts),
2749   NEONMAP2(vrhaddq_v, aarch64_neon_urhadd, aarch64_neon_srhadd, Add1ArgType | UnsignedAlts),
2750   NEONMAP2(vrshl_v, aarch64_neon_urshl, aarch64_neon_srshl, Add1ArgType | UnsignedAlts),
2751   NEONMAP2(vrshlq_v, aarch64_neon_urshl, aarch64_neon_srshl, Add1ArgType | UnsignedAlts),
2752   NEONMAP2(vrshr_n_v, aarch64_neon_urshl, aarch64_neon_srshl, UnsignedAlts),
2753   NEONMAP2(vrshrq_n_v, aarch64_neon_urshl, aarch64_neon_srshl, UnsignedAlts),
2754   NEONMAP2(vrsqrte_v, aarch64_neon_frsqrte, aarch64_neon_ursqrte, 0),
2755   NEONMAP2(vrsqrteq_v, aarch64_neon_frsqrte, aarch64_neon_ursqrte, 0),
2756   NEONMAP1(vrsqrts_v, aarch64_neon_frsqrts, Add1ArgType),
2757   NEONMAP1(vrsqrtsq_v, aarch64_neon_frsqrts, Add1ArgType),
2758   NEONMAP1(vrsubhn_v, aarch64_neon_rsubhn, Add1ArgType),
2759   NEONMAP1(vsha1su0q_v, aarch64_crypto_sha1su0, 0),
2760   NEONMAP1(vsha1su1q_v, aarch64_crypto_sha1su1, 0),
2761   NEONMAP1(vsha256h2q_v, aarch64_crypto_sha256h2, 0),
2762   NEONMAP1(vsha256hq_v, aarch64_crypto_sha256h, 0),
2763   NEONMAP1(vsha256su0q_v, aarch64_crypto_sha256su0, 0),
2764   NEONMAP1(vsha256su1q_v, aarch64_crypto_sha256su1, 0),
2765   NEONMAP0(vshl_n_v),
2766   NEONMAP2(vshl_v, aarch64_neon_ushl, aarch64_neon_sshl, Add1ArgType | UnsignedAlts),
2767   NEONMAP0(vshll_n_v),
2768   NEONMAP0(vshlq_n_v),
2769   NEONMAP2(vshlq_v, aarch64_neon_ushl, aarch64_neon_sshl, Add1ArgType | UnsignedAlts),
2770   NEONMAP0(vshr_n_v),
2771   NEONMAP0(vshrn_n_v),
2772   NEONMAP0(vshrq_n_v),
2773   NEONMAP0(vsubhn_v),
2774   NEONMAP0(vtst_v),
2775   NEONMAP0(vtstq_v),
2776 };
2777 
2778 static const NeonIntrinsicInfo AArch64SISDIntrinsicMap[] = {
2779   NEONMAP1(vabdd_f64, aarch64_sisd_fabd, Add1ArgType),
2780   NEONMAP1(vabds_f32, aarch64_sisd_fabd, Add1ArgType),
2781   NEONMAP1(vabsd_s64, aarch64_neon_abs, Add1ArgType),
2782   NEONMAP1(vaddlv_s32, aarch64_neon_saddlv, AddRetType | Add1ArgType),
2783   NEONMAP1(vaddlv_u32, aarch64_neon_uaddlv, AddRetType | Add1ArgType),
2784   NEONMAP1(vaddlvq_s32, aarch64_neon_saddlv, AddRetType | Add1ArgType),
2785   NEONMAP1(vaddlvq_u32, aarch64_neon_uaddlv, AddRetType | Add1ArgType),
2786   NEONMAP1(vaddv_f32, aarch64_neon_faddv, AddRetType | Add1ArgType),
2787   NEONMAP1(vaddv_s32, aarch64_neon_saddv, AddRetType | Add1ArgType),
2788   NEONMAP1(vaddv_u32, aarch64_neon_uaddv, AddRetType | Add1ArgType),
2789   NEONMAP1(vaddvq_f32, aarch64_neon_faddv, AddRetType | Add1ArgType),
2790   NEONMAP1(vaddvq_f64, aarch64_neon_faddv, AddRetType | Add1ArgType),
2791   NEONMAP1(vaddvq_s32, aarch64_neon_saddv, AddRetType | Add1ArgType),
2792   NEONMAP1(vaddvq_s64, aarch64_neon_saddv, AddRetType | Add1ArgType),
2793   NEONMAP1(vaddvq_u32, aarch64_neon_uaddv, AddRetType | Add1ArgType),
2794   NEONMAP1(vaddvq_u64, aarch64_neon_uaddv, AddRetType | Add1ArgType),
2795   NEONMAP1(vcaged_f64, aarch64_neon_facge, AddRetType | Add1ArgType),
2796   NEONMAP1(vcages_f32, aarch64_neon_facge, AddRetType | Add1ArgType),
2797   NEONMAP1(vcagtd_f64, aarch64_neon_facgt, AddRetType | Add1ArgType),
2798   NEONMAP1(vcagts_f32, aarch64_neon_facgt, AddRetType | Add1ArgType),
2799   NEONMAP1(vcaled_f64, aarch64_neon_facge, AddRetType | Add1ArgType),
2800   NEONMAP1(vcales_f32, aarch64_neon_facge, AddRetType | Add1ArgType),
2801   NEONMAP1(vcaltd_f64, aarch64_neon_facgt, AddRetType | Add1ArgType),
2802   NEONMAP1(vcalts_f32, aarch64_neon_facgt, AddRetType | Add1ArgType),
2803   NEONMAP1(vcvtad_s64_f64, aarch64_neon_fcvtas, AddRetType | Add1ArgType),
2804   NEONMAP1(vcvtad_u64_f64, aarch64_neon_fcvtau, AddRetType | Add1ArgType),
2805   NEONMAP1(vcvtas_s32_f32, aarch64_neon_fcvtas, AddRetType | Add1ArgType),
2806   NEONMAP1(vcvtas_u32_f32, aarch64_neon_fcvtau, AddRetType | Add1ArgType),
2807   NEONMAP1(vcvtd_n_f64_s64, aarch64_neon_vcvtfxs2fp, AddRetType | Add1ArgType),
2808   NEONMAP1(vcvtd_n_f64_u64, aarch64_neon_vcvtfxu2fp, AddRetType | Add1ArgType),
2809   NEONMAP1(vcvtd_n_s64_f64, aarch64_neon_vcvtfp2fxs, AddRetType | Add1ArgType),
2810   NEONMAP1(vcvtd_n_u64_f64, aarch64_neon_vcvtfp2fxu, AddRetType | Add1ArgType),
2811   NEONMAP1(vcvtmd_s64_f64, aarch64_neon_fcvtms, AddRetType | Add1ArgType),
2812   NEONMAP1(vcvtmd_u64_f64, aarch64_neon_fcvtmu, AddRetType | Add1ArgType),
2813   NEONMAP1(vcvtms_s32_f32, aarch64_neon_fcvtms, AddRetType | Add1ArgType),
2814   NEONMAP1(vcvtms_u32_f32, aarch64_neon_fcvtmu, AddRetType | Add1ArgType),
2815   NEONMAP1(vcvtnd_s64_f64, aarch64_neon_fcvtns, AddRetType | Add1ArgType),
2816   NEONMAP1(vcvtnd_u64_f64, aarch64_neon_fcvtnu, AddRetType | Add1ArgType),
2817   NEONMAP1(vcvtns_s32_f32, aarch64_neon_fcvtns, AddRetType | Add1ArgType),
2818   NEONMAP1(vcvtns_u32_f32, aarch64_neon_fcvtnu, AddRetType | Add1ArgType),
2819   NEONMAP1(vcvtpd_s64_f64, aarch64_neon_fcvtps, AddRetType | Add1ArgType),
2820   NEONMAP1(vcvtpd_u64_f64, aarch64_neon_fcvtpu, AddRetType | Add1ArgType),
2821   NEONMAP1(vcvtps_s32_f32, aarch64_neon_fcvtps, AddRetType | Add1ArgType),
2822   NEONMAP1(vcvtps_u32_f32, aarch64_neon_fcvtpu, AddRetType | Add1ArgType),
2823   NEONMAP1(vcvts_n_f32_s32, aarch64_neon_vcvtfxs2fp, AddRetType | Add1ArgType),
2824   NEONMAP1(vcvts_n_f32_u32, aarch64_neon_vcvtfxu2fp, AddRetType | Add1ArgType),
2825   NEONMAP1(vcvts_n_s32_f32, aarch64_neon_vcvtfp2fxs, AddRetType | Add1ArgType),
2826   NEONMAP1(vcvts_n_u32_f32, aarch64_neon_vcvtfp2fxu, AddRetType | Add1ArgType),
2827   NEONMAP1(vcvtxd_f32_f64, aarch64_sisd_fcvtxn, 0),
2828   NEONMAP1(vmaxnmv_f32, aarch64_neon_fmaxnmv, AddRetType | Add1ArgType),
2829   NEONMAP1(vmaxnmvq_f32, aarch64_neon_fmaxnmv, AddRetType | Add1ArgType),
2830   NEONMAP1(vmaxnmvq_f64, aarch64_neon_fmaxnmv, AddRetType | Add1ArgType),
2831   NEONMAP1(vmaxv_f32, aarch64_neon_fmaxv, AddRetType | Add1ArgType),
2832   NEONMAP1(vmaxv_s32, aarch64_neon_smaxv, AddRetType | Add1ArgType),
2833   NEONMAP1(vmaxv_u32, aarch64_neon_umaxv, AddRetType | Add1ArgType),
2834   NEONMAP1(vmaxvq_f32, aarch64_neon_fmaxv, AddRetType | Add1ArgType),
2835   NEONMAP1(vmaxvq_f64, aarch64_neon_fmaxv, AddRetType | Add1ArgType),
2836   NEONMAP1(vmaxvq_s32, aarch64_neon_smaxv, AddRetType | Add1ArgType),
2837   NEONMAP1(vmaxvq_u32, aarch64_neon_umaxv, AddRetType | Add1ArgType),
2838   NEONMAP1(vminnmv_f32, aarch64_neon_fminnmv, AddRetType | Add1ArgType),
2839   NEONMAP1(vminnmvq_f32, aarch64_neon_fminnmv, AddRetType | Add1ArgType),
2840   NEONMAP1(vminnmvq_f64, aarch64_neon_fminnmv, AddRetType | Add1ArgType),
2841   NEONMAP1(vminv_f32, aarch64_neon_fminv, AddRetType | Add1ArgType),
2842   NEONMAP1(vminv_s32, aarch64_neon_sminv, AddRetType | Add1ArgType),
2843   NEONMAP1(vminv_u32, aarch64_neon_uminv, AddRetType | Add1ArgType),
2844   NEONMAP1(vminvq_f32, aarch64_neon_fminv, AddRetType | Add1ArgType),
2845   NEONMAP1(vminvq_f64, aarch64_neon_fminv, AddRetType | Add1ArgType),
2846   NEONMAP1(vminvq_s32, aarch64_neon_sminv, AddRetType | Add1ArgType),
2847   NEONMAP1(vminvq_u32, aarch64_neon_uminv, AddRetType | Add1ArgType),
2848   NEONMAP1(vmull_p64, aarch64_neon_pmull64, 0),
2849   NEONMAP1(vmulxd_f64, aarch64_neon_fmulx, Add1ArgType),
2850   NEONMAP1(vmulxs_f32, aarch64_neon_fmulx, Add1ArgType),
2851   NEONMAP1(vpaddd_s64, aarch64_neon_uaddv, AddRetType | Add1ArgType),
2852   NEONMAP1(vpaddd_u64, aarch64_neon_uaddv, AddRetType | Add1ArgType),
2853   NEONMAP1(vpmaxnmqd_f64, aarch64_neon_fmaxnmv, AddRetType | Add1ArgType),
2854   NEONMAP1(vpmaxnms_f32, aarch64_neon_fmaxnmv, AddRetType | Add1ArgType),
2855   NEONMAP1(vpmaxqd_f64, aarch64_neon_fmaxv, AddRetType | Add1ArgType),
2856   NEONMAP1(vpmaxs_f32, aarch64_neon_fmaxv, AddRetType | Add1ArgType),
2857   NEONMAP1(vpminnmqd_f64, aarch64_neon_fminnmv, AddRetType | Add1ArgType),
2858   NEONMAP1(vpminnms_f32, aarch64_neon_fminnmv, AddRetType | Add1ArgType),
2859   NEONMAP1(vpminqd_f64, aarch64_neon_fminv, AddRetType | Add1ArgType),
2860   NEONMAP1(vpmins_f32, aarch64_neon_fminv, AddRetType | Add1ArgType),
2861   NEONMAP1(vqabsb_s8, aarch64_neon_sqabs, Vectorize1ArgType | Use64BitVectors),
2862   NEONMAP1(vqabsd_s64, aarch64_neon_sqabs, Add1ArgType),
2863   NEONMAP1(vqabsh_s16, aarch64_neon_sqabs, Vectorize1ArgType | Use64BitVectors),
2864   NEONMAP1(vqabss_s32, aarch64_neon_sqabs, Add1ArgType),
2865   NEONMAP1(vqaddb_s8, aarch64_neon_sqadd, Vectorize1ArgType | Use64BitVectors),
2866   NEONMAP1(vqaddb_u8, aarch64_neon_uqadd, Vectorize1ArgType | Use64BitVectors),
2867   NEONMAP1(vqaddd_s64, aarch64_neon_sqadd, Add1ArgType),
2868   NEONMAP1(vqaddd_u64, aarch64_neon_uqadd, Add1ArgType),
2869   NEONMAP1(vqaddh_s16, aarch64_neon_sqadd, Vectorize1ArgType | Use64BitVectors),
2870   NEONMAP1(vqaddh_u16, aarch64_neon_uqadd, Vectorize1ArgType | Use64BitVectors),
2871   NEONMAP1(vqadds_s32, aarch64_neon_sqadd, Add1ArgType),
2872   NEONMAP1(vqadds_u32, aarch64_neon_uqadd, Add1ArgType),
2873   NEONMAP1(vqdmulhh_s16, aarch64_neon_sqdmulh, Vectorize1ArgType | Use64BitVectors),
2874   NEONMAP1(vqdmulhs_s32, aarch64_neon_sqdmulh, Add1ArgType),
2875   NEONMAP1(vqdmullh_s16, aarch64_neon_sqdmull, VectorRet | Use128BitVectors),
2876   NEONMAP1(vqdmulls_s32, aarch64_neon_sqdmulls_scalar, 0),
2877   NEONMAP1(vqmovnd_s64, aarch64_neon_scalar_sqxtn, AddRetType | Add1ArgType),
2878   NEONMAP1(vqmovnd_u64, aarch64_neon_scalar_uqxtn, AddRetType | Add1ArgType),
2879   NEONMAP1(vqmovnh_s16, aarch64_neon_sqxtn, VectorRet | Use64BitVectors),
2880   NEONMAP1(vqmovnh_u16, aarch64_neon_uqxtn, VectorRet | Use64BitVectors),
2881   NEONMAP1(vqmovns_s32, aarch64_neon_sqxtn, VectorRet | Use64BitVectors),
2882   NEONMAP1(vqmovns_u32, aarch64_neon_uqxtn, VectorRet | Use64BitVectors),
2883   NEONMAP1(vqmovund_s64, aarch64_neon_scalar_sqxtun, AddRetType | Add1ArgType),
2884   NEONMAP1(vqmovunh_s16, aarch64_neon_sqxtun, VectorRet | Use64BitVectors),
2885   NEONMAP1(vqmovuns_s32, aarch64_neon_sqxtun, VectorRet | Use64BitVectors),
2886   NEONMAP1(vqnegb_s8, aarch64_neon_sqneg, Vectorize1ArgType | Use64BitVectors),
2887   NEONMAP1(vqnegd_s64, aarch64_neon_sqneg, Add1ArgType),
2888   NEONMAP1(vqnegh_s16, aarch64_neon_sqneg, Vectorize1ArgType | Use64BitVectors),
2889   NEONMAP1(vqnegs_s32, aarch64_neon_sqneg, Add1ArgType),
2890   NEONMAP1(vqrdmulhh_s16, aarch64_neon_sqrdmulh, Vectorize1ArgType | Use64BitVectors),
2891   NEONMAP1(vqrdmulhs_s32, aarch64_neon_sqrdmulh, Add1ArgType),
2892   NEONMAP1(vqrshlb_s8, aarch64_neon_sqrshl, Vectorize1ArgType | Use64BitVectors),
2893   NEONMAP1(vqrshlb_u8, aarch64_neon_uqrshl, Vectorize1ArgType | Use64BitVectors),
2894   NEONMAP1(vqrshld_s64, aarch64_neon_sqrshl, Add1ArgType),
2895   NEONMAP1(vqrshld_u64, aarch64_neon_uqrshl, Add1ArgType),
2896   NEONMAP1(vqrshlh_s16, aarch64_neon_sqrshl, Vectorize1ArgType | Use64BitVectors),
2897   NEONMAP1(vqrshlh_u16, aarch64_neon_uqrshl, Vectorize1ArgType | Use64BitVectors),
2898   NEONMAP1(vqrshls_s32, aarch64_neon_sqrshl, Add1ArgType),
2899   NEONMAP1(vqrshls_u32, aarch64_neon_uqrshl, Add1ArgType),
2900   NEONMAP1(vqrshrnd_n_s64, aarch64_neon_sqrshrn, AddRetType),
2901   NEONMAP1(vqrshrnd_n_u64, aarch64_neon_uqrshrn, AddRetType),
2902   NEONMAP1(vqrshrnh_n_s16, aarch64_neon_sqrshrn, VectorRet | Use64BitVectors),
2903   NEONMAP1(vqrshrnh_n_u16, aarch64_neon_uqrshrn, VectorRet | Use64BitVectors),
2904   NEONMAP1(vqrshrns_n_s32, aarch64_neon_sqrshrn, VectorRet | Use64BitVectors),
2905   NEONMAP1(vqrshrns_n_u32, aarch64_neon_uqrshrn, VectorRet | Use64BitVectors),
2906   NEONMAP1(vqrshrund_n_s64, aarch64_neon_sqrshrun, AddRetType),
2907   NEONMAP1(vqrshrunh_n_s16, aarch64_neon_sqrshrun, VectorRet | Use64BitVectors),
2908   NEONMAP1(vqrshruns_n_s32, aarch64_neon_sqrshrun, VectorRet | Use64BitVectors),
2909   NEONMAP1(vqshlb_n_s8, aarch64_neon_sqshl, Vectorize1ArgType | Use64BitVectors),
2910   NEONMAP1(vqshlb_n_u8, aarch64_neon_uqshl, Vectorize1ArgType | Use64BitVectors),
2911   NEONMAP1(vqshlb_s8, aarch64_neon_sqshl, Vectorize1ArgType | Use64BitVectors),
2912   NEONMAP1(vqshlb_u8, aarch64_neon_uqshl, Vectorize1ArgType | Use64BitVectors),
2913   NEONMAP1(vqshld_s64, aarch64_neon_sqshl, Add1ArgType),
2914   NEONMAP1(vqshld_u64, aarch64_neon_uqshl, Add1ArgType),
2915   NEONMAP1(vqshlh_n_s16, aarch64_neon_sqshl, Vectorize1ArgType | Use64BitVectors),
2916   NEONMAP1(vqshlh_n_u16, aarch64_neon_uqshl, Vectorize1ArgType | Use64BitVectors),
2917   NEONMAP1(vqshlh_s16, aarch64_neon_sqshl, Vectorize1ArgType | Use64BitVectors),
2918   NEONMAP1(vqshlh_u16, aarch64_neon_uqshl, Vectorize1ArgType | Use64BitVectors),
2919   NEONMAP1(vqshls_n_s32, aarch64_neon_sqshl, Add1ArgType),
2920   NEONMAP1(vqshls_n_u32, aarch64_neon_uqshl, Add1ArgType),
2921   NEONMAP1(vqshls_s32, aarch64_neon_sqshl, Add1ArgType),
2922   NEONMAP1(vqshls_u32, aarch64_neon_uqshl, Add1ArgType),
2923   NEONMAP1(vqshlub_n_s8, aarch64_neon_sqshlu, Vectorize1ArgType | Use64BitVectors),
2924   NEONMAP1(vqshluh_n_s16, aarch64_neon_sqshlu, Vectorize1ArgType | Use64BitVectors),
2925   NEONMAP1(vqshlus_n_s32, aarch64_neon_sqshlu, Add1ArgType),
2926   NEONMAP1(vqshrnd_n_s64, aarch64_neon_sqshrn, AddRetType),
2927   NEONMAP1(vqshrnd_n_u64, aarch64_neon_uqshrn, AddRetType),
2928   NEONMAP1(vqshrnh_n_s16, aarch64_neon_sqshrn, VectorRet | Use64BitVectors),
2929   NEONMAP1(vqshrnh_n_u16, aarch64_neon_uqshrn, VectorRet | Use64BitVectors),
2930   NEONMAP1(vqshrns_n_s32, aarch64_neon_sqshrn, VectorRet | Use64BitVectors),
2931   NEONMAP1(vqshrns_n_u32, aarch64_neon_uqshrn, VectorRet | Use64BitVectors),
2932   NEONMAP1(vqshrund_n_s64, aarch64_neon_sqshrun, AddRetType),
2933   NEONMAP1(vqshrunh_n_s16, aarch64_neon_sqshrun, VectorRet | Use64BitVectors),
2934   NEONMAP1(vqshruns_n_s32, aarch64_neon_sqshrun, VectorRet | Use64BitVectors),
2935   NEONMAP1(vqsubb_s8, aarch64_neon_sqsub, Vectorize1ArgType | Use64BitVectors),
2936   NEONMAP1(vqsubb_u8, aarch64_neon_uqsub, Vectorize1ArgType | Use64BitVectors),
2937   NEONMAP1(vqsubd_s64, aarch64_neon_sqsub, Add1ArgType),
2938   NEONMAP1(vqsubd_u64, aarch64_neon_uqsub, Add1ArgType),
2939   NEONMAP1(vqsubh_s16, aarch64_neon_sqsub, Vectorize1ArgType | Use64BitVectors),
2940   NEONMAP1(vqsubh_u16, aarch64_neon_uqsub, Vectorize1ArgType | Use64BitVectors),
2941   NEONMAP1(vqsubs_s32, aarch64_neon_sqsub, Add1ArgType),
2942   NEONMAP1(vqsubs_u32, aarch64_neon_uqsub, Add1ArgType),
2943   NEONMAP1(vrecped_f64, aarch64_neon_frecpe, Add1ArgType),
2944   NEONMAP1(vrecpes_f32, aarch64_neon_frecpe, Add1ArgType),
2945   NEONMAP1(vrecpxd_f64, aarch64_neon_frecpx, Add1ArgType),
2946   NEONMAP1(vrecpxs_f32, aarch64_neon_frecpx, Add1ArgType),
2947   NEONMAP1(vrshld_s64, aarch64_neon_srshl, Add1ArgType),
2948   NEONMAP1(vrshld_u64, aarch64_neon_urshl, Add1ArgType),
2949   NEONMAP1(vrsqrted_f64, aarch64_neon_frsqrte, Add1ArgType),
2950   NEONMAP1(vrsqrtes_f32, aarch64_neon_frsqrte, Add1ArgType),
2951   NEONMAP1(vrsqrtsd_f64, aarch64_neon_frsqrts, Add1ArgType),
2952   NEONMAP1(vrsqrtss_f32, aarch64_neon_frsqrts, Add1ArgType),
2953   NEONMAP1(vsha1cq_u32, aarch64_crypto_sha1c, 0),
2954   NEONMAP1(vsha1h_u32, aarch64_crypto_sha1h, 0),
2955   NEONMAP1(vsha1mq_u32, aarch64_crypto_sha1m, 0),
2956   NEONMAP1(vsha1pq_u32, aarch64_crypto_sha1p, 0),
2957   NEONMAP1(vshld_s64, aarch64_neon_sshl, Add1ArgType),
2958   NEONMAP1(vshld_u64, aarch64_neon_ushl, Add1ArgType),
2959   NEONMAP1(vslid_n_s64, aarch64_neon_vsli, Vectorize1ArgType),
2960   NEONMAP1(vslid_n_u64, aarch64_neon_vsli, Vectorize1ArgType),
2961   NEONMAP1(vsqaddb_u8, aarch64_neon_usqadd, Vectorize1ArgType | Use64BitVectors),
2962   NEONMAP1(vsqaddd_u64, aarch64_neon_usqadd, Add1ArgType),
2963   NEONMAP1(vsqaddh_u16, aarch64_neon_usqadd, Vectorize1ArgType | Use64BitVectors),
2964   NEONMAP1(vsqadds_u32, aarch64_neon_usqadd, Add1ArgType),
2965   NEONMAP1(vsrid_n_s64, aarch64_neon_vsri, Vectorize1ArgType),
2966   NEONMAP1(vsrid_n_u64, aarch64_neon_vsri, Vectorize1ArgType),
2967   NEONMAP1(vuqaddb_s8, aarch64_neon_suqadd, Vectorize1ArgType | Use64BitVectors),
2968   NEONMAP1(vuqaddd_s64, aarch64_neon_suqadd, Add1ArgType),
2969   NEONMAP1(vuqaddh_s16, aarch64_neon_suqadd, Vectorize1ArgType | Use64BitVectors),
2970   NEONMAP1(vuqadds_s32, aarch64_neon_suqadd, Add1ArgType),
2971 };
2972 
2973 #undef NEONMAP0
2974 #undef NEONMAP1
2975 #undef NEONMAP2
2976 
2977 static bool NEONSIMDIntrinsicsProvenSorted = false;
2978 
2979 static bool AArch64SIMDIntrinsicsProvenSorted = false;
2980 static bool AArch64SISDIntrinsicsProvenSorted = false;
2981 
2982 
2983 static const NeonIntrinsicInfo *
2984 findNeonIntrinsicInMap(ArrayRef<NeonIntrinsicInfo> IntrinsicMap,
2985                        unsigned BuiltinID, bool &MapProvenSorted) {
2986 
2987 #ifndef NDEBUG
2988   if (!MapProvenSorted) {
2989     assert(std::is_sorted(std::begin(IntrinsicMap), std::end(IntrinsicMap)));
2990     MapProvenSorted = true;
2991   }
2992 #endif
2993 
2994   const NeonIntrinsicInfo *Builtin =
2995       std::lower_bound(IntrinsicMap.begin(), IntrinsicMap.end(), BuiltinID);
2996 
2997   if (Builtin != IntrinsicMap.end() && Builtin->BuiltinID == BuiltinID)
2998     return Builtin;
2999 
3000   return nullptr;
3001 }
3002 
3003 Function *CodeGenFunction::LookupNeonLLVMIntrinsic(unsigned IntrinsicID,
3004                                                    unsigned Modifier,
3005                                                    llvm::Type *ArgType,
3006                                                    const CallExpr *E) {
3007   int VectorSize = 0;
3008   if (Modifier & Use64BitVectors)
3009     VectorSize = 64;
3010   else if (Modifier & Use128BitVectors)
3011     VectorSize = 128;
3012 
3013   // Return type.
3014   SmallVector<llvm::Type *, 3> Tys;
3015   if (Modifier & AddRetType) {
3016     llvm::Type *Ty = ConvertType(E->getCallReturnType(getContext()));
3017     if (Modifier & VectorizeRetType)
3018       Ty = llvm::VectorType::get(
3019           Ty, VectorSize ? VectorSize / Ty->getPrimitiveSizeInBits() : 1);
3020 
3021     Tys.push_back(Ty);
3022   }
3023 
3024   // Arguments.
3025   if (Modifier & VectorizeArgTypes) {
3026     int Elts = VectorSize ? VectorSize / ArgType->getPrimitiveSizeInBits() : 1;
3027     ArgType = llvm::VectorType::get(ArgType, Elts);
3028   }
3029 
3030   if (Modifier & (Add1ArgType | Add2ArgTypes))
3031     Tys.push_back(ArgType);
3032 
3033   if (Modifier & Add2ArgTypes)
3034     Tys.push_back(ArgType);
3035 
3036   if (Modifier & InventFloatType)
3037     Tys.push_back(FloatTy);
3038 
3039   return CGM.getIntrinsic(IntrinsicID, Tys);
3040 }
3041 
3042 static Value *EmitCommonNeonSISDBuiltinExpr(CodeGenFunction &CGF,
3043                                             const NeonIntrinsicInfo &SISDInfo,
3044                                             SmallVectorImpl<Value *> &Ops,
3045                                             const CallExpr *E) {
3046   unsigned BuiltinID = SISDInfo.BuiltinID;
3047   unsigned int Int = SISDInfo.LLVMIntrinsic;
3048   unsigned Modifier = SISDInfo.TypeModifier;
3049   const char *s = SISDInfo.NameHint;
3050 
3051   switch (BuiltinID) {
3052   case NEON::BI__builtin_neon_vcled_s64:
3053   case NEON::BI__builtin_neon_vcled_u64:
3054   case NEON::BI__builtin_neon_vcles_f32:
3055   case NEON::BI__builtin_neon_vcled_f64:
3056   case NEON::BI__builtin_neon_vcltd_s64:
3057   case NEON::BI__builtin_neon_vcltd_u64:
3058   case NEON::BI__builtin_neon_vclts_f32:
3059   case NEON::BI__builtin_neon_vcltd_f64:
3060   case NEON::BI__builtin_neon_vcales_f32:
3061   case NEON::BI__builtin_neon_vcaled_f64:
3062   case NEON::BI__builtin_neon_vcalts_f32:
3063   case NEON::BI__builtin_neon_vcaltd_f64:
3064     // Only one direction of comparisons actually exist, cmle is actually a cmge
3065     // with swapped operands. The table gives us the right intrinsic but we
3066     // still need to do the swap.
3067     std::swap(Ops[0], Ops[1]);
3068     break;
3069   }
3070 
3071   assert(Int && "Generic code assumes a valid intrinsic");
3072 
3073   // Determine the type(s) of this overloaded AArch64 intrinsic.
3074   const Expr *Arg = E->getArg(0);
3075   llvm::Type *ArgTy = CGF.ConvertType(Arg->getType());
3076   Function *F = CGF.LookupNeonLLVMIntrinsic(Int, Modifier, ArgTy, E);
3077 
3078   int j = 0;
3079   ConstantInt *C0 = ConstantInt::get(CGF.SizeTy, 0);
3080   for (Function::const_arg_iterator ai = F->arg_begin(), ae = F->arg_end();
3081        ai != ae; ++ai, ++j) {
3082     llvm::Type *ArgTy = ai->getType();
3083     if (Ops[j]->getType()->getPrimitiveSizeInBits() ==
3084              ArgTy->getPrimitiveSizeInBits())
3085       continue;
3086 
3087     assert(ArgTy->isVectorTy() && !Ops[j]->getType()->isVectorTy());
3088     // The constant argument to an _n_ intrinsic always has Int32Ty, so truncate
3089     // it before inserting.
3090     Ops[j] =
3091         CGF.Builder.CreateTruncOrBitCast(Ops[j], ArgTy->getVectorElementType());
3092     Ops[j] =
3093         CGF.Builder.CreateInsertElement(UndefValue::get(ArgTy), Ops[j], C0);
3094   }
3095 
3096   Value *Result = CGF.EmitNeonCall(F, Ops, s);
3097   llvm::Type *ResultType = CGF.ConvertType(E->getType());
3098   if (ResultType->getPrimitiveSizeInBits() <
3099       Result->getType()->getPrimitiveSizeInBits())
3100     return CGF.Builder.CreateExtractElement(Result, C0);
3101 
3102   return CGF.Builder.CreateBitCast(Result, ResultType, s);
3103 }
3104 
3105 Value *CodeGenFunction::EmitCommonNeonBuiltinExpr(
3106     unsigned BuiltinID, unsigned LLVMIntrinsic, unsigned AltLLVMIntrinsic,
3107     const char *NameHint, unsigned Modifier, const CallExpr *E,
3108     SmallVectorImpl<llvm::Value *> &Ops, Address PtrOp0, Address PtrOp1) {
3109   // Get the last argument, which specifies the vector type.
3110   llvm::APSInt NeonTypeConst;
3111   const Expr *Arg = E->getArg(E->getNumArgs() - 1);
3112   if (!Arg->isIntegerConstantExpr(NeonTypeConst, getContext()))
3113     return nullptr;
3114 
3115   // Determine the type of this overloaded NEON intrinsic.
3116   NeonTypeFlags Type(NeonTypeConst.getZExtValue());
3117   bool Usgn = Type.isUnsigned();
3118   bool Quad = Type.isQuad();
3119 
3120   llvm::VectorType *VTy = GetNeonType(this, Type);
3121   llvm::Type *Ty = VTy;
3122   if (!Ty)
3123     return nullptr;
3124 
3125   auto getAlignmentValue32 = [&](Address addr) -> Value* {
3126     return Builder.getInt32(addr.getAlignment().getQuantity());
3127   };
3128 
3129   unsigned Int = LLVMIntrinsic;
3130   if ((Modifier & UnsignedAlts) && !Usgn)
3131     Int = AltLLVMIntrinsic;
3132 
3133   switch (BuiltinID) {
3134   default: break;
3135   case NEON::BI__builtin_neon_vabs_v:
3136   case NEON::BI__builtin_neon_vabsq_v:
3137     if (VTy->getElementType()->isFloatingPointTy())
3138       return EmitNeonCall(CGM.getIntrinsic(Intrinsic::fabs, Ty), Ops, "vabs");
3139     return EmitNeonCall(CGM.getIntrinsic(LLVMIntrinsic, Ty), Ops, "vabs");
3140   case NEON::BI__builtin_neon_vaddhn_v: {
3141     llvm::VectorType *SrcTy =
3142         llvm::VectorType::getExtendedElementVectorType(VTy);
3143 
3144     // %sum = add <4 x i32> %lhs, %rhs
3145     Ops[0] = Builder.CreateBitCast(Ops[0], SrcTy);
3146     Ops[1] = Builder.CreateBitCast(Ops[1], SrcTy);
3147     Ops[0] = Builder.CreateAdd(Ops[0], Ops[1], "vaddhn");
3148 
3149     // %high = lshr <4 x i32> %sum, <i32 16, i32 16, i32 16, i32 16>
3150     Constant *ShiftAmt =
3151         ConstantInt::get(SrcTy, SrcTy->getScalarSizeInBits() / 2);
3152     Ops[0] = Builder.CreateLShr(Ops[0], ShiftAmt, "vaddhn");
3153 
3154     // %res = trunc <4 x i32> %high to <4 x i16>
3155     return Builder.CreateTrunc(Ops[0], VTy, "vaddhn");
3156   }
3157   case NEON::BI__builtin_neon_vcale_v:
3158   case NEON::BI__builtin_neon_vcaleq_v:
3159   case NEON::BI__builtin_neon_vcalt_v:
3160   case NEON::BI__builtin_neon_vcaltq_v:
3161     std::swap(Ops[0], Ops[1]);
3162   case NEON::BI__builtin_neon_vcage_v:
3163   case NEON::BI__builtin_neon_vcageq_v:
3164   case NEON::BI__builtin_neon_vcagt_v:
3165   case NEON::BI__builtin_neon_vcagtq_v: {
3166     llvm::Type *VecFlt = llvm::VectorType::get(
3167         VTy->getScalarSizeInBits() == 32 ? FloatTy : DoubleTy,
3168         VTy->getNumElements());
3169     llvm::Type *Tys[] = { VTy, VecFlt };
3170     Function *F = CGM.getIntrinsic(LLVMIntrinsic, Tys);
3171     return EmitNeonCall(F, Ops, NameHint);
3172   }
3173   case NEON::BI__builtin_neon_vclz_v:
3174   case NEON::BI__builtin_neon_vclzq_v:
3175     // We generate target-independent intrinsic, which needs a second argument
3176     // for whether or not clz of zero is undefined; on ARM it isn't.
3177     Ops.push_back(Builder.getInt1(getTarget().isCLZForZeroUndef()));
3178     break;
3179   case NEON::BI__builtin_neon_vcvt_f32_v:
3180   case NEON::BI__builtin_neon_vcvtq_f32_v:
3181     Ops[0] = Builder.CreateBitCast(Ops[0], Ty);
3182     Ty = GetNeonType(this, NeonTypeFlags(NeonTypeFlags::Float32, false, Quad));
3183     return Usgn ? Builder.CreateUIToFP(Ops[0], Ty, "vcvt")
3184                 : Builder.CreateSIToFP(Ops[0], Ty, "vcvt");
3185   case NEON::BI__builtin_neon_vcvt_n_f32_v:
3186   case NEON::BI__builtin_neon_vcvt_n_f64_v:
3187   case NEON::BI__builtin_neon_vcvtq_n_f32_v:
3188   case NEON::BI__builtin_neon_vcvtq_n_f64_v: {
3189     llvm::Type *Tys[2] = { GetFloatNeonType(this, Type), Ty };
3190     Int = Usgn ? LLVMIntrinsic : AltLLVMIntrinsic;
3191     Function *F = CGM.getIntrinsic(Int, Tys);
3192     return EmitNeonCall(F, Ops, "vcvt_n");
3193   }
3194   case NEON::BI__builtin_neon_vcvt_n_s32_v:
3195   case NEON::BI__builtin_neon_vcvt_n_u32_v:
3196   case NEON::BI__builtin_neon_vcvt_n_s64_v:
3197   case NEON::BI__builtin_neon_vcvt_n_u64_v:
3198   case NEON::BI__builtin_neon_vcvtq_n_s32_v:
3199   case NEON::BI__builtin_neon_vcvtq_n_u32_v:
3200   case NEON::BI__builtin_neon_vcvtq_n_s64_v:
3201   case NEON::BI__builtin_neon_vcvtq_n_u64_v: {
3202     llvm::Type *Tys[2] = { Ty, GetFloatNeonType(this, Type) };
3203     Function *F = CGM.getIntrinsic(LLVMIntrinsic, Tys);
3204     return EmitNeonCall(F, Ops, "vcvt_n");
3205   }
3206   case NEON::BI__builtin_neon_vcvt_s32_v:
3207   case NEON::BI__builtin_neon_vcvt_u32_v:
3208   case NEON::BI__builtin_neon_vcvt_s64_v:
3209   case NEON::BI__builtin_neon_vcvt_u64_v:
3210   case NEON::BI__builtin_neon_vcvtq_s32_v:
3211   case NEON::BI__builtin_neon_vcvtq_u32_v:
3212   case NEON::BI__builtin_neon_vcvtq_s64_v:
3213   case NEON::BI__builtin_neon_vcvtq_u64_v: {
3214     Ops[0] = Builder.CreateBitCast(Ops[0], GetFloatNeonType(this, Type));
3215     return Usgn ? Builder.CreateFPToUI(Ops[0], Ty, "vcvt")
3216                 : Builder.CreateFPToSI(Ops[0], Ty, "vcvt");
3217   }
3218   case NEON::BI__builtin_neon_vcvta_s32_v:
3219   case NEON::BI__builtin_neon_vcvta_s64_v:
3220   case NEON::BI__builtin_neon_vcvta_u32_v:
3221   case NEON::BI__builtin_neon_vcvta_u64_v:
3222   case NEON::BI__builtin_neon_vcvtaq_s32_v:
3223   case NEON::BI__builtin_neon_vcvtaq_s64_v:
3224   case NEON::BI__builtin_neon_vcvtaq_u32_v:
3225   case NEON::BI__builtin_neon_vcvtaq_u64_v:
3226   case NEON::BI__builtin_neon_vcvtn_s32_v:
3227   case NEON::BI__builtin_neon_vcvtn_s64_v:
3228   case NEON::BI__builtin_neon_vcvtn_u32_v:
3229   case NEON::BI__builtin_neon_vcvtn_u64_v:
3230   case NEON::BI__builtin_neon_vcvtnq_s32_v:
3231   case NEON::BI__builtin_neon_vcvtnq_s64_v:
3232   case NEON::BI__builtin_neon_vcvtnq_u32_v:
3233   case NEON::BI__builtin_neon_vcvtnq_u64_v:
3234   case NEON::BI__builtin_neon_vcvtp_s32_v:
3235   case NEON::BI__builtin_neon_vcvtp_s64_v:
3236   case NEON::BI__builtin_neon_vcvtp_u32_v:
3237   case NEON::BI__builtin_neon_vcvtp_u64_v:
3238   case NEON::BI__builtin_neon_vcvtpq_s32_v:
3239   case NEON::BI__builtin_neon_vcvtpq_s64_v:
3240   case NEON::BI__builtin_neon_vcvtpq_u32_v:
3241   case NEON::BI__builtin_neon_vcvtpq_u64_v:
3242   case NEON::BI__builtin_neon_vcvtm_s32_v:
3243   case NEON::BI__builtin_neon_vcvtm_s64_v:
3244   case NEON::BI__builtin_neon_vcvtm_u32_v:
3245   case NEON::BI__builtin_neon_vcvtm_u64_v:
3246   case NEON::BI__builtin_neon_vcvtmq_s32_v:
3247   case NEON::BI__builtin_neon_vcvtmq_s64_v:
3248   case NEON::BI__builtin_neon_vcvtmq_u32_v:
3249   case NEON::BI__builtin_neon_vcvtmq_u64_v: {
3250     llvm::Type *Tys[2] = { Ty, GetFloatNeonType(this, Type) };
3251     return EmitNeonCall(CGM.getIntrinsic(LLVMIntrinsic, Tys), Ops, NameHint);
3252   }
3253   case NEON::BI__builtin_neon_vext_v:
3254   case NEON::BI__builtin_neon_vextq_v: {
3255     int CV = cast<ConstantInt>(Ops[2])->getSExtValue();
3256     SmallVector<Constant*, 16> Indices;
3257     for (unsigned i = 0, e = VTy->getNumElements(); i != e; ++i)
3258       Indices.push_back(ConstantInt::get(Int32Ty, i+CV));
3259 
3260     Ops[0] = Builder.CreateBitCast(Ops[0], Ty);
3261     Ops[1] = Builder.CreateBitCast(Ops[1], Ty);
3262     Value *SV = llvm::ConstantVector::get(Indices);
3263     return Builder.CreateShuffleVector(Ops[0], Ops[1], SV, "vext");
3264   }
3265   case NEON::BI__builtin_neon_vfma_v:
3266   case NEON::BI__builtin_neon_vfmaq_v: {
3267     Value *F = CGM.getIntrinsic(Intrinsic::fma, Ty);
3268     Ops[0] = Builder.CreateBitCast(Ops[0], Ty);
3269     Ops[1] = Builder.CreateBitCast(Ops[1], Ty);
3270     Ops[2] = Builder.CreateBitCast(Ops[2], Ty);
3271 
3272     // NEON intrinsic puts accumulator first, unlike the LLVM fma.
3273     return Builder.CreateCall(F, {Ops[1], Ops[2], Ops[0]});
3274   }
3275   case NEON::BI__builtin_neon_vld1_v:
3276   case NEON::BI__builtin_neon_vld1q_v: {
3277     llvm::Type *Tys[] = {Ty, Int8PtrTy};
3278     Ops.push_back(getAlignmentValue32(PtrOp0));
3279     return EmitNeonCall(CGM.getIntrinsic(LLVMIntrinsic, Tys), Ops, "vld1");
3280   }
3281   case NEON::BI__builtin_neon_vld2_v:
3282   case NEON::BI__builtin_neon_vld2q_v:
3283   case NEON::BI__builtin_neon_vld3_v:
3284   case NEON::BI__builtin_neon_vld3q_v:
3285   case NEON::BI__builtin_neon_vld4_v:
3286   case NEON::BI__builtin_neon_vld4q_v: {
3287     llvm::Type *Tys[] = {Ty, Int8PtrTy};
3288     Function *F = CGM.getIntrinsic(LLVMIntrinsic, Tys);
3289     Value *Align = getAlignmentValue32(PtrOp1);
3290     Ops[1] = Builder.CreateCall(F, {Ops[1], Align}, NameHint);
3291     Ty = llvm::PointerType::getUnqual(Ops[1]->getType());
3292     Ops[0] = Builder.CreateBitCast(Ops[0], Ty);
3293     return Builder.CreateDefaultAlignedStore(Ops[1], Ops[0]);
3294   }
3295   case NEON::BI__builtin_neon_vld1_dup_v:
3296   case NEON::BI__builtin_neon_vld1q_dup_v: {
3297     Value *V = UndefValue::get(Ty);
3298     Ty = llvm::PointerType::getUnqual(VTy->getElementType());
3299     PtrOp0 = Builder.CreateBitCast(PtrOp0, Ty);
3300     LoadInst *Ld = Builder.CreateLoad(PtrOp0);
3301     llvm::Constant *CI = ConstantInt::get(SizeTy, 0);
3302     Ops[0] = Builder.CreateInsertElement(V, Ld, CI);
3303     return EmitNeonSplat(Ops[0], CI);
3304   }
3305   case NEON::BI__builtin_neon_vld2_lane_v:
3306   case NEON::BI__builtin_neon_vld2q_lane_v:
3307   case NEON::BI__builtin_neon_vld3_lane_v:
3308   case NEON::BI__builtin_neon_vld3q_lane_v:
3309   case NEON::BI__builtin_neon_vld4_lane_v:
3310   case NEON::BI__builtin_neon_vld4q_lane_v: {
3311     llvm::Type *Tys[] = {Ty, Int8PtrTy};
3312     Function *F = CGM.getIntrinsic(LLVMIntrinsic, Tys);
3313     for (unsigned I = 2; I < Ops.size() - 1; ++I)
3314       Ops[I] = Builder.CreateBitCast(Ops[I], Ty);
3315     Ops.push_back(getAlignmentValue32(PtrOp1));
3316     Ops[1] = Builder.CreateCall(F, makeArrayRef(Ops).slice(1), NameHint);
3317     Ty = llvm::PointerType::getUnqual(Ops[1]->getType());
3318     Ops[0] = Builder.CreateBitCast(Ops[0], Ty);
3319     return Builder.CreateDefaultAlignedStore(Ops[1], Ops[0]);
3320   }
3321   case NEON::BI__builtin_neon_vmovl_v: {
3322     llvm::Type *DTy =llvm::VectorType::getTruncatedElementVectorType(VTy);
3323     Ops[0] = Builder.CreateBitCast(Ops[0], DTy);
3324     if (Usgn)
3325       return Builder.CreateZExt(Ops[0], Ty, "vmovl");
3326     return Builder.CreateSExt(Ops[0], Ty, "vmovl");
3327   }
3328   case NEON::BI__builtin_neon_vmovn_v: {
3329     llvm::Type *QTy = llvm::VectorType::getExtendedElementVectorType(VTy);
3330     Ops[0] = Builder.CreateBitCast(Ops[0], QTy);
3331     return Builder.CreateTrunc(Ops[0], Ty, "vmovn");
3332   }
3333   case NEON::BI__builtin_neon_vmull_v:
3334     // FIXME: the integer vmull operations could be emitted in terms of pure
3335     // LLVM IR (2 exts followed by a mul). Unfortunately LLVM has a habit of
3336     // hoisting the exts outside loops. Until global ISel comes along that can
3337     // see through such movement this leads to bad CodeGen. So we need an
3338     // intrinsic for now.
3339     Int = Usgn ? Intrinsic::arm_neon_vmullu : Intrinsic::arm_neon_vmulls;
3340     Int = Type.isPoly() ? (unsigned)Intrinsic::arm_neon_vmullp : Int;
3341     return EmitNeonCall(CGM.getIntrinsic(Int, Ty), Ops, "vmull");
3342   case NEON::BI__builtin_neon_vpadal_v:
3343   case NEON::BI__builtin_neon_vpadalq_v: {
3344     // The source operand type has twice as many elements of half the size.
3345     unsigned EltBits = VTy->getElementType()->getPrimitiveSizeInBits();
3346     llvm::Type *EltTy =
3347       llvm::IntegerType::get(getLLVMContext(), EltBits / 2);
3348     llvm::Type *NarrowTy =
3349       llvm::VectorType::get(EltTy, VTy->getNumElements() * 2);
3350     llvm::Type *Tys[2] = { Ty, NarrowTy };
3351     return EmitNeonCall(CGM.getIntrinsic(Int, Tys), Ops, NameHint);
3352   }
3353   case NEON::BI__builtin_neon_vpaddl_v:
3354   case NEON::BI__builtin_neon_vpaddlq_v: {
3355     // The source operand type has twice as many elements of half the size.
3356     unsigned EltBits = VTy->getElementType()->getPrimitiveSizeInBits();
3357     llvm::Type *EltTy = llvm::IntegerType::get(getLLVMContext(), EltBits / 2);
3358     llvm::Type *NarrowTy =
3359       llvm::VectorType::get(EltTy, VTy->getNumElements() * 2);
3360     llvm::Type *Tys[2] = { Ty, NarrowTy };
3361     return EmitNeonCall(CGM.getIntrinsic(Int, Tys), Ops, "vpaddl");
3362   }
3363   case NEON::BI__builtin_neon_vqdmlal_v:
3364   case NEON::BI__builtin_neon_vqdmlsl_v: {
3365     SmallVector<Value *, 2> MulOps(Ops.begin() + 1, Ops.end());
3366     Ops[1] =
3367         EmitNeonCall(CGM.getIntrinsic(LLVMIntrinsic, Ty), MulOps, "vqdmlal");
3368     Ops.resize(2);
3369     return EmitNeonCall(CGM.getIntrinsic(AltLLVMIntrinsic, Ty), Ops, NameHint);
3370   }
3371   case NEON::BI__builtin_neon_vqshl_n_v:
3372   case NEON::BI__builtin_neon_vqshlq_n_v:
3373     return EmitNeonCall(CGM.getIntrinsic(Int, Ty), Ops, "vqshl_n",
3374                         1, false);
3375   case NEON::BI__builtin_neon_vqshlu_n_v:
3376   case NEON::BI__builtin_neon_vqshluq_n_v:
3377     return EmitNeonCall(CGM.getIntrinsic(Int, Ty), Ops, "vqshlu_n",
3378                         1, false);
3379   case NEON::BI__builtin_neon_vrecpe_v:
3380   case NEON::BI__builtin_neon_vrecpeq_v:
3381   case NEON::BI__builtin_neon_vrsqrte_v:
3382   case NEON::BI__builtin_neon_vrsqrteq_v:
3383     Int = Ty->isFPOrFPVectorTy() ? LLVMIntrinsic : AltLLVMIntrinsic;
3384     return EmitNeonCall(CGM.getIntrinsic(Int, Ty), Ops, NameHint);
3385 
3386   case NEON::BI__builtin_neon_vrshr_n_v:
3387   case NEON::BI__builtin_neon_vrshrq_n_v:
3388     return EmitNeonCall(CGM.getIntrinsic(Int, Ty), Ops, "vrshr_n",
3389                         1, true);
3390   case NEON::BI__builtin_neon_vshl_n_v:
3391   case NEON::BI__builtin_neon_vshlq_n_v:
3392     Ops[1] = EmitNeonShiftVector(Ops[1], Ty, false);
3393     return Builder.CreateShl(Builder.CreateBitCast(Ops[0],Ty), Ops[1],
3394                              "vshl_n");
3395   case NEON::BI__builtin_neon_vshll_n_v: {
3396     llvm::Type *SrcTy = llvm::VectorType::getTruncatedElementVectorType(VTy);
3397     Ops[0] = Builder.CreateBitCast(Ops[0], SrcTy);
3398     if (Usgn)
3399       Ops[0] = Builder.CreateZExt(Ops[0], VTy);
3400     else
3401       Ops[0] = Builder.CreateSExt(Ops[0], VTy);
3402     Ops[1] = EmitNeonShiftVector(Ops[1], VTy, false);
3403     return Builder.CreateShl(Ops[0], Ops[1], "vshll_n");
3404   }
3405   case NEON::BI__builtin_neon_vshrn_n_v: {
3406     llvm::Type *SrcTy = llvm::VectorType::getExtendedElementVectorType(VTy);
3407     Ops[0] = Builder.CreateBitCast(Ops[0], SrcTy);
3408     Ops[1] = EmitNeonShiftVector(Ops[1], SrcTy, false);
3409     if (Usgn)
3410       Ops[0] = Builder.CreateLShr(Ops[0], Ops[1]);
3411     else
3412       Ops[0] = Builder.CreateAShr(Ops[0], Ops[1]);
3413     return Builder.CreateTrunc(Ops[0], Ty, "vshrn_n");
3414   }
3415   case NEON::BI__builtin_neon_vshr_n_v:
3416   case NEON::BI__builtin_neon_vshrq_n_v:
3417     return EmitNeonRShiftImm(Ops[0], Ops[1], Ty, Usgn, "vshr_n");
3418   case NEON::BI__builtin_neon_vst1_v:
3419   case NEON::BI__builtin_neon_vst1q_v:
3420   case NEON::BI__builtin_neon_vst2_v:
3421   case NEON::BI__builtin_neon_vst2q_v:
3422   case NEON::BI__builtin_neon_vst3_v:
3423   case NEON::BI__builtin_neon_vst3q_v:
3424   case NEON::BI__builtin_neon_vst4_v:
3425   case NEON::BI__builtin_neon_vst4q_v:
3426   case NEON::BI__builtin_neon_vst2_lane_v:
3427   case NEON::BI__builtin_neon_vst2q_lane_v:
3428   case NEON::BI__builtin_neon_vst3_lane_v:
3429   case NEON::BI__builtin_neon_vst3q_lane_v:
3430   case NEON::BI__builtin_neon_vst4_lane_v:
3431   case NEON::BI__builtin_neon_vst4q_lane_v: {
3432     llvm::Type *Tys[] = {Int8PtrTy, Ty};
3433     Ops.push_back(getAlignmentValue32(PtrOp0));
3434     return EmitNeonCall(CGM.getIntrinsic(Int, Tys), Ops, "");
3435   }
3436   case NEON::BI__builtin_neon_vsubhn_v: {
3437     llvm::VectorType *SrcTy =
3438         llvm::VectorType::getExtendedElementVectorType(VTy);
3439 
3440     // %sum = add <4 x i32> %lhs, %rhs
3441     Ops[0] = Builder.CreateBitCast(Ops[0], SrcTy);
3442     Ops[1] = Builder.CreateBitCast(Ops[1], SrcTy);
3443     Ops[0] = Builder.CreateSub(Ops[0], Ops[1], "vsubhn");
3444 
3445     // %high = lshr <4 x i32> %sum, <i32 16, i32 16, i32 16, i32 16>
3446     Constant *ShiftAmt =
3447         ConstantInt::get(SrcTy, SrcTy->getScalarSizeInBits() / 2);
3448     Ops[0] = Builder.CreateLShr(Ops[0], ShiftAmt, "vsubhn");
3449 
3450     // %res = trunc <4 x i32> %high to <4 x i16>
3451     return Builder.CreateTrunc(Ops[0], VTy, "vsubhn");
3452   }
3453   case NEON::BI__builtin_neon_vtrn_v:
3454   case NEON::BI__builtin_neon_vtrnq_v: {
3455     Ops[0] = Builder.CreateBitCast(Ops[0], llvm::PointerType::getUnqual(Ty));
3456     Ops[1] = Builder.CreateBitCast(Ops[1], Ty);
3457     Ops[2] = Builder.CreateBitCast(Ops[2], Ty);
3458     Value *SV = nullptr;
3459 
3460     for (unsigned vi = 0; vi != 2; ++vi) {
3461       SmallVector<Constant*, 16> Indices;
3462       for (unsigned i = 0, e = VTy->getNumElements(); i != e; i += 2) {
3463         Indices.push_back(Builder.getInt32(i+vi));
3464         Indices.push_back(Builder.getInt32(i+e+vi));
3465       }
3466       Value *Addr = Builder.CreateConstInBoundsGEP1_32(Ty, Ops[0], vi);
3467       SV = llvm::ConstantVector::get(Indices);
3468       SV = Builder.CreateShuffleVector(Ops[1], Ops[2], SV, "vtrn");
3469       SV = Builder.CreateDefaultAlignedStore(SV, Addr);
3470     }
3471     return SV;
3472   }
3473   case NEON::BI__builtin_neon_vtst_v:
3474   case NEON::BI__builtin_neon_vtstq_v: {
3475     Ops[0] = Builder.CreateBitCast(Ops[0], Ty);
3476     Ops[1] = Builder.CreateBitCast(Ops[1], Ty);
3477     Ops[0] = Builder.CreateAnd(Ops[0], Ops[1]);
3478     Ops[0] = Builder.CreateICmp(ICmpInst::ICMP_NE, Ops[0],
3479                                 ConstantAggregateZero::get(Ty));
3480     return Builder.CreateSExt(Ops[0], Ty, "vtst");
3481   }
3482   case NEON::BI__builtin_neon_vuzp_v:
3483   case NEON::BI__builtin_neon_vuzpq_v: {
3484     Ops[0] = Builder.CreateBitCast(Ops[0], llvm::PointerType::getUnqual(Ty));
3485     Ops[1] = Builder.CreateBitCast(Ops[1], Ty);
3486     Ops[2] = Builder.CreateBitCast(Ops[2], Ty);
3487     Value *SV = nullptr;
3488 
3489     for (unsigned vi = 0; vi != 2; ++vi) {
3490       SmallVector<Constant*, 16> Indices;
3491       for (unsigned i = 0, e = VTy->getNumElements(); i != e; ++i)
3492         Indices.push_back(ConstantInt::get(Int32Ty, 2*i+vi));
3493 
3494       Value *Addr = Builder.CreateConstInBoundsGEP1_32(Ty, Ops[0], vi);
3495       SV = llvm::ConstantVector::get(Indices);
3496       SV = Builder.CreateShuffleVector(Ops[1], Ops[2], SV, "vuzp");
3497       SV = Builder.CreateDefaultAlignedStore(SV, Addr);
3498     }
3499     return SV;
3500   }
3501   case NEON::BI__builtin_neon_vzip_v:
3502   case NEON::BI__builtin_neon_vzipq_v: {
3503     Ops[0] = Builder.CreateBitCast(Ops[0], llvm::PointerType::getUnqual(Ty));
3504     Ops[1] = Builder.CreateBitCast(Ops[1], Ty);
3505     Ops[2] = Builder.CreateBitCast(Ops[2], Ty);
3506     Value *SV = nullptr;
3507 
3508     for (unsigned vi = 0; vi != 2; ++vi) {
3509       SmallVector<Constant*, 16> Indices;
3510       for (unsigned i = 0, e = VTy->getNumElements(); i != e; i += 2) {
3511         Indices.push_back(ConstantInt::get(Int32Ty, (i + vi*e) >> 1));
3512         Indices.push_back(ConstantInt::get(Int32Ty, ((i + vi*e) >> 1)+e));
3513       }
3514       Value *Addr = Builder.CreateConstInBoundsGEP1_32(Ty, Ops[0], vi);
3515       SV = llvm::ConstantVector::get(Indices);
3516       SV = Builder.CreateShuffleVector(Ops[1], Ops[2], SV, "vzip");
3517       SV = Builder.CreateDefaultAlignedStore(SV, Addr);
3518     }
3519     return SV;
3520   }
3521   }
3522 
3523   assert(Int && "Expected valid intrinsic number");
3524 
3525   // Determine the type(s) of this overloaded AArch64 intrinsic.
3526   Function *F = LookupNeonLLVMIntrinsic(Int, Modifier, Ty, E);
3527 
3528   Value *Result = EmitNeonCall(F, Ops, NameHint);
3529   llvm::Type *ResultType = ConvertType(E->getType());
3530   // AArch64 intrinsic one-element vector type cast to
3531   // scalar type expected by the builtin
3532   return Builder.CreateBitCast(Result, ResultType, NameHint);
3533 }
3534 
3535 Value *CodeGenFunction::EmitAArch64CompareBuiltinExpr(
3536     Value *Op, llvm::Type *Ty, const CmpInst::Predicate Fp,
3537     const CmpInst::Predicate Ip, const Twine &Name) {
3538   llvm::Type *OTy = Op->getType();
3539 
3540   // FIXME: this is utterly horrific. We should not be looking at previous
3541   // codegen context to find out what needs doing. Unfortunately TableGen
3542   // currently gives us exactly the same calls for vceqz_f32 and vceqz_s32
3543   // (etc).
3544   if (BitCastInst *BI = dyn_cast<BitCastInst>(Op))
3545     OTy = BI->getOperand(0)->getType();
3546 
3547   Op = Builder.CreateBitCast(Op, OTy);
3548   if (OTy->getScalarType()->isFloatingPointTy()) {
3549     Op = Builder.CreateFCmp(Fp, Op, Constant::getNullValue(OTy));
3550   } else {
3551     Op = Builder.CreateICmp(Ip, Op, Constant::getNullValue(OTy));
3552   }
3553   return Builder.CreateSExt(Op, Ty, Name);
3554 }
3555 
3556 static Value *packTBLDVectorList(CodeGenFunction &CGF, ArrayRef<Value *> Ops,
3557                                  Value *ExtOp, Value *IndexOp,
3558                                  llvm::Type *ResTy, unsigned IntID,
3559                                  const char *Name) {
3560   SmallVector<Value *, 2> TblOps;
3561   if (ExtOp)
3562     TblOps.push_back(ExtOp);
3563 
3564   // Build a vector containing sequential number like (0, 1, 2, ..., 15)
3565   SmallVector<Constant*, 16> Indices;
3566   llvm::VectorType *TblTy = cast<llvm::VectorType>(Ops[0]->getType());
3567   for (unsigned i = 0, e = TblTy->getNumElements(); i != e; ++i) {
3568     Indices.push_back(ConstantInt::get(CGF.Int32Ty, 2*i));
3569     Indices.push_back(ConstantInt::get(CGF.Int32Ty, 2*i+1));
3570   }
3571   Value *SV = llvm::ConstantVector::get(Indices);
3572 
3573   int PairPos = 0, End = Ops.size() - 1;
3574   while (PairPos < End) {
3575     TblOps.push_back(CGF.Builder.CreateShuffleVector(Ops[PairPos],
3576                                                      Ops[PairPos+1], SV, Name));
3577     PairPos += 2;
3578   }
3579 
3580   // If there's an odd number of 64-bit lookup table, fill the high 64-bit
3581   // of the 128-bit lookup table with zero.
3582   if (PairPos == End) {
3583     Value *ZeroTbl = ConstantAggregateZero::get(TblTy);
3584     TblOps.push_back(CGF.Builder.CreateShuffleVector(Ops[PairPos],
3585                                                      ZeroTbl, SV, Name));
3586   }
3587 
3588   Function *TblF;
3589   TblOps.push_back(IndexOp);
3590   TblF = CGF.CGM.getIntrinsic(IntID, ResTy);
3591 
3592   return CGF.EmitNeonCall(TblF, TblOps, Name);
3593 }
3594 
3595 Value *CodeGenFunction::GetValueForARMHint(unsigned BuiltinID) {
3596   unsigned Value;
3597   switch (BuiltinID) {
3598   default:
3599     return nullptr;
3600   case ARM::BI__builtin_arm_nop:
3601     Value = 0;
3602     break;
3603   case ARM::BI__builtin_arm_yield:
3604   case ARM::BI__yield:
3605     Value = 1;
3606     break;
3607   case ARM::BI__builtin_arm_wfe:
3608   case ARM::BI__wfe:
3609     Value = 2;
3610     break;
3611   case ARM::BI__builtin_arm_wfi:
3612   case ARM::BI__wfi:
3613     Value = 3;
3614     break;
3615   case ARM::BI__builtin_arm_sev:
3616   case ARM::BI__sev:
3617     Value = 4;
3618     break;
3619   case ARM::BI__builtin_arm_sevl:
3620   case ARM::BI__sevl:
3621     Value = 5;
3622     break;
3623   }
3624 
3625   return Builder.CreateCall(CGM.getIntrinsic(Intrinsic::arm_hint),
3626                             llvm::ConstantInt::get(Int32Ty, Value));
3627 }
3628 
3629 // Generates the IR for the read/write special register builtin,
3630 // ValueType is the type of the value that is to be written or read,
3631 // RegisterType is the type of the register being written to or read from.
3632 static Value *EmitSpecialRegisterBuiltin(CodeGenFunction &CGF,
3633                                          const CallExpr *E,
3634                                          llvm::Type *RegisterType,
3635                                          llvm::Type *ValueType, bool IsRead) {
3636   // write and register intrinsics only support 32 and 64 bit operations.
3637   assert((RegisterType->isIntegerTy(32) || RegisterType->isIntegerTy(64))
3638           && "Unsupported size for register.");
3639 
3640   CodeGen::CGBuilderTy &Builder = CGF.Builder;
3641   CodeGen::CodeGenModule &CGM = CGF.CGM;
3642   LLVMContext &Context = CGM.getLLVMContext();
3643 
3644   const Expr *SysRegStrExpr = E->getArg(0)->IgnoreParenCasts();
3645   StringRef SysReg = cast<StringLiteral>(SysRegStrExpr)->getString();
3646 
3647   llvm::Metadata *Ops[] = { llvm::MDString::get(Context, SysReg) };
3648   llvm::MDNode *RegName = llvm::MDNode::get(Context, Ops);
3649   llvm::Value *Metadata = llvm::MetadataAsValue::get(Context, RegName);
3650 
3651   llvm::Type *Types[] = { RegisterType };
3652 
3653   bool MixedTypes = RegisterType->isIntegerTy(64) && ValueType->isIntegerTy(32);
3654   assert(!(RegisterType->isIntegerTy(32) && ValueType->isIntegerTy(64))
3655             && "Can't fit 64-bit value in 32-bit register");
3656 
3657   if (IsRead) {
3658     llvm::Value *F = CGM.getIntrinsic(llvm::Intrinsic::read_register, Types);
3659     llvm::Value *Call = Builder.CreateCall(F, Metadata);
3660 
3661     if (MixedTypes)
3662       // Read into 64 bit register and then truncate result to 32 bit.
3663       return Builder.CreateTrunc(Call, ValueType);
3664 
3665     if (ValueType->isPointerTy())
3666       // Have i32/i64 result (Call) but want to return a VoidPtrTy (i8*).
3667       return Builder.CreateIntToPtr(Call, ValueType);
3668 
3669     return Call;
3670   }
3671 
3672   llvm::Value *F = CGM.getIntrinsic(llvm::Intrinsic::write_register, Types);
3673   llvm::Value *ArgValue = CGF.EmitScalarExpr(E->getArg(1));
3674   if (MixedTypes) {
3675     // Extend 32 bit write value to 64 bit to pass to write.
3676     ArgValue = Builder.CreateZExt(ArgValue, RegisterType);
3677     return Builder.CreateCall(F, { Metadata, ArgValue });
3678   }
3679 
3680   if (ValueType->isPointerTy()) {
3681     // Have VoidPtrTy ArgValue but want to return an i32/i64.
3682     ArgValue = Builder.CreatePtrToInt(ArgValue, RegisterType);
3683     return Builder.CreateCall(F, { Metadata, ArgValue });
3684   }
3685 
3686   return Builder.CreateCall(F, { Metadata, ArgValue });
3687 }
3688 
3689 /// Return true if BuiltinID is an overloaded Neon intrinsic with an extra
3690 /// argument that specifies the vector type.
3691 static bool HasExtraNeonArgument(unsigned BuiltinID) {
3692   switch (BuiltinID) {
3693   default: break;
3694   case NEON::BI__builtin_neon_vget_lane_i8:
3695   case NEON::BI__builtin_neon_vget_lane_i16:
3696   case NEON::BI__builtin_neon_vget_lane_i32:
3697   case NEON::BI__builtin_neon_vget_lane_i64:
3698   case NEON::BI__builtin_neon_vget_lane_f32:
3699   case NEON::BI__builtin_neon_vgetq_lane_i8:
3700   case NEON::BI__builtin_neon_vgetq_lane_i16:
3701   case NEON::BI__builtin_neon_vgetq_lane_i32:
3702   case NEON::BI__builtin_neon_vgetq_lane_i64:
3703   case NEON::BI__builtin_neon_vgetq_lane_f32:
3704   case NEON::BI__builtin_neon_vset_lane_i8:
3705   case NEON::BI__builtin_neon_vset_lane_i16:
3706   case NEON::BI__builtin_neon_vset_lane_i32:
3707   case NEON::BI__builtin_neon_vset_lane_i64:
3708   case NEON::BI__builtin_neon_vset_lane_f32:
3709   case NEON::BI__builtin_neon_vsetq_lane_i8:
3710   case NEON::BI__builtin_neon_vsetq_lane_i16:
3711   case NEON::BI__builtin_neon_vsetq_lane_i32:
3712   case NEON::BI__builtin_neon_vsetq_lane_i64:
3713   case NEON::BI__builtin_neon_vsetq_lane_f32:
3714   case NEON::BI__builtin_neon_vsha1h_u32:
3715   case NEON::BI__builtin_neon_vsha1cq_u32:
3716   case NEON::BI__builtin_neon_vsha1pq_u32:
3717   case NEON::BI__builtin_neon_vsha1mq_u32:
3718   case ARM::BI_MoveToCoprocessor:
3719   case ARM::BI_MoveToCoprocessor2:
3720     return false;
3721   }
3722   return true;
3723 }
3724 
3725 Value *CodeGenFunction::EmitARMBuiltinExpr(unsigned BuiltinID,
3726                                            const CallExpr *E) {
3727   if (auto Hint = GetValueForARMHint(BuiltinID))
3728     return Hint;
3729 
3730   if (BuiltinID == ARM::BI__emit) {
3731     bool IsThumb = getTarget().getTriple().getArch() == llvm::Triple::thumb;
3732     llvm::FunctionType *FTy =
3733         llvm::FunctionType::get(VoidTy, /*Variadic=*/false);
3734 
3735     APSInt Value;
3736     if (!E->getArg(0)->EvaluateAsInt(Value, CGM.getContext()))
3737       llvm_unreachable("Sema will ensure that the parameter is constant");
3738 
3739     uint64_t ZExtValue = Value.zextOrTrunc(IsThumb ? 16 : 32).getZExtValue();
3740 
3741     llvm::InlineAsm *Emit =
3742         IsThumb ? InlineAsm::get(FTy, ".inst.n 0x" + utohexstr(ZExtValue), "",
3743                                  /*SideEffects=*/true)
3744                 : InlineAsm::get(FTy, ".inst 0x" + utohexstr(ZExtValue), "",
3745                                  /*SideEffects=*/true);
3746 
3747     return Builder.CreateCall(Emit);
3748   }
3749 
3750   if (BuiltinID == ARM::BI__builtin_arm_dbg) {
3751     Value *Option = EmitScalarExpr(E->getArg(0));
3752     return Builder.CreateCall(CGM.getIntrinsic(Intrinsic::arm_dbg), Option);
3753   }
3754 
3755   if (BuiltinID == ARM::BI__builtin_arm_prefetch) {
3756     Value *Address = EmitScalarExpr(E->getArg(0));
3757     Value *RW      = EmitScalarExpr(E->getArg(1));
3758     Value *IsData  = EmitScalarExpr(E->getArg(2));
3759 
3760     // Locality is not supported on ARM target
3761     Value *Locality = llvm::ConstantInt::get(Int32Ty, 3);
3762 
3763     Value *F = CGM.getIntrinsic(Intrinsic::prefetch);
3764     return Builder.CreateCall(F, {Address, RW, Locality, IsData});
3765   }
3766 
3767   if (BuiltinID == ARM::BI__builtin_arm_rbit) {
3768     return Builder.CreateCall(CGM.getIntrinsic(Intrinsic::arm_rbit),
3769                                                EmitScalarExpr(E->getArg(0)),
3770                               "rbit");
3771   }
3772 
3773   if (BuiltinID == ARM::BI__clear_cache) {
3774     assert(E->getNumArgs() == 2 && "__clear_cache takes 2 arguments");
3775     const FunctionDecl *FD = E->getDirectCallee();
3776     Value *Ops[2];
3777     for (unsigned i = 0; i < 2; i++)
3778       Ops[i] = EmitScalarExpr(E->getArg(i));
3779     llvm::Type *Ty = CGM.getTypes().ConvertType(FD->getType());
3780     llvm::FunctionType *FTy = cast<llvm::FunctionType>(Ty);
3781     StringRef Name = FD->getName();
3782     return EmitNounwindRuntimeCall(CGM.CreateRuntimeFunction(FTy, Name), Ops);
3783   }
3784 
3785   if (BuiltinID == ARM::BI__builtin_arm_ldrexd ||
3786       ((BuiltinID == ARM::BI__builtin_arm_ldrex ||
3787         BuiltinID == ARM::BI__builtin_arm_ldaex) &&
3788        getContext().getTypeSize(E->getType()) == 64) ||
3789       BuiltinID == ARM::BI__ldrexd) {
3790     Function *F;
3791 
3792     switch (BuiltinID) {
3793     default: llvm_unreachable("unexpected builtin");
3794     case ARM::BI__builtin_arm_ldaex:
3795       F = CGM.getIntrinsic(Intrinsic::arm_ldaexd);
3796       break;
3797     case ARM::BI__builtin_arm_ldrexd:
3798     case ARM::BI__builtin_arm_ldrex:
3799     case ARM::BI__ldrexd:
3800       F = CGM.getIntrinsic(Intrinsic::arm_ldrexd);
3801       break;
3802     }
3803 
3804     Value *LdPtr = EmitScalarExpr(E->getArg(0));
3805     Value *Val = Builder.CreateCall(F, Builder.CreateBitCast(LdPtr, Int8PtrTy),
3806                                     "ldrexd");
3807 
3808     Value *Val0 = Builder.CreateExtractValue(Val, 1);
3809     Value *Val1 = Builder.CreateExtractValue(Val, 0);
3810     Val0 = Builder.CreateZExt(Val0, Int64Ty);
3811     Val1 = Builder.CreateZExt(Val1, Int64Ty);
3812 
3813     Value *ShiftCst = llvm::ConstantInt::get(Int64Ty, 32);
3814     Val = Builder.CreateShl(Val0, ShiftCst, "shl", true /* nuw */);
3815     Val = Builder.CreateOr(Val, Val1);
3816     return Builder.CreateBitCast(Val, ConvertType(E->getType()));
3817   }
3818 
3819   if (BuiltinID == ARM::BI__builtin_arm_ldrex ||
3820       BuiltinID == ARM::BI__builtin_arm_ldaex) {
3821     Value *LoadAddr = EmitScalarExpr(E->getArg(0));
3822 
3823     QualType Ty = E->getType();
3824     llvm::Type *RealResTy = ConvertType(Ty);
3825     llvm::Type *IntResTy = llvm::IntegerType::get(getLLVMContext(),
3826                                                   getContext().getTypeSize(Ty));
3827     LoadAddr = Builder.CreateBitCast(LoadAddr, IntResTy->getPointerTo());
3828 
3829     Function *F = CGM.getIntrinsic(BuiltinID == ARM::BI__builtin_arm_ldaex
3830                                        ? Intrinsic::arm_ldaex
3831                                        : Intrinsic::arm_ldrex,
3832                                    LoadAddr->getType());
3833     Value *Val = Builder.CreateCall(F, LoadAddr, "ldrex");
3834 
3835     if (RealResTy->isPointerTy())
3836       return Builder.CreateIntToPtr(Val, RealResTy);
3837     else {
3838       Val = Builder.CreateTruncOrBitCast(Val, IntResTy);
3839       return Builder.CreateBitCast(Val, RealResTy);
3840     }
3841   }
3842 
3843   if (BuiltinID == ARM::BI__builtin_arm_strexd ||
3844       ((BuiltinID == ARM::BI__builtin_arm_stlex ||
3845         BuiltinID == ARM::BI__builtin_arm_strex) &&
3846        getContext().getTypeSize(E->getArg(0)->getType()) == 64)) {
3847     Function *F = CGM.getIntrinsic(BuiltinID == ARM::BI__builtin_arm_stlex
3848                                        ? Intrinsic::arm_stlexd
3849                                        : Intrinsic::arm_strexd);
3850     llvm::Type *STy = llvm::StructType::get(Int32Ty, Int32Ty, nullptr);
3851 
3852     Address Tmp = CreateMemTemp(E->getArg(0)->getType());
3853     Value *Val = EmitScalarExpr(E->getArg(0));
3854     Builder.CreateStore(Val, Tmp);
3855 
3856     Address LdPtr = Builder.CreateBitCast(Tmp,llvm::PointerType::getUnqual(STy));
3857     Val = Builder.CreateLoad(LdPtr);
3858 
3859     Value *Arg0 = Builder.CreateExtractValue(Val, 0);
3860     Value *Arg1 = Builder.CreateExtractValue(Val, 1);
3861     Value *StPtr = Builder.CreateBitCast(EmitScalarExpr(E->getArg(1)), Int8PtrTy);
3862     return Builder.CreateCall(F, {Arg0, Arg1, StPtr}, "strexd");
3863   }
3864 
3865   if (BuiltinID == ARM::BI__builtin_arm_strex ||
3866       BuiltinID == ARM::BI__builtin_arm_stlex) {
3867     Value *StoreVal = EmitScalarExpr(E->getArg(0));
3868     Value *StoreAddr = EmitScalarExpr(E->getArg(1));
3869 
3870     QualType Ty = E->getArg(0)->getType();
3871     llvm::Type *StoreTy = llvm::IntegerType::get(getLLVMContext(),
3872                                                  getContext().getTypeSize(Ty));
3873     StoreAddr = Builder.CreateBitCast(StoreAddr, StoreTy->getPointerTo());
3874 
3875     if (StoreVal->getType()->isPointerTy())
3876       StoreVal = Builder.CreatePtrToInt(StoreVal, Int32Ty);
3877     else {
3878       StoreVal = Builder.CreateBitCast(StoreVal, StoreTy);
3879       StoreVal = Builder.CreateZExtOrBitCast(StoreVal, Int32Ty);
3880     }
3881 
3882     Function *F = CGM.getIntrinsic(BuiltinID == ARM::BI__builtin_arm_stlex
3883                                        ? Intrinsic::arm_stlex
3884                                        : Intrinsic::arm_strex,
3885                                    StoreAddr->getType());
3886     return Builder.CreateCall(F, {StoreVal, StoreAddr}, "strex");
3887   }
3888 
3889   if (BuiltinID == ARM::BI__builtin_arm_clrex) {
3890     Function *F = CGM.getIntrinsic(Intrinsic::arm_clrex);
3891     return Builder.CreateCall(F);
3892   }
3893 
3894   // CRC32
3895   Intrinsic::ID CRCIntrinsicID = Intrinsic::not_intrinsic;
3896   switch (BuiltinID) {
3897   case ARM::BI__builtin_arm_crc32b:
3898     CRCIntrinsicID = Intrinsic::arm_crc32b; break;
3899   case ARM::BI__builtin_arm_crc32cb:
3900     CRCIntrinsicID = Intrinsic::arm_crc32cb; break;
3901   case ARM::BI__builtin_arm_crc32h:
3902     CRCIntrinsicID = Intrinsic::arm_crc32h; break;
3903   case ARM::BI__builtin_arm_crc32ch:
3904     CRCIntrinsicID = Intrinsic::arm_crc32ch; break;
3905   case ARM::BI__builtin_arm_crc32w:
3906   case ARM::BI__builtin_arm_crc32d:
3907     CRCIntrinsicID = Intrinsic::arm_crc32w; break;
3908   case ARM::BI__builtin_arm_crc32cw:
3909   case ARM::BI__builtin_arm_crc32cd:
3910     CRCIntrinsicID = Intrinsic::arm_crc32cw; break;
3911   }
3912 
3913   if (CRCIntrinsicID != Intrinsic::not_intrinsic) {
3914     Value *Arg0 = EmitScalarExpr(E->getArg(0));
3915     Value *Arg1 = EmitScalarExpr(E->getArg(1));
3916 
3917     // crc32{c,}d intrinsics are implemnted as two calls to crc32{c,}w
3918     // intrinsics, hence we need different codegen for these cases.
3919     if (BuiltinID == ARM::BI__builtin_arm_crc32d ||
3920         BuiltinID == ARM::BI__builtin_arm_crc32cd) {
3921       Value *C1 = llvm::ConstantInt::get(Int64Ty, 32);
3922       Value *Arg1a = Builder.CreateTruncOrBitCast(Arg1, Int32Ty);
3923       Value *Arg1b = Builder.CreateLShr(Arg1, C1);
3924       Arg1b = Builder.CreateTruncOrBitCast(Arg1b, Int32Ty);
3925 
3926       Function *F = CGM.getIntrinsic(CRCIntrinsicID);
3927       Value *Res = Builder.CreateCall(F, {Arg0, Arg1a});
3928       return Builder.CreateCall(F, {Res, Arg1b});
3929     } else {
3930       Arg1 = Builder.CreateZExtOrBitCast(Arg1, Int32Ty);
3931 
3932       Function *F = CGM.getIntrinsic(CRCIntrinsicID);
3933       return Builder.CreateCall(F, {Arg0, Arg1});
3934     }
3935   }
3936 
3937   if (BuiltinID == ARM::BI__builtin_arm_rsr ||
3938       BuiltinID == ARM::BI__builtin_arm_rsr64 ||
3939       BuiltinID == ARM::BI__builtin_arm_rsrp ||
3940       BuiltinID == ARM::BI__builtin_arm_wsr ||
3941       BuiltinID == ARM::BI__builtin_arm_wsr64 ||
3942       BuiltinID == ARM::BI__builtin_arm_wsrp) {
3943 
3944     bool IsRead = BuiltinID == ARM::BI__builtin_arm_rsr ||
3945                   BuiltinID == ARM::BI__builtin_arm_rsr64 ||
3946                   BuiltinID == ARM::BI__builtin_arm_rsrp;
3947 
3948     bool IsPointerBuiltin = BuiltinID == ARM::BI__builtin_arm_rsrp ||
3949                             BuiltinID == ARM::BI__builtin_arm_wsrp;
3950 
3951     bool Is64Bit = BuiltinID == ARM::BI__builtin_arm_rsr64 ||
3952                    BuiltinID == ARM::BI__builtin_arm_wsr64;
3953 
3954     llvm::Type *ValueType;
3955     llvm::Type *RegisterType;
3956     if (IsPointerBuiltin) {
3957       ValueType = VoidPtrTy;
3958       RegisterType = Int32Ty;
3959     } else if (Is64Bit) {
3960       ValueType = RegisterType = Int64Ty;
3961     } else {
3962       ValueType = RegisterType = Int32Ty;
3963     }
3964 
3965     return EmitSpecialRegisterBuiltin(*this, E, RegisterType, ValueType, IsRead);
3966   }
3967 
3968   // Find out if any arguments are required to be integer constant
3969   // expressions.
3970   unsigned ICEArguments = 0;
3971   ASTContext::GetBuiltinTypeError Error;
3972   getContext().GetBuiltinType(BuiltinID, Error, &ICEArguments);
3973   assert(Error == ASTContext::GE_None && "Should not codegen an error");
3974 
3975   auto getAlignmentValue32 = [&](Address addr) -> Value* {
3976     return Builder.getInt32(addr.getAlignment().getQuantity());
3977   };
3978 
3979   Address PtrOp0 = Address::invalid();
3980   Address PtrOp1 = Address::invalid();
3981   SmallVector<Value*, 4> Ops;
3982   bool HasExtraArg = HasExtraNeonArgument(BuiltinID);
3983   unsigned NumArgs = E->getNumArgs() - (HasExtraArg ? 1 : 0);
3984   for (unsigned i = 0, e = NumArgs; i != e; i++) {
3985     if (i == 0) {
3986       switch (BuiltinID) {
3987       case NEON::BI__builtin_neon_vld1_v:
3988       case NEON::BI__builtin_neon_vld1q_v:
3989       case NEON::BI__builtin_neon_vld1q_lane_v:
3990       case NEON::BI__builtin_neon_vld1_lane_v:
3991       case NEON::BI__builtin_neon_vld1_dup_v:
3992       case NEON::BI__builtin_neon_vld1q_dup_v:
3993       case NEON::BI__builtin_neon_vst1_v:
3994       case NEON::BI__builtin_neon_vst1q_v:
3995       case NEON::BI__builtin_neon_vst1q_lane_v:
3996       case NEON::BI__builtin_neon_vst1_lane_v:
3997       case NEON::BI__builtin_neon_vst2_v:
3998       case NEON::BI__builtin_neon_vst2q_v:
3999       case NEON::BI__builtin_neon_vst2_lane_v:
4000       case NEON::BI__builtin_neon_vst2q_lane_v:
4001       case NEON::BI__builtin_neon_vst3_v:
4002       case NEON::BI__builtin_neon_vst3q_v:
4003       case NEON::BI__builtin_neon_vst3_lane_v:
4004       case NEON::BI__builtin_neon_vst3q_lane_v:
4005       case NEON::BI__builtin_neon_vst4_v:
4006       case NEON::BI__builtin_neon_vst4q_v:
4007       case NEON::BI__builtin_neon_vst4_lane_v:
4008       case NEON::BI__builtin_neon_vst4q_lane_v:
4009         // Get the alignment for the argument in addition to the value;
4010         // we'll use it later.
4011         PtrOp0 = EmitPointerWithAlignment(E->getArg(0));
4012         Ops.push_back(PtrOp0.getPointer());
4013         continue;
4014       }
4015     }
4016     if (i == 1) {
4017       switch (BuiltinID) {
4018       case NEON::BI__builtin_neon_vld2_v:
4019       case NEON::BI__builtin_neon_vld2q_v:
4020       case NEON::BI__builtin_neon_vld3_v:
4021       case NEON::BI__builtin_neon_vld3q_v:
4022       case NEON::BI__builtin_neon_vld4_v:
4023       case NEON::BI__builtin_neon_vld4q_v:
4024       case NEON::BI__builtin_neon_vld2_lane_v:
4025       case NEON::BI__builtin_neon_vld2q_lane_v:
4026       case NEON::BI__builtin_neon_vld3_lane_v:
4027       case NEON::BI__builtin_neon_vld3q_lane_v:
4028       case NEON::BI__builtin_neon_vld4_lane_v:
4029       case NEON::BI__builtin_neon_vld4q_lane_v:
4030       case NEON::BI__builtin_neon_vld2_dup_v:
4031       case NEON::BI__builtin_neon_vld3_dup_v:
4032       case NEON::BI__builtin_neon_vld4_dup_v:
4033         // Get the alignment for the argument in addition to the value;
4034         // we'll use it later.
4035         PtrOp1 = EmitPointerWithAlignment(E->getArg(1));
4036         Ops.push_back(PtrOp1.getPointer());
4037         continue;
4038       }
4039     }
4040 
4041     if ((ICEArguments & (1 << i)) == 0) {
4042       Ops.push_back(EmitScalarExpr(E->getArg(i)));
4043     } else {
4044       // If this is required to be a constant, constant fold it so that we know
4045       // that the generated intrinsic gets a ConstantInt.
4046       llvm::APSInt Result;
4047       bool IsConst = E->getArg(i)->isIntegerConstantExpr(Result, getContext());
4048       assert(IsConst && "Constant arg isn't actually constant?"); (void)IsConst;
4049       Ops.push_back(llvm::ConstantInt::get(getLLVMContext(), Result));
4050     }
4051   }
4052 
4053   switch (BuiltinID) {
4054   default: break;
4055 
4056   case NEON::BI__builtin_neon_vget_lane_i8:
4057   case NEON::BI__builtin_neon_vget_lane_i16:
4058   case NEON::BI__builtin_neon_vget_lane_i32:
4059   case NEON::BI__builtin_neon_vget_lane_i64:
4060   case NEON::BI__builtin_neon_vget_lane_f32:
4061   case NEON::BI__builtin_neon_vgetq_lane_i8:
4062   case NEON::BI__builtin_neon_vgetq_lane_i16:
4063   case NEON::BI__builtin_neon_vgetq_lane_i32:
4064   case NEON::BI__builtin_neon_vgetq_lane_i64:
4065   case NEON::BI__builtin_neon_vgetq_lane_f32:
4066     return Builder.CreateExtractElement(Ops[0], Ops[1], "vget_lane");
4067 
4068   case NEON::BI__builtin_neon_vset_lane_i8:
4069   case NEON::BI__builtin_neon_vset_lane_i16:
4070   case NEON::BI__builtin_neon_vset_lane_i32:
4071   case NEON::BI__builtin_neon_vset_lane_i64:
4072   case NEON::BI__builtin_neon_vset_lane_f32:
4073   case NEON::BI__builtin_neon_vsetq_lane_i8:
4074   case NEON::BI__builtin_neon_vsetq_lane_i16:
4075   case NEON::BI__builtin_neon_vsetq_lane_i32:
4076   case NEON::BI__builtin_neon_vsetq_lane_i64:
4077   case NEON::BI__builtin_neon_vsetq_lane_f32:
4078     return Builder.CreateInsertElement(Ops[1], Ops[0], Ops[2], "vset_lane");
4079 
4080   case NEON::BI__builtin_neon_vsha1h_u32:
4081     return EmitNeonCall(CGM.getIntrinsic(Intrinsic::arm_neon_sha1h), Ops,
4082                         "vsha1h");
4083   case NEON::BI__builtin_neon_vsha1cq_u32:
4084     return EmitNeonCall(CGM.getIntrinsic(Intrinsic::arm_neon_sha1c), Ops,
4085                         "vsha1h");
4086   case NEON::BI__builtin_neon_vsha1pq_u32:
4087     return EmitNeonCall(CGM.getIntrinsic(Intrinsic::arm_neon_sha1p), Ops,
4088                         "vsha1h");
4089   case NEON::BI__builtin_neon_vsha1mq_u32:
4090     return EmitNeonCall(CGM.getIntrinsic(Intrinsic::arm_neon_sha1m), Ops,
4091                         "vsha1h");
4092 
4093   // The ARM _MoveToCoprocessor builtins put the input register value as
4094   // the first argument, but the LLVM intrinsic expects it as the third one.
4095   case ARM::BI_MoveToCoprocessor:
4096   case ARM::BI_MoveToCoprocessor2: {
4097     Function *F = CGM.getIntrinsic(BuiltinID == ARM::BI_MoveToCoprocessor ?
4098                                    Intrinsic::arm_mcr : Intrinsic::arm_mcr2);
4099     return Builder.CreateCall(F, {Ops[1], Ops[2], Ops[0],
4100                                   Ops[3], Ops[4], Ops[5]});
4101   }
4102   }
4103 
4104   // Get the last argument, which specifies the vector type.
4105   assert(HasExtraArg);
4106   llvm::APSInt Result;
4107   const Expr *Arg = E->getArg(E->getNumArgs()-1);
4108   if (!Arg->isIntegerConstantExpr(Result, getContext()))
4109     return nullptr;
4110 
4111   if (BuiltinID == ARM::BI__builtin_arm_vcvtr_f ||
4112       BuiltinID == ARM::BI__builtin_arm_vcvtr_d) {
4113     // Determine the overloaded type of this builtin.
4114     llvm::Type *Ty;
4115     if (BuiltinID == ARM::BI__builtin_arm_vcvtr_f)
4116       Ty = FloatTy;
4117     else
4118       Ty = DoubleTy;
4119 
4120     // Determine whether this is an unsigned conversion or not.
4121     bool usgn = Result.getZExtValue() == 1;
4122     unsigned Int = usgn ? Intrinsic::arm_vcvtru : Intrinsic::arm_vcvtr;
4123 
4124     // Call the appropriate intrinsic.
4125     Function *F = CGM.getIntrinsic(Int, Ty);
4126     return Builder.CreateCall(F, Ops, "vcvtr");
4127   }
4128 
4129   // Determine the type of this overloaded NEON intrinsic.
4130   NeonTypeFlags Type(Result.getZExtValue());
4131   bool usgn = Type.isUnsigned();
4132   bool rightShift = false;
4133 
4134   llvm::VectorType *VTy = GetNeonType(this, Type);
4135   llvm::Type *Ty = VTy;
4136   if (!Ty)
4137     return nullptr;
4138 
4139   // Many NEON builtins have identical semantics and uses in ARM and
4140   // AArch64. Emit these in a single function.
4141   auto IntrinsicMap = makeArrayRef(ARMSIMDIntrinsicMap);
4142   const NeonIntrinsicInfo *Builtin = findNeonIntrinsicInMap(
4143       IntrinsicMap, BuiltinID, NEONSIMDIntrinsicsProvenSorted);
4144   if (Builtin)
4145     return EmitCommonNeonBuiltinExpr(
4146         Builtin->BuiltinID, Builtin->LLVMIntrinsic, Builtin->AltLLVMIntrinsic,
4147         Builtin->NameHint, Builtin->TypeModifier, E, Ops, PtrOp0, PtrOp1);
4148 
4149   unsigned Int;
4150   switch (BuiltinID) {
4151   default: return nullptr;
4152   case NEON::BI__builtin_neon_vld1q_lane_v:
4153     // Handle 64-bit integer elements as a special case.  Use shuffles of
4154     // one-element vectors to avoid poor code for i64 in the backend.
4155     if (VTy->getElementType()->isIntegerTy(64)) {
4156       // Extract the other lane.
4157       Ops[1] = Builder.CreateBitCast(Ops[1], Ty);
4158       uint32_t Lane = cast<ConstantInt>(Ops[2])->getZExtValue();
4159       Value *SV = llvm::ConstantVector::get(ConstantInt::get(Int32Ty, 1-Lane));
4160       Ops[1] = Builder.CreateShuffleVector(Ops[1], Ops[1], SV);
4161       // Load the value as a one-element vector.
4162       Ty = llvm::VectorType::get(VTy->getElementType(), 1);
4163       llvm::Type *Tys[] = {Ty, Int8PtrTy};
4164       Function *F = CGM.getIntrinsic(Intrinsic::arm_neon_vld1, Tys);
4165       Value *Align = getAlignmentValue32(PtrOp0);
4166       Value *Ld = Builder.CreateCall(F, {Ops[0], Align});
4167       // Combine them.
4168       uint32_t Indices[] = {1 - Lane, Lane};
4169       SV = llvm::ConstantDataVector::get(getLLVMContext(), Indices);
4170       return Builder.CreateShuffleVector(Ops[1], Ld, SV, "vld1q_lane");
4171     }
4172     // fall through
4173   case NEON::BI__builtin_neon_vld1_lane_v: {
4174     Ops[1] = Builder.CreateBitCast(Ops[1], Ty);
4175     PtrOp0 = Builder.CreateElementBitCast(PtrOp0, VTy->getElementType());
4176     Value *Ld = Builder.CreateLoad(PtrOp0);
4177     return Builder.CreateInsertElement(Ops[1], Ld, Ops[2], "vld1_lane");
4178   }
4179   case NEON::BI__builtin_neon_vld2_dup_v:
4180   case NEON::BI__builtin_neon_vld3_dup_v:
4181   case NEON::BI__builtin_neon_vld4_dup_v: {
4182     // Handle 64-bit elements as a special-case.  There is no "dup" needed.
4183     if (VTy->getElementType()->getPrimitiveSizeInBits() == 64) {
4184       switch (BuiltinID) {
4185       case NEON::BI__builtin_neon_vld2_dup_v:
4186         Int = Intrinsic::arm_neon_vld2;
4187         break;
4188       case NEON::BI__builtin_neon_vld3_dup_v:
4189         Int = Intrinsic::arm_neon_vld3;
4190         break;
4191       case NEON::BI__builtin_neon_vld4_dup_v:
4192         Int = Intrinsic::arm_neon_vld4;
4193         break;
4194       default: llvm_unreachable("unknown vld_dup intrinsic?");
4195       }
4196       llvm::Type *Tys[] = {Ty, Int8PtrTy};
4197       Function *F = CGM.getIntrinsic(Int, Tys);
4198       llvm::Value *Align = getAlignmentValue32(PtrOp1);
4199       Ops[1] = Builder.CreateCall(F, {Ops[1], Align}, "vld_dup");
4200       Ty = llvm::PointerType::getUnqual(Ops[1]->getType());
4201       Ops[0] = Builder.CreateBitCast(Ops[0], Ty);
4202       return Builder.CreateDefaultAlignedStore(Ops[1], Ops[0]);
4203     }
4204     switch (BuiltinID) {
4205     case NEON::BI__builtin_neon_vld2_dup_v:
4206       Int = Intrinsic::arm_neon_vld2lane;
4207       break;
4208     case NEON::BI__builtin_neon_vld3_dup_v:
4209       Int = Intrinsic::arm_neon_vld3lane;
4210       break;
4211     case NEON::BI__builtin_neon_vld4_dup_v:
4212       Int = Intrinsic::arm_neon_vld4lane;
4213       break;
4214     default: llvm_unreachable("unknown vld_dup intrinsic?");
4215     }
4216     llvm::Type *Tys[] = {Ty, Int8PtrTy};
4217     Function *F = CGM.getIntrinsic(Int, Tys);
4218     llvm::StructType *STy = cast<llvm::StructType>(F->getReturnType());
4219 
4220     SmallVector<Value*, 6> Args;
4221     Args.push_back(Ops[1]);
4222     Args.append(STy->getNumElements(), UndefValue::get(Ty));
4223 
4224     llvm::Constant *CI = ConstantInt::get(Int32Ty, 0);
4225     Args.push_back(CI);
4226     Args.push_back(getAlignmentValue32(PtrOp1));
4227 
4228     Ops[1] = Builder.CreateCall(F, Args, "vld_dup");
4229     // splat lane 0 to all elts in each vector of the result.
4230     for (unsigned i = 0, e = STy->getNumElements(); i != e; ++i) {
4231       Value *Val = Builder.CreateExtractValue(Ops[1], i);
4232       Value *Elt = Builder.CreateBitCast(Val, Ty);
4233       Elt = EmitNeonSplat(Elt, CI);
4234       Elt = Builder.CreateBitCast(Elt, Val->getType());
4235       Ops[1] = Builder.CreateInsertValue(Ops[1], Elt, i);
4236     }
4237     Ty = llvm::PointerType::getUnqual(Ops[1]->getType());
4238     Ops[0] = Builder.CreateBitCast(Ops[0], Ty);
4239     return Builder.CreateDefaultAlignedStore(Ops[1], Ops[0]);
4240   }
4241   case NEON::BI__builtin_neon_vqrshrn_n_v:
4242     Int =
4243       usgn ? Intrinsic::arm_neon_vqrshiftnu : Intrinsic::arm_neon_vqrshiftns;
4244     return EmitNeonCall(CGM.getIntrinsic(Int, Ty), Ops, "vqrshrn_n",
4245                         1, true);
4246   case NEON::BI__builtin_neon_vqrshrun_n_v:
4247     return EmitNeonCall(CGM.getIntrinsic(Intrinsic::arm_neon_vqrshiftnsu, Ty),
4248                         Ops, "vqrshrun_n", 1, true);
4249   case NEON::BI__builtin_neon_vqshrn_n_v:
4250     Int = usgn ? Intrinsic::arm_neon_vqshiftnu : Intrinsic::arm_neon_vqshiftns;
4251     return EmitNeonCall(CGM.getIntrinsic(Int, Ty), Ops, "vqshrn_n",
4252                         1, true);
4253   case NEON::BI__builtin_neon_vqshrun_n_v:
4254     return EmitNeonCall(CGM.getIntrinsic(Intrinsic::arm_neon_vqshiftnsu, Ty),
4255                         Ops, "vqshrun_n", 1, true);
4256   case NEON::BI__builtin_neon_vrecpe_v:
4257   case NEON::BI__builtin_neon_vrecpeq_v:
4258     return EmitNeonCall(CGM.getIntrinsic(Intrinsic::arm_neon_vrecpe, Ty),
4259                         Ops, "vrecpe");
4260   case NEON::BI__builtin_neon_vrshrn_n_v:
4261     return EmitNeonCall(CGM.getIntrinsic(Intrinsic::arm_neon_vrshiftn, Ty),
4262                         Ops, "vrshrn_n", 1, true);
4263   case NEON::BI__builtin_neon_vrsra_n_v:
4264   case NEON::BI__builtin_neon_vrsraq_n_v:
4265     Ops[0] = Builder.CreateBitCast(Ops[0], Ty);
4266     Ops[1] = Builder.CreateBitCast(Ops[1], Ty);
4267     Ops[2] = EmitNeonShiftVector(Ops[2], Ty, true);
4268     Int = usgn ? Intrinsic::arm_neon_vrshiftu : Intrinsic::arm_neon_vrshifts;
4269     Ops[1] = Builder.CreateCall(CGM.getIntrinsic(Int, Ty), {Ops[1], Ops[2]});
4270     return Builder.CreateAdd(Ops[0], Ops[1], "vrsra_n");
4271   case NEON::BI__builtin_neon_vsri_n_v:
4272   case NEON::BI__builtin_neon_vsriq_n_v:
4273     rightShift = true;
4274   case NEON::BI__builtin_neon_vsli_n_v:
4275   case NEON::BI__builtin_neon_vsliq_n_v:
4276     Ops[2] = EmitNeonShiftVector(Ops[2], Ty, rightShift);
4277     return EmitNeonCall(CGM.getIntrinsic(Intrinsic::arm_neon_vshiftins, Ty),
4278                         Ops, "vsli_n");
4279   case NEON::BI__builtin_neon_vsra_n_v:
4280   case NEON::BI__builtin_neon_vsraq_n_v:
4281     Ops[0] = Builder.CreateBitCast(Ops[0], Ty);
4282     Ops[1] = EmitNeonRShiftImm(Ops[1], Ops[2], Ty, usgn, "vsra_n");
4283     return Builder.CreateAdd(Ops[0], Ops[1]);
4284   case NEON::BI__builtin_neon_vst1q_lane_v:
4285     // Handle 64-bit integer elements as a special case.  Use a shuffle to get
4286     // a one-element vector and avoid poor code for i64 in the backend.
4287     if (VTy->getElementType()->isIntegerTy(64)) {
4288       Ops[1] = Builder.CreateBitCast(Ops[1], Ty);
4289       Value *SV = llvm::ConstantVector::get(cast<llvm::Constant>(Ops[2]));
4290       Ops[1] = Builder.CreateShuffleVector(Ops[1], Ops[1], SV);
4291       Ops[2] = getAlignmentValue32(PtrOp0);
4292       llvm::Type *Tys[] = {Int8PtrTy, Ops[1]->getType()};
4293       return Builder.CreateCall(CGM.getIntrinsic(Intrinsic::arm_neon_vst1,
4294                                                  Tys), Ops);
4295     }
4296     // fall through
4297   case NEON::BI__builtin_neon_vst1_lane_v: {
4298     Ops[1] = Builder.CreateBitCast(Ops[1], Ty);
4299     Ops[1] = Builder.CreateExtractElement(Ops[1], Ops[2]);
4300     Ty = llvm::PointerType::getUnqual(Ops[1]->getType());
4301     auto St = Builder.CreateStore(Ops[1], Builder.CreateBitCast(PtrOp0, Ty));
4302     return St;
4303   }
4304   case NEON::BI__builtin_neon_vtbl1_v:
4305     return EmitNeonCall(CGM.getIntrinsic(Intrinsic::arm_neon_vtbl1),
4306                         Ops, "vtbl1");
4307   case NEON::BI__builtin_neon_vtbl2_v:
4308     return EmitNeonCall(CGM.getIntrinsic(Intrinsic::arm_neon_vtbl2),
4309                         Ops, "vtbl2");
4310   case NEON::BI__builtin_neon_vtbl3_v:
4311     return EmitNeonCall(CGM.getIntrinsic(Intrinsic::arm_neon_vtbl3),
4312                         Ops, "vtbl3");
4313   case NEON::BI__builtin_neon_vtbl4_v:
4314     return EmitNeonCall(CGM.getIntrinsic(Intrinsic::arm_neon_vtbl4),
4315                         Ops, "vtbl4");
4316   case NEON::BI__builtin_neon_vtbx1_v:
4317     return EmitNeonCall(CGM.getIntrinsic(Intrinsic::arm_neon_vtbx1),
4318                         Ops, "vtbx1");
4319   case NEON::BI__builtin_neon_vtbx2_v:
4320     return EmitNeonCall(CGM.getIntrinsic(Intrinsic::arm_neon_vtbx2),
4321                         Ops, "vtbx2");
4322   case NEON::BI__builtin_neon_vtbx3_v:
4323     return EmitNeonCall(CGM.getIntrinsic(Intrinsic::arm_neon_vtbx3),
4324                         Ops, "vtbx3");
4325   case NEON::BI__builtin_neon_vtbx4_v:
4326     return EmitNeonCall(CGM.getIntrinsic(Intrinsic::arm_neon_vtbx4),
4327                         Ops, "vtbx4");
4328   }
4329 }
4330 
4331 static Value *EmitAArch64TblBuiltinExpr(CodeGenFunction &CGF, unsigned BuiltinID,
4332                                       const CallExpr *E,
4333                                       SmallVectorImpl<Value *> &Ops) {
4334   unsigned int Int = 0;
4335   const char *s = nullptr;
4336 
4337   switch (BuiltinID) {
4338   default:
4339     return nullptr;
4340   case NEON::BI__builtin_neon_vtbl1_v:
4341   case NEON::BI__builtin_neon_vqtbl1_v:
4342   case NEON::BI__builtin_neon_vqtbl1q_v:
4343   case NEON::BI__builtin_neon_vtbl2_v:
4344   case NEON::BI__builtin_neon_vqtbl2_v:
4345   case NEON::BI__builtin_neon_vqtbl2q_v:
4346   case NEON::BI__builtin_neon_vtbl3_v:
4347   case NEON::BI__builtin_neon_vqtbl3_v:
4348   case NEON::BI__builtin_neon_vqtbl3q_v:
4349   case NEON::BI__builtin_neon_vtbl4_v:
4350   case NEON::BI__builtin_neon_vqtbl4_v:
4351   case NEON::BI__builtin_neon_vqtbl4q_v:
4352     break;
4353   case NEON::BI__builtin_neon_vtbx1_v:
4354   case NEON::BI__builtin_neon_vqtbx1_v:
4355   case NEON::BI__builtin_neon_vqtbx1q_v:
4356   case NEON::BI__builtin_neon_vtbx2_v:
4357   case NEON::BI__builtin_neon_vqtbx2_v:
4358   case NEON::BI__builtin_neon_vqtbx2q_v:
4359   case NEON::BI__builtin_neon_vtbx3_v:
4360   case NEON::BI__builtin_neon_vqtbx3_v:
4361   case NEON::BI__builtin_neon_vqtbx3q_v:
4362   case NEON::BI__builtin_neon_vtbx4_v:
4363   case NEON::BI__builtin_neon_vqtbx4_v:
4364   case NEON::BI__builtin_neon_vqtbx4q_v:
4365     break;
4366   }
4367 
4368   assert(E->getNumArgs() >= 3);
4369 
4370   // Get the last argument, which specifies the vector type.
4371   llvm::APSInt Result;
4372   const Expr *Arg = E->getArg(E->getNumArgs() - 1);
4373   if (!Arg->isIntegerConstantExpr(Result, CGF.getContext()))
4374     return nullptr;
4375 
4376   // Determine the type of this overloaded NEON intrinsic.
4377   NeonTypeFlags Type(Result.getZExtValue());
4378   llvm::VectorType *Ty = GetNeonType(&CGF, Type);
4379   if (!Ty)
4380     return nullptr;
4381 
4382   CodeGen::CGBuilderTy &Builder = CGF.Builder;
4383 
4384   // AArch64 scalar builtins are not overloaded, they do not have an extra
4385   // argument that specifies the vector type, need to handle each case.
4386   switch (BuiltinID) {
4387   case NEON::BI__builtin_neon_vtbl1_v: {
4388     return packTBLDVectorList(CGF, makeArrayRef(Ops).slice(0, 1), nullptr,
4389                               Ops[1], Ty, Intrinsic::aarch64_neon_tbl1,
4390                               "vtbl1");
4391   }
4392   case NEON::BI__builtin_neon_vtbl2_v: {
4393     return packTBLDVectorList(CGF, makeArrayRef(Ops).slice(0, 2), nullptr,
4394                               Ops[2], Ty, Intrinsic::aarch64_neon_tbl1,
4395                               "vtbl1");
4396   }
4397   case NEON::BI__builtin_neon_vtbl3_v: {
4398     return packTBLDVectorList(CGF, makeArrayRef(Ops).slice(0, 3), nullptr,
4399                               Ops[3], Ty, Intrinsic::aarch64_neon_tbl2,
4400                               "vtbl2");
4401   }
4402   case NEON::BI__builtin_neon_vtbl4_v: {
4403     return packTBLDVectorList(CGF, makeArrayRef(Ops).slice(0, 4), nullptr,
4404                               Ops[4], Ty, Intrinsic::aarch64_neon_tbl2,
4405                               "vtbl2");
4406   }
4407   case NEON::BI__builtin_neon_vtbx1_v: {
4408     Value *TblRes =
4409         packTBLDVectorList(CGF, makeArrayRef(Ops).slice(1, 1), nullptr, Ops[2],
4410                            Ty, Intrinsic::aarch64_neon_tbl1, "vtbl1");
4411 
4412     llvm::Constant *EightV = ConstantInt::get(Ty, 8);
4413     Value *CmpRes = Builder.CreateICmp(ICmpInst::ICMP_UGE, Ops[2], EightV);
4414     CmpRes = Builder.CreateSExt(CmpRes, Ty);
4415 
4416     Value *EltsFromInput = Builder.CreateAnd(CmpRes, Ops[0]);
4417     Value *EltsFromTbl = Builder.CreateAnd(Builder.CreateNot(CmpRes), TblRes);
4418     return Builder.CreateOr(EltsFromInput, EltsFromTbl, "vtbx");
4419   }
4420   case NEON::BI__builtin_neon_vtbx2_v: {
4421     return packTBLDVectorList(CGF, makeArrayRef(Ops).slice(1, 2), Ops[0],
4422                               Ops[3], Ty, Intrinsic::aarch64_neon_tbx1,
4423                               "vtbx1");
4424   }
4425   case NEON::BI__builtin_neon_vtbx3_v: {
4426     Value *TblRes =
4427         packTBLDVectorList(CGF, makeArrayRef(Ops).slice(1, 3), nullptr, Ops[4],
4428                            Ty, Intrinsic::aarch64_neon_tbl2, "vtbl2");
4429 
4430     llvm::Constant *TwentyFourV = ConstantInt::get(Ty, 24);
4431     Value *CmpRes = Builder.CreateICmp(ICmpInst::ICMP_UGE, Ops[4],
4432                                            TwentyFourV);
4433     CmpRes = Builder.CreateSExt(CmpRes, Ty);
4434 
4435     Value *EltsFromInput = Builder.CreateAnd(CmpRes, Ops[0]);
4436     Value *EltsFromTbl = Builder.CreateAnd(Builder.CreateNot(CmpRes), TblRes);
4437     return Builder.CreateOr(EltsFromInput, EltsFromTbl, "vtbx");
4438   }
4439   case NEON::BI__builtin_neon_vtbx4_v: {
4440     return packTBLDVectorList(CGF, makeArrayRef(Ops).slice(1, 4), Ops[0],
4441                               Ops[5], Ty, Intrinsic::aarch64_neon_tbx2,
4442                               "vtbx2");
4443   }
4444   case NEON::BI__builtin_neon_vqtbl1_v:
4445   case NEON::BI__builtin_neon_vqtbl1q_v:
4446     Int = Intrinsic::aarch64_neon_tbl1; s = "vtbl1"; break;
4447   case NEON::BI__builtin_neon_vqtbl2_v:
4448   case NEON::BI__builtin_neon_vqtbl2q_v: {
4449     Int = Intrinsic::aarch64_neon_tbl2; s = "vtbl2"; break;
4450   case NEON::BI__builtin_neon_vqtbl3_v:
4451   case NEON::BI__builtin_neon_vqtbl3q_v:
4452     Int = Intrinsic::aarch64_neon_tbl3; s = "vtbl3"; break;
4453   case NEON::BI__builtin_neon_vqtbl4_v:
4454   case NEON::BI__builtin_neon_vqtbl4q_v:
4455     Int = Intrinsic::aarch64_neon_tbl4; s = "vtbl4"; break;
4456   case NEON::BI__builtin_neon_vqtbx1_v:
4457   case NEON::BI__builtin_neon_vqtbx1q_v:
4458     Int = Intrinsic::aarch64_neon_tbx1; s = "vtbx1"; break;
4459   case NEON::BI__builtin_neon_vqtbx2_v:
4460   case NEON::BI__builtin_neon_vqtbx2q_v:
4461     Int = Intrinsic::aarch64_neon_tbx2; s = "vtbx2"; break;
4462   case NEON::BI__builtin_neon_vqtbx3_v:
4463   case NEON::BI__builtin_neon_vqtbx3q_v:
4464     Int = Intrinsic::aarch64_neon_tbx3; s = "vtbx3"; break;
4465   case NEON::BI__builtin_neon_vqtbx4_v:
4466   case NEON::BI__builtin_neon_vqtbx4q_v:
4467     Int = Intrinsic::aarch64_neon_tbx4; s = "vtbx4"; break;
4468   }
4469   }
4470 
4471   if (!Int)
4472     return nullptr;
4473 
4474   Function *F = CGF.CGM.getIntrinsic(Int, Ty);
4475   return CGF.EmitNeonCall(F, Ops, s);
4476 }
4477 
4478 Value *CodeGenFunction::vectorWrapScalar16(Value *Op) {
4479   llvm::Type *VTy = llvm::VectorType::get(Int16Ty, 4);
4480   Op = Builder.CreateBitCast(Op, Int16Ty);
4481   Value *V = UndefValue::get(VTy);
4482   llvm::Constant *CI = ConstantInt::get(SizeTy, 0);
4483   Op = Builder.CreateInsertElement(V, Op, CI);
4484   return Op;
4485 }
4486 
4487 Value *CodeGenFunction::EmitAArch64BuiltinExpr(unsigned BuiltinID,
4488                                                const CallExpr *E) {
4489   unsigned HintID = static_cast<unsigned>(-1);
4490   switch (BuiltinID) {
4491   default: break;
4492   case AArch64::BI__builtin_arm_nop:
4493     HintID = 0;
4494     break;
4495   case AArch64::BI__builtin_arm_yield:
4496     HintID = 1;
4497     break;
4498   case AArch64::BI__builtin_arm_wfe:
4499     HintID = 2;
4500     break;
4501   case AArch64::BI__builtin_arm_wfi:
4502     HintID = 3;
4503     break;
4504   case AArch64::BI__builtin_arm_sev:
4505     HintID = 4;
4506     break;
4507   case AArch64::BI__builtin_arm_sevl:
4508     HintID = 5;
4509     break;
4510   }
4511 
4512   if (HintID != static_cast<unsigned>(-1)) {
4513     Function *F = CGM.getIntrinsic(Intrinsic::aarch64_hint);
4514     return Builder.CreateCall(F, llvm::ConstantInt::get(Int32Ty, HintID));
4515   }
4516 
4517   if (BuiltinID == AArch64::BI__builtin_arm_prefetch) {
4518     Value *Address         = EmitScalarExpr(E->getArg(0));
4519     Value *RW              = EmitScalarExpr(E->getArg(1));
4520     Value *CacheLevel      = EmitScalarExpr(E->getArg(2));
4521     Value *RetentionPolicy = EmitScalarExpr(E->getArg(3));
4522     Value *IsData          = EmitScalarExpr(E->getArg(4));
4523 
4524     Value *Locality = nullptr;
4525     if (cast<llvm::ConstantInt>(RetentionPolicy)->isZero()) {
4526       // Temporal fetch, needs to convert cache level to locality.
4527       Locality = llvm::ConstantInt::get(Int32Ty,
4528         -cast<llvm::ConstantInt>(CacheLevel)->getValue() + 3);
4529     } else {
4530       // Streaming fetch.
4531       Locality = llvm::ConstantInt::get(Int32Ty, 0);
4532     }
4533 
4534     // FIXME: We need AArch64 specific LLVM intrinsic if we want to specify
4535     // PLDL3STRM or PLDL2STRM.
4536     Value *F = CGM.getIntrinsic(Intrinsic::prefetch);
4537     return Builder.CreateCall(F, {Address, RW, Locality, IsData});
4538   }
4539 
4540   if (BuiltinID == AArch64::BI__builtin_arm_rbit) {
4541     assert((getContext().getTypeSize(E->getType()) == 32) &&
4542            "rbit of unusual size!");
4543     llvm::Value *Arg = EmitScalarExpr(E->getArg(0));
4544     return Builder.CreateCall(
4545         CGM.getIntrinsic(Intrinsic::aarch64_rbit, Arg->getType()), Arg, "rbit");
4546   }
4547   if (BuiltinID == AArch64::BI__builtin_arm_rbit64) {
4548     assert((getContext().getTypeSize(E->getType()) == 64) &&
4549            "rbit of unusual size!");
4550     llvm::Value *Arg = EmitScalarExpr(E->getArg(0));
4551     return Builder.CreateCall(
4552         CGM.getIntrinsic(Intrinsic::aarch64_rbit, Arg->getType()), Arg, "rbit");
4553   }
4554 
4555   if (BuiltinID == AArch64::BI__clear_cache) {
4556     assert(E->getNumArgs() == 2 && "__clear_cache takes 2 arguments");
4557     const FunctionDecl *FD = E->getDirectCallee();
4558     Value *Ops[2];
4559     for (unsigned i = 0; i < 2; i++)
4560       Ops[i] = EmitScalarExpr(E->getArg(i));
4561     llvm::Type *Ty = CGM.getTypes().ConvertType(FD->getType());
4562     llvm::FunctionType *FTy = cast<llvm::FunctionType>(Ty);
4563     StringRef Name = FD->getName();
4564     return EmitNounwindRuntimeCall(CGM.CreateRuntimeFunction(FTy, Name), Ops);
4565   }
4566 
4567   if ((BuiltinID == AArch64::BI__builtin_arm_ldrex ||
4568       BuiltinID == AArch64::BI__builtin_arm_ldaex) &&
4569       getContext().getTypeSize(E->getType()) == 128) {
4570     Function *F = CGM.getIntrinsic(BuiltinID == AArch64::BI__builtin_arm_ldaex
4571                                        ? Intrinsic::aarch64_ldaxp
4572                                        : Intrinsic::aarch64_ldxp);
4573 
4574     Value *LdPtr = EmitScalarExpr(E->getArg(0));
4575     Value *Val = Builder.CreateCall(F, Builder.CreateBitCast(LdPtr, Int8PtrTy),
4576                                     "ldxp");
4577 
4578     Value *Val0 = Builder.CreateExtractValue(Val, 1);
4579     Value *Val1 = Builder.CreateExtractValue(Val, 0);
4580     llvm::Type *Int128Ty = llvm::IntegerType::get(getLLVMContext(), 128);
4581     Val0 = Builder.CreateZExt(Val0, Int128Ty);
4582     Val1 = Builder.CreateZExt(Val1, Int128Ty);
4583 
4584     Value *ShiftCst = llvm::ConstantInt::get(Int128Ty, 64);
4585     Val = Builder.CreateShl(Val0, ShiftCst, "shl", true /* nuw */);
4586     Val = Builder.CreateOr(Val, Val1);
4587     return Builder.CreateBitCast(Val, ConvertType(E->getType()));
4588   } else if (BuiltinID == AArch64::BI__builtin_arm_ldrex ||
4589              BuiltinID == AArch64::BI__builtin_arm_ldaex) {
4590     Value *LoadAddr = EmitScalarExpr(E->getArg(0));
4591 
4592     QualType Ty = E->getType();
4593     llvm::Type *RealResTy = ConvertType(Ty);
4594     llvm::Type *IntResTy = llvm::IntegerType::get(getLLVMContext(),
4595                                                   getContext().getTypeSize(Ty));
4596     LoadAddr = Builder.CreateBitCast(LoadAddr, IntResTy->getPointerTo());
4597 
4598     Function *F = CGM.getIntrinsic(BuiltinID == AArch64::BI__builtin_arm_ldaex
4599                                        ? Intrinsic::aarch64_ldaxr
4600                                        : Intrinsic::aarch64_ldxr,
4601                                    LoadAddr->getType());
4602     Value *Val = Builder.CreateCall(F, LoadAddr, "ldxr");
4603 
4604     if (RealResTy->isPointerTy())
4605       return Builder.CreateIntToPtr(Val, RealResTy);
4606 
4607     Val = Builder.CreateTruncOrBitCast(Val, IntResTy);
4608     return Builder.CreateBitCast(Val, RealResTy);
4609   }
4610 
4611   if ((BuiltinID == AArch64::BI__builtin_arm_strex ||
4612        BuiltinID == AArch64::BI__builtin_arm_stlex) &&
4613       getContext().getTypeSize(E->getArg(0)->getType()) == 128) {
4614     Function *F = CGM.getIntrinsic(BuiltinID == AArch64::BI__builtin_arm_stlex
4615                                        ? Intrinsic::aarch64_stlxp
4616                                        : Intrinsic::aarch64_stxp);
4617     llvm::Type *STy = llvm::StructType::get(Int64Ty, Int64Ty, nullptr);
4618 
4619     Address Tmp = CreateMemTemp(E->getArg(0)->getType());
4620     EmitAnyExprToMem(E->getArg(0), Tmp, Qualifiers(), /*init*/ true);
4621 
4622     Tmp = Builder.CreateBitCast(Tmp, llvm::PointerType::getUnqual(STy));
4623     llvm::Value *Val = Builder.CreateLoad(Tmp);
4624 
4625     Value *Arg0 = Builder.CreateExtractValue(Val, 0);
4626     Value *Arg1 = Builder.CreateExtractValue(Val, 1);
4627     Value *StPtr = Builder.CreateBitCast(EmitScalarExpr(E->getArg(1)),
4628                                          Int8PtrTy);
4629     return Builder.CreateCall(F, {Arg0, Arg1, StPtr}, "stxp");
4630   }
4631 
4632   if (BuiltinID == AArch64::BI__builtin_arm_strex ||
4633       BuiltinID == AArch64::BI__builtin_arm_stlex) {
4634     Value *StoreVal = EmitScalarExpr(E->getArg(0));
4635     Value *StoreAddr = EmitScalarExpr(E->getArg(1));
4636 
4637     QualType Ty = E->getArg(0)->getType();
4638     llvm::Type *StoreTy = llvm::IntegerType::get(getLLVMContext(),
4639                                                  getContext().getTypeSize(Ty));
4640     StoreAddr = Builder.CreateBitCast(StoreAddr, StoreTy->getPointerTo());
4641 
4642     if (StoreVal->getType()->isPointerTy())
4643       StoreVal = Builder.CreatePtrToInt(StoreVal, Int64Ty);
4644     else {
4645       StoreVal = Builder.CreateBitCast(StoreVal, StoreTy);
4646       StoreVal = Builder.CreateZExtOrBitCast(StoreVal, Int64Ty);
4647     }
4648 
4649     Function *F = CGM.getIntrinsic(BuiltinID == AArch64::BI__builtin_arm_stlex
4650                                        ? Intrinsic::aarch64_stlxr
4651                                        : Intrinsic::aarch64_stxr,
4652                                    StoreAddr->getType());
4653     return Builder.CreateCall(F, {StoreVal, StoreAddr}, "stxr");
4654   }
4655 
4656   if (BuiltinID == AArch64::BI__builtin_arm_clrex) {
4657     Function *F = CGM.getIntrinsic(Intrinsic::aarch64_clrex);
4658     return Builder.CreateCall(F);
4659   }
4660 
4661   if (BuiltinID == AArch64::BI__builtin_thread_pointer) {
4662     Function *F = CGM.getIntrinsic(Intrinsic::aarch64_thread_pointer);
4663     return Builder.CreateCall(F);
4664   }
4665 
4666   // CRC32
4667   Intrinsic::ID CRCIntrinsicID = Intrinsic::not_intrinsic;
4668   switch (BuiltinID) {
4669   case AArch64::BI__builtin_arm_crc32b:
4670     CRCIntrinsicID = Intrinsic::aarch64_crc32b; break;
4671   case AArch64::BI__builtin_arm_crc32cb:
4672     CRCIntrinsicID = Intrinsic::aarch64_crc32cb; break;
4673   case AArch64::BI__builtin_arm_crc32h:
4674     CRCIntrinsicID = Intrinsic::aarch64_crc32h; break;
4675   case AArch64::BI__builtin_arm_crc32ch:
4676     CRCIntrinsicID = Intrinsic::aarch64_crc32ch; break;
4677   case AArch64::BI__builtin_arm_crc32w:
4678     CRCIntrinsicID = Intrinsic::aarch64_crc32w; break;
4679   case AArch64::BI__builtin_arm_crc32cw:
4680     CRCIntrinsicID = Intrinsic::aarch64_crc32cw; break;
4681   case AArch64::BI__builtin_arm_crc32d:
4682     CRCIntrinsicID = Intrinsic::aarch64_crc32x; break;
4683   case AArch64::BI__builtin_arm_crc32cd:
4684     CRCIntrinsicID = Intrinsic::aarch64_crc32cx; break;
4685   }
4686 
4687   if (CRCIntrinsicID != Intrinsic::not_intrinsic) {
4688     Value *Arg0 = EmitScalarExpr(E->getArg(0));
4689     Value *Arg1 = EmitScalarExpr(E->getArg(1));
4690     Function *F = CGM.getIntrinsic(CRCIntrinsicID);
4691 
4692     llvm::Type *DataTy = F->getFunctionType()->getParamType(1);
4693     Arg1 = Builder.CreateZExtOrBitCast(Arg1, DataTy);
4694 
4695     return Builder.CreateCall(F, {Arg0, Arg1});
4696   }
4697 
4698   if (BuiltinID == AArch64::BI__builtin_arm_rsr ||
4699       BuiltinID == AArch64::BI__builtin_arm_rsr64 ||
4700       BuiltinID == AArch64::BI__builtin_arm_rsrp ||
4701       BuiltinID == AArch64::BI__builtin_arm_wsr ||
4702       BuiltinID == AArch64::BI__builtin_arm_wsr64 ||
4703       BuiltinID == AArch64::BI__builtin_arm_wsrp) {
4704 
4705     bool IsRead = BuiltinID == AArch64::BI__builtin_arm_rsr ||
4706                   BuiltinID == AArch64::BI__builtin_arm_rsr64 ||
4707                   BuiltinID == AArch64::BI__builtin_arm_rsrp;
4708 
4709     bool IsPointerBuiltin = BuiltinID == AArch64::BI__builtin_arm_rsrp ||
4710                             BuiltinID == AArch64::BI__builtin_arm_wsrp;
4711 
4712     bool Is64Bit = BuiltinID != AArch64::BI__builtin_arm_rsr &&
4713                    BuiltinID != AArch64::BI__builtin_arm_wsr;
4714 
4715     llvm::Type *ValueType;
4716     llvm::Type *RegisterType = Int64Ty;
4717     if (IsPointerBuiltin) {
4718       ValueType = VoidPtrTy;
4719     } else if (Is64Bit) {
4720       ValueType = Int64Ty;
4721     } else {
4722       ValueType = Int32Ty;
4723     }
4724 
4725     return EmitSpecialRegisterBuiltin(*this, E, RegisterType, ValueType, IsRead);
4726   }
4727 
4728   // Find out if any arguments are required to be integer constant
4729   // expressions.
4730   unsigned ICEArguments = 0;
4731   ASTContext::GetBuiltinTypeError Error;
4732   getContext().GetBuiltinType(BuiltinID, Error, &ICEArguments);
4733   assert(Error == ASTContext::GE_None && "Should not codegen an error");
4734 
4735   llvm::SmallVector<Value*, 4> Ops;
4736   for (unsigned i = 0, e = E->getNumArgs() - 1; i != e; i++) {
4737     if ((ICEArguments & (1 << i)) == 0) {
4738       Ops.push_back(EmitScalarExpr(E->getArg(i)));
4739     } else {
4740       // If this is required to be a constant, constant fold it so that we know
4741       // that the generated intrinsic gets a ConstantInt.
4742       llvm::APSInt Result;
4743       bool IsConst = E->getArg(i)->isIntegerConstantExpr(Result, getContext());
4744       assert(IsConst && "Constant arg isn't actually constant?");
4745       (void)IsConst;
4746       Ops.push_back(llvm::ConstantInt::get(getLLVMContext(), Result));
4747     }
4748   }
4749 
4750   auto SISDMap = makeArrayRef(AArch64SISDIntrinsicMap);
4751   const NeonIntrinsicInfo *Builtin = findNeonIntrinsicInMap(
4752       SISDMap, BuiltinID, AArch64SISDIntrinsicsProvenSorted);
4753 
4754   if (Builtin) {
4755     Ops.push_back(EmitScalarExpr(E->getArg(E->getNumArgs() - 1)));
4756     Value *Result = EmitCommonNeonSISDBuiltinExpr(*this, *Builtin, Ops, E);
4757     assert(Result && "SISD intrinsic should have been handled");
4758     return Result;
4759   }
4760 
4761   llvm::APSInt Result;
4762   const Expr *Arg = E->getArg(E->getNumArgs()-1);
4763   NeonTypeFlags Type(0);
4764   if (Arg->isIntegerConstantExpr(Result, getContext()))
4765     // Determine the type of this overloaded NEON intrinsic.
4766     Type = NeonTypeFlags(Result.getZExtValue());
4767 
4768   bool usgn = Type.isUnsigned();
4769   bool quad = Type.isQuad();
4770 
4771   // Handle non-overloaded intrinsics first.
4772   switch (BuiltinID) {
4773   default: break;
4774   case NEON::BI__builtin_neon_vldrq_p128: {
4775     llvm::Type *Int128PTy = llvm::Type::getIntNPtrTy(getLLVMContext(), 128);
4776     Value *Ptr = Builder.CreateBitCast(EmitScalarExpr(E->getArg(0)), Int128PTy);
4777     return Builder.CreateDefaultAlignedLoad(Ptr);
4778   }
4779   case NEON::BI__builtin_neon_vstrq_p128: {
4780     llvm::Type *Int128PTy = llvm::Type::getIntNPtrTy(getLLVMContext(), 128);
4781     Value *Ptr = Builder.CreateBitCast(Ops[0], Int128PTy);
4782     return Builder.CreateDefaultAlignedStore(EmitScalarExpr(E->getArg(1)), Ptr);
4783   }
4784   case NEON::BI__builtin_neon_vcvts_u32_f32:
4785   case NEON::BI__builtin_neon_vcvtd_u64_f64:
4786     usgn = true;
4787     // FALL THROUGH
4788   case NEON::BI__builtin_neon_vcvts_s32_f32:
4789   case NEON::BI__builtin_neon_vcvtd_s64_f64: {
4790     Ops.push_back(EmitScalarExpr(E->getArg(0)));
4791     bool Is64 = Ops[0]->getType()->getPrimitiveSizeInBits() == 64;
4792     llvm::Type *InTy = Is64 ? Int64Ty : Int32Ty;
4793     llvm::Type *FTy = Is64 ? DoubleTy : FloatTy;
4794     Ops[0] = Builder.CreateBitCast(Ops[0], FTy);
4795     if (usgn)
4796       return Builder.CreateFPToUI(Ops[0], InTy);
4797     return Builder.CreateFPToSI(Ops[0], InTy);
4798   }
4799   case NEON::BI__builtin_neon_vcvts_f32_u32:
4800   case NEON::BI__builtin_neon_vcvtd_f64_u64:
4801     usgn = true;
4802     // FALL THROUGH
4803   case NEON::BI__builtin_neon_vcvts_f32_s32:
4804   case NEON::BI__builtin_neon_vcvtd_f64_s64: {
4805     Ops.push_back(EmitScalarExpr(E->getArg(0)));
4806     bool Is64 = Ops[0]->getType()->getPrimitiveSizeInBits() == 64;
4807     llvm::Type *InTy = Is64 ? Int64Ty : Int32Ty;
4808     llvm::Type *FTy = Is64 ? DoubleTy : FloatTy;
4809     Ops[0] = Builder.CreateBitCast(Ops[0], InTy);
4810     if (usgn)
4811       return Builder.CreateUIToFP(Ops[0], FTy);
4812     return Builder.CreateSIToFP(Ops[0], FTy);
4813   }
4814   case NEON::BI__builtin_neon_vpaddd_s64: {
4815     llvm::Type *Ty = llvm::VectorType::get(Int64Ty, 2);
4816     Value *Vec = EmitScalarExpr(E->getArg(0));
4817     // The vector is v2f64, so make sure it's bitcast to that.
4818     Vec = Builder.CreateBitCast(Vec, Ty, "v2i64");
4819     llvm::Value *Idx0 = llvm::ConstantInt::get(SizeTy, 0);
4820     llvm::Value *Idx1 = llvm::ConstantInt::get(SizeTy, 1);
4821     Value *Op0 = Builder.CreateExtractElement(Vec, Idx0, "lane0");
4822     Value *Op1 = Builder.CreateExtractElement(Vec, Idx1, "lane1");
4823     // Pairwise addition of a v2f64 into a scalar f64.
4824     return Builder.CreateAdd(Op0, Op1, "vpaddd");
4825   }
4826   case NEON::BI__builtin_neon_vpaddd_f64: {
4827     llvm::Type *Ty =
4828       llvm::VectorType::get(DoubleTy, 2);
4829     Value *Vec = EmitScalarExpr(E->getArg(0));
4830     // The vector is v2f64, so make sure it's bitcast to that.
4831     Vec = Builder.CreateBitCast(Vec, Ty, "v2f64");
4832     llvm::Value *Idx0 = llvm::ConstantInt::get(SizeTy, 0);
4833     llvm::Value *Idx1 = llvm::ConstantInt::get(SizeTy, 1);
4834     Value *Op0 = Builder.CreateExtractElement(Vec, Idx0, "lane0");
4835     Value *Op1 = Builder.CreateExtractElement(Vec, Idx1, "lane1");
4836     // Pairwise addition of a v2f64 into a scalar f64.
4837     return Builder.CreateFAdd(Op0, Op1, "vpaddd");
4838   }
4839   case NEON::BI__builtin_neon_vpadds_f32: {
4840     llvm::Type *Ty =
4841       llvm::VectorType::get(FloatTy, 2);
4842     Value *Vec = EmitScalarExpr(E->getArg(0));
4843     // The vector is v2f32, so make sure it's bitcast to that.
4844     Vec = Builder.CreateBitCast(Vec, Ty, "v2f32");
4845     llvm::Value *Idx0 = llvm::ConstantInt::get(SizeTy, 0);
4846     llvm::Value *Idx1 = llvm::ConstantInt::get(SizeTy, 1);
4847     Value *Op0 = Builder.CreateExtractElement(Vec, Idx0, "lane0");
4848     Value *Op1 = Builder.CreateExtractElement(Vec, Idx1, "lane1");
4849     // Pairwise addition of a v2f32 into a scalar f32.
4850     return Builder.CreateFAdd(Op0, Op1, "vpaddd");
4851   }
4852   case NEON::BI__builtin_neon_vceqzd_s64:
4853   case NEON::BI__builtin_neon_vceqzd_f64:
4854   case NEON::BI__builtin_neon_vceqzs_f32:
4855     Ops.push_back(EmitScalarExpr(E->getArg(0)));
4856     return EmitAArch64CompareBuiltinExpr(
4857         Ops[0], ConvertType(E->getCallReturnType(getContext())),
4858         ICmpInst::FCMP_OEQ, ICmpInst::ICMP_EQ, "vceqz");
4859   case NEON::BI__builtin_neon_vcgezd_s64:
4860   case NEON::BI__builtin_neon_vcgezd_f64:
4861   case NEON::BI__builtin_neon_vcgezs_f32:
4862     Ops.push_back(EmitScalarExpr(E->getArg(0)));
4863     return EmitAArch64CompareBuiltinExpr(
4864         Ops[0], ConvertType(E->getCallReturnType(getContext())),
4865         ICmpInst::FCMP_OGE, ICmpInst::ICMP_SGE, "vcgez");
4866   case NEON::BI__builtin_neon_vclezd_s64:
4867   case NEON::BI__builtin_neon_vclezd_f64:
4868   case NEON::BI__builtin_neon_vclezs_f32:
4869     Ops.push_back(EmitScalarExpr(E->getArg(0)));
4870     return EmitAArch64CompareBuiltinExpr(
4871         Ops[0], ConvertType(E->getCallReturnType(getContext())),
4872         ICmpInst::FCMP_OLE, ICmpInst::ICMP_SLE, "vclez");
4873   case NEON::BI__builtin_neon_vcgtzd_s64:
4874   case NEON::BI__builtin_neon_vcgtzd_f64:
4875   case NEON::BI__builtin_neon_vcgtzs_f32:
4876     Ops.push_back(EmitScalarExpr(E->getArg(0)));
4877     return EmitAArch64CompareBuiltinExpr(
4878         Ops[0], ConvertType(E->getCallReturnType(getContext())),
4879         ICmpInst::FCMP_OGT, ICmpInst::ICMP_SGT, "vcgtz");
4880   case NEON::BI__builtin_neon_vcltzd_s64:
4881   case NEON::BI__builtin_neon_vcltzd_f64:
4882   case NEON::BI__builtin_neon_vcltzs_f32:
4883     Ops.push_back(EmitScalarExpr(E->getArg(0)));
4884     return EmitAArch64CompareBuiltinExpr(
4885         Ops[0], ConvertType(E->getCallReturnType(getContext())),
4886         ICmpInst::FCMP_OLT, ICmpInst::ICMP_SLT, "vcltz");
4887 
4888   case NEON::BI__builtin_neon_vceqzd_u64: {
4889     Ops.push_back(EmitScalarExpr(E->getArg(0)));
4890     Ops[0] = Builder.CreateBitCast(Ops[0], Int64Ty);
4891     Ops[0] =
4892         Builder.CreateICmpEQ(Ops[0], llvm::Constant::getNullValue(Int64Ty));
4893     return Builder.CreateSExt(Ops[0], Int64Ty, "vceqzd");
4894   }
4895   case NEON::BI__builtin_neon_vceqd_f64:
4896   case NEON::BI__builtin_neon_vcled_f64:
4897   case NEON::BI__builtin_neon_vcltd_f64:
4898   case NEON::BI__builtin_neon_vcged_f64:
4899   case NEON::BI__builtin_neon_vcgtd_f64: {
4900     llvm::CmpInst::Predicate P;
4901     switch (BuiltinID) {
4902     default: llvm_unreachable("missing builtin ID in switch!");
4903     case NEON::BI__builtin_neon_vceqd_f64: P = llvm::FCmpInst::FCMP_OEQ; break;
4904     case NEON::BI__builtin_neon_vcled_f64: P = llvm::FCmpInst::FCMP_OLE; break;
4905     case NEON::BI__builtin_neon_vcltd_f64: P = llvm::FCmpInst::FCMP_OLT; break;
4906     case NEON::BI__builtin_neon_vcged_f64: P = llvm::FCmpInst::FCMP_OGE; break;
4907     case NEON::BI__builtin_neon_vcgtd_f64: P = llvm::FCmpInst::FCMP_OGT; break;
4908     }
4909     Ops.push_back(EmitScalarExpr(E->getArg(1)));
4910     Ops[0] = Builder.CreateBitCast(Ops[0], DoubleTy);
4911     Ops[1] = Builder.CreateBitCast(Ops[1], DoubleTy);
4912     Ops[0] = Builder.CreateFCmp(P, Ops[0], Ops[1]);
4913     return Builder.CreateSExt(Ops[0], Int64Ty, "vcmpd");
4914   }
4915   case NEON::BI__builtin_neon_vceqs_f32:
4916   case NEON::BI__builtin_neon_vcles_f32:
4917   case NEON::BI__builtin_neon_vclts_f32:
4918   case NEON::BI__builtin_neon_vcges_f32:
4919   case NEON::BI__builtin_neon_vcgts_f32: {
4920     llvm::CmpInst::Predicate P;
4921     switch (BuiltinID) {
4922     default: llvm_unreachable("missing builtin ID in switch!");
4923     case NEON::BI__builtin_neon_vceqs_f32: P = llvm::FCmpInst::FCMP_OEQ; break;
4924     case NEON::BI__builtin_neon_vcles_f32: P = llvm::FCmpInst::FCMP_OLE; break;
4925     case NEON::BI__builtin_neon_vclts_f32: P = llvm::FCmpInst::FCMP_OLT; break;
4926     case NEON::BI__builtin_neon_vcges_f32: P = llvm::FCmpInst::FCMP_OGE; break;
4927     case NEON::BI__builtin_neon_vcgts_f32: P = llvm::FCmpInst::FCMP_OGT; break;
4928     }
4929     Ops.push_back(EmitScalarExpr(E->getArg(1)));
4930     Ops[0] = Builder.CreateBitCast(Ops[0], FloatTy);
4931     Ops[1] = Builder.CreateBitCast(Ops[1], FloatTy);
4932     Ops[0] = Builder.CreateFCmp(P, Ops[0], Ops[1]);
4933     return Builder.CreateSExt(Ops[0], Int32Ty, "vcmpd");
4934   }
4935   case NEON::BI__builtin_neon_vceqd_s64:
4936   case NEON::BI__builtin_neon_vceqd_u64:
4937   case NEON::BI__builtin_neon_vcgtd_s64:
4938   case NEON::BI__builtin_neon_vcgtd_u64:
4939   case NEON::BI__builtin_neon_vcltd_s64:
4940   case NEON::BI__builtin_neon_vcltd_u64:
4941   case NEON::BI__builtin_neon_vcged_u64:
4942   case NEON::BI__builtin_neon_vcged_s64:
4943   case NEON::BI__builtin_neon_vcled_u64:
4944   case NEON::BI__builtin_neon_vcled_s64: {
4945     llvm::CmpInst::Predicate P;
4946     switch (BuiltinID) {
4947     default: llvm_unreachable("missing builtin ID in switch!");
4948     case NEON::BI__builtin_neon_vceqd_s64:
4949     case NEON::BI__builtin_neon_vceqd_u64:P = llvm::ICmpInst::ICMP_EQ;break;
4950     case NEON::BI__builtin_neon_vcgtd_s64:P = llvm::ICmpInst::ICMP_SGT;break;
4951     case NEON::BI__builtin_neon_vcgtd_u64:P = llvm::ICmpInst::ICMP_UGT;break;
4952     case NEON::BI__builtin_neon_vcltd_s64:P = llvm::ICmpInst::ICMP_SLT;break;
4953     case NEON::BI__builtin_neon_vcltd_u64:P = llvm::ICmpInst::ICMP_ULT;break;
4954     case NEON::BI__builtin_neon_vcged_u64:P = llvm::ICmpInst::ICMP_UGE;break;
4955     case NEON::BI__builtin_neon_vcged_s64:P = llvm::ICmpInst::ICMP_SGE;break;
4956     case NEON::BI__builtin_neon_vcled_u64:P = llvm::ICmpInst::ICMP_ULE;break;
4957     case NEON::BI__builtin_neon_vcled_s64:P = llvm::ICmpInst::ICMP_SLE;break;
4958     }
4959     Ops.push_back(EmitScalarExpr(E->getArg(1)));
4960     Ops[0] = Builder.CreateBitCast(Ops[0], Int64Ty);
4961     Ops[1] = Builder.CreateBitCast(Ops[1], Int64Ty);
4962     Ops[0] = Builder.CreateICmp(P, Ops[0], Ops[1]);
4963     return Builder.CreateSExt(Ops[0], Int64Ty, "vceqd");
4964   }
4965   case NEON::BI__builtin_neon_vtstd_s64:
4966   case NEON::BI__builtin_neon_vtstd_u64: {
4967     Ops.push_back(EmitScalarExpr(E->getArg(1)));
4968     Ops[0] = Builder.CreateBitCast(Ops[0], Int64Ty);
4969     Ops[1] = Builder.CreateBitCast(Ops[1], Int64Ty);
4970     Ops[0] = Builder.CreateAnd(Ops[0], Ops[1]);
4971     Ops[0] = Builder.CreateICmp(ICmpInst::ICMP_NE, Ops[0],
4972                                 llvm::Constant::getNullValue(Int64Ty));
4973     return Builder.CreateSExt(Ops[0], Int64Ty, "vtstd");
4974   }
4975   case NEON::BI__builtin_neon_vset_lane_i8:
4976   case NEON::BI__builtin_neon_vset_lane_i16:
4977   case NEON::BI__builtin_neon_vset_lane_i32:
4978   case NEON::BI__builtin_neon_vset_lane_i64:
4979   case NEON::BI__builtin_neon_vset_lane_f32:
4980   case NEON::BI__builtin_neon_vsetq_lane_i8:
4981   case NEON::BI__builtin_neon_vsetq_lane_i16:
4982   case NEON::BI__builtin_neon_vsetq_lane_i32:
4983   case NEON::BI__builtin_neon_vsetq_lane_i64:
4984   case NEON::BI__builtin_neon_vsetq_lane_f32:
4985     Ops.push_back(EmitScalarExpr(E->getArg(2)));
4986     return Builder.CreateInsertElement(Ops[1], Ops[0], Ops[2], "vset_lane");
4987   case NEON::BI__builtin_neon_vset_lane_f64:
4988     // The vector type needs a cast for the v1f64 variant.
4989     Ops[1] = Builder.CreateBitCast(Ops[1],
4990                                    llvm::VectorType::get(DoubleTy, 1));
4991     Ops.push_back(EmitScalarExpr(E->getArg(2)));
4992     return Builder.CreateInsertElement(Ops[1], Ops[0], Ops[2], "vset_lane");
4993   case NEON::BI__builtin_neon_vsetq_lane_f64:
4994     // The vector type needs a cast for the v2f64 variant.
4995     Ops[1] = Builder.CreateBitCast(Ops[1],
4996         llvm::VectorType::get(DoubleTy, 2));
4997     Ops.push_back(EmitScalarExpr(E->getArg(2)));
4998     return Builder.CreateInsertElement(Ops[1], Ops[0], Ops[2], "vset_lane");
4999 
5000   case NEON::BI__builtin_neon_vget_lane_i8:
5001   case NEON::BI__builtin_neon_vdupb_lane_i8:
5002     Ops[0] = Builder.CreateBitCast(Ops[0], llvm::VectorType::get(Int8Ty, 8));
5003     return Builder.CreateExtractElement(Ops[0], EmitScalarExpr(E->getArg(1)),
5004                                         "vget_lane");
5005   case NEON::BI__builtin_neon_vgetq_lane_i8:
5006   case NEON::BI__builtin_neon_vdupb_laneq_i8:
5007     Ops[0] = Builder.CreateBitCast(Ops[0], llvm::VectorType::get(Int8Ty, 16));
5008     return Builder.CreateExtractElement(Ops[0], EmitScalarExpr(E->getArg(1)),
5009                                         "vgetq_lane");
5010   case NEON::BI__builtin_neon_vget_lane_i16:
5011   case NEON::BI__builtin_neon_vduph_lane_i16:
5012     Ops[0] = Builder.CreateBitCast(Ops[0], llvm::VectorType::get(Int16Ty, 4));
5013     return Builder.CreateExtractElement(Ops[0], EmitScalarExpr(E->getArg(1)),
5014                                         "vget_lane");
5015   case NEON::BI__builtin_neon_vgetq_lane_i16:
5016   case NEON::BI__builtin_neon_vduph_laneq_i16:
5017     Ops[0] = Builder.CreateBitCast(Ops[0], llvm::VectorType::get(Int16Ty, 8));
5018     return Builder.CreateExtractElement(Ops[0], EmitScalarExpr(E->getArg(1)),
5019                                         "vgetq_lane");
5020   case NEON::BI__builtin_neon_vget_lane_i32:
5021   case NEON::BI__builtin_neon_vdups_lane_i32:
5022     Ops[0] = Builder.CreateBitCast(Ops[0], llvm::VectorType::get(Int32Ty, 2));
5023     return Builder.CreateExtractElement(Ops[0], EmitScalarExpr(E->getArg(1)),
5024                                         "vget_lane");
5025   case NEON::BI__builtin_neon_vdups_lane_f32:
5026     Ops[0] = Builder.CreateBitCast(Ops[0],
5027         llvm::VectorType::get(FloatTy, 2));
5028     return Builder.CreateExtractElement(Ops[0], EmitScalarExpr(E->getArg(1)),
5029                                         "vdups_lane");
5030   case NEON::BI__builtin_neon_vgetq_lane_i32:
5031   case NEON::BI__builtin_neon_vdups_laneq_i32:
5032     Ops[0] = Builder.CreateBitCast(Ops[0], llvm::VectorType::get(Int32Ty, 4));
5033     return Builder.CreateExtractElement(Ops[0], EmitScalarExpr(E->getArg(1)),
5034                                         "vgetq_lane");
5035   case NEON::BI__builtin_neon_vget_lane_i64:
5036   case NEON::BI__builtin_neon_vdupd_lane_i64:
5037     Ops[0] = Builder.CreateBitCast(Ops[0], llvm::VectorType::get(Int64Ty, 1));
5038     return Builder.CreateExtractElement(Ops[0], EmitScalarExpr(E->getArg(1)),
5039                                         "vget_lane");
5040   case NEON::BI__builtin_neon_vdupd_lane_f64:
5041     Ops[0] = Builder.CreateBitCast(Ops[0],
5042         llvm::VectorType::get(DoubleTy, 1));
5043     return Builder.CreateExtractElement(Ops[0], EmitScalarExpr(E->getArg(1)),
5044                                         "vdupd_lane");
5045   case NEON::BI__builtin_neon_vgetq_lane_i64:
5046   case NEON::BI__builtin_neon_vdupd_laneq_i64:
5047     Ops[0] = Builder.CreateBitCast(Ops[0], llvm::VectorType::get(Int64Ty, 2));
5048     return Builder.CreateExtractElement(Ops[0], EmitScalarExpr(E->getArg(1)),
5049                                         "vgetq_lane");
5050   case NEON::BI__builtin_neon_vget_lane_f32:
5051     Ops[0] = Builder.CreateBitCast(Ops[0],
5052         llvm::VectorType::get(FloatTy, 2));
5053     return Builder.CreateExtractElement(Ops[0], EmitScalarExpr(E->getArg(1)),
5054                                         "vget_lane");
5055   case NEON::BI__builtin_neon_vget_lane_f64:
5056     Ops[0] = Builder.CreateBitCast(Ops[0],
5057         llvm::VectorType::get(DoubleTy, 1));
5058     return Builder.CreateExtractElement(Ops[0], EmitScalarExpr(E->getArg(1)),
5059                                         "vget_lane");
5060   case NEON::BI__builtin_neon_vgetq_lane_f32:
5061   case NEON::BI__builtin_neon_vdups_laneq_f32:
5062     Ops[0] = Builder.CreateBitCast(Ops[0],
5063         llvm::VectorType::get(FloatTy, 4));
5064     return Builder.CreateExtractElement(Ops[0], EmitScalarExpr(E->getArg(1)),
5065                                         "vgetq_lane");
5066   case NEON::BI__builtin_neon_vgetq_lane_f64:
5067   case NEON::BI__builtin_neon_vdupd_laneq_f64:
5068     Ops[0] = Builder.CreateBitCast(Ops[0],
5069         llvm::VectorType::get(DoubleTy, 2));
5070     return Builder.CreateExtractElement(Ops[0], EmitScalarExpr(E->getArg(1)),
5071                                         "vgetq_lane");
5072   case NEON::BI__builtin_neon_vaddd_s64:
5073   case NEON::BI__builtin_neon_vaddd_u64:
5074     return Builder.CreateAdd(Ops[0], EmitScalarExpr(E->getArg(1)), "vaddd");
5075   case NEON::BI__builtin_neon_vsubd_s64:
5076   case NEON::BI__builtin_neon_vsubd_u64:
5077     return Builder.CreateSub(Ops[0], EmitScalarExpr(E->getArg(1)), "vsubd");
5078   case NEON::BI__builtin_neon_vqdmlalh_s16:
5079   case NEON::BI__builtin_neon_vqdmlslh_s16: {
5080     SmallVector<Value *, 2> ProductOps;
5081     ProductOps.push_back(vectorWrapScalar16(Ops[1]));
5082     ProductOps.push_back(vectorWrapScalar16(EmitScalarExpr(E->getArg(2))));
5083     llvm::Type *VTy = llvm::VectorType::get(Int32Ty, 4);
5084     Ops[1] = EmitNeonCall(CGM.getIntrinsic(Intrinsic::aarch64_neon_sqdmull, VTy),
5085                           ProductOps, "vqdmlXl");
5086     Constant *CI = ConstantInt::get(SizeTy, 0);
5087     Ops[1] = Builder.CreateExtractElement(Ops[1], CI, "lane0");
5088 
5089     unsigned AccumInt = BuiltinID == NEON::BI__builtin_neon_vqdmlalh_s16
5090                                         ? Intrinsic::aarch64_neon_sqadd
5091                                         : Intrinsic::aarch64_neon_sqsub;
5092     return EmitNeonCall(CGM.getIntrinsic(AccumInt, Int32Ty), Ops, "vqdmlXl");
5093   }
5094   case NEON::BI__builtin_neon_vqshlud_n_s64: {
5095     Ops.push_back(EmitScalarExpr(E->getArg(1)));
5096     Ops[1] = Builder.CreateZExt(Ops[1], Int64Ty);
5097     return EmitNeonCall(CGM.getIntrinsic(Intrinsic::aarch64_neon_sqshlu, Int64Ty),
5098                         Ops, "vqshlu_n");
5099   }
5100   case NEON::BI__builtin_neon_vqshld_n_u64:
5101   case NEON::BI__builtin_neon_vqshld_n_s64: {
5102     unsigned Int = BuiltinID == NEON::BI__builtin_neon_vqshld_n_u64
5103                                    ? Intrinsic::aarch64_neon_uqshl
5104                                    : Intrinsic::aarch64_neon_sqshl;
5105     Ops.push_back(EmitScalarExpr(E->getArg(1)));
5106     Ops[1] = Builder.CreateZExt(Ops[1], Int64Ty);
5107     return EmitNeonCall(CGM.getIntrinsic(Int, Int64Ty), Ops, "vqshl_n");
5108   }
5109   case NEON::BI__builtin_neon_vrshrd_n_u64:
5110   case NEON::BI__builtin_neon_vrshrd_n_s64: {
5111     unsigned Int = BuiltinID == NEON::BI__builtin_neon_vrshrd_n_u64
5112                                    ? Intrinsic::aarch64_neon_urshl
5113                                    : Intrinsic::aarch64_neon_srshl;
5114     Ops.push_back(EmitScalarExpr(E->getArg(1)));
5115     int SV = cast<ConstantInt>(Ops[1])->getSExtValue();
5116     Ops[1] = ConstantInt::get(Int64Ty, -SV);
5117     return EmitNeonCall(CGM.getIntrinsic(Int, Int64Ty), Ops, "vrshr_n");
5118   }
5119   case NEON::BI__builtin_neon_vrsrad_n_u64:
5120   case NEON::BI__builtin_neon_vrsrad_n_s64: {
5121     unsigned Int = BuiltinID == NEON::BI__builtin_neon_vrsrad_n_u64
5122                                    ? Intrinsic::aarch64_neon_urshl
5123                                    : Intrinsic::aarch64_neon_srshl;
5124     Ops[1] = Builder.CreateBitCast(Ops[1], Int64Ty);
5125     Ops.push_back(Builder.CreateNeg(EmitScalarExpr(E->getArg(2))));
5126     Ops[1] = Builder.CreateCall(CGM.getIntrinsic(Int, Int64Ty),
5127                                 {Ops[1], Builder.CreateSExt(Ops[2], Int64Ty)});
5128     return Builder.CreateAdd(Ops[0], Builder.CreateBitCast(Ops[1], Int64Ty));
5129   }
5130   case NEON::BI__builtin_neon_vshld_n_s64:
5131   case NEON::BI__builtin_neon_vshld_n_u64: {
5132     llvm::ConstantInt *Amt = cast<ConstantInt>(EmitScalarExpr(E->getArg(1)));
5133     return Builder.CreateShl(
5134         Ops[0], ConstantInt::get(Int64Ty, Amt->getZExtValue()), "shld_n");
5135   }
5136   case NEON::BI__builtin_neon_vshrd_n_s64: {
5137     llvm::ConstantInt *Amt = cast<ConstantInt>(EmitScalarExpr(E->getArg(1)));
5138     return Builder.CreateAShr(
5139         Ops[0], ConstantInt::get(Int64Ty, std::min(static_cast<uint64_t>(63),
5140                                                    Amt->getZExtValue())),
5141         "shrd_n");
5142   }
5143   case NEON::BI__builtin_neon_vshrd_n_u64: {
5144     llvm::ConstantInt *Amt = cast<ConstantInt>(EmitScalarExpr(E->getArg(1)));
5145     uint64_t ShiftAmt = Amt->getZExtValue();
5146     // Right-shifting an unsigned value by its size yields 0.
5147     if (ShiftAmt == 64)
5148       return ConstantInt::get(Int64Ty, 0);
5149     return Builder.CreateLShr(Ops[0], ConstantInt::get(Int64Ty, ShiftAmt),
5150                               "shrd_n");
5151   }
5152   case NEON::BI__builtin_neon_vsrad_n_s64: {
5153     llvm::ConstantInt *Amt = cast<ConstantInt>(EmitScalarExpr(E->getArg(2)));
5154     Ops[1] = Builder.CreateAShr(
5155         Ops[1], ConstantInt::get(Int64Ty, std::min(static_cast<uint64_t>(63),
5156                                                    Amt->getZExtValue())),
5157         "shrd_n");
5158     return Builder.CreateAdd(Ops[0], Ops[1]);
5159   }
5160   case NEON::BI__builtin_neon_vsrad_n_u64: {
5161     llvm::ConstantInt *Amt = cast<ConstantInt>(EmitScalarExpr(E->getArg(2)));
5162     uint64_t ShiftAmt = Amt->getZExtValue();
5163     // Right-shifting an unsigned value by its size yields 0.
5164     // As Op + 0 = Op, return Ops[0] directly.
5165     if (ShiftAmt == 64)
5166       return Ops[0];
5167     Ops[1] = Builder.CreateLShr(Ops[1], ConstantInt::get(Int64Ty, ShiftAmt),
5168                                 "shrd_n");
5169     return Builder.CreateAdd(Ops[0], Ops[1]);
5170   }
5171   case NEON::BI__builtin_neon_vqdmlalh_lane_s16:
5172   case NEON::BI__builtin_neon_vqdmlalh_laneq_s16:
5173   case NEON::BI__builtin_neon_vqdmlslh_lane_s16:
5174   case NEON::BI__builtin_neon_vqdmlslh_laneq_s16: {
5175     Ops[2] = Builder.CreateExtractElement(Ops[2], EmitScalarExpr(E->getArg(3)),
5176                                           "lane");
5177     SmallVector<Value *, 2> ProductOps;
5178     ProductOps.push_back(vectorWrapScalar16(Ops[1]));
5179     ProductOps.push_back(vectorWrapScalar16(Ops[2]));
5180     llvm::Type *VTy = llvm::VectorType::get(Int32Ty, 4);
5181     Ops[1] = EmitNeonCall(CGM.getIntrinsic(Intrinsic::aarch64_neon_sqdmull, VTy),
5182                           ProductOps, "vqdmlXl");
5183     Constant *CI = ConstantInt::get(SizeTy, 0);
5184     Ops[1] = Builder.CreateExtractElement(Ops[1], CI, "lane0");
5185     Ops.pop_back();
5186 
5187     unsigned AccInt = (BuiltinID == NEON::BI__builtin_neon_vqdmlalh_lane_s16 ||
5188                        BuiltinID == NEON::BI__builtin_neon_vqdmlalh_laneq_s16)
5189                           ? Intrinsic::aarch64_neon_sqadd
5190                           : Intrinsic::aarch64_neon_sqsub;
5191     return EmitNeonCall(CGM.getIntrinsic(AccInt, Int32Ty), Ops, "vqdmlXl");
5192   }
5193   case NEON::BI__builtin_neon_vqdmlals_s32:
5194   case NEON::BI__builtin_neon_vqdmlsls_s32: {
5195     SmallVector<Value *, 2> ProductOps;
5196     ProductOps.push_back(Ops[1]);
5197     ProductOps.push_back(EmitScalarExpr(E->getArg(2)));
5198     Ops[1] =
5199         EmitNeonCall(CGM.getIntrinsic(Intrinsic::aarch64_neon_sqdmulls_scalar),
5200                      ProductOps, "vqdmlXl");
5201 
5202     unsigned AccumInt = BuiltinID == NEON::BI__builtin_neon_vqdmlals_s32
5203                                         ? Intrinsic::aarch64_neon_sqadd
5204                                         : Intrinsic::aarch64_neon_sqsub;
5205     return EmitNeonCall(CGM.getIntrinsic(AccumInt, Int64Ty), Ops, "vqdmlXl");
5206   }
5207   case NEON::BI__builtin_neon_vqdmlals_lane_s32:
5208   case NEON::BI__builtin_neon_vqdmlals_laneq_s32:
5209   case NEON::BI__builtin_neon_vqdmlsls_lane_s32:
5210   case NEON::BI__builtin_neon_vqdmlsls_laneq_s32: {
5211     Ops[2] = Builder.CreateExtractElement(Ops[2], EmitScalarExpr(E->getArg(3)),
5212                                           "lane");
5213     SmallVector<Value *, 2> ProductOps;
5214     ProductOps.push_back(Ops[1]);
5215     ProductOps.push_back(Ops[2]);
5216     Ops[1] =
5217         EmitNeonCall(CGM.getIntrinsic(Intrinsic::aarch64_neon_sqdmulls_scalar),
5218                      ProductOps, "vqdmlXl");
5219     Ops.pop_back();
5220 
5221     unsigned AccInt = (BuiltinID == NEON::BI__builtin_neon_vqdmlals_lane_s32 ||
5222                        BuiltinID == NEON::BI__builtin_neon_vqdmlals_laneq_s32)
5223                           ? Intrinsic::aarch64_neon_sqadd
5224                           : Intrinsic::aarch64_neon_sqsub;
5225     return EmitNeonCall(CGM.getIntrinsic(AccInt, Int64Ty), Ops, "vqdmlXl");
5226   }
5227   }
5228 
5229   llvm::VectorType *VTy = GetNeonType(this, Type);
5230   llvm::Type *Ty = VTy;
5231   if (!Ty)
5232     return nullptr;
5233 
5234   // Not all intrinsics handled by the common case work for AArch64 yet, so only
5235   // defer to common code if it's been added to our special map.
5236   Builtin = findNeonIntrinsicInMap(AArch64SIMDIntrinsicMap, BuiltinID,
5237                                    AArch64SIMDIntrinsicsProvenSorted);
5238 
5239   if (Builtin)
5240     return EmitCommonNeonBuiltinExpr(
5241         Builtin->BuiltinID, Builtin->LLVMIntrinsic, Builtin->AltLLVMIntrinsic,
5242         Builtin->NameHint, Builtin->TypeModifier, E, Ops,
5243         /*never use addresses*/ Address::invalid(), Address::invalid());
5244 
5245   if (Value *V = EmitAArch64TblBuiltinExpr(*this, BuiltinID, E, Ops))
5246     return V;
5247 
5248   unsigned Int;
5249   switch (BuiltinID) {
5250   default: return nullptr;
5251   case NEON::BI__builtin_neon_vbsl_v:
5252   case NEON::BI__builtin_neon_vbslq_v: {
5253     llvm::Type *BitTy = llvm::VectorType::getInteger(VTy);
5254     Ops[0] = Builder.CreateBitCast(Ops[0], BitTy, "vbsl");
5255     Ops[1] = Builder.CreateBitCast(Ops[1], BitTy, "vbsl");
5256     Ops[2] = Builder.CreateBitCast(Ops[2], BitTy, "vbsl");
5257 
5258     Ops[1] = Builder.CreateAnd(Ops[0], Ops[1], "vbsl");
5259     Ops[2] = Builder.CreateAnd(Builder.CreateNot(Ops[0]), Ops[2], "vbsl");
5260     Ops[0] = Builder.CreateOr(Ops[1], Ops[2], "vbsl");
5261     return Builder.CreateBitCast(Ops[0], Ty);
5262   }
5263   case NEON::BI__builtin_neon_vfma_lane_v:
5264   case NEON::BI__builtin_neon_vfmaq_lane_v: { // Only used for FP types
5265     // The ARM builtins (and instructions) have the addend as the first
5266     // operand, but the 'fma' intrinsics have it last. Swap it around here.
5267     Value *Addend = Ops[0];
5268     Value *Multiplicand = Ops[1];
5269     Value *LaneSource = Ops[2];
5270     Ops[0] = Multiplicand;
5271     Ops[1] = LaneSource;
5272     Ops[2] = Addend;
5273 
5274     // Now adjust things to handle the lane access.
5275     llvm::Type *SourceTy = BuiltinID == NEON::BI__builtin_neon_vfmaq_lane_v ?
5276       llvm::VectorType::get(VTy->getElementType(), VTy->getNumElements() / 2) :
5277       VTy;
5278     llvm::Constant *cst = cast<Constant>(Ops[3]);
5279     Value *SV = llvm::ConstantVector::getSplat(VTy->getNumElements(), cst);
5280     Ops[1] = Builder.CreateBitCast(Ops[1], SourceTy);
5281     Ops[1] = Builder.CreateShuffleVector(Ops[1], Ops[1], SV, "lane");
5282 
5283     Ops.pop_back();
5284     Int = Intrinsic::fma;
5285     return EmitNeonCall(CGM.getIntrinsic(Int, Ty), Ops, "fmla");
5286   }
5287   case NEON::BI__builtin_neon_vfma_laneq_v: {
5288     llvm::VectorType *VTy = cast<llvm::VectorType>(Ty);
5289     // v1f64 fma should be mapped to Neon scalar f64 fma
5290     if (VTy && VTy->getElementType() == DoubleTy) {
5291       Ops[0] = Builder.CreateBitCast(Ops[0], DoubleTy);
5292       Ops[1] = Builder.CreateBitCast(Ops[1], DoubleTy);
5293       llvm::Type *VTy = GetNeonType(this,
5294         NeonTypeFlags(NeonTypeFlags::Float64, false, true));
5295       Ops[2] = Builder.CreateBitCast(Ops[2], VTy);
5296       Ops[2] = Builder.CreateExtractElement(Ops[2], Ops[3], "extract");
5297       Value *F = CGM.getIntrinsic(Intrinsic::fma, DoubleTy);
5298       Value *Result = Builder.CreateCall(F, {Ops[1], Ops[2], Ops[0]});
5299       return Builder.CreateBitCast(Result, Ty);
5300     }
5301     Value *F = CGM.getIntrinsic(Intrinsic::fma, Ty);
5302     Ops[0] = Builder.CreateBitCast(Ops[0], Ty);
5303     Ops[1] = Builder.CreateBitCast(Ops[1], Ty);
5304 
5305     llvm::Type *STy = llvm::VectorType::get(VTy->getElementType(),
5306                                             VTy->getNumElements() * 2);
5307     Ops[2] = Builder.CreateBitCast(Ops[2], STy);
5308     Value* SV = llvm::ConstantVector::getSplat(VTy->getNumElements(),
5309                                                cast<ConstantInt>(Ops[3]));
5310     Ops[2] = Builder.CreateShuffleVector(Ops[2], Ops[2], SV, "lane");
5311 
5312     return Builder.CreateCall(F, {Ops[2], Ops[1], Ops[0]});
5313   }
5314   case NEON::BI__builtin_neon_vfmaq_laneq_v: {
5315     Value *F = CGM.getIntrinsic(Intrinsic::fma, Ty);
5316     Ops[0] = Builder.CreateBitCast(Ops[0], Ty);
5317     Ops[1] = Builder.CreateBitCast(Ops[1], Ty);
5318 
5319     Ops[2] = Builder.CreateBitCast(Ops[2], Ty);
5320     Ops[2] = EmitNeonSplat(Ops[2], cast<ConstantInt>(Ops[3]));
5321     return Builder.CreateCall(F, {Ops[2], Ops[1], Ops[0]});
5322   }
5323   case NEON::BI__builtin_neon_vfmas_lane_f32:
5324   case NEON::BI__builtin_neon_vfmas_laneq_f32:
5325   case NEON::BI__builtin_neon_vfmad_lane_f64:
5326   case NEON::BI__builtin_neon_vfmad_laneq_f64: {
5327     Ops.push_back(EmitScalarExpr(E->getArg(3)));
5328     llvm::Type *Ty = ConvertType(E->getCallReturnType(getContext()));
5329     Value *F = CGM.getIntrinsic(Intrinsic::fma, Ty);
5330     Ops[2] = Builder.CreateExtractElement(Ops[2], Ops[3], "extract");
5331     return Builder.CreateCall(F, {Ops[1], Ops[2], Ops[0]});
5332   }
5333   case NEON::BI__builtin_neon_vfms_v:
5334   case NEON::BI__builtin_neon_vfmsq_v: {  // Only used for FP types
5335     // FIXME: probably remove when we no longer support aarch64_simd.h
5336     // (arm_neon.h delegates to vfma).
5337 
5338     // The ARM builtins (and instructions) have the addend as the first
5339     // operand, but the 'fma' intrinsics have it last. Swap it around here.
5340     Value *Subtrahend = Ops[0];
5341     Value *Multiplicand = Ops[2];
5342     Ops[0] = Multiplicand;
5343     Ops[2] = Subtrahend;
5344     Ops[1] = Builder.CreateBitCast(Ops[1], VTy);
5345     Ops[1] = Builder.CreateFNeg(Ops[1]);
5346     Int = Intrinsic::fma;
5347     return EmitNeonCall(CGM.getIntrinsic(Int, Ty), Ops, "fmls");
5348   }
5349   case NEON::BI__builtin_neon_vmull_v:
5350     // FIXME: improve sharing scheme to cope with 3 alternative LLVM intrinsics.
5351     Int = usgn ? Intrinsic::aarch64_neon_umull : Intrinsic::aarch64_neon_smull;
5352     if (Type.isPoly()) Int = Intrinsic::aarch64_neon_pmull;
5353     return EmitNeonCall(CGM.getIntrinsic(Int, Ty), Ops, "vmull");
5354   case NEON::BI__builtin_neon_vmax_v:
5355   case NEON::BI__builtin_neon_vmaxq_v:
5356     // FIXME: improve sharing scheme to cope with 3 alternative LLVM intrinsics.
5357     Int = usgn ? Intrinsic::aarch64_neon_umax : Intrinsic::aarch64_neon_smax;
5358     if (Ty->isFPOrFPVectorTy()) Int = Intrinsic::aarch64_neon_fmax;
5359     return EmitNeonCall(CGM.getIntrinsic(Int, Ty), Ops, "vmax");
5360   case NEON::BI__builtin_neon_vmin_v:
5361   case NEON::BI__builtin_neon_vminq_v:
5362     // FIXME: improve sharing scheme to cope with 3 alternative LLVM intrinsics.
5363     Int = usgn ? Intrinsic::aarch64_neon_umin : Intrinsic::aarch64_neon_smin;
5364     if (Ty->isFPOrFPVectorTy()) Int = Intrinsic::aarch64_neon_fmin;
5365     return EmitNeonCall(CGM.getIntrinsic(Int, Ty), Ops, "vmin");
5366   case NEON::BI__builtin_neon_vabd_v:
5367   case NEON::BI__builtin_neon_vabdq_v:
5368     // FIXME: improve sharing scheme to cope with 3 alternative LLVM intrinsics.
5369     Int = usgn ? Intrinsic::aarch64_neon_uabd : Intrinsic::aarch64_neon_sabd;
5370     if (Ty->isFPOrFPVectorTy()) Int = Intrinsic::aarch64_neon_fabd;
5371     return EmitNeonCall(CGM.getIntrinsic(Int, Ty), Ops, "vabd");
5372   case NEON::BI__builtin_neon_vpadal_v:
5373   case NEON::BI__builtin_neon_vpadalq_v: {
5374     unsigned ArgElts = VTy->getNumElements();
5375     llvm::IntegerType *EltTy = cast<IntegerType>(VTy->getElementType());
5376     unsigned BitWidth = EltTy->getBitWidth();
5377     llvm::Type *ArgTy = llvm::VectorType::get(
5378         llvm::IntegerType::get(getLLVMContext(), BitWidth/2), 2*ArgElts);
5379     llvm::Type* Tys[2] = { VTy, ArgTy };
5380     Int = usgn ? Intrinsic::aarch64_neon_uaddlp : Intrinsic::aarch64_neon_saddlp;
5381     SmallVector<llvm::Value*, 1> TmpOps;
5382     TmpOps.push_back(Ops[1]);
5383     Function *F = CGM.getIntrinsic(Int, Tys);
5384     llvm::Value *tmp = EmitNeonCall(F, TmpOps, "vpadal");
5385     llvm::Value *addend = Builder.CreateBitCast(Ops[0], tmp->getType());
5386     return Builder.CreateAdd(tmp, addend);
5387   }
5388   case NEON::BI__builtin_neon_vpmin_v:
5389   case NEON::BI__builtin_neon_vpminq_v:
5390     // FIXME: improve sharing scheme to cope with 3 alternative LLVM intrinsics.
5391     Int = usgn ? Intrinsic::aarch64_neon_uminp : Intrinsic::aarch64_neon_sminp;
5392     if (Ty->isFPOrFPVectorTy()) Int = Intrinsic::aarch64_neon_fminp;
5393     return EmitNeonCall(CGM.getIntrinsic(Int, Ty), Ops, "vpmin");
5394   case NEON::BI__builtin_neon_vpmax_v:
5395   case NEON::BI__builtin_neon_vpmaxq_v:
5396     // FIXME: improve sharing scheme to cope with 3 alternative LLVM intrinsics.
5397     Int = usgn ? Intrinsic::aarch64_neon_umaxp : Intrinsic::aarch64_neon_smaxp;
5398     if (Ty->isFPOrFPVectorTy()) Int = Intrinsic::aarch64_neon_fmaxp;
5399     return EmitNeonCall(CGM.getIntrinsic(Int, Ty), Ops, "vpmax");
5400   case NEON::BI__builtin_neon_vminnm_v:
5401   case NEON::BI__builtin_neon_vminnmq_v:
5402     Int = Intrinsic::aarch64_neon_fminnm;
5403     return EmitNeonCall(CGM.getIntrinsic(Int, Ty), Ops, "vminnm");
5404   case NEON::BI__builtin_neon_vmaxnm_v:
5405   case NEON::BI__builtin_neon_vmaxnmq_v:
5406     Int = Intrinsic::aarch64_neon_fmaxnm;
5407     return EmitNeonCall(CGM.getIntrinsic(Int, Ty), Ops, "vmaxnm");
5408   case NEON::BI__builtin_neon_vrecpss_f32: {
5409     Ops.push_back(EmitScalarExpr(E->getArg(1)));
5410     return EmitNeonCall(CGM.getIntrinsic(Intrinsic::aarch64_neon_frecps, FloatTy),
5411                         Ops, "vrecps");
5412   }
5413   case NEON::BI__builtin_neon_vrecpsd_f64: {
5414     Ops.push_back(EmitScalarExpr(E->getArg(1)));
5415     return EmitNeonCall(CGM.getIntrinsic(Intrinsic::aarch64_neon_frecps, DoubleTy),
5416                         Ops, "vrecps");
5417   }
5418   case NEON::BI__builtin_neon_vqshrun_n_v:
5419     Int = Intrinsic::aarch64_neon_sqshrun;
5420     return EmitNeonCall(CGM.getIntrinsic(Int, Ty), Ops, "vqshrun_n");
5421   case NEON::BI__builtin_neon_vqrshrun_n_v:
5422     Int = Intrinsic::aarch64_neon_sqrshrun;
5423     return EmitNeonCall(CGM.getIntrinsic(Int, Ty), Ops, "vqrshrun_n");
5424   case NEON::BI__builtin_neon_vqshrn_n_v:
5425     Int = usgn ? Intrinsic::aarch64_neon_uqshrn : Intrinsic::aarch64_neon_sqshrn;
5426     return EmitNeonCall(CGM.getIntrinsic(Int, Ty), Ops, "vqshrn_n");
5427   case NEON::BI__builtin_neon_vrshrn_n_v:
5428     Int = Intrinsic::aarch64_neon_rshrn;
5429     return EmitNeonCall(CGM.getIntrinsic(Int, Ty), Ops, "vrshrn_n");
5430   case NEON::BI__builtin_neon_vqrshrn_n_v:
5431     Int = usgn ? Intrinsic::aarch64_neon_uqrshrn : Intrinsic::aarch64_neon_sqrshrn;
5432     return EmitNeonCall(CGM.getIntrinsic(Int, Ty), Ops, "vqrshrn_n");
5433   case NEON::BI__builtin_neon_vrnda_v:
5434   case NEON::BI__builtin_neon_vrndaq_v: {
5435     Int = Intrinsic::round;
5436     return EmitNeonCall(CGM.getIntrinsic(Int, Ty), Ops, "vrnda");
5437   }
5438   case NEON::BI__builtin_neon_vrndi_v:
5439   case NEON::BI__builtin_neon_vrndiq_v: {
5440     Int = Intrinsic::nearbyint;
5441     return EmitNeonCall(CGM.getIntrinsic(Int, Ty), Ops, "vrndi");
5442   }
5443   case NEON::BI__builtin_neon_vrndm_v:
5444   case NEON::BI__builtin_neon_vrndmq_v: {
5445     Int = Intrinsic::floor;
5446     return EmitNeonCall(CGM.getIntrinsic(Int, Ty), Ops, "vrndm");
5447   }
5448   case NEON::BI__builtin_neon_vrndn_v:
5449   case NEON::BI__builtin_neon_vrndnq_v: {
5450     Int = Intrinsic::aarch64_neon_frintn;
5451     return EmitNeonCall(CGM.getIntrinsic(Int, Ty), Ops, "vrndn");
5452   }
5453   case NEON::BI__builtin_neon_vrndp_v:
5454   case NEON::BI__builtin_neon_vrndpq_v: {
5455     Int = Intrinsic::ceil;
5456     return EmitNeonCall(CGM.getIntrinsic(Int, Ty), Ops, "vrndp");
5457   }
5458   case NEON::BI__builtin_neon_vrndx_v:
5459   case NEON::BI__builtin_neon_vrndxq_v: {
5460     Int = Intrinsic::rint;
5461     return EmitNeonCall(CGM.getIntrinsic(Int, Ty), Ops, "vrndx");
5462   }
5463   case NEON::BI__builtin_neon_vrnd_v:
5464   case NEON::BI__builtin_neon_vrndq_v: {
5465     Int = Intrinsic::trunc;
5466     return EmitNeonCall(CGM.getIntrinsic(Int, Ty), Ops, "vrndz");
5467   }
5468   case NEON::BI__builtin_neon_vceqz_v:
5469   case NEON::BI__builtin_neon_vceqzq_v:
5470     return EmitAArch64CompareBuiltinExpr(Ops[0], Ty, ICmpInst::FCMP_OEQ,
5471                                          ICmpInst::ICMP_EQ, "vceqz");
5472   case NEON::BI__builtin_neon_vcgez_v:
5473   case NEON::BI__builtin_neon_vcgezq_v:
5474     return EmitAArch64CompareBuiltinExpr(Ops[0], Ty, ICmpInst::FCMP_OGE,
5475                                          ICmpInst::ICMP_SGE, "vcgez");
5476   case NEON::BI__builtin_neon_vclez_v:
5477   case NEON::BI__builtin_neon_vclezq_v:
5478     return EmitAArch64CompareBuiltinExpr(Ops[0], Ty, ICmpInst::FCMP_OLE,
5479                                          ICmpInst::ICMP_SLE, "vclez");
5480   case NEON::BI__builtin_neon_vcgtz_v:
5481   case NEON::BI__builtin_neon_vcgtzq_v:
5482     return EmitAArch64CompareBuiltinExpr(Ops[0], Ty, ICmpInst::FCMP_OGT,
5483                                          ICmpInst::ICMP_SGT, "vcgtz");
5484   case NEON::BI__builtin_neon_vcltz_v:
5485   case NEON::BI__builtin_neon_vcltzq_v:
5486     return EmitAArch64CompareBuiltinExpr(Ops[0], Ty, ICmpInst::FCMP_OLT,
5487                                          ICmpInst::ICMP_SLT, "vcltz");
5488   case NEON::BI__builtin_neon_vcvt_f64_v:
5489   case NEON::BI__builtin_neon_vcvtq_f64_v:
5490     Ops[0] = Builder.CreateBitCast(Ops[0], Ty);
5491     Ty = GetNeonType(this, NeonTypeFlags(NeonTypeFlags::Float64, false, quad));
5492     return usgn ? Builder.CreateUIToFP(Ops[0], Ty, "vcvt")
5493                 : Builder.CreateSIToFP(Ops[0], Ty, "vcvt");
5494   case NEON::BI__builtin_neon_vcvt_f64_f32: {
5495     assert(Type.getEltType() == NeonTypeFlags::Float64 && quad &&
5496            "unexpected vcvt_f64_f32 builtin");
5497     NeonTypeFlags SrcFlag = NeonTypeFlags(NeonTypeFlags::Float32, false, false);
5498     Ops[0] = Builder.CreateBitCast(Ops[0], GetNeonType(this, SrcFlag));
5499 
5500     return Builder.CreateFPExt(Ops[0], Ty, "vcvt");
5501   }
5502   case NEON::BI__builtin_neon_vcvt_f32_f64: {
5503     assert(Type.getEltType() == NeonTypeFlags::Float32 &&
5504            "unexpected vcvt_f32_f64 builtin");
5505     NeonTypeFlags SrcFlag = NeonTypeFlags(NeonTypeFlags::Float64, false, true);
5506     Ops[0] = Builder.CreateBitCast(Ops[0], GetNeonType(this, SrcFlag));
5507 
5508     return Builder.CreateFPTrunc(Ops[0], Ty, "vcvt");
5509   }
5510   case NEON::BI__builtin_neon_vcvt_s32_v:
5511   case NEON::BI__builtin_neon_vcvt_u32_v:
5512   case NEON::BI__builtin_neon_vcvt_s64_v:
5513   case NEON::BI__builtin_neon_vcvt_u64_v:
5514   case NEON::BI__builtin_neon_vcvtq_s32_v:
5515   case NEON::BI__builtin_neon_vcvtq_u32_v:
5516   case NEON::BI__builtin_neon_vcvtq_s64_v:
5517   case NEON::BI__builtin_neon_vcvtq_u64_v: {
5518     Ops[0] = Builder.CreateBitCast(Ops[0], GetFloatNeonType(this, Type));
5519     if (usgn)
5520       return Builder.CreateFPToUI(Ops[0], Ty);
5521     return Builder.CreateFPToSI(Ops[0], Ty);
5522   }
5523   case NEON::BI__builtin_neon_vcvta_s32_v:
5524   case NEON::BI__builtin_neon_vcvtaq_s32_v:
5525   case NEON::BI__builtin_neon_vcvta_u32_v:
5526   case NEON::BI__builtin_neon_vcvtaq_u32_v:
5527   case NEON::BI__builtin_neon_vcvta_s64_v:
5528   case NEON::BI__builtin_neon_vcvtaq_s64_v:
5529   case NEON::BI__builtin_neon_vcvta_u64_v:
5530   case NEON::BI__builtin_neon_vcvtaq_u64_v: {
5531     Int = usgn ? Intrinsic::aarch64_neon_fcvtau : Intrinsic::aarch64_neon_fcvtas;
5532     llvm::Type *Tys[2] = { Ty, GetFloatNeonType(this, Type) };
5533     return EmitNeonCall(CGM.getIntrinsic(Int, Tys), Ops, "vcvta");
5534   }
5535   case NEON::BI__builtin_neon_vcvtm_s32_v:
5536   case NEON::BI__builtin_neon_vcvtmq_s32_v:
5537   case NEON::BI__builtin_neon_vcvtm_u32_v:
5538   case NEON::BI__builtin_neon_vcvtmq_u32_v:
5539   case NEON::BI__builtin_neon_vcvtm_s64_v:
5540   case NEON::BI__builtin_neon_vcvtmq_s64_v:
5541   case NEON::BI__builtin_neon_vcvtm_u64_v:
5542   case NEON::BI__builtin_neon_vcvtmq_u64_v: {
5543     Int = usgn ? Intrinsic::aarch64_neon_fcvtmu : Intrinsic::aarch64_neon_fcvtms;
5544     llvm::Type *Tys[2] = { Ty, GetFloatNeonType(this, Type) };
5545     return EmitNeonCall(CGM.getIntrinsic(Int, Tys), Ops, "vcvtm");
5546   }
5547   case NEON::BI__builtin_neon_vcvtn_s32_v:
5548   case NEON::BI__builtin_neon_vcvtnq_s32_v:
5549   case NEON::BI__builtin_neon_vcvtn_u32_v:
5550   case NEON::BI__builtin_neon_vcvtnq_u32_v:
5551   case NEON::BI__builtin_neon_vcvtn_s64_v:
5552   case NEON::BI__builtin_neon_vcvtnq_s64_v:
5553   case NEON::BI__builtin_neon_vcvtn_u64_v:
5554   case NEON::BI__builtin_neon_vcvtnq_u64_v: {
5555     Int = usgn ? Intrinsic::aarch64_neon_fcvtnu : Intrinsic::aarch64_neon_fcvtns;
5556     llvm::Type *Tys[2] = { Ty, GetFloatNeonType(this, Type) };
5557     return EmitNeonCall(CGM.getIntrinsic(Int, Tys), Ops, "vcvtn");
5558   }
5559   case NEON::BI__builtin_neon_vcvtp_s32_v:
5560   case NEON::BI__builtin_neon_vcvtpq_s32_v:
5561   case NEON::BI__builtin_neon_vcvtp_u32_v:
5562   case NEON::BI__builtin_neon_vcvtpq_u32_v:
5563   case NEON::BI__builtin_neon_vcvtp_s64_v:
5564   case NEON::BI__builtin_neon_vcvtpq_s64_v:
5565   case NEON::BI__builtin_neon_vcvtp_u64_v:
5566   case NEON::BI__builtin_neon_vcvtpq_u64_v: {
5567     Int = usgn ? Intrinsic::aarch64_neon_fcvtpu : Intrinsic::aarch64_neon_fcvtps;
5568     llvm::Type *Tys[2] = { Ty, GetFloatNeonType(this, Type) };
5569     return EmitNeonCall(CGM.getIntrinsic(Int, Tys), Ops, "vcvtp");
5570   }
5571   case NEON::BI__builtin_neon_vmulx_v:
5572   case NEON::BI__builtin_neon_vmulxq_v: {
5573     Int = Intrinsic::aarch64_neon_fmulx;
5574     return EmitNeonCall(CGM.getIntrinsic(Int, Ty), Ops, "vmulx");
5575   }
5576   case NEON::BI__builtin_neon_vmul_lane_v:
5577   case NEON::BI__builtin_neon_vmul_laneq_v: {
5578     // v1f64 vmul_lane should be mapped to Neon scalar mul lane
5579     bool Quad = false;
5580     if (BuiltinID == NEON::BI__builtin_neon_vmul_laneq_v)
5581       Quad = true;
5582     Ops[0] = Builder.CreateBitCast(Ops[0], DoubleTy);
5583     llvm::Type *VTy = GetNeonType(this,
5584       NeonTypeFlags(NeonTypeFlags::Float64, false, Quad));
5585     Ops[1] = Builder.CreateBitCast(Ops[1], VTy);
5586     Ops[1] = Builder.CreateExtractElement(Ops[1], Ops[2], "extract");
5587     Value *Result = Builder.CreateFMul(Ops[0], Ops[1]);
5588     return Builder.CreateBitCast(Result, Ty);
5589   }
5590   case NEON::BI__builtin_neon_vnegd_s64:
5591     return Builder.CreateNeg(EmitScalarExpr(E->getArg(0)), "vnegd");
5592   case NEON::BI__builtin_neon_vpmaxnm_v:
5593   case NEON::BI__builtin_neon_vpmaxnmq_v: {
5594     Int = Intrinsic::aarch64_neon_fmaxnmp;
5595     return EmitNeonCall(CGM.getIntrinsic(Int, Ty), Ops, "vpmaxnm");
5596   }
5597   case NEON::BI__builtin_neon_vpminnm_v:
5598   case NEON::BI__builtin_neon_vpminnmq_v: {
5599     Int = Intrinsic::aarch64_neon_fminnmp;
5600     return EmitNeonCall(CGM.getIntrinsic(Int, Ty), Ops, "vpminnm");
5601   }
5602   case NEON::BI__builtin_neon_vsqrt_v:
5603   case NEON::BI__builtin_neon_vsqrtq_v: {
5604     Int = Intrinsic::sqrt;
5605     Ops[0] = Builder.CreateBitCast(Ops[0], Ty);
5606     return EmitNeonCall(CGM.getIntrinsic(Int, Ty), Ops, "vsqrt");
5607   }
5608   case NEON::BI__builtin_neon_vrbit_v:
5609   case NEON::BI__builtin_neon_vrbitq_v: {
5610     Int = Intrinsic::aarch64_neon_rbit;
5611     return EmitNeonCall(CGM.getIntrinsic(Int, Ty), Ops, "vrbit");
5612   }
5613   case NEON::BI__builtin_neon_vaddv_u8:
5614     // FIXME: These are handled by the AArch64 scalar code.
5615     usgn = true;
5616     // FALLTHROUGH
5617   case NEON::BI__builtin_neon_vaddv_s8: {
5618     Int = usgn ? Intrinsic::aarch64_neon_uaddv : Intrinsic::aarch64_neon_saddv;
5619     Ty = Int32Ty;
5620     VTy = llvm::VectorType::get(Int8Ty, 8);
5621     llvm::Type *Tys[2] = { Ty, VTy };
5622     Ops.push_back(EmitScalarExpr(E->getArg(0)));
5623     Ops[0] = EmitNeonCall(CGM.getIntrinsic(Int, Tys), Ops, "vaddv");
5624     return Builder.CreateTrunc(Ops[0], Int8Ty);
5625   }
5626   case NEON::BI__builtin_neon_vaddv_u16:
5627     usgn = true;
5628     // FALLTHROUGH
5629   case NEON::BI__builtin_neon_vaddv_s16: {
5630     Int = usgn ? Intrinsic::aarch64_neon_uaddv : Intrinsic::aarch64_neon_saddv;
5631     Ty = Int32Ty;
5632     VTy = llvm::VectorType::get(Int16Ty, 4);
5633     llvm::Type *Tys[2] = { Ty, VTy };
5634     Ops.push_back(EmitScalarExpr(E->getArg(0)));
5635     Ops[0] = EmitNeonCall(CGM.getIntrinsic(Int, Tys), Ops, "vaddv");
5636     return Builder.CreateTrunc(Ops[0], Int16Ty);
5637   }
5638   case NEON::BI__builtin_neon_vaddvq_u8:
5639     usgn = true;
5640     // FALLTHROUGH
5641   case NEON::BI__builtin_neon_vaddvq_s8: {
5642     Int = usgn ? Intrinsic::aarch64_neon_uaddv : Intrinsic::aarch64_neon_saddv;
5643     Ty = Int32Ty;
5644     VTy = llvm::VectorType::get(Int8Ty, 16);
5645     llvm::Type *Tys[2] = { Ty, VTy };
5646     Ops.push_back(EmitScalarExpr(E->getArg(0)));
5647     Ops[0] = EmitNeonCall(CGM.getIntrinsic(Int, Tys), Ops, "vaddv");
5648     return Builder.CreateTrunc(Ops[0], Int8Ty);
5649   }
5650   case NEON::BI__builtin_neon_vaddvq_u16:
5651     usgn = true;
5652     // FALLTHROUGH
5653   case NEON::BI__builtin_neon_vaddvq_s16: {
5654     Int = usgn ? Intrinsic::aarch64_neon_uaddv : Intrinsic::aarch64_neon_saddv;
5655     Ty = Int32Ty;
5656     VTy = llvm::VectorType::get(Int16Ty, 8);
5657     llvm::Type *Tys[2] = { Ty, VTy };
5658     Ops.push_back(EmitScalarExpr(E->getArg(0)));
5659     Ops[0] = EmitNeonCall(CGM.getIntrinsic(Int, Tys), Ops, "vaddv");
5660     return Builder.CreateTrunc(Ops[0], Int16Ty);
5661   }
5662   case NEON::BI__builtin_neon_vmaxv_u8: {
5663     Int = Intrinsic::aarch64_neon_umaxv;
5664     Ty = Int32Ty;
5665     VTy = llvm::VectorType::get(Int8Ty, 8);
5666     llvm::Type *Tys[2] = { Ty, VTy };
5667     Ops.push_back(EmitScalarExpr(E->getArg(0)));
5668     Ops[0] = EmitNeonCall(CGM.getIntrinsic(Int, Tys), Ops, "vmaxv");
5669     return Builder.CreateTrunc(Ops[0], Int8Ty);
5670   }
5671   case NEON::BI__builtin_neon_vmaxv_u16: {
5672     Int = Intrinsic::aarch64_neon_umaxv;
5673     Ty = Int32Ty;
5674     VTy = llvm::VectorType::get(Int16Ty, 4);
5675     llvm::Type *Tys[2] = { Ty, VTy };
5676     Ops.push_back(EmitScalarExpr(E->getArg(0)));
5677     Ops[0] = EmitNeonCall(CGM.getIntrinsic(Int, Tys), Ops, "vmaxv");
5678     return Builder.CreateTrunc(Ops[0], Int16Ty);
5679   }
5680   case NEON::BI__builtin_neon_vmaxvq_u8: {
5681     Int = Intrinsic::aarch64_neon_umaxv;
5682     Ty = Int32Ty;
5683     VTy = llvm::VectorType::get(Int8Ty, 16);
5684     llvm::Type *Tys[2] = { Ty, VTy };
5685     Ops.push_back(EmitScalarExpr(E->getArg(0)));
5686     Ops[0] = EmitNeonCall(CGM.getIntrinsic(Int, Tys), Ops, "vmaxv");
5687     return Builder.CreateTrunc(Ops[0], Int8Ty);
5688   }
5689   case NEON::BI__builtin_neon_vmaxvq_u16: {
5690     Int = Intrinsic::aarch64_neon_umaxv;
5691     Ty = Int32Ty;
5692     VTy = llvm::VectorType::get(Int16Ty, 8);
5693     llvm::Type *Tys[2] = { Ty, VTy };
5694     Ops.push_back(EmitScalarExpr(E->getArg(0)));
5695     Ops[0] = EmitNeonCall(CGM.getIntrinsic(Int, Tys), Ops, "vmaxv");
5696     return Builder.CreateTrunc(Ops[0], Int16Ty);
5697   }
5698   case NEON::BI__builtin_neon_vmaxv_s8: {
5699     Int = Intrinsic::aarch64_neon_smaxv;
5700     Ty = Int32Ty;
5701     VTy = llvm::VectorType::get(Int8Ty, 8);
5702     llvm::Type *Tys[2] = { Ty, VTy };
5703     Ops.push_back(EmitScalarExpr(E->getArg(0)));
5704     Ops[0] = EmitNeonCall(CGM.getIntrinsic(Int, Tys), Ops, "vmaxv");
5705     return Builder.CreateTrunc(Ops[0], Int8Ty);
5706   }
5707   case NEON::BI__builtin_neon_vmaxv_s16: {
5708     Int = Intrinsic::aarch64_neon_smaxv;
5709     Ty = Int32Ty;
5710     VTy = llvm::VectorType::get(Int16Ty, 4);
5711     llvm::Type *Tys[2] = { Ty, VTy };
5712     Ops.push_back(EmitScalarExpr(E->getArg(0)));
5713     Ops[0] = EmitNeonCall(CGM.getIntrinsic(Int, Tys), Ops, "vmaxv");
5714     return Builder.CreateTrunc(Ops[0], Int16Ty);
5715   }
5716   case NEON::BI__builtin_neon_vmaxvq_s8: {
5717     Int = Intrinsic::aarch64_neon_smaxv;
5718     Ty = Int32Ty;
5719     VTy = llvm::VectorType::get(Int8Ty, 16);
5720     llvm::Type *Tys[2] = { Ty, VTy };
5721     Ops.push_back(EmitScalarExpr(E->getArg(0)));
5722     Ops[0] = EmitNeonCall(CGM.getIntrinsic(Int, Tys), Ops, "vmaxv");
5723     return Builder.CreateTrunc(Ops[0], Int8Ty);
5724   }
5725   case NEON::BI__builtin_neon_vmaxvq_s16: {
5726     Int = Intrinsic::aarch64_neon_smaxv;
5727     Ty = Int32Ty;
5728     VTy = llvm::VectorType::get(Int16Ty, 8);
5729     llvm::Type *Tys[2] = { Ty, VTy };
5730     Ops.push_back(EmitScalarExpr(E->getArg(0)));
5731     Ops[0] = EmitNeonCall(CGM.getIntrinsic(Int, Tys), Ops, "vmaxv");
5732     return Builder.CreateTrunc(Ops[0], Int16Ty);
5733   }
5734   case NEON::BI__builtin_neon_vminv_u8: {
5735     Int = Intrinsic::aarch64_neon_uminv;
5736     Ty = Int32Ty;
5737     VTy = llvm::VectorType::get(Int8Ty, 8);
5738     llvm::Type *Tys[2] = { Ty, VTy };
5739     Ops.push_back(EmitScalarExpr(E->getArg(0)));
5740     Ops[0] = EmitNeonCall(CGM.getIntrinsic(Int, Tys), Ops, "vminv");
5741     return Builder.CreateTrunc(Ops[0], Int8Ty);
5742   }
5743   case NEON::BI__builtin_neon_vminv_u16: {
5744     Int = Intrinsic::aarch64_neon_uminv;
5745     Ty = Int32Ty;
5746     VTy = llvm::VectorType::get(Int16Ty, 4);
5747     llvm::Type *Tys[2] = { Ty, VTy };
5748     Ops.push_back(EmitScalarExpr(E->getArg(0)));
5749     Ops[0] = EmitNeonCall(CGM.getIntrinsic(Int, Tys), Ops, "vminv");
5750     return Builder.CreateTrunc(Ops[0], Int16Ty);
5751   }
5752   case NEON::BI__builtin_neon_vminvq_u8: {
5753     Int = Intrinsic::aarch64_neon_uminv;
5754     Ty = Int32Ty;
5755     VTy = llvm::VectorType::get(Int8Ty, 16);
5756     llvm::Type *Tys[2] = { Ty, VTy };
5757     Ops.push_back(EmitScalarExpr(E->getArg(0)));
5758     Ops[0] = EmitNeonCall(CGM.getIntrinsic(Int, Tys), Ops, "vminv");
5759     return Builder.CreateTrunc(Ops[0], Int8Ty);
5760   }
5761   case NEON::BI__builtin_neon_vminvq_u16: {
5762     Int = Intrinsic::aarch64_neon_uminv;
5763     Ty = Int32Ty;
5764     VTy = llvm::VectorType::get(Int16Ty, 8);
5765     llvm::Type *Tys[2] = { Ty, VTy };
5766     Ops.push_back(EmitScalarExpr(E->getArg(0)));
5767     Ops[0] = EmitNeonCall(CGM.getIntrinsic(Int, Tys), Ops, "vminv");
5768     return Builder.CreateTrunc(Ops[0], Int16Ty);
5769   }
5770   case NEON::BI__builtin_neon_vminv_s8: {
5771     Int = Intrinsic::aarch64_neon_sminv;
5772     Ty = Int32Ty;
5773     VTy = llvm::VectorType::get(Int8Ty, 8);
5774     llvm::Type *Tys[2] = { Ty, VTy };
5775     Ops.push_back(EmitScalarExpr(E->getArg(0)));
5776     Ops[0] = EmitNeonCall(CGM.getIntrinsic(Int, Tys), Ops, "vminv");
5777     return Builder.CreateTrunc(Ops[0], Int8Ty);
5778   }
5779   case NEON::BI__builtin_neon_vminv_s16: {
5780     Int = Intrinsic::aarch64_neon_sminv;
5781     Ty = Int32Ty;
5782     VTy = llvm::VectorType::get(Int16Ty, 4);
5783     llvm::Type *Tys[2] = { Ty, VTy };
5784     Ops.push_back(EmitScalarExpr(E->getArg(0)));
5785     Ops[0] = EmitNeonCall(CGM.getIntrinsic(Int, Tys), Ops, "vminv");
5786     return Builder.CreateTrunc(Ops[0], Int16Ty);
5787   }
5788   case NEON::BI__builtin_neon_vminvq_s8: {
5789     Int = Intrinsic::aarch64_neon_sminv;
5790     Ty = Int32Ty;
5791     VTy = llvm::VectorType::get(Int8Ty, 16);
5792     llvm::Type *Tys[2] = { Ty, VTy };
5793     Ops.push_back(EmitScalarExpr(E->getArg(0)));
5794     Ops[0] = EmitNeonCall(CGM.getIntrinsic(Int, Tys), Ops, "vminv");
5795     return Builder.CreateTrunc(Ops[0], Int8Ty);
5796   }
5797   case NEON::BI__builtin_neon_vminvq_s16: {
5798     Int = Intrinsic::aarch64_neon_sminv;
5799     Ty = Int32Ty;
5800     VTy = llvm::VectorType::get(Int16Ty, 8);
5801     llvm::Type *Tys[2] = { Ty, VTy };
5802     Ops.push_back(EmitScalarExpr(E->getArg(0)));
5803     Ops[0] = EmitNeonCall(CGM.getIntrinsic(Int, Tys), Ops, "vminv");
5804     return Builder.CreateTrunc(Ops[0], Int16Ty);
5805   }
5806   case NEON::BI__builtin_neon_vmul_n_f64: {
5807     Ops[0] = Builder.CreateBitCast(Ops[0], DoubleTy);
5808     Value *RHS = Builder.CreateBitCast(EmitScalarExpr(E->getArg(1)), DoubleTy);
5809     return Builder.CreateFMul(Ops[0], RHS);
5810   }
5811   case NEON::BI__builtin_neon_vaddlv_u8: {
5812     Int = Intrinsic::aarch64_neon_uaddlv;
5813     Ty = Int32Ty;
5814     VTy = llvm::VectorType::get(Int8Ty, 8);
5815     llvm::Type *Tys[2] = { Ty, VTy };
5816     Ops.push_back(EmitScalarExpr(E->getArg(0)));
5817     Ops[0] = EmitNeonCall(CGM.getIntrinsic(Int, Tys), Ops, "vaddlv");
5818     return Builder.CreateTrunc(Ops[0], Int16Ty);
5819   }
5820   case NEON::BI__builtin_neon_vaddlv_u16: {
5821     Int = Intrinsic::aarch64_neon_uaddlv;
5822     Ty = Int32Ty;
5823     VTy = llvm::VectorType::get(Int16Ty, 4);
5824     llvm::Type *Tys[2] = { Ty, VTy };
5825     Ops.push_back(EmitScalarExpr(E->getArg(0)));
5826     return EmitNeonCall(CGM.getIntrinsic(Int, Tys), Ops, "vaddlv");
5827   }
5828   case NEON::BI__builtin_neon_vaddlvq_u8: {
5829     Int = Intrinsic::aarch64_neon_uaddlv;
5830     Ty = Int32Ty;
5831     VTy = llvm::VectorType::get(Int8Ty, 16);
5832     llvm::Type *Tys[2] = { Ty, VTy };
5833     Ops.push_back(EmitScalarExpr(E->getArg(0)));
5834     Ops[0] = EmitNeonCall(CGM.getIntrinsic(Int, Tys), Ops, "vaddlv");
5835     return Builder.CreateTrunc(Ops[0], Int16Ty);
5836   }
5837   case NEON::BI__builtin_neon_vaddlvq_u16: {
5838     Int = Intrinsic::aarch64_neon_uaddlv;
5839     Ty = Int32Ty;
5840     VTy = llvm::VectorType::get(Int16Ty, 8);
5841     llvm::Type *Tys[2] = { Ty, VTy };
5842     Ops.push_back(EmitScalarExpr(E->getArg(0)));
5843     return EmitNeonCall(CGM.getIntrinsic(Int, Tys), Ops, "vaddlv");
5844   }
5845   case NEON::BI__builtin_neon_vaddlv_s8: {
5846     Int = Intrinsic::aarch64_neon_saddlv;
5847     Ty = Int32Ty;
5848     VTy = llvm::VectorType::get(Int8Ty, 8);
5849     llvm::Type *Tys[2] = { Ty, VTy };
5850     Ops.push_back(EmitScalarExpr(E->getArg(0)));
5851     Ops[0] = EmitNeonCall(CGM.getIntrinsic(Int, Tys), Ops, "vaddlv");
5852     return Builder.CreateTrunc(Ops[0], Int16Ty);
5853   }
5854   case NEON::BI__builtin_neon_vaddlv_s16: {
5855     Int = Intrinsic::aarch64_neon_saddlv;
5856     Ty = Int32Ty;
5857     VTy = llvm::VectorType::get(Int16Ty, 4);
5858     llvm::Type *Tys[2] = { Ty, VTy };
5859     Ops.push_back(EmitScalarExpr(E->getArg(0)));
5860     return EmitNeonCall(CGM.getIntrinsic(Int, Tys), Ops, "vaddlv");
5861   }
5862   case NEON::BI__builtin_neon_vaddlvq_s8: {
5863     Int = Intrinsic::aarch64_neon_saddlv;
5864     Ty = Int32Ty;
5865     VTy = llvm::VectorType::get(Int8Ty, 16);
5866     llvm::Type *Tys[2] = { Ty, VTy };
5867     Ops.push_back(EmitScalarExpr(E->getArg(0)));
5868     Ops[0] = EmitNeonCall(CGM.getIntrinsic(Int, Tys), Ops, "vaddlv");
5869     return Builder.CreateTrunc(Ops[0], Int16Ty);
5870   }
5871   case NEON::BI__builtin_neon_vaddlvq_s16: {
5872     Int = Intrinsic::aarch64_neon_saddlv;
5873     Ty = Int32Ty;
5874     VTy = llvm::VectorType::get(Int16Ty, 8);
5875     llvm::Type *Tys[2] = { Ty, VTy };
5876     Ops.push_back(EmitScalarExpr(E->getArg(0)));
5877     return EmitNeonCall(CGM.getIntrinsic(Int, Tys), Ops, "vaddlv");
5878   }
5879   case NEON::BI__builtin_neon_vsri_n_v:
5880   case NEON::BI__builtin_neon_vsriq_n_v: {
5881     Int = Intrinsic::aarch64_neon_vsri;
5882     llvm::Function *Intrin = CGM.getIntrinsic(Int, Ty);
5883     return EmitNeonCall(Intrin, Ops, "vsri_n");
5884   }
5885   case NEON::BI__builtin_neon_vsli_n_v:
5886   case NEON::BI__builtin_neon_vsliq_n_v: {
5887     Int = Intrinsic::aarch64_neon_vsli;
5888     llvm::Function *Intrin = CGM.getIntrinsic(Int, Ty);
5889     return EmitNeonCall(Intrin, Ops, "vsli_n");
5890   }
5891   case NEON::BI__builtin_neon_vsra_n_v:
5892   case NEON::BI__builtin_neon_vsraq_n_v:
5893     Ops[0] = Builder.CreateBitCast(Ops[0], Ty);
5894     Ops[1] = EmitNeonRShiftImm(Ops[1], Ops[2], Ty, usgn, "vsra_n");
5895     return Builder.CreateAdd(Ops[0], Ops[1]);
5896   case NEON::BI__builtin_neon_vrsra_n_v:
5897   case NEON::BI__builtin_neon_vrsraq_n_v: {
5898     Int = usgn ? Intrinsic::aarch64_neon_urshl : Intrinsic::aarch64_neon_srshl;
5899     SmallVector<llvm::Value*,2> TmpOps;
5900     TmpOps.push_back(Ops[1]);
5901     TmpOps.push_back(Ops[2]);
5902     Function* F = CGM.getIntrinsic(Int, Ty);
5903     llvm::Value *tmp = EmitNeonCall(F, TmpOps, "vrshr_n", 1, true);
5904     Ops[0] = Builder.CreateBitCast(Ops[0], VTy);
5905     return Builder.CreateAdd(Ops[0], tmp);
5906   }
5907     // FIXME: Sharing loads & stores with 32-bit is complicated by the absence
5908     // of an Align parameter here.
5909   case NEON::BI__builtin_neon_vld1_x2_v:
5910   case NEON::BI__builtin_neon_vld1q_x2_v:
5911   case NEON::BI__builtin_neon_vld1_x3_v:
5912   case NEON::BI__builtin_neon_vld1q_x3_v:
5913   case NEON::BI__builtin_neon_vld1_x4_v:
5914   case NEON::BI__builtin_neon_vld1q_x4_v: {
5915     llvm::Type *PTy = llvm::PointerType::getUnqual(VTy->getVectorElementType());
5916     Ops[1] = Builder.CreateBitCast(Ops[1], PTy);
5917     llvm::Type *Tys[2] = { VTy, PTy };
5918     unsigned Int;
5919     switch (BuiltinID) {
5920     case NEON::BI__builtin_neon_vld1_x2_v:
5921     case NEON::BI__builtin_neon_vld1q_x2_v:
5922       Int = Intrinsic::aarch64_neon_ld1x2;
5923       break;
5924     case NEON::BI__builtin_neon_vld1_x3_v:
5925     case NEON::BI__builtin_neon_vld1q_x3_v:
5926       Int = Intrinsic::aarch64_neon_ld1x3;
5927       break;
5928     case NEON::BI__builtin_neon_vld1_x4_v:
5929     case NEON::BI__builtin_neon_vld1q_x4_v:
5930       Int = Intrinsic::aarch64_neon_ld1x4;
5931       break;
5932     }
5933     Function *F = CGM.getIntrinsic(Int, Tys);
5934     Ops[1] = Builder.CreateCall(F, Ops[1], "vld1xN");
5935     Ty = llvm::PointerType::getUnqual(Ops[1]->getType());
5936     Ops[0] = Builder.CreateBitCast(Ops[0], Ty);
5937     return Builder.CreateDefaultAlignedStore(Ops[1], Ops[0]);
5938   }
5939   case NEON::BI__builtin_neon_vst1_x2_v:
5940   case NEON::BI__builtin_neon_vst1q_x2_v:
5941   case NEON::BI__builtin_neon_vst1_x3_v:
5942   case NEON::BI__builtin_neon_vst1q_x3_v:
5943   case NEON::BI__builtin_neon_vst1_x4_v:
5944   case NEON::BI__builtin_neon_vst1q_x4_v: {
5945     llvm::Type *PTy = llvm::PointerType::getUnqual(VTy->getVectorElementType());
5946     llvm::Type *Tys[2] = { VTy, PTy };
5947     unsigned Int;
5948     switch (BuiltinID) {
5949     case NEON::BI__builtin_neon_vst1_x2_v:
5950     case NEON::BI__builtin_neon_vst1q_x2_v:
5951       Int = Intrinsic::aarch64_neon_st1x2;
5952       break;
5953     case NEON::BI__builtin_neon_vst1_x3_v:
5954     case NEON::BI__builtin_neon_vst1q_x3_v:
5955       Int = Intrinsic::aarch64_neon_st1x3;
5956       break;
5957     case NEON::BI__builtin_neon_vst1_x4_v:
5958     case NEON::BI__builtin_neon_vst1q_x4_v:
5959       Int = Intrinsic::aarch64_neon_st1x4;
5960       break;
5961     }
5962     std::rotate(Ops.begin(), Ops.begin() + 1, Ops.end());
5963     return EmitNeonCall(CGM.getIntrinsic(Int, Tys), Ops, "");
5964   }
5965   case NEON::BI__builtin_neon_vld1_v:
5966   case NEON::BI__builtin_neon_vld1q_v:
5967     Ops[0] = Builder.CreateBitCast(Ops[0], llvm::PointerType::getUnqual(VTy));
5968     return Builder.CreateDefaultAlignedLoad(Ops[0]);
5969   case NEON::BI__builtin_neon_vst1_v:
5970   case NEON::BI__builtin_neon_vst1q_v:
5971     Ops[0] = Builder.CreateBitCast(Ops[0], llvm::PointerType::getUnqual(VTy));
5972     Ops[1] = Builder.CreateBitCast(Ops[1], VTy);
5973     return Builder.CreateDefaultAlignedStore(Ops[1], Ops[0]);
5974   case NEON::BI__builtin_neon_vld1_lane_v:
5975   case NEON::BI__builtin_neon_vld1q_lane_v:
5976     Ops[1] = Builder.CreateBitCast(Ops[1], Ty);
5977     Ty = llvm::PointerType::getUnqual(VTy->getElementType());
5978     Ops[0] = Builder.CreateBitCast(Ops[0], Ty);
5979     Ops[0] = Builder.CreateDefaultAlignedLoad(Ops[0]);
5980     return Builder.CreateInsertElement(Ops[1], Ops[0], Ops[2], "vld1_lane");
5981   case NEON::BI__builtin_neon_vld1_dup_v:
5982   case NEON::BI__builtin_neon_vld1q_dup_v: {
5983     Value *V = UndefValue::get(Ty);
5984     Ty = llvm::PointerType::getUnqual(VTy->getElementType());
5985     Ops[0] = Builder.CreateBitCast(Ops[0], Ty);
5986     Ops[0] = Builder.CreateDefaultAlignedLoad(Ops[0]);
5987     llvm::Constant *CI = ConstantInt::get(Int32Ty, 0);
5988     Ops[0] = Builder.CreateInsertElement(V, Ops[0], CI);
5989     return EmitNeonSplat(Ops[0], CI);
5990   }
5991   case NEON::BI__builtin_neon_vst1_lane_v:
5992   case NEON::BI__builtin_neon_vst1q_lane_v:
5993     Ops[1] = Builder.CreateBitCast(Ops[1], Ty);
5994     Ops[1] = Builder.CreateExtractElement(Ops[1], Ops[2]);
5995     Ty = llvm::PointerType::getUnqual(Ops[1]->getType());
5996     return Builder.CreateDefaultAlignedStore(Ops[1],
5997                                              Builder.CreateBitCast(Ops[0], Ty));
5998   case NEON::BI__builtin_neon_vld2_v:
5999   case NEON::BI__builtin_neon_vld2q_v: {
6000     llvm::Type *PTy = llvm::PointerType::getUnqual(VTy);
6001     Ops[1] = Builder.CreateBitCast(Ops[1], PTy);
6002     llvm::Type *Tys[2] = { VTy, PTy };
6003     Function *F = CGM.getIntrinsic(Intrinsic::aarch64_neon_ld2, Tys);
6004     Ops[1] = Builder.CreateCall(F, Ops[1], "vld2");
6005     Ops[0] = Builder.CreateBitCast(Ops[0],
6006                 llvm::PointerType::getUnqual(Ops[1]->getType()));
6007     return Builder.CreateDefaultAlignedStore(Ops[1], Ops[0]);
6008   }
6009   case NEON::BI__builtin_neon_vld3_v:
6010   case NEON::BI__builtin_neon_vld3q_v: {
6011     llvm::Type *PTy = llvm::PointerType::getUnqual(VTy);
6012     Ops[1] = Builder.CreateBitCast(Ops[1], PTy);
6013     llvm::Type *Tys[2] = { VTy, PTy };
6014     Function *F = CGM.getIntrinsic(Intrinsic::aarch64_neon_ld3, Tys);
6015     Ops[1] = Builder.CreateCall(F, Ops[1], "vld3");
6016     Ops[0] = Builder.CreateBitCast(Ops[0],
6017                 llvm::PointerType::getUnqual(Ops[1]->getType()));
6018     return Builder.CreateDefaultAlignedStore(Ops[1], Ops[0]);
6019   }
6020   case NEON::BI__builtin_neon_vld4_v:
6021   case NEON::BI__builtin_neon_vld4q_v: {
6022     llvm::Type *PTy = llvm::PointerType::getUnqual(VTy);
6023     Ops[1] = Builder.CreateBitCast(Ops[1], PTy);
6024     llvm::Type *Tys[2] = { VTy, PTy };
6025     Function *F = CGM.getIntrinsic(Intrinsic::aarch64_neon_ld4, Tys);
6026     Ops[1] = Builder.CreateCall(F, Ops[1], "vld4");
6027     Ops[0] = Builder.CreateBitCast(Ops[0],
6028                 llvm::PointerType::getUnqual(Ops[1]->getType()));
6029     return Builder.CreateDefaultAlignedStore(Ops[1], Ops[0]);
6030   }
6031   case NEON::BI__builtin_neon_vld2_dup_v:
6032   case NEON::BI__builtin_neon_vld2q_dup_v: {
6033     llvm::Type *PTy =
6034       llvm::PointerType::getUnqual(VTy->getElementType());
6035     Ops[1] = Builder.CreateBitCast(Ops[1], PTy);
6036     llvm::Type *Tys[2] = { VTy, PTy };
6037     Function *F = CGM.getIntrinsic(Intrinsic::aarch64_neon_ld2r, Tys);
6038     Ops[1] = Builder.CreateCall(F, Ops[1], "vld2");
6039     Ops[0] = Builder.CreateBitCast(Ops[0],
6040                 llvm::PointerType::getUnqual(Ops[1]->getType()));
6041     return Builder.CreateDefaultAlignedStore(Ops[1], Ops[0]);
6042   }
6043   case NEON::BI__builtin_neon_vld3_dup_v:
6044   case NEON::BI__builtin_neon_vld3q_dup_v: {
6045     llvm::Type *PTy =
6046       llvm::PointerType::getUnqual(VTy->getElementType());
6047     Ops[1] = Builder.CreateBitCast(Ops[1], PTy);
6048     llvm::Type *Tys[2] = { VTy, PTy };
6049     Function *F = CGM.getIntrinsic(Intrinsic::aarch64_neon_ld3r, Tys);
6050     Ops[1] = Builder.CreateCall(F, Ops[1], "vld3");
6051     Ops[0] = Builder.CreateBitCast(Ops[0],
6052                 llvm::PointerType::getUnqual(Ops[1]->getType()));
6053     return Builder.CreateDefaultAlignedStore(Ops[1], Ops[0]);
6054   }
6055   case NEON::BI__builtin_neon_vld4_dup_v:
6056   case NEON::BI__builtin_neon_vld4q_dup_v: {
6057     llvm::Type *PTy =
6058       llvm::PointerType::getUnqual(VTy->getElementType());
6059     Ops[1] = Builder.CreateBitCast(Ops[1], PTy);
6060     llvm::Type *Tys[2] = { VTy, PTy };
6061     Function *F = CGM.getIntrinsic(Intrinsic::aarch64_neon_ld4r, Tys);
6062     Ops[1] = Builder.CreateCall(F, Ops[1], "vld4");
6063     Ops[0] = Builder.CreateBitCast(Ops[0],
6064                 llvm::PointerType::getUnqual(Ops[1]->getType()));
6065     return Builder.CreateDefaultAlignedStore(Ops[1], Ops[0]);
6066   }
6067   case NEON::BI__builtin_neon_vld2_lane_v:
6068   case NEON::BI__builtin_neon_vld2q_lane_v: {
6069     llvm::Type *Tys[2] = { VTy, Ops[1]->getType() };
6070     Function *F = CGM.getIntrinsic(Intrinsic::aarch64_neon_ld2lane, Tys);
6071     Ops.push_back(Ops[1]);
6072     Ops.erase(Ops.begin()+1);
6073     Ops[1] = Builder.CreateBitCast(Ops[1], Ty);
6074     Ops[2] = Builder.CreateBitCast(Ops[2], Ty);
6075     Ops[3] = Builder.CreateZExt(Ops[3], Int64Ty);
6076     Ops[1] = Builder.CreateCall(F, makeArrayRef(Ops).slice(1), "vld2_lane");
6077     Ty = llvm::PointerType::getUnqual(Ops[1]->getType());
6078     Ops[0] = Builder.CreateBitCast(Ops[0], Ty);
6079     return Builder.CreateDefaultAlignedStore(Ops[1], Ops[0]);
6080   }
6081   case NEON::BI__builtin_neon_vld3_lane_v:
6082   case NEON::BI__builtin_neon_vld3q_lane_v: {
6083     llvm::Type *Tys[2] = { VTy, Ops[1]->getType() };
6084     Function *F = CGM.getIntrinsic(Intrinsic::aarch64_neon_ld3lane, Tys);
6085     Ops.push_back(Ops[1]);
6086     Ops.erase(Ops.begin()+1);
6087     Ops[1] = Builder.CreateBitCast(Ops[1], Ty);
6088     Ops[2] = Builder.CreateBitCast(Ops[2], Ty);
6089     Ops[3] = Builder.CreateBitCast(Ops[3], Ty);
6090     Ops[4] = Builder.CreateZExt(Ops[4], Int64Ty);
6091     Ops[1] = Builder.CreateCall(F, makeArrayRef(Ops).slice(1), "vld3_lane");
6092     Ty = llvm::PointerType::getUnqual(Ops[1]->getType());
6093     Ops[0] = Builder.CreateBitCast(Ops[0], Ty);
6094     return Builder.CreateDefaultAlignedStore(Ops[1], Ops[0]);
6095   }
6096   case NEON::BI__builtin_neon_vld4_lane_v:
6097   case NEON::BI__builtin_neon_vld4q_lane_v: {
6098     llvm::Type *Tys[2] = { VTy, Ops[1]->getType() };
6099     Function *F = CGM.getIntrinsic(Intrinsic::aarch64_neon_ld4lane, Tys);
6100     Ops.push_back(Ops[1]);
6101     Ops.erase(Ops.begin()+1);
6102     Ops[1] = Builder.CreateBitCast(Ops[1], Ty);
6103     Ops[2] = Builder.CreateBitCast(Ops[2], Ty);
6104     Ops[3] = Builder.CreateBitCast(Ops[3], Ty);
6105     Ops[4] = Builder.CreateBitCast(Ops[4], Ty);
6106     Ops[5] = Builder.CreateZExt(Ops[5], Int64Ty);
6107     Ops[1] = Builder.CreateCall(F, makeArrayRef(Ops).slice(1), "vld4_lane");
6108     Ty = llvm::PointerType::getUnqual(Ops[1]->getType());
6109     Ops[0] = Builder.CreateBitCast(Ops[0], Ty);
6110     return Builder.CreateDefaultAlignedStore(Ops[1], Ops[0]);
6111   }
6112   case NEON::BI__builtin_neon_vst2_v:
6113   case NEON::BI__builtin_neon_vst2q_v: {
6114     Ops.push_back(Ops[0]);
6115     Ops.erase(Ops.begin());
6116     llvm::Type *Tys[2] = { VTy, Ops[2]->getType() };
6117     return EmitNeonCall(CGM.getIntrinsic(Intrinsic::aarch64_neon_st2, Tys),
6118                         Ops, "");
6119   }
6120   case NEON::BI__builtin_neon_vst2_lane_v:
6121   case NEON::BI__builtin_neon_vst2q_lane_v: {
6122     Ops.push_back(Ops[0]);
6123     Ops.erase(Ops.begin());
6124     Ops[2] = Builder.CreateZExt(Ops[2], Int64Ty);
6125     llvm::Type *Tys[2] = { VTy, Ops[3]->getType() };
6126     return EmitNeonCall(CGM.getIntrinsic(Intrinsic::aarch64_neon_st2lane, Tys),
6127                         Ops, "");
6128   }
6129   case NEON::BI__builtin_neon_vst3_v:
6130   case NEON::BI__builtin_neon_vst3q_v: {
6131     Ops.push_back(Ops[0]);
6132     Ops.erase(Ops.begin());
6133     llvm::Type *Tys[2] = { VTy, Ops[3]->getType() };
6134     return EmitNeonCall(CGM.getIntrinsic(Intrinsic::aarch64_neon_st3, Tys),
6135                         Ops, "");
6136   }
6137   case NEON::BI__builtin_neon_vst3_lane_v:
6138   case NEON::BI__builtin_neon_vst3q_lane_v: {
6139     Ops.push_back(Ops[0]);
6140     Ops.erase(Ops.begin());
6141     Ops[3] = Builder.CreateZExt(Ops[3], Int64Ty);
6142     llvm::Type *Tys[2] = { VTy, Ops[4]->getType() };
6143     return EmitNeonCall(CGM.getIntrinsic(Intrinsic::aarch64_neon_st3lane, Tys),
6144                         Ops, "");
6145   }
6146   case NEON::BI__builtin_neon_vst4_v:
6147   case NEON::BI__builtin_neon_vst4q_v: {
6148     Ops.push_back(Ops[0]);
6149     Ops.erase(Ops.begin());
6150     llvm::Type *Tys[2] = { VTy, Ops[4]->getType() };
6151     return EmitNeonCall(CGM.getIntrinsic(Intrinsic::aarch64_neon_st4, Tys),
6152                         Ops, "");
6153   }
6154   case NEON::BI__builtin_neon_vst4_lane_v:
6155   case NEON::BI__builtin_neon_vst4q_lane_v: {
6156     Ops.push_back(Ops[0]);
6157     Ops.erase(Ops.begin());
6158     Ops[4] = Builder.CreateZExt(Ops[4], Int64Ty);
6159     llvm::Type *Tys[2] = { VTy, Ops[5]->getType() };
6160     return EmitNeonCall(CGM.getIntrinsic(Intrinsic::aarch64_neon_st4lane, Tys),
6161                         Ops, "");
6162   }
6163   case NEON::BI__builtin_neon_vtrn_v:
6164   case NEON::BI__builtin_neon_vtrnq_v: {
6165     Ops[0] = Builder.CreateBitCast(Ops[0], llvm::PointerType::getUnqual(Ty));
6166     Ops[1] = Builder.CreateBitCast(Ops[1], Ty);
6167     Ops[2] = Builder.CreateBitCast(Ops[2], Ty);
6168     Value *SV = nullptr;
6169 
6170     for (unsigned vi = 0; vi != 2; ++vi) {
6171       SmallVector<Constant*, 16> Indices;
6172       for (unsigned i = 0, e = VTy->getNumElements(); i != e; i += 2) {
6173         Indices.push_back(ConstantInt::get(Int32Ty, i+vi));
6174         Indices.push_back(ConstantInt::get(Int32Ty, i+e+vi));
6175       }
6176       Value *Addr = Builder.CreateConstInBoundsGEP1_32(Ty, Ops[0], vi);
6177       SV = llvm::ConstantVector::get(Indices);
6178       SV = Builder.CreateShuffleVector(Ops[1], Ops[2], SV, "vtrn");
6179       SV = Builder.CreateDefaultAlignedStore(SV, Addr);
6180     }
6181     return SV;
6182   }
6183   case NEON::BI__builtin_neon_vuzp_v:
6184   case NEON::BI__builtin_neon_vuzpq_v: {
6185     Ops[0] = Builder.CreateBitCast(Ops[0], llvm::PointerType::getUnqual(Ty));
6186     Ops[1] = Builder.CreateBitCast(Ops[1], Ty);
6187     Ops[2] = Builder.CreateBitCast(Ops[2], Ty);
6188     Value *SV = nullptr;
6189 
6190     for (unsigned vi = 0; vi != 2; ++vi) {
6191       SmallVector<Constant*, 16> Indices;
6192       for (unsigned i = 0, e = VTy->getNumElements(); i != e; ++i)
6193         Indices.push_back(ConstantInt::get(Int32Ty, 2*i+vi));
6194 
6195       Value *Addr = Builder.CreateConstInBoundsGEP1_32(Ty, Ops[0], vi);
6196       SV = llvm::ConstantVector::get(Indices);
6197       SV = Builder.CreateShuffleVector(Ops[1], Ops[2], SV, "vuzp");
6198       SV = Builder.CreateDefaultAlignedStore(SV, Addr);
6199     }
6200     return SV;
6201   }
6202   case NEON::BI__builtin_neon_vzip_v:
6203   case NEON::BI__builtin_neon_vzipq_v: {
6204     Ops[0] = Builder.CreateBitCast(Ops[0], llvm::PointerType::getUnqual(Ty));
6205     Ops[1] = Builder.CreateBitCast(Ops[1], Ty);
6206     Ops[2] = Builder.CreateBitCast(Ops[2], Ty);
6207     Value *SV = nullptr;
6208 
6209     for (unsigned vi = 0; vi != 2; ++vi) {
6210       SmallVector<Constant*, 16> Indices;
6211       for (unsigned i = 0, e = VTy->getNumElements(); i != e; i += 2) {
6212         Indices.push_back(ConstantInt::get(Int32Ty, (i + vi*e) >> 1));
6213         Indices.push_back(ConstantInt::get(Int32Ty, ((i + vi*e) >> 1)+e));
6214       }
6215       Value *Addr = Builder.CreateConstInBoundsGEP1_32(Ty, Ops[0], vi);
6216       SV = llvm::ConstantVector::get(Indices);
6217       SV = Builder.CreateShuffleVector(Ops[1], Ops[2], SV, "vzip");
6218       SV = Builder.CreateDefaultAlignedStore(SV, Addr);
6219     }
6220     return SV;
6221   }
6222   case NEON::BI__builtin_neon_vqtbl1q_v: {
6223     return EmitNeonCall(CGM.getIntrinsic(Intrinsic::aarch64_neon_tbl1, Ty),
6224                         Ops, "vtbl1");
6225   }
6226   case NEON::BI__builtin_neon_vqtbl2q_v: {
6227     return EmitNeonCall(CGM.getIntrinsic(Intrinsic::aarch64_neon_tbl2, Ty),
6228                         Ops, "vtbl2");
6229   }
6230   case NEON::BI__builtin_neon_vqtbl3q_v: {
6231     return EmitNeonCall(CGM.getIntrinsic(Intrinsic::aarch64_neon_tbl3, Ty),
6232                         Ops, "vtbl3");
6233   }
6234   case NEON::BI__builtin_neon_vqtbl4q_v: {
6235     return EmitNeonCall(CGM.getIntrinsic(Intrinsic::aarch64_neon_tbl4, Ty),
6236                         Ops, "vtbl4");
6237   }
6238   case NEON::BI__builtin_neon_vqtbx1q_v: {
6239     return EmitNeonCall(CGM.getIntrinsic(Intrinsic::aarch64_neon_tbx1, Ty),
6240                         Ops, "vtbx1");
6241   }
6242   case NEON::BI__builtin_neon_vqtbx2q_v: {
6243     return EmitNeonCall(CGM.getIntrinsic(Intrinsic::aarch64_neon_tbx2, Ty),
6244                         Ops, "vtbx2");
6245   }
6246   case NEON::BI__builtin_neon_vqtbx3q_v: {
6247     return EmitNeonCall(CGM.getIntrinsic(Intrinsic::aarch64_neon_tbx3, Ty),
6248                         Ops, "vtbx3");
6249   }
6250   case NEON::BI__builtin_neon_vqtbx4q_v: {
6251     return EmitNeonCall(CGM.getIntrinsic(Intrinsic::aarch64_neon_tbx4, Ty),
6252                         Ops, "vtbx4");
6253   }
6254   case NEON::BI__builtin_neon_vsqadd_v:
6255   case NEON::BI__builtin_neon_vsqaddq_v: {
6256     Int = Intrinsic::aarch64_neon_usqadd;
6257     return EmitNeonCall(CGM.getIntrinsic(Int, Ty), Ops, "vsqadd");
6258   }
6259   case NEON::BI__builtin_neon_vuqadd_v:
6260   case NEON::BI__builtin_neon_vuqaddq_v: {
6261     Int = Intrinsic::aarch64_neon_suqadd;
6262     return EmitNeonCall(CGM.getIntrinsic(Int, Ty), Ops, "vuqadd");
6263   }
6264   }
6265 }
6266 
6267 llvm::Value *CodeGenFunction::
6268 BuildVector(ArrayRef<llvm::Value*> Ops) {
6269   assert((Ops.size() & (Ops.size() - 1)) == 0 &&
6270          "Not a power-of-two sized vector!");
6271   bool AllConstants = true;
6272   for (unsigned i = 0, e = Ops.size(); i != e && AllConstants; ++i)
6273     AllConstants &= isa<Constant>(Ops[i]);
6274 
6275   // If this is a constant vector, create a ConstantVector.
6276   if (AllConstants) {
6277     SmallVector<llvm::Constant*, 16> CstOps;
6278     for (unsigned i = 0, e = Ops.size(); i != e; ++i)
6279       CstOps.push_back(cast<Constant>(Ops[i]));
6280     return llvm::ConstantVector::get(CstOps);
6281   }
6282 
6283   // Otherwise, insertelement the values to build the vector.
6284   Value *Result =
6285     llvm::UndefValue::get(llvm::VectorType::get(Ops[0]->getType(), Ops.size()));
6286 
6287   for (unsigned i = 0, e = Ops.size(); i != e; ++i)
6288     Result = Builder.CreateInsertElement(Result, Ops[i], Builder.getInt32(i));
6289 
6290   return Result;
6291 }
6292 
6293 Value *CodeGenFunction::EmitX86BuiltinExpr(unsigned BuiltinID,
6294                                            const CallExpr *E) {
6295   if (BuiltinID == X86::BI__builtin_ms_va_start ||
6296       BuiltinID == X86::BI__builtin_ms_va_end)
6297     return EmitVAStartEnd(EmitMSVAListRef(E->getArg(0)).getPointer(),
6298                           BuiltinID == X86::BI__builtin_ms_va_start);
6299   if (BuiltinID == X86::BI__builtin_ms_va_copy) {
6300     // Lower this manually. We can't reliably determine whether or not any
6301     // given va_copy() is for a Win64 va_list from the calling convention
6302     // alone, because it's legal to do this from a System V ABI function.
6303     // With opaque pointer types, we won't have enough information in LLVM
6304     // IR to determine this from the argument types, either. Best to do it
6305     // now, while we have enough information.
6306     Address DestAddr = EmitMSVAListRef(E->getArg(0));
6307     Address SrcAddr = EmitMSVAListRef(E->getArg(1));
6308 
6309     llvm::Type *BPP = Int8PtrPtrTy;
6310 
6311     DestAddr = Address(Builder.CreateBitCast(DestAddr.getPointer(), BPP, "cp"),
6312                        DestAddr.getAlignment());
6313     SrcAddr = Address(Builder.CreateBitCast(SrcAddr.getPointer(), BPP, "ap"),
6314                       SrcAddr.getAlignment());
6315 
6316     Value *ArgPtr = Builder.CreateLoad(SrcAddr, "ap.val");
6317     return Builder.CreateStore(ArgPtr, DestAddr);
6318   }
6319 
6320   SmallVector<Value*, 4> Ops;
6321 
6322   // Find out if any arguments are required to be integer constant expressions.
6323   unsigned ICEArguments = 0;
6324   ASTContext::GetBuiltinTypeError Error;
6325   getContext().GetBuiltinType(BuiltinID, Error, &ICEArguments);
6326   assert(Error == ASTContext::GE_None && "Should not codegen an error");
6327 
6328   for (unsigned i = 0, e = E->getNumArgs(); i != e; i++) {
6329     // If this is a normal argument, just emit it as a scalar.
6330     if ((ICEArguments & (1 << i)) == 0) {
6331       Ops.push_back(EmitScalarExpr(E->getArg(i)));
6332       continue;
6333     }
6334 
6335     // If this is required to be a constant, constant fold it so that we know
6336     // that the generated intrinsic gets a ConstantInt.
6337     llvm::APSInt Result;
6338     bool IsConst = E->getArg(i)->isIntegerConstantExpr(Result, getContext());
6339     assert(IsConst && "Constant arg isn't actually constant?"); (void)IsConst;
6340     Ops.push_back(llvm::ConstantInt::get(getLLVMContext(), Result));
6341   }
6342 
6343   switch (BuiltinID) {
6344   default: return nullptr;
6345   case X86::BI__builtin_cpu_supports: {
6346     const Expr *FeatureExpr = E->getArg(0)->IgnoreParenCasts();
6347     StringRef FeatureStr = cast<StringLiteral>(FeatureExpr)->getString();
6348 
6349     // TODO: When/if this becomes more than x86 specific then use a TargetInfo
6350     // based mapping.
6351     // Processor features and mapping to processor feature value.
6352     enum X86Features {
6353       CMOV = 0,
6354       MMX,
6355       POPCNT,
6356       SSE,
6357       SSE2,
6358       SSE3,
6359       SSSE3,
6360       SSE4_1,
6361       SSE4_2,
6362       AVX,
6363       AVX2,
6364       SSE4_A,
6365       FMA4,
6366       XOP,
6367       FMA,
6368       AVX512F,
6369       BMI,
6370       BMI2,
6371       MAX
6372     };
6373 
6374     X86Features Feature = StringSwitch<X86Features>(FeatureStr)
6375                               .Case("cmov", X86Features::CMOV)
6376                               .Case("mmx", X86Features::MMX)
6377                               .Case("popcnt", X86Features::POPCNT)
6378                               .Case("sse", X86Features::SSE)
6379                               .Case("sse2", X86Features::SSE2)
6380                               .Case("sse3", X86Features::SSE3)
6381                               .Case("sse4.1", X86Features::SSE4_1)
6382                               .Case("sse4.2", X86Features::SSE4_2)
6383                               .Case("avx", X86Features::AVX)
6384                               .Case("avx2", X86Features::AVX2)
6385                               .Case("sse4a", X86Features::SSE4_A)
6386                               .Case("fma4", X86Features::FMA4)
6387                               .Case("xop", X86Features::XOP)
6388                               .Case("fma", X86Features::FMA)
6389                               .Case("avx512f", X86Features::AVX512F)
6390                               .Case("bmi", X86Features::BMI)
6391                               .Case("bmi2", X86Features::BMI2)
6392                               .Default(X86Features::MAX);
6393     assert(Feature != X86Features::MAX && "Invalid feature!");
6394 
6395     // Matching the struct layout from the compiler-rt/libgcc structure that is
6396     // filled in:
6397     // unsigned int __cpu_vendor;
6398     // unsigned int __cpu_type;
6399     // unsigned int __cpu_subtype;
6400     // unsigned int __cpu_features[1];
6401     llvm::Type *STy = llvm::StructType::get(
6402         Int32Ty, Int32Ty, Int32Ty, llvm::ArrayType::get(Int32Ty, 1), nullptr);
6403 
6404     // Grab the global __cpu_model.
6405     llvm::Constant *CpuModel = CGM.CreateRuntimeVariable(STy, "__cpu_model");
6406 
6407     // Grab the first (0th) element from the field __cpu_features off of the
6408     // global in the struct STy.
6409     Value *Idxs[] = {
6410       ConstantInt::get(Int32Ty, 0),
6411       ConstantInt::get(Int32Ty, 3),
6412       ConstantInt::get(Int32Ty, 0)
6413     };
6414     Value *CpuFeatures = Builder.CreateGEP(STy, CpuModel, Idxs);
6415     Value *Features = Builder.CreateAlignedLoad(CpuFeatures,
6416                                                 CharUnits::fromQuantity(4));
6417 
6418     // Check the value of the bit corresponding to the feature requested.
6419     Value *Bitset = Builder.CreateAnd(
6420         Features, llvm::ConstantInt::get(Int32Ty, 1 << Feature));
6421     return Builder.CreateICmpNE(Bitset, llvm::ConstantInt::get(Int32Ty, 0));
6422   }
6423   case X86::BI_mm_prefetch: {
6424     Value *Address = Ops[0];
6425     Value *RW = ConstantInt::get(Int32Ty, 0);
6426     Value *Locality = Ops[1];
6427     Value *Data = ConstantInt::get(Int32Ty, 1);
6428     Value *F = CGM.getIntrinsic(Intrinsic::prefetch);
6429     return Builder.CreateCall(F, {Address, RW, Locality, Data});
6430   }
6431   case X86::BI__builtin_ia32_undef128:
6432   case X86::BI__builtin_ia32_undef256:
6433   case X86::BI__builtin_ia32_undef512:
6434     return UndefValue::get(ConvertType(E->getType()));
6435   case X86::BI__builtin_ia32_vec_init_v8qi:
6436   case X86::BI__builtin_ia32_vec_init_v4hi:
6437   case X86::BI__builtin_ia32_vec_init_v2si:
6438     return Builder.CreateBitCast(BuildVector(Ops),
6439                                  llvm::Type::getX86_MMXTy(getLLVMContext()));
6440   case X86::BI__builtin_ia32_vec_ext_v2si:
6441     return Builder.CreateExtractElement(Ops[0],
6442                                   llvm::ConstantInt::get(Ops[1]->getType(), 0));
6443   case X86::BI__builtin_ia32_ldmxcsr: {
6444     Address Tmp = CreateMemTemp(E->getArg(0)->getType());
6445     Builder.CreateStore(Ops[0], Tmp);
6446     return Builder.CreateCall(CGM.getIntrinsic(Intrinsic::x86_sse_ldmxcsr),
6447                           Builder.CreateBitCast(Tmp.getPointer(), Int8PtrTy));
6448   }
6449   case X86::BI__builtin_ia32_stmxcsr: {
6450     Address Tmp = CreateMemTemp(E->getType());
6451     Builder.CreateCall(CGM.getIntrinsic(Intrinsic::x86_sse_stmxcsr),
6452                        Builder.CreateBitCast(Tmp.getPointer(), Int8PtrTy));
6453     return Builder.CreateLoad(Tmp, "stmxcsr");
6454   }
6455   case X86::BI__builtin_ia32_xsave:
6456   case X86::BI__builtin_ia32_xsave64:
6457   case X86::BI__builtin_ia32_xrstor:
6458   case X86::BI__builtin_ia32_xrstor64:
6459   case X86::BI__builtin_ia32_xsaveopt:
6460   case X86::BI__builtin_ia32_xsaveopt64:
6461   case X86::BI__builtin_ia32_xrstors:
6462   case X86::BI__builtin_ia32_xrstors64:
6463   case X86::BI__builtin_ia32_xsavec:
6464   case X86::BI__builtin_ia32_xsavec64:
6465   case X86::BI__builtin_ia32_xsaves:
6466   case X86::BI__builtin_ia32_xsaves64: {
6467     Intrinsic::ID ID;
6468 #define INTRINSIC_X86_XSAVE_ID(NAME) \
6469     case X86::BI__builtin_ia32_##NAME: \
6470       ID = Intrinsic::x86_##NAME; \
6471       break
6472     switch (BuiltinID) {
6473     default: llvm_unreachable("Unsupported intrinsic!");
6474     INTRINSIC_X86_XSAVE_ID(xsave);
6475     INTRINSIC_X86_XSAVE_ID(xsave64);
6476     INTRINSIC_X86_XSAVE_ID(xrstor);
6477     INTRINSIC_X86_XSAVE_ID(xrstor64);
6478     INTRINSIC_X86_XSAVE_ID(xsaveopt);
6479     INTRINSIC_X86_XSAVE_ID(xsaveopt64);
6480     INTRINSIC_X86_XSAVE_ID(xrstors);
6481     INTRINSIC_X86_XSAVE_ID(xrstors64);
6482     INTRINSIC_X86_XSAVE_ID(xsavec);
6483     INTRINSIC_X86_XSAVE_ID(xsavec64);
6484     INTRINSIC_X86_XSAVE_ID(xsaves);
6485     INTRINSIC_X86_XSAVE_ID(xsaves64);
6486     }
6487 #undef INTRINSIC_X86_XSAVE_ID
6488     Value *Mhi = Builder.CreateTrunc(
6489       Builder.CreateLShr(Ops[1], ConstantInt::get(Int64Ty, 32)), Int32Ty);
6490     Value *Mlo = Builder.CreateTrunc(Ops[1], Int32Ty);
6491     Ops[1] = Mhi;
6492     Ops.push_back(Mlo);
6493     return Builder.CreateCall(CGM.getIntrinsic(ID), Ops);
6494   }
6495   case X86::BI__builtin_ia32_storehps:
6496   case X86::BI__builtin_ia32_storelps: {
6497     llvm::Type *PtrTy = llvm::PointerType::getUnqual(Int64Ty);
6498     llvm::Type *VecTy = llvm::VectorType::get(Int64Ty, 2);
6499 
6500     // cast val v2i64
6501     Ops[1] = Builder.CreateBitCast(Ops[1], VecTy, "cast");
6502 
6503     // extract (0, 1)
6504     unsigned Index = BuiltinID == X86::BI__builtin_ia32_storelps ? 0 : 1;
6505     llvm::Value *Idx = llvm::ConstantInt::get(SizeTy, Index);
6506     Ops[1] = Builder.CreateExtractElement(Ops[1], Idx, "extract");
6507 
6508     // cast pointer to i64 & store
6509     Ops[0] = Builder.CreateBitCast(Ops[0], PtrTy);
6510     return Builder.CreateDefaultAlignedStore(Ops[1], Ops[0]);
6511   }
6512   case X86::BI__builtin_ia32_palignr128:
6513   case X86::BI__builtin_ia32_palignr256: {
6514     unsigned ShiftVal = cast<llvm::ConstantInt>(Ops[2])->getZExtValue();
6515 
6516     unsigned NumElts =
6517       cast<llvm::VectorType>(Ops[0]->getType())->getNumElements();
6518     assert(NumElts % 16 == 0);
6519     unsigned NumLanes = NumElts / 16;
6520     unsigned NumLaneElts = NumElts / NumLanes;
6521 
6522     // If palignr is shifting the pair of vectors more than the size of two
6523     // lanes, emit zero.
6524     if (ShiftVal >= (2 * NumLaneElts))
6525       return llvm::Constant::getNullValue(ConvertType(E->getType()));
6526 
6527     // If palignr is shifting the pair of input vectors more than one lane,
6528     // but less than two lanes, convert to shifting in zeroes.
6529     if (ShiftVal > NumLaneElts) {
6530       ShiftVal -= NumLaneElts;
6531       Ops[1] = Ops[0];
6532       Ops[0] = llvm::Constant::getNullValue(Ops[0]->getType());
6533     }
6534 
6535     uint32_t Indices[32];
6536     // 256-bit palignr operates on 128-bit lanes so we need to handle that
6537     for (unsigned l = 0; l != NumElts; l += NumLaneElts) {
6538       for (unsigned i = 0; i != NumLaneElts; ++i) {
6539         unsigned Idx = ShiftVal + i;
6540         if (Idx >= NumLaneElts)
6541           Idx += NumElts - NumLaneElts; // End of lane, switch operand.
6542         Indices[l + i] = Idx + l;
6543       }
6544     }
6545 
6546     Value *SV = llvm::ConstantDataVector::get(getLLVMContext(),
6547                                               makeArrayRef(Indices, NumElts));
6548     return Builder.CreateShuffleVector(Ops[1], Ops[0], SV, "palignr");
6549   }
6550   case X86::BI__builtin_ia32_pslldqi256: {
6551     // Shift value is in bits so divide by 8.
6552     unsigned shiftVal = cast<llvm::ConstantInt>(Ops[1])->getZExtValue() >> 3;
6553 
6554     // If pslldq is shifting the vector more than 15 bytes, emit zero.
6555     if (shiftVal >= 16)
6556       return llvm::Constant::getNullValue(ConvertType(E->getType()));
6557 
6558     uint32_t Indices[32];
6559     // 256-bit pslldq operates on 128-bit lanes so we need to handle that
6560     for (unsigned l = 0; l != 32; l += 16) {
6561       for (unsigned i = 0; i != 16; ++i) {
6562         unsigned Idx = 32 + i - shiftVal;
6563         if (Idx < 32) Idx -= 16; // end of lane, switch operand.
6564         Indices[l + i] = Idx + l;
6565       }
6566     }
6567 
6568     llvm::Type *VecTy = llvm::VectorType::get(Int8Ty, 32);
6569     Ops[0] = Builder.CreateBitCast(Ops[0], VecTy, "cast");
6570     Value *Zero = llvm::Constant::getNullValue(VecTy);
6571 
6572     Value *SV = llvm::ConstantDataVector::get(getLLVMContext(), Indices);
6573     SV = Builder.CreateShuffleVector(Zero, Ops[0], SV, "pslldq");
6574     llvm::Type *ResultType = ConvertType(E->getType());
6575     return Builder.CreateBitCast(SV, ResultType, "cast");
6576   }
6577   case X86::BI__builtin_ia32_psrldqi256: {
6578     // Shift value is in bits so divide by 8.
6579     unsigned shiftVal = cast<llvm::ConstantInt>(Ops[1])->getZExtValue() >> 3;
6580 
6581     // If psrldq is shifting the vector more than 15 bytes, emit zero.
6582     if (shiftVal >= 16)
6583       return llvm::Constant::getNullValue(ConvertType(E->getType()));
6584 
6585     uint32_t Indices[32];
6586     // 256-bit psrldq operates on 128-bit lanes so we need to handle that
6587     for (unsigned l = 0; l != 32; l += 16) {
6588       for (unsigned i = 0; i != 16; ++i) {
6589         unsigned Idx = i + shiftVal;
6590         if (Idx >= 16) Idx += 16; // end of lane, switch operand.
6591         Indices[l + i] = Idx + l;
6592       }
6593     }
6594 
6595     llvm::Type *VecTy = llvm::VectorType::get(Int8Ty, 32);
6596     Ops[0] = Builder.CreateBitCast(Ops[0], VecTy, "cast");
6597     Value *Zero = llvm::Constant::getNullValue(VecTy);
6598 
6599     Value *SV = llvm::ConstantDataVector::get(getLLVMContext(), Indices);
6600     SV = Builder.CreateShuffleVector(Ops[0], Zero, SV, "psrldq");
6601     llvm::Type *ResultType = ConvertType(E->getType());
6602     return Builder.CreateBitCast(SV, ResultType, "cast");
6603   }
6604   case X86::BI__builtin_ia32_movntps:
6605   case X86::BI__builtin_ia32_movntps256:
6606   case X86::BI__builtin_ia32_movntpd:
6607   case X86::BI__builtin_ia32_movntpd256:
6608   case X86::BI__builtin_ia32_movntdq:
6609   case X86::BI__builtin_ia32_movntdq256:
6610   case X86::BI__builtin_ia32_movnti:
6611   case X86::BI__builtin_ia32_movnti64: {
6612     llvm::MDNode *Node = llvm::MDNode::get(
6613         getLLVMContext(), llvm::ConstantAsMetadata::get(Builder.getInt32(1)));
6614 
6615     // Convert the type of the pointer to a pointer to the stored type.
6616     Value *BC = Builder.CreateBitCast(Ops[0],
6617                                 llvm::PointerType::getUnqual(Ops[1]->getType()),
6618                                       "cast");
6619     StoreInst *SI = Builder.CreateDefaultAlignedStore(Ops[1], BC);
6620     SI->setMetadata(CGM.getModule().getMDKindID("nontemporal"), Node);
6621 
6622     // If the operand is an integer, we can't assume alignment. Otherwise,
6623     // assume natural alignment.
6624     QualType ArgTy = E->getArg(1)->getType();
6625     unsigned Align;
6626     if (ArgTy->isIntegerType())
6627       Align = 1;
6628     else
6629       Align = getContext().getTypeSizeInChars(ArgTy).getQuantity();
6630     SI->setAlignment(Align);
6631     return SI;
6632   }
6633   // 3DNow!
6634   case X86::BI__builtin_ia32_pswapdsf:
6635   case X86::BI__builtin_ia32_pswapdsi: {
6636     llvm::Type *MMXTy = llvm::Type::getX86_MMXTy(getLLVMContext());
6637     Ops[0] = Builder.CreateBitCast(Ops[0], MMXTy, "cast");
6638     llvm::Function *F = CGM.getIntrinsic(Intrinsic::x86_3dnowa_pswapd);
6639     return Builder.CreateCall(F, Ops, "pswapd");
6640   }
6641   case X86::BI__builtin_ia32_rdrand16_step:
6642   case X86::BI__builtin_ia32_rdrand32_step:
6643   case X86::BI__builtin_ia32_rdrand64_step:
6644   case X86::BI__builtin_ia32_rdseed16_step:
6645   case X86::BI__builtin_ia32_rdseed32_step:
6646   case X86::BI__builtin_ia32_rdseed64_step: {
6647     Intrinsic::ID ID;
6648     switch (BuiltinID) {
6649     default: llvm_unreachable("Unsupported intrinsic!");
6650     case X86::BI__builtin_ia32_rdrand16_step:
6651       ID = Intrinsic::x86_rdrand_16;
6652       break;
6653     case X86::BI__builtin_ia32_rdrand32_step:
6654       ID = Intrinsic::x86_rdrand_32;
6655       break;
6656     case X86::BI__builtin_ia32_rdrand64_step:
6657       ID = Intrinsic::x86_rdrand_64;
6658       break;
6659     case X86::BI__builtin_ia32_rdseed16_step:
6660       ID = Intrinsic::x86_rdseed_16;
6661       break;
6662     case X86::BI__builtin_ia32_rdseed32_step:
6663       ID = Intrinsic::x86_rdseed_32;
6664       break;
6665     case X86::BI__builtin_ia32_rdseed64_step:
6666       ID = Intrinsic::x86_rdseed_64;
6667       break;
6668     }
6669 
6670     Value *Call = Builder.CreateCall(CGM.getIntrinsic(ID));
6671     Builder.CreateDefaultAlignedStore(Builder.CreateExtractValue(Call, 0),
6672                                       Ops[0]);
6673     return Builder.CreateExtractValue(Call, 1);
6674   }
6675   // SSE comparison intrisics
6676   case X86::BI__builtin_ia32_cmpeqps:
6677   case X86::BI__builtin_ia32_cmpltps:
6678   case X86::BI__builtin_ia32_cmpleps:
6679   case X86::BI__builtin_ia32_cmpunordps:
6680   case X86::BI__builtin_ia32_cmpneqps:
6681   case X86::BI__builtin_ia32_cmpnltps:
6682   case X86::BI__builtin_ia32_cmpnleps:
6683   case X86::BI__builtin_ia32_cmpordps:
6684   case X86::BI__builtin_ia32_cmpeqss:
6685   case X86::BI__builtin_ia32_cmpltss:
6686   case X86::BI__builtin_ia32_cmpless:
6687   case X86::BI__builtin_ia32_cmpunordss:
6688   case X86::BI__builtin_ia32_cmpneqss:
6689   case X86::BI__builtin_ia32_cmpnltss:
6690   case X86::BI__builtin_ia32_cmpnless:
6691   case X86::BI__builtin_ia32_cmpordss:
6692   case X86::BI__builtin_ia32_cmpeqpd:
6693   case X86::BI__builtin_ia32_cmpltpd:
6694   case X86::BI__builtin_ia32_cmplepd:
6695   case X86::BI__builtin_ia32_cmpunordpd:
6696   case X86::BI__builtin_ia32_cmpneqpd:
6697   case X86::BI__builtin_ia32_cmpnltpd:
6698   case X86::BI__builtin_ia32_cmpnlepd:
6699   case X86::BI__builtin_ia32_cmpordpd:
6700   case X86::BI__builtin_ia32_cmpeqsd:
6701   case X86::BI__builtin_ia32_cmpltsd:
6702   case X86::BI__builtin_ia32_cmplesd:
6703   case X86::BI__builtin_ia32_cmpunordsd:
6704   case X86::BI__builtin_ia32_cmpneqsd:
6705   case X86::BI__builtin_ia32_cmpnltsd:
6706   case X86::BI__builtin_ia32_cmpnlesd:
6707   case X86::BI__builtin_ia32_cmpordsd:
6708     // These exist so that the builtin that takes an immediate can be bounds
6709     // checked by clang to avoid passing bad immediates to the backend. Since
6710     // AVX has a larger immediate than SSE we would need separate builtins to
6711     // do the different bounds checking. Rather than create a clang specific
6712     // SSE only builtin, this implements eight separate builtins to match gcc
6713     // implementation.
6714 
6715     // Choose the immediate.
6716     unsigned Imm;
6717     switch (BuiltinID) {
6718     default: llvm_unreachable("Unsupported intrinsic!");
6719     case X86::BI__builtin_ia32_cmpeqps:
6720     case X86::BI__builtin_ia32_cmpeqss:
6721     case X86::BI__builtin_ia32_cmpeqpd:
6722     case X86::BI__builtin_ia32_cmpeqsd:
6723       Imm = 0;
6724       break;
6725     case X86::BI__builtin_ia32_cmpltps:
6726     case X86::BI__builtin_ia32_cmpltss:
6727     case X86::BI__builtin_ia32_cmpltpd:
6728     case X86::BI__builtin_ia32_cmpltsd:
6729       Imm = 1;
6730       break;
6731     case X86::BI__builtin_ia32_cmpleps:
6732     case X86::BI__builtin_ia32_cmpless:
6733     case X86::BI__builtin_ia32_cmplepd:
6734     case X86::BI__builtin_ia32_cmplesd:
6735       Imm = 2;
6736       break;
6737     case X86::BI__builtin_ia32_cmpunordps:
6738     case X86::BI__builtin_ia32_cmpunordss:
6739     case X86::BI__builtin_ia32_cmpunordpd:
6740     case X86::BI__builtin_ia32_cmpunordsd:
6741       Imm = 3;
6742       break;
6743     case X86::BI__builtin_ia32_cmpneqps:
6744     case X86::BI__builtin_ia32_cmpneqss:
6745     case X86::BI__builtin_ia32_cmpneqpd:
6746     case X86::BI__builtin_ia32_cmpneqsd:
6747       Imm = 4;
6748       break;
6749     case X86::BI__builtin_ia32_cmpnltps:
6750     case X86::BI__builtin_ia32_cmpnltss:
6751     case X86::BI__builtin_ia32_cmpnltpd:
6752     case X86::BI__builtin_ia32_cmpnltsd:
6753       Imm = 5;
6754       break;
6755     case X86::BI__builtin_ia32_cmpnleps:
6756     case X86::BI__builtin_ia32_cmpnless:
6757     case X86::BI__builtin_ia32_cmpnlepd:
6758     case X86::BI__builtin_ia32_cmpnlesd:
6759       Imm = 6;
6760       break;
6761     case X86::BI__builtin_ia32_cmpordps:
6762     case X86::BI__builtin_ia32_cmpordss:
6763     case X86::BI__builtin_ia32_cmpordpd:
6764     case X86::BI__builtin_ia32_cmpordsd:
6765       Imm = 7;
6766       break;
6767     }
6768 
6769     // Choose the intrinsic ID.
6770     const char *name;
6771     Intrinsic::ID ID;
6772     switch (BuiltinID) {
6773     default: llvm_unreachable("Unsupported intrinsic!");
6774     case X86::BI__builtin_ia32_cmpeqps:
6775     case X86::BI__builtin_ia32_cmpltps:
6776     case X86::BI__builtin_ia32_cmpleps:
6777     case X86::BI__builtin_ia32_cmpunordps:
6778     case X86::BI__builtin_ia32_cmpneqps:
6779     case X86::BI__builtin_ia32_cmpnltps:
6780     case X86::BI__builtin_ia32_cmpnleps:
6781     case X86::BI__builtin_ia32_cmpordps:
6782       name = "cmpps";
6783       ID = Intrinsic::x86_sse_cmp_ps;
6784       break;
6785     case X86::BI__builtin_ia32_cmpeqss:
6786     case X86::BI__builtin_ia32_cmpltss:
6787     case X86::BI__builtin_ia32_cmpless:
6788     case X86::BI__builtin_ia32_cmpunordss:
6789     case X86::BI__builtin_ia32_cmpneqss:
6790     case X86::BI__builtin_ia32_cmpnltss:
6791     case X86::BI__builtin_ia32_cmpnless:
6792     case X86::BI__builtin_ia32_cmpordss:
6793       name = "cmpss";
6794       ID = Intrinsic::x86_sse_cmp_ss;
6795       break;
6796     case X86::BI__builtin_ia32_cmpeqpd:
6797     case X86::BI__builtin_ia32_cmpltpd:
6798     case X86::BI__builtin_ia32_cmplepd:
6799     case X86::BI__builtin_ia32_cmpunordpd:
6800     case X86::BI__builtin_ia32_cmpneqpd:
6801     case X86::BI__builtin_ia32_cmpnltpd:
6802     case X86::BI__builtin_ia32_cmpnlepd:
6803     case X86::BI__builtin_ia32_cmpordpd:
6804       name = "cmppd";
6805       ID = Intrinsic::x86_sse2_cmp_pd;
6806       break;
6807     case X86::BI__builtin_ia32_cmpeqsd:
6808     case X86::BI__builtin_ia32_cmpltsd:
6809     case X86::BI__builtin_ia32_cmplesd:
6810     case X86::BI__builtin_ia32_cmpunordsd:
6811     case X86::BI__builtin_ia32_cmpneqsd:
6812     case X86::BI__builtin_ia32_cmpnltsd:
6813     case X86::BI__builtin_ia32_cmpnlesd:
6814     case X86::BI__builtin_ia32_cmpordsd:
6815       name = "cmpsd";
6816       ID = Intrinsic::x86_sse2_cmp_sd;
6817       break;
6818     }
6819 
6820     Ops.push_back(llvm::ConstantInt::get(Int8Ty, Imm));
6821     llvm::Function *F = CGM.getIntrinsic(ID);
6822     return Builder.CreateCall(F, Ops, name);
6823   }
6824 }
6825 
6826 
6827 Value *CodeGenFunction::EmitPPCBuiltinExpr(unsigned BuiltinID,
6828                                            const CallExpr *E) {
6829   SmallVector<Value*, 4> Ops;
6830 
6831   for (unsigned i = 0, e = E->getNumArgs(); i != e; i++)
6832     Ops.push_back(EmitScalarExpr(E->getArg(i)));
6833 
6834   Intrinsic::ID ID = Intrinsic::not_intrinsic;
6835 
6836   switch (BuiltinID) {
6837   default: return nullptr;
6838 
6839   // __builtin_ppc_get_timebase is GCC 4.8+'s PowerPC-specific name for what we
6840   // call __builtin_readcyclecounter.
6841   case PPC::BI__builtin_ppc_get_timebase:
6842     return Builder.CreateCall(CGM.getIntrinsic(Intrinsic::readcyclecounter));
6843 
6844   // vec_ld, vec_lvsl, vec_lvsr
6845   case PPC::BI__builtin_altivec_lvx:
6846   case PPC::BI__builtin_altivec_lvxl:
6847   case PPC::BI__builtin_altivec_lvebx:
6848   case PPC::BI__builtin_altivec_lvehx:
6849   case PPC::BI__builtin_altivec_lvewx:
6850   case PPC::BI__builtin_altivec_lvsl:
6851   case PPC::BI__builtin_altivec_lvsr:
6852   case PPC::BI__builtin_vsx_lxvd2x:
6853   case PPC::BI__builtin_vsx_lxvw4x:
6854   {
6855     Ops[1] = Builder.CreateBitCast(Ops[1], Int8PtrTy);
6856 
6857     Ops[0] = Builder.CreateGEP(Ops[1], Ops[0]);
6858     Ops.pop_back();
6859 
6860     switch (BuiltinID) {
6861     default: llvm_unreachable("Unsupported ld/lvsl/lvsr intrinsic!");
6862     case PPC::BI__builtin_altivec_lvx:
6863       ID = Intrinsic::ppc_altivec_lvx;
6864       break;
6865     case PPC::BI__builtin_altivec_lvxl:
6866       ID = Intrinsic::ppc_altivec_lvxl;
6867       break;
6868     case PPC::BI__builtin_altivec_lvebx:
6869       ID = Intrinsic::ppc_altivec_lvebx;
6870       break;
6871     case PPC::BI__builtin_altivec_lvehx:
6872       ID = Intrinsic::ppc_altivec_lvehx;
6873       break;
6874     case PPC::BI__builtin_altivec_lvewx:
6875       ID = Intrinsic::ppc_altivec_lvewx;
6876       break;
6877     case PPC::BI__builtin_altivec_lvsl:
6878       ID = Intrinsic::ppc_altivec_lvsl;
6879       break;
6880     case PPC::BI__builtin_altivec_lvsr:
6881       ID = Intrinsic::ppc_altivec_lvsr;
6882       break;
6883     case PPC::BI__builtin_vsx_lxvd2x:
6884       ID = Intrinsic::ppc_vsx_lxvd2x;
6885       break;
6886     case PPC::BI__builtin_vsx_lxvw4x:
6887       ID = Intrinsic::ppc_vsx_lxvw4x;
6888       break;
6889     }
6890     llvm::Function *F = CGM.getIntrinsic(ID);
6891     return Builder.CreateCall(F, Ops, "");
6892   }
6893 
6894   // vec_st
6895   case PPC::BI__builtin_altivec_stvx:
6896   case PPC::BI__builtin_altivec_stvxl:
6897   case PPC::BI__builtin_altivec_stvebx:
6898   case PPC::BI__builtin_altivec_stvehx:
6899   case PPC::BI__builtin_altivec_stvewx:
6900   case PPC::BI__builtin_vsx_stxvd2x:
6901   case PPC::BI__builtin_vsx_stxvw4x:
6902   {
6903     Ops[2] = Builder.CreateBitCast(Ops[2], Int8PtrTy);
6904     Ops[1] = Builder.CreateGEP(Ops[2], Ops[1]);
6905     Ops.pop_back();
6906 
6907     switch (BuiltinID) {
6908     default: llvm_unreachable("Unsupported st intrinsic!");
6909     case PPC::BI__builtin_altivec_stvx:
6910       ID = Intrinsic::ppc_altivec_stvx;
6911       break;
6912     case PPC::BI__builtin_altivec_stvxl:
6913       ID = Intrinsic::ppc_altivec_stvxl;
6914       break;
6915     case PPC::BI__builtin_altivec_stvebx:
6916       ID = Intrinsic::ppc_altivec_stvebx;
6917       break;
6918     case PPC::BI__builtin_altivec_stvehx:
6919       ID = Intrinsic::ppc_altivec_stvehx;
6920       break;
6921     case PPC::BI__builtin_altivec_stvewx:
6922       ID = Intrinsic::ppc_altivec_stvewx;
6923       break;
6924     case PPC::BI__builtin_vsx_stxvd2x:
6925       ID = Intrinsic::ppc_vsx_stxvd2x;
6926       break;
6927     case PPC::BI__builtin_vsx_stxvw4x:
6928       ID = Intrinsic::ppc_vsx_stxvw4x;
6929       break;
6930     }
6931     llvm::Function *F = CGM.getIntrinsic(ID);
6932     return Builder.CreateCall(F, Ops, "");
6933   }
6934   // Square root
6935   case PPC::BI__builtin_vsx_xvsqrtsp:
6936   case PPC::BI__builtin_vsx_xvsqrtdp: {
6937     llvm::Type *ResultType = ConvertType(E->getType());
6938     Value *X = EmitScalarExpr(E->getArg(0));
6939     ID = Intrinsic::sqrt;
6940     llvm::Function *F = CGM.getIntrinsic(ID, ResultType);
6941     return Builder.CreateCall(F, X);
6942   }
6943   // Count leading zeros
6944   case PPC::BI__builtin_altivec_vclzb:
6945   case PPC::BI__builtin_altivec_vclzh:
6946   case PPC::BI__builtin_altivec_vclzw:
6947   case PPC::BI__builtin_altivec_vclzd: {
6948     llvm::Type *ResultType = ConvertType(E->getType());
6949     Value *X = EmitScalarExpr(E->getArg(0));
6950     Value *Undef = ConstantInt::get(Builder.getInt1Ty(), false);
6951     Function *F = CGM.getIntrinsic(Intrinsic::ctlz, ResultType);
6952     return Builder.CreateCall(F, {X, Undef});
6953   }
6954   // Copy sign
6955   case PPC::BI__builtin_vsx_xvcpsgnsp:
6956   case PPC::BI__builtin_vsx_xvcpsgndp: {
6957     llvm::Type *ResultType = ConvertType(E->getType());
6958     Value *X = EmitScalarExpr(E->getArg(0));
6959     Value *Y = EmitScalarExpr(E->getArg(1));
6960     ID = Intrinsic::copysign;
6961     llvm::Function *F = CGM.getIntrinsic(ID, ResultType);
6962     return Builder.CreateCall(F, {X, Y});
6963   }
6964   // Rounding/truncation
6965   case PPC::BI__builtin_vsx_xvrspip:
6966   case PPC::BI__builtin_vsx_xvrdpip:
6967   case PPC::BI__builtin_vsx_xvrdpim:
6968   case PPC::BI__builtin_vsx_xvrspim:
6969   case PPC::BI__builtin_vsx_xvrdpi:
6970   case PPC::BI__builtin_vsx_xvrspi:
6971   case PPC::BI__builtin_vsx_xvrdpic:
6972   case PPC::BI__builtin_vsx_xvrspic:
6973   case PPC::BI__builtin_vsx_xvrdpiz:
6974   case PPC::BI__builtin_vsx_xvrspiz: {
6975     llvm::Type *ResultType = ConvertType(E->getType());
6976     Value *X = EmitScalarExpr(E->getArg(0));
6977     if (BuiltinID == PPC::BI__builtin_vsx_xvrdpim ||
6978         BuiltinID == PPC::BI__builtin_vsx_xvrspim)
6979       ID = Intrinsic::floor;
6980     else if (BuiltinID == PPC::BI__builtin_vsx_xvrdpi ||
6981              BuiltinID == PPC::BI__builtin_vsx_xvrspi)
6982       ID = Intrinsic::round;
6983     else if (BuiltinID == PPC::BI__builtin_vsx_xvrdpic ||
6984              BuiltinID == PPC::BI__builtin_vsx_xvrspic)
6985       ID = Intrinsic::nearbyint;
6986     else if (BuiltinID == PPC::BI__builtin_vsx_xvrdpip ||
6987              BuiltinID == PPC::BI__builtin_vsx_xvrspip)
6988       ID = Intrinsic::ceil;
6989     else if (BuiltinID == PPC::BI__builtin_vsx_xvrdpiz ||
6990              BuiltinID == PPC::BI__builtin_vsx_xvrspiz)
6991       ID = Intrinsic::trunc;
6992     llvm::Function *F = CGM.getIntrinsic(ID, ResultType);
6993     return Builder.CreateCall(F, X);
6994   }
6995   // FMA variations
6996   case PPC::BI__builtin_vsx_xvmaddadp:
6997   case PPC::BI__builtin_vsx_xvmaddasp:
6998   case PPC::BI__builtin_vsx_xvnmaddadp:
6999   case PPC::BI__builtin_vsx_xvnmaddasp:
7000   case PPC::BI__builtin_vsx_xvmsubadp:
7001   case PPC::BI__builtin_vsx_xvmsubasp:
7002   case PPC::BI__builtin_vsx_xvnmsubadp:
7003   case PPC::BI__builtin_vsx_xvnmsubasp: {
7004     llvm::Type *ResultType = ConvertType(E->getType());
7005     Value *X = EmitScalarExpr(E->getArg(0));
7006     Value *Y = EmitScalarExpr(E->getArg(1));
7007     Value *Z = EmitScalarExpr(E->getArg(2));
7008     Value *Zero = llvm::ConstantFP::getZeroValueForNegation(ResultType);
7009     llvm::Function *F = CGM.getIntrinsic(Intrinsic::fma, ResultType);
7010     switch (BuiltinID) {
7011       case PPC::BI__builtin_vsx_xvmaddadp:
7012       case PPC::BI__builtin_vsx_xvmaddasp:
7013         return Builder.CreateCall(F, {X, Y, Z});
7014       case PPC::BI__builtin_vsx_xvnmaddadp:
7015       case PPC::BI__builtin_vsx_xvnmaddasp:
7016         return Builder.CreateFSub(Zero,
7017                                   Builder.CreateCall(F, {X, Y, Z}), "sub");
7018       case PPC::BI__builtin_vsx_xvmsubadp:
7019       case PPC::BI__builtin_vsx_xvmsubasp:
7020         return Builder.CreateCall(F,
7021                                   {X, Y, Builder.CreateFSub(Zero, Z, "sub")});
7022       case PPC::BI__builtin_vsx_xvnmsubadp:
7023       case PPC::BI__builtin_vsx_xvnmsubasp:
7024         Value *FsubRes =
7025           Builder.CreateCall(F, {X, Y, Builder.CreateFSub(Zero, Z, "sub")});
7026         return Builder.CreateFSub(Zero, FsubRes, "sub");
7027     }
7028     llvm_unreachable("Unknown FMA operation");
7029     return nullptr; // Suppress no-return warning
7030   }
7031   }
7032 }
7033 
7034 Value *CodeGenFunction::EmitAMDGPUBuiltinExpr(unsigned BuiltinID,
7035                                               const CallExpr *E) {
7036   switch (BuiltinID) {
7037   case AMDGPU::BI__builtin_amdgcn_div_scale:
7038   case AMDGPU::BI__builtin_amdgcn_div_scalef: {
7039     // Translate from the intrinsics's struct return to the builtin's out
7040     // argument.
7041 
7042     Address FlagOutPtr = EmitPointerWithAlignment(E->getArg(3));
7043 
7044     llvm::Value *X = EmitScalarExpr(E->getArg(0));
7045     llvm::Value *Y = EmitScalarExpr(E->getArg(1));
7046     llvm::Value *Z = EmitScalarExpr(E->getArg(2));
7047 
7048     llvm::Value *Callee = CGM.getIntrinsic(Intrinsic::amdgcn_div_scale,
7049                                            X->getType());
7050 
7051     llvm::Value *Tmp = Builder.CreateCall(Callee, {X, Y, Z});
7052 
7053     llvm::Value *Result = Builder.CreateExtractValue(Tmp, 0);
7054     llvm::Value *Flag = Builder.CreateExtractValue(Tmp, 1);
7055 
7056     llvm::Type *RealFlagType
7057       = FlagOutPtr.getPointer()->getType()->getPointerElementType();
7058 
7059     llvm::Value *FlagExt = Builder.CreateZExt(Flag, RealFlagType);
7060     Builder.CreateStore(FlagExt, FlagOutPtr);
7061     return Result;
7062   }
7063   case AMDGPU::BI__builtin_amdgcn_div_fmas:
7064   case AMDGPU::BI__builtin_amdgcn_div_fmasf: {
7065     llvm::Value *Src0 = EmitScalarExpr(E->getArg(0));
7066     llvm::Value *Src1 = EmitScalarExpr(E->getArg(1));
7067     llvm::Value *Src2 = EmitScalarExpr(E->getArg(2));
7068     llvm::Value *Src3 = EmitScalarExpr(E->getArg(3));
7069 
7070     llvm::Value *F = CGM.getIntrinsic(Intrinsic::amdgcn_div_fmas,
7071                                       Src0->getType());
7072     llvm::Value *Src3ToBool = Builder.CreateIsNotNull(Src3);
7073     return Builder.CreateCall(F, {Src0, Src1, Src2, Src3ToBool});
7074   }
7075   case AMDGPU::BI__builtin_amdgcn_div_fixup:
7076   case AMDGPU::BI__builtin_amdgcn_div_fixupf:
7077     return emitTernaryFPBuiltin(*this, E, Intrinsic::amdgcn_div_fixup);
7078   case AMDGPU::BI__builtin_amdgcn_trig_preop:
7079   case AMDGPU::BI__builtin_amdgcn_trig_preopf:
7080     return emitFPIntBuiltin(*this, E, Intrinsic::amdgcn_trig_preop);
7081   case AMDGPU::BI__builtin_amdgcn_rcp:
7082   case AMDGPU::BI__builtin_amdgcn_rcpf:
7083     return emitUnaryBuiltin(*this, E, Intrinsic::amdgcn_rcp);
7084   case AMDGPU::BI__builtin_amdgcn_rsq:
7085   case AMDGPU::BI__builtin_amdgcn_rsqf:
7086     return emitUnaryBuiltin(*this, E, Intrinsic::amdgcn_rsq);
7087   case AMDGPU::BI__builtin_amdgcn_rsq_clamp:
7088   case AMDGPU::BI__builtin_amdgcn_rsq_clampf:
7089     return emitUnaryBuiltin(*this, E, Intrinsic::amdgcn_rsq_clamp);
7090   case AMDGPU::BI__builtin_amdgcn_sinf:
7091     return emitUnaryBuiltin(*this, E, Intrinsic::amdgcn_sin);
7092   case AMDGPU::BI__builtin_amdgcn_cosf:
7093     return emitUnaryBuiltin(*this, E, Intrinsic::amdgcn_cos);
7094   case AMDGPU::BI__builtin_amdgcn_log_clampf:
7095     return emitUnaryBuiltin(*this, E, Intrinsic::amdgcn_log_clamp);
7096   case AMDGPU::BI__builtin_amdgcn_ldexp:
7097   case AMDGPU::BI__builtin_amdgcn_ldexpf:
7098     return emitFPIntBuiltin(*this, E, Intrinsic::amdgcn_ldexp);
7099   case AMDGPU::BI__builtin_amdgcn_class:
7100   case AMDGPU::BI__builtin_amdgcn_classf:
7101     return emitFPIntBuiltin(*this, E, Intrinsic::amdgcn_class);
7102 
7103     // Legacy amdgpu prefix
7104   case AMDGPU::BI__builtin_amdgpu_rsq:
7105   case AMDGPU::BI__builtin_amdgpu_rsqf: {
7106     if (getTarget().getTriple().getArch() == Triple::amdgcn)
7107       return emitUnaryBuiltin(*this, E, Intrinsic::amdgcn_rsq);
7108     return emitUnaryBuiltin(*this, E, Intrinsic::r600_rsq);
7109   }
7110   case AMDGPU::BI__builtin_amdgpu_ldexp:
7111   case AMDGPU::BI__builtin_amdgpu_ldexpf: {
7112     if (getTarget().getTriple().getArch() == Triple::amdgcn)
7113       return emitFPIntBuiltin(*this, E, Intrinsic::amdgcn_ldexp);
7114     return emitFPIntBuiltin(*this, E, Intrinsic::AMDGPU_ldexp);
7115   }
7116   default:
7117     return nullptr;
7118   }
7119 }
7120 
7121 /// Handle a SystemZ function in which the final argument is a pointer
7122 /// to an int that receives the post-instruction CC value.  At the LLVM level
7123 /// this is represented as a function that returns a {result, cc} pair.
7124 static Value *EmitSystemZIntrinsicWithCC(CodeGenFunction &CGF,
7125                                          unsigned IntrinsicID,
7126                                          const CallExpr *E) {
7127   unsigned NumArgs = E->getNumArgs() - 1;
7128   SmallVector<Value *, 8> Args(NumArgs);
7129   for (unsigned I = 0; I < NumArgs; ++I)
7130     Args[I] = CGF.EmitScalarExpr(E->getArg(I));
7131   Address CCPtr = CGF.EmitPointerWithAlignment(E->getArg(NumArgs));
7132   Value *F = CGF.CGM.getIntrinsic(IntrinsicID);
7133   Value *Call = CGF.Builder.CreateCall(F, Args);
7134   Value *CC = CGF.Builder.CreateExtractValue(Call, 1);
7135   CGF.Builder.CreateStore(CC, CCPtr);
7136   return CGF.Builder.CreateExtractValue(Call, 0);
7137 }
7138 
7139 Value *CodeGenFunction::EmitSystemZBuiltinExpr(unsigned BuiltinID,
7140                                                const CallExpr *E) {
7141   switch (BuiltinID) {
7142   case SystemZ::BI__builtin_tbegin: {
7143     Value *TDB = EmitScalarExpr(E->getArg(0));
7144     Value *Control = llvm::ConstantInt::get(Int32Ty, 0xff0c);
7145     Value *F = CGM.getIntrinsic(Intrinsic::s390_tbegin);
7146     return Builder.CreateCall(F, {TDB, Control});
7147   }
7148   case SystemZ::BI__builtin_tbegin_nofloat: {
7149     Value *TDB = EmitScalarExpr(E->getArg(0));
7150     Value *Control = llvm::ConstantInt::get(Int32Ty, 0xff0c);
7151     Value *F = CGM.getIntrinsic(Intrinsic::s390_tbegin_nofloat);
7152     return Builder.CreateCall(F, {TDB, Control});
7153   }
7154   case SystemZ::BI__builtin_tbeginc: {
7155     Value *TDB = llvm::ConstantPointerNull::get(Int8PtrTy);
7156     Value *Control = llvm::ConstantInt::get(Int32Ty, 0xff08);
7157     Value *F = CGM.getIntrinsic(Intrinsic::s390_tbeginc);
7158     return Builder.CreateCall(F, {TDB, Control});
7159   }
7160   case SystemZ::BI__builtin_tabort: {
7161     Value *Data = EmitScalarExpr(E->getArg(0));
7162     Value *F = CGM.getIntrinsic(Intrinsic::s390_tabort);
7163     return Builder.CreateCall(F, Builder.CreateSExt(Data, Int64Ty, "tabort"));
7164   }
7165   case SystemZ::BI__builtin_non_tx_store: {
7166     Value *Address = EmitScalarExpr(E->getArg(0));
7167     Value *Data = EmitScalarExpr(E->getArg(1));
7168     Value *F = CGM.getIntrinsic(Intrinsic::s390_ntstg);
7169     return Builder.CreateCall(F, {Data, Address});
7170   }
7171 
7172   // Vector builtins.  Note that most vector builtins are mapped automatically
7173   // to target-specific LLVM intrinsics.  The ones handled specially here can
7174   // be represented via standard LLVM IR, which is preferable to enable common
7175   // LLVM optimizations.
7176 
7177   case SystemZ::BI__builtin_s390_vpopctb:
7178   case SystemZ::BI__builtin_s390_vpopcth:
7179   case SystemZ::BI__builtin_s390_vpopctf:
7180   case SystemZ::BI__builtin_s390_vpopctg: {
7181     llvm::Type *ResultType = ConvertType(E->getType());
7182     Value *X = EmitScalarExpr(E->getArg(0));
7183     Function *F = CGM.getIntrinsic(Intrinsic::ctpop, ResultType);
7184     return Builder.CreateCall(F, X);
7185   }
7186 
7187   case SystemZ::BI__builtin_s390_vclzb:
7188   case SystemZ::BI__builtin_s390_vclzh:
7189   case SystemZ::BI__builtin_s390_vclzf:
7190   case SystemZ::BI__builtin_s390_vclzg: {
7191     llvm::Type *ResultType = ConvertType(E->getType());
7192     Value *X = EmitScalarExpr(E->getArg(0));
7193     Value *Undef = ConstantInt::get(Builder.getInt1Ty(), false);
7194     Function *F = CGM.getIntrinsic(Intrinsic::ctlz, ResultType);
7195     return Builder.CreateCall(F, {X, Undef});
7196   }
7197 
7198   case SystemZ::BI__builtin_s390_vctzb:
7199   case SystemZ::BI__builtin_s390_vctzh:
7200   case SystemZ::BI__builtin_s390_vctzf:
7201   case SystemZ::BI__builtin_s390_vctzg: {
7202     llvm::Type *ResultType = ConvertType(E->getType());
7203     Value *X = EmitScalarExpr(E->getArg(0));
7204     Value *Undef = ConstantInt::get(Builder.getInt1Ty(), false);
7205     Function *F = CGM.getIntrinsic(Intrinsic::cttz, ResultType);
7206     return Builder.CreateCall(F, {X, Undef});
7207   }
7208 
7209   case SystemZ::BI__builtin_s390_vfsqdb: {
7210     llvm::Type *ResultType = ConvertType(E->getType());
7211     Value *X = EmitScalarExpr(E->getArg(0));
7212     Function *F = CGM.getIntrinsic(Intrinsic::sqrt, ResultType);
7213     return Builder.CreateCall(F, X);
7214   }
7215   case SystemZ::BI__builtin_s390_vfmadb: {
7216     llvm::Type *ResultType = ConvertType(E->getType());
7217     Value *X = EmitScalarExpr(E->getArg(0));
7218     Value *Y = EmitScalarExpr(E->getArg(1));
7219     Value *Z = EmitScalarExpr(E->getArg(2));
7220     Function *F = CGM.getIntrinsic(Intrinsic::fma, ResultType);
7221     return Builder.CreateCall(F, {X, Y, Z});
7222   }
7223   case SystemZ::BI__builtin_s390_vfmsdb: {
7224     llvm::Type *ResultType = ConvertType(E->getType());
7225     Value *X = EmitScalarExpr(E->getArg(0));
7226     Value *Y = EmitScalarExpr(E->getArg(1));
7227     Value *Z = EmitScalarExpr(E->getArg(2));
7228     Value *Zero = llvm::ConstantFP::getZeroValueForNegation(ResultType);
7229     Function *F = CGM.getIntrinsic(Intrinsic::fma, ResultType);
7230     return Builder.CreateCall(F, {X, Y, Builder.CreateFSub(Zero, Z, "sub")});
7231   }
7232   case SystemZ::BI__builtin_s390_vflpdb: {
7233     llvm::Type *ResultType = ConvertType(E->getType());
7234     Value *X = EmitScalarExpr(E->getArg(0));
7235     Function *F = CGM.getIntrinsic(Intrinsic::fabs, ResultType);
7236     return Builder.CreateCall(F, X);
7237   }
7238   case SystemZ::BI__builtin_s390_vflndb: {
7239     llvm::Type *ResultType = ConvertType(E->getType());
7240     Value *X = EmitScalarExpr(E->getArg(0));
7241     Value *Zero = llvm::ConstantFP::getZeroValueForNegation(ResultType);
7242     Function *F = CGM.getIntrinsic(Intrinsic::fabs, ResultType);
7243     return Builder.CreateFSub(Zero, Builder.CreateCall(F, X), "sub");
7244   }
7245   case SystemZ::BI__builtin_s390_vfidb: {
7246     llvm::Type *ResultType = ConvertType(E->getType());
7247     Value *X = EmitScalarExpr(E->getArg(0));
7248     // Constant-fold the M4 and M5 mask arguments.
7249     llvm::APSInt M4, M5;
7250     bool IsConstM4 = E->getArg(1)->isIntegerConstantExpr(M4, getContext());
7251     bool IsConstM5 = E->getArg(2)->isIntegerConstantExpr(M5, getContext());
7252     assert(IsConstM4 && IsConstM5 && "Constant arg isn't actually constant?");
7253     (void)IsConstM4; (void)IsConstM5;
7254     // Check whether this instance of vfidb can be represented via a LLVM
7255     // standard intrinsic.  We only support some combinations of M4 and M5.
7256     Intrinsic::ID ID = Intrinsic::not_intrinsic;
7257     switch (M4.getZExtValue()) {
7258     default: break;
7259     case 0:  // IEEE-inexact exception allowed
7260       switch (M5.getZExtValue()) {
7261       default: break;
7262       case 0: ID = Intrinsic::rint; break;
7263       }
7264       break;
7265     case 4:  // IEEE-inexact exception suppressed
7266       switch (M5.getZExtValue()) {
7267       default: break;
7268       case 0: ID = Intrinsic::nearbyint; break;
7269       case 1: ID = Intrinsic::round; break;
7270       case 5: ID = Intrinsic::trunc; break;
7271       case 6: ID = Intrinsic::ceil; break;
7272       case 7: ID = Intrinsic::floor; break;
7273       }
7274       break;
7275     }
7276     if (ID != Intrinsic::not_intrinsic) {
7277       Function *F = CGM.getIntrinsic(ID, ResultType);
7278       return Builder.CreateCall(F, X);
7279     }
7280     Function *F = CGM.getIntrinsic(Intrinsic::s390_vfidb);
7281     Value *M4Value = llvm::ConstantInt::get(getLLVMContext(), M4);
7282     Value *M5Value = llvm::ConstantInt::get(getLLVMContext(), M5);
7283     return Builder.CreateCall(F, {X, M4Value, M5Value});
7284   }
7285 
7286   // Vector intrisincs that output the post-instruction CC value.
7287 
7288 #define INTRINSIC_WITH_CC(NAME) \
7289     case SystemZ::BI__builtin_##NAME: \
7290       return EmitSystemZIntrinsicWithCC(*this, Intrinsic::NAME, E)
7291 
7292   INTRINSIC_WITH_CC(s390_vpkshs);
7293   INTRINSIC_WITH_CC(s390_vpksfs);
7294   INTRINSIC_WITH_CC(s390_vpksgs);
7295 
7296   INTRINSIC_WITH_CC(s390_vpklshs);
7297   INTRINSIC_WITH_CC(s390_vpklsfs);
7298   INTRINSIC_WITH_CC(s390_vpklsgs);
7299 
7300   INTRINSIC_WITH_CC(s390_vceqbs);
7301   INTRINSIC_WITH_CC(s390_vceqhs);
7302   INTRINSIC_WITH_CC(s390_vceqfs);
7303   INTRINSIC_WITH_CC(s390_vceqgs);
7304 
7305   INTRINSIC_WITH_CC(s390_vchbs);
7306   INTRINSIC_WITH_CC(s390_vchhs);
7307   INTRINSIC_WITH_CC(s390_vchfs);
7308   INTRINSIC_WITH_CC(s390_vchgs);
7309 
7310   INTRINSIC_WITH_CC(s390_vchlbs);
7311   INTRINSIC_WITH_CC(s390_vchlhs);
7312   INTRINSIC_WITH_CC(s390_vchlfs);
7313   INTRINSIC_WITH_CC(s390_vchlgs);
7314 
7315   INTRINSIC_WITH_CC(s390_vfaebs);
7316   INTRINSIC_WITH_CC(s390_vfaehs);
7317   INTRINSIC_WITH_CC(s390_vfaefs);
7318 
7319   INTRINSIC_WITH_CC(s390_vfaezbs);
7320   INTRINSIC_WITH_CC(s390_vfaezhs);
7321   INTRINSIC_WITH_CC(s390_vfaezfs);
7322 
7323   INTRINSIC_WITH_CC(s390_vfeebs);
7324   INTRINSIC_WITH_CC(s390_vfeehs);
7325   INTRINSIC_WITH_CC(s390_vfeefs);
7326 
7327   INTRINSIC_WITH_CC(s390_vfeezbs);
7328   INTRINSIC_WITH_CC(s390_vfeezhs);
7329   INTRINSIC_WITH_CC(s390_vfeezfs);
7330 
7331   INTRINSIC_WITH_CC(s390_vfenebs);
7332   INTRINSIC_WITH_CC(s390_vfenehs);
7333   INTRINSIC_WITH_CC(s390_vfenefs);
7334 
7335   INTRINSIC_WITH_CC(s390_vfenezbs);
7336   INTRINSIC_WITH_CC(s390_vfenezhs);
7337   INTRINSIC_WITH_CC(s390_vfenezfs);
7338 
7339   INTRINSIC_WITH_CC(s390_vistrbs);
7340   INTRINSIC_WITH_CC(s390_vistrhs);
7341   INTRINSIC_WITH_CC(s390_vistrfs);
7342 
7343   INTRINSIC_WITH_CC(s390_vstrcbs);
7344   INTRINSIC_WITH_CC(s390_vstrchs);
7345   INTRINSIC_WITH_CC(s390_vstrcfs);
7346 
7347   INTRINSIC_WITH_CC(s390_vstrczbs);
7348   INTRINSIC_WITH_CC(s390_vstrczhs);
7349   INTRINSIC_WITH_CC(s390_vstrczfs);
7350 
7351   INTRINSIC_WITH_CC(s390_vfcedbs);
7352   INTRINSIC_WITH_CC(s390_vfchdbs);
7353   INTRINSIC_WITH_CC(s390_vfchedbs);
7354 
7355   INTRINSIC_WITH_CC(s390_vftcidb);
7356 
7357 #undef INTRINSIC_WITH_CC
7358 
7359   default:
7360     return nullptr;
7361   }
7362 }
7363 
7364 Value *CodeGenFunction::EmitNVPTXBuiltinExpr(unsigned BuiltinID,
7365                                              const CallExpr *E) {
7366   switch (BuiltinID) {
7367   case NVPTX::BI__nvvm_atom_add_gen_i:
7368   case NVPTX::BI__nvvm_atom_add_gen_l:
7369   case NVPTX::BI__nvvm_atom_add_gen_ll:
7370     return MakeBinaryAtomicValue(*this, llvm::AtomicRMWInst::Add, E);
7371 
7372   case NVPTX::BI__nvvm_atom_sub_gen_i:
7373   case NVPTX::BI__nvvm_atom_sub_gen_l:
7374   case NVPTX::BI__nvvm_atom_sub_gen_ll:
7375     return MakeBinaryAtomicValue(*this, llvm::AtomicRMWInst::Sub, E);
7376 
7377   case NVPTX::BI__nvvm_atom_and_gen_i:
7378   case NVPTX::BI__nvvm_atom_and_gen_l:
7379   case NVPTX::BI__nvvm_atom_and_gen_ll:
7380     return MakeBinaryAtomicValue(*this, llvm::AtomicRMWInst::And, E);
7381 
7382   case NVPTX::BI__nvvm_atom_or_gen_i:
7383   case NVPTX::BI__nvvm_atom_or_gen_l:
7384   case NVPTX::BI__nvvm_atom_or_gen_ll:
7385     return MakeBinaryAtomicValue(*this, llvm::AtomicRMWInst::Or, E);
7386 
7387   case NVPTX::BI__nvvm_atom_xor_gen_i:
7388   case NVPTX::BI__nvvm_atom_xor_gen_l:
7389   case NVPTX::BI__nvvm_atom_xor_gen_ll:
7390     return MakeBinaryAtomicValue(*this, llvm::AtomicRMWInst::Xor, E);
7391 
7392   case NVPTX::BI__nvvm_atom_xchg_gen_i:
7393   case NVPTX::BI__nvvm_atom_xchg_gen_l:
7394   case NVPTX::BI__nvvm_atom_xchg_gen_ll:
7395     return MakeBinaryAtomicValue(*this, llvm::AtomicRMWInst::Xchg, E);
7396 
7397   case NVPTX::BI__nvvm_atom_max_gen_i:
7398   case NVPTX::BI__nvvm_atom_max_gen_l:
7399   case NVPTX::BI__nvvm_atom_max_gen_ll:
7400     return MakeBinaryAtomicValue(*this, llvm::AtomicRMWInst::Max, E);
7401 
7402   case NVPTX::BI__nvvm_atom_max_gen_ui:
7403   case NVPTX::BI__nvvm_atom_max_gen_ul:
7404   case NVPTX::BI__nvvm_atom_max_gen_ull:
7405     return MakeBinaryAtomicValue(*this, llvm::AtomicRMWInst::UMax, E);
7406 
7407   case NVPTX::BI__nvvm_atom_min_gen_i:
7408   case NVPTX::BI__nvvm_atom_min_gen_l:
7409   case NVPTX::BI__nvvm_atom_min_gen_ll:
7410     return MakeBinaryAtomicValue(*this, llvm::AtomicRMWInst::Min, E);
7411 
7412   case NVPTX::BI__nvvm_atom_min_gen_ui:
7413   case NVPTX::BI__nvvm_atom_min_gen_ul:
7414   case NVPTX::BI__nvvm_atom_min_gen_ull:
7415     return MakeBinaryAtomicValue(*this, llvm::AtomicRMWInst::UMin, E);
7416 
7417   case NVPTX::BI__nvvm_atom_cas_gen_i:
7418   case NVPTX::BI__nvvm_atom_cas_gen_l:
7419   case NVPTX::BI__nvvm_atom_cas_gen_ll:
7420     // __nvvm_atom_cas_gen_* should return the old value rather than the
7421     // success flag.
7422     return MakeAtomicCmpXchgValue(*this, E, /*ReturnBool=*/false);
7423 
7424   case NVPTX::BI__nvvm_atom_add_gen_f: {
7425     Value *Ptr = EmitScalarExpr(E->getArg(0));
7426     Value *Val = EmitScalarExpr(E->getArg(1));
7427     // atomicrmw only deals with integer arguments so we need to use
7428     // LLVM's nvvm_atomic_load_add_f32 intrinsic for that.
7429     Value *FnALAF32 =
7430         CGM.getIntrinsic(Intrinsic::nvvm_atomic_load_add_f32, Ptr->getType());
7431     return Builder.CreateCall(FnALAF32, {Ptr, Val});
7432   }
7433 
7434   default:
7435     return nullptr;
7436   }
7437 }
7438 
7439 Value *CodeGenFunction::EmitWebAssemblyBuiltinExpr(unsigned BuiltinID,
7440                                                    const CallExpr *E) {
7441   switch (BuiltinID) {
7442   case WebAssembly::BI__builtin_wasm_memory_size: {
7443     llvm::Type *ResultType = ConvertType(E->getType());
7444     Value *Callee = CGM.getIntrinsic(Intrinsic::wasm_memory_size, ResultType);
7445     return Builder.CreateCall(Callee);
7446   }
7447   case WebAssembly::BI__builtin_wasm_grow_memory: {
7448     Value *X = EmitScalarExpr(E->getArg(0));
7449     Value *Callee = CGM.getIntrinsic(Intrinsic::wasm_grow_memory, X->getType());
7450     return Builder.CreateCall(Callee, X);
7451   }
7452 
7453   default:
7454     return nullptr;
7455   }
7456 }
7457