1 // 2 // The LLVM Compiler Infrastructure 3 // 4 // This file is distributed under the University of Illinois Open Source 5 // License. See LICENSE.TXT for details. 6 // 7 //===----------------------------------------------------------------------===// 8 // 9 // This file defines the interfaces that NVPTX uses to lower LLVM code into a 10 // selection DAG. 11 // 12 //===----------------------------------------------------------------------===// 13 14 #include "NVPTXISelLowering.h" 15 #include "NVPTX.h" 16 #include "NVPTXTargetMachine.h" 17 #include "NVPTXTargetObjectFile.h" 18 #include "NVPTXUtilities.h" 19 #include "llvm/CodeGen/Analysis.h" 20 #include "llvm/CodeGen/MachineFrameInfo.h" 21 #include "llvm/CodeGen/MachineFunction.h" 22 #include "llvm/CodeGen/MachineInstrBuilder.h" 23 #include "llvm/CodeGen/MachineRegisterInfo.h" 24 #include "llvm/CodeGen/TargetLoweringObjectFileImpl.h" 25 #include "llvm/IR/CallSite.h" 26 #include "llvm/IR/DerivedTypes.h" 27 #include "llvm/IR/Function.h" 28 #include "llvm/IR/GlobalValue.h" 29 #include "llvm/IR/IntrinsicInst.h" 30 #include "llvm/IR/Intrinsics.h" 31 #include "llvm/IR/Module.h" 32 #include "llvm/MC/MCSectionELF.h" 33 #include "llvm/Support/CommandLine.h" 34 #include "llvm/Support/Debug.h" 35 #include "llvm/Support/ErrorHandling.h" 36 #include "llvm/Support/MathExtras.h" 37 #include "llvm/Support/raw_ostream.h" 38 #include <sstream> 39 40 #undef DEBUG_TYPE 41 #define DEBUG_TYPE "nvptx-lower" 42 43 using namespace llvm; 44 45 static unsigned int uniqueCallSite = 0; 46 47 static cl::opt<bool> sched4reg( 48 "nvptx-sched4reg", 49 cl::desc("NVPTX Specific: schedule for register pressue"), cl::init(false)); 50 51 static cl::opt<unsigned> 52 FMAContractLevelOpt("nvptx-fma-level", cl::ZeroOrMore, cl::Hidden, 53 cl::desc("NVPTX Specific: FMA contraction (0: don't do it" 54 " 1: do it 2: do it aggressively"), 55 cl::init(2)); 56 57 static bool IsPTXVectorType(MVT VT) { 58 switch (VT.SimpleTy) { 59 default: 60 return false; 61 case MVT::v2i1: 62 case MVT::v4i1: 63 case MVT::v2i8: 64 case MVT::v4i8: 65 case MVT::v2i16: 66 case MVT::v4i16: 67 case MVT::v2i32: 68 case MVT::v4i32: 69 case MVT::v2i64: 70 case MVT::v2f32: 71 case MVT::v4f32: 72 case MVT::v2f64: 73 return true; 74 } 75 } 76 77 /// ComputePTXValueVTs - For the given Type \p Ty, returns the set of primitive 78 /// EVTs that compose it. Unlike ComputeValueVTs, this will break apart vectors 79 /// into their primitive components. 80 /// NOTE: This is a band-aid for code that expects ComputeValueVTs to return the 81 /// same number of types as the Ins/Outs arrays in LowerFormalArguments, 82 /// LowerCall, and LowerReturn. 83 static void ComputePTXValueVTs(const TargetLowering &TLI, const DataLayout &DL, 84 Type *Ty, SmallVectorImpl<EVT> &ValueVTs, 85 SmallVectorImpl<uint64_t> *Offsets = nullptr, 86 uint64_t StartingOffset = 0) { 87 SmallVector<EVT, 16> TempVTs; 88 SmallVector<uint64_t, 16> TempOffsets; 89 90 ComputeValueVTs(TLI, DL, Ty, TempVTs, &TempOffsets, StartingOffset); 91 for (unsigned i = 0, e = TempVTs.size(); i != e; ++i) { 92 EVT VT = TempVTs[i]; 93 uint64_t Off = TempOffsets[i]; 94 if (VT.isVector()) 95 for (unsigned j = 0, je = VT.getVectorNumElements(); j != je; ++j) { 96 ValueVTs.push_back(VT.getVectorElementType()); 97 if (Offsets) 98 Offsets->push_back(Off+j*VT.getVectorElementType().getStoreSize()); 99 } 100 else { 101 ValueVTs.push_back(VT); 102 if (Offsets) 103 Offsets->push_back(Off); 104 } 105 } 106 } 107 108 // NVPTXTargetLowering Constructor. 109 NVPTXTargetLowering::NVPTXTargetLowering(const NVPTXTargetMachine &TM, 110 const NVPTXSubtarget &STI) 111 : TargetLowering(TM), nvTM(&TM), STI(STI) { 112 113 // always lower memset, memcpy, and memmove intrinsics to load/store 114 // instructions, rather 115 // then generating calls to memset, mempcy or memmove. 116 MaxStoresPerMemset = (unsigned) 0xFFFFFFFF; 117 MaxStoresPerMemcpy = (unsigned) 0xFFFFFFFF; 118 MaxStoresPerMemmove = (unsigned) 0xFFFFFFFF; 119 120 setBooleanContents(ZeroOrNegativeOneBooleanContent); 121 setBooleanVectorContents(ZeroOrNegativeOneBooleanContent); 122 123 // Jump is Expensive. Don't create extra control flow for 'and', 'or' 124 // condition branches. 125 setJumpIsExpensive(true); 126 127 // Wide divides are _very_ slow. Try to reduce the width of the divide if 128 // possible. 129 addBypassSlowDiv(64, 32); 130 131 // By default, use the Source scheduling 132 if (sched4reg) 133 setSchedulingPreference(Sched::RegPressure); 134 else 135 setSchedulingPreference(Sched::Source); 136 137 addRegisterClass(MVT::i1, &NVPTX::Int1RegsRegClass); 138 addRegisterClass(MVT::i16, &NVPTX::Int16RegsRegClass); 139 addRegisterClass(MVT::i32, &NVPTX::Int32RegsRegClass); 140 addRegisterClass(MVT::i64, &NVPTX::Int64RegsRegClass); 141 addRegisterClass(MVT::f32, &NVPTX::Float32RegsRegClass); 142 addRegisterClass(MVT::f64, &NVPTX::Float64RegsRegClass); 143 144 // Operations not directly supported by NVPTX. 145 setOperationAction(ISD::SELECT_CC, MVT::f32, Expand); 146 setOperationAction(ISD::SELECT_CC, MVT::f64, Expand); 147 setOperationAction(ISD::SELECT_CC, MVT::i1, Expand); 148 setOperationAction(ISD::SELECT_CC, MVT::i8, Expand); 149 setOperationAction(ISD::SELECT_CC, MVT::i16, Expand); 150 setOperationAction(ISD::SELECT_CC, MVT::i32, Expand); 151 setOperationAction(ISD::SELECT_CC, MVT::i64, Expand); 152 setOperationAction(ISD::BR_CC, MVT::f32, Expand); 153 setOperationAction(ISD::BR_CC, MVT::f64, Expand); 154 setOperationAction(ISD::BR_CC, MVT::i1, Expand); 155 setOperationAction(ISD::BR_CC, MVT::i8, Expand); 156 setOperationAction(ISD::BR_CC, MVT::i16, Expand); 157 setOperationAction(ISD::BR_CC, MVT::i32, Expand); 158 setOperationAction(ISD::BR_CC, MVT::i64, Expand); 159 // Some SIGN_EXTEND_INREG can be done using cvt instruction. 160 // For others we will expand to a SHL/SRA pair. 161 setOperationAction(ISD::SIGN_EXTEND_INREG, MVT::i64, Legal); 162 setOperationAction(ISD::SIGN_EXTEND_INREG, MVT::i32, Legal); 163 setOperationAction(ISD::SIGN_EXTEND_INREG, MVT::i16, Legal); 164 setOperationAction(ISD::SIGN_EXTEND_INREG, MVT::i8 , Legal); 165 setOperationAction(ISD::SIGN_EXTEND_INREG, MVT::i1, Expand); 166 167 setOperationAction(ISD::SHL_PARTS, MVT::i32 , Custom); 168 setOperationAction(ISD::SRA_PARTS, MVT::i32 , Custom); 169 setOperationAction(ISD::SRL_PARTS, MVT::i32 , Custom); 170 setOperationAction(ISD::SHL_PARTS, MVT::i64 , Custom); 171 setOperationAction(ISD::SRA_PARTS, MVT::i64 , Custom); 172 setOperationAction(ISD::SRL_PARTS, MVT::i64 , Custom); 173 174 if (STI.hasROT64()) { 175 setOperationAction(ISD::ROTL, MVT::i64, Legal); 176 setOperationAction(ISD::ROTR, MVT::i64, Legal); 177 } else { 178 setOperationAction(ISD::ROTL, MVT::i64, Expand); 179 setOperationAction(ISD::ROTR, MVT::i64, Expand); 180 } 181 if (STI.hasROT32()) { 182 setOperationAction(ISD::ROTL, MVT::i32, Legal); 183 setOperationAction(ISD::ROTR, MVT::i32, Legal); 184 } else { 185 setOperationAction(ISD::ROTL, MVT::i32, Expand); 186 setOperationAction(ISD::ROTR, MVT::i32, Expand); 187 } 188 189 setOperationAction(ISD::ROTL, MVT::i16, Expand); 190 setOperationAction(ISD::ROTR, MVT::i16, Expand); 191 setOperationAction(ISD::ROTL, MVT::i8, Expand); 192 setOperationAction(ISD::ROTR, MVT::i8, Expand); 193 setOperationAction(ISD::BSWAP, MVT::i16, Expand); 194 setOperationAction(ISD::BSWAP, MVT::i32, Expand); 195 setOperationAction(ISD::BSWAP, MVT::i64, Expand); 196 197 // Indirect branch is not supported. 198 // This also disables Jump Table creation. 199 setOperationAction(ISD::BR_JT, MVT::Other, Expand); 200 setOperationAction(ISD::BRIND, MVT::Other, Expand); 201 202 setOperationAction(ISD::GlobalAddress, MVT::i32, Custom); 203 setOperationAction(ISD::GlobalAddress, MVT::i64, Custom); 204 205 // We want to legalize constant related memmove and memcopy 206 // intrinsics. 207 setOperationAction(ISD::INTRINSIC_W_CHAIN, MVT::Other, Custom); 208 209 // Turn FP extload into load/fextend 210 setLoadExtAction(ISD::EXTLOAD, MVT::f32, MVT::f16, Expand); 211 setLoadExtAction(ISD::EXTLOAD, MVT::f64, MVT::f16, Expand); 212 setLoadExtAction(ISD::EXTLOAD, MVT::f64, MVT::f32, Expand); 213 setLoadExtAction(ISD::EXTLOAD, MVT::v2f32, MVT::v2f16, Expand); 214 setLoadExtAction(ISD::EXTLOAD, MVT::v2f64, MVT::v2f16, Expand); 215 setLoadExtAction(ISD::EXTLOAD, MVT::v2f64, MVT::v2f32, Expand); 216 setLoadExtAction(ISD::EXTLOAD, MVT::v4f32, MVT::v4f16, Expand); 217 setLoadExtAction(ISD::EXTLOAD, MVT::v4f64, MVT::v4f16, Expand); 218 setLoadExtAction(ISD::EXTLOAD, MVT::v4f64, MVT::v4f32, Expand); 219 // Turn FP truncstore into trunc + store. 220 // FIXME: vector types should also be expanded 221 setTruncStoreAction(MVT::f32, MVT::f16, Expand); 222 setTruncStoreAction(MVT::f64, MVT::f16, Expand); 223 setTruncStoreAction(MVT::f64, MVT::f32, Expand); 224 225 // PTX does not support load / store predicate registers 226 setOperationAction(ISD::LOAD, MVT::i1, Custom); 227 setOperationAction(ISD::STORE, MVT::i1, Custom); 228 229 for (MVT VT : MVT::integer_valuetypes()) { 230 setLoadExtAction(ISD::SEXTLOAD, VT, MVT::i1, Promote); 231 setLoadExtAction(ISD::ZEXTLOAD, VT, MVT::i1, Promote); 232 setTruncStoreAction(VT, MVT::i1, Expand); 233 } 234 235 // This is legal in NVPTX 236 setOperationAction(ISD::ConstantFP, MVT::f64, Legal); 237 setOperationAction(ISD::ConstantFP, MVT::f32, Legal); 238 239 // TRAP can be lowered to PTX trap 240 setOperationAction(ISD::TRAP, MVT::Other, Legal); 241 242 setOperationAction(ISD::ADDC, MVT::i64, Expand); 243 setOperationAction(ISD::ADDE, MVT::i64, Expand); 244 245 // Register custom handling for vector loads/stores 246 for (MVT VT : MVT::vector_valuetypes()) { 247 if (IsPTXVectorType(VT)) { 248 setOperationAction(ISD::LOAD, VT, Custom); 249 setOperationAction(ISD::STORE, VT, Custom); 250 setOperationAction(ISD::INTRINSIC_W_CHAIN, VT, Custom); 251 } 252 } 253 254 // Custom handling for i8 intrinsics 255 setOperationAction(ISD::INTRINSIC_W_CHAIN, MVT::i8, Custom); 256 257 setOperationAction(ISD::CTLZ, MVT::i16, Legal); 258 setOperationAction(ISD::CTLZ, MVT::i32, Legal); 259 setOperationAction(ISD::CTLZ, MVT::i64, Legal); 260 setOperationAction(ISD::CTTZ, MVT::i16, Expand); 261 setOperationAction(ISD::CTTZ, MVT::i32, Expand); 262 setOperationAction(ISD::CTTZ, MVT::i64, Expand); 263 setOperationAction(ISD::CTPOP, MVT::i16, Legal); 264 setOperationAction(ISD::CTPOP, MVT::i32, Legal); 265 setOperationAction(ISD::CTPOP, MVT::i64, Legal); 266 267 // PTX does not directly support SELP of i1, so promote to i32 first 268 setOperationAction(ISD::SELECT, MVT::i1, Custom); 269 270 // PTX cannot multiply two i64s in a single instruction. 271 setOperationAction(ISD::SMUL_LOHI, MVT::i64, Expand); 272 setOperationAction(ISD::UMUL_LOHI, MVT::i64, Expand); 273 274 // We have some custom DAG combine patterns for these nodes 275 setTargetDAGCombine(ISD::ADD); 276 setTargetDAGCombine(ISD::AND); 277 setTargetDAGCombine(ISD::FADD); 278 setTargetDAGCombine(ISD::MUL); 279 setTargetDAGCombine(ISD::SHL); 280 setTargetDAGCombine(ISD::SELECT); 281 282 // Now deduce the information based on the above mentioned 283 // actions 284 computeRegisterProperties(STI.getRegisterInfo()); 285 } 286 287 const char *NVPTXTargetLowering::getTargetNodeName(unsigned Opcode) const { 288 switch ((NVPTXISD::NodeType)Opcode) { 289 case NVPTXISD::FIRST_NUMBER: 290 break; 291 case NVPTXISD::CALL: 292 return "NVPTXISD::CALL"; 293 case NVPTXISD::RET_FLAG: 294 return "NVPTXISD::RET_FLAG"; 295 case NVPTXISD::LOAD_PARAM: 296 return "NVPTXISD::LOAD_PARAM"; 297 case NVPTXISD::Wrapper: 298 return "NVPTXISD::Wrapper"; 299 case NVPTXISD::DeclareParam: 300 return "NVPTXISD::DeclareParam"; 301 case NVPTXISD::DeclareScalarParam: 302 return "NVPTXISD::DeclareScalarParam"; 303 case NVPTXISD::DeclareRet: 304 return "NVPTXISD::DeclareRet"; 305 case NVPTXISD::DeclareScalarRet: 306 return "NVPTXISD::DeclareScalarRet"; 307 case NVPTXISD::DeclareRetParam: 308 return "NVPTXISD::DeclareRetParam"; 309 case NVPTXISD::PrintCall: 310 return "NVPTXISD::PrintCall"; 311 case NVPTXISD::PrintConvergentCall: 312 return "NVPTXISD::PrintConvergentCall"; 313 case NVPTXISD::PrintCallUni: 314 return "NVPTXISD::PrintCallUni"; 315 case NVPTXISD::PrintConvergentCallUni: 316 return "NVPTXISD::PrintConvergentCallUni"; 317 case NVPTXISD::LoadParam: 318 return "NVPTXISD::LoadParam"; 319 case NVPTXISD::LoadParamV2: 320 return "NVPTXISD::LoadParamV2"; 321 case NVPTXISD::LoadParamV4: 322 return "NVPTXISD::LoadParamV4"; 323 case NVPTXISD::StoreParam: 324 return "NVPTXISD::StoreParam"; 325 case NVPTXISD::StoreParamV2: 326 return "NVPTXISD::StoreParamV2"; 327 case NVPTXISD::StoreParamV4: 328 return "NVPTXISD::StoreParamV4"; 329 case NVPTXISD::StoreParamS32: 330 return "NVPTXISD::StoreParamS32"; 331 case NVPTXISD::StoreParamU32: 332 return "NVPTXISD::StoreParamU32"; 333 case NVPTXISD::CallArgBegin: 334 return "NVPTXISD::CallArgBegin"; 335 case NVPTXISD::CallArg: 336 return "NVPTXISD::CallArg"; 337 case NVPTXISD::LastCallArg: 338 return "NVPTXISD::LastCallArg"; 339 case NVPTXISD::CallArgEnd: 340 return "NVPTXISD::CallArgEnd"; 341 case NVPTXISD::CallVoid: 342 return "NVPTXISD::CallVoid"; 343 case NVPTXISD::CallVal: 344 return "NVPTXISD::CallVal"; 345 case NVPTXISD::CallSymbol: 346 return "NVPTXISD::CallSymbol"; 347 case NVPTXISD::Prototype: 348 return "NVPTXISD::Prototype"; 349 case NVPTXISD::MoveParam: 350 return "NVPTXISD::MoveParam"; 351 case NVPTXISD::StoreRetval: 352 return "NVPTXISD::StoreRetval"; 353 case NVPTXISD::StoreRetvalV2: 354 return "NVPTXISD::StoreRetvalV2"; 355 case NVPTXISD::StoreRetvalV4: 356 return "NVPTXISD::StoreRetvalV4"; 357 case NVPTXISD::PseudoUseParam: 358 return "NVPTXISD::PseudoUseParam"; 359 case NVPTXISD::RETURN: 360 return "NVPTXISD::RETURN"; 361 case NVPTXISD::CallSeqBegin: 362 return "NVPTXISD::CallSeqBegin"; 363 case NVPTXISD::CallSeqEnd: 364 return "NVPTXISD::CallSeqEnd"; 365 case NVPTXISD::CallPrototype: 366 return "NVPTXISD::CallPrototype"; 367 case NVPTXISD::LoadV2: 368 return "NVPTXISD::LoadV2"; 369 case NVPTXISD::LoadV4: 370 return "NVPTXISD::LoadV4"; 371 case NVPTXISD::LDGV2: 372 return "NVPTXISD::LDGV2"; 373 case NVPTXISD::LDGV4: 374 return "NVPTXISD::LDGV4"; 375 case NVPTXISD::LDUV2: 376 return "NVPTXISD::LDUV2"; 377 case NVPTXISD::LDUV4: 378 return "NVPTXISD::LDUV4"; 379 case NVPTXISD::StoreV2: 380 return "NVPTXISD::StoreV2"; 381 case NVPTXISD::StoreV4: 382 return "NVPTXISD::StoreV4"; 383 case NVPTXISD::FUN_SHFL_CLAMP: 384 return "NVPTXISD::FUN_SHFL_CLAMP"; 385 case NVPTXISD::FUN_SHFR_CLAMP: 386 return "NVPTXISD::FUN_SHFR_CLAMP"; 387 case NVPTXISD::IMAD: 388 return "NVPTXISD::IMAD"; 389 case NVPTXISD::Dummy: 390 return "NVPTXISD::Dummy"; 391 case NVPTXISD::MUL_WIDE_SIGNED: 392 return "NVPTXISD::MUL_WIDE_SIGNED"; 393 case NVPTXISD::MUL_WIDE_UNSIGNED: 394 return "NVPTXISD::MUL_WIDE_UNSIGNED"; 395 case NVPTXISD::Tex1DFloatS32: return "NVPTXISD::Tex1DFloatS32"; 396 case NVPTXISD::Tex1DFloatFloat: return "NVPTXISD::Tex1DFloatFloat"; 397 case NVPTXISD::Tex1DFloatFloatLevel: 398 return "NVPTXISD::Tex1DFloatFloatLevel"; 399 case NVPTXISD::Tex1DFloatFloatGrad: 400 return "NVPTXISD::Tex1DFloatFloatGrad"; 401 case NVPTXISD::Tex1DS32S32: return "NVPTXISD::Tex1DS32S32"; 402 case NVPTXISD::Tex1DS32Float: return "NVPTXISD::Tex1DS32Float"; 403 case NVPTXISD::Tex1DS32FloatLevel: 404 return "NVPTXISD::Tex1DS32FloatLevel"; 405 case NVPTXISD::Tex1DS32FloatGrad: 406 return "NVPTXISD::Tex1DS32FloatGrad"; 407 case NVPTXISD::Tex1DU32S32: return "NVPTXISD::Tex1DU32S32"; 408 case NVPTXISD::Tex1DU32Float: return "NVPTXISD::Tex1DU32Float"; 409 case NVPTXISD::Tex1DU32FloatLevel: 410 return "NVPTXISD::Tex1DU32FloatLevel"; 411 case NVPTXISD::Tex1DU32FloatGrad: 412 return "NVPTXISD::Tex1DU32FloatGrad"; 413 case NVPTXISD::Tex1DArrayFloatS32: return "NVPTXISD::Tex1DArrayFloatS32"; 414 case NVPTXISD::Tex1DArrayFloatFloat: return "NVPTXISD::Tex1DArrayFloatFloat"; 415 case NVPTXISD::Tex1DArrayFloatFloatLevel: 416 return "NVPTXISD::Tex1DArrayFloatFloatLevel"; 417 case NVPTXISD::Tex1DArrayFloatFloatGrad: 418 return "NVPTXISD::Tex1DArrayFloatFloatGrad"; 419 case NVPTXISD::Tex1DArrayS32S32: return "NVPTXISD::Tex1DArrayS32S32"; 420 case NVPTXISD::Tex1DArrayS32Float: return "NVPTXISD::Tex1DArrayS32Float"; 421 case NVPTXISD::Tex1DArrayS32FloatLevel: 422 return "NVPTXISD::Tex1DArrayS32FloatLevel"; 423 case NVPTXISD::Tex1DArrayS32FloatGrad: 424 return "NVPTXISD::Tex1DArrayS32FloatGrad"; 425 case NVPTXISD::Tex1DArrayU32S32: return "NVPTXISD::Tex1DArrayU32S32"; 426 case NVPTXISD::Tex1DArrayU32Float: return "NVPTXISD::Tex1DArrayU32Float"; 427 case NVPTXISD::Tex1DArrayU32FloatLevel: 428 return "NVPTXISD::Tex1DArrayU32FloatLevel"; 429 case NVPTXISD::Tex1DArrayU32FloatGrad: 430 return "NVPTXISD::Tex1DArrayU32FloatGrad"; 431 case NVPTXISD::Tex2DFloatS32: return "NVPTXISD::Tex2DFloatS32"; 432 case NVPTXISD::Tex2DFloatFloat: return "NVPTXISD::Tex2DFloatFloat"; 433 case NVPTXISD::Tex2DFloatFloatLevel: 434 return "NVPTXISD::Tex2DFloatFloatLevel"; 435 case NVPTXISD::Tex2DFloatFloatGrad: 436 return "NVPTXISD::Tex2DFloatFloatGrad"; 437 case NVPTXISD::Tex2DS32S32: return "NVPTXISD::Tex2DS32S32"; 438 case NVPTXISD::Tex2DS32Float: return "NVPTXISD::Tex2DS32Float"; 439 case NVPTXISD::Tex2DS32FloatLevel: 440 return "NVPTXISD::Tex2DS32FloatLevel"; 441 case NVPTXISD::Tex2DS32FloatGrad: 442 return "NVPTXISD::Tex2DS32FloatGrad"; 443 case NVPTXISD::Tex2DU32S32: return "NVPTXISD::Tex2DU32S32"; 444 case NVPTXISD::Tex2DU32Float: return "NVPTXISD::Tex2DU32Float"; 445 case NVPTXISD::Tex2DU32FloatLevel: 446 return "NVPTXISD::Tex2DU32FloatLevel"; 447 case NVPTXISD::Tex2DU32FloatGrad: 448 return "NVPTXISD::Tex2DU32FloatGrad"; 449 case NVPTXISD::Tex2DArrayFloatS32: return "NVPTXISD::Tex2DArrayFloatS32"; 450 case NVPTXISD::Tex2DArrayFloatFloat: return "NVPTXISD::Tex2DArrayFloatFloat"; 451 case NVPTXISD::Tex2DArrayFloatFloatLevel: 452 return "NVPTXISD::Tex2DArrayFloatFloatLevel"; 453 case NVPTXISD::Tex2DArrayFloatFloatGrad: 454 return "NVPTXISD::Tex2DArrayFloatFloatGrad"; 455 case NVPTXISD::Tex2DArrayS32S32: return "NVPTXISD::Tex2DArrayS32S32"; 456 case NVPTXISD::Tex2DArrayS32Float: return "NVPTXISD::Tex2DArrayS32Float"; 457 case NVPTXISD::Tex2DArrayS32FloatLevel: 458 return "NVPTXISD::Tex2DArrayS32FloatLevel"; 459 case NVPTXISD::Tex2DArrayS32FloatGrad: 460 return "NVPTXISD::Tex2DArrayS32FloatGrad"; 461 case NVPTXISD::Tex2DArrayU32S32: return "NVPTXISD::Tex2DArrayU32S32"; 462 case NVPTXISD::Tex2DArrayU32Float: return "NVPTXISD::Tex2DArrayU32Float"; 463 case NVPTXISD::Tex2DArrayU32FloatLevel: 464 return "NVPTXISD::Tex2DArrayU32FloatLevel"; 465 case NVPTXISD::Tex2DArrayU32FloatGrad: 466 return "NVPTXISD::Tex2DArrayU32FloatGrad"; 467 case NVPTXISD::Tex3DFloatS32: return "NVPTXISD::Tex3DFloatS32"; 468 case NVPTXISD::Tex3DFloatFloat: return "NVPTXISD::Tex3DFloatFloat"; 469 case NVPTXISD::Tex3DFloatFloatLevel: 470 return "NVPTXISD::Tex3DFloatFloatLevel"; 471 case NVPTXISD::Tex3DFloatFloatGrad: 472 return "NVPTXISD::Tex3DFloatFloatGrad"; 473 case NVPTXISD::Tex3DS32S32: return "NVPTXISD::Tex3DS32S32"; 474 case NVPTXISD::Tex3DS32Float: return "NVPTXISD::Tex3DS32Float"; 475 case NVPTXISD::Tex3DS32FloatLevel: 476 return "NVPTXISD::Tex3DS32FloatLevel"; 477 case NVPTXISD::Tex3DS32FloatGrad: 478 return "NVPTXISD::Tex3DS32FloatGrad"; 479 case NVPTXISD::Tex3DU32S32: return "NVPTXISD::Tex3DU32S32"; 480 case NVPTXISD::Tex3DU32Float: return "NVPTXISD::Tex3DU32Float"; 481 case NVPTXISD::Tex3DU32FloatLevel: 482 return "NVPTXISD::Tex3DU32FloatLevel"; 483 case NVPTXISD::Tex3DU32FloatGrad: 484 return "NVPTXISD::Tex3DU32FloatGrad"; 485 case NVPTXISD::TexCubeFloatFloat: return "NVPTXISD::TexCubeFloatFloat"; 486 case NVPTXISD::TexCubeFloatFloatLevel: 487 return "NVPTXISD::TexCubeFloatFloatLevel"; 488 case NVPTXISD::TexCubeS32Float: return "NVPTXISD::TexCubeS32Float"; 489 case NVPTXISD::TexCubeS32FloatLevel: 490 return "NVPTXISD::TexCubeS32FloatLevel"; 491 case NVPTXISD::TexCubeU32Float: return "NVPTXISD::TexCubeU32Float"; 492 case NVPTXISD::TexCubeU32FloatLevel: 493 return "NVPTXISD::TexCubeU32FloatLevel"; 494 case NVPTXISD::TexCubeArrayFloatFloat: 495 return "NVPTXISD::TexCubeArrayFloatFloat"; 496 case NVPTXISD::TexCubeArrayFloatFloatLevel: 497 return "NVPTXISD::TexCubeArrayFloatFloatLevel"; 498 case NVPTXISD::TexCubeArrayS32Float: 499 return "NVPTXISD::TexCubeArrayS32Float"; 500 case NVPTXISD::TexCubeArrayS32FloatLevel: 501 return "NVPTXISD::TexCubeArrayS32FloatLevel"; 502 case NVPTXISD::TexCubeArrayU32Float: 503 return "NVPTXISD::TexCubeArrayU32Float"; 504 case NVPTXISD::TexCubeArrayU32FloatLevel: 505 return "NVPTXISD::TexCubeArrayU32FloatLevel"; 506 case NVPTXISD::Tld4R2DFloatFloat: 507 return "NVPTXISD::Tld4R2DFloatFloat"; 508 case NVPTXISD::Tld4G2DFloatFloat: 509 return "NVPTXISD::Tld4G2DFloatFloat"; 510 case NVPTXISD::Tld4B2DFloatFloat: 511 return "NVPTXISD::Tld4B2DFloatFloat"; 512 case NVPTXISD::Tld4A2DFloatFloat: 513 return "NVPTXISD::Tld4A2DFloatFloat"; 514 case NVPTXISD::Tld4R2DS64Float: 515 return "NVPTXISD::Tld4R2DS64Float"; 516 case NVPTXISD::Tld4G2DS64Float: 517 return "NVPTXISD::Tld4G2DS64Float"; 518 case NVPTXISD::Tld4B2DS64Float: 519 return "NVPTXISD::Tld4B2DS64Float"; 520 case NVPTXISD::Tld4A2DS64Float: 521 return "NVPTXISD::Tld4A2DS64Float"; 522 case NVPTXISD::Tld4R2DU64Float: 523 return "NVPTXISD::Tld4R2DU64Float"; 524 case NVPTXISD::Tld4G2DU64Float: 525 return "NVPTXISD::Tld4G2DU64Float"; 526 case NVPTXISD::Tld4B2DU64Float: 527 return "NVPTXISD::Tld4B2DU64Float"; 528 case NVPTXISD::Tld4A2DU64Float: 529 return "NVPTXISD::Tld4A2DU64Float"; 530 531 case NVPTXISD::TexUnified1DFloatS32: 532 return "NVPTXISD::TexUnified1DFloatS32"; 533 case NVPTXISD::TexUnified1DFloatFloat: 534 return "NVPTXISD::TexUnified1DFloatFloat"; 535 case NVPTXISD::TexUnified1DFloatFloatLevel: 536 return "NVPTXISD::TexUnified1DFloatFloatLevel"; 537 case NVPTXISD::TexUnified1DFloatFloatGrad: 538 return "NVPTXISD::TexUnified1DFloatFloatGrad"; 539 case NVPTXISD::TexUnified1DS32S32: 540 return "NVPTXISD::TexUnified1DS32S32"; 541 case NVPTXISD::TexUnified1DS32Float: 542 return "NVPTXISD::TexUnified1DS32Float"; 543 case NVPTXISD::TexUnified1DS32FloatLevel: 544 return "NVPTXISD::TexUnified1DS32FloatLevel"; 545 case NVPTXISD::TexUnified1DS32FloatGrad: 546 return "NVPTXISD::TexUnified1DS32FloatGrad"; 547 case NVPTXISD::TexUnified1DU32S32: 548 return "NVPTXISD::TexUnified1DU32S32"; 549 case NVPTXISD::TexUnified1DU32Float: 550 return "NVPTXISD::TexUnified1DU32Float"; 551 case NVPTXISD::TexUnified1DU32FloatLevel: 552 return "NVPTXISD::TexUnified1DU32FloatLevel"; 553 case NVPTXISD::TexUnified1DU32FloatGrad: 554 return "NVPTXISD::TexUnified1DU32FloatGrad"; 555 case NVPTXISD::TexUnified1DArrayFloatS32: 556 return "NVPTXISD::TexUnified1DArrayFloatS32"; 557 case NVPTXISD::TexUnified1DArrayFloatFloat: 558 return "NVPTXISD::TexUnified1DArrayFloatFloat"; 559 case NVPTXISD::TexUnified1DArrayFloatFloatLevel: 560 return "NVPTXISD::TexUnified1DArrayFloatFloatLevel"; 561 case NVPTXISD::TexUnified1DArrayFloatFloatGrad: 562 return "NVPTXISD::TexUnified1DArrayFloatFloatGrad"; 563 case NVPTXISD::TexUnified1DArrayS32S32: 564 return "NVPTXISD::TexUnified1DArrayS32S32"; 565 case NVPTXISD::TexUnified1DArrayS32Float: 566 return "NVPTXISD::TexUnified1DArrayS32Float"; 567 case NVPTXISD::TexUnified1DArrayS32FloatLevel: 568 return "NVPTXISD::TexUnified1DArrayS32FloatLevel"; 569 case NVPTXISD::TexUnified1DArrayS32FloatGrad: 570 return "NVPTXISD::TexUnified1DArrayS32FloatGrad"; 571 case NVPTXISD::TexUnified1DArrayU32S32: 572 return "NVPTXISD::TexUnified1DArrayU32S32"; 573 case NVPTXISD::TexUnified1DArrayU32Float: 574 return "NVPTXISD::TexUnified1DArrayU32Float"; 575 case NVPTXISD::TexUnified1DArrayU32FloatLevel: 576 return "NVPTXISD::TexUnified1DArrayU32FloatLevel"; 577 case NVPTXISD::TexUnified1DArrayU32FloatGrad: 578 return "NVPTXISD::TexUnified1DArrayU32FloatGrad"; 579 case NVPTXISD::TexUnified2DFloatS32: 580 return "NVPTXISD::TexUnified2DFloatS32"; 581 case NVPTXISD::TexUnified2DFloatFloat: 582 return "NVPTXISD::TexUnified2DFloatFloat"; 583 case NVPTXISD::TexUnified2DFloatFloatLevel: 584 return "NVPTXISD::TexUnified2DFloatFloatLevel"; 585 case NVPTXISD::TexUnified2DFloatFloatGrad: 586 return "NVPTXISD::TexUnified2DFloatFloatGrad"; 587 case NVPTXISD::TexUnified2DS32S32: 588 return "NVPTXISD::TexUnified2DS32S32"; 589 case NVPTXISD::TexUnified2DS32Float: 590 return "NVPTXISD::TexUnified2DS32Float"; 591 case NVPTXISD::TexUnified2DS32FloatLevel: 592 return "NVPTXISD::TexUnified2DS32FloatLevel"; 593 case NVPTXISD::TexUnified2DS32FloatGrad: 594 return "NVPTXISD::TexUnified2DS32FloatGrad"; 595 case NVPTXISD::TexUnified2DU32S32: 596 return "NVPTXISD::TexUnified2DU32S32"; 597 case NVPTXISD::TexUnified2DU32Float: 598 return "NVPTXISD::TexUnified2DU32Float"; 599 case NVPTXISD::TexUnified2DU32FloatLevel: 600 return "NVPTXISD::TexUnified2DU32FloatLevel"; 601 case NVPTXISD::TexUnified2DU32FloatGrad: 602 return "NVPTXISD::TexUnified2DU32FloatGrad"; 603 case NVPTXISD::TexUnified2DArrayFloatS32: 604 return "NVPTXISD::TexUnified2DArrayFloatS32"; 605 case NVPTXISD::TexUnified2DArrayFloatFloat: 606 return "NVPTXISD::TexUnified2DArrayFloatFloat"; 607 case NVPTXISD::TexUnified2DArrayFloatFloatLevel: 608 return "NVPTXISD::TexUnified2DArrayFloatFloatLevel"; 609 case NVPTXISD::TexUnified2DArrayFloatFloatGrad: 610 return "NVPTXISD::TexUnified2DArrayFloatFloatGrad"; 611 case NVPTXISD::TexUnified2DArrayS32S32: 612 return "NVPTXISD::TexUnified2DArrayS32S32"; 613 case NVPTXISD::TexUnified2DArrayS32Float: 614 return "NVPTXISD::TexUnified2DArrayS32Float"; 615 case NVPTXISD::TexUnified2DArrayS32FloatLevel: 616 return "NVPTXISD::TexUnified2DArrayS32FloatLevel"; 617 case NVPTXISD::TexUnified2DArrayS32FloatGrad: 618 return "NVPTXISD::TexUnified2DArrayS32FloatGrad"; 619 case NVPTXISD::TexUnified2DArrayU32S32: 620 return "NVPTXISD::TexUnified2DArrayU32S32"; 621 case NVPTXISD::TexUnified2DArrayU32Float: 622 return "NVPTXISD::TexUnified2DArrayU32Float"; 623 case NVPTXISD::TexUnified2DArrayU32FloatLevel: 624 return "NVPTXISD::TexUnified2DArrayU32FloatLevel"; 625 case NVPTXISD::TexUnified2DArrayU32FloatGrad: 626 return "NVPTXISD::TexUnified2DArrayU32FloatGrad"; 627 case NVPTXISD::TexUnified3DFloatS32: 628 return "NVPTXISD::TexUnified3DFloatS32"; 629 case NVPTXISD::TexUnified3DFloatFloat: 630 return "NVPTXISD::TexUnified3DFloatFloat"; 631 case NVPTXISD::TexUnified3DFloatFloatLevel: 632 return "NVPTXISD::TexUnified3DFloatFloatLevel"; 633 case NVPTXISD::TexUnified3DFloatFloatGrad: 634 return "NVPTXISD::TexUnified3DFloatFloatGrad"; 635 case NVPTXISD::TexUnified3DS32S32: 636 return "NVPTXISD::TexUnified3DS32S32"; 637 case NVPTXISD::TexUnified3DS32Float: 638 return "NVPTXISD::TexUnified3DS32Float"; 639 case NVPTXISD::TexUnified3DS32FloatLevel: 640 return "NVPTXISD::TexUnified3DS32FloatLevel"; 641 case NVPTXISD::TexUnified3DS32FloatGrad: 642 return "NVPTXISD::TexUnified3DS32FloatGrad"; 643 case NVPTXISD::TexUnified3DU32S32: 644 return "NVPTXISD::TexUnified3DU32S32"; 645 case NVPTXISD::TexUnified3DU32Float: 646 return "NVPTXISD::TexUnified3DU32Float"; 647 case NVPTXISD::TexUnified3DU32FloatLevel: 648 return "NVPTXISD::TexUnified3DU32FloatLevel"; 649 case NVPTXISD::TexUnified3DU32FloatGrad: 650 return "NVPTXISD::TexUnified3DU32FloatGrad"; 651 case NVPTXISD::TexUnifiedCubeFloatFloat: 652 return "NVPTXISD::TexUnifiedCubeFloatFloat"; 653 case NVPTXISD::TexUnifiedCubeFloatFloatLevel: 654 return "NVPTXISD::TexUnifiedCubeFloatFloatLevel"; 655 case NVPTXISD::TexUnifiedCubeS32Float: 656 return "NVPTXISD::TexUnifiedCubeS32Float"; 657 case NVPTXISD::TexUnifiedCubeS32FloatLevel: 658 return "NVPTXISD::TexUnifiedCubeS32FloatLevel"; 659 case NVPTXISD::TexUnifiedCubeU32Float: 660 return "NVPTXISD::TexUnifiedCubeU32Float"; 661 case NVPTXISD::TexUnifiedCubeU32FloatLevel: 662 return "NVPTXISD::TexUnifiedCubeU32FloatLevel"; 663 case NVPTXISD::TexUnifiedCubeArrayFloatFloat: 664 return "NVPTXISD::TexUnifiedCubeArrayFloatFloat"; 665 case NVPTXISD::TexUnifiedCubeArrayFloatFloatLevel: 666 return "NVPTXISD::TexUnifiedCubeArrayFloatFloatLevel"; 667 case NVPTXISD::TexUnifiedCubeArrayS32Float: 668 return "NVPTXISD::TexUnifiedCubeArrayS32Float"; 669 case NVPTXISD::TexUnifiedCubeArrayS32FloatLevel: 670 return "NVPTXISD::TexUnifiedCubeArrayS32FloatLevel"; 671 case NVPTXISD::TexUnifiedCubeArrayU32Float: 672 return "NVPTXISD::TexUnifiedCubeArrayU32Float"; 673 case NVPTXISD::TexUnifiedCubeArrayU32FloatLevel: 674 return "NVPTXISD::TexUnifiedCubeArrayU32FloatLevel"; 675 case NVPTXISD::Tld4UnifiedR2DFloatFloat: 676 return "NVPTXISD::Tld4UnifiedR2DFloatFloat"; 677 case NVPTXISD::Tld4UnifiedG2DFloatFloat: 678 return "NVPTXISD::Tld4UnifiedG2DFloatFloat"; 679 case NVPTXISD::Tld4UnifiedB2DFloatFloat: 680 return "NVPTXISD::Tld4UnifiedB2DFloatFloat"; 681 case NVPTXISD::Tld4UnifiedA2DFloatFloat: 682 return "NVPTXISD::Tld4UnifiedA2DFloatFloat"; 683 case NVPTXISD::Tld4UnifiedR2DS64Float: 684 return "NVPTXISD::Tld4UnifiedR2DS64Float"; 685 case NVPTXISD::Tld4UnifiedG2DS64Float: 686 return "NVPTXISD::Tld4UnifiedG2DS64Float"; 687 case NVPTXISD::Tld4UnifiedB2DS64Float: 688 return "NVPTXISD::Tld4UnifiedB2DS64Float"; 689 case NVPTXISD::Tld4UnifiedA2DS64Float: 690 return "NVPTXISD::Tld4UnifiedA2DS64Float"; 691 case NVPTXISD::Tld4UnifiedR2DU64Float: 692 return "NVPTXISD::Tld4UnifiedR2DU64Float"; 693 case NVPTXISD::Tld4UnifiedG2DU64Float: 694 return "NVPTXISD::Tld4UnifiedG2DU64Float"; 695 case NVPTXISD::Tld4UnifiedB2DU64Float: 696 return "NVPTXISD::Tld4UnifiedB2DU64Float"; 697 case NVPTXISD::Tld4UnifiedA2DU64Float: 698 return "NVPTXISD::Tld4UnifiedA2DU64Float"; 699 700 case NVPTXISD::Suld1DI8Clamp: return "NVPTXISD::Suld1DI8Clamp"; 701 case NVPTXISD::Suld1DI16Clamp: return "NVPTXISD::Suld1DI16Clamp"; 702 case NVPTXISD::Suld1DI32Clamp: return "NVPTXISD::Suld1DI32Clamp"; 703 case NVPTXISD::Suld1DI64Clamp: return "NVPTXISD::Suld1DI64Clamp"; 704 case NVPTXISD::Suld1DV2I8Clamp: return "NVPTXISD::Suld1DV2I8Clamp"; 705 case NVPTXISD::Suld1DV2I16Clamp: return "NVPTXISD::Suld1DV2I16Clamp"; 706 case NVPTXISD::Suld1DV2I32Clamp: return "NVPTXISD::Suld1DV2I32Clamp"; 707 case NVPTXISD::Suld1DV2I64Clamp: return "NVPTXISD::Suld1DV2I64Clamp"; 708 case NVPTXISD::Suld1DV4I8Clamp: return "NVPTXISD::Suld1DV4I8Clamp"; 709 case NVPTXISD::Suld1DV4I16Clamp: return "NVPTXISD::Suld1DV4I16Clamp"; 710 case NVPTXISD::Suld1DV4I32Clamp: return "NVPTXISD::Suld1DV4I32Clamp"; 711 712 case NVPTXISD::Suld1DArrayI8Clamp: return "NVPTXISD::Suld1DArrayI8Clamp"; 713 case NVPTXISD::Suld1DArrayI16Clamp: return "NVPTXISD::Suld1DArrayI16Clamp"; 714 case NVPTXISD::Suld1DArrayI32Clamp: return "NVPTXISD::Suld1DArrayI32Clamp"; 715 case NVPTXISD::Suld1DArrayI64Clamp: return "NVPTXISD::Suld1DArrayI64Clamp"; 716 case NVPTXISD::Suld1DArrayV2I8Clamp: return "NVPTXISD::Suld1DArrayV2I8Clamp"; 717 case NVPTXISD::Suld1DArrayV2I16Clamp:return "NVPTXISD::Suld1DArrayV2I16Clamp"; 718 case NVPTXISD::Suld1DArrayV2I32Clamp:return "NVPTXISD::Suld1DArrayV2I32Clamp"; 719 case NVPTXISD::Suld1DArrayV2I64Clamp:return "NVPTXISD::Suld1DArrayV2I64Clamp"; 720 case NVPTXISD::Suld1DArrayV4I8Clamp: return "NVPTXISD::Suld1DArrayV4I8Clamp"; 721 case NVPTXISD::Suld1DArrayV4I16Clamp:return "NVPTXISD::Suld1DArrayV4I16Clamp"; 722 case NVPTXISD::Suld1DArrayV4I32Clamp:return "NVPTXISD::Suld1DArrayV4I32Clamp"; 723 724 case NVPTXISD::Suld2DI8Clamp: return "NVPTXISD::Suld2DI8Clamp"; 725 case NVPTXISD::Suld2DI16Clamp: return "NVPTXISD::Suld2DI16Clamp"; 726 case NVPTXISD::Suld2DI32Clamp: return "NVPTXISD::Suld2DI32Clamp"; 727 case NVPTXISD::Suld2DI64Clamp: return "NVPTXISD::Suld2DI64Clamp"; 728 case NVPTXISD::Suld2DV2I8Clamp: return "NVPTXISD::Suld2DV2I8Clamp"; 729 case NVPTXISD::Suld2DV2I16Clamp: return "NVPTXISD::Suld2DV2I16Clamp"; 730 case NVPTXISD::Suld2DV2I32Clamp: return "NVPTXISD::Suld2DV2I32Clamp"; 731 case NVPTXISD::Suld2DV2I64Clamp: return "NVPTXISD::Suld2DV2I64Clamp"; 732 case NVPTXISD::Suld2DV4I8Clamp: return "NVPTXISD::Suld2DV4I8Clamp"; 733 case NVPTXISD::Suld2DV4I16Clamp: return "NVPTXISD::Suld2DV4I16Clamp"; 734 case NVPTXISD::Suld2DV4I32Clamp: return "NVPTXISD::Suld2DV4I32Clamp"; 735 736 case NVPTXISD::Suld2DArrayI8Clamp: return "NVPTXISD::Suld2DArrayI8Clamp"; 737 case NVPTXISD::Suld2DArrayI16Clamp: return "NVPTXISD::Suld2DArrayI16Clamp"; 738 case NVPTXISD::Suld2DArrayI32Clamp: return "NVPTXISD::Suld2DArrayI32Clamp"; 739 case NVPTXISD::Suld2DArrayI64Clamp: return "NVPTXISD::Suld2DArrayI64Clamp"; 740 case NVPTXISD::Suld2DArrayV2I8Clamp: return "NVPTXISD::Suld2DArrayV2I8Clamp"; 741 case NVPTXISD::Suld2DArrayV2I16Clamp:return "NVPTXISD::Suld2DArrayV2I16Clamp"; 742 case NVPTXISD::Suld2DArrayV2I32Clamp:return "NVPTXISD::Suld2DArrayV2I32Clamp"; 743 case NVPTXISD::Suld2DArrayV2I64Clamp:return "NVPTXISD::Suld2DArrayV2I64Clamp"; 744 case NVPTXISD::Suld2DArrayV4I8Clamp: return "NVPTXISD::Suld2DArrayV4I8Clamp"; 745 case NVPTXISD::Suld2DArrayV4I16Clamp:return "NVPTXISD::Suld2DArrayV4I16Clamp"; 746 case NVPTXISD::Suld2DArrayV4I32Clamp:return "NVPTXISD::Suld2DArrayV4I32Clamp"; 747 748 case NVPTXISD::Suld3DI8Clamp: return "NVPTXISD::Suld3DI8Clamp"; 749 case NVPTXISD::Suld3DI16Clamp: return "NVPTXISD::Suld3DI16Clamp"; 750 case NVPTXISD::Suld3DI32Clamp: return "NVPTXISD::Suld3DI32Clamp"; 751 case NVPTXISD::Suld3DI64Clamp: return "NVPTXISD::Suld3DI64Clamp"; 752 case NVPTXISD::Suld3DV2I8Clamp: return "NVPTXISD::Suld3DV2I8Clamp"; 753 case NVPTXISD::Suld3DV2I16Clamp: return "NVPTXISD::Suld3DV2I16Clamp"; 754 case NVPTXISD::Suld3DV2I32Clamp: return "NVPTXISD::Suld3DV2I32Clamp"; 755 case NVPTXISD::Suld3DV2I64Clamp: return "NVPTXISD::Suld3DV2I64Clamp"; 756 case NVPTXISD::Suld3DV4I8Clamp: return "NVPTXISD::Suld3DV4I8Clamp"; 757 case NVPTXISD::Suld3DV4I16Clamp: return "NVPTXISD::Suld3DV4I16Clamp"; 758 case NVPTXISD::Suld3DV4I32Clamp: return "NVPTXISD::Suld3DV4I32Clamp"; 759 760 case NVPTXISD::Suld1DI8Trap: return "NVPTXISD::Suld1DI8Trap"; 761 case NVPTXISD::Suld1DI16Trap: return "NVPTXISD::Suld1DI16Trap"; 762 case NVPTXISD::Suld1DI32Trap: return "NVPTXISD::Suld1DI32Trap"; 763 case NVPTXISD::Suld1DI64Trap: return "NVPTXISD::Suld1DI64Trap"; 764 case NVPTXISD::Suld1DV2I8Trap: return "NVPTXISD::Suld1DV2I8Trap"; 765 case NVPTXISD::Suld1DV2I16Trap: return "NVPTXISD::Suld1DV2I16Trap"; 766 case NVPTXISD::Suld1DV2I32Trap: return "NVPTXISD::Suld1DV2I32Trap"; 767 case NVPTXISD::Suld1DV2I64Trap: return "NVPTXISD::Suld1DV2I64Trap"; 768 case NVPTXISD::Suld1DV4I8Trap: return "NVPTXISD::Suld1DV4I8Trap"; 769 case NVPTXISD::Suld1DV4I16Trap: return "NVPTXISD::Suld1DV4I16Trap"; 770 case NVPTXISD::Suld1DV4I32Trap: return "NVPTXISD::Suld1DV4I32Trap"; 771 772 case NVPTXISD::Suld1DArrayI8Trap: return "NVPTXISD::Suld1DArrayI8Trap"; 773 case NVPTXISD::Suld1DArrayI16Trap: return "NVPTXISD::Suld1DArrayI16Trap"; 774 case NVPTXISD::Suld1DArrayI32Trap: return "NVPTXISD::Suld1DArrayI32Trap"; 775 case NVPTXISD::Suld1DArrayI64Trap: return "NVPTXISD::Suld1DArrayI64Trap"; 776 case NVPTXISD::Suld1DArrayV2I8Trap: return "NVPTXISD::Suld1DArrayV2I8Trap"; 777 case NVPTXISD::Suld1DArrayV2I16Trap: return "NVPTXISD::Suld1DArrayV2I16Trap"; 778 case NVPTXISD::Suld1DArrayV2I32Trap: return "NVPTXISD::Suld1DArrayV2I32Trap"; 779 case NVPTXISD::Suld1DArrayV2I64Trap: return "NVPTXISD::Suld1DArrayV2I64Trap"; 780 case NVPTXISD::Suld1DArrayV4I8Trap: return "NVPTXISD::Suld1DArrayV4I8Trap"; 781 case NVPTXISD::Suld1DArrayV4I16Trap: return "NVPTXISD::Suld1DArrayV4I16Trap"; 782 case NVPTXISD::Suld1DArrayV4I32Trap: return "NVPTXISD::Suld1DArrayV4I32Trap"; 783 784 case NVPTXISD::Suld2DI8Trap: return "NVPTXISD::Suld2DI8Trap"; 785 case NVPTXISD::Suld2DI16Trap: return "NVPTXISD::Suld2DI16Trap"; 786 case NVPTXISD::Suld2DI32Trap: return "NVPTXISD::Suld2DI32Trap"; 787 case NVPTXISD::Suld2DI64Trap: return "NVPTXISD::Suld2DI64Trap"; 788 case NVPTXISD::Suld2DV2I8Trap: return "NVPTXISD::Suld2DV2I8Trap"; 789 case NVPTXISD::Suld2DV2I16Trap: return "NVPTXISD::Suld2DV2I16Trap"; 790 case NVPTXISD::Suld2DV2I32Trap: return "NVPTXISD::Suld2DV2I32Trap"; 791 case NVPTXISD::Suld2DV2I64Trap: return "NVPTXISD::Suld2DV2I64Trap"; 792 case NVPTXISD::Suld2DV4I8Trap: return "NVPTXISD::Suld2DV4I8Trap"; 793 case NVPTXISD::Suld2DV4I16Trap: return "NVPTXISD::Suld2DV4I16Trap"; 794 case NVPTXISD::Suld2DV4I32Trap: return "NVPTXISD::Suld2DV4I32Trap"; 795 796 case NVPTXISD::Suld2DArrayI8Trap: return "NVPTXISD::Suld2DArrayI8Trap"; 797 case NVPTXISD::Suld2DArrayI16Trap: return "NVPTXISD::Suld2DArrayI16Trap"; 798 case NVPTXISD::Suld2DArrayI32Trap: return "NVPTXISD::Suld2DArrayI32Trap"; 799 case NVPTXISD::Suld2DArrayI64Trap: return "NVPTXISD::Suld2DArrayI64Trap"; 800 case NVPTXISD::Suld2DArrayV2I8Trap: return "NVPTXISD::Suld2DArrayV2I8Trap"; 801 case NVPTXISD::Suld2DArrayV2I16Trap: return "NVPTXISD::Suld2DArrayV2I16Trap"; 802 case NVPTXISD::Suld2DArrayV2I32Trap: return "NVPTXISD::Suld2DArrayV2I32Trap"; 803 case NVPTXISD::Suld2DArrayV2I64Trap: return "NVPTXISD::Suld2DArrayV2I64Trap"; 804 case NVPTXISD::Suld2DArrayV4I8Trap: return "NVPTXISD::Suld2DArrayV4I8Trap"; 805 case NVPTXISD::Suld2DArrayV4I16Trap: return "NVPTXISD::Suld2DArrayV4I16Trap"; 806 case NVPTXISD::Suld2DArrayV4I32Trap: return "NVPTXISD::Suld2DArrayV4I32Trap"; 807 808 case NVPTXISD::Suld3DI8Trap: return "NVPTXISD::Suld3DI8Trap"; 809 case NVPTXISD::Suld3DI16Trap: return "NVPTXISD::Suld3DI16Trap"; 810 case NVPTXISD::Suld3DI32Trap: return "NVPTXISD::Suld3DI32Trap"; 811 case NVPTXISD::Suld3DI64Trap: return "NVPTXISD::Suld3DI64Trap"; 812 case NVPTXISD::Suld3DV2I8Trap: return "NVPTXISD::Suld3DV2I8Trap"; 813 case NVPTXISD::Suld3DV2I16Trap: return "NVPTXISD::Suld3DV2I16Trap"; 814 case NVPTXISD::Suld3DV2I32Trap: return "NVPTXISD::Suld3DV2I32Trap"; 815 case NVPTXISD::Suld3DV2I64Trap: return "NVPTXISD::Suld3DV2I64Trap"; 816 case NVPTXISD::Suld3DV4I8Trap: return "NVPTXISD::Suld3DV4I8Trap"; 817 case NVPTXISD::Suld3DV4I16Trap: return "NVPTXISD::Suld3DV4I16Trap"; 818 case NVPTXISD::Suld3DV4I32Trap: return "NVPTXISD::Suld3DV4I32Trap"; 819 820 case NVPTXISD::Suld1DI8Zero: return "NVPTXISD::Suld1DI8Zero"; 821 case NVPTXISD::Suld1DI16Zero: return "NVPTXISD::Suld1DI16Zero"; 822 case NVPTXISD::Suld1DI32Zero: return "NVPTXISD::Suld1DI32Zero"; 823 case NVPTXISD::Suld1DI64Zero: return "NVPTXISD::Suld1DI64Zero"; 824 case NVPTXISD::Suld1DV2I8Zero: return "NVPTXISD::Suld1DV2I8Zero"; 825 case NVPTXISD::Suld1DV2I16Zero: return "NVPTXISD::Suld1DV2I16Zero"; 826 case NVPTXISD::Suld1DV2I32Zero: return "NVPTXISD::Suld1DV2I32Zero"; 827 case NVPTXISD::Suld1DV2I64Zero: return "NVPTXISD::Suld1DV2I64Zero"; 828 case NVPTXISD::Suld1DV4I8Zero: return "NVPTXISD::Suld1DV4I8Zero"; 829 case NVPTXISD::Suld1DV4I16Zero: return "NVPTXISD::Suld1DV4I16Zero"; 830 case NVPTXISD::Suld1DV4I32Zero: return "NVPTXISD::Suld1DV4I32Zero"; 831 832 case NVPTXISD::Suld1DArrayI8Zero: return "NVPTXISD::Suld1DArrayI8Zero"; 833 case NVPTXISD::Suld1DArrayI16Zero: return "NVPTXISD::Suld1DArrayI16Zero"; 834 case NVPTXISD::Suld1DArrayI32Zero: return "NVPTXISD::Suld1DArrayI32Zero"; 835 case NVPTXISD::Suld1DArrayI64Zero: return "NVPTXISD::Suld1DArrayI64Zero"; 836 case NVPTXISD::Suld1DArrayV2I8Zero: return "NVPTXISD::Suld1DArrayV2I8Zero"; 837 case NVPTXISD::Suld1DArrayV2I16Zero: return "NVPTXISD::Suld1DArrayV2I16Zero"; 838 case NVPTXISD::Suld1DArrayV2I32Zero: return "NVPTXISD::Suld1DArrayV2I32Zero"; 839 case NVPTXISD::Suld1DArrayV2I64Zero: return "NVPTXISD::Suld1DArrayV2I64Zero"; 840 case NVPTXISD::Suld1DArrayV4I8Zero: return "NVPTXISD::Suld1DArrayV4I8Zero"; 841 case NVPTXISD::Suld1DArrayV4I16Zero: return "NVPTXISD::Suld1DArrayV4I16Zero"; 842 case NVPTXISD::Suld1DArrayV4I32Zero: return "NVPTXISD::Suld1DArrayV4I32Zero"; 843 844 case NVPTXISD::Suld2DI8Zero: return "NVPTXISD::Suld2DI8Zero"; 845 case NVPTXISD::Suld2DI16Zero: return "NVPTXISD::Suld2DI16Zero"; 846 case NVPTXISD::Suld2DI32Zero: return "NVPTXISD::Suld2DI32Zero"; 847 case NVPTXISD::Suld2DI64Zero: return "NVPTXISD::Suld2DI64Zero"; 848 case NVPTXISD::Suld2DV2I8Zero: return "NVPTXISD::Suld2DV2I8Zero"; 849 case NVPTXISD::Suld2DV2I16Zero: return "NVPTXISD::Suld2DV2I16Zero"; 850 case NVPTXISD::Suld2DV2I32Zero: return "NVPTXISD::Suld2DV2I32Zero"; 851 case NVPTXISD::Suld2DV2I64Zero: return "NVPTXISD::Suld2DV2I64Zero"; 852 case NVPTXISD::Suld2DV4I8Zero: return "NVPTXISD::Suld2DV4I8Zero"; 853 case NVPTXISD::Suld2DV4I16Zero: return "NVPTXISD::Suld2DV4I16Zero"; 854 case NVPTXISD::Suld2DV4I32Zero: return "NVPTXISD::Suld2DV4I32Zero"; 855 856 case NVPTXISD::Suld2DArrayI8Zero: return "NVPTXISD::Suld2DArrayI8Zero"; 857 case NVPTXISD::Suld2DArrayI16Zero: return "NVPTXISD::Suld2DArrayI16Zero"; 858 case NVPTXISD::Suld2DArrayI32Zero: return "NVPTXISD::Suld2DArrayI32Zero"; 859 case NVPTXISD::Suld2DArrayI64Zero: return "NVPTXISD::Suld2DArrayI64Zero"; 860 case NVPTXISD::Suld2DArrayV2I8Zero: return "NVPTXISD::Suld2DArrayV2I8Zero"; 861 case NVPTXISD::Suld2DArrayV2I16Zero: return "NVPTXISD::Suld2DArrayV2I16Zero"; 862 case NVPTXISD::Suld2DArrayV2I32Zero: return "NVPTXISD::Suld2DArrayV2I32Zero"; 863 case NVPTXISD::Suld2DArrayV2I64Zero: return "NVPTXISD::Suld2DArrayV2I64Zero"; 864 case NVPTXISD::Suld2DArrayV4I8Zero: return "NVPTXISD::Suld2DArrayV4I8Zero"; 865 case NVPTXISD::Suld2DArrayV4I16Zero: return "NVPTXISD::Suld2DArrayV4I16Zero"; 866 case NVPTXISD::Suld2DArrayV4I32Zero: return "NVPTXISD::Suld2DArrayV4I32Zero"; 867 868 case NVPTXISD::Suld3DI8Zero: return "NVPTXISD::Suld3DI8Zero"; 869 case NVPTXISD::Suld3DI16Zero: return "NVPTXISD::Suld3DI16Zero"; 870 case NVPTXISD::Suld3DI32Zero: return "NVPTXISD::Suld3DI32Zero"; 871 case NVPTXISD::Suld3DI64Zero: return "NVPTXISD::Suld3DI64Zero"; 872 case NVPTXISD::Suld3DV2I8Zero: return "NVPTXISD::Suld3DV2I8Zero"; 873 case NVPTXISD::Suld3DV2I16Zero: return "NVPTXISD::Suld3DV2I16Zero"; 874 case NVPTXISD::Suld3DV2I32Zero: return "NVPTXISD::Suld3DV2I32Zero"; 875 case NVPTXISD::Suld3DV2I64Zero: return "NVPTXISD::Suld3DV2I64Zero"; 876 case NVPTXISD::Suld3DV4I8Zero: return "NVPTXISD::Suld3DV4I8Zero"; 877 case NVPTXISD::Suld3DV4I16Zero: return "NVPTXISD::Suld3DV4I16Zero"; 878 case NVPTXISD::Suld3DV4I32Zero: return "NVPTXISD::Suld3DV4I32Zero"; 879 } 880 return nullptr; 881 } 882 883 TargetLoweringBase::LegalizeTypeAction 884 NVPTXTargetLowering::getPreferredVectorAction(EVT VT) const { 885 if (VT.getVectorNumElements() != 1 && VT.getScalarType() == MVT::i1) 886 return TypeSplitVector; 887 888 return TargetLoweringBase::getPreferredVectorAction(VT); 889 } 890 891 SDValue 892 NVPTXTargetLowering::LowerGlobalAddress(SDValue Op, SelectionDAG &DAG) const { 893 SDLoc dl(Op); 894 const GlobalValue *GV = cast<GlobalAddressSDNode>(Op)->getGlobal(); 895 auto PtrVT = getPointerTy(DAG.getDataLayout()); 896 Op = DAG.getTargetGlobalAddress(GV, dl, PtrVT); 897 return DAG.getNode(NVPTXISD::Wrapper, dl, PtrVT, Op); 898 } 899 900 std::string NVPTXTargetLowering::getPrototype( 901 const DataLayout &DL, Type *retTy, const ArgListTy &Args, 902 const SmallVectorImpl<ISD::OutputArg> &Outs, unsigned retAlignment, 903 const ImmutableCallSite *CS) const { 904 auto PtrVT = getPointerTy(DL); 905 906 bool isABI = (STI.getSmVersion() >= 20); 907 assert(isABI && "Non-ABI compilation is not supported"); 908 if (!isABI) 909 return ""; 910 911 std::stringstream O; 912 O << "prototype_" << uniqueCallSite << " : .callprototype "; 913 914 if (retTy->getTypeID() == Type::VoidTyID) { 915 O << "()"; 916 } else { 917 O << "("; 918 if (retTy->isFloatingPointTy() || retTy->isIntegerTy()) { 919 unsigned size = 0; 920 if (auto *ITy = dyn_cast<IntegerType>(retTy)) { 921 size = ITy->getBitWidth(); 922 if (size < 32) 923 size = 32; 924 } else { 925 assert(retTy->isFloatingPointTy() && 926 "Floating point type expected here"); 927 size = retTy->getPrimitiveSizeInBits(); 928 } 929 930 O << ".param .b" << size << " _"; 931 } else if (isa<PointerType>(retTy)) { 932 O << ".param .b" << PtrVT.getSizeInBits() << " _"; 933 } else if ((retTy->getTypeID() == Type::StructTyID) || 934 isa<VectorType>(retTy)) { 935 auto &DL = CS->getCalledFunction()->getParent()->getDataLayout(); 936 O << ".param .align " << retAlignment << " .b8 _[" 937 << DL.getTypeAllocSize(retTy) << "]"; 938 } else { 939 llvm_unreachable("Unknown return type"); 940 } 941 O << ") "; 942 } 943 O << "_ ("; 944 945 bool first = true; 946 947 unsigned OIdx = 0; 948 for (unsigned i = 0, e = Args.size(); i != e; ++i, ++OIdx) { 949 Type *Ty = Args[i].Ty; 950 if (!first) { 951 O << ", "; 952 } 953 first = false; 954 955 if (!Outs[OIdx].Flags.isByVal()) { 956 if (Ty->isAggregateType() || Ty->isVectorTy()) { 957 unsigned align = 0; 958 const CallInst *CallI = cast<CallInst>(CS->getInstruction()); 959 // +1 because index 0 is reserved for return type alignment 960 if (!llvm::getAlign(*CallI, i + 1, align)) 961 align = DL.getABITypeAlignment(Ty); 962 unsigned sz = DL.getTypeAllocSize(Ty); 963 O << ".param .align " << align << " .b8 "; 964 O << "_"; 965 O << "[" << sz << "]"; 966 // update the index for Outs 967 SmallVector<EVT, 16> vtparts; 968 ComputeValueVTs(*this, DL, Ty, vtparts); 969 if (unsigned len = vtparts.size()) 970 OIdx += len - 1; 971 continue; 972 } 973 // i8 types in IR will be i16 types in SDAG 974 assert((getValueType(DL, Ty) == Outs[OIdx].VT || 975 (getValueType(DL, Ty) == MVT::i8 && Outs[OIdx].VT == MVT::i16)) && 976 "type mismatch between callee prototype and arguments"); 977 // scalar type 978 unsigned sz = 0; 979 if (isa<IntegerType>(Ty)) { 980 sz = cast<IntegerType>(Ty)->getBitWidth(); 981 if (sz < 32) 982 sz = 32; 983 } else if (isa<PointerType>(Ty)) 984 sz = PtrVT.getSizeInBits(); 985 else 986 sz = Ty->getPrimitiveSizeInBits(); 987 O << ".param .b" << sz << " "; 988 O << "_"; 989 continue; 990 } 991 auto *PTy = dyn_cast<PointerType>(Ty); 992 assert(PTy && "Param with byval attribute should be a pointer type"); 993 Type *ETy = PTy->getElementType(); 994 995 unsigned align = Outs[OIdx].Flags.getByValAlign(); 996 unsigned sz = DL.getTypeAllocSize(ETy); 997 O << ".param .align " << align << " .b8 "; 998 O << "_"; 999 O << "[" << sz << "]"; 1000 } 1001 O << ");"; 1002 return O.str(); 1003 } 1004 1005 unsigned 1006 NVPTXTargetLowering::getArgumentAlignment(SDValue Callee, 1007 const ImmutableCallSite *CS, 1008 Type *Ty, 1009 unsigned Idx) const { 1010 unsigned Align = 0; 1011 const Value *DirectCallee = CS->getCalledFunction(); 1012 1013 if (!DirectCallee) { 1014 // We don't have a direct function symbol, but that may be because of 1015 // constant cast instructions in the call. 1016 const Instruction *CalleeI = CS->getInstruction(); 1017 assert(CalleeI && "Call target is not a function or derived value?"); 1018 1019 // With bitcast'd call targets, the instruction will be the call 1020 if (isa<CallInst>(CalleeI)) { 1021 // Check if we have call alignment metadata 1022 if (llvm::getAlign(*cast<CallInst>(CalleeI), Idx, Align)) 1023 return Align; 1024 1025 const Value *CalleeV = cast<CallInst>(CalleeI)->getCalledValue(); 1026 // Ignore any bitcast instructions 1027 while(isa<ConstantExpr>(CalleeV)) { 1028 const ConstantExpr *CE = cast<ConstantExpr>(CalleeV); 1029 if (!CE->isCast()) 1030 break; 1031 // Look through the bitcast 1032 CalleeV = cast<ConstantExpr>(CalleeV)->getOperand(0); 1033 } 1034 1035 // We have now looked past all of the bitcasts. Do we finally have a 1036 // Function? 1037 if (isa<Function>(CalleeV)) 1038 DirectCallee = CalleeV; 1039 } 1040 } 1041 1042 // Check for function alignment information if we found that the 1043 // ultimate target is a Function 1044 if (DirectCallee) 1045 if (llvm::getAlign(*cast<Function>(DirectCallee), Idx, Align)) 1046 return Align; 1047 1048 // Call is indirect or alignment information is not available, fall back to 1049 // the ABI type alignment 1050 auto &DL = CS->getCaller()->getParent()->getDataLayout(); 1051 return DL.getABITypeAlignment(Ty); 1052 } 1053 1054 SDValue NVPTXTargetLowering::LowerCall(TargetLowering::CallLoweringInfo &CLI, 1055 SmallVectorImpl<SDValue> &InVals) const { 1056 SelectionDAG &DAG = CLI.DAG; 1057 SDLoc dl = CLI.DL; 1058 SmallVectorImpl<ISD::OutputArg> &Outs = CLI.Outs; 1059 SmallVectorImpl<SDValue> &OutVals = CLI.OutVals; 1060 SmallVectorImpl<ISD::InputArg> &Ins = CLI.Ins; 1061 SDValue Chain = CLI.Chain; 1062 SDValue Callee = CLI.Callee; 1063 bool &isTailCall = CLI.IsTailCall; 1064 ArgListTy &Args = CLI.getArgs(); 1065 Type *retTy = CLI.RetTy; 1066 ImmutableCallSite *CS = CLI.CS; 1067 1068 bool isABI = (STI.getSmVersion() >= 20); 1069 assert(isABI && "Non-ABI compilation is not supported"); 1070 if (!isABI) 1071 return Chain; 1072 MachineFunction &MF = DAG.getMachineFunction(); 1073 const Function *F = MF.getFunction(); 1074 auto &DL = MF.getDataLayout(); 1075 1076 SDValue tempChain = Chain; 1077 Chain = DAG.getCALLSEQ_START(Chain, 1078 DAG.getIntPtrConstant(uniqueCallSite, dl, true), 1079 dl); 1080 SDValue InFlag = Chain.getValue(1); 1081 1082 unsigned paramCount = 0; 1083 // Args.size() and Outs.size() need not match. 1084 // Outs.size() will be larger 1085 // * if there is an aggregate argument with multiple fields (each field 1086 // showing up separately in Outs) 1087 // * if there is a vector argument with more than typical vector-length 1088 // elements (generally if more than 4) where each vector element is 1089 // individually present in Outs. 1090 // So a different index should be used for indexing into Outs/OutVals. 1091 // See similar issue in LowerFormalArguments. 1092 unsigned OIdx = 0; 1093 // Declare the .params or .reg need to pass values 1094 // to the function 1095 for (unsigned i = 0, e = Args.size(); i != e; ++i, ++OIdx) { 1096 EVT VT = Outs[OIdx].VT; 1097 Type *Ty = Args[i].Ty; 1098 1099 if (!Outs[OIdx].Flags.isByVal()) { 1100 if (Ty->isAggregateType()) { 1101 // aggregate 1102 SmallVector<EVT, 16> vtparts; 1103 SmallVector<uint64_t, 16> Offsets; 1104 ComputePTXValueVTs(*this, DAG.getDataLayout(), Ty, vtparts, &Offsets, 1105 0); 1106 1107 unsigned align = getArgumentAlignment(Callee, CS, Ty, paramCount + 1); 1108 // declare .param .align <align> .b8 .param<n>[<size>]; 1109 unsigned sz = DL.getTypeAllocSize(Ty); 1110 SDVTList DeclareParamVTs = DAG.getVTList(MVT::Other, MVT::Glue); 1111 SDValue DeclareParamOps[] = { Chain, DAG.getConstant(align, dl, 1112 MVT::i32), 1113 DAG.getConstant(paramCount, dl, MVT::i32), 1114 DAG.getConstant(sz, dl, MVT::i32), 1115 InFlag }; 1116 Chain = DAG.getNode(NVPTXISD::DeclareParam, dl, DeclareParamVTs, 1117 DeclareParamOps); 1118 InFlag = Chain.getValue(1); 1119 for (unsigned j = 0, je = vtparts.size(); j != je; ++j) { 1120 EVT elemtype = vtparts[j]; 1121 unsigned ArgAlign = GreatestCommonDivisor64(align, Offsets[j]); 1122 if (elemtype.isInteger() && (sz < 8)) 1123 sz = 8; 1124 SDValue StVal = OutVals[OIdx]; 1125 if (elemtype.getSizeInBits() < 16) { 1126 StVal = DAG.getNode(ISD::ANY_EXTEND, dl, MVT::i16, StVal); 1127 } 1128 SDVTList CopyParamVTs = DAG.getVTList(MVT::Other, MVT::Glue); 1129 SDValue CopyParamOps[] = { Chain, 1130 DAG.getConstant(paramCount, dl, MVT::i32), 1131 DAG.getConstant(Offsets[j], dl, MVT::i32), 1132 StVal, InFlag }; 1133 Chain = DAG.getMemIntrinsicNode(NVPTXISD::StoreParam, dl, 1134 CopyParamVTs, CopyParamOps, 1135 elemtype, MachinePointerInfo(), 1136 ArgAlign); 1137 InFlag = Chain.getValue(1); 1138 ++OIdx; 1139 } 1140 if (vtparts.size() > 0) 1141 --OIdx; 1142 ++paramCount; 1143 continue; 1144 } 1145 if (Ty->isVectorTy()) { 1146 EVT ObjectVT = getValueType(DL, Ty); 1147 unsigned align = getArgumentAlignment(Callee, CS, Ty, paramCount + 1); 1148 // declare .param .align <align> .b8 .param<n>[<size>]; 1149 unsigned sz = DL.getTypeAllocSize(Ty); 1150 SDVTList DeclareParamVTs = DAG.getVTList(MVT::Other, MVT::Glue); 1151 SDValue DeclareParamOps[] = { Chain, 1152 DAG.getConstant(align, dl, MVT::i32), 1153 DAG.getConstant(paramCount, dl, MVT::i32), 1154 DAG.getConstant(sz, dl, MVT::i32), 1155 InFlag }; 1156 Chain = DAG.getNode(NVPTXISD::DeclareParam, dl, DeclareParamVTs, 1157 DeclareParamOps); 1158 InFlag = Chain.getValue(1); 1159 unsigned NumElts = ObjectVT.getVectorNumElements(); 1160 EVT EltVT = ObjectVT.getVectorElementType(); 1161 EVT MemVT = EltVT; 1162 bool NeedExtend = false; 1163 if (EltVT.getSizeInBits() < 16) { 1164 NeedExtend = true; 1165 EltVT = MVT::i16; 1166 } 1167 1168 // V1 store 1169 if (NumElts == 1) { 1170 SDValue Elt = OutVals[OIdx++]; 1171 if (NeedExtend) 1172 Elt = DAG.getNode(ISD::ZERO_EXTEND, dl, MVT::i16, Elt); 1173 1174 SDVTList CopyParamVTs = DAG.getVTList(MVT::Other, MVT::Glue); 1175 SDValue CopyParamOps[] = { Chain, 1176 DAG.getConstant(paramCount, dl, MVT::i32), 1177 DAG.getConstant(0, dl, MVT::i32), Elt, 1178 InFlag }; 1179 Chain = DAG.getMemIntrinsicNode(NVPTXISD::StoreParam, dl, 1180 CopyParamVTs, CopyParamOps, 1181 MemVT, MachinePointerInfo()); 1182 InFlag = Chain.getValue(1); 1183 } else if (NumElts == 2) { 1184 SDValue Elt0 = OutVals[OIdx++]; 1185 SDValue Elt1 = OutVals[OIdx++]; 1186 if (NeedExtend) { 1187 Elt0 = DAG.getNode(ISD::ZERO_EXTEND, dl, MVT::i16, Elt0); 1188 Elt1 = DAG.getNode(ISD::ZERO_EXTEND, dl, MVT::i16, Elt1); 1189 } 1190 1191 SDVTList CopyParamVTs = DAG.getVTList(MVT::Other, MVT::Glue); 1192 SDValue CopyParamOps[] = { Chain, 1193 DAG.getConstant(paramCount, dl, MVT::i32), 1194 DAG.getConstant(0, dl, MVT::i32), Elt0, 1195 Elt1, InFlag }; 1196 Chain = DAG.getMemIntrinsicNode(NVPTXISD::StoreParamV2, dl, 1197 CopyParamVTs, CopyParamOps, 1198 MemVT, MachinePointerInfo()); 1199 InFlag = Chain.getValue(1); 1200 } else { 1201 unsigned curOffset = 0; 1202 // V4 stores 1203 // We have at least 4 elements (<3 x Ty> expands to 4 elements) and 1204 // the 1205 // vector will be expanded to a power of 2 elements, so we know we can 1206 // always round up to the next multiple of 4 when creating the vector 1207 // stores. 1208 // e.g. 4 elem => 1 st.v4 1209 // 6 elem => 2 st.v4 1210 // 8 elem => 2 st.v4 1211 // 11 elem => 3 st.v4 1212 unsigned VecSize = 4; 1213 if (EltVT.getSizeInBits() == 64) 1214 VecSize = 2; 1215 1216 // This is potentially only part of a vector, so assume all elements 1217 // are packed together. 1218 unsigned PerStoreOffset = MemVT.getStoreSizeInBits() / 8 * VecSize; 1219 1220 for (unsigned i = 0; i < NumElts; i += VecSize) { 1221 // Get values 1222 SDValue StoreVal; 1223 SmallVector<SDValue, 8> Ops; 1224 Ops.push_back(Chain); 1225 Ops.push_back(DAG.getConstant(paramCount, dl, MVT::i32)); 1226 Ops.push_back(DAG.getConstant(curOffset, dl, MVT::i32)); 1227 1228 unsigned Opc = NVPTXISD::StoreParamV2; 1229 1230 StoreVal = OutVals[OIdx++]; 1231 if (NeedExtend) 1232 StoreVal = DAG.getNode(ISD::ZERO_EXTEND, dl, MVT::i16, StoreVal); 1233 Ops.push_back(StoreVal); 1234 1235 if (i + 1 < NumElts) { 1236 StoreVal = OutVals[OIdx++]; 1237 if (NeedExtend) 1238 StoreVal = 1239 DAG.getNode(ISD::ZERO_EXTEND, dl, MVT::i16, StoreVal); 1240 } else { 1241 StoreVal = DAG.getUNDEF(EltVT); 1242 } 1243 Ops.push_back(StoreVal); 1244 1245 if (VecSize == 4) { 1246 Opc = NVPTXISD::StoreParamV4; 1247 if (i + 2 < NumElts) { 1248 StoreVal = OutVals[OIdx++]; 1249 if (NeedExtend) 1250 StoreVal = 1251 DAG.getNode(ISD::ZERO_EXTEND, dl, MVT::i16, StoreVal); 1252 } else { 1253 StoreVal = DAG.getUNDEF(EltVT); 1254 } 1255 Ops.push_back(StoreVal); 1256 1257 if (i + 3 < NumElts) { 1258 StoreVal = OutVals[OIdx++]; 1259 if (NeedExtend) 1260 StoreVal = 1261 DAG.getNode(ISD::ZERO_EXTEND, dl, MVT::i16, StoreVal); 1262 } else { 1263 StoreVal = DAG.getUNDEF(EltVT); 1264 } 1265 Ops.push_back(StoreVal); 1266 } 1267 1268 Ops.push_back(InFlag); 1269 1270 SDVTList CopyParamVTs = DAG.getVTList(MVT::Other, MVT::Glue); 1271 Chain = DAG.getMemIntrinsicNode(Opc, dl, CopyParamVTs, Ops, 1272 MemVT, MachinePointerInfo()); 1273 InFlag = Chain.getValue(1); 1274 curOffset += PerStoreOffset; 1275 } 1276 } 1277 ++paramCount; 1278 --OIdx; 1279 continue; 1280 } 1281 // Plain scalar 1282 // for ABI, declare .param .b<size> .param<n>; 1283 unsigned sz = VT.getSizeInBits(); 1284 bool needExtend = false; 1285 if (VT.isInteger()) { 1286 if (sz < 16) 1287 needExtend = true; 1288 if (sz < 32) 1289 sz = 32; 1290 } 1291 SDVTList DeclareParamVTs = DAG.getVTList(MVT::Other, MVT::Glue); 1292 SDValue DeclareParamOps[] = { Chain, 1293 DAG.getConstant(paramCount, dl, MVT::i32), 1294 DAG.getConstant(sz, dl, MVT::i32), 1295 DAG.getConstant(0, dl, MVT::i32), InFlag }; 1296 Chain = DAG.getNode(NVPTXISD::DeclareScalarParam, dl, DeclareParamVTs, 1297 DeclareParamOps); 1298 InFlag = Chain.getValue(1); 1299 SDValue OutV = OutVals[OIdx]; 1300 if (needExtend) { 1301 // zext/sext i1 to i16 1302 unsigned opc = ISD::ZERO_EXTEND; 1303 if (Outs[OIdx].Flags.isSExt()) 1304 opc = ISD::SIGN_EXTEND; 1305 OutV = DAG.getNode(opc, dl, MVT::i16, OutV); 1306 } 1307 SDVTList CopyParamVTs = DAG.getVTList(MVT::Other, MVT::Glue); 1308 SDValue CopyParamOps[] = { Chain, 1309 DAG.getConstant(paramCount, dl, MVT::i32), 1310 DAG.getConstant(0, dl, MVT::i32), OutV, 1311 InFlag }; 1312 1313 unsigned opcode = NVPTXISD::StoreParam; 1314 if (Outs[OIdx].Flags.isZExt() && VT.getSizeInBits() < 32) 1315 opcode = NVPTXISD::StoreParamU32; 1316 else if (Outs[OIdx].Flags.isSExt() && VT.getSizeInBits() < 32) 1317 opcode = NVPTXISD::StoreParamS32; 1318 Chain = DAG.getMemIntrinsicNode(opcode, dl, CopyParamVTs, CopyParamOps, 1319 VT, MachinePointerInfo()); 1320 1321 InFlag = Chain.getValue(1); 1322 ++paramCount; 1323 continue; 1324 } 1325 // struct or vector 1326 SmallVector<EVT, 16> vtparts; 1327 SmallVector<uint64_t, 16> Offsets; 1328 auto *PTy = dyn_cast<PointerType>(Args[i].Ty); 1329 assert(PTy && "Type of a byval parameter should be pointer"); 1330 ComputePTXValueVTs(*this, DAG.getDataLayout(), PTy->getElementType(), 1331 vtparts, &Offsets, 0); 1332 1333 // declare .param .align <align> .b8 .param<n>[<size>]; 1334 unsigned sz = Outs[OIdx].Flags.getByValSize(); 1335 SDVTList DeclareParamVTs = DAG.getVTList(MVT::Other, MVT::Glue); 1336 unsigned ArgAlign = Outs[OIdx].Flags.getByValAlign(); 1337 // The ByValAlign in the Outs[OIdx].Flags is alway set at this point, 1338 // so we don't need to worry about natural alignment or not. 1339 // See TargetLowering::LowerCallTo(). 1340 SDValue DeclareParamOps[] = { 1341 Chain, DAG.getConstant(Outs[OIdx].Flags.getByValAlign(), dl, MVT::i32), 1342 DAG.getConstant(paramCount, dl, MVT::i32), 1343 DAG.getConstant(sz, dl, MVT::i32), InFlag 1344 }; 1345 Chain = DAG.getNode(NVPTXISD::DeclareParam, dl, DeclareParamVTs, 1346 DeclareParamOps); 1347 InFlag = Chain.getValue(1); 1348 for (unsigned j = 0, je = vtparts.size(); j != je; ++j) { 1349 EVT elemtype = vtparts[j]; 1350 int curOffset = Offsets[j]; 1351 unsigned PartAlign = GreatestCommonDivisor64(ArgAlign, curOffset); 1352 auto PtrVT = getPointerTy(DAG.getDataLayout()); 1353 SDValue srcAddr = DAG.getNode(ISD::ADD, dl, PtrVT, OutVals[OIdx], 1354 DAG.getConstant(curOffset, dl, PtrVT)); 1355 SDValue theVal = DAG.getLoad(elemtype, dl, tempChain, srcAddr, 1356 MachinePointerInfo(), false, false, false, 1357 PartAlign); 1358 if (elemtype.getSizeInBits() < 16) { 1359 theVal = DAG.getNode(ISD::ANY_EXTEND, dl, MVT::i16, theVal); 1360 } 1361 SDVTList CopyParamVTs = DAG.getVTList(MVT::Other, MVT::Glue); 1362 SDValue CopyParamOps[] = { Chain, 1363 DAG.getConstant(paramCount, dl, MVT::i32), 1364 DAG.getConstant(curOffset, dl, MVT::i32), 1365 theVal, InFlag }; 1366 Chain = DAG.getMemIntrinsicNode(NVPTXISD::StoreParam, dl, CopyParamVTs, 1367 CopyParamOps, elemtype, 1368 MachinePointerInfo()); 1369 1370 InFlag = Chain.getValue(1); 1371 } 1372 ++paramCount; 1373 } 1374 1375 GlobalAddressSDNode *Func = dyn_cast<GlobalAddressSDNode>(Callee.getNode()); 1376 unsigned retAlignment = 0; 1377 1378 // Handle Result 1379 if (Ins.size() > 0) { 1380 SmallVector<EVT, 16> resvtparts; 1381 ComputeValueVTs(*this, DL, retTy, resvtparts); 1382 1383 // Declare 1384 // .param .align 16 .b8 retval0[<size-in-bytes>], or 1385 // .param .b<size-in-bits> retval0 1386 unsigned resultsz = DL.getTypeAllocSizeInBits(retTy); 1387 // Emit ".param .b<size-in-bits> retval0" instead of byte arrays only for 1388 // these three types to match the logic in 1389 // NVPTXAsmPrinter::printReturnValStr and NVPTXTargetLowering::getPrototype. 1390 // Plus, this behavior is consistent with nvcc's. 1391 if (retTy->isFloatingPointTy() || retTy->isIntegerTy() || 1392 retTy->isPointerTy()) { 1393 // Scalar needs to be at least 32bit wide 1394 if (resultsz < 32) 1395 resultsz = 32; 1396 SDVTList DeclareRetVTs = DAG.getVTList(MVT::Other, MVT::Glue); 1397 SDValue DeclareRetOps[] = { Chain, DAG.getConstant(1, dl, MVT::i32), 1398 DAG.getConstant(resultsz, dl, MVT::i32), 1399 DAG.getConstant(0, dl, MVT::i32), InFlag }; 1400 Chain = DAG.getNode(NVPTXISD::DeclareRet, dl, DeclareRetVTs, 1401 DeclareRetOps); 1402 InFlag = Chain.getValue(1); 1403 } else { 1404 retAlignment = getArgumentAlignment(Callee, CS, retTy, 0); 1405 SDVTList DeclareRetVTs = DAG.getVTList(MVT::Other, MVT::Glue); 1406 SDValue DeclareRetOps[] = { Chain, 1407 DAG.getConstant(retAlignment, dl, MVT::i32), 1408 DAG.getConstant(resultsz / 8, dl, MVT::i32), 1409 DAG.getConstant(0, dl, MVT::i32), InFlag }; 1410 Chain = DAG.getNode(NVPTXISD::DeclareRetParam, dl, DeclareRetVTs, 1411 DeclareRetOps); 1412 InFlag = Chain.getValue(1); 1413 } 1414 } 1415 1416 if (!Func) { 1417 // This is indirect function call case : PTX requires a prototype of the 1418 // form 1419 // proto_0 : .callprototype(.param .b32 _) _ (.param .b32 _); 1420 // to be emitted, and the label has to used as the last arg of call 1421 // instruction. 1422 // The prototype is embedded in a string and put as the operand for a 1423 // CallPrototype SDNode which will print out to the value of the string. 1424 SDVTList ProtoVTs = DAG.getVTList(MVT::Other, MVT::Glue); 1425 std::string Proto = 1426 getPrototype(DAG.getDataLayout(), retTy, Args, Outs, retAlignment, CS); 1427 const char *ProtoStr = 1428 nvTM->getManagedStrPool()->getManagedString(Proto.c_str())->c_str(); 1429 SDValue ProtoOps[] = { 1430 Chain, DAG.getTargetExternalSymbol(ProtoStr, MVT::i32), InFlag, 1431 }; 1432 Chain = DAG.getNode(NVPTXISD::CallPrototype, dl, ProtoVTs, ProtoOps); 1433 InFlag = Chain.getValue(1); 1434 } 1435 // Op to just print "call" 1436 SDVTList PrintCallVTs = DAG.getVTList(MVT::Other, MVT::Glue); 1437 SDValue PrintCallOps[] = { 1438 Chain, DAG.getConstant((Ins.size() == 0) ? 0 : 1, dl, MVT::i32), InFlag 1439 }; 1440 // We model convergent calls as separate opcodes. 1441 unsigned Opcode = Func ? NVPTXISD::PrintCallUni : NVPTXISD::PrintCall; 1442 if (CLI.IsConvergent) 1443 Opcode = Opcode == NVPTXISD::PrintCallUni ? NVPTXISD::PrintConvergentCallUni 1444 : NVPTXISD::PrintConvergentCall; 1445 Chain = DAG.getNode(Opcode, dl, PrintCallVTs, PrintCallOps); 1446 InFlag = Chain.getValue(1); 1447 1448 // Ops to print out the function name 1449 SDVTList CallVoidVTs = DAG.getVTList(MVT::Other, MVT::Glue); 1450 SDValue CallVoidOps[] = { Chain, Callee, InFlag }; 1451 Chain = DAG.getNode(NVPTXISD::CallVoid, dl, CallVoidVTs, CallVoidOps); 1452 InFlag = Chain.getValue(1); 1453 1454 // Ops to print out the param list 1455 SDVTList CallArgBeginVTs = DAG.getVTList(MVT::Other, MVT::Glue); 1456 SDValue CallArgBeginOps[] = { Chain, InFlag }; 1457 Chain = DAG.getNode(NVPTXISD::CallArgBegin, dl, CallArgBeginVTs, 1458 CallArgBeginOps); 1459 InFlag = Chain.getValue(1); 1460 1461 for (unsigned i = 0, e = paramCount; i != e; ++i) { 1462 unsigned opcode; 1463 if (i == (e - 1)) 1464 opcode = NVPTXISD::LastCallArg; 1465 else 1466 opcode = NVPTXISD::CallArg; 1467 SDVTList CallArgVTs = DAG.getVTList(MVT::Other, MVT::Glue); 1468 SDValue CallArgOps[] = { Chain, DAG.getConstant(1, dl, MVT::i32), 1469 DAG.getConstant(i, dl, MVT::i32), InFlag }; 1470 Chain = DAG.getNode(opcode, dl, CallArgVTs, CallArgOps); 1471 InFlag = Chain.getValue(1); 1472 } 1473 SDVTList CallArgEndVTs = DAG.getVTList(MVT::Other, MVT::Glue); 1474 SDValue CallArgEndOps[] = { Chain, 1475 DAG.getConstant(Func ? 1 : 0, dl, MVT::i32), 1476 InFlag }; 1477 Chain = DAG.getNode(NVPTXISD::CallArgEnd, dl, CallArgEndVTs, CallArgEndOps); 1478 InFlag = Chain.getValue(1); 1479 1480 if (!Func) { 1481 SDVTList PrototypeVTs = DAG.getVTList(MVT::Other, MVT::Glue); 1482 SDValue PrototypeOps[] = { Chain, 1483 DAG.getConstant(uniqueCallSite, dl, MVT::i32), 1484 InFlag }; 1485 Chain = DAG.getNode(NVPTXISD::Prototype, dl, PrototypeVTs, PrototypeOps); 1486 InFlag = Chain.getValue(1); 1487 } 1488 1489 // Generate loads from param memory/moves from registers for result 1490 if (Ins.size() > 0) { 1491 if (retTy && retTy->isVectorTy()) { 1492 EVT ObjectVT = getValueType(DL, retTy); 1493 unsigned NumElts = ObjectVT.getVectorNumElements(); 1494 EVT EltVT = ObjectVT.getVectorElementType(); 1495 assert(STI.getTargetLowering()->getNumRegisters(F->getContext(), 1496 ObjectVT) == NumElts && 1497 "Vector was not scalarized"); 1498 unsigned sz = EltVT.getSizeInBits(); 1499 bool needTruncate = sz < 8; 1500 1501 if (NumElts == 1) { 1502 // Just a simple load 1503 SmallVector<EVT, 4> LoadRetVTs; 1504 if (EltVT == MVT::i1 || EltVT == MVT::i8) { 1505 // If loading i1/i8 result, generate 1506 // load.b8 i16 1507 // if i1 1508 // trunc i16 to i1 1509 LoadRetVTs.push_back(MVT::i16); 1510 } else 1511 LoadRetVTs.push_back(EltVT); 1512 LoadRetVTs.push_back(MVT::Other); 1513 LoadRetVTs.push_back(MVT::Glue); 1514 SDValue LoadRetOps[] = {Chain, DAG.getConstant(1, dl, MVT::i32), 1515 DAG.getConstant(0, dl, MVT::i32), InFlag}; 1516 SDValue retval = DAG.getMemIntrinsicNode( 1517 NVPTXISD::LoadParam, dl, 1518 DAG.getVTList(LoadRetVTs), LoadRetOps, EltVT, MachinePointerInfo()); 1519 Chain = retval.getValue(1); 1520 InFlag = retval.getValue(2); 1521 SDValue Ret0 = retval; 1522 if (needTruncate) 1523 Ret0 = DAG.getNode(ISD::TRUNCATE, dl, EltVT, Ret0); 1524 InVals.push_back(Ret0); 1525 } else if (NumElts == 2) { 1526 // LoadV2 1527 SmallVector<EVT, 4> LoadRetVTs; 1528 if (EltVT == MVT::i1 || EltVT == MVT::i8) { 1529 // If loading i1/i8 result, generate 1530 // load.b8 i16 1531 // if i1 1532 // trunc i16 to i1 1533 LoadRetVTs.push_back(MVT::i16); 1534 LoadRetVTs.push_back(MVT::i16); 1535 } else { 1536 LoadRetVTs.push_back(EltVT); 1537 LoadRetVTs.push_back(EltVT); 1538 } 1539 LoadRetVTs.push_back(MVT::Other); 1540 LoadRetVTs.push_back(MVT::Glue); 1541 SDValue LoadRetOps[] = {Chain, DAG.getConstant(1, dl, MVT::i32), 1542 DAG.getConstant(0, dl, MVT::i32), InFlag}; 1543 SDValue retval = DAG.getMemIntrinsicNode( 1544 NVPTXISD::LoadParamV2, dl, 1545 DAG.getVTList(LoadRetVTs), LoadRetOps, EltVT, MachinePointerInfo()); 1546 Chain = retval.getValue(2); 1547 InFlag = retval.getValue(3); 1548 SDValue Ret0 = retval.getValue(0); 1549 SDValue Ret1 = retval.getValue(1); 1550 if (needTruncate) { 1551 Ret0 = DAG.getNode(ISD::TRUNCATE, dl, MVT::i1, Ret0); 1552 InVals.push_back(Ret0); 1553 Ret1 = DAG.getNode(ISD::TRUNCATE, dl, MVT::i1, Ret1); 1554 InVals.push_back(Ret1); 1555 } else { 1556 InVals.push_back(Ret0); 1557 InVals.push_back(Ret1); 1558 } 1559 } else { 1560 // Split into N LoadV4 1561 unsigned Ofst = 0; 1562 unsigned VecSize = 4; 1563 unsigned Opc = NVPTXISD::LoadParamV4; 1564 if (EltVT.getSizeInBits() == 64) { 1565 VecSize = 2; 1566 Opc = NVPTXISD::LoadParamV2; 1567 } 1568 EVT VecVT = EVT::getVectorVT(F->getContext(), EltVT, VecSize); 1569 for (unsigned i = 0; i < NumElts; i += VecSize) { 1570 SmallVector<EVT, 8> LoadRetVTs; 1571 if (EltVT == MVT::i1 || EltVT == MVT::i8) { 1572 // If loading i1/i8 result, generate 1573 // load.b8 i16 1574 // if i1 1575 // trunc i16 to i1 1576 for (unsigned j = 0; j < VecSize; ++j) 1577 LoadRetVTs.push_back(MVT::i16); 1578 } else { 1579 for (unsigned j = 0; j < VecSize; ++j) 1580 LoadRetVTs.push_back(EltVT); 1581 } 1582 LoadRetVTs.push_back(MVT::Other); 1583 LoadRetVTs.push_back(MVT::Glue); 1584 SDValue LoadRetOps[] = {Chain, DAG.getConstant(1, dl, MVT::i32), 1585 DAG.getConstant(Ofst, dl, MVT::i32), InFlag}; 1586 SDValue retval = DAG.getMemIntrinsicNode( 1587 Opc, dl, DAG.getVTList(LoadRetVTs), 1588 LoadRetOps, EltVT, MachinePointerInfo()); 1589 if (VecSize == 2) { 1590 Chain = retval.getValue(2); 1591 InFlag = retval.getValue(3); 1592 } else { 1593 Chain = retval.getValue(4); 1594 InFlag = retval.getValue(5); 1595 } 1596 1597 for (unsigned j = 0; j < VecSize; ++j) { 1598 if (i + j >= NumElts) 1599 break; 1600 SDValue Elt = retval.getValue(j); 1601 if (needTruncate) 1602 Elt = DAG.getNode(ISD::TRUNCATE, dl, EltVT, Elt); 1603 InVals.push_back(Elt); 1604 } 1605 Ofst += DL.getTypeAllocSize(VecVT.getTypeForEVT(F->getContext())); 1606 } 1607 } 1608 } else { 1609 SmallVector<EVT, 16> VTs; 1610 SmallVector<uint64_t, 16> Offsets; 1611 ComputePTXValueVTs(*this, DAG.getDataLayout(), retTy, VTs, &Offsets, 0); 1612 assert(VTs.size() == Ins.size() && "Bad value decomposition"); 1613 unsigned RetAlign = getArgumentAlignment(Callee, CS, retTy, 0); 1614 for (unsigned i = 0, e = Ins.size(); i != e; ++i) { 1615 unsigned sz = VTs[i].getSizeInBits(); 1616 unsigned AlignI = GreatestCommonDivisor64(RetAlign, Offsets[i]); 1617 bool needTruncate = false; 1618 if (VTs[i].isInteger() && sz < 8) { 1619 sz = 8; 1620 needTruncate = true; 1621 } 1622 1623 SmallVector<EVT, 4> LoadRetVTs; 1624 EVT TheLoadType = VTs[i]; 1625 if (retTy->isIntegerTy() && DL.getTypeAllocSizeInBits(retTy) < 32) { 1626 // This is for integer types only, and specifically not for 1627 // aggregates. 1628 LoadRetVTs.push_back(MVT::i32); 1629 TheLoadType = MVT::i32; 1630 needTruncate = true; 1631 } else if (sz < 16) { 1632 // If loading i1/i8 result, generate 1633 // load i8 (-> i16) 1634 // trunc i16 to i1/i8 1635 1636 // FIXME: Do we need to set needTruncate to true here, too? We could 1637 // not figure out what this branch is for in D17872, so we left it 1638 // alone. The comment above about loading i1/i8 may be wrong, as the 1639 // branch above seems to cover integers of size < 32. 1640 LoadRetVTs.push_back(MVT::i16); 1641 } else 1642 LoadRetVTs.push_back(Ins[i].VT); 1643 LoadRetVTs.push_back(MVT::Other); 1644 LoadRetVTs.push_back(MVT::Glue); 1645 1646 SDValue LoadRetOps[] = {Chain, DAG.getConstant(1, dl, MVT::i32), 1647 DAG.getConstant(Offsets[i], dl, MVT::i32), 1648 InFlag}; 1649 SDValue retval = DAG.getMemIntrinsicNode( 1650 NVPTXISD::LoadParam, dl, 1651 DAG.getVTList(LoadRetVTs), LoadRetOps, 1652 TheLoadType, MachinePointerInfo(), AlignI); 1653 Chain = retval.getValue(1); 1654 InFlag = retval.getValue(2); 1655 SDValue Ret0 = retval.getValue(0); 1656 if (needTruncate) 1657 Ret0 = DAG.getNode(ISD::TRUNCATE, dl, Ins[i].VT, Ret0); 1658 InVals.push_back(Ret0); 1659 } 1660 } 1661 } 1662 1663 Chain = DAG.getCALLSEQ_END(Chain, 1664 DAG.getIntPtrConstant(uniqueCallSite, dl, true), 1665 DAG.getIntPtrConstant(uniqueCallSite + 1, dl, 1666 true), 1667 InFlag, dl); 1668 uniqueCallSite++; 1669 1670 // set isTailCall to false for now, until we figure out how to express 1671 // tail call optimization in PTX 1672 isTailCall = false; 1673 return Chain; 1674 } 1675 1676 // By default CONCAT_VECTORS is lowered by ExpandVectorBuildThroughStack() 1677 // (see LegalizeDAG.cpp). This is slow and uses local memory. 1678 // We use extract/insert/build vector just as what LegalizeOp() does in llvm 2.5 1679 SDValue 1680 NVPTXTargetLowering::LowerCONCAT_VECTORS(SDValue Op, SelectionDAG &DAG) const { 1681 SDNode *Node = Op.getNode(); 1682 SDLoc dl(Node); 1683 SmallVector<SDValue, 8> Ops; 1684 unsigned NumOperands = Node->getNumOperands(); 1685 for (unsigned i = 0; i < NumOperands; ++i) { 1686 SDValue SubOp = Node->getOperand(i); 1687 EVT VVT = SubOp.getNode()->getValueType(0); 1688 EVT EltVT = VVT.getVectorElementType(); 1689 unsigned NumSubElem = VVT.getVectorNumElements(); 1690 for (unsigned j = 0; j < NumSubElem; ++j) { 1691 Ops.push_back(DAG.getNode(ISD::EXTRACT_VECTOR_ELT, dl, EltVT, SubOp, 1692 DAG.getIntPtrConstant(j, dl))); 1693 } 1694 } 1695 return DAG.getBuildVector(Node->getValueType(0), dl, Ops); 1696 } 1697 1698 /// LowerShiftRightParts - Lower SRL_PARTS, SRA_PARTS, which 1699 /// 1) returns two i32 values and take a 2 x i32 value to shift plus a shift 1700 /// amount, or 1701 /// 2) returns two i64 values and take a 2 x i64 value to shift plus a shift 1702 /// amount. 1703 SDValue NVPTXTargetLowering::LowerShiftRightParts(SDValue Op, 1704 SelectionDAG &DAG) const { 1705 assert(Op.getNumOperands() == 3 && "Not a double-shift!"); 1706 assert(Op.getOpcode() == ISD::SRA_PARTS || Op.getOpcode() == ISD::SRL_PARTS); 1707 1708 EVT VT = Op.getValueType(); 1709 unsigned VTBits = VT.getSizeInBits(); 1710 SDLoc dl(Op); 1711 SDValue ShOpLo = Op.getOperand(0); 1712 SDValue ShOpHi = Op.getOperand(1); 1713 SDValue ShAmt = Op.getOperand(2); 1714 unsigned Opc = (Op.getOpcode() == ISD::SRA_PARTS) ? ISD::SRA : ISD::SRL; 1715 1716 if (VTBits == 32 && STI.getSmVersion() >= 35) { 1717 1718 // For 32bit and sm35, we can use the funnel shift 'shf' instruction. 1719 // {dHi, dLo} = {aHi, aLo} >> Amt 1720 // dHi = aHi >> Amt 1721 // dLo = shf.r.clamp aLo, aHi, Amt 1722 1723 SDValue Hi = DAG.getNode(Opc, dl, VT, ShOpHi, ShAmt); 1724 SDValue Lo = DAG.getNode(NVPTXISD::FUN_SHFR_CLAMP, dl, VT, ShOpLo, ShOpHi, 1725 ShAmt); 1726 1727 SDValue Ops[2] = { Lo, Hi }; 1728 return DAG.getMergeValues(Ops, dl); 1729 } 1730 else { 1731 1732 // {dHi, dLo} = {aHi, aLo} >> Amt 1733 // - if (Amt>=size) then 1734 // dLo = aHi >> (Amt-size) 1735 // dHi = aHi >> Amt (this is either all 0 or all 1) 1736 // else 1737 // dLo = (aLo >>logic Amt) | (aHi << (size-Amt)) 1738 // dHi = aHi >> Amt 1739 1740 SDValue RevShAmt = DAG.getNode(ISD::SUB, dl, MVT::i32, 1741 DAG.getConstant(VTBits, dl, MVT::i32), 1742 ShAmt); 1743 SDValue Tmp1 = DAG.getNode(ISD::SRL, dl, VT, ShOpLo, ShAmt); 1744 SDValue ExtraShAmt = DAG.getNode(ISD::SUB, dl, MVT::i32, ShAmt, 1745 DAG.getConstant(VTBits, dl, MVT::i32)); 1746 SDValue Tmp2 = DAG.getNode(ISD::SHL, dl, VT, ShOpHi, RevShAmt); 1747 SDValue FalseVal = DAG.getNode(ISD::OR, dl, VT, Tmp1, Tmp2); 1748 SDValue TrueVal = DAG.getNode(Opc, dl, VT, ShOpHi, ExtraShAmt); 1749 1750 SDValue Cmp = DAG.getSetCC(dl, MVT::i1, ShAmt, 1751 DAG.getConstant(VTBits, dl, MVT::i32), 1752 ISD::SETGE); 1753 SDValue Hi = DAG.getNode(Opc, dl, VT, ShOpHi, ShAmt); 1754 SDValue Lo = DAG.getNode(ISD::SELECT, dl, VT, Cmp, TrueVal, FalseVal); 1755 1756 SDValue Ops[2] = { Lo, Hi }; 1757 return DAG.getMergeValues(Ops, dl); 1758 } 1759 } 1760 1761 /// LowerShiftLeftParts - Lower SHL_PARTS, which 1762 /// 1) returns two i32 values and take a 2 x i32 value to shift plus a shift 1763 /// amount, or 1764 /// 2) returns two i64 values and take a 2 x i64 value to shift plus a shift 1765 /// amount. 1766 SDValue NVPTXTargetLowering::LowerShiftLeftParts(SDValue Op, 1767 SelectionDAG &DAG) const { 1768 assert(Op.getNumOperands() == 3 && "Not a double-shift!"); 1769 assert(Op.getOpcode() == ISD::SHL_PARTS); 1770 1771 EVT VT = Op.getValueType(); 1772 unsigned VTBits = VT.getSizeInBits(); 1773 SDLoc dl(Op); 1774 SDValue ShOpLo = Op.getOperand(0); 1775 SDValue ShOpHi = Op.getOperand(1); 1776 SDValue ShAmt = Op.getOperand(2); 1777 1778 if (VTBits == 32 && STI.getSmVersion() >= 35) { 1779 1780 // For 32bit and sm35, we can use the funnel shift 'shf' instruction. 1781 // {dHi, dLo} = {aHi, aLo} << Amt 1782 // dHi = shf.l.clamp aLo, aHi, Amt 1783 // dLo = aLo << Amt 1784 1785 SDValue Hi = DAG.getNode(NVPTXISD::FUN_SHFL_CLAMP, dl, VT, ShOpLo, ShOpHi, 1786 ShAmt); 1787 SDValue Lo = DAG.getNode(ISD::SHL, dl, VT, ShOpLo, ShAmt); 1788 1789 SDValue Ops[2] = { Lo, Hi }; 1790 return DAG.getMergeValues(Ops, dl); 1791 } 1792 else { 1793 1794 // {dHi, dLo} = {aHi, aLo} << Amt 1795 // - if (Amt>=size) then 1796 // dLo = aLo << Amt (all 0) 1797 // dLo = aLo << (Amt-size) 1798 // else 1799 // dLo = aLo << Amt 1800 // dHi = (aHi << Amt) | (aLo >> (size-Amt)) 1801 1802 SDValue RevShAmt = DAG.getNode(ISD::SUB, dl, MVT::i32, 1803 DAG.getConstant(VTBits, dl, MVT::i32), 1804 ShAmt); 1805 SDValue Tmp1 = DAG.getNode(ISD::SHL, dl, VT, ShOpHi, ShAmt); 1806 SDValue ExtraShAmt = DAG.getNode(ISD::SUB, dl, MVT::i32, ShAmt, 1807 DAG.getConstant(VTBits, dl, MVT::i32)); 1808 SDValue Tmp2 = DAG.getNode(ISD::SRL, dl, VT, ShOpLo, RevShAmt); 1809 SDValue FalseVal = DAG.getNode(ISD::OR, dl, VT, Tmp1, Tmp2); 1810 SDValue TrueVal = DAG.getNode(ISD::SHL, dl, VT, ShOpLo, ExtraShAmt); 1811 1812 SDValue Cmp = DAG.getSetCC(dl, MVT::i1, ShAmt, 1813 DAG.getConstant(VTBits, dl, MVT::i32), 1814 ISD::SETGE); 1815 SDValue Lo = DAG.getNode(ISD::SHL, dl, VT, ShOpLo, ShAmt); 1816 SDValue Hi = DAG.getNode(ISD::SELECT, dl, VT, Cmp, TrueVal, FalseVal); 1817 1818 SDValue Ops[2] = { Lo, Hi }; 1819 return DAG.getMergeValues(Ops, dl); 1820 } 1821 } 1822 1823 SDValue 1824 NVPTXTargetLowering::LowerOperation(SDValue Op, SelectionDAG &DAG) const { 1825 switch (Op.getOpcode()) { 1826 case ISD::RETURNADDR: 1827 return SDValue(); 1828 case ISD::FRAMEADDR: 1829 return SDValue(); 1830 case ISD::GlobalAddress: 1831 return LowerGlobalAddress(Op, DAG); 1832 case ISD::INTRINSIC_W_CHAIN: 1833 return Op; 1834 case ISD::BUILD_VECTOR: 1835 case ISD::EXTRACT_SUBVECTOR: 1836 return Op; 1837 case ISD::CONCAT_VECTORS: 1838 return LowerCONCAT_VECTORS(Op, DAG); 1839 case ISD::STORE: 1840 return LowerSTORE(Op, DAG); 1841 case ISD::LOAD: 1842 return LowerLOAD(Op, DAG); 1843 case ISD::SHL_PARTS: 1844 return LowerShiftLeftParts(Op, DAG); 1845 case ISD::SRA_PARTS: 1846 case ISD::SRL_PARTS: 1847 return LowerShiftRightParts(Op, DAG); 1848 case ISD::SELECT: 1849 return LowerSelect(Op, DAG); 1850 default: 1851 llvm_unreachable("Custom lowering not defined for operation"); 1852 } 1853 } 1854 1855 SDValue NVPTXTargetLowering::LowerSelect(SDValue Op, SelectionDAG &DAG) const { 1856 SDValue Op0 = Op->getOperand(0); 1857 SDValue Op1 = Op->getOperand(1); 1858 SDValue Op2 = Op->getOperand(2); 1859 SDLoc DL(Op.getNode()); 1860 1861 assert(Op.getValueType() == MVT::i1 && "Custom lowering enabled only for i1"); 1862 1863 Op1 = DAG.getNode(ISD::ANY_EXTEND, DL, MVT::i32, Op1); 1864 Op2 = DAG.getNode(ISD::ANY_EXTEND, DL, MVT::i32, Op2); 1865 SDValue Select = DAG.getNode(ISD::SELECT, DL, MVT::i32, Op0, Op1, Op2); 1866 SDValue Trunc = DAG.getNode(ISD::TRUNCATE, DL, MVT::i1, Select); 1867 1868 return Trunc; 1869 } 1870 1871 SDValue NVPTXTargetLowering::LowerLOAD(SDValue Op, SelectionDAG &DAG) const { 1872 if (Op.getValueType() == MVT::i1) 1873 return LowerLOADi1(Op, DAG); 1874 else 1875 return SDValue(); 1876 } 1877 1878 // v = ld i1* addr 1879 // => 1880 // v1 = ld i8* addr (-> i16) 1881 // v = trunc i16 to i1 1882 SDValue NVPTXTargetLowering::LowerLOADi1(SDValue Op, SelectionDAG &DAG) const { 1883 SDNode *Node = Op.getNode(); 1884 LoadSDNode *LD = cast<LoadSDNode>(Node); 1885 SDLoc dl(Node); 1886 assert(LD->getExtensionType() == ISD::NON_EXTLOAD); 1887 assert(Node->getValueType(0) == MVT::i1 && 1888 "Custom lowering for i1 load only"); 1889 SDValue newLD = 1890 DAG.getLoad(MVT::i16, dl, LD->getChain(), LD->getBasePtr(), 1891 LD->getPointerInfo(), LD->isVolatile(), LD->isNonTemporal(), 1892 LD->isInvariant(), LD->getAlignment()); 1893 SDValue result = DAG.getNode(ISD::TRUNCATE, dl, MVT::i1, newLD); 1894 // The legalizer (the caller) is expecting two values from the legalized 1895 // load, so we build a MergeValues node for it. See ExpandUnalignedLoad() 1896 // in LegalizeDAG.cpp which also uses MergeValues. 1897 SDValue Ops[] = { result, LD->getChain() }; 1898 return DAG.getMergeValues(Ops, dl); 1899 } 1900 1901 SDValue NVPTXTargetLowering::LowerSTORE(SDValue Op, SelectionDAG &DAG) const { 1902 EVT ValVT = Op.getOperand(1).getValueType(); 1903 if (ValVT == MVT::i1) 1904 return LowerSTOREi1(Op, DAG); 1905 else if (ValVT.isVector()) 1906 return LowerSTOREVector(Op, DAG); 1907 else 1908 return SDValue(); 1909 } 1910 1911 SDValue 1912 NVPTXTargetLowering::LowerSTOREVector(SDValue Op, SelectionDAG &DAG) const { 1913 SDNode *N = Op.getNode(); 1914 SDValue Val = N->getOperand(1); 1915 SDLoc DL(N); 1916 EVT ValVT = Val.getValueType(); 1917 1918 if (ValVT.isVector()) { 1919 // We only handle "native" vector sizes for now, e.g. <4 x double> is not 1920 // legal. We can (and should) split that into 2 stores of <2 x double> here 1921 // but I'm leaving that as a TODO for now. 1922 if (!ValVT.isSimple()) 1923 return SDValue(); 1924 switch (ValVT.getSimpleVT().SimpleTy) { 1925 default: 1926 return SDValue(); 1927 case MVT::v2i8: 1928 case MVT::v2i16: 1929 case MVT::v2i32: 1930 case MVT::v2i64: 1931 case MVT::v2f32: 1932 case MVT::v2f64: 1933 case MVT::v4i8: 1934 case MVT::v4i16: 1935 case MVT::v4i32: 1936 case MVT::v4f32: 1937 // This is a "native" vector type 1938 break; 1939 } 1940 1941 MemSDNode *MemSD = cast<MemSDNode>(N); 1942 const DataLayout &TD = DAG.getDataLayout(); 1943 1944 unsigned Align = MemSD->getAlignment(); 1945 unsigned PrefAlign = 1946 TD.getPrefTypeAlignment(ValVT.getTypeForEVT(*DAG.getContext())); 1947 if (Align < PrefAlign) { 1948 // This store is not sufficiently aligned, so bail out and let this vector 1949 // store be scalarized. Note that we may still be able to emit smaller 1950 // vector stores. For example, if we are storing a <4 x float> with an 1951 // alignment of 8, this check will fail but the legalizer will try again 1952 // with 2 x <2 x float>, which will succeed with an alignment of 8. 1953 return SDValue(); 1954 } 1955 1956 unsigned Opcode = 0; 1957 EVT EltVT = ValVT.getVectorElementType(); 1958 unsigned NumElts = ValVT.getVectorNumElements(); 1959 1960 // Since StoreV2 is a target node, we cannot rely on DAG type legalization. 1961 // Therefore, we must ensure the type is legal. For i1 and i8, we set the 1962 // stored type to i16 and propagate the "real" type as the memory type. 1963 bool NeedExt = false; 1964 if (EltVT.getSizeInBits() < 16) 1965 NeedExt = true; 1966 1967 switch (NumElts) { 1968 default: 1969 return SDValue(); 1970 case 2: 1971 Opcode = NVPTXISD::StoreV2; 1972 break; 1973 case 4: { 1974 Opcode = NVPTXISD::StoreV4; 1975 break; 1976 } 1977 } 1978 1979 SmallVector<SDValue, 8> Ops; 1980 1981 // First is the chain 1982 Ops.push_back(N->getOperand(0)); 1983 1984 // Then the split values 1985 for (unsigned i = 0; i < NumElts; ++i) { 1986 SDValue ExtVal = DAG.getNode(ISD::EXTRACT_VECTOR_ELT, DL, EltVT, Val, 1987 DAG.getIntPtrConstant(i, DL)); 1988 if (NeedExt) 1989 ExtVal = DAG.getNode(ISD::ANY_EXTEND, DL, MVT::i16, ExtVal); 1990 Ops.push_back(ExtVal); 1991 } 1992 1993 // Then any remaining arguments 1994 Ops.append(N->op_begin() + 2, N->op_end()); 1995 1996 SDValue NewSt = DAG.getMemIntrinsicNode( 1997 Opcode, DL, DAG.getVTList(MVT::Other), Ops, 1998 MemSD->getMemoryVT(), MemSD->getMemOperand()); 1999 2000 //return DCI.CombineTo(N, NewSt, true); 2001 return NewSt; 2002 } 2003 2004 return SDValue(); 2005 } 2006 2007 // st i1 v, addr 2008 // => 2009 // v1 = zxt v to i16 2010 // st.u8 i16, addr 2011 SDValue NVPTXTargetLowering::LowerSTOREi1(SDValue Op, SelectionDAG &DAG) const { 2012 SDNode *Node = Op.getNode(); 2013 SDLoc dl(Node); 2014 StoreSDNode *ST = cast<StoreSDNode>(Node); 2015 SDValue Tmp1 = ST->getChain(); 2016 SDValue Tmp2 = ST->getBasePtr(); 2017 SDValue Tmp3 = ST->getValue(); 2018 assert(Tmp3.getValueType() == MVT::i1 && "Custom lowering for i1 store only"); 2019 unsigned Alignment = ST->getAlignment(); 2020 bool isVolatile = ST->isVolatile(); 2021 bool isNonTemporal = ST->isNonTemporal(); 2022 Tmp3 = DAG.getNode(ISD::ZERO_EXTEND, dl, MVT::i16, Tmp3); 2023 SDValue Result = DAG.getTruncStore(Tmp1, dl, Tmp3, Tmp2, 2024 ST->getPointerInfo(), MVT::i8, isNonTemporal, 2025 isVolatile, Alignment); 2026 return Result; 2027 } 2028 2029 SDValue 2030 NVPTXTargetLowering::getParamSymbol(SelectionDAG &DAG, int idx, EVT v) const { 2031 std::string ParamSym; 2032 raw_string_ostream ParamStr(ParamSym); 2033 2034 ParamStr << DAG.getMachineFunction().getName() << "_param_" << idx; 2035 ParamStr.flush(); 2036 2037 std::string *SavedStr = 2038 nvTM->getManagedStrPool()->getManagedString(ParamSym.c_str()); 2039 return DAG.getTargetExternalSymbol(SavedStr->c_str(), v); 2040 } 2041 2042 // Check to see if the kernel argument is image*_t or sampler_t 2043 2044 static bool isImageOrSamplerVal(const Value *arg, const Module *context) { 2045 static const char *const specialTypes[] = { "struct._image2d_t", 2046 "struct._image3d_t", 2047 "struct._sampler_t" }; 2048 2049 Type *Ty = arg->getType(); 2050 auto *PTy = dyn_cast<PointerType>(Ty); 2051 2052 if (!PTy) 2053 return false; 2054 2055 if (!context) 2056 return false; 2057 2058 auto *STy = dyn_cast<StructType>(PTy->getElementType()); 2059 if (!STy || STy->isLiteral()) 2060 return false; 2061 2062 return std::find(std::begin(specialTypes), std::end(specialTypes), 2063 STy->getName()) != std::end(specialTypes); 2064 } 2065 2066 SDValue NVPTXTargetLowering::LowerFormalArguments( 2067 SDValue Chain, CallingConv::ID CallConv, bool isVarArg, 2068 const SmallVectorImpl<ISD::InputArg> &Ins, const SDLoc &dl, 2069 SelectionDAG &DAG, SmallVectorImpl<SDValue> &InVals) const { 2070 MachineFunction &MF = DAG.getMachineFunction(); 2071 const DataLayout &DL = DAG.getDataLayout(); 2072 auto PtrVT = getPointerTy(DAG.getDataLayout()); 2073 2074 const Function *F = MF.getFunction(); 2075 const AttributeSet &PAL = F->getAttributes(); 2076 const TargetLowering *TLI = STI.getTargetLowering(); 2077 2078 SDValue Root = DAG.getRoot(); 2079 std::vector<SDValue> OutChains; 2080 2081 bool isABI = (STI.getSmVersion() >= 20); 2082 assert(isABI && "Non-ABI compilation is not supported"); 2083 if (!isABI) 2084 return Chain; 2085 2086 std::vector<Type *> argTypes; 2087 std::vector<const Argument *> theArgs; 2088 for (const Argument &I : F->args()) { 2089 theArgs.push_back(&I); 2090 argTypes.push_back(I.getType()); 2091 } 2092 // argTypes.size() (or theArgs.size()) and Ins.size() need not match. 2093 // Ins.size() will be larger 2094 // * if there is an aggregate argument with multiple fields (each field 2095 // showing up separately in Ins) 2096 // * if there is a vector argument with more than typical vector-length 2097 // elements (generally if more than 4) where each vector element is 2098 // individually present in Ins. 2099 // So a different index should be used for indexing into Ins. 2100 // See similar issue in LowerCall. 2101 unsigned InsIdx = 0; 2102 2103 int idx = 0; 2104 for (unsigned i = 0, e = theArgs.size(); i != e; ++i, ++idx, ++InsIdx) { 2105 Type *Ty = argTypes[i]; 2106 2107 // If the kernel argument is image*_t or sampler_t, convert it to 2108 // a i32 constant holding the parameter position. This can later 2109 // matched in the AsmPrinter to output the correct mangled name. 2110 if (isImageOrSamplerVal( 2111 theArgs[i], 2112 (theArgs[i]->getParent() ? theArgs[i]->getParent()->getParent() 2113 : nullptr))) { 2114 assert(llvm::isKernelFunction(*F) && 2115 "Only kernels can have image/sampler params"); 2116 InVals.push_back(DAG.getConstant(i + 1, dl, MVT::i32)); 2117 continue; 2118 } 2119 2120 if (theArgs[i]->use_empty()) { 2121 // argument is dead 2122 if (Ty->isAggregateType()) { 2123 SmallVector<EVT, 16> vtparts; 2124 2125 ComputePTXValueVTs(*this, DAG.getDataLayout(), Ty, vtparts); 2126 assert(vtparts.size() > 0 && "empty aggregate type not expected"); 2127 for (unsigned parti = 0, parte = vtparts.size(); parti != parte; 2128 ++parti) { 2129 InVals.push_back(DAG.getNode(ISD::UNDEF, dl, Ins[InsIdx].VT)); 2130 ++InsIdx; 2131 } 2132 if (vtparts.size() > 0) 2133 --InsIdx; 2134 continue; 2135 } 2136 if (Ty->isVectorTy()) { 2137 EVT ObjectVT = getValueType(DL, Ty); 2138 unsigned NumRegs = TLI->getNumRegisters(F->getContext(), ObjectVT); 2139 for (unsigned parti = 0; parti < NumRegs; ++parti) { 2140 InVals.push_back(DAG.getNode(ISD::UNDEF, dl, Ins[InsIdx].VT)); 2141 ++InsIdx; 2142 } 2143 if (NumRegs > 0) 2144 --InsIdx; 2145 continue; 2146 } 2147 InVals.push_back(DAG.getNode(ISD::UNDEF, dl, Ins[InsIdx].VT)); 2148 continue; 2149 } 2150 2151 // In the following cases, assign a node order of "idx+1" 2152 // to newly created nodes. The SDNodes for params have to 2153 // appear in the same order as their order of appearance 2154 // in the original function. "idx+1" holds that order. 2155 if (!PAL.hasAttribute(i + 1, Attribute::ByVal)) { 2156 if (Ty->isAggregateType()) { 2157 SmallVector<EVT, 16> vtparts; 2158 SmallVector<uint64_t, 16> offsets; 2159 2160 // NOTE: Here, we lose the ability to issue vector loads for vectors 2161 // that are a part of a struct. This should be investigated in the 2162 // future. 2163 ComputePTXValueVTs(*this, DAG.getDataLayout(), Ty, vtparts, &offsets, 2164 0); 2165 assert(vtparts.size() > 0 && "empty aggregate type not expected"); 2166 bool aggregateIsPacked = false; 2167 if (StructType *STy = llvm::dyn_cast<StructType>(Ty)) 2168 aggregateIsPacked = STy->isPacked(); 2169 2170 SDValue Arg = getParamSymbol(DAG, idx, PtrVT); 2171 for (unsigned parti = 0, parte = vtparts.size(); parti != parte; 2172 ++parti) { 2173 EVT partVT = vtparts[parti]; 2174 Value *srcValue = Constant::getNullValue( 2175 PointerType::get(partVT.getTypeForEVT(F->getContext()), 2176 llvm::ADDRESS_SPACE_PARAM)); 2177 SDValue srcAddr = 2178 DAG.getNode(ISD::ADD, dl, PtrVT, Arg, 2179 DAG.getConstant(offsets[parti], dl, PtrVT)); 2180 unsigned partAlign = aggregateIsPacked 2181 ? 1 2182 : DL.getABITypeAlignment( 2183 partVT.getTypeForEVT(F->getContext())); 2184 SDValue p; 2185 if (Ins[InsIdx].VT.getSizeInBits() > partVT.getSizeInBits()) { 2186 ISD::LoadExtType ExtOp = Ins[InsIdx].Flags.isSExt() ? 2187 ISD::SEXTLOAD : ISD::ZEXTLOAD; 2188 p = DAG.getExtLoad(ExtOp, dl, Ins[InsIdx].VT, Root, srcAddr, 2189 MachinePointerInfo(srcValue), partVT, false, 2190 false, false, partAlign); 2191 } else { 2192 p = DAG.getLoad(partVT, dl, Root, srcAddr, 2193 MachinePointerInfo(srcValue), false, false, false, 2194 partAlign); 2195 } 2196 if (p.getNode()) 2197 p.getNode()->setIROrder(idx + 1); 2198 InVals.push_back(p); 2199 ++InsIdx; 2200 } 2201 if (vtparts.size() > 0) 2202 --InsIdx; 2203 continue; 2204 } 2205 if (Ty->isVectorTy()) { 2206 EVT ObjectVT = getValueType(DL, Ty); 2207 SDValue Arg = getParamSymbol(DAG, idx, PtrVT); 2208 unsigned NumElts = ObjectVT.getVectorNumElements(); 2209 assert(TLI->getNumRegisters(F->getContext(), ObjectVT) == NumElts && 2210 "Vector was not scalarized"); 2211 EVT EltVT = ObjectVT.getVectorElementType(); 2212 2213 // V1 load 2214 // f32 = load ... 2215 if (NumElts == 1) { 2216 // We only have one element, so just directly load it 2217 Value *SrcValue = Constant::getNullValue(PointerType::get( 2218 EltVT.getTypeForEVT(F->getContext()), llvm::ADDRESS_SPACE_PARAM)); 2219 SDValue P = DAG.getLoad( 2220 EltVT, dl, Root, Arg, MachinePointerInfo(SrcValue), false, false, 2221 true, 2222 DL.getABITypeAlignment(EltVT.getTypeForEVT(F->getContext()))); 2223 if (P.getNode()) 2224 P.getNode()->setIROrder(idx + 1); 2225 2226 if (Ins[InsIdx].VT.getSizeInBits() > EltVT.getSizeInBits()) 2227 P = DAG.getNode(ISD::ANY_EXTEND, dl, Ins[InsIdx].VT, P); 2228 InVals.push_back(P); 2229 ++InsIdx; 2230 } else if (NumElts == 2) { 2231 // V2 load 2232 // f32,f32 = load ... 2233 EVT VecVT = EVT::getVectorVT(F->getContext(), EltVT, 2); 2234 Value *SrcValue = Constant::getNullValue(PointerType::get( 2235 VecVT.getTypeForEVT(F->getContext()), llvm::ADDRESS_SPACE_PARAM)); 2236 SDValue P = DAG.getLoad( 2237 VecVT, dl, Root, Arg, MachinePointerInfo(SrcValue), false, false, 2238 true, 2239 DL.getABITypeAlignment(VecVT.getTypeForEVT(F->getContext()))); 2240 if (P.getNode()) 2241 P.getNode()->setIROrder(idx + 1); 2242 2243 SDValue Elt0 = DAG.getNode(ISD::EXTRACT_VECTOR_ELT, dl, EltVT, P, 2244 DAG.getIntPtrConstant(0, dl)); 2245 SDValue Elt1 = DAG.getNode(ISD::EXTRACT_VECTOR_ELT, dl, EltVT, P, 2246 DAG.getIntPtrConstant(1, dl)); 2247 2248 if (Ins[InsIdx].VT.getSizeInBits() > EltVT.getSizeInBits()) { 2249 Elt0 = DAG.getNode(ISD::ANY_EXTEND, dl, Ins[InsIdx].VT, Elt0); 2250 Elt1 = DAG.getNode(ISD::ANY_EXTEND, dl, Ins[InsIdx].VT, Elt1); 2251 } 2252 2253 InVals.push_back(Elt0); 2254 InVals.push_back(Elt1); 2255 InsIdx += 2; 2256 } else { 2257 // V4 loads 2258 // We have at least 4 elements (<3 x Ty> expands to 4 elements) and 2259 // the 2260 // vector will be expanded to a power of 2 elements, so we know we can 2261 // always round up to the next multiple of 4 when creating the vector 2262 // loads. 2263 // e.g. 4 elem => 1 ld.v4 2264 // 6 elem => 2 ld.v4 2265 // 8 elem => 2 ld.v4 2266 // 11 elem => 3 ld.v4 2267 unsigned VecSize = 4; 2268 if (EltVT.getSizeInBits() == 64) { 2269 VecSize = 2; 2270 } 2271 EVT VecVT = EVT::getVectorVT(F->getContext(), EltVT, VecSize); 2272 unsigned Ofst = 0; 2273 for (unsigned i = 0; i < NumElts; i += VecSize) { 2274 Value *SrcValue = Constant::getNullValue( 2275 PointerType::get(VecVT.getTypeForEVT(F->getContext()), 2276 llvm::ADDRESS_SPACE_PARAM)); 2277 SDValue SrcAddr = DAG.getNode(ISD::ADD, dl, PtrVT, Arg, 2278 DAG.getConstant(Ofst, dl, PtrVT)); 2279 SDValue P = DAG.getLoad( 2280 VecVT, dl, Root, SrcAddr, MachinePointerInfo(SrcValue), false, 2281 false, true, 2282 DL.getABITypeAlignment(VecVT.getTypeForEVT(F->getContext()))); 2283 if (P.getNode()) 2284 P.getNode()->setIROrder(idx + 1); 2285 2286 for (unsigned j = 0; j < VecSize; ++j) { 2287 if (i + j >= NumElts) 2288 break; 2289 SDValue Elt = DAG.getNode(ISD::EXTRACT_VECTOR_ELT, dl, EltVT, P, 2290 DAG.getIntPtrConstant(j, dl)); 2291 if (Ins[InsIdx].VT.getSizeInBits() > EltVT.getSizeInBits()) 2292 Elt = DAG.getNode(ISD::ANY_EXTEND, dl, Ins[InsIdx].VT, Elt); 2293 InVals.push_back(Elt); 2294 } 2295 Ofst += DL.getTypeAllocSize(VecVT.getTypeForEVT(F->getContext())); 2296 } 2297 InsIdx += NumElts; 2298 } 2299 2300 if (NumElts > 0) 2301 --InsIdx; 2302 continue; 2303 } 2304 // A plain scalar. 2305 EVT ObjectVT = getValueType(DL, Ty); 2306 // If ABI, load from the param symbol 2307 SDValue Arg = getParamSymbol(DAG, idx, PtrVT); 2308 Value *srcValue = Constant::getNullValue(PointerType::get( 2309 ObjectVT.getTypeForEVT(F->getContext()), llvm::ADDRESS_SPACE_PARAM)); 2310 SDValue p; 2311 if (ObjectVT.getSizeInBits() < Ins[InsIdx].VT.getSizeInBits()) { 2312 ISD::LoadExtType ExtOp = Ins[InsIdx].Flags.isSExt() ? 2313 ISD::SEXTLOAD : ISD::ZEXTLOAD; 2314 p = DAG.getExtLoad( 2315 ExtOp, dl, Ins[InsIdx].VT, Root, Arg, MachinePointerInfo(srcValue), 2316 ObjectVT, false, false, false, 2317 DL.getABITypeAlignment(ObjectVT.getTypeForEVT(F->getContext()))); 2318 } else { 2319 p = DAG.getLoad( 2320 Ins[InsIdx].VT, dl, Root, Arg, MachinePointerInfo(srcValue), false, 2321 false, false, 2322 DL.getABITypeAlignment(ObjectVT.getTypeForEVT(F->getContext()))); 2323 } 2324 if (p.getNode()) 2325 p.getNode()->setIROrder(idx + 1); 2326 InVals.push_back(p); 2327 continue; 2328 } 2329 2330 // Param has ByVal attribute 2331 // Return MoveParam(param symbol). 2332 // Ideally, the param symbol can be returned directly, 2333 // but when SDNode builder decides to use it in a CopyToReg(), 2334 // machine instruction fails because TargetExternalSymbol 2335 // (not lowered) is target dependent, and CopyToReg assumes 2336 // the source is lowered. 2337 // 2338 // Byval arguments for regular function are lowered the same way 2339 // as for kernels in order to generate better code and work around 2340 // a known issue in ptxas. See comments in 2341 // NVPTXDAGToDAGISel::SelectAddrSpaceCast() for the gory details. 2342 EVT ObjectVT = getValueType(DL, Ty); 2343 assert(ObjectVT == Ins[InsIdx].VT && 2344 "Ins type did not match function type"); 2345 SDValue Arg = getParamSymbol(DAG, idx, PtrVT); 2346 SDValue p = DAG.getNode(NVPTXISD::MoveParam, dl, ObjectVT, Arg); 2347 if (p.getNode()) 2348 p.getNode()->setIROrder(idx + 1); 2349 InVals.push_back(p); 2350 } 2351 2352 // Clang will check explicit VarArg and issue error if any. However, Clang 2353 // will let code with 2354 // implicit var arg like f() pass. See bug 617733. 2355 // We treat this case as if the arg list is empty. 2356 // if (F.isVarArg()) { 2357 // assert(0 && "VarArg not supported yet!"); 2358 //} 2359 2360 if (!OutChains.empty()) 2361 DAG.setRoot(DAG.getNode(ISD::TokenFactor, dl, MVT::Other, OutChains)); 2362 2363 return Chain; 2364 } 2365 2366 SDValue 2367 NVPTXTargetLowering::LowerReturn(SDValue Chain, CallingConv::ID CallConv, 2368 bool isVarArg, 2369 const SmallVectorImpl<ISD::OutputArg> &Outs, 2370 const SmallVectorImpl<SDValue> &OutVals, 2371 const SDLoc &dl, SelectionDAG &DAG) const { 2372 MachineFunction &MF = DAG.getMachineFunction(); 2373 const Function *F = MF.getFunction(); 2374 Type *RetTy = F->getReturnType(); 2375 const DataLayout &TD = DAG.getDataLayout(); 2376 2377 bool isABI = (STI.getSmVersion() >= 20); 2378 assert(isABI && "Non-ABI compilation is not supported"); 2379 if (!isABI) 2380 return Chain; 2381 2382 if (VectorType *VTy = dyn_cast<VectorType>(RetTy)) { 2383 // If we have a vector type, the OutVals array will be the scalarized 2384 // components and we have combine them into 1 or more vector stores. 2385 unsigned NumElts = VTy->getNumElements(); 2386 assert(NumElts == Outs.size() && "Bad scalarization of return value"); 2387 2388 // const_cast can be removed in later LLVM versions 2389 EVT EltVT = getValueType(TD, RetTy).getVectorElementType(); 2390 bool NeedExtend = false; 2391 if (EltVT.getSizeInBits() < 16) 2392 NeedExtend = true; 2393 2394 // V1 store 2395 if (NumElts == 1) { 2396 SDValue StoreVal = OutVals[0]; 2397 // We only have one element, so just directly store it 2398 if (NeedExtend) 2399 StoreVal = DAG.getNode(ISD::ZERO_EXTEND, dl, MVT::i16, StoreVal); 2400 SDValue Ops[] = { Chain, DAG.getConstant(0, dl, MVT::i32), StoreVal }; 2401 Chain = DAG.getMemIntrinsicNode(NVPTXISD::StoreRetval, dl, 2402 DAG.getVTList(MVT::Other), Ops, 2403 EltVT, MachinePointerInfo()); 2404 2405 } else if (NumElts == 2) { 2406 // V2 store 2407 SDValue StoreVal0 = OutVals[0]; 2408 SDValue StoreVal1 = OutVals[1]; 2409 2410 if (NeedExtend) { 2411 StoreVal0 = DAG.getNode(ISD::ZERO_EXTEND, dl, MVT::i16, StoreVal0); 2412 StoreVal1 = DAG.getNode(ISD::ZERO_EXTEND, dl, MVT::i16, StoreVal1); 2413 } 2414 2415 SDValue Ops[] = { Chain, DAG.getConstant(0, dl, MVT::i32), StoreVal0, 2416 StoreVal1 }; 2417 Chain = DAG.getMemIntrinsicNode(NVPTXISD::StoreRetvalV2, dl, 2418 DAG.getVTList(MVT::Other), Ops, 2419 EltVT, MachinePointerInfo()); 2420 } else { 2421 // V4 stores 2422 // We have at least 4 elements (<3 x Ty> expands to 4 elements) and the 2423 // vector will be expanded to a power of 2 elements, so we know we can 2424 // always round up to the next multiple of 4 when creating the vector 2425 // stores. 2426 // e.g. 4 elem => 1 st.v4 2427 // 6 elem => 2 st.v4 2428 // 8 elem => 2 st.v4 2429 // 11 elem => 3 st.v4 2430 2431 unsigned VecSize = 4; 2432 if (OutVals[0].getValueType().getSizeInBits() == 64) 2433 VecSize = 2; 2434 2435 unsigned Offset = 0; 2436 2437 EVT VecVT = 2438 EVT::getVectorVT(F->getContext(), EltVT, VecSize); 2439 unsigned PerStoreOffset = 2440 TD.getTypeAllocSize(VecVT.getTypeForEVT(F->getContext())); 2441 2442 for (unsigned i = 0; i < NumElts; i += VecSize) { 2443 // Get values 2444 SDValue StoreVal; 2445 SmallVector<SDValue, 8> Ops; 2446 Ops.push_back(Chain); 2447 Ops.push_back(DAG.getConstant(Offset, dl, MVT::i32)); 2448 unsigned Opc = NVPTXISD::StoreRetvalV2; 2449 EVT ExtendedVT = (NeedExtend) ? MVT::i16 : OutVals[0].getValueType(); 2450 2451 StoreVal = OutVals[i]; 2452 if (NeedExtend) 2453 StoreVal = DAG.getNode(ISD::ZERO_EXTEND, dl, ExtendedVT, StoreVal); 2454 Ops.push_back(StoreVal); 2455 2456 if (i + 1 < NumElts) { 2457 StoreVal = OutVals[i + 1]; 2458 if (NeedExtend) 2459 StoreVal = DAG.getNode(ISD::ZERO_EXTEND, dl, ExtendedVT, StoreVal); 2460 } else { 2461 StoreVal = DAG.getUNDEF(ExtendedVT); 2462 } 2463 Ops.push_back(StoreVal); 2464 2465 if (VecSize == 4) { 2466 Opc = NVPTXISD::StoreRetvalV4; 2467 if (i + 2 < NumElts) { 2468 StoreVal = OutVals[i + 2]; 2469 if (NeedExtend) 2470 StoreVal = 2471 DAG.getNode(ISD::ZERO_EXTEND, dl, ExtendedVT, StoreVal); 2472 } else { 2473 StoreVal = DAG.getUNDEF(ExtendedVT); 2474 } 2475 Ops.push_back(StoreVal); 2476 2477 if (i + 3 < NumElts) { 2478 StoreVal = OutVals[i + 3]; 2479 if (NeedExtend) 2480 StoreVal = 2481 DAG.getNode(ISD::ZERO_EXTEND, dl, ExtendedVT, StoreVal); 2482 } else { 2483 StoreVal = DAG.getUNDEF(ExtendedVT); 2484 } 2485 Ops.push_back(StoreVal); 2486 } 2487 2488 // Chain = DAG.getNode(Opc, dl, MVT::Other, &Ops[0], Ops.size()); 2489 Chain = 2490 DAG.getMemIntrinsicNode(Opc, dl, DAG.getVTList(MVT::Other), Ops, 2491 EltVT, MachinePointerInfo()); 2492 Offset += PerStoreOffset; 2493 } 2494 } 2495 } else { 2496 SmallVector<EVT, 16> ValVTs; 2497 SmallVector<uint64_t, 16> Offsets; 2498 ComputePTXValueVTs(*this, DAG.getDataLayout(), RetTy, ValVTs, &Offsets, 0); 2499 assert(ValVTs.size() == OutVals.size() && "Bad return value decomposition"); 2500 2501 for (unsigned i = 0, e = Outs.size(); i != e; ++i) { 2502 SDValue theVal = OutVals[i]; 2503 EVT TheValType = theVal.getValueType(); 2504 unsigned numElems = 1; 2505 if (TheValType.isVector()) 2506 numElems = TheValType.getVectorNumElements(); 2507 for (unsigned j = 0, je = numElems; j != je; ++j) { 2508 SDValue TmpVal = theVal; 2509 if (TheValType.isVector()) 2510 TmpVal = DAG.getNode(ISD::EXTRACT_VECTOR_ELT, dl, 2511 TheValType.getVectorElementType(), TmpVal, 2512 DAG.getIntPtrConstant(j, dl)); 2513 EVT TheStoreType = ValVTs[i]; 2514 if (RetTy->isIntegerTy() && TD.getTypeAllocSizeInBits(RetTy) < 32) { 2515 // The following zero-extension is for integer types only, and 2516 // specifically not for aggregates. 2517 TmpVal = DAG.getNode(ISD::ZERO_EXTEND, dl, MVT::i32, TmpVal); 2518 TheStoreType = MVT::i32; 2519 } 2520 else if (TmpVal.getValueType().getSizeInBits() < 16) 2521 TmpVal = DAG.getNode(ISD::ANY_EXTEND, dl, MVT::i16, TmpVal); 2522 2523 SDValue Ops[] = { 2524 Chain, 2525 DAG.getConstant(Offsets[i], dl, MVT::i32), 2526 TmpVal }; 2527 Chain = DAG.getMemIntrinsicNode(NVPTXISD::StoreRetval, dl, 2528 DAG.getVTList(MVT::Other), Ops, 2529 TheStoreType, 2530 MachinePointerInfo()); 2531 } 2532 } 2533 } 2534 2535 return DAG.getNode(NVPTXISD::RET_FLAG, dl, MVT::Other, Chain); 2536 } 2537 2538 2539 void NVPTXTargetLowering::LowerAsmOperandForConstraint( 2540 SDValue Op, std::string &Constraint, std::vector<SDValue> &Ops, 2541 SelectionDAG &DAG) const { 2542 if (Constraint.length() > 1) 2543 return; 2544 else 2545 TargetLowering::LowerAsmOperandForConstraint(Op, Constraint, Ops, DAG); 2546 } 2547 2548 static unsigned getOpcForTextureInstr(unsigned Intrinsic) { 2549 switch (Intrinsic) { 2550 default: 2551 return 0; 2552 2553 case Intrinsic::nvvm_tex_1d_v4f32_s32: 2554 return NVPTXISD::Tex1DFloatS32; 2555 case Intrinsic::nvvm_tex_1d_v4f32_f32: 2556 return NVPTXISD::Tex1DFloatFloat; 2557 case Intrinsic::nvvm_tex_1d_level_v4f32_f32: 2558 return NVPTXISD::Tex1DFloatFloatLevel; 2559 case Intrinsic::nvvm_tex_1d_grad_v4f32_f32: 2560 return NVPTXISD::Tex1DFloatFloatGrad; 2561 case Intrinsic::nvvm_tex_1d_v4s32_s32: 2562 return NVPTXISD::Tex1DS32S32; 2563 case Intrinsic::nvvm_tex_1d_v4s32_f32: 2564 return NVPTXISD::Tex1DS32Float; 2565 case Intrinsic::nvvm_tex_1d_level_v4s32_f32: 2566 return NVPTXISD::Tex1DS32FloatLevel; 2567 case Intrinsic::nvvm_tex_1d_grad_v4s32_f32: 2568 return NVPTXISD::Tex1DS32FloatGrad; 2569 case Intrinsic::nvvm_tex_1d_v4u32_s32: 2570 return NVPTXISD::Tex1DU32S32; 2571 case Intrinsic::nvvm_tex_1d_v4u32_f32: 2572 return NVPTXISD::Tex1DU32Float; 2573 case Intrinsic::nvvm_tex_1d_level_v4u32_f32: 2574 return NVPTXISD::Tex1DU32FloatLevel; 2575 case Intrinsic::nvvm_tex_1d_grad_v4u32_f32: 2576 return NVPTXISD::Tex1DU32FloatGrad; 2577 2578 case Intrinsic::nvvm_tex_1d_array_v4f32_s32: 2579 return NVPTXISD::Tex1DArrayFloatS32; 2580 case Intrinsic::nvvm_tex_1d_array_v4f32_f32: 2581 return NVPTXISD::Tex1DArrayFloatFloat; 2582 case Intrinsic::nvvm_tex_1d_array_level_v4f32_f32: 2583 return NVPTXISD::Tex1DArrayFloatFloatLevel; 2584 case Intrinsic::nvvm_tex_1d_array_grad_v4f32_f32: 2585 return NVPTXISD::Tex1DArrayFloatFloatGrad; 2586 case Intrinsic::nvvm_tex_1d_array_v4s32_s32: 2587 return NVPTXISD::Tex1DArrayS32S32; 2588 case Intrinsic::nvvm_tex_1d_array_v4s32_f32: 2589 return NVPTXISD::Tex1DArrayS32Float; 2590 case Intrinsic::nvvm_tex_1d_array_level_v4s32_f32: 2591 return NVPTXISD::Tex1DArrayS32FloatLevel; 2592 case Intrinsic::nvvm_tex_1d_array_grad_v4s32_f32: 2593 return NVPTXISD::Tex1DArrayS32FloatGrad; 2594 case Intrinsic::nvvm_tex_1d_array_v4u32_s32: 2595 return NVPTXISD::Tex1DArrayU32S32; 2596 case Intrinsic::nvvm_tex_1d_array_v4u32_f32: 2597 return NVPTXISD::Tex1DArrayU32Float; 2598 case Intrinsic::nvvm_tex_1d_array_level_v4u32_f32: 2599 return NVPTXISD::Tex1DArrayU32FloatLevel; 2600 case Intrinsic::nvvm_tex_1d_array_grad_v4u32_f32: 2601 return NVPTXISD::Tex1DArrayU32FloatGrad; 2602 2603 case Intrinsic::nvvm_tex_2d_v4f32_s32: 2604 return NVPTXISD::Tex2DFloatS32; 2605 case Intrinsic::nvvm_tex_2d_v4f32_f32: 2606 return NVPTXISD::Tex2DFloatFloat; 2607 case Intrinsic::nvvm_tex_2d_level_v4f32_f32: 2608 return NVPTXISD::Tex2DFloatFloatLevel; 2609 case Intrinsic::nvvm_tex_2d_grad_v4f32_f32: 2610 return NVPTXISD::Tex2DFloatFloatGrad; 2611 case Intrinsic::nvvm_tex_2d_v4s32_s32: 2612 return NVPTXISD::Tex2DS32S32; 2613 case Intrinsic::nvvm_tex_2d_v4s32_f32: 2614 return NVPTXISD::Tex2DS32Float; 2615 case Intrinsic::nvvm_tex_2d_level_v4s32_f32: 2616 return NVPTXISD::Tex2DS32FloatLevel; 2617 case Intrinsic::nvvm_tex_2d_grad_v4s32_f32: 2618 return NVPTXISD::Tex2DS32FloatGrad; 2619 case Intrinsic::nvvm_tex_2d_v4u32_s32: 2620 return NVPTXISD::Tex2DU32S32; 2621 case Intrinsic::nvvm_tex_2d_v4u32_f32: 2622 return NVPTXISD::Tex2DU32Float; 2623 case Intrinsic::nvvm_tex_2d_level_v4u32_f32: 2624 return NVPTXISD::Tex2DU32FloatLevel; 2625 case Intrinsic::nvvm_tex_2d_grad_v4u32_f32: 2626 return NVPTXISD::Tex2DU32FloatGrad; 2627 2628 case Intrinsic::nvvm_tex_2d_array_v4f32_s32: 2629 return NVPTXISD::Tex2DArrayFloatS32; 2630 case Intrinsic::nvvm_tex_2d_array_v4f32_f32: 2631 return NVPTXISD::Tex2DArrayFloatFloat; 2632 case Intrinsic::nvvm_tex_2d_array_level_v4f32_f32: 2633 return NVPTXISD::Tex2DArrayFloatFloatLevel; 2634 case Intrinsic::nvvm_tex_2d_array_grad_v4f32_f32: 2635 return NVPTXISD::Tex2DArrayFloatFloatGrad; 2636 case Intrinsic::nvvm_tex_2d_array_v4s32_s32: 2637 return NVPTXISD::Tex2DArrayS32S32; 2638 case Intrinsic::nvvm_tex_2d_array_v4s32_f32: 2639 return NVPTXISD::Tex2DArrayS32Float; 2640 case Intrinsic::nvvm_tex_2d_array_level_v4s32_f32: 2641 return NVPTXISD::Tex2DArrayS32FloatLevel; 2642 case Intrinsic::nvvm_tex_2d_array_grad_v4s32_f32: 2643 return NVPTXISD::Tex2DArrayS32FloatGrad; 2644 case Intrinsic::nvvm_tex_2d_array_v4u32_s32: 2645 return NVPTXISD::Tex2DArrayU32S32; 2646 case Intrinsic::nvvm_tex_2d_array_v4u32_f32: 2647 return NVPTXISD::Tex2DArrayU32Float; 2648 case Intrinsic::nvvm_tex_2d_array_level_v4u32_f32: 2649 return NVPTXISD::Tex2DArrayU32FloatLevel; 2650 case Intrinsic::nvvm_tex_2d_array_grad_v4u32_f32: 2651 return NVPTXISD::Tex2DArrayU32FloatGrad; 2652 2653 case Intrinsic::nvvm_tex_3d_v4f32_s32: 2654 return NVPTXISD::Tex3DFloatS32; 2655 case Intrinsic::nvvm_tex_3d_v4f32_f32: 2656 return NVPTXISD::Tex3DFloatFloat; 2657 case Intrinsic::nvvm_tex_3d_level_v4f32_f32: 2658 return NVPTXISD::Tex3DFloatFloatLevel; 2659 case Intrinsic::nvvm_tex_3d_grad_v4f32_f32: 2660 return NVPTXISD::Tex3DFloatFloatGrad; 2661 case Intrinsic::nvvm_tex_3d_v4s32_s32: 2662 return NVPTXISD::Tex3DS32S32; 2663 case Intrinsic::nvvm_tex_3d_v4s32_f32: 2664 return NVPTXISD::Tex3DS32Float; 2665 case Intrinsic::nvvm_tex_3d_level_v4s32_f32: 2666 return NVPTXISD::Tex3DS32FloatLevel; 2667 case Intrinsic::nvvm_tex_3d_grad_v4s32_f32: 2668 return NVPTXISD::Tex3DS32FloatGrad; 2669 case Intrinsic::nvvm_tex_3d_v4u32_s32: 2670 return NVPTXISD::Tex3DU32S32; 2671 case Intrinsic::nvvm_tex_3d_v4u32_f32: 2672 return NVPTXISD::Tex3DU32Float; 2673 case Intrinsic::nvvm_tex_3d_level_v4u32_f32: 2674 return NVPTXISD::Tex3DU32FloatLevel; 2675 case Intrinsic::nvvm_tex_3d_grad_v4u32_f32: 2676 return NVPTXISD::Tex3DU32FloatGrad; 2677 2678 case Intrinsic::nvvm_tex_cube_v4f32_f32: 2679 return NVPTXISD::TexCubeFloatFloat; 2680 case Intrinsic::nvvm_tex_cube_level_v4f32_f32: 2681 return NVPTXISD::TexCubeFloatFloatLevel; 2682 case Intrinsic::nvvm_tex_cube_v4s32_f32: 2683 return NVPTXISD::TexCubeS32Float; 2684 case Intrinsic::nvvm_tex_cube_level_v4s32_f32: 2685 return NVPTXISD::TexCubeS32FloatLevel; 2686 case Intrinsic::nvvm_tex_cube_v4u32_f32: 2687 return NVPTXISD::TexCubeU32Float; 2688 case Intrinsic::nvvm_tex_cube_level_v4u32_f32: 2689 return NVPTXISD::TexCubeU32FloatLevel; 2690 2691 case Intrinsic::nvvm_tex_cube_array_v4f32_f32: 2692 return NVPTXISD::TexCubeArrayFloatFloat; 2693 case Intrinsic::nvvm_tex_cube_array_level_v4f32_f32: 2694 return NVPTXISD::TexCubeArrayFloatFloatLevel; 2695 case Intrinsic::nvvm_tex_cube_array_v4s32_f32: 2696 return NVPTXISD::TexCubeArrayS32Float; 2697 case Intrinsic::nvvm_tex_cube_array_level_v4s32_f32: 2698 return NVPTXISD::TexCubeArrayS32FloatLevel; 2699 case Intrinsic::nvvm_tex_cube_array_v4u32_f32: 2700 return NVPTXISD::TexCubeArrayU32Float; 2701 case Intrinsic::nvvm_tex_cube_array_level_v4u32_f32: 2702 return NVPTXISD::TexCubeArrayU32FloatLevel; 2703 2704 case Intrinsic::nvvm_tld4_r_2d_v4f32_f32: 2705 return NVPTXISD::Tld4R2DFloatFloat; 2706 case Intrinsic::nvvm_tld4_g_2d_v4f32_f32: 2707 return NVPTXISD::Tld4G2DFloatFloat; 2708 case Intrinsic::nvvm_tld4_b_2d_v4f32_f32: 2709 return NVPTXISD::Tld4B2DFloatFloat; 2710 case Intrinsic::nvvm_tld4_a_2d_v4f32_f32: 2711 return NVPTXISD::Tld4A2DFloatFloat; 2712 case Intrinsic::nvvm_tld4_r_2d_v4s32_f32: 2713 return NVPTXISD::Tld4R2DS64Float; 2714 case Intrinsic::nvvm_tld4_g_2d_v4s32_f32: 2715 return NVPTXISD::Tld4G2DS64Float; 2716 case Intrinsic::nvvm_tld4_b_2d_v4s32_f32: 2717 return NVPTXISD::Tld4B2DS64Float; 2718 case Intrinsic::nvvm_tld4_a_2d_v4s32_f32: 2719 return NVPTXISD::Tld4A2DS64Float; 2720 case Intrinsic::nvvm_tld4_r_2d_v4u32_f32: 2721 return NVPTXISD::Tld4R2DU64Float; 2722 case Intrinsic::nvvm_tld4_g_2d_v4u32_f32: 2723 return NVPTXISD::Tld4G2DU64Float; 2724 case Intrinsic::nvvm_tld4_b_2d_v4u32_f32: 2725 return NVPTXISD::Tld4B2DU64Float; 2726 case Intrinsic::nvvm_tld4_a_2d_v4u32_f32: 2727 return NVPTXISD::Tld4A2DU64Float; 2728 2729 case Intrinsic::nvvm_tex_unified_1d_v4f32_s32: 2730 return NVPTXISD::TexUnified1DFloatS32; 2731 case Intrinsic::nvvm_tex_unified_1d_v4f32_f32: 2732 return NVPTXISD::TexUnified1DFloatFloat; 2733 case Intrinsic::nvvm_tex_unified_1d_level_v4f32_f32: 2734 return NVPTXISD::TexUnified1DFloatFloatLevel; 2735 case Intrinsic::nvvm_tex_unified_1d_grad_v4f32_f32: 2736 return NVPTXISD::TexUnified1DFloatFloatGrad; 2737 case Intrinsic::nvvm_tex_unified_1d_v4s32_s32: 2738 return NVPTXISD::TexUnified1DS32S32; 2739 case Intrinsic::nvvm_tex_unified_1d_v4s32_f32: 2740 return NVPTXISD::TexUnified1DS32Float; 2741 case Intrinsic::nvvm_tex_unified_1d_level_v4s32_f32: 2742 return NVPTXISD::TexUnified1DS32FloatLevel; 2743 case Intrinsic::nvvm_tex_unified_1d_grad_v4s32_f32: 2744 return NVPTXISD::TexUnified1DS32FloatGrad; 2745 case Intrinsic::nvvm_tex_unified_1d_v4u32_s32: 2746 return NVPTXISD::TexUnified1DU32S32; 2747 case Intrinsic::nvvm_tex_unified_1d_v4u32_f32: 2748 return NVPTXISD::TexUnified1DU32Float; 2749 case Intrinsic::nvvm_tex_unified_1d_level_v4u32_f32: 2750 return NVPTXISD::TexUnified1DU32FloatLevel; 2751 case Intrinsic::nvvm_tex_unified_1d_grad_v4u32_f32: 2752 return NVPTXISD::TexUnified1DU32FloatGrad; 2753 2754 case Intrinsic::nvvm_tex_unified_1d_array_v4f32_s32: 2755 return NVPTXISD::TexUnified1DArrayFloatS32; 2756 case Intrinsic::nvvm_tex_unified_1d_array_v4f32_f32: 2757 return NVPTXISD::TexUnified1DArrayFloatFloat; 2758 case Intrinsic::nvvm_tex_unified_1d_array_level_v4f32_f32: 2759 return NVPTXISD::TexUnified1DArrayFloatFloatLevel; 2760 case Intrinsic::nvvm_tex_unified_1d_array_grad_v4f32_f32: 2761 return NVPTXISD::TexUnified1DArrayFloatFloatGrad; 2762 case Intrinsic::nvvm_tex_unified_1d_array_v4s32_s32: 2763 return NVPTXISD::TexUnified1DArrayS32S32; 2764 case Intrinsic::nvvm_tex_unified_1d_array_v4s32_f32: 2765 return NVPTXISD::TexUnified1DArrayS32Float; 2766 case Intrinsic::nvvm_tex_unified_1d_array_level_v4s32_f32: 2767 return NVPTXISD::TexUnified1DArrayS32FloatLevel; 2768 case Intrinsic::nvvm_tex_unified_1d_array_grad_v4s32_f32: 2769 return NVPTXISD::TexUnified1DArrayS32FloatGrad; 2770 case Intrinsic::nvvm_tex_unified_1d_array_v4u32_s32: 2771 return NVPTXISD::TexUnified1DArrayU32S32; 2772 case Intrinsic::nvvm_tex_unified_1d_array_v4u32_f32: 2773 return NVPTXISD::TexUnified1DArrayU32Float; 2774 case Intrinsic::nvvm_tex_unified_1d_array_level_v4u32_f32: 2775 return NVPTXISD::TexUnified1DArrayU32FloatLevel; 2776 case Intrinsic::nvvm_tex_unified_1d_array_grad_v4u32_f32: 2777 return NVPTXISD::TexUnified1DArrayU32FloatGrad; 2778 2779 case Intrinsic::nvvm_tex_unified_2d_v4f32_s32: 2780 return NVPTXISD::TexUnified2DFloatS32; 2781 case Intrinsic::nvvm_tex_unified_2d_v4f32_f32: 2782 return NVPTXISD::TexUnified2DFloatFloat; 2783 case Intrinsic::nvvm_tex_unified_2d_level_v4f32_f32: 2784 return NVPTXISD::TexUnified2DFloatFloatLevel; 2785 case Intrinsic::nvvm_tex_unified_2d_grad_v4f32_f32: 2786 return NVPTXISD::TexUnified2DFloatFloatGrad; 2787 case Intrinsic::nvvm_tex_unified_2d_v4s32_s32: 2788 return NVPTXISD::TexUnified2DS32S32; 2789 case Intrinsic::nvvm_tex_unified_2d_v4s32_f32: 2790 return NVPTXISD::TexUnified2DS32Float; 2791 case Intrinsic::nvvm_tex_unified_2d_level_v4s32_f32: 2792 return NVPTXISD::TexUnified2DS32FloatLevel; 2793 case Intrinsic::nvvm_tex_unified_2d_grad_v4s32_f32: 2794 return NVPTXISD::TexUnified2DS32FloatGrad; 2795 case Intrinsic::nvvm_tex_unified_2d_v4u32_s32: 2796 return NVPTXISD::TexUnified2DU32S32; 2797 case Intrinsic::nvvm_tex_unified_2d_v4u32_f32: 2798 return NVPTXISD::TexUnified2DU32Float; 2799 case Intrinsic::nvvm_tex_unified_2d_level_v4u32_f32: 2800 return NVPTXISD::TexUnified2DU32FloatLevel; 2801 case Intrinsic::nvvm_tex_unified_2d_grad_v4u32_f32: 2802 return NVPTXISD::TexUnified2DU32FloatGrad; 2803 2804 case Intrinsic::nvvm_tex_unified_2d_array_v4f32_s32: 2805 return NVPTXISD::TexUnified2DArrayFloatS32; 2806 case Intrinsic::nvvm_tex_unified_2d_array_v4f32_f32: 2807 return NVPTXISD::TexUnified2DArrayFloatFloat; 2808 case Intrinsic::nvvm_tex_unified_2d_array_level_v4f32_f32: 2809 return NVPTXISD::TexUnified2DArrayFloatFloatLevel; 2810 case Intrinsic::nvvm_tex_unified_2d_array_grad_v4f32_f32: 2811 return NVPTXISD::TexUnified2DArrayFloatFloatGrad; 2812 case Intrinsic::nvvm_tex_unified_2d_array_v4s32_s32: 2813 return NVPTXISD::TexUnified2DArrayS32S32; 2814 case Intrinsic::nvvm_tex_unified_2d_array_v4s32_f32: 2815 return NVPTXISD::TexUnified2DArrayS32Float; 2816 case Intrinsic::nvvm_tex_unified_2d_array_level_v4s32_f32: 2817 return NVPTXISD::TexUnified2DArrayS32FloatLevel; 2818 case Intrinsic::nvvm_tex_unified_2d_array_grad_v4s32_f32: 2819 return NVPTXISD::TexUnified2DArrayS32FloatGrad; 2820 case Intrinsic::nvvm_tex_unified_2d_array_v4u32_s32: 2821 return NVPTXISD::TexUnified2DArrayU32S32; 2822 case Intrinsic::nvvm_tex_unified_2d_array_v4u32_f32: 2823 return NVPTXISD::TexUnified2DArrayU32Float; 2824 case Intrinsic::nvvm_tex_unified_2d_array_level_v4u32_f32: 2825 return NVPTXISD::TexUnified2DArrayU32FloatLevel; 2826 case Intrinsic::nvvm_tex_unified_2d_array_grad_v4u32_f32: 2827 return NVPTXISD::TexUnified2DArrayU32FloatGrad; 2828 2829 case Intrinsic::nvvm_tex_unified_3d_v4f32_s32: 2830 return NVPTXISD::TexUnified3DFloatS32; 2831 case Intrinsic::nvvm_tex_unified_3d_v4f32_f32: 2832 return NVPTXISD::TexUnified3DFloatFloat; 2833 case Intrinsic::nvvm_tex_unified_3d_level_v4f32_f32: 2834 return NVPTXISD::TexUnified3DFloatFloatLevel; 2835 case Intrinsic::nvvm_tex_unified_3d_grad_v4f32_f32: 2836 return NVPTXISD::TexUnified3DFloatFloatGrad; 2837 case Intrinsic::nvvm_tex_unified_3d_v4s32_s32: 2838 return NVPTXISD::TexUnified3DS32S32; 2839 case Intrinsic::nvvm_tex_unified_3d_v4s32_f32: 2840 return NVPTXISD::TexUnified3DS32Float; 2841 case Intrinsic::nvvm_tex_unified_3d_level_v4s32_f32: 2842 return NVPTXISD::TexUnified3DS32FloatLevel; 2843 case Intrinsic::nvvm_tex_unified_3d_grad_v4s32_f32: 2844 return NVPTXISD::TexUnified3DS32FloatGrad; 2845 case Intrinsic::nvvm_tex_unified_3d_v4u32_s32: 2846 return NVPTXISD::TexUnified3DU32S32; 2847 case Intrinsic::nvvm_tex_unified_3d_v4u32_f32: 2848 return NVPTXISD::TexUnified3DU32Float; 2849 case Intrinsic::nvvm_tex_unified_3d_level_v4u32_f32: 2850 return NVPTXISD::TexUnified3DU32FloatLevel; 2851 case Intrinsic::nvvm_tex_unified_3d_grad_v4u32_f32: 2852 return NVPTXISD::TexUnified3DU32FloatGrad; 2853 2854 case Intrinsic::nvvm_tex_unified_cube_v4f32_f32: 2855 return NVPTXISD::TexUnifiedCubeFloatFloat; 2856 case Intrinsic::nvvm_tex_unified_cube_level_v4f32_f32: 2857 return NVPTXISD::TexUnifiedCubeFloatFloatLevel; 2858 case Intrinsic::nvvm_tex_unified_cube_v4s32_f32: 2859 return NVPTXISD::TexUnifiedCubeS32Float; 2860 case Intrinsic::nvvm_tex_unified_cube_level_v4s32_f32: 2861 return NVPTXISD::TexUnifiedCubeS32FloatLevel; 2862 case Intrinsic::nvvm_tex_unified_cube_v4u32_f32: 2863 return NVPTXISD::TexUnifiedCubeU32Float; 2864 case Intrinsic::nvvm_tex_unified_cube_level_v4u32_f32: 2865 return NVPTXISD::TexUnifiedCubeU32FloatLevel; 2866 2867 case Intrinsic::nvvm_tex_unified_cube_array_v4f32_f32: 2868 return NVPTXISD::TexUnifiedCubeArrayFloatFloat; 2869 case Intrinsic::nvvm_tex_unified_cube_array_level_v4f32_f32: 2870 return NVPTXISD::TexUnifiedCubeArrayFloatFloatLevel; 2871 case Intrinsic::nvvm_tex_unified_cube_array_v4s32_f32: 2872 return NVPTXISD::TexUnifiedCubeArrayS32Float; 2873 case Intrinsic::nvvm_tex_unified_cube_array_level_v4s32_f32: 2874 return NVPTXISD::TexUnifiedCubeArrayS32FloatLevel; 2875 case Intrinsic::nvvm_tex_unified_cube_array_v4u32_f32: 2876 return NVPTXISD::TexUnifiedCubeArrayU32Float; 2877 case Intrinsic::nvvm_tex_unified_cube_array_level_v4u32_f32: 2878 return NVPTXISD::TexUnifiedCubeArrayU32FloatLevel; 2879 2880 case Intrinsic::nvvm_tld4_unified_r_2d_v4f32_f32: 2881 return NVPTXISD::Tld4UnifiedR2DFloatFloat; 2882 case Intrinsic::nvvm_tld4_unified_g_2d_v4f32_f32: 2883 return NVPTXISD::Tld4UnifiedG2DFloatFloat; 2884 case Intrinsic::nvvm_tld4_unified_b_2d_v4f32_f32: 2885 return NVPTXISD::Tld4UnifiedB2DFloatFloat; 2886 case Intrinsic::nvvm_tld4_unified_a_2d_v4f32_f32: 2887 return NVPTXISD::Tld4UnifiedA2DFloatFloat; 2888 case Intrinsic::nvvm_tld4_unified_r_2d_v4s32_f32: 2889 return NVPTXISD::Tld4UnifiedR2DS64Float; 2890 case Intrinsic::nvvm_tld4_unified_g_2d_v4s32_f32: 2891 return NVPTXISD::Tld4UnifiedG2DS64Float; 2892 case Intrinsic::nvvm_tld4_unified_b_2d_v4s32_f32: 2893 return NVPTXISD::Tld4UnifiedB2DS64Float; 2894 case Intrinsic::nvvm_tld4_unified_a_2d_v4s32_f32: 2895 return NVPTXISD::Tld4UnifiedA2DS64Float; 2896 case Intrinsic::nvvm_tld4_unified_r_2d_v4u32_f32: 2897 return NVPTXISD::Tld4UnifiedR2DU64Float; 2898 case Intrinsic::nvvm_tld4_unified_g_2d_v4u32_f32: 2899 return NVPTXISD::Tld4UnifiedG2DU64Float; 2900 case Intrinsic::nvvm_tld4_unified_b_2d_v4u32_f32: 2901 return NVPTXISD::Tld4UnifiedB2DU64Float; 2902 case Intrinsic::nvvm_tld4_unified_a_2d_v4u32_f32: 2903 return NVPTXISD::Tld4UnifiedA2DU64Float; 2904 } 2905 } 2906 2907 static unsigned getOpcForSurfaceInstr(unsigned Intrinsic) { 2908 switch (Intrinsic) { 2909 default: 2910 return 0; 2911 case Intrinsic::nvvm_suld_1d_i8_clamp: 2912 return NVPTXISD::Suld1DI8Clamp; 2913 case Intrinsic::nvvm_suld_1d_i16_clamp: 2914 return NVPTXISD::Suld1DI16Clamp; 2915 case Intrinsic::nvvm_suld_1d_i32_clamp: 2916 return NVPTXISD::Suld1DI32Clamp; 2917 case Intrinsic::nvvm_suld_1d_i64_clamp: 2918 return NVPTXISD::Suld1DI64Clamp; 2919 case Intrinsic::nvvm_suld_1d_v2i8_clamp: 2920 return NVPTXISD::Suld1DV2I8Clamp; 2921 case Intrinsic::nvvm_suld_1d_v2i16_clamp: 2922 return NVPTXISD::Suld1DV2I16Clamp; 2923 case Intrinsic::nvvm_suld_1d_v2i32_clamp: 2924 return NVPTXISD::Suld1DV2I32Clamp; 2925 case Intrinsic::nvvm_suld_1d_v2i64_clamp: 2926 return NVPTXISD::Suld1DV2I64Clamp; 2927 case Intrinsic::nvvm_suld_1d_v4i8_clamp: 2928 return NVPTXISD::Suld1DV4I8Clamp; 2929 case Intrinsic::nvvm_suld_1d_v4i16_clamp: 2930 return NVPTXISD::Suld1DV4I16Clamp; 2931 case Intrinsic::nvvm_suld_1d_v4i32_clamp: 2932 return NVPTXISD::Suld1DV4I32Clamp; 2933 case Intrinsic::nvvm_suld_1d_array_i8_clamp: 2934 return NVPTXISD::Suld1DArrayI8Clamp; 2935 case Intrinsic::nvvm_suld_1d_array_i16_clamp: 2936 return NVPTXISD::Suld1DArrayI16Clamp; 2937 case Intrinsic::nvvm_suld_1d_array_i32_clamp: 2938 return NVPTXISD::Suld1DArrayI32Clamp; 2939 case Intrinsic::nvvm_suld_1d_array_i64_clamp: 2940 return NVPTXISD::Suld1DArrayI64Clamp; 2941 case Intrinsic::nvvm_suld_1d_array_v2i8_clamp: 2942 return NVPTXISD::Suld1DArrayV2I8Clamp; 2943 case Intrinsic::nvvm_suld_1d_array_v2i16_clamp: 2944 return NVPTXISD::Suld1DArrayV2I16Clamp; 2945 case Intrinsic::nvvm_suld_1d_array_v2i32_clamp: 2946 return NVPTXISD::Suld1DArrayV2I32Clamp; 2947 case Intrinsic::nvvm_suld_1d_array_v2i64_clamp: 2948 return NVPTXISD::Suld1DArrayV2I64Clamp; 2949 case Intrinsic::nvvm_suld_1d_array_v4i8_clamp: 2950 return NVPTXISD::Suld1DArrayV4I8Clamp; 2951 case Intrinsic::nvvm_suld_1d_array_v4i16_clamp: 2952 return NVPTXISD::Suld1DArrayV4I16Clamp; 2953 case Intrinsic::nvvm_suld_1d_array_v4i32_clamp: 2954 return NVPTXISD::Suld1DArrayV4I32Clamp; 2955 case Intrinsic::nvvm_suld_2d_i8_clamp: 2956 return NVPTXISD::Suld2DI8Clamp; 2957 case Intrinsic::nvvm_suld_2d_i16_clamp: 2958 return NVPTXISD::Suld2DI16Clamp; 2959 case Intrinsic::nvvm_suld_2d_i32_clamp: 2960 return NVPTXISD::Suld2DI32Clamp; 2961 case Intrinsic::nvvm_suld_2d_i64_clamp: 2962 return NVPTXISD::Suld2DI64Clamp; 2963 case Intrinsic::nvvm_suld_2d_v2i8_clamp: 2964 return NVPTXISD::Suld2DV2I8Clamp; 2965 case Intrinsic::nvvm_suld_2d_v2i16_clamp: 2966 return NVPTXISD::Suld2DV2I16Clamp; 2967 case Intrinsic::nvvm_suld_2d_v2i32_clamp: 2968 return NVPTXISD::Suld2DV2I32Clamp; 2969 case Intrinsic::nvvm_suld_2d_v2i64_clamp: 2970 return NVPTXISD::Suld2DV2I64Clamp; 2971 case Intrinsic::nvvm_suld_2d_v4i8_clamp: 2972 return NVPTXISD::Suld2DV4I8Clamp; 2973 case Intrinsic::nvvm_suld_2d_v4i16_clamp: 2974 return NVPTXISD::Suld2DV4I16Clamp; 2975 case Intrinsic::nvvm_suld_2d_v4i32_clamp: 2976 return NVPTXISD::Suld2DV4I32Clamp; 2977 case Intrinsic::nvvm_suld_2d_array_i8_clamp: 2978 return NVPTXISD::Suld2DArrayI8Clamp; 2979 case Intrinsic::nvvm_suld_2d_array_i16_clamp: 2980 return NVPTXISD::Suld2DArrayI16Clamp; 2981 case Intrinsic::nvvm_suld_2d_array_i32_clamp: 2982 return NVPTXISD::Suld2DArrayI32Clamp; 2983 case Intrinsic::nvvm_suld_2d_array_i64_clamp: 2984 return NVPTXISD::Suld2DArrayI64Clamp; 2985 case Intrinsic::nvvm_suld_2d_array_v2i8_clamp: 2986 return NVPTXISD::Suld2DArrayV2I8Clamp; 2987 case Intrinsic::nvvm_suld_2d_array_v2i16_clamp: 2988 return NVPTXISD::Suld2DArrayV2I16Clamp; 2989 case Intrinsic::nvvm_suld_2d_array_v2i32_clamp: 2990 return NVPTXISD::Suld2DArrayV2I32Clamp; 2991 case Intrinsic::nvvm_suld_2d_array_v2i64_clamp: 2992 return NVPTXISD::Suld2DArrayV2I64Clamp; 2993 case Intrinsic::nvvm_suld_2d_array_v4i8_clamp: 2994 return NVPTXISD::Suld2DArrayV4I8Clamp; 2995 case Intrinsic::nvvm_suld_2d_array_v4i16_clamp: 2996 return NVPTXISD::Suld2DArrayV4I16Clamp; 2997 case Intrinsic::nvvm_suld_2d_array_v4i32_clamp: 2998 return NVPTXISD::Suld2DArrayV4I32Clamp; 2999 case Intrinsic::nvvm_suld_3d_i8_clamp: 3000 return NVPTXISD::Suld3DI8Clamp; 3001 case Intrinsic::nvvm_suld_3d_i16_clamp: 3002 return NVPTXISD::Suld3DI16Clamp; 3003 case Intrinsic::nvvm_suld_3d_i32_clamp: 3004 return NVPTXISD::Suld3DI32Clamp; 3005 case Intrinsic::nvvm_suld_3d_i64_clamp: 3006 return NVPTXISD::Suld3DI64Clamp; 3007 case Intrinsic::nvvm_suld_3d_v2i8_clamp: 3008 return NVPTXISD::Suld3DV2I8Clamp; 3009 case Intrinsic::nvvm_suld_3d_v2i16_clamp: 3010 return NVPTXISD::Suld3DV2I16Clamp; 3011 case Intrinsic::nvvm_suld_3d_v2i32_clamp: 3012 return NVPTXISD::Suld3DV2I32Clamp; 3013 case Intrinsic::nvvm_suld_3d_v2i64_clamp: 3014 return NVPTXISD::Suld3DV2I64Clamp; 3015 case Intrinsic::nvvm_suld_3d_v4i8_clamp: 3016 return NVPTXISD::Suld3DV4I8Clamp; 3017 case Intrinsic::nvvm_suld_3d_v4i16_clamp: 3018 return NVPTXISD::Suld3DV4I16Clamp; 3019 case Intrinsic::nvvm_suld_3d_v4i32_clamp: 3020 return NVPTXISD::Suld3DV4I32Clamp; 3021 case Intrinsic::nvvm_suld_1d_i8_trap: 3022 return NVPTXISD::Suld1DI8Trap; 3023 case Intrinsic::nvvm_suld_1d_i16_trap: 3024 return NVPTXISD::Suld1DI16Trap; 3025 case Intrinsic::nvvm_suld_1d_i32_trap: 3026 return NVPTXISD::Suld1DI32Trap; 3027 case Intrinsic::nvvm_suld_1d_i64_trap: 3028 return NVPTXISD::Suld1DI64Trap; 3029 case Intrinsic::nvvm_suld_1d_v2i8_trap: 3030 return NVPTXISD::Suld1DV2I8Trap; 3031 case Intrinsic::nvvm_suld_1d_v2i16_trap: 3032 return NVPTXISD::Suld1DV2I16Trap; 3033 case Intrinsic::nvvm_suld_1d_v2i32_trap: 3034 return NVPTXISD::Suld1DV2I32Trap; 3035 case Intrinsic::nvvm_suld_1d_v2i64_trap: 3036 return NVPTXISD::Suld1DV2I64Trap; 3037 case Intrinsic::nvvm_suld_1d_v4i8_trap: 3038 return NVPTXISD::Suld1DV4I8Trap; 3039 case Intrinsic::nvvm_suld_1d_v4i16_trap: 3040 return NVPTXISD::Suld1DV4I16Trap; 3041 case Intrinsic::nvvm_suld_1d_v4i32_trap: 3042 return NVPTXISD::Suld1DV4I32Trap; 3043 case Intrinsic::nvvm_suld_1d_array_i8_trap: 3044 return NVPTXISD::Suld1DArrayI8Trap; 3045 case Intrinsic::nvvm_suld_1d_array_i16_trap: 3046 return NVPTXISD::Suld1DArrayI16Trap; 3047 case Intrinsic::nvvm_suld_1d_array_i32_trap: 3048 return NVPTXISD::Suld1DArrayI32Trap; 3049 case Intrinsic::nvvm_suld_1d_array_i64_trap: 3050 return NVPTXISD::Suld1DArrayI64Trap; 3051 case Intrinsic::nvvm_suld_1d_array_v2i8_trap: 3052 return NVPTXISD::Suld1DArrayV2I8Trap; 3053 case Intrinsic::nvvm_suld_1d_array_v2i16_trap: 3054 return NVPTXISD::Suld1DArrayV2I16Trap; 3055 case Intrinsic::nvvm_suld_1d_array_v2i32_trap: 3056 return NVPTXISD::Suld1DArrayV2I32Trap; 3057 case Intrinsic::nvvm_suld_1d_array_v2i64_trap: 3058 return NVPTXISD::Suld1DArrayV2I64Trap; 3059 case Intrinsic::nvvm_suld_1d_array_v4i8_trap: 3060 return NVPTXISD::Suld1DArrayV4I8Trap; 3061 case Intrinsic::nvvm_suld_1d_array_v4i16_trap: 3062 return NVPTXISD::Suld1DArrayV4I16Trap; 3063 case Intrinsic::nvvm_suld_1d_array_v4i32_trap: 3064 return NVPTXISD::Suld1DArrayV4I32Trap; 3065 case Intrinsic::nvvm_suld_2d_i8_trap: 3066 return NVPTXISD::Suld2DI8Trap; 3067 case Intrinsic::nvvm_suld_2d_i16_trap: 3068 return NVPTXISD::Suld2DI16Trap; 3069 case Intrinsic::nvvm_suld_2d_i32_trap: 3070 return NVPTXISD::Suld2DI32Trap; 3071 case Intrinsic::nvvm_suld_2d_i64_trap: 3072 return NVPTXISD::Suld2DI64Trap; 3073 case Intrinsic::nvvm_suld_2d_v2i8_trap: 3074 return NVPTXISD::Suld2DV2I8Trap; 3075 case Intrinsic::nvvm_suld_2d_v2i16_trap: 3076 return NVPTXISD::Suld2DV2I16Trap; 3077 case Intrinsic::nvvm_suld_2d_v2i32_trap: 3078 return NVPTXISD::Suld2DV2I32Trap; 3079 case Intrinsic::nvvm_suld_2d_v2i64_trap: 3080 return NVPTXISD::Suld2DV2I64Trap; 3081 case Intrinsic::nvvm_suld_2d_v4i8_trap: 3082 return NVPTXISD::Suld2DV4I8Trap; 3083 case Intrinsic::nvvm_suld_2d_v4i16_trap: 3084 return NVPTXISD::Suld2DV4I16Trap; 3085 case Intrinsic::nvvm_suld_2d_v4i32_trap: 3086 return NVPTXISD::Suld2DV4I32Trap; 3087 case Intrinsic::nvvm_suld_2d_array_i8_trap: 3088 return NVPTXISD::Suld2DArrayI8Trap; 3089 case Intrinsic::nvvm_suld_2d_array_i16_trap: 3090 return NVPTXISD::Suld2DArrayI16Trap; 3091 case Intrinsic::nvvm_suld_2d_array_i32_trap: 3092 return NVPTXISD::Suld2DArrayI32Trap; 3093 case Intrinsic::nvvm_suld_2d_array_i64_trap: 3094 return NVPTXISD::Suld2DArrayI64Trap; 3095 case Intrinsic::nvvm_suld_2d_array_v2i8_trap: 3096 return NVPTXISD::Suld2DArrayV2I8Trap; 3097 case Intrinsic::nvvm_suld_2d_array_v2i16_trap: 3098 return NVPTXISD::Suld2DArrayV2I16Trap; 3099 case Intrinsic::nvvm_suld_2d_array_v2i32_trap: 3100 return NVPTXISD::Suld2DArrayV2I32Trap; 3101 case Intrinsic::nvvm_suld_2d_array_v2i64_trap: 3102 return NVPTXISD::Suld2DArrayV2I64Trap; 3103 case Intrinsic::nvvm_suld_2d_array_v4i8_trap: 3104 return NVPTXISD::Suld2DArrayV4I8Trap; 3105 case Intrinsic::nvvm_suld_2d_array_v4i16_trap: 3106 return NVPTXISD::Suld2DArrayV4I16Trap; 3107 case Intrinsic::nvvm_suld_2d_array_v4i32_trap: 3108 return NVPTXISD::Suld2DArrayV4I32Trap; 3109 case Intrinsic::nvvm_suld_3d_i8_trap: 3110 return NVPTXISD::Suld3DI8Trap; 3111 case Intrinsic::nvvm_suld_3d_i16_trap: 3112 return NVPTXISD::Suld3DI16Trap; 3113 case Intrinsic::nvvm_suld_3d_i32_trap: 3114 return NVPTXISD::Suld3DI32Trap; 3115 case Intrinsic::nvvm_suld_3d_i64_trap: 3116 return NVPTXISD::Suld3DI64Trap; 3117 case Intrinsic::nvvm_suld_3d_v2i8_trap: 3118 return NVPTXISD::Suld3DV2I8Trap; 3119 case Intrinsic::nvvm_suld_3d_v2i16_trap: 3120 return NVPTXISD::Suld3DV2I16Trap; 3121 case Intrinsic::nvvm_suld_3d_v2i32_trap: 3122 return NVPTXISD::Suld3DV2I32Trap; 3123 case Intrinsic::nvvm_suld_3d_v2i64_trap: 3124 return NVPTXISD::Suld3DV2I64Trap; 3125 case Intrinsic::nvvm_suld_3d_v4i8_trap: 3126 return NVPTXISD::Suld3DV4I8Trap; 3127 case Intrinsic::nvvm_suld_3d_v4i16_trap: 3128 return NVPTXISD::Suld3DV4I16Trap; 3129 case Intrinsic::nvvm_suld_3d_v4i32_trap: 3130 return NVPTXISD::Suld3DV4I32Trap; 3131 case Intrinsic::nvvm_suld_1d_i8_zero: 3132 return NVPTXISD::Suld1DI8Zero; 3133 case Intrinsic::nvvm_suld_1d_i16_zero: 3134 return NVPTXISD::Suld1DI16Zero; 3135 case Intrinsic::nvvm_suld_1d_i32_zero: 3136 return NVPTXISD::Suld1DI32Zero; 3137 case Intrinsic::nvvm_suld_1d_i64_zero: 3138 return NVPTXISD::Suld1DI64Zero; 3139 case Intrinsic::nvvm_suld_1d_v2i8_zero: 3140 return NVPTXISD::Suld1DV2I8Zero; 3141 case Intrinsic::nvvm_suld_1d_v2i16_zero: 3142 return NVPTXISD::Suld1DV2I16Zero; 3143 case Intrinsic::nvvm_suld_1d_v2i32_zero: 3144 return NVPTXISD::Suld1DV2I32Zero; 3145 case Intrinsic::nvvm_suld_1d_v2i64_zero: 3146 return NVPTXISD::Suld1DV2I64Zero; 3147 case Intrinsic::nvvm_suld_1d_v4i8_zero: 3148 return NVPTXISD::Suld1DV4I8Zero; 3149 case Intrinsic::nvvm_suld_1d_v4i16_zero: 3150 return NVPTXISD::Suld1DV4I16Zero; 3151 case Intrinsic::nvvm_suld_1d_v4i32_zero: 3152 return NVPTXISD::Suld1DV4I32Zero; 3153 case Intrinsic::nvvm_suld_1d_array_i8_zero: 3154 return NVPTXISD::Suld1DArrayI8Zero; 3155 case Intrinsic::nvvm_suld_1d_array_i16_zero: 3156 return NVPTXISD::Suld1DArrayI16Zero; 3157 case Intrinsic::nvvm_suld_1d_array_i32_zero: 3158 return NVPTXISD::Suld1DArrayI32Zero; 3159 case Intrinsic::nvvm_suld_1d_array_i64_zero: 3160 return NVPTXISD::Suld1DArrayI64Zero; 3161 case Intrinsic::nvvm_suld_1d_array_v2i8_zero: 3162 return NVPTXISD::Suld1DArrayV2I8Zero; 3163 case Intrinsic::nvvm_suld_1d_array_v2i16_zero: 3164 return NVPTXISD::Suld1DArrayV2I16Zero; 3165 case Intrinsic::nvvm_suld_1d_array_v2i32_zero: 3166 return NVPTXISD::Suld1DArrayV2I32Zero; 3167 case Intrinsic::nvvm_suld_1d_array_v2i64_zero: 3168 return NVPTXISD::Suld1DArrayV2I64Zero; 3169 case Intrinsic::nvvm_suld_1d_array_v4i8_zero: 3170 return NVPTXISD::Suld1DArrayV4I8Zero; 3171 case Intrinsic::nvvm_suld_1d_array_v4i16_zero: 3172 return NVPTXISD::Suld1DArrayV4I16Zero; 3173 case Intrinsic::nvvm_suld_1d_array_v4i32_zero: 3174 return NVPTXISD::Suld1DArrayV4I32Zero; 3175 case Intrinsic::nvvm_suld_2d_i8_zero: 3176 return NVPTXISD::Suld2DI8Zero; 3177 case Intrinsic::nvvm_suld_2d_i16_zero: 3178 return NVPTXISD::Suld2DI16Zero; 3179 case Intrinsic::nvvm_suld_2d_i32_zero: 3180 return NVPTXISD::Suld2DI32Zero; 3181 case Intrinsic::nvvm_suld_2d_i64_zero: 3182 return NVPTXISD::Suld2DI64Zero; 3183 case Intrinsic::nvvm_suld_2d_v2i8_zero: 3184 return NVPTXISD::Suld2DV2I8Zero; 3185 case Intrinsic::nvvm_suld_2d_v2i16_zero: 3186 return NVPTXISD::Suld2DV2I16Zero; 3187 case Intrinsic::nvvm_suld_2d_v2i32_zero: 3188 return NVPTXISD::Suld2DV2I32Zero; 3189 case Intrinsic::nvvm_suld_2d_v2i64_zero: 3190 return NVPTXISD::Suld2DV2I64Zero; 3191 case Intrinsic::nvvm_suld_2d_v4i8_zero: 3192 return NVPTXISD::Suld2DV4I8Zero; 3193 case Intrinsic::nvvm_suld_2d_v4i16_zero: 3194 return NVPTXISD::Suld2DV4I16Zero; 3195 case Intrinsic::nvvm_suld_2d_v4i32_zero: 3196 return NVPTXISD::Suld2DV4I32Zero; 3197 case Intrinsic::nvvm_suld_2d_array_i8_zero: 3198 return NVPTXISD::Suld2DArrayI8Zero; 3199 case Intrinsic::nvvm_suld_2d_array_i16_zero: 3200 return NVPTXISD::Suld2DArrayI16Zero; 3201 case Intrinsic::nvvm_suld_2d_array_i32_zero: 3202 return NVPTXISD::Suld2DArrayI32Zero; 3203 case Intrinsic::nvvm_suld_2d_array_i64_zero: 3204 return NVPTXISD::Suld2DArrayI64Zero; 3205 case Intrinsic::nvvm_suld_2d_array_v2i8_zero: 3206 return NVPTXISD::Suld2DArrayV2I8Zero; 3207 case Intrinsic::nvvm_suld_2d_array_v2i16_zero: 3208 return NVPTXISD::Suld2DArrayV2I16Zero; 3209 case Intrinsic::nvvm_suld_2d_array_v2i32_zero: 3210 return NVPTXISD::Suld2DArrayV2I32Zero; 3211 case Intrinsic::nvvm_suld_2d_array_v2i64_zero: 3212 return NVPTXISD::Suld2DArrayV2I64Zero; 3213 case Intrinsic::nvvm_suld_2d_array_v4i8_zero: 3214 return NVPTXISD::Suld2DArrayV4I8Zero; 3215 case Intrinsic::nvvm_suld_2d_array_v4i16_zero: 3216 return NVPTXISD::Suld2DArrayV4I16Zero; 3217 case Intrinsic::nvvm_suld_2d_array_v4i32_zero: 3218 return NVPTXISD::Suld2DArrayV4I32Zero; 3219 case Intrinsic::nvvm_suld_3d_i8_zero: 3220 return NVPTXISD::Suld3DI8Zero; 3221 case Intrinsic::nvvm_suld_3d_i16_zero: 3222 return NVPTXISD::Suld3DI16Zero; 3223 case Intrinsic::nvvm_suld_3d_i32_zero: 3224 return NVPTXISD::Suld3DI32Zero; 3225 case Intrinsic::nvvm_suld_3d_i64_zero: 3226 return NVPTXISD::Suld3DI64Zero; 3227 case Intrinsic::nvvm_suld_3d_v2i8_zero: 3228 return NVPTXISD::Suld3DV2I8Zero; 3229 case Intrinsic::nvvm_suld_3d_v2i16_zero: 3230 return NVPTXISD::Suld3DV2I16Zero; 3231 case Intrinsic::nvvm_suld_3d_v2i32_zero: 3232 return NVPTXISD::Suld3DV2I32Zero; 3233 case Intrinsic::nvvm_suld_3d_v2i64_zero: 3234 return NVPTXISD::Suld3DV2I64Zero; 3235 case Intrinsic::nvvm_suld_3d_v4i8_zero: 3236 return NVPTXISD::Suld3DV4I8Zero; 3237 case Intrinsic::nvvm_suld_3d_v4i16_zero: 3238 return NVPTXISD::Suld3DV4I16Zero; 3239 case Intrinsic::nvvm_suld_3d_v4i32_zero: 3240 return NVPTXISD::Suld3DV4I32Zero; 3241 } 3242 } 3243 3244 // llvm.ptx.memcpy.const and llvm.ptx.memmove.const need to be modeled as 3245 // TgtMemIntrinsic 3246 // because we need the information that is only available in the "Value" type 3247 // of destination 3248 // pointer. In particular, the address space information. 3249 bool NVPTXTargetLowering::getTgtMemIntrinsic( 3250 IntrinsicInfo &Info, const CallInst &I, unsigned Intrinsic) const { 3251 switch (Intrinsic) { 3252 default: 3253 return false; 3254 3255 case Intrinsic::nvvm_atomic_load_add_f32: 3256 Info.opc = ISD::INTRINSIC_W_CHAIN; 3257 Info.memVT = MVT::f32; 3258 Info.ptrVal = I.getArgOperand(0); 3259 Info.offset = 0; 3260 Info.vol = 0; 3261 Info.readMem = true; 3262 Info.writeMem = true; 3263 Info.align = 0; 3264 return true; 3265 3266 case Intrinsic::nvvm_atomic_load_inc_32: 3267 case Intrinsic::nvvm_atomic_load_dec_32: 3268 Info.opc = ISD::INTRINSIC_W_CHAIN; 3269 Info.memVT = MVT::i32; 3270 Info.ptrVal = I.getArgOperand(0); 3271 Info.offset = 0; 3272 Info.vol = 0; 3273 Info.readMem = true; 3274 Info.writeMem = true; 3275 Info.align = 0; 3276 return true; 3277 3278 case Intrinsic::nvvm_ldu_global_i: 3279 case Intrinsic::nvvm_ldu_global_f: 3280 case Intrinsic::nvvm_ldu_global_p: { 3281 auto &DL = I.getModule()->getDataLayout(); 3282 Info.opc = ISD::INTRINSIC_W_CHAIN; 3283 if (Intrinsic == Intrinsic::nvvm_ldu_global_i) 3284 Info.memVT = getValueType(DL, I.getType()); 3285 else if(Intrinsic == Intrinsic::nvvm_ldu_global_p) 3286 Info.memVT = getPointerTy(DL); 3287 else 3288 Info.memVT = getValueType(DL, I.getType()); 3289 Info.ptrVal = I.getArgOperand(0); 3290 Info.offset = 0; 3291 Info.vol = 0; 3292 Info.readMem = true; 3293 Info.writeMem = false; 3294 Info.align = cast<ConstantInt>(I.getArgOperand(1))->getZExtValue(); 3295 3296 return true; 3297 } 3298 case Intrinsic::nvvm_ldg_global_i: 3299 case Intrinsic::nvvm_ldg_global_f: 3300 case Intrinsic::nvvm_ldg_global_p: { 3301 auto &DL = I.getModule()->getDataLayout(); 3302 3303 Info.opc = ISD::INTRINSIC_W_CHAIN; 3304 if (Intrinsic == Intrinsic::nvvm_ldg_global_i) 3305 Info.memVT = getValueType(DL, I.getType()); 3306 else if(Intrinsic == Intrinsic::nvvm_ldg_global_p) 3307 Info.memVT = getPointerTy(DL); 3308 else 3309 Info.memVT = getValueType(DL, I.getType()); 3310 Info.ptrVal = I.getArgOperand(0); 3311 Info.offset = 0; 3312 Info.vol = 0; 3313 Info.readMem = true; 3314 Info.writeMem = false; 3315 Info.align = cast<ConstantInt>(I.getArgOperand(1))->getZExtValue(); 3316 3317 return true; 3318 } 3319 3320 case Intrinsic::nvvm_tex_1d_v4f32_s32: 3321 case Intrinsic::nvvm_tex_1d_v4f32_f32: 3322 case Intrinsic::nvvm_tex_1d_level_v4f32_f32: 3323 case Intrinsic::nvvm_tex_1d_grad_v4f32_f32: 3324 case Intrinsic::nvvm_tex_1d_array_v4f32_s32: 3325 case Intrinsic::nvvm_tex_1d_array_v4f32_f32: 3326 case Intrinsic::nvvm_tex_1d_array_level_v4f32_f32: 3327 case Intrinsic::nvvm_tex_1d_array_grad_v4f32_f32: 3328 case Intrinsic::nvvm_tex_2d_v4f32_s32: 3329 case Intrinsic::nvvm_tex_2d_v4f32_f32: 3330 case Intrinsic::nvvm_tex_2d_level_v4f32_f32: 3331 case Intrinsic::nvvm_tex_2d_grad_v4f32_f32: 3332 case Intrinsic::nvvm_tex_2d_array_v4f32_s32: 3333 case Intrinsic::nvvm_tex_2d_array_v4f32_f32: 3334 case Intrinsic::nvvm_tex_2d_array_level_v4f32_f32: 3335 case Intrinsic::nvvm_tex_2d_array_grad_v4f32_f32: 3336 case Intrinsic::nvvm_tex_3d_v4f32_s32: 3337 case Intrinsic::nvvm_tex_3d_v4f32_f32: 3338 case Intrinsic::nvvm_tex_3d_level_v4f32_f32: 3339 case Intrinsic::nvvm_tex_3d_grad_v4f32_f32: 3340 case Intrinsic::nvvm_tex_cube_v4f32_f32: 3341 case Intrinsic::nvvm_tex_cube_level_v4f32_f32: 3342 case Intrinsic::nvvm_tex_cube_array_v4f32_f32: 3343 case Intrinsic::nvvm_tex_cube_array_level_v4f32_f32: 3344 case Intrinsic::nvvm_tld4_r_2d_v4f32_f32: 3345 case Intrinsic::nvvm_tld4_g_2d_v4f32_f32: 3346 case Intrinsic::nvvm_tld4_b_2d_v4f32_f32: 3347 case Intrinsic::nvvm_tld4_a_2d_v4f32_f32: 3348 case Intrinsic::nvvm_tex_unified_1d_v4f32_s32: 3349 case Intrinsic::nvvm_tex_unified_1d_v4f32_f32: 3350 case Intrinsic::nvvm_tex_unified_1d_level_v4f32_f32: 3351 case Intrinsic::nvvm_tex_unified_1d_grad_v4f32_f32: 3352 case Intrinsic::nvvm_tex_unified_1d_array_v4f32_s32: 3353 case Intrinsic::nvvm_tex_unified_1d_array_v4f32_f32: 3354 case Intrinsic::nvvm_tex_unified_1d_array_level_v4f32_f32: 3355 case Intrinsic::nvvm_tex_unified_1d_array_grad_v4f32_f32: 3356 case Intrinsic::nvvm_tex_unified_2d_v4f32_s32: 3357 case Intrinsic::nvvm_tex_unified_2d_v4f32_f32: 3358 case Intrinsic::nvvm_tex_unified_2d_level_v4f32_f32: 3359 case Intrinsic::nvvm_tex_unified_2d_grad_v4f32_f32: 3360 case Intrinsic::nvvm_tex_unified_2d_array_v4f32_s32: 3361 case Intrinsic::nvvm_tex_unified_2d_array_v4f32_f32: 3362 case Intrinsic::nvvm_tex_unified_2d_array_level_v4f32_f32: 3363 case Intrinsic::nvvm_tex_unified_2d_array_grad_v4f32_f32: 3364 case Intrinsic::nvvm_tex_unified_3d_v4f32_s32: 3365 case Intrinsic::nvvm_tex_unified_3d_v4f32_f32: 3366 case Intrinsic::nvvm_tex_unified_3d_level_v4f32_f32: 3367 case Intrinsic::nvvm_tex_unified_3d_grad_v4f32_f32: 3368 case Intrinsic::nvvm_tex_unified_cube_v4f32_f32: 3369 case Intrinsic::nvvm_tex_unified_cube_level_v4f32_f32: 3370 case Intrinsic::nvvm_tex_unified_cube_array_v4f32_f32: 3371 case Intrinsic::nvvm_tex_unified_cube_array_level_v4f32_f32: 3372 case Intrinsic::nvvm_tld4_unified_r_2d_v4f32_f32: 3373 case Intrinsic::nvvm_tld4_unified_g_2d_v4f32_f32: 3374 case Intrinsic::nvvm_tld4_unified_b_2d_v4f32_f32: 3375 case Intrinsic::nvvm_tld4_unified_a_2d_v4f32_f32: { 3376 Info.opc = getOpcForTextureInstr(Intrinsic); 3377 Info.memVT = MVT::v4f32; 3378 Info.ptrVal = nullptr; 3379 Info.offset = 0; 3380 Info.vol = 0; 3381 Info.readMem = true; 3382 Info.writeMem = false; 3383 Info.align = 16; 3384 return true; 3385 } 3386 case Intrinsic::nvvm_tex_1d_v4s32_s32: 3387 case Intrinsic::nvvm_tex_1d_v4s32_f32: 3388 case Intrinsic::nvvm_tex_1d_level_v4s32_f32: 3389 case Intrinsic::nvvm_tex_1d_grad_v4s32_f32: 3390 case Intrinsic::nvvm_tex_1d_array_v4s32_s32: 3391 case Intrinsic::nvvm_tex_1d_array_v4s32_f32: 3392 case Intrinsic::nvvm_tex_1d_array_level_v4s32_f32: 3393 case Intrinsic::nvvm_tex_1d_array_grad_v4s32_f32: 3394 case Intrinsic::nvvm_tex_2d_v4s32_s32: 3395 case Intrinsic::nvvm_tex_2d_v4s32_f32: 3396 case Intrinsic::nvvm_tex_2d_level_v4s32_f32: 3397 case Intrinsic::nvvm_tex_2d_grad_v4s32_f32: 3398 case Intrinsic::nvvm_tex_2d_array_v4s32_s32: 3399 case Intrinsic::nvvm_tex_2d_array_v4s32_f32: 3400 case Intrinsic::nvvm_tex_2d_array_level_v4s32_f32: 3401 case Intrinsic::nvvm_tex_2d_array_grad_v4s32_f32: 3402 case Intrinsic::nvvm_tex_3d_v4s32_s32: 3403 case Intrinsic::nvvm_tex_3d_v4s32_f32: 3404 case Intrinsic::nvvm_tex_3d_level_v4s32_f32: 3405 case Intrinsic::nvvm_tex_3d_grad_v4s32_f32: 3406 case Intrinsic::nvvm_tex_cube_v4s32_f32: 3407 case Intrinsic::nvvm_tex_cube_level_v4s32_f32: 3408 case Intrinsic::nvvm_tex_cube_array_v4s32_f32: 3409 case Intrinsic::nvvm_tex_cube_array_level_v4s32_f32: 3410 case Intrinsic::nvvm_tex_cube_v4u32_f32: 3411 case Intrinsic::nvvm_tex_cube_level_v4u32_f32: 3412 case Intrinsic::nvvm_tex_cube_array_v4u32_f32: 3413 case Intrinsic::nvvm_tex_cube_array_level_v4u32_f32: 3414 case Intrinsic::nvvm_tex_1d_v4u32_s32: 3415 case Intrinsic::nvvm_tex_1d_v4u32_f32: 3416 case Intrinsic::nvvm_tex_1d_level_v4u32_f32: 3417 case Intrinsic::nvvm_tex_1d_grad_v4u32_f32: 3418 case Intrinsic::nvvm_tex_1d_array_v4u32_s32: 3419 case Intrinsic::nvvm_tex_1d_array_v4u32_f32: 3420 case Intrinsic::nvvm_tex_1d_array_level_v4u32_f32: 3421 case Intrinsic::nvvm_tex_1d_array_grad_v4u32_f32: 3422 case Intrinsic::nvvm_tex_2d_v4u32_s32: 3423 case Intrinsic::nvvm_tex_2d_v4u32_f32: 3424 case Intrinsic::nvvm_tex_2d_level_v4u32_f32: 3425 case Intrinsic::nvvm_tex_2d_grad_v4u32_f32: 3426 case Intrinsic::nvvm_tex_2d_array_v4u32_s32: 3427 case Intrinsic::nvvm_tex_2d_array_v4u32_f32: 3428 case Intrinsic::nvvm_tex_2d_array_level_v4u32_f32: 3429 case Intrinsic::nvvm_tex_2d_array_grad_v4u32_f32: 3430 case Intrinsic::nvvm_tex_3d_v4u32_s32: 3431 case Intrinsic::nvvm_tex_3d_v4u32_f32: 3432 case Intrinsic::nvvm_tex_3d_level_v4u32_f32: 3433 case Intrinsic::nvvm_tex_3d_grad_v4u32_f32: 3434 case Intrinsic::nvvm_tld4_r_2d_v4s32_f32: 3435 case Intrinsic::nvvm_tld4_g_2d_v4s32_f32: 3436 case Intrinsic::nvvm_tld4_b_2d_v4s32_f32: 3437 case Intrinsic::nvvm_tld4_a_2d_v4s32_f32: 3438 case Intrinsic::nvvm_tld4_r_2d_v4u32_f32: 3439 case Intrinsic::nvvm_tld4_g_2d_v4u32_f32: 3440 case Intrinsic::nvvm_tld4_b_2d_v4u32_f32: 3441 case Intrinsic::nvvm_tld4_a_2d_v4u32_f32: 3442 case Intrinsic::nvvm_tex_unified_1d_v4s32_s32: 3443 case Intrinsic::nvvm_tex_unified_1d_v4s32_f32: 3444 case Intrinsic::nvvm_tex_unified_1d_level_v4s32_f32: 3445 case Intrinsic::nvvm_tex_unified_1d_grad_v4s32_f32: 3446 case Intrinsic::nvvm_tex_unified_1d_array_v4s32_s32: 3447 case Intrinsic::nvvm_tex_unified_1d_array_v4s32_f32: 3448 case Intrinsic::nvvm_tex_unified_1d_array_level_v4s32_f32: 3449 case Intrinsic::nvvm_tex_unified_1d_array_grad_v4s32_f32: 3450 case Intrinsic::nvvm_tex_unified_2d_v4s32_s32: 3451 case Intrinsic::nvvm_tex_unified_2d_v4s32_f32: 3452 case Intrinsic::nvvm_tex_unified_2d_level_v4s32_f32: 3453 case Intrinsic::nvvm_tex_unified_2d_grad_v4s32_f32: 3454 case Intrinsic::nvvm_tex_unified_2d_array_v4s32_s32: 3455 case Intrinsic::nvvm_tex_unified_2d_array_v4s32_f32: 3456 case Intrinsic::nvvm_tex_unified_2d_array_level_v4s32_f32: 3457 case Intrinsic::nvvm_tex_unified_2d_array_grad_v4s32_f32: 3458 case Intrinsic::nvvm_tex_unified_3d_v4s32_s32: 3459 case Intrinsic::nvvm_tex_unified_3d_v4s32_f32: 3460 case Intrinsic::nvvm_tex_unified_3d_level_v4s32_f32: 3461 case Intrinsic::nvvm_tex_unified_3d_grad_v4s32_f32: 3462 case Intrinsic::nvvm_tex_unified_1d_v4u32_s32: 3463 case Intrinsic::nvvm_tex_unified_1d_v4u32_f32: 3464 case Intrinsic::nvvm_tex_unified_1d_level_v4u32_f32: 3465 case Intrinsic::nvvm_tex_unified_1d_grad_v4u32_f32: 3466 case Intrinsic::nvvm_tex_unified_1d_array_v4u32_s32: 3467 case Intrinsic::nvvm_tex_unified_1d_array_v4u32_f32: 3468 case Intrinsic::nvvm_tex_unified_1d_array_level_v4u32_f32: 3469 case Intrinsic::nvvm_tex_unified_1d_array_grad_v4u32_f32: 3470 case Intrinsic::nvvm_tex_unified_2d_v4u32_s32: 3471 case Intrinsic::nvvm_tex_unified_2d_v4u32_f32: 3472 case Intrinsic::nvvm_tex_unified_2d_level_v4u32_f32: 3473 case Intrinsic::nvvm_tex_unified_2d_grad_v4u32_f32: 3474 case Intrinsic::nvvm_tex_unified_2d_array_v4u32_s32: 3475 case Intrinsic::nvvm_tex_unified_2d_array_v4u32_f32: 3476 case Intrinsic::nvvm_tex_unified_2d_array_level_v4u32_f32: 3477 case Intrinsic::nvvm_tex_unified_2d_array_grad_v4u32_f32: 3478 case Intrinsic::nvvm_tex_unified_3d_v4u32_s32: 3479 case Intrinsic::nvvm_tex_unified_3d_v4u32_f32: 3480 case Intrinsic::nvvm_tex_unified_3d_level_v4u32_f32: 3481 case Intrinsic::nvvm_tex_unified_3d_grad_v4u32_f32: 3482 case Intrinsic::nvvm_tex_unified_cube_v4s32_f32: 3483 case Intrinsic::nvvm_tex_unified_cube_level_v4s32_f32: 3484 case Intrinsic::nvvm_tex_unified_cube_array_v4s32_f32: 3485 case Intrinsic::nvvm_tex_unified_cube_array_level_v4s32_f32: 3486 case Intrinsic::nvvm_tex_unified_cube_v4u32_f32: 3487 case Intrinsic::nvvm_tex_unified_cube_level_v4u32_f32: 3488 case Intrinsic::nvvm_tex_unified_cube_array_v4u32_f32: 3489 case Intrinsic::nvvm_tex_unified_cube_array_level_v4u32_f32: 3490 case Intrinsic::nvvm_tld4_unified_r_2d_v4s32_f32: 3491 case Intrinsic::nvvm_tld4_unified_g_2d_v4s32_f32: 3492 case Intrinsic::nvvm_tld4_unified_b_2d_v4s32_f32: 3493 case Intrinsic::nvvm_tld4_unified_a_2d_v4s32_f32: 3494 case Intrinsic::nvvm_tld4_unified_r_2d_v4u32_f32: 3495 case Intrinsic::nvvm_tld4_unified_g_2d_v4u32_f32: 3496 case Intrinsic::nvvm_tld4_unified_b_2d_v4u32_f32: 3497 case Intrinsic::nvvm_tld4_unified_a_2d_v4u32_f32: { 3498 Info.opc = getOpcForTextureInstr(Intrinsic); 3499 Info.memVT = MVT::v4i32; 3500 Info.ptrVal = nullptr; 3501 Info.offset = 0; 3502 Info.vol = 0; 3503 Info.readMem = true; 3504 Info.writeMem = false; 3505 Info.align = 16; 3506 return true; 3507 } 3508 case Intrinsic::nvvm_suld_1d_i8_clamp: 3509 case Intrinsic::nvvm_suld_1d_v2i8_clamp: 3510 case Intrinsic::nvvm_suld_1d_v4i8_clamp: 3511 case Intrinsic::nvvm_suld_1d_array_i8_clamp: 3512 case Intrinsic::nvvm_suld_1d_array_v2i8_clamp: 3513 case Intrinsic::nvvm_suld_1d_array_v4i8_clamp: 3514 case Intrinsic::nvvm_suld_2d_i8_clamp: 3515 case Intrinsic::nvvm_suld_2d_v2i8_clamp: 3516 case Intrinsic::nvvm_suld_2d_v4i8_clamp: 3517 case Intrinsic::nvvm_suld_2d_array_i8_clamp: 3518 case Intrinsic::nvvm_suld_2d_array_v2i8_clamp: 3519 case Intrinsic::nvvm_suld_2d_array_v4i8_clamp: 3520 case Intrinsic::nvvm_suld_3d_i8_clamp: 3521 case Intrinsic::nvvm_suld_3d_v2i8_clamp: 3522 case Intrinsic::nvvm_suld_3d_v4i8_clamp: 3523 case Intrinsic::nvvm_suld_1d_i8_trap: 3524 case Intrinsic::nvvm_suld_1d_v2i8_trap: 3525 case Intrinsic::nvvm_suld_1d_v4i8_trap: 3526 case Intrinsic::nvvm_suld_1d_array_i8_trap: 3527 case Intrinsic::nvvm_suld_1d_array_v2i8_trap: 3528 case Intrinsic::nvvm_suld_1d_array_v4i8_trap: 3529 case Intrinsic::nvvm_suld_2d_i8_trap: 3530 case Intrinsic::nvvm_suld_2d_v2i8_trap: 3531 case Intrinsic::nvvm_suld_2d_v4i8_trap: 3532 case Intrinsic::nvvm_suld_2d_array_i8_trap: 3533 case Intrinsic::nvvm_suld_2d_array_v2i8_trap: 3534 case Intrinsic::nvvm_suld_2d_array_v4i8_trap: 3535 case Intrinsic::nvvm_suld_3d_i8_trap: 3536 case Intrinsic::nvvm_suld_3d_v2i8_trap: 3537 case Intrinsic::nvvm_suld_3d_v4i8_trap: 3538 case Intrinsic::nvvm_suld_1d_i8_zero: 3539 case Intrinsic::nvvm_suld_1d_v2i8_zero: 3540 case Intrinsic::nvvm_suld_1d_v4i8_zero: 3541 case Intrinsic::nvvm_suld_1d_array_i8_zero: 3542 case Intrinsic::nvvm_suld_1d_array_v2i8_zero: 3543 case Intrinsic::nvvm_suld_1d_array_v4i8_zero: 3544 case Intrinsic::nvvm_suld_2d_i8_zero: 3545 case Intrinsic::nvvm_suld_2d_v2i8_zero: 3546 case Intrinsic::nvvm_suld_2d_v4i8_zero: 3547 case Intrinsic::nvvm_suld_2d_array_i8_zero: 3548 case Intrinsic::nvvm_suld_2d_array_v2i8_zero: 3549 case Intrinsic::nvvm_suld_2d_array_v4i8_zero: 3550 case Intrinsic::nvvm_suld_3d_i8_zero: 3551 case Intrinsic::nvvm_suld_3d_v2i8_zero: 3552 case Intrinsic::nvvm_suld_3d_v4i8_zero: { 3553 Info.opc = getOpcForSurfaceInstr(Intrinsic); 3554 Info.memVT = MVT::i8; 3555 Info.ptrVal = nullptr; 3556 Info.offset = 0; 3557 Info.vol = 0; 3558 Info.readMem = true; 3559 Info.writeMem = false; 3560 Info.align = 16; 3561 return true; 3562 } 3563 case Intrinsic::nvvm_suld_1d_i16_clamp: 3564 case Intrinsic::nvvm_suld_1d_v2i16_clamp: 3565 case Intrinsic::nvvm_suld_1d_v4i16_clamp: 3566 case Intrinsic::nvvm_suld_1d_array_i16_clamp: 3567 case Intrinsic::nvvm_suld_1d_array_v2i16_clamp: 3568 case Intrinsic::nvvm_suld_1d_array_v4i16_clamp: 3569 case Intrinsic::nvvm_suld_2d_i16_clamp: 3570 case Intrinsic::nvvm_suld_2d_v2i16_clamp: 3571 case Intrinsic::nvvm_suld_2d_v4i16_clamp: 3572 case Intrinsic::nvvm_suld_2d_array_i16_clamp: 3573 case Intrinsic::nvvm_suld_2d_array_v2i16_clamp: 3574 case Intrinsic::nvvm_suld_2d_array_v4i16_clamp: 3575 case Intrinsic::nvvm_suld_3d_i16_clamp: 3576 case Intrinsic::nvvm_suld_3d_v2i16_clamp: 3577 case Intrinsic::nvvm_suld_3d_v4i16_clamp: 3578 case Intrinsic::nvvm_suld_1d_i16_trap: 3579 case Intrinsic::nvvm_suld_1d_v2i16_trap: 3580 case Intrinsic::nvvm_suld_1d_v4i16_trap: 3581 case Intrinsic::nvvm_suld_1d_array_i16_trap: 3582 case Intrinsic::nvvm_suld_1d_array_v2i16_trap: 3583 case Intrinsic::nvvm_suld_1d_array_v4i16_trap: 3584 case Intrinsic::nvvm_suld_2d_i16_trap: 3585 case Intrinsic::nvvm_suld_2d_v2i16_trap: 3586 case Intrinsic::nvvm_suld_2d_v4i16_trap: 3587 case Intrinsic::nvvm_suld_2d_array_i16_trap: 3588 case Intrinsic::nvvm_suld_2d_array_v2i16_trap: 3589 case Intrinsic::nvvm_suld_2d_array_v4i16_trap: 3590 case Intrinsic::nvvm_suld_3d_i16_trap: 3591 case Intrinsic::nvvm_suld_3d_v2i16_trap: 3592 case Intrinsic::nvvm_suld_3d_v4i16_trap: 3593 case Intrinsic::nvvm_suld_1d_i16_zero: 3594 case Intrinsic::nvvm_suld_1d_v2i16_zero: 3595 case Intrinsic::nvvm_suld_1d_v4i16_zero: 3596 case Intrinsic::nvvm_suld_1d_array_i16_zero: 3597 case Intrinsic::nvvm_suld_1d_array_v2i16_zero: 3598 case Intrinsic::nvvm_suld_1d_array_v4i16_zero: 3599 case Intrinsic::nvvm_suld_2d_i16_zero: 3600 case Intrinsic::nvvm_suld_2d_v2i16_zero: 3601 case Intrinsic::nvvm_suld_2d_v4i16_zero: 3602 case Intrinsic::nvvm_suld_2d_array_i16_zero: 3603 case Intrinsic::nvvm_suld_2d_array_v2i16_zero: 3604 case Intrinsic::nvvm_suld_2d_array_v4i16_zero: 3605 case Intrinsic::nvvm_suld_3d_i16_zero: 3606 case Intrinsic::nvvm_suld_3d_v2i16_zero: 3607 case Intrinsic::nvvm_suld_3d_v4i16_zero: { 3608 Info.opc = getOpcForSurfaceInstr(Intrinsic); 3609 Info.memVT = MVT::i16; 3610 Info.ptrVal = nullptr; 3611 Info.offset = 0; 3612 Info.vol = 0; 3613 Info.readMem = true; 3614 Info.writeMem = false; 3615 Info.align = 16; 3616 return true; 3617 } 3618 case Intrinsic::nvvm_suld_1d_i32_clamp: 3619 case Intrinsic::nvvm_suld_1d_v2i32_clamp: 3620 case Intrinsic::nvvm_suld_1d_v4i32_clamp: 3621 case Intrinsic::nvvm_suld_1d_array_i32_clamp: 3622 case Intrinsic::nvvm_suld_1d_array_v2i32_clamp: 3623 case Intrinsic::nvvm_suld_1d_array_v4i32_clamp: 3624 case Intrinsic::nvvm_suld_2d_i32_clamp: 3625 case Intrinsic::nvvm_suld_2d_v2i32_clamp: 3626 case Intrinsic::nvvm_suld_2d_v4i32_clamp: 3627 case Intrinsic::nvvm_suld_2d_array_i32_clamp: 3628 case Intrinsic::nvvm_suld_2d_array_v2i32_clamp: 3629 case Intrinsic::nvvm_suld_2d_array_v4i32_clamp: 3630 case Intrinsic::nvvm_suld_3d_i32_clamp: 3631 case Intrinsic::nvvm_suld_3d_v2i32_clamp: 3632 case Intrinsic::nvvm_suld_3d_v4i32_clamp: 3633 case Intrinsic::nvvm_suld_1d_i32_trap: 3634 case Intrinsic::nvvm_suld_1d_v2i32_trap: 3635 case Intrinsic::nvvm_suld_1d_v4i32_trap: 3636 case Intrinsic::nvvm_suld_1d_array_i32_trap: 3637 case Intrinsic::nvvm_suld_1d_array_v2i32_trap: 3638 case Intrinsic::nvvm_suld_1d_array_v4i32_trap: 3639 case Intrinsic::nvvm_suld_2d_i32_trap: 3640 case Intrinsic::nvvm_suld_2d_v2i32_trap: 3641 case Intrinsic::nvvm_suld_2d_v4i32_trap: 3642 case Intrinsic::nvvm_suld_2d_array_i32_trap: 3643 case Intrinsic::nvvm_suld_2d_array_v2i32_trap: 3644 case Intrinsic::nvvm_suld_2d_array_v4i32_trap: 3645 case Intrinsic::nvvm_suld_3d_i32_trap: 3646 case Intrinsic::nvvm_suld_3d_v2i32_trap: 3647 case Intrinsic::nvvm_suld_3d_v4i32_trap: 3648 case Intrinsic::nvvm_suld_1d_i32_zero: 3649 case Intrinsic::nvvm_suld_1d_v2i32_zero: 3650 case Intrinsic::nvvm_suld_1d_v4i32_zero: 3651 case Intrinsic::nvvm_suld_1d_array_i32_zero: 3652 case Intrinsic::nvvm_suld_1d_array_v2i32_zero: 3653 case Intrinsic::nvvm_suld_1d_array_v4i32_zero: 3654 case Intrinsic::nvvm_suld_2d_i32_zero: 3655 case Intrinsic::nvvm_suld_2d_v2i32_zero: 3656 case Intrinsic::nvvm_suld_2d_v4i32_zero: 3657 case Intrinsic::nvvm_suld_2d_array_i32_zero: 3658 case Intrinsic::nvvm_suld_2d_array_v2i32_zero: 3659 case Intrinsic::nvvm_suld_2d_array_v4i32_zero: 3660 case Intrinsic::nvvm_suld_3d_i32_zero: 3661 case Intrinsic::nvvm_suld_3d_v2i32_zero: 3662 case Intrinsic::nvvm_suld_3d_v4i32_zero: { 3663 Info.opc = getOpcForSurfaceInstr(Intrinsic); 3664 Info.memVT = MVT::i32; 3665 Info.ptrVal = nullptr; 3666 Info.offset = 0; 3667 Info.vol = 0; 3668 Info.readMem = true; 3669 Info.writeMem = false; 3670 Info.align = 16; 3671 return true; 3672 } 3673 case Intrinsic::nvvm_suld_1d_i64_clamp: 3674 case Intrinsic::nvvm_suld_1d_v2i64_clamp: 3675 case Intrinsic::nvvm_suld_1d_array_i64_clamp: 3676 case Intrinsic::nvvm_suld_1d_array_v2i64_clamp: 3677 case Intrinsic::nvvm_suld_2d_i64_clamp: 3678 case Intrinsic::nvvm_suld_2d_v2i64_clamp: 3679 case Intrinsic::nvvm_suld_2d_array_i64_clamp: 3680 case Intrinsic::nvvm_suld_2d_array_v2i64_clamp: 3681 case Intrinsic::nvvm_suld_3d_i64_clamp: 3682 case Intrinsic::nvvm_suld_3d_v2i64_clamp: 3683 case Intrinsic::nvvm_suld_1d_i64_trap: 3684 case Intrinsic::nvvm_suld_1d_v2i64_trap: 3685 case Intrinsic::nvvm_suld_1d_array_i64_trap: 3686 case Intrinsic::nvvm_suld_1d_array_v2i64_trap: 3687 case Intrinsic::nvvm_suld_2d_i64_trap: 3688 case Intrinsic::nvvm_suld_2d_v2i64_trap: 3689 case Intrinsic::nvvm_suld_2d_array_i64_trap: 3690 case Intrinsic::nvvm_suld_2d_array_v2i64_trap: 3691 case Intrinsic::nvvm_suld_3d_i64_trap: 3692 case Intrinsic::nvvm_suld_3d_v2i64_trap: 3693 case Intrinsic::nvvm_suld_1d_i64_zero: 3694 case Intrinsic::nvvm_suld_1d_v2i64_zero: 3695 case Intrinsic::nvvm_suld_1d_array_i64_zero: 3696 case Intrinsic::nvvm_suld_1d_array_v2i64_zero: 3697 case Intrinsic::nvvm_suld_2d_i64_zero: 3698 case Intrinsic::nvvm_suld_2d_v2i64_zero: 3699 case Intrinsic::nvvm_suld_2d_array_i64_zero: 3700 case Intrinsic::nvvm_suld_2d_array_v2i64_zero: 3701 case Intrinsic::nvvm_suld_3d_i64_zero: 3702 case Intrinsic::nvvm_suld_3d_v2i64_zero: { 3703 Info.opc = getOpcForSurfaceInstr(Intrinsic); 3704 Info.memVT = MVT::i64; 3705 Info.ptrVal = nullptr; 3706 Info.offset = 0; 3707 Info.vol = 0; 3708 Info.readMem = true; 3709 Info.writeMem = false; 3710 Info.align = 16; 3711 return true; 3712 } 3713 } 3714 return false; 3715 } 3716 3717 /// isLegalAddressingMode - Return true if the addressing mode represented 3718 /// by AM is legal for this target, for a load/store of the specified type. 3719 /// Used to guide target specific optimizations, like loop strength reduction 3720 /// (LoopStrengthReduce.cpp) and memory optimization for address mode 3721 /// (CodeGenPrepare.cpp) 3722 bool NVPTXTargetLowering::isLegalAddressingMode(const DataLayout &DL, 3723 const AddrMode &AM, Type *Ty, 3724 unsigned AS) const { 3725 3726 // AddrMode - This represents an addressing mode of: 3727 // BaseGV + BaseOffs + BaseReg + Scale*ScaleReg 3728 // 3729 // The legal address modes are 3730 // - [avar] 3731 // - [areg] 3732 // - [areg+immoff] 3733 // - [immAddr] 3734 3735 if (AM.BaseGV) { 3736 return !AM.BaseOffs && !AM.HasBaseReg && !AM.Scale; 3737 } 3738 3739 switch (AM.Scale) { 3740 case 0: // "r", "r+i" or "i" is allowed 3741 break; 3742 case 1: 3743 if (AM.HasBaseReg) // "r+r+i" or "r+r" is not allowed. 3744 return false; 3745 // Otherwise we have r+i. 3746 break; 3747 default: 3748 // No scale > 1 is allowed 3749 return false; 3750 } 3751 return true; 3752 } 3753 3754 //===----------------------------------------------------------------------===// 3755 // NVPTX Inline Assembly Support 3756 //===----------------------------------------------------------------------===// 3757 3758 /// getConstraintType - Given a constraint letter, return the type of 3759 /// constraint it is for this target. 3760 NVPTXTargetLowering::ConstraintType 3761 NVPTXTargetLowering::getConstraintType(StringRef Constraint) const { 3762 if (Constraint.size() == 1) { 3763 switch (Constraint[0]) { 3764 default: 3765 break; 3766 case 'b': 3767 case 'r': 3768 case 'h': 3769 case 'c': 3770 case 'l': 3771 case 'f': 3772 case 'd': 3773 case '0': 3774 case 'N': 3775 return C_RegisterClass; 3776 } 3777 } 3778 return TargetLowering::getConstraintType(Constraint); 3779 } 3780 3781 std::pair<unsigned, const TargetRegisterClass *> 3782 NVPTXTargetLowering::getRegForInlineAsmConstraint(const TargetRegisterInfo *TRI, 3783 StringRef Constraint, 3784 MVT VT) const { 3785 if (Constraint.size() == 1) { 3786 switch (Constraint[0]) { 3787 case 'b': 3788 return std::make_pair(0U, &NVPTX::Int1RegsRegClass); 3789 case 'c': 3790 return std::make_pair(0U, &NVPTX::Int16RegsRegClass); 3791 case 'h': 3792 return std::make_pair(0U, &NVPTX::Int16RegsRegClass); 3793 case 'r': 3794 return std::make_pair(0U, &NVPTX::Int32RegsRegClass); 3795 case 'l': 3796 case 'N': 3797 return std::make_pair(0U, &NVPTX::Int64RegsRegClass); 3798 case 'f': 3799 return std::make_pair(0U, &NVPTX::Float32RegsRegClass); 3800 case 'd': 3801 return std::make_pair(0U, &NVPTX::Float64RegsRegClass); 3802 } 3803 } 3804 return TargetLowering::getRegForInlineAsmConstraint(TRI, Constraint, VT); 3805 } 3806 3807 //===----------------------------------------------------------------------===// 3808 // NVPTX DAG Combining 3809 //===----------------------------------------------------------------------===// 3810 3811 bool NVPTXTargetLowering::allowFMA(MachineFunction &MF, 3812 CodeGenOpt::Level OptLevel) const { 3813 const Function *F = MF.getFunction(); 3814 const TargetOptions &TO = MF.getTarget().Options; 3815 3816 // Always honor command-line argument 3817 if (FMAContractLevelOpt.getNumOccurrences() > 0) { 3818 return FMAContractLevelOpt > 0; 3819 } else if (OptLevel == 0) { 3820 // Do not contract if we're not optimizing the code 3821 return false; 3822 } else if (TO.AllowFPOpFusion == FPOpFusion::Fast || TO.UnsafeFPMath) { 3823 // Honor TargetOptions flags that explicitly say fusion is okay 3824 return true; 3825 } else if (F->hasFnAttribute("unsafe-fp-math")) { 3826 // Check for unsafe-fp-math=true coming from Clang 3827 Attribute Attr = F->getFnAttribute("unsafe-fp-math"); 3828 StringRef Val = Attr.getValueAsString(); 3829 if (Val == "true") 3830 return true; 3831 } 3832 3833 // We did not have a clear indication that fusion is allowed, so assume not 3834 return false; 3835 } 3836 3837 /// PerformADDCombineWithOperands - Try DAG combinations for an ADD with 3838 /// operands N0 and N1. This is a helper for PerformADDCombine that is 3839 /// called with the default operands, and if that fails, with commuted 3840 /// operands. 3841 static SDValue PerformADDCombineWithOperands(SDNode *N, SDValue N0, SDValue N1, 3842 TargetLowering::DAGCombinerInfo &DCI, 3843 const NVPTXSubtarget &Subtarget, 3844 CodeGenOpt::Level OptLevel) { 3845 SelectionDAG &DAG = DCI.DAG; 3846 // Skip non-integer, non-scalar case 3847 EVT VT=N0.getValueType(); 3848 if (VT.isVector()) 3849 return SDValue(); 3850 3851 // fold (add (mul a, b), c) -> (mad a, b, c) 3852 // 3853 if (N0.getOpcode() == ISD::MUL) { 3854 assert (VT.isInteger()); 3855 // For integer: 3856 // Since integer multiply-add costs the same as integer multiply 3857 // but is more costly than integer add, do the fusion only when 3858 // the mul is only used in the add. 3859 if (OptLevel==CodeGenOpt::None || VT != MVT::i32 || 3860 !N0.getNode()->hasOneUse()) 3861 return SDValue(); 3862 3863 // Do the folding 3864 return DAG.getNode(NVPTXISD::IMAD, SDLoc(N), VT, 3865 N0.getOperand(0), N0.getOperand(1), N1); 3866 } 3867 else if (N0.getOpcode() == ISD::FMUL) { 3868 if (VT == MVT::f32 || VT == MVT::f64) { 3869 const auto *TLI = static_cast<const NVPTXTargetLowering *>( 3870 &DAG.getTargetLoweringInfo()); 3871 if (!TLI->allowFMA(DAG.getMachineFunction(), OptLevel)) 3872 return SDValue(); 3873 3874 // For floating point: 3875 // Do the fusion only when the mul has less than 5 uses and all 3876 // are add. 3877 // The heuristic is that if a use is not an add, then that use 3878 // cannot be fused into fma, therefore mul is still needed anyway. 3879 // If there are more than 4 uses, even if they are all add, fusing 3880 // them will increase register pressue. 3881 // 3882 int numUses = 0; 3883 int nonAddCount = 0; 3884 for (SDNode::use_iterator UI = N0.getNode()->use_begin(), 3885 UE = N0.getNode()->use_end(); 3886 UI != UE; ++UI) { 3887 numUses++; 3888 SDNode *User = *UI; 3889 if (User->getOpcode() != ISD::FADD) 3890 ++nonAddCount; 3891 } 3892 if (numUses >= 5) 3893 return SDValue(); 3894 if (nonAddCount) { 3895 int orderNo = N->getIROrder(); 3896 int orderNo2 = N0.getNode()->getIROrder(); 3897 // simple heuristics here for considering potential register 3898 // pressure, the logics here is that the differnce are used 3899 // to measure the distance between def and use, the longer distance 3900 // more likely cause register pressure. 3901 if (orderNo - orderNo2 < 500) 3902 return SDValue(); 3903 3904 // Now, check if at least one of the FMUL's operands is live beyond the node N, 3905 // which guarantees that the FMA will not increase register pressure at node N. 3906 bool opIsLive = false; 3907 const SDNode *left = N0.getOperand(0).getNode(); 3908 const SDNode *right = N0.getOperand(1).getNode(); 3909 3910 if (isa<ConstantSDNode>(left) || isa<ConstantSDNode>(right)) 3911 opIsLive = true; 3912 3913 if (!opIsLive) 3914 for (SDNode::use_iterator UI = left->use_begin(), UE = left->use_end(); UI != UE; ++UI) { 3915 SDNode *User = *UI; 3916 int orderNo3 = User->getIROrder(); 3917 if (orderNo3 > orderNo) { 3918 opIsLive = true; 3919 break; 3920 } 3921 } 3922 3923 if (!opIsLive) 3924 for (SDNode::use_iterator UI = right->use_begin(), UE = right->use_end(); UI != UE; ++UI) { 3925 SDNode *User = *UI; 3926 int orderNo3 = User->getIROrder(); 3927 if (orderNo3 > orderNo) { 3928 opIsLive = true; 3929 break; 3930 } 3931 } 3932 3933 if (!opIsLive) 3934 return SDValue(); 3935 } 3936 3937 return DAG.getNode(ISD::FMA, SDLoc(N), VT, 3938 N0.getOperand(0), N0.getOperand(1), N1); 3939 } 3940 } 3941 3942 return SDValue(); 3943 } 3944 3945 /// PerformADDCombine - Target-specific dag combine xforms for ISD::ADD. 3946 /// 3947 static SDValue PerformADDCombine(SDNode *N, 3948 TargetLowering::DAGCombinerInfo &DCI, 3949 const NVPTXSubtarget &Subtarget, 3950 CodeGenOpt::Level OptLevel) { 3951 SDValue N0 = N->getOperand(0); 3952 SDValue N1 = N->getOperand(1); 3953 3954 // First try with the default operand order. 3955 if (SDValue Result = 3956 PerformADDCombineWithOperands(N, N0, N1, DCI, Subtarget, OptLevel)) 3957 return Result; 3958 3959 // If that didn't work, try again with the operands commuted. 3960 return PerformADDCombineWithOperands(N, N1, N0, DCI, Subtarget, OptLevel); 3961 } 3962 3963 static SDValue PerformANDCombine(SDNode *N, 3964 TargetLowering::DAGCombinerInfo &DCI) { 3965 // The type legalizer turns a vector load of i8 values into a zextload to i16 3966 // registers, optionally ANY_EXTENDs it (if target type is integer), 3967 // and ANDs off the high 8 bits. Since we turn this load into a 3968 // target-specific DAG node, the DAG combiner fails to eliminate these AND 3969 // nodes. Do that here. 3970 SDValue Val = N->getOperand(0); 3971 SDValue Mask = N->getOperand(1); 3972 3973 if (isa<ConstantSDNode>(Val)) { 3974 std::swap(Val, Mask); 3975 } 3976 3977 SDValue AExt; 3978 // Generally, we will see zextload -> IMOV16rr -> ANY_EXTEND -> and 3979 if (Val.getOpcode() == ISD::ANY_EXTEND) { 3980 AExt = Val; 3981 Val = Val->getOperand(0); 3982 } 3983 3984 if (Val->isMachineOpcode() && Val->getMachineOpcode() == NVPTX::IMOV16rr) { 3985 Val = Val->getOperand(0); 3986 } 3987 3988 if (Val->getOpcode() == NVPTXISD::LoadV2 || 3989 Val->getOpcode() == NVPTXISD::LoadV4) { 3990 ConstantSDNode *MaskCnst = dyn_cast<ConstantSDNode>(Mask); 3991 if (!MaskCnst) { 3992 // Not an AND with a constant 3993 return SDValue(); 3994 } 3995 3996 uint64_t MaskVal = MaskCnst->getZExtValue(); 3997 if (MaskVal != 0xff) { 3998 // Not an AND that chops off top 8 bits 3999 return SDValue(); 4000 } 4001 4002 MemSDNode *Mem = dyn_cast<MemSDNode>(Val); 4003 if (!Mem) { 4004 // Not a MemSDNode?!? 4005 return SDValue(); 4006 } 4007 4008 EVT MemVT = Mem->getMemoryVT(); 4009 if (MemVT != MVT::v2i8 && MemVT != MVT::v4i8) { 4010 // We only handle the i8 case 4011 return SDValue(); 4012 } 4013 4014 unsigned ExtType = 4015 cast<ConstantSDNode>(Val->getOperand(Val->getNumOperands()-1))-> 4016 getZExtValue(); 4017 if (ExtType == ISD::SEXTLOAD) { 4018 // If for some reason the load is a sextload, the and is needed to zero 4019 // out the high 8 bits 4020 return SDValue(); 4021 } 4022 4023 bool AddTo = false; 4024 if (AExt.getNode() != 0) { 4025 // Re-insert the ext as a zext. 4026 Val = DCI.DAG.getNode(ISD::ZERO_EXTEND, SDLoc(N), 4027 AExt.getValueType(), Val); 4028 AddTo = true; 4029 } 4030 4031 // If we get here, the AND is unnecessary. Just replace it with the load 4032 DCI.CombineTo(N, Val, AddTo); 4033 } 4034 4035 return SDValue(); 4036 } 4037 4038 static SDValue PerformSELECTCombine(SDNode *N, 4039 TargetLowering::DAGCombinerInfo &DCI) { 4040 // Currently this detects patterns for integer min and max and 4041 // lowers them to PTX-specific intrinsics that enable hardware 4042 // support. 4043 4044 const SDValue Cond = N->getOperand(0); 4045 if (Cond.getOpcode() != ISD::SETCC) return SDValue(); 4046 4047 const SDValue LHS = Cond.getOperand(0); 4048 const SDValue RHS = Cond.getOperand(1); 4049 const SDValue True = N->getOperand(1); 4050 const SDValue False = N->getOperand(2); 4051 if (!(LHS == True && RHS == False) && !(LHS == False && RHS == True)) 4052 return SDValue(); 4053 4054 const EVT VT = N->getValueType(0); 4055 if (VT != MVT::i32 && VT != MVT::i64) return SDValue(); 4056 4057 const ISD::CondCode CC = cast<CondCodeSDNode>(Cond.getOperand(2))->get(); 4058 SDValue Larger; // The larger of LHS and RHS when condition is true. 4059 switch (CC) { 4060 case ISD::SETULT: 4061 case ISD::SETULE: 4062 case ISD::SETLT: 4063 case ISD::SETLE: 4064 Larger = RHS; 4065 break; 4066 4067 case ISD::SETGT: 4068 case ISD::SETGE: 4069 case ISD::SETUGT: 4070 case ISD::SETUGE: 4071 Larger = LHS; 4072 break; 4073 4074 default: 4075 return SDValue(); 4076 } 4077 const bool IsMax = (Larger == True); 4078 const bool IsSigned = ISD::isSignedIntSetCC(CC); 4079 4080 unsigned IntrinsicId; 4081 if (VT == MVT::i32) { 4082 if (IsSigned) 4083 IntrinsicId = IsMax ? Intrinsic::nvvm_max_i : Intrinsic::nvvm_min_i; 4084 else 4085 IntrinsicId = IsMax ? Intrinsic::nvvm_max_ui : Intrinsic::nvvm_min_ui; 4086 } else { 4087 assert(VT == MVT::i64); 4088 if (IsSigned) 4089 IntrinsicId = IsMax ? Intrinsic::nvvm_max_ll : Intrinsic::nvvm_min_ll; 4090 else 4091 IntrinsicId = IsMax ? Intrinsic::nvvm_max_ull : Intrinsic::nvvm_min_ull; 4092 } 4093 4094 SDLoc DL(N); 4095 return DCI.DAG.getNode(ISD::INTRINSIC_WO_CHAIN, DL, VT, 4096 DCI.DAG.getConstant(IntrinsicId, DL, VT), LHS, RHS); 4097 } 4098 4099 enum OperandSignedness { 4100 Signed = 0, 4101 Unsigned, 4102 Unknown 4103 }; 4104 4105 /// IsMulWideOperandDemotable - Checks if the provided DAG node is an operand 4106 /// that can be demoted to \p OptSize bits without loss of information. The 4107 /// signedness of the operand, if determinable, is placed in \p S. 4108 static bool IsMulWideOperandDemotable(SDValue Op, 4109 unsigned OptSize, 4110 OperandSignedness &S) { 4111 S = Unknown; 4112 4113 if (Op.getOpcode() == ISD::SIGN_EXTEND || 4114 Op.getOpcode() == ISD::SIGN_EXTEND_INREG) { 4115 EVT OrigVT = Op.getOperand(0).getValueType(); 4116 if (OrigVT.getSizeInBits() <= OptSize) { 4117 S = Signed; 4118 return true; 4119 } 4120 } else if (Op.getOpcode() == ISD::ZERO_EXTEND) { 4121 EVT OrigVT = Op.getOperand(0).getValueType(); 4122 if (OrigVT.getSizeInBits() <= OptSize) { 4123 S = Unsigned; 4124 return true; 4125 } 4126 } 4127 4128 return false; 4129 } 4130 4131 /// AreMulWideOperandsDemotable - Checks if the given LHS and RHS operands can 4132 /// be demoted to \p OptSize bits without loss of information. If the operands 4133 /// contain a constant, it should appear as the RHS operand. The signedness of 4134 /// the operands is placed in \p IsSigned. 4135 static bool AreMulWideOperandsDemotable(SDValue LHS, SDValue RHS, 4136 unsigned OptSize, 4137 bool &IsSigned) { 4138 4139 OperandSignedness LHSSign; 4140 4141 // The LHS operand must be a demotable op 4142 if (!IsMulWideOperandDemotable(LHS, OptSize, LHSSign)) 4143 return false; 4144 4145 // We should have been able to determine the signedness from the LHS 4146 if (LHSSign == Unknown) 4147 return false; 4148 4149 IsSigned = (LHSSign == Signed); 4150 4151 // The RHS can be a demotable op or a constant 4152 if (ConstantSDNode *CI = dyn_cast<ConstantSDNode>(RHS)) { 4153 const APInt &Val = CI->getAPIntValue(); 4154 if (LHSSign == Unsigned) { 4155 return Val.isIntN(OptSize); 4156 } else { 4157 return Val.isSignedIntN(OptSize); 4158 } 4159 } else { 4160 OperandSignedness RHSSign; 4161 if (!IsMulWideOperandDemotable(RHS, OptSize, RHSSign)) 4162 return false; 4163 4164 return LHSSign == RHSSign; 4165 } 4166 } 4167 4168 /// TryMULWIDECombine - Attempt to replace a multiply of M bits with a multiply 4169 /// of M/2 bits that produces an M-bit result (i.e. mul.wide). This transform 4170 /// works on both multiply DAG nodes and SHL DAG nodes with a constant shift 4171 /// amount. 4172 static SDValue TryMULWIDECombine(SDNode *N, 4173 TargetLowering::DAGCombinerInfo &DCI) { 4174 EVT MulType = N->getValueType(0); 4175 if (MulType != MVT::i32 && MulType != MVT::i64) { 4176 return SDValue(); 4177 } 4178 4179 SDLoc DL(N); 4180 unsigned OptSize = MulType.getSizeInBits() >> 1; 4181 SDValue LHS = N->getOperand(0); 4182 SDValue RHS = N->getOperand(1); 4183 4184 // Canonicalize the multiply so the constant (if any) is on the right 4185 if (N->getOpcode() == ISD::MUL) { 4186 if (isa<ConstantSDNode>(LHS)) { 4187 std::swap(LHS, RHS); 4188 } 4189 } 4190 4191 // If we have a SHL, determine the actual multiply amount 4192 if (N->getOpcode() == ISD::SHL) { 4193 ConstantSDNode *ShlRHS = dyn_cast<ConstantSDNode>(RHS); 4194 if (!ShlRHS) { 4195 return SDValue(); 4196 } 4197 4198 APInt ShiftAmt = ShlRHS->getAPIntValue(); 4199 unsigned BitWidth = MulType.getSizeInBits(); 4200 if (ShiftAmt.sge(0) && ShiftAmt.slt(BitWidth)) { 4201 APInt MulVal = APInt(BitWidth, 1) << ShiftAmt; 4202 RHS = DCI.DAG.getConstant(MulVal, DL, MulType); 4203 } else { 4204 return SDValue(); 4205 } 4206 } 4207 4208 bool Signed; 4209 // Verify that our operands are demotable 4210 if (!AreMulWideOperandsDemotable(LHS, RHS, OptSize, Signed)) { 4211 return SDValue(); 4212 } 4213 4214 EVT DemotedVT; 4215 if (MulType == MVT::i32) { 4216 DemotedVT = MVT::i16; 4217 } else { 4218 DemotedVT = MVT::i32; 4219 } 4220 4221 // Truncate the operands to the correct size. Note that these are just for 4222 // type consistency and will (likely) be eliminated in later phases. 4223 SDValue TruncLHS = 4224 DCI.DAG.getNode(ISD::TRUNCATE, DL, DemotedVT, LHS); 4225 SDValue TruncRHS = 4226 DCI.DAG.getNode(ISD::TRUNCATE, DL, DemotedVT, RHS); 4227 4228 unsigned Opc; 4229 if (Signed) { 4230 Opc = NVPTXISD::MUL_WIDE_SIGNED; 4231 } else { 4232 Opc = NVPTXISD::MUL_WIDE_UNSIGNED; 4233 } 4234 4235 return DCI.DAG.getNode(Opc, DL, MulType, TruncLHS, TruncRHS); 4236 } 4237 4238 /// PerformMULCombine - Runs PTX-specific DAG combine patterns on MUL nodes. 4239 static SDValue PerformMULCombine(SDNode *N, 4240 TargetLowering::DAGCombinerInfo &DCI, 4241 CodeGenOpt::Level OptLevel) { 4242 if (OptLevel > 0) { 4243 // Try mul.wide combining at OptLevel > 0 4244 if (SDValue Ret = TryMULWIDECombine(N, DCI)) 4245 return Ret; 4246 } 4247 4248 return SDValue(); 4249 } 4250 4251 /// PerformSHLCombine - Runs PTX-specific DAG combine patterns on SHL nodes. 4252 static SDValue PerformSHLCombine(SDNode *N, 4253 TargetLowering::DAGCombinerInfo &DCI, 4254 CodeGenOpt::Level OptLevel) { 4255 if (OptLevel > 0) { 4256 // Try mul.wide combining at OptLevel > 0 4257 if (SDValue Ret = TryMULWIDECombine(N, DCI)) 4258 return Ret; 4259 } 4260 4261 return SDValue(); 4262 } 4263 4264 SDValue NVPTXTargetLowering::PerformDAGCombine(SDNode *N, 4265 DAGCombinerInfo &DCI) const { 4266 CodeGenOpt::Level OptLevel = getTargetMachine().getOptLevel(); 4267 switch (N->getOpcode()) { 4268 default: break; 4269 case ISD::ADD: 4270 case ISD::FADD: 4271 return PerformADDCombine(N, DCI, STI, OptLevel); 4272 case ISD::MUL: 4273 return PerformMULCombine(N, DCI, OptLevel); 4274 case ISD::SHL: 4275 return PerformSHLCombine(N, DCI, OptLevel); 4276 case ISD::AND: 4277 return PerformANDCombine(N, DCI); 4278 case ISD::SELECT: 4279 return PerformSELECTCombine(N, DCI); 4280 } 4281 return SDValue(); 4282 } 4283 4284 /// ReplaceVectorLoad - Convert vector loads into multi-output scalar loads. 4285 static void ReplaceLoadVector(SDNode *N, SelectionDAG &DAG, 4286 SmallVectorImpl<SDValue> &Results) { 4287 EVT ResVT = N->getValueType(0); 4288 SDLoc DL(N); 4289 4290 assert(ResVT.isVector() && "Vector load must have vector type"); 4291 4292 // We only handle "native" vector sizes for now, e.g. <4 x double> is not 4293 // legal. We can (and should) split that into 2 loads of <2 x double> here 4294 // but I'm leaving that as a TODO for now. 4295 assert(ResVT.isSimple() && "Can only handle simple types"); 4296 switch (ResVT.getSimpleVT().SimpleTy) { 4297 default: 4298 return; 4299 case MVT::v2i8: 4300 case MVT::v2i16: 4301 case MVT::v2i32: 4302 case MVT::v2i64: 4303 case MVT::v2f32: 4304 case MVT::v2f64: 4305 case MVT::v4i8: 4306 case MVT::v4i16: 4307 case MVT::v4i32: 4308 case MVT::v4f32: 4309 // This is a "native" vector type 4310 break; 4311 } 4312 4313 LoadSDNode *LD = cast<LoadSDNode>(N); 4314 4315 unsigned Align = LD->getAlignment(); 4316 auto &TD = DAG.getDataLayout(); 4317 unsigned PrefAlign = 4318 TD.getPrefTypeAlignment(ResVT.getTypeForEVT(*DAG.getContext())); 4319 if (Align < PrefAlign) { 4320 // This load is not sufficiently aligned, so bail out and let this vector 4321 // load be scalarized. Note that we may still be able to emit smaller 4322 // vector loads. For example, if we are loading a <4 x float> with an 4323 // alignment of 8, this check will fail but the legalizer will try again 4324 // with 2 x <2 x float>, which will succeed with an alignment of 8. 4325 return; 4326 } 4327 4328 EVT EltVT = ResVT.getVectorElementType(); 4329 unsigned NumElts = ResVT.getVectorNumElements(); 4330 4331 // Since LoadV2 is a target node, we cannot rely on DAG type legalization. 4332 // Therefore, we must ensure the type is legal. For i1 and i8, we set the 4333 // loaded type to i16 and propagate the "real" type as the memory type. 4334 bool NeedTrunc = false; 4335 if (EltVT.getSizeInBits() < 16) { 4336 EltVT = MVT::i16; 4337 NeedTrunc = true; 4338 } 4339 4340 unsigned Opcode = 0; 4341 SDVTList LdResVTs; 4342 4343 switch (NumElts) { 4344 default: 4345 return; 4346 case 2: 4347 Opcode = NVPTXISD::LoadV2; 4348 LdResVTs = DAG.getVTList(EltVT, EltVT, MVT::Other); 4349 break; 4350 case 4: { 4351 Opcode = NVPTXISD::LoadV4; 4352 EVT ListVTs[] = { EltVT, EltVT, EltVT, EltVT, MVT::Other }; 4353 LdResVTs = DAG.getVTList(ListVTs); 4354 break; 4355 } 4356 } 4357 4358 // Copy regular operands 4359 SmallVector<SDValue, 8> OtherOps(N->op_begin(), N->op_end()); 4360 4361 // The select routine does not have access to the LoadSDNode instance, so 4362 // pass along the extension information 4363 OtherOps.push_back(DAG.getIntPtrConstant(LD->getExtensionType(), DL)); 4364 4365 SDValue NewLD = DAG.getMemIntrinsicNode(Opcode, DL, LdResVTs, OtherOps, 4366 LD->getMemoryVT(), 4367 LD->getMemOperand()); 4368 4369 SmallVector<SDValue, 4> ScalarRes; 4370 4371 for (unsigned i = 0; i < NumElts; ++i) { 4372 SDValue Res = NewLD.getValue(i); 4373 if (NeedTrunc) 4374 Res = DAG.getNode(ISD::TRUNCATE, DL, ResVT.getVectorElementType(), Res); 4375 ScalarRes.push_back(Res); 4376 } 4377 4378 SDValue LoadChain = NewLD.getValue(NumElts); 4379 4380 SDValue BuildVec = DAG.getBuildVector(ResVT, DL, ScalarRes); 4381 4382 Results.push_back(BuildVec); 4383 Results.push_back(LoadChain); 4384 } 4385 4386 static void ReplaceINTRINSIC_W_CHAIN(SDNode *N, SelectionDAG &DAG, 4387 SmallVectorImpl<SDValue> &Results) { 4388 SDValue Chain = N->getOperand(0); 4389 SDValue Intrin = N->getOperand(1); 4390 SDLoc DL(N); 4391 4392 // Get the intrinsic ID 4393 unsigned IntrinNo = cast<ConstantSDNode>(Intrin.getNode())->getZExtValue(); 4394 switch (IntrinNo) { 4395 default: 4396 return; 4397 case Intrinsic::nvvm_ldg_global_i: 4398 case Intrinsic::nvvm_ldg_global_f: 4399 case Intrinsic::nvvm_ldg_global_p: 4400 case Intrinsic::nvvm_ldu_global_i: 4401 case Intrinsic::nvvm_ldu_global_f: 4402 case Intrinsic::nvvm_ldu_global_p: { 4403 EVT ResVT = N->getValueType(0); 4404 4405 if (ResVT.isVector()) { 4406 // Vector LDG/LDU 4407 4408 unsigned NumElts = ResVT.getVectorNumElements(); 4409 EVT EltVT = ResVT.getVectorElementType(); 4410 4411 // Since LDU/LDG are target nodes, we cannot rely on DAG type 4412 // legalization. 4413 // Therefore, we must ensure the type is legal. For i1 and i8, we set the 4414 // loaded type to i16 and propagate the "real" type as the memory type. 4415 bool NeedTrunc = false; 4416 if (EltVT.getSizeInBits() < 16) { 4417 EltVT = MVT::i16; 4418 NeedTrunc = true; 4419 } 4420 4421 unsigned Opcode = 0; 4422 SDVTList LdResVTs; 4423 4424 switch (NumElts) { 4425 default: 4426 return; 4427 case 2: 4428 switch (IntrinNo) { 4429 default: 4430 return; 4431 case Intrinsic::nvvm_ldg_global_i: 4432 case Intrinsic::nvvm_ldg_global_f: 4433 case Intrinsic::nvvm_ldg_global_p: 4434 Opcode = NVPTXISD::LDGV2; 4435 break; 4436 case Intrinsic::nvvm_ldu_global_i: 4437 case Intrinsic::nvvm_ldu_global_f: 4438 case Intrinsic::nvvm_ldu_global_p: 4439 Opcode = NVPTXISD::LDUV2; 4440 break; 4441 } 4442 LdResVTs = DAG.getVTList(EltVT, EltVT, MVT::Other); 4443 break; 4444 case 4: { 4445 switch (IntrinNo) { 4446 default: 4447 return; 4448 case Intrinsic::nvvm_ldg_global_i: 4449 case Intrinsic::nvvm_ldg_global_f: 4450 case Intrinsic::nvvm_ldg_global_p: 4451 Opcode = NVPTXISD::LDGV4; 4452 break; 4453 case Intrinsic::nvvm_ldu_global_i: 4454 case Intrinsic::nvvm_ldu_global_f: 4455 case Intrinsic::nvvm_ldu_global_p: 4456 Opcode = NVPTXISD::LDUV4; 4457 break; 4458 } 4459 EVT ListVTs[] = { EltVT, EltVT, EltVT, EltVT, MVT::Other }; 4460 LdResVTs = DAG.getVTList(ListVTs); 4461 break; 4462 } 4463 } 4464 4465 SmallVector<SDValue, 8> OtherOps; 4466 4467 // Copy regular operands 4468 4469 OtherOps.push_back(Chain); // Chain 4470 // Skip operand 1 (intrinsic ID) 4471 // Others 4472 OtherOps.append(N->op_begin() + 2, N->op_end()); 4473 4474 MemIntrinsicSDNode *MemSD = cast<MemIntrinsicSDNode>(N); 4475 4476 SDValue NewLD = DAG.getMemIntrinsicNode(Opcode, DL, LdResVTs, OtherOps, 4477 MemSD->getMemoryVT(), 4478 MemSD->getMemOperand()); 4479 4480 SmallVector<SDValue, 4> ScalarRes; 4481 4482 for (unsigned i = 0; i < NumElts; ++i) { 4483 SDValue Res = NewLD.getValue(i); 4484 if (NeedTrunc) 4485 Res = 4486 DAG.getNode(ISD::TRUNCATE, DL, ResVT.getVectorElementType(), Res); 4487 ScalarRes.push_back(Res); 4488 } 4489 4490 SDValue LoadChain = NewLD.getValue(NumElts); 4491 4492 SDValue BuildVec = 4493 DAG.getBuildVector(ResVT, DL, ScalarRes); 4494 4495 Results.push_back(BuildVec); 4496 Results.push_back(LoadChain); 4497 } else { 4498 // i8 LDG/LDU 4499 assert(ResVT.isSimple() && ResVT.getSimpleVT().SimpleTy == MVT::i8 && 4500 "Custom handling of non-i8 ldu/ldg?"); 4501 4502 // Just copy all operands as-is 4503 SmallVector<SDValue, 4> Ops(N->op_begin(), N->op_end()); 4504 4505 // Force output to i16 4506 SDVTList LdResVTs = DAG.getVTList(MVT::i16, MVT::Other); 4507 4508 MemIntrinsicSDNode *MemSD = cast<MemIntrinsicSDNode>(N); 4509 4510 // We make sure the memory type is i8, which will be used during isel 4511 // to select the proper instruction. 4512 SDValue NewLD = 4513 DAG.getMemIntrinsicNode(ISD::INTRINSIC_W_CHAIN, DL, LdResVTs, Ops, 4514 MVT::i8, MemSD->getMemOperand()); 4515 4516 Results.push_back(DAG.getNode(ISD::TRUNCATE, DL, MVT::i8, 4517 NewLD.getValue(0))); 4518 Results.push_back(NewLD.getValue(1)); 4519 } 4520 } 4521 } 4522 } 4523 4524 void NVPTXTargetLowering::ReplaceNodeResults( 4525 SDNode *N, SmallVectorImpl<SDValue> &Results, SelectionDAG &DAG) const { 4526 switch (N->getOpcode()) { 4527 default: 4528 report_fatal_error("Unhandled custom legalization"); 4529 case ISD::LOAD: 4530 ReplaceLoadVector(N, DAG, Results); 4531 return; 4532 case ISD::INTRINSIC_W_CHAIN: 4533 ReplaceINTRINSIC_W_CHAIN(N, DAG, Results); 4534 return; 4535 } 4536 } 4537 4538 // Pin NVPTXSection's and NVPTXTargetObjectFile's vtables to this file. 4539 void NVPTXSection::anchor() {} 4540 4541 NVPTXTargetObjectFile::~NVPTXTargetObjectFile() { 4542 delete static_cast<NVPTXSection *>(TextSection); 4543 delete static_cast<NVPTXSection *>(DataSection); 4544 delete static_cast<NVPTXSection *>(BSSSection); 4545 delete static_cast<NVPTXSection *>(ReadOnlySection); 4546 4547 delete static_cast<NVPTXSection *>(StaticCtorSection); 4548 delete static_cast<NVPTXSection *>(StaticDtorSection); 4549 delete static_cast<NVPTXSection *>(LSDASection); 4550 delete static_cast<NVPTXSection *>(EHFrameSection); 4551 delete static_cast<NVPTXSection *>(DwarfAbbrevSection); 4552 delete static_cast<NVPTXSection *>(DwarfInfoSection); 4553 delete static_cast<NVPTXSection *>(DwarfLineSection); 4554 delete static_cast<NVPTXSection *>(DwarfFrameSection); 4555 delete static_cast<NVPTXSection *>(DwarfPubTypesSection); 4556 delete static_cast<const NVPTXSection *>(DwarfDebugInlineSection); 4557 delete static_cast<NVPTXSection *>(DwarfStrSection); 4558 delete static_cast<NVPTXSection *>(DwarfLocSection); 4559 delete static_cast<NVPTXSection *>(DwarfARangesSection); 4560 delete static_cast<NVPTXSection *>(DwarfRangesSection); 4561 delete static_cast<NVPTXSection *>(DwarfMacinfoSection); 4562 } 4563 4564 MCSection * 4565 NVPTXTargetObjectFile::SelectSectionForGlobal(const GlobalValue *GV, 4566 SectionKind Kind, Mangler &Mang, 4567 const TargetMachine &TM) const { 4568 return getDataSection(); 4569 } 4570