cuda-oxide:从零加一个自定义 PTX intrinsic——五阶段管线 + 两个真实踩坑 走一遍真实流程:在 cuda-oxide 里加一个返回常量 42 的自定义 intrinsic xxx(),最终在 PTX 中通过内联汇编 mov.u32 %r1, 42; 实现。五个 crate 要改、两个错误版本一定会踩、convergent 属性是正确性而不是性能开关。把整套实战拆给你看。 zTgx 1 0 0 专题cuda-oxideintrinsic
从 Rust 写 inline PTX 模板 会读 PTX 之后,下一步是从 Rust 里写自己的 PTX——这是实现自定义 GPU intrinsic 的必备技能。本文讲清楚 inline asm 的'模板 + 约束串'两段对应关系、临时寄存器作用域、谓词输出 selp 套路、format! 动态生成的陷阱,以及一个'读 shared memory 比对'的完整合成例子。 zTgx 0 0 0 专题compilerptx
cuda-oxide:hello-constant 拆解 07——块尾控制流 + intrinsic dispatch 拆 hello-constant 系列第七站。每个 basic block(基本块)末尾的控制流(rustc 内部叫 Terminator,终结符)是 translator 最复杂的一段。本文按 docs/run.log 真实 dump,讲清楚函数调用为什么必须落在块尾、translate_call 的三步流程、try_dispatch_intrinsic 怎么靠 FQDN(完全限定路径名)字符串识别 GPU intrinsic(编译器内建函数)、以及桩函数体为什么根本没翻译。 zTgx 0 0 0 专题cuda-oxiderust