白嫖 github action + Gemini 自动化每日精选论文 code四月 10, 2026 AIcoding现在越来越火热,不可避免有点焦虑。我也vibecoding了一个Gemini每日精选论文工具(白嫖githubaction和googleAIstudio大模型token),加紧学习效率。欢迎star/fork使用#背景随着AI技术的飞速发展,每天都有大量的论文发表,作为工程师或者研究 code
WSL2 shell 使用优化 - 交互响应速度、代理配置 code四月 9, 2026 我承认,世界上最好的linux发行版,那就是—WSL#0.背景本人虽然使用Windows电脑,但一直使用WSL2工作,所有项目代码等都在WSL2里,也更习惯于linux命令行操作。结合vscode的remote套件连接WSL进行开发非常方便。但默认配置下在使用shell,可能会有代理配置难或代理无法 wsl
[CUDA 入门] 认识 CUDA “不存在的存储层级” - local memory code四月 1, 2026 CUDA 入门:揭开 local memory 逻辑私有、物理落 global 的本质,讲解触发场景与避免编译器溢出到 local memory 的性能要点。 vitamin-cudacudac++GPU
[CUDA 优化实战] safe online softmax - 面试必问:任意 hidden_size、one pass、two pass、trade-off、split-k code三月 31, 2026 CUDA safe online softmax 全场景攻略:覆盖任意 hidden_size、one pass/two pass、split-k 等面试高频考点的实现方法与 trade-off 分析。 vitamin-cudacudac++GPU
[CUDA 入门] L1/TEX/SMEM - 再识bank conflict code三月 6, 2026 结合 NCU 验证与 NV GTC 技术报告,重新理解 L1/TEX/SMEM 共享存储上的 warp 间 Bank Conflict 成因与规避方法。 vitamin-cudacudac++GPU
[CUDA 优化实战] sgemm - 超越 cuBLAS:带你学会极致优化的矩阵乘法 cuda c++ 实现 code三月 5, 2026 纯 C++ CUDA 手搓 SGEMM,从 naive tiling 到双缓冲与 swizzle,在 RTX 5060 上超越 cuBLAS,系统复盘 FP32 矩阵乘法极致优化全流程。 vitamin-cudacudac++GPUGEMM
[CUDA 优化实战] RoPE - 手写算子的作用之 kernel fusion:减少访存次数、减少启动开销的优化技巧 code三月 5, 2026 对比 PyTorch 与手写 CUDA Kernel 实现 RoPE 算子,解析 kernel fusion 如何通过减少访存与启动开销突破大模型推理的显存带宽瓶颈。 vitamin-cudacudac++GPU
[CUDA 优化实战] 矩阵转置-从 Padding 到 XOR Swizzle:CUDA 共享内存优化的艺术 code二月 13, 2026 CUDA 矩阵转置优化实战:从合并/跨步访存的朴素 Kernel,演进到 Shared Memory Tiling、Padding 与 XOR Swizzle,详解共享内存 Bank Conflict 的成因与规避方法。 vitamin-cudacudac++GPU
CUDA 开发者应该熟悉的数 code二月 9, 2026 梳理 CUDA 性能调优必知的硬件参数与延迟量级——Warp Size、SM 数量、访存带宽等黄金数字,帮助开发者榨干 GPU 算力。 vitamin-cudacudac++GPU
深度解读 DeviceQuery:理解你的 GPU 硬件属性 hpc二月 6, 2026 以 RTX 5060 为例深度解读 CUDA deviceQuery 输出,帮你理解计算能力、SM 配置、内存层次等硬件属性以指导 Kernel 开发。 vitamin-cudacudac++GPU