-
Models From First Principles 08: Which Model Should You Use? MR.Q, EBT, SICQL, HRM, Tiny and PACS Compared
-
Models From First Principles 07: PACS — Building an Optimizer From Gradient Statistics
-
Models From First Principles 06: Inside Tiny — Residual Blocks, Attention and Sparse Autoencoders
-
Models From First Principles 05: Tiny — Recursive Reasoning With a Small Neural Network
-
Models From First Principles 04: HRM — Hierarchical Reasoning With Fast and Slow Recurrent State
-
Models From First Principles 03: SICQL — Building a Model From Q, V and Policy Networks
-
Models From First Principles 02: EBT — From One Score to Q, V, Policy and Advantage
-
Models From First Principles 01: MR.Q — Building a Neural Quality Model From Two Embeddings
-
Models From First Principles 00: The Model Inside the Model
-
PyTorch Zero to Hero 10: Build a Small GPT-Style Language Model From Scratch
-
PyTorch Performance Debugging: CUDA OOM, Slow Training, GPU Utilization and torch.compile
-
PyTorch Model Not Learning? A Systematic Debugging Guide
-
PyTorch Attention Shapes: Q, K, V, Multi-Head Attention Masks and Transformer Dimension Errors
-
PyTorch CNN Shape Errors: Conv2d Output Sizes, Channels, Flatten Bugs and How to Debug Them
-
PyTorch DataLoader Performance: num_workers, pin_memory, Prefetching and Why Your GPU Is Waiting
-
PyTorch nn.Module Explained: Missing Parameters, state_dict, Buffers and Registration Bugs
-
Build a Neural Network From Scratch in PyTorch Without nn.Module
-
PyTorch Autograd Debugging: requires_grad, detach, backward() and NaN Gradients
-
PyTorch Tensor Shapes: Broadcasting, Reshape, View, Permute and the Errors That Waste Your Time
-
PyTorch Zero to Hero 00: What Are We Actually Doing?