<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance" xsi:schemaLocation="http://www.sitemaps.org/schemas/sitemap/0.9 http://www.sitemaps.org/schemas/sitemap/0.9/sitemap.xsd" xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
<url>
<loc>https://blogs.gruheshkurra.com/blog/build-autograd-from-scratch/</loc>
<lastmod>2026-05-11T00:00:00+00:00</lastmod>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/blog/build-gpt2-from-scratch/</loc>
<lastmod>2026-05-11T00:00:00+00:00</lastmod>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/blog/essence-of-linear-algebra/</loc>
<lastmod>2026-06-04T03:30:00+00:00</lastmod>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/blog/what-is-a-gpt-visual-intro/</loc>
<lastmod>2026-06-04T04:30:00+00:00</lastmod>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/blog/attention-in-transformers-explained/</loc>
<lastmod>2026-06-04T05:30:00+00:00</lastmod>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/blog/deepseek-v4-engineering-explained/</loc>
<lastmod>2026-06-05T04:30:00+00:00</lastmod>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/blog/transformer-from-scratch-forward-backward-math/</loc>
<lastmod>2026-06-05T07:30:00+00:00</lastmod>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/blog/numerical-gradient-checking-explained/</loc>
<lastmod>2026-06-07T00:00:00+00:00</lastmod>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/blog/byte-pair-encoding-from-scratch/</loc>
<lastmod>2026-06-10T00:00:00+00:00</lastmod>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/blog/positional-encoding-explained/</loc>
<lastmod>2026-06-10T00:00:00+00:00</lastmod>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/blog/token-embeddings-explained/</loc>
<lastmod>2026-06-10T00:00:00+00:00</lastmod>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/blog/adam-optimizer-explained/</loc>
<lastmod>2026-06-14T00:00:00+00:00</lastmod>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/blog/cross-entropy-loss-explained/</loc>
<lastmod>2026-06-14T00:00:00+00:00</lastmod>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/blog/gpt-math-beyond-attention/</loc>
<lastmod>2026-06-24T04:30:00+00:00</lastmod>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/blog/build-mini-llm-numpy-from-scratch/</loc>
<lastmod>2026-07-16T11:30:00+00:00</lastmod>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/about/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/ai-explanations/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/library/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/news/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/papers/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/tags/deep-learning/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/tags/backpropagation/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/tags/autograd/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/tags/python/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/tags/pytorch/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/tags/from-scratch/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/tags/gpt-2/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/tags/transformers/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/tags/llm/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/tags/linear-algebra/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/tags/learning/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/tags/math/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/tags/machine-learning/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/tags/3blue1brown/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/tags/gpt/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/tags/word-embeddings/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/tags/softmax/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/tags/attention/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/tags/self-attention/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/tags/multi-head-attention/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/tags/deepseek/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/tags/long-context/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/tags/model-training/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/tags/sparse-attention/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/tags/optimizers/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/tags/ai-search/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/tags/encoder-decoder/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/tags/layer-norm/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/tags/adam/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/tags/testing/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/tags/tokenization/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/tags/bpe/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/tags/nlp/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/tags/positional-encoding/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/tags/embeddings/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/tags/optimization/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/tags/adamw/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/tags/training/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/tags/loss-functions/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/tags/numpy/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/tags/rope/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/tags/gqa/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/tags/swiglu/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/tags/rmsnorm/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/tags/chat/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/tags/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/series/ai/</loc>
</url>
<url>
<loc>https://blogs.gruheshkurra.com/series/</loc>
</url>
</urlset>
