A Practical Guide for AI Engineers and Developers
Chris von Csefalvay

#ML
#SFT
#RLHF
#DPO
#KTO
#GRPO
🧠 هنر Post-Training مدلهای هوش مصنوعی
⚙️ بهطور پیشفرض توانمند؛ با طراحی قابلاعتماد.
🌐 یک مدل ازپیشآموزشدیده تقریبا بیشتر اینترنت رو خونده، اما نمیشه برای استفاده درست از اون دانش، چندان بهش اعتماد کرد. Post-Training همون فرایندیه که این وضعیت رو تغییر میده؛ جایی که یک مدل خام و عمومی رو به سیستمی تبدیل میکنی که رفتار مناسبی داره، دستورها رو دنبال میکنه، درخواستهایی رو که نباید انجام بده رد میکنه و از پس کار مشخصی که بهش سپرده شده برمیاد.
🛠️ Post-Training در واقع دخالت هدایتشده انسان در عملکرد ماشینه؛ همون بخشی که تقریبا هیچکس درست توضیحش نمیده.
👨💻 کریس فون چفالوی بخش زیادی از مسیر حرفهای خودش رو صرف ساخت سیستمهای ML آماده پروداکشن در صنعت کرده؛ از پردازش زبان پزشکی گرفته تا تحلیل متنهای حقوقی. او در کتاب The Craft of Post-Training تصمیمهای پشت هر تکنیک رو توضیح میده: چه زمانی باید Fine-Tuning انجام بدی و چه زمانی نباید، چرا گاهی کیفیت مدل بدون نشانه واضحی افت میکنه، و کدوم روش با محدودیت واقعی پروژه تو هماهنگتره.
📐 مباحث ریاضی هم در کتاب حضور دارن، چون وقتی بفهمی یک تکنیک چرا کار میکنه، موقع خراب شدنش هم میتونی اون رو دیباگ کنی.
🎯 چیزهایی که یاد میگیری
🧩 بین روشهای اصلی Post-Training مثل SFT، RLHF، DPO، KTO و GRPO انتخاب میکنی و بهاندازهای اونها رو میفهمی که بهجای حدس زدن، خطاها و شکستهای مدل رو برطرف کنی
🧠 مدل رو با دامنه تخصصی خودت سازگار میکنی، بدون اینکه گرفتار Catastrophic Forgetting بشه؛ یعنی حالتی که شبکه هنگام آموزش روی دادههای جدید، دانستههای قبلی خودش رو ناگهان بازنویسی یا فراموش میکنه
💾 با استفاده از تکنیکهای جدید Quantization، مدلهای بزرگتر رو با حافظه سختافزاری محدودی که در اختیار داری اجرا میکنی
🤖 سیستمهای ایجنتی رو طوری آموزش میدی که حتی زیر فشار حملهها و ورودیهای خصمانه، رفتار قابلاعتمادی داشته باشن
📊 فراتر از Benchmarkهای استاندارد، همون معیارهایی رو اندازهگیری میکنی که واقعا برای دیپلوی و محیط پروداکشن تو اهمیت دارن
🔍 وقتی مدت زیادی با LLMها کار میکنی، بالاخره این سؤال پیش میاد که چه کاری روی اونها انجام شده تا اینطور رفتار کنن. پاسخ در Post-Trainingای قرار داره که رفتار اونها رو شکل داده. کتاب The Craft of Post-Training نشون میده این فرایند دقیقا چطور انجام میشه.
📖 فهرست مطالب
پارت ۱. مبانی
فصل ۱. اصول ضروری Post-Training. چی هست و چرا اهمیت داره
فصل ۲. پیشنیازهای موفقیت. قبل از Fine-Tuning
پارت ۲. ابزارها
فصل ۳. Supervised Fine-Tuning. تکنیک پایه
فصل ۴. Reinforcement Learning. هر بار بهتر
فصل ۵. Preference Optimization. جایگزینهای مدرن PPO
فصل ۶. استراتژیهای ارزیابی. اندازهگیری کیفیت مدل
پارت ۳. هنر کار
فصل ۷. تکنیکهای افزایش کارایی. Quantization و فشردهسازی
فصل ۸. سازگارسازی با دامنه. مدل رو مخصوص خودت کن
فصل ۹. مدلهای ایجنتی. عمل، نه فقط حرف
فصل ۱۰. قابلیتهای Reasoning. آموزش برای تفکر پیچیده
پارت ۴. مرزهای پیشرو
فصل ۱۱. آموزش مصنوعی. Self-Play و دادههای تولیدشده
فصل ۱۲. سیستمهای چندوجهی. Post-Training فراتر از متن
فصل ۱۳. مسیرهای آینده. قدم بعدی چیه
👤 درباره نویسنده
👨🔬 کریس فون چفالوی از مدیران ارشد بخش AI شرکت HCLTech است و پژوهشهای Post-Training و هوش بالینی رو رهبری میکنه. او سابقه فعالیت در نقشهای ارشد رهبری Data Science در شرکتهای بزرگ رو داره و مدلهای زبانی رو برای کاربردهایی از Pharmacovigilance یا نظارت بر ایمنی داروها گرفته تا تحلیل پویاییهای اجتماعی طراحی کرده.
🎓 او مدارک دانشگاهی خودش رو از Oxford و Cardiff گرفته و عضو Royal Society for Public Health و عضو ارشد IEEE است.
Capable by default. Reliable by design.
A pre-trained model has read most of the internet—and can be trusted with almost none of it. Post-training is the work that changes that: where you take a raw, general model and shape it into something that behaves, follows instructions, refuses what it shouldn’t do, and handles the specific job you need. It’s the human hand on the machine, and the part almost no one explains.
Chris von Csefalvay has spent his career building production ML systems in industry, from clinical language to legal text. In The Craft of Post-Training, he shows you the decisions behind every technique: when to fine-tune and when not to, why a model quietly gets worse, and which method fits the constraint you’re actually under. The math is here, because knowing why a technique works is what lets you debug it when it breaks.
You’ll know how to:
When you’ve used LLMs long enough, you start to wonder what was done to make them behave. The secret is in the post-training that shaped them. The Craft of Post-Training shows you how that’s done.
Table of Contents
Part I. The Foundation
Chapter 1. Post-Training Essentials: What It Is and Why It Matters
Chapter 2. Prerequisites for Success: Before You Fine-Tune
Part II. The Tools
Chapter 3. Supervised Fine-Tuning: The Foundation Technique
Chapter 4. Reinforcement Learning: Better Each Time
Chapter 5. Preference Optimization: Modern Alternatives to PPO
Chapter 6. Evaluation Strategies: Measuring Model Quality
Part III. The Craft
Chapter 7. Efficiency Techniques: Quantization and Compression
Chapter 8. Domain Adaptation: Make It Yours
Chapter 9. Agentic Models: Deeds, Not Words
Chapter 10. Reasoning Capabilities: Training for Complex Thought
Part IV. The Frontier
Chapter 11. Synthetic Training: Self-Play and Generated Data
Chapter 12. Multimodal Systems: Post-Training Beyond the Text
Chapter 13. Future Directions: What Comes Next
About the Author
Chris von Csefalvay is a Principal at HCLTech’s AI Practice, leading post-training research and clinical intelligence. He has held senior data science leadership roles across major enterprises and designed language models for applications from pharmacovigilance to social dynamics. He holds degrees from Oxford and Cardiff, and is a Fellow of the Royal Society for Public Health and a Senior Member of IEEE.









