Achieving Production Excellence
Charity Majors, Liz Fong-Jones, and George Miranda with Austin Parker

#Observability_Engineering
#CI/CD
#OpenTelemetry
#AI_Agent
🧠 مشاهدهپذیری تنها راهیه که باهاش میشه سیستمهای حیاتی کسبوکار رو، یعنی همون سیستمهایی که مشتریها هر روز بهشون وابستهاند، مهندسی، مدیریت و بهتر کرد. هرچقدر پیچیدگی نرمافزار بیشتر میشه، نیاز به مشاهدهپذیری هم بالاتر میره. در ویرایش دوم که بهطور کامل بازنگری شده، چریتی میجرز، لیز فانگ-جونز و جورج میراندا وضعیت فعلی این حوزه رو بررسی میکنن و توضیح میدن متخصصها چطور میتونن Practiceهای مشاهدهپذیری خودشون رو از جمعآوری سیگنالهای جدا و پراکنده، به ورکفلوهای یکپارچه داده ارتقا بدن.
👨💻 این کتاب برای هر تیم مهندسی نرمافزاریه، چه بزرگ و چه کوچک، که باید تجربه منحصربهفرد مشتری رو بفهمه تا کد باکیفیت و قابلیتهایی رو که مشتریها میخوان، با سرعت مناسب تحویل بده. با ارزشی که سیستمهای Observable ایجاد میکنن آشنا میشی و قدمهای مشخصی یاد میگیری که باهاشون میتونی Practice توسعه مبتنی بر مشاهدهپذیری رو در تیم خودت پیادهسازی کنی. چهار فصل کاملاً جدید هم موضوعهای تازهای مثل مدلهای زبانی بزرگ، مشاهدهپذیری Frontend، بهینهسازی هزینه و مهندسی پرفورمنس، و ابزارهای عملی Open Source رو بررسی میکنن.
🎯 چیزهایی که یاد میگیری
🔄 تأثیر مشاهدهپذیری رو در سراسر چرخه عمر توسعه نرمافزار میفهمی
📏 یاد میگیری تیمهای مختلف چطور و چرا از مشاهدهپذیری همراه با Service-Level Objectiveها استفاده میکنن
🏗️ Practiceهای مدرن مشاهدهپذیری رو در سازمانت پیادهسازی میکنی
💰 مقرونبهصرفه بودن ابزارهای مشاهدهپذیری رو به حداکثر میرسونی
🧩 کد باکیفیتی تولید میکنی که دیباگ و نگهداری Context-Aware سیستم رو ممکن میکنه
📊 از Analytics غنی از داده استفاده میکنی تا هنگام حفظ Site Reliability، جوابها رو سریعتر پیدا کنی
📖 فهرست مطالب
بخش ۱. مقدمهای بر مشاهدهپذیری
فصل ۱. مشاهدهپذیری چیست؟
فصل ۲. عبور کد به پروداکشن: اعتبارسنجی نیت دولوپر در پروداکشن
فصل ۳. ریشههای مشاهدهپذیری در نرمافزار
بخش ۲. مبانی Instrumentation
فصل ۴. شروع کار با Instrumentation
فصل ۵. Eventهای ساختاریافته، بلوکهای سازنده مشاهدهپذیری هستن
فصل ۶. ساخت Eventهای ساختاریافته با عرض دلخواه
فصل ۷. Instrument کردن کد با OpenTelemetry
بخش ۳. ورکفلوهای تحلیل
فصل ۸. شروع تحلیل مشاهدهپذیری
فصل ۹. توسعه مبتنی بر مشاهدهپذیری
فصل ۱۰. نقش ایجنتهای AI در مشاهدهپذیری
فصل ۱۱. استفاده از Service-Level Objectiveها برای Reliability
بخش ۴. بررسی فنی عمیق مشاهدهپذیری
فصل ۱۲. واکنش به Alertهای مبتنی بر SLO و دیباگ کردن آنها
فصل ۱۳. ذخیرهسازی کارآمد داده با Retriever
فصل ۱۴. ذخیرهسازی کارآمد داده با ClickHouse
فصل ۱۵. Sampling ارزان و بهاندازه کافی دقیق
فصل ۱۶. مدیریت Telemetry با پایپلاینها
فصل ۱۷. هستیشناسیها بهعنوان زبان مشترک انسانها و AI
بخش ۵. Use Caseهای مشاهدهپذیری
فصل ۱۸. مشاهدهپذیری برای پایپلاینهای CI/CD
فصل ۱۹. مشاهدهپذیری برای Mobile و Frontend
فصل ۲۰. مهندسی پرفورمنس با مشاهدهپذیری
فصل ۲۱. مشاهدهپذیری برای مدلهای زبانی بزرگ
فصل ۲۲. مطالعه موردی Fin در مهندسی مدرن
بخش ۶. حکمرانی مشاهدهپذیری
فصل ۲۳. سرعت یادگیری سازمانی حالا بزرگترین محدودیت شماست: نامهای سرگشاده به CTOها
فصل ۲۴. تفکر سیستمی برای تحویل نرمافزار
فصل ۲۵. چشمانداز مشاهدهپذیری از زاویه سیستمها
فصل ۲۶. توجیه کسبوکاری مشاهدهپذیری
فصل ۲۷. عیبیابی سرمایهگذاری در مشاهدهپذیری
فصل ۲۸. تغییر سازمانی
فصل ۲۹. ساختن در برابر خریدن، یا استفاده از Open Source
فصل ۳۰. هنر و علم همکاری با Vendorها
فصل ۳۱. Instrumentation برای تیمهای مشاهدهپذیری
فصل ۳۲. از اینجا به کجا میریم؟
🆕 چه چیزهایی در ویرایش دوم فرق کرده؟
👨💻 اول از همه، یک همنویسنده جدید داریم. با خوشحالی از آستین پارکر استقبال میکنیم که تخصص عمیقی در AI و OpenTelemetry داره.
🎙️ همینطور خیلی خوشحالیم که در این ویرایش، صداهای متنوعتری رو وارد کتاب کردیم و مجموعهای عالی از نویسندههای مهمان داریم. فرصت معرفی بعضی از آدمهایی که بهشون احترام میذاریم و از همکاری باهاشون لذت میبریم، یکی از بهترین بخشهای آماده کردن این کتاب بوده.
📚 بهترتیب حضور در کتاب
🧩 جرمی مورل یکی از جامعترین راهنماهایی رو نوشته که تا حالا درباره استفاده از Wide Eventها و ساخت Attributeهای سفارشی دیدهایم. او نقش مهمی در بهروزرسانی فصل ۵، یعنی «Eventهای ساختاریافته، بلوکهای سازنده مشاهدهپذیری هستن»، داشته و فصل ۶، یعنی «ساخت Eventهای ساختاریافته با عرض دلخواه»، رو بهطور کامل نوشته.
🤖 بوریس تانه Use Caseهای Agentic AI رو بررسی کرده و اصلهای لازم برای تولید و حفظ Context رو توضیح داده؛ چیزی که با حرکت به سمت اتوماسیون بیشتر، همچنان یکی از کلیدهای موفقیته. فکر میکنیم از اصلهایی که او در فصل ۱۰، یعنی «نقش ایجنتهای AI در مشاهدهپذیری»، مطرح کرده لذت میبری.
📏 مت واین یک مطالعه موردی عمیق درباره پذیرش SLOها ارائه داده تا نگاه بهروزتری به چالشها و راهکارهای اونها داشته باشیم. این مورد جایگزین Use Case متمرکز بر Honeycomb شده که قبلاً در فصل ۱۱، یعنی «استفاده از Service-Level Objectiveها برای Reliability»، قرار داشت.
🗄️ تیم مهندسی ClickHouse بررسی عمیقی ارائه داده از اینکه دیتاستور Open Source آنها چطور برای نیازهای Workloadهای مشاهدهپذیری Tune شده. این محتوا در فصل ۱۴، یعنی «ذخیرهسازی کارآمد داده با ClickHouse»، قرار داره. این فصل جدید یک پیادهسازی جایگزین برای Storage Engine شرکت Honeycomb ارائه میده که در فصل ۱۳، یعنی «ذخیرهسازی کارآمد داده با Retriever»، توضیح داده شده.
🔄 مایک کلی با بررسی چالشها و راهکارهای مدیریت Telemetry از زاویه پروژه Open Source به نام Bindplane، محتوای عمیقی برای فصل ۱۶، یعنی «مدیریت Telemetry با پایپلاینها»، ارائه داده.
🔷 فرانک چن که در ویرایش اول هم نویسنده مهمان بود، در ویرایش دوم برگشته تا در فصل ۱۷، یعنی «هستیشناسیها بهعنوان زبان مشترک انسانها و AI»، هستیشناسیها و روش فکر کردن به کل زنجیره Instrumentation رو بررسی کنه.
🚀 هوگو سانتوس نقش زیادی در بهروزرسانی دیدگاه فرانک چن در ویرایش اول درباره Instrument کردن تستها و پایپلاینهای Continuous Delivery داشته. این محتوا در فصل جدید ۱۸، یعنی «مشاهدهپذیری برای پایپلاینهای CI/CD»، قرار گرفته.
📱 هنسون هو و مت کلاین ورکفلوهای پیچیده و چالشبرانگیزی رو بررسی کردهاند که برای پیادهسازی ورکفلوهای دارای مشاهدهپذیری بالا در حوزه دستگاههای Mobile لازم هستن. این مطالب در فصل ۱۹، یعنی «مشاهدهپذیری برای Mobile و Frontend»، ارائه شدهاند.
🧠 فیلیپ کارتر نقش مهمی در بهکارگیری اصلهای این کتاب در دنیای اجرای اپلیکیشنهای Generative AI در پروداکشن داشته. محتوای او در فصل ۲۱، یعنی «مشاهدهپذیری برای مدلهای زبانی بزرگ»، قرار داره.
🏢 کشا میخایلوف روایتی اولشخص از مسیر مشاهدهپذیری در شرکت Fin، که قبلاً Intercom بود، ارائه داده. این روایت در فصل ۲۲، یعنی «مطالعه موردی Fin در مهندسی مدرن»، قرار داره. این فصل نشون میده چطور خیلی از کانسپتهای کتاب در سناریوهای دنیای واقعی کنار هم قرار میگیرن.
📨 دارا کرن نامهای سرگشاده برای مدیران ارشد تکنولوژی یا CTOها نوشته و توضیح داده که سازمان او چطور در عصر AI از مشاهدهپذیری برای حل مسئله افزایش سرعت یادگیری سازمانی استفاده کرده. این محتوا در فصل ۲۳، یعنی «سرعت یادگیری سازمانی حالا بزرگترین محدودیت شماست: نامهای سرگشاده به CTOها»، قرار داره.
🔄 ریک کلارک در فصل ۲۸، یعنی «تغییر سازمانی»، عمیق وارد موضوع ایجاد تغییر بدون داشتن اختیار رسمی شده. این فصل توضیح میده چطور حامیهای داخلی پیدا کنی، اجماع بسازی و تغییرهای تحولآفرین و مختلکننده رو در سیستمهای پیچیده Sociotechnical جلو ببری.
🔐 هیزل ویکلی یک پیشگفتار عالی درباره افقهای در حال تغییر توسعه نرمافزار نوشته و نقش مهمی در فصل ۳۱، یعنی «Instrumentation برای تیمهای مشاهدهپذیری»، داشته؛ مخصوصاً برای تیمهایی که در محیطهای امنیتی شدید کار میکنن.
🛤️ دوم اینکه دو مسیر موازی برای راهنمایی مهندسهایی داریم که کد مینویسن: یک مسیر برای توسعه AI-Assisted و یک مسیر برای توسعه کلاسیک. هر دو مسیر رو در فصلهای مربوط به Instrumentation و تحلیل پیدا میکنی. بهجای اینکه راهنماییها رو به یک تکنولوژی یا ابزار خاص گره بزنیم، اصلهای لازم برای موفقیت و تأثیر اونها روی خروجی رو توضیح میدیم.
🧭 در نهایت، ساختار مطالب رو بر اساس نقشهای کاری مختلف به گروههای فصلی تقسیم کردهایم. ویرایش اول این کتاب «درباره مشاهدهپذیری» و برای «همه» بود. این ویرایش تلاش میکنه یک ساختار مفهومی هدفمندتر ارائه بده.
👤 درباره نویسندگان
👩💻 چریتی میجرز همبنیانگذار و مدیر ارشد فناوری یا CTO در Honeycomb.io است. او بهطور مرتب در کنفرانسها سخنرانی میکنه و بلاگر توانمندیه.
👩💻 لیز فانگ-جونز، Field CTO در Honeycomb.io است. او سابقه فعالیت بهعنوان Developer Advocate، برگزارکننده فعالیتهای کارگری و اخلاقی، و مهندس Site Reliability یا SRE رو داره. لیز در Honeycomb از کامیونیتیهای SRE و مشاهدهپذیری حمایت میکنه و قبلاً بهعنوان SRE روی محصولهایی از Google Cloud Load Balancer تا Google Flights کار کرده.
👨💼 جورج میراندا مدیر اکوسیستم و همکاریها در Honeycomb.io است. او پیشزمینه قویای در Product Marketing و DevRel داره.
Observability is the only way to engineer, manage, and improve the business-critical systems that customers depend on every day—and as the complexity of software grows, so does the need for observability. With this thoroughly revised second edition, authors Charity Majors, Liz Fong-Jones, and George Miranda take inventory of the current state of the field and explain how practitioners can evolve their observability practices from collecting separate, disparate signals to unified data workflows.
This book is for any software engineering team, large or small, that must understand the unique customer experience in order to ship quality code and features that customers want, at the right velocity. You'll discover the value that observable systems bring and learn concrete steps you can follow to achieve an observability-driven development practice yourself. And four completely new chapters explore recent trends such as large language models, frontend observability, cost optimization/performance engineering, and practical open source tooling.
Table of Contents
Part I. Introduction to Observability
Chapter 1. What Is Observability?
Chapter 2. How Code Crosses Over: Validating Developer Intent in Production
Chapter 3. The Origins of Observability in Software
Part II. Instrumentation Fundamentals
Chapter 4. Getting Started with Instrumentation
Chapter 5. Structured Events Are the Building Blocks of Observability
Chapter 6. Making Structured Events Arbitrarily Wide
Chapter 7. Instrumenting Your Code with OpenTelemetry
Part III. Analysis Workflows
Chapter 8. Getting Started with Observability Analysis
Chapter 9. Observability-Driven Development
Chapter 10. The Role of AI Agents for Observability
Chapter 11. Using Service Level Objectives for Reliability
Part IV. Observability Technical Deep Dives
Chapter 12. Acting on and Debugging SLO-Based Alerts
Chapter 13. Efficient Data Storage with Retriever
Chapter 14. Efficient Data Storage with ClickHouse
Chapter 15. Cheap and Accurate Enough Sampling
Chapter 16. Telemetry Management with Pipelines
Chapter 17. Ontologies as a Shared Language for Humans and AI
Part V. Observability Use Cases
Chapter 18. Observability for CI/CD Pipelines
Chapter 19. Observability for Mobile and Frontend
Chapter 20. Performance Engineering with Observability
Chapter 21. Observability for Large Language Models
Chapter 22. Fin’s Case Study in Modern Engineering
Part VI. Observability Governance
Chapter 23. Organizational Learning Speed Is Now Your Biggest Constraint: An Open Letter to CTOs
Chapter 24. Systems Thinking for Software Delivery
Chapter 25. The Observability Landscape Through a Systems Lens
Chapter 26. The Business Case for Observability
Chapter 27. Diagnosing Your Observability Investment
Chapter 28. The Organizational Shift
Chapter 29. Build Versus Buy (Versus Open Source)
Chapter 30. The Art and Science of Vendor Partnerships
Chapter 31. Instrumentation for Observability Teams
Chapter 32. Where Do We Go from Here?
What’s Different in the Second Edition
First, we have a new coauthor. We are delighted to welcome Austin Parker, with deep subject matter expertise in AI and OpenTelemetry.
We’re also excited to incorporate a broader range of voices for this edition of the book, featuring a stellar lineup of guest writers. The opportunity to spotlight some of the people we look up to and enjoy working with has been one of the greatest pleasures of putting this book together.
In order of presentation in the book:
Second, we have two parallel tracks of guidance for engineers who write code: one track for AI-assisted development and the other for classic development. You’ll find both tracks in each chapter on instrumentation and analysis. Instead of anchoring our guidance in any one particular technology or tool, we describe the principles necessary for success and how they affect outcomes.
Lastly, we’ve restructured the material into chapter groups based on functional roles. The first edition of this book was “about observability,” for “everyone.” This edition aims for a more targeted conceptual structure.
About the Author
Charity Majors is Co-Founder and CTO of Honeycomb.io. She is a frequent conference speaker and talented blogger.
Liz Fong-Jones is Field CTO at Honeycom.io. She has been a developer advocate, labor and ethics organizer, and site reliability engineer (SRE). She’s an advocate at Honeycomb for the SRE and observability communities and previously was an SRE working on products ranging from the Google Cloud Load Balancer to Google Flights.
George Miranda is the Head of Ecosystem and Partnerships at Honeycomb.io. He has a strong background in product marketing and DevRel.









