تجزیه و تحلیل داده های اولیه را انجام دهید

ساخت وبلاگ

این فصل شامل فرمول های ریاضی است ، اما اجازه ندهید که شما را ترساند! آنها گام به گام توضیح داده می شوند.

در فصل آخر ، دوست شما تخمین زده است که سفر شما چه مدت طول بکشد. اما او به شما اقدامات گرایش اصلی را به شما داد ، مانند مثلاً میانگین ، که در این حالت 60 دقیقه در هر سفر بود.

آنچه اکنون باید بدانید این است که آیا مدت زمان سفرهای دوست شما در حدود 60 دقیقه "محکم خوشه بندی شده" (به عنوان مثال: [58 ، 60 ، 62 ، 59 ، 57.])) یا اینکه آیا آنها پراکنده تر پراکنده شده اند (مثال: [[[[40 ، 70 ، 78 ، 43 ، . etc.]).

اگر مقادیر محکم حدود 60 دقیقه خوشه ای داشته باشید ، می خواهید 75 دقیقه قبل از آن بگذارید. به این ترتیب ، شما احتمالاً 5 یا 10 دقیقه قبل از مصاحبه خود خواهید رسید. اما اگر مقادیر بسیار از هم فاصله دارند ، باید 100 دقیقه قبل از مصاحبه خود بگذارید ، زیرا این سفر کاملاً ممکن است 80 دقیقه طول بکشد!

من آن را دریافت می کنم! محاسبه مقدار گسترش. من حدس می زنم که یک اقدام آماری برای آن وجود دارد؟

کاملا! حتی چندین نفر نیز وجود دارد. به آنها اقدامات پراکندگی گفته می شود.

فکر کردن از طریق

بیایید سعی کنیم شاخص پراکندگی ، گام به گام را ایجاد کنیم. برای نشان دادن آن ، ما از مقادیر زیر (70 ، 60 ، 50 ، 55 ، 55 ، 65 ، 65) استفاده خواهیم کرد و به هر یک از آنها نام می دهیم: $ (xi ) $ ، با $ (i )$ مقادیر از 1 تا 7. بنابراین نام های ارزش ما از $ (x1 ) $ به $ (x7 ) $ اجرا می شود.

به طور رسمی ، این بیان شده است: $ ((x_1. x_n) = (70 ، 60 ، 50 ، 55 ، 55 ، 65 ، 65) ) $ ، با $ (n = 7 ) $.

توجه داشته باشید که میانگین این مقادیر 60 است ، که $ ( overline = 60 ) $ نوشته شده است ، و "x bar" تلفظ می شود.

اقدامات پراکندگی آسان است! بیایید تمام مقادیر خود را بگیریم و انحراف را از میانگین برای هر یک از آنها محاسبه کنیم. سپس همه انحرافات را اضافه خواهیم کرد.

این شروع خوبی استاز آنجا که میانگین ما 60 است ، انحراف $ (xi ) $ از میانگین عبارتند از: $ ((x_1- overline. x_7- overline) = (10،0 ، -10 ، -5 ، -5 ،5،5) ) $. به جز ، اگر همه آنها را اضافه کنیم ، 0 می گیریم! ما می توانیم این ریاضیات را نشان دهیم: مهم نیست که ارزش شما چقدر پراکنده شده است ، جمع انحراف از میانگین همیشه 0 خواهد بود. بسیار مفید نیست.

این فقط 0 است به این دلیل که تعداد مثبت و منفی وجود دارد. بیایید با مربع کردن همه آنها به این نتیجه برسیم. شماره مربع همیشه مثبت است ، مگر نه؟

درست است! هنگامی که ما این کار را انجام می دهیم ، این چیزی است که ما می گیریم: $ (((x_1- overline)^2. (x_7- overline)^2) = (100،0،100،25،25،25،25) ) $. حال اگر همه این مقادیر را اضافه کنیم ، 300 دریافت می کنیم.

در اینجا ، ما مبلغ تمام $ ((x_i- overline)^2 ) $ را با $ (i ) $ مقادیر از 1 تا 7 محاسبه کردیم.

باشه. اما یک مشکل دیگر وجود دارددر اینجا ما 7 ارزش داریم ، فقط به این دلیل که ما کمی تنبل هستیم و فقط جمع آوری شده 7. اما در آمار ، هرچه بیشتر جمع می کنیم ، ایده ای بهتر از آنچه توصیف می کنیم داریم. بنابراین ما باید 10 ، 100 یا حتی 1000 مقدار جمع آوری می کردیم!

با این حال ، با 1000 مقدار ، اندازه گیری ما منفجر می شود! این از 300 با 7 ارزش به 40،000،000،000 ، با 1000 ارزش می رود. این یک مشکل است

بنابراین ، به جای محاسبه مبلغ و منفجر کردن نشانگر ما ، اجازه می دهیم میانگین را بگیریم. چه 7 مقدار یا 1000 وجود داشته باشد ، میانگین منفجر نمی شود.

ایده خوبی است. میانگین (100،0،100،25،25،25،25) 42. 86 است.

برای به دست آوردن میانگین 42. 86 ، ما به سادگی 300 را بر اساس تعداد مقادیر تقسیم کردیم: 7. فرمول قبلی را با $ ( frac ) $ ضرب کردیم ، که به ما داد

اقدامات پراکندگی

واریانس تجربی

حدس بزن چی شده! شاخصی که ما فقط ساخته ایم یکی از شاخص های متداول در آمار است! به آن واریانس تجربی گفته می شود.

همانطور که فقط دیدیم ، برابر با $ (v = frac sum _^(x_i- overline)^2 ) $ است

برای رفتن بیشتر به جنبه محاسبات ، در انتهای فصل به بخش بعدی آن بروید. همچنین یک نسخه "اصلاح شده" از واریانس تجربی را که به آن بی طرفانه است ، مشاهده خواهید کرد. برای این کار من شما را به بخش بعدی Take It ارجاع می دهم.: Magicien:

انحراف معیار

انحراف استاندارد به سادگی ریشه مربع واریانس است. این اغلب به طور خلاصه STD است. در حقیقت ، وقتی واریانس تجربی زمان سفر خود را محاسبه می کنیم ، نتیجه در یک واحد دقیقه $ (^2 ) $ بیان می شود ، که بسیار قابل درک نیست. اگر ریشه مربع را بگیریم ، واحد دقیقه می شود. در اینجا ، انحراف استاندارد ما 6. 55 دقیقه است. نوشته شده است

اما انحراف استاندارد 6. 55 دقیقه برای سفر 1 ساعت (به طور متوسط) همان انحراف استاندارد 6. 55 دقیقه برای سفر 24 ساعته (به طور متوسط) نیست! به این ضریب تغییر گفته می شود ، که در بخش بعدی آن خواهید یافت.

دامنه بین کوارتلی

میانه را به خاطر می آورید؟این مقدار "میانی" است که مقادیر بالاتر و پایین را تقسیم می کند.

کوارتیل همان چیز است ، به جز مقادیر تقسیم بر چهارم. بنابراین سه کوارتیل وجود دارد که $ (q_1 ) $ (کوارتیل اول) ، $ (q_2 ) $ (کوارتیل دوم) و $ (q_3 ) $ (کوارتیل سوم) وجود دارد. اینگونه کار می کند:

• 1/4 از مقادیر زیر $ (q_1 ) $ ، 3/4 در بالا است.

• 2/4 از مقادیر زیر $ (q_2 ) $ ، 2/4 بالاتر است ($ (q_2 ) $ میانه است!).

• 3/4 مقادیر زیر $ (q_3 ) $ ، 1/4 بالاتر است.

مفهوم کلی در پشت این به عنوان Quantile of Order alpha $ ( alpha ) $ شناخته شده است. بنابراین ، میانه مقدار سفارش 0. 5 است. Q1 مقدار سفارش 0. 25 است. و Q3 کمی سفارش 0. 75 است. همچنین DECKES (مقدار سفارش 0. 1 ، 0. 2 و غیره) و سانتیل ها نیز وجود دارد که به آنها صدک نیز گفته می شود (مقدار سفارش 0. 01 ، 0. 02 و غیره).

دامنه بین کورتیل تفاوت بین کوارتیل 3 و کوارتیل 1 است:

توطئه های جعبه و whisker (توطئه های جعبه)

جعبه و ویسکر: چه نام خنده دار! مردم فرانسوی آن را "جعبه سبیل" می نامند.

یک طرح جعبه راهی برای نمایش گرافیکی گروههای داده عددی از طریق کوارتیل های آنها است تا میزان پراکندگی در داده ها را نشان دهد.$ (q_1 ) $ و $ (q_3 ) $ طرفین جعبه را تعیین می کنند ، و میانه اغلب در داخل نشان داده می شود. خطوط ("ویسکرها") سپس به صورت عمودی از جعبه گسترش می یابند تا کمترین و بالاترین مقادیر را نشان دهند. مشروط بر اینکه این خطوط (در هر دو طرف جعبه) در فاصله 1. 5 IQR از کوارتیل های فوقانی و تحتانی محدوده بین کوارتیل قرار داشته باشند. مقادیر زیر $ (q_3 - 1. 5iq ) $ یا بالاتر از $ (Q_3 + 1. 5iq ) $ $ در نظر گرفته می شوند. آنها در The Whisker گنجانده نشده اند:

Box and Whisker Plot

طرح جعبه و ویسکر

توطئه های جعبه و هیستوگرام همان هدف را دارند: برای ارائه نشانه ای از توزیع تجربی. توطئه های جعبه ممکن است نسبت به هیستوگرام ابتدایی تر به نظر برسند ، اما این مزیت را دارند که مقایسه توزیع بیش از یک متغیر را آسان تر می کنند (مقایسه دو قطعه جعبه آسانتر از دو هیستوگرام).

اکنون برای کد.

برای واریانس تجربی و انحراف استاندارد ، همان اصل مانند فصل گذشته اعمال می شود: ما روشهای VAR () و STD () را برای متغیر مورد نظر خود می نامیم. افشای کامل: این دو روش نتایج را باز می گردانند که تا حدودی از مواردی که با فرمول داده های فوق دریافت می کنید متفاوت است. این ما را به "برآوردگرهای مغرضانه" تبدیل می کند (برای این کار ، انگیزه بیشتری در بین ما می تواند به بخش اشاره کند: واریانس تجربی). برای به دست آوردن نتایج توضیح داده شده در بالا ، باید DDOF = 0 را اضافه کنیم (خطوط 8 و 9).

ما توطئه های جعبه را با هیستوگرام نمایش خواهیم داد ، بنابراین می توانید مقایسه کنید :). در خط 12 ، کلمه کلیدی vert = false وجود دارد زیرا ما نمی خواهیم طرح جعبه عمودی باشد (می خواهیم افقی باشد!). گرفتن کد از فصل قبلی ما ، در اینجا آنچه را که می گیریم آمده است:

واریانس مبلغ معامله برای دسته اجاره تهی است ، به این معنی که مبلغ اجاره همیشه یکسان است.

آن را بیشتر کنید: واریانس تجربی اصلاح شده

بهترین راه برای برآورد واریانس یک متغیر تصادفی (یعنی واریانس نظری) واریانس تجربی نیست.

تعجب آور ، نه؟آره. وقتی در محاسبات عمیق می شویم ، می بینیم که واریانس تجربی مقادیری را نشان می دهد (به طور متوسط) از واریانس متغیر تصادفی.

این ما را به مفهوم تعصب برآوردگر سوق می دهد. یک برآوردگر بی طرف بهتر از یک برآوردگر مغرضانه است و واریانس تجربی یک برآوردگر مغرضانه از واریانس یک متغیر تصادفی است.

واریانس تجربی اصلاح شده یا بی طرفانه برای اصلاح این تعصب تهیه شده است. این اغلب به عنوان $ (s '^2 ) $ بیان می شود ، و برابر با $ (s'^2 = fracv ) $ است ، جایی که $ (v ) $ واریانس تجربی است ، و $ $ (n ) $ اندازه نمونه است. هنگامی که اندازه نمونه بزرگ است ، واریانس تجربی و واریانس تجربی بی طرفانه تقریباً برابر است.

بیشتر از آن استفاده کنید: محاسبات با استفاده از واریانس تجربی

ما می توانیم با محاسبه نشان دهیم که واریانس تجربی $ (v ) $ نیز می تواند به صورت بسیار عملی بیان شود:

این قضیه Koenig-Huygens است. برای تظاهرات ، به اینجا بروید.

اگر متغیر جدید $ (y ) $ را بر اساس یک متغیر $ (x ) $ ایجاد کنیم که واریانس $ (vx ) $ شناخته شده است ، و $ (y = ax+b ) $ ، مامی توانید واریانس $ (y ) $ را پیدا کنید ، که $ (vy ) $ نوشته شده است! این رابطه با این رابطه ارائه می شود: $ (vy = a2vx ) $.

آن را بیشتر کنید: ضریب تغییر

هنگام مسافرت ، یک انحراف استاندارد 6. 55 دقیقه برای سفر 1 ساعت همان انحراف استاندارد 6. 55 دقیقه برای سفر 24 ساعته نیست! در حالت اول ، انحراف استاندارد نسبتاً بزرگ دیده می شود ، در حالی که در مورد دوم ، طی یک دوره 24 ساعته ناچیز تلقی می شود.

ضریب تنوع برای رسیدگی به این موضوع ایجاد شده است. این انحراف استاندارد است که با میانگین تقسیم می شود:

آن را بیشتر کنید: سایر اقدامات پراکندگی

در ابتدای این فصل ، ما گفتیم:

بیایید همه اعداد را مربع کنیم - تعداد مربع همیشه مثبت است ، درست است؟

وقتی این را گفتیم ، شاید شما فکر کردید:

آیا نمی توانیم به جای مربع کردن عدد ، مقدار مطلق را نیز بگیریم؟

کاملا.؛) وقتی این کار را انجام می دهیم ، میانگین انحراف مطلق را محاسبه می کنیم.

دو نسخه وجود دارد: یکی که در آن انحراف از میانگین را محاسبه می کنیم ، دیگری که در آن انحراف از میانه را محاسبه می کنیم.

در اینجا نسخه با میانه وجود دارد:

اگر می خواهید یک محاسبه قوی تر داشته باشید ، می توانیم انحراف مطلق را نیز تعریف کنیم ، که میانگین انحراف مطلق از مدیان داده ها است.

فارکس حرفه ای...
ما را در سایت فارکس حرفه ای دنبال می کنید

برچسب : نویسنده : مرتضی احباب بازدید : <-PostHit-> تاريخ : يکشنبه 21 اسفند 1401 ساعت: 16:37