Mundarija (22)
- 1. Kirish va motivatsiya
- 2. Nazariya — chuqur tushuntirish
- 2.1. Diapazon va dispersiya
- 2.2. Standart chetlanish (std)
- 2.3. IQR (kvartillararo)
- 2.4. std ma'nosi va ishlatilishi
- 2.5. Populyatsiya vs namuna (ddof)
- 2.6. Tarqoqlik amaliyoti
- 2.7. Tarqoqlik tuzoqlari
- 2.8. Tarqoqlik — hikoyaning ikkinchi yarmi
- 3. Tez ma'lumotnoma
- 4. Batafsil misollar
- Misol 1 — Ikki sinf (bir o'rtacha, turli std)
- Misol 2 — Diapazon, dispersiya, std
- Misol 3 — IQR va outlier
- Misol 4 — Populyatsiya vs namuna (ddof)
- 5. To'g'ri va noto'g'ri tushunishlar
- 6. Keng tarqalgan xatolar va yechimlari
- 7. Integratsiya — bu bilim qayerda kerak bo'ladi
- 8. Eng yaxshi amaliyotlar
- 9. Amaliy topshiriq
- Xulosa
4.3-dars: Tarqoqlik (dispersiya, std, diapazon)
4-QISM — STATISTIKA · 3-dars
1. Kirish va motivatsiya
O'rtacha ma'lumotning markazini ko'rsatadi, lekin hikoyaning yarmi — ikkinchi yarmi tarqoqlik: qiymatlar markaz atrofida jipslashganmi yoki keng yoyilganmi? Ikki sinf bir xil o'rtacha ballga ega bo'lishi mumkin (70), lekin biri [68, 70, 72] (jipslashgan — barcha o'xshash), boshqasi [40, 70, 100] (tarqoq — juda farqli). O'rtacha ularni ajratmaydi — tarqoqlik ajratadi. Asosiy o'lchovlar: diapazon (max-min), dispersiya (variance — o'rtacha kvadratik chetlanish), standart chetlanish (std — dispersiya ildizi, eng ko'p ishlatiladigan), IQR (kvartillararo — chidamli). Nega muhim? (1) To'liq rasm — markaz + tarqoqlik; (2) Xavf/barqarorlik — moliyada std = xavf; (3) ML — standartlashtirish (std) modelga tayyorlash. Bu dars tarqoqlikni chuqur o'rgatadi — ma'lumot qanchalik tarqoq.
Tarqoqlik — ma'lumot markaz atrofida qancha yoyilgan: diapazon (range — max-min; oddiy, chetga sezgir), dispersiya (variance — o'rtacha kvadratik chetlanish), standart chetlanish (std — dispersiya ildizi; eng ko'p, o'sha birlikda), IQR (kvartillararo — Q3-Q1, chidamli), std ma'nosi (68-95-99.7 — 4.6), ddof (populyatsiya vs namuna). Foydalanish: to'liq rasm, xavf, standartlashtirish. Bu 4.2 (markazlashuv), 2.8 (std) bilan bog'liq. Tarqoqlik — std/dispersiya/IQR. Markaz + tarqoqlik. Yoyilish.
Real vaziyat. Data Scientist ikki sinf ballini solishtirdi: A sinf [68, 70, 72], B sinf [40, 70, 100]. O'rtacha bir xil (70) — lekin sinflar butunlay boshqa (A jipslashgan — barcha o'xshash; B tarqoq — juda farqli). Std ajratdi: A std ~1.6 (jipslashgan), B std ~24.5 (tarqoq). O'rtacha yarmi (markaz), std ikkinchi yarmi (tarqoqlik). Moliyada: ikki investitsiya bir xil o'rtacha daromad, lekin biri std past (barqaror — xavfsiz), biri std yuqori (o'zgaruvchan — xavfli). Tarqoqlik to'liq rasmni berdi (markaz + yoyilish). Std — Data Science asosiy o'lchovi (xavf, barqarorlik, standartlashtirish).
Bu darsda tarqoqlikni o'rganamiz.
Bu darsda:
- Diapazon va dispersiya
- Standart chetlanish (std)
- IQR (kvartillararo)
- std ma'nosi va ishlatilishi
- Populyatsiya vs namuna (ddof)
- Tarqoqlik amaliyoti
- Tarqoqlik tuzoqlari
- Amaliy: tarqoqlik modeli
ℹ Misollar real numpy/pandas bilan (deterministik) ishlaydi.
2. Nazariya — chuqur tushuntirish
2.1. Diapazon va dispersiya
Eng oddiy va kvadratik:
import numpy as np
data = np.array([10, 20, 30, 40, 50])
# DIAPAZON (range) — max - min
data.max() - data.min() # 40 (oddiy, chetga sezgir)
# DISPERSIYA (variance) — o'rtacha kvadratik chetlanish
data.var() # 200.0
# har element o'rtachadan farqi kvadrati, o'rtachasi Diapazon va dispersiya — oddiy va kvadratik: diapazon (range — max - min; eng oddiy — eng katta va kichik farqi; chetga sezgir — bir chet qiymat buzadi), dispersiya (variance — var(); o'rtacha kvadratik chetlanish — har element o'rtachadan farqi kvadrati, o'rtachasi). Sabab: diapazon (oddiy — chegaralar, lekin faqat 2 nuqta, chet sezgir); dispersiya (hamma element — o'rtachadan farq; kvadrat — manfiy yo'q, katta farq ko'proq jazolanadi). Dispersiya kvadrat birlikda (yosh kv — tushunish qiyin; std yechadi — 2.2). Diapazon (max-min), dispersiya (kvadratik chetlanish). Oddiy vs to'liq. Kvadrat.
2.2. Standart chetlanish (std)
Dispersiya ildizi (eng ko'p):
data = np.array([10, 20, 30, 40, 50])
data.std() # 14.14 (dispersiya ildizi: sqrt(200))
np.sqrt(data.var()) # bir xil
# std — o'RTACHA birlikda (yosh, dollar — tushunarli)
# "o'rtachadan o'rtacha uzoqlik" (taxminan) Standart chetlanish (std) — dispersiya ildizi: data.std() (dispersiya kvadrat ildizi — sqrt(var); sqrt(200)=14.14). Sabab: dispersiya kvadrat birlikda (yosh kv — tushunish qiyin); std ildizini oladi → o'sha birlikda (yosh, dollar — tushunarli); eng ko'p ishlatiladi (tarqoqlik — std). std ma'nosi — "o'rtachadan o'rtacha uzoqlik" (taxminan — qiymatlar markazdan qancha uzoq). Katta std (tarqoq), kichik std (jipslashgan). std — dispersiya ildizi (std, o'sha birlik). Eng ko'p. Tushunarli.
2.3. IQR (kvartillararo)
Chidamli tarqoqlik:
data = np.array([1, 2, 3, 4, 5, 6, 7, 8, 100])
Q1 = np.percentile(data, 25) # 1-kvartil (25%)
Q3 = np.percentile(data, 75) # 3-kvartil (75%)
IQR = Q3 - Q1 # kvartillararo
# CHIDAMLI (chet qiymat ta'sir qilmaydi — 100 buzmaydi)
# outlier: Q1 - 1.5*IQR dan past yoki Q3 + 1.5*IQR dan yuqori IQR (kvartillararo) — chidamli tarqoqlik: Q1 = percentile(data, 25) (1-kvartil — 25% pastda), Q3 = percentile(data, 75) (3-kvartil — 75%), IQR = Q3 - Q1 (o'rta 50% yoyilishi). Sabab: std/diapazon chetga sezgir (outlier buzadi); IQR — o'rta 50% (chet tashqarida — ta'sir qilmaydi; chidamli — median kabi 4.2). Outlier aniqlash: Q1 - 1.5*IQR dan past yoki Q3 + 1.5*IQR dan yuqori (box plot — 5-qism). IQR (chidamli — median hamrohi), std (sezgir — o'rtacha hamrohi). IQR — kvartillararo (Q3-Q1, chidamli). Chet. Outlier.
2.4. std ma'nosi va ishlatilishi
std ma'nosi va ishlatilishi: ma'no — qiymatlar markazdan o'rtacha uzoqlik (katta std — tarqoq, keng; kichik std — jipslashgan, markazga yaqin); 68-95-99.7 qoidasi (normal taqsimot — 4.6: ~68% ma'lumot o'rtacha ± 1 std, ~95% ± 2 std, ~99.7% ± 3 std); ishlatilish: (1) xavf (moliya — std = o'zgaruvchanlik = xavf; yuqori std — xavfli investitsiya), (2) barqarorlik (kichik std — barqaror, ishonchli), (3) standartlashtirish (z-score = (x - o'rtacha)/std — 2.6; ML tayyorgarlik), (4) outlier (o'rtacha ± 3 std tashqari — chet). Sabab: std tarqoqlikni o'lchaydi (markaz yetmaydi — yoyilish muhim: xavf, barqarorlik); Data Science'da keng (xavf, standartlashtirish). std ma'nosi — o'rtacha uzoqlik (68-95-99.7). Xavf. Standartlashtirish.
2.5. Populyatsiya vs namuna (ddof)
Populyatsiya vs namuna (ddof) — bo'luvchi farqi: populyatsiya std (std() — NumPy standart, ddof=0; bo'luvchi N), namuna std (std(ddof=1) — bo'luvchi N-1; namuna uchun). Sabab: namuna populyatsiyani baholaganda (4.1 — namuna → populyatsiya); namuna std populyatsiya std'ni kam baholaydi (namuna markazga yaqinroq); N-1 (Bessel tuzatishi) buni to'g'rilaydi (biroz kattaroq — xolisroq). NumPy standart ddof=0 (populyatsiya); Pandas standart ddof=1 (namuna!) — farqli! Ehtiyot (NumPy std() vs Pandas .std() — turli natija). Amalda ko'pincha ddof=1 (namuna — real ma'lumot). Populyatsiya/namuna — ddof (0 vs 1). Bessel. NumPy/Pandas farq.
2.6. Tarqoqlik amaliyoti
Tarqoqlik amaliyoti: diapazon (max-min — oddiy chegara); std (std — eng ko'p, o'sha birlik); dispersiya (var — kvadrat); IQR (percentile 75-25 — chidamli, outlier); markaz + tarqoqlik (mean+std yoki median+IQR); ddof (namuna ddof=1); 68-95-99.7 (std ma'nosi — 4.6); standartlashtirish (z-score — std). Tuzoqlar: markazsiz tarqoqlik (birga kerak), ddof (NumPy 0, Pandas 1 — farq), std chetga sezgir (outlier — IQR), dispersiya birlik (kvadrat — std), IQR/std chalkash. Amaliyot — std, IQR, markaz+tarqoqlik, ddof. Yoyilish. To'liq rasm.
2.7. Tarqoqlik tuzoqlari
Tarqoqlik asosiy tuzoqlari: markaz yetarli deb (o'rtacha yolg'iz — tarqoqlikni ko'rsatmaydi; [70,70] va [40,100] bir o'rtacha, turli std; markaz + tarqoqlik birga); ddof (NumPy vs Pandas) (NumPy std() — ddof=0 (populyatsiya); Pandas .std() — ddof=1 (namuna); turli natija — chalkash; real ma'lumot ddof=1); std chetga sezgir (outlier std'ni oshiradi (bir chet — katta std); chidamli kerak bo'lsa IQR); dispersiya birlik (variance kvadrat birlik (yosh kv) — tushunish qiyin; std o'sha birlik); IQR/std chalkash (std — o'rtacha hamrohi (sezgir); IQR — median hamrohi (chidamli); mos ishlatish); std manfiy emas (std ≥ 0 — chetlanish; manfiy std xato); kichik namuna std (kam element — beqaror std); std=0 (barcha bir xil — tarqoqlik yo'q; masalan [5,5,5]). Sabab: tarqoqlik markaz/ddof/chet nozik (yolg'iz markaz, ddof, outlier — jim xato). Yechim: markaz+tarqoqlik, ddof to'g'ri, IQR (chet), std birlik. Tuzoqlar — markaz, ddof, chet, birlik.
2.8. Tarqoqlik — hikoyaning ikkinchi yarmi
Tarqoqlik asosiy g'oyasi — hikoyaning ikkinchi yarmi: markaz (o'rtacha — 4.2) ma'lumotning yarmi (qayerda); tarqoqlik ikkinchi yarmi (qancha yoyilgan — jipslashgan yoki keng); ikkisi birga to'liq rasm ([70,70,70] va [40,70,100] bir o'rtacha, turli tarqoqlik — std ajratadi). Diapazon (max-min — oddiy), dispersiya (kvadratik chetlanish), std (dispersiya ildizi — eng ko'p, o'sha birlik, "o'rtacha uzoqlik"), IQR (o'rta 50% — chidamli, outlier). Std ishlatilishi: xavf (moliya — o'zgaruvchanlik), barqarorlik (kichik std — ishonchli), standartlashtirish (z-score — ML), outlier (± 3 std). ddof (namuna ddof=1 — Bessel; NumPy/Pandas farq). Data Science'da tarqoqlik doim (markaz bilan birga — to'liq rasm; xavf; ML tayyorgarlik). Bu 4.2 (markazlashuv) davomi va 4.5 (taqsimot), 4.6 (normal — 68-95-99.7), 2.6 (standartlashtirish) bilan. Tarqoqlik — hikoyaning ikkinchi yarmi (std/IQR). Markaz + tarqoqlik. To'liq rasm.
3. Tez ma'lumotnoma
import numpy as np
# DIAPAZON (oddiy, chetga sezgir):
data.max() - data.min()
# DISPERSIYA (kvadratik chetlanish):
data.var() # kvadrat birlik (yosh kv)
# STD (dispersiya ildizi — eng ko'p, o'sha birlik):
data.std() # "o'rtachadan o'rtacha uzoqlik"
np.sqrt(data.var()) # bir xil
# IQR (kvartillararo — chidamli):
Q1 = np.percentile(data, 25)
Q3 = np.percentile(data, 75)
IQR = Q3 - Q1
# outlier: Q1-1.5*IQR dan past / Q3+1.5*IQR dan yuqori
# DDOF (populyatsiya vs namuna):
data.std() # NumPy ddof=0 (populyatsiya)
data.std(ddof=1) # namuna (Bessel, N-1)
# Pandas .std() — ddof=1 (namuna) — FARQLI!
# 68-95-99.7 (normal — 4.6):
# ±1 std ~68% · ±2 std ~95% · ±3 std ~99.7%
QOIDA: markaz + tarqoqlik · std (sezgir) IQR (chidamli) · ddof (namuna 1)Tarqoqlik xulosasi
Tarqoqlik — hikoyaning ikkinchi yarmi (markaz + tarqoqlik)
Diapazon (max-min) · dispersiya (kvadratik) · std (ildiz, eng ko'p)
std — "o'rtachadan o'rtacha uzoqlik" (o'sha birlik)
IQR — o'rta 50% (chidamli, outlier)
ddof — namuna (1, Bessel) · NumPy 0, Pandas 1 (farq!)4. Batafsil misollar
Misollar real numpy/pandas bilan (deterministik) ishlaydi.
Misol 1 — Ikki sinf (bir o'rtacha, turli std)
"""Ikki sinf: bir o'rtacha, turli tarqoqlik (real numpy)."""
import numpy as np
def main() -> None:
A = np.array([68, 70, 72]) # jipslashgan
B = np.array([40, 70, 100]) # tarqoq
print("=== 1. Bir xil o'rtacha ===")
print(f" A o'rtacha: {A.mean()}, B o'rtacha: {B.mean()}")
print("\n=== 2. Turli std ===")
print(f" A std: {round(A.std(), 1)} (jipslashgan)")
print(f" B std: {round(B.std(), 1)} (tarqoq)")
print("\n=== 3. Diapazon ===")
print(f" A: {A.max()-A.min()}, B: {B.max()-B.min()}")
print("\n=== 4. Xulosa ===")
print(" o'rtacha bir xil, tarqoqlik ajratadi")
print(" ⭐ Std — hikoyaning ikkinchi yarmi")
if __name__ == "__main__":
main()Natijaning muhim qismi:
=== 1. Bir xil o'rtacha ===
A o'rtacha: 70.0, B o'rtacha: 70.0
=== 2. Turli std ===
A std: 1.6 (jipslashgan)
B std: 24.5 (tarqoq)
=== 3. Diapazon ===
A: 4, B: 60
=== 4. Xulosa ===
o'rtacha bir xil, tarqoqlik ajratadi
⭐ Std — hikoyaning ikkinchi yarmiNima ko'rsatdi: 2.1, 2.2-bo'limlar.
Misol 2 — Diapazon, dispersiya, std
"""Diapazon, dispersiya, std (real numpy)."""
import numpy as np
def main() -> None:
data = np.array([10, 20, 30, 40, 50])
print("=== 1. Diapazon ===")
print(f" max-min: {data.max() - data.min()}")
print("\n=== 2. Dispersiya (kvadrat) ===")
print(f" var: {data.var()} (kvadrat birlik)")
print("\n=== 3. Std (ildiz) ===")
print(f" std: {round(data.std(), 2)} (sqrt(var))")
print("\n=== 4. Bog'lanish ===")
print(f" sqrt(var) == std: {round(np.sqrt(data.var()), 2) == round(data.std(), 2)}")
print(" ⭐ std = dispersiya ildizi (o'sha birlik)")
if __name__ == "__main__":
main()Natijaning muhim qismi:
=== 1. Diapazon ===
max-min: 40
=== 2. Dispersiya (kvadrat) ===
var: 200.0 (kvadrat birlik)
=== 3. Std (ildiz) ===
std: 14.14 (sqrt(var))
=== 4. Bog'lanish ===
sqrt(var) == std: True
⭐ std = dispersiya ildizi (o'sha birlik)Nima ko'rsatdi: 2.1, 2.2-bo'limlar.
Misol 3 — IQR va outlier
"""IQR va outlier (real numpy)."""
import numpy as np
def main() -> None:
data = np.array([10, 12, 14, 15, 16, 18, 20, 100])
print("=== 1. Kvartillar ===")
Q1 = np.percentile(data, 25)
Q3 = np.percentile(data, 75)
print(f" Q1: {Q1}, Q3: {Q3}")
print("\n=== 2. IQR ===")
IQR = Q3 - Q1
print(f" IQR: {IQR} (o'rta 50%)")
print("\n=== 3. std vs IQR (chet) ===")
print(f" std: {round(data.std(), 1)} (100 buzdi)")
print(f" IQR: {IQR} (100 ta'sir qilmadi)")
print("\n=== 4. Outlier chegarasi ===")
yuqori = Q3 + 1.5 * IQR
print(f" outlier > {yuqori}: {list(data[data > yuqori])}")
print(" ⭐ IQR — chidamli (chet ta'sir qilmaydi)")
if __name__ == "__main__":
main()Natijaning muhim qismi:
=== 1. Kvartillar ===
Q1: 13.5, Q3: 18.5
=== 2. IQR ===
IQR: 5.0 (o'rta 50%)
=== 3. std vs IQR (chet) ===
std: 28.3 (100 buzdi)
IQR: 5.0 (100 ta'sir qilmadi)
=== 4. Outlier chegarasi ===
outlier > 26.0: [np.int64(100)]
⭐ IQR — chidamli (chet ta'sir qilmaydi)Nima ko'rsatdi: 2.3-bo'lim.
Misol 4 — Populyatsiya vs namuna (ddof)
"""Populyatsiya vs namuna std (real numpy/pandas)."""
import numpy as np
import pandas as pd
def main() -> None:
data = np.array([10, 20, 30, 40, 50])
print("=== 1. NumPy std (ddof=0) ===")
print(f" populyatsiya: {round(data.std(), 3)}")
print("\n=== 2. NumPy namuna (ddof=1) ===")
print(f" namuna: {round(data.std(ddof=1), 3)}")
print("\n=== 3. Pandas std (ddof=1) ===")
s = pd.Series(data)
print(f" Pandas: {round(s.std(), 3)} (namuna!)")
print("\n=== 4. Farq ===")
print(f" NumPy std != Pandas std: {round(data.std(),3) != round(s.std(),3)}")
print(" ⭐ ddof — NumPy 0 (populyatsiya), Pandas 1 (namuna)")
if __name__ == "__main__":
main()Natijaning muhim qismi:
=== 1. NumPy std (ddof=0) ===
populyatsiya: 14.142
=== 2. NumPy namuna (ddof=1) ===
namuna: 15.811
=== 3. Pandas std (ddof=1) ===
Pandas: 15.811 (namuna!)
=== 4. Farq ===
NumPy std != Pandas std: True
⭐ ddof — NumPy 0 (populyatsiya), Pandas 1 (namuna)Nima ko'rsatdi: 2.5-bo'lim.
5. To'g'ri va noto'g'ri tushunishlar
| Noto'g'ri fikr | To'g'risi |
|---|---|
| "o'rtacha yetarli" | Markaz + tarqoqlik |
| "std = dispersiya" | std = dispersiya ildizi |
| "NumPy std = Pandas std" | ddof farqli (0 vs 1) |
| "std chetga chidamli" | Sezgir (IQR chidamli) |
| "dispersiya o'sha birlik" | Kvadrat (std o'sha) |
| "IQR = std" | IQR chidamli, std sezgir |
| "std manfiy bo'ladi" | ≥ 0 (chetlanish) |
| "diapazon eng yaxshi" | Faqat 2 nuqta (chet sezgir) |
6. Keng tarqalgan xatolar va yechimlari
1. Markazsiz tarqoqlik
data.mean() # tarqoqlik yo'q # ⚠️
data.mean(), data.std() # markaz + tarqoqlik # ✅2. ddof (NumPy vs Pandas)
np.std(data) # ddof=0 · pd.Series(data).std() # ddof=1 # ⚠️
data.std(ddof=1) # namuna uchun aniq # ✅3. std chetga sezgir
data.std() # outlier oshiradi # ⚠️
Q3 - Q1 # IQR (chidamli) # ✅4. Dispersiya birlik
data.var() # kvadrat (yosh kv) — tushunish qiyin # ⚠️
data.std() # o'sha birlik (yosh) # ✅5. IQR/std chalkash
data.std() # o'rtacha hamrohi (sezgir) # ⚠️
# chet bo'lsa median + IQR (chidamli) # ✅6. Kichik namuna
np.std([5, 100]) # beqaror (kam element) # ⚠️
# katta namuna (barqaror) # ✅7. std=0 e'tibor
np.std([5, 5, 5]) # 0 (tarqoqlik yo'q) # ⚠️
# barcha bir xil — tekshir # ✅7. Integratsiya — bu bilim qayerda kerak bo'ladi
- 4.2-dars (o'tilgan): Markazlashuv (markaz + tarqoqlik)
- 2.6-dars (o'tilgan): Standartlashtirish (z-score — std)
- 4.6-dars: Normal taqsimot (68-95-99.7)
- 5-qism: Vizualizatsiya (box plot — IQR)
- 20-qism: ML (standartlashtirish)
8. Eng yaxshi amaliyotlar
Markaz + tarqoqlik (o'rtacha + std).
std — eng ko'p (o'sha birlik).
IQR — chidamli (chet/outlier).
ddof=1 — namuna (real ma'lumot).
NumPy (ddof=0) vs Pandas (ddof=1) — ehtiyot.
std — xavf/barqarorlik (moliya).
68-95-99.7 (std ma'nosi).
Tarqoqlik — hikoyaning ikkinchi yarmi.
9. Amaliy topshiriq
Vazifa 1: Bashorat qiling
1. # tarqoqlik nima?
2. # diapazon nima?
3. # dispersiya nima?
4. # std nima?
5. # std vs dispersiya?
6. # IQR nima?
7. # std vs IQR (chet)?
8. # ddof nima?
9. # NumPy vs Pandas std?
10. # std ma'nosi?
11. # markaz yetarlimi?
12. # nega tarqoqlik muhim?Javoblar
- Markaz atrofida yoyilish
- max - min
- O'rtacha kvadratik chetlanish
- Dispersiya ildizi
- std = sqrt(dispersiya)
- Q3 - Q1 (o'rta 50%)
- std sezgir, IQR chidamli
- Populyatsiya (0) vs namuna (1)
- NumPy 0, Pandas 1 (farq)
- O'rtachadan o'rtacha uzoqlik
- Yo'q (markaz + tarqoqlik)
- To'liq rasm, xavf, ML
Vazifa 2: Xatolarni tuzating
1. data.mean() # to'liq tasvir
2. np.std(data) # namuna kerak
3. data.std() # chet bor
4. data.var() # tushunarli birlik
5. # o'rtacha bir xil → bir xil ma'lumotJavoblar
1. data.mean(), data.std()
2. data.std(ddof=1)
3. Q3 - Q1 (IQR)
4. data.std() (o'sha birlik)
5. std ham tekshir (turli tarqoqlik)Vazifa 3: Diapazon/dispersiya
Modellang:
- Diapazon
- Dispersiya
- Kvadrat
- Oddiy
Vazifa 4: std
Modellang:
- Ildiz
- O'sha birlik
- Eng ko'p
- Uzoqlik
Vazifa 5: IQR
Modellang:
- Kvartil
- O'rta 50%
- Chidamli
- Outlier
Vazifa 6: ddof
Modellang:
- Populyatsiya
- Namuna
- Bessel
- NumPy/Pandas
Vazifa 7: O'ylash
Ikki sinf bir xil o'rtacha ballga (70) ega bo'lishi mumkin, lekin biri [68,70,72] (std past), boshqasi [40,70,100] (std yuqori). Nima uchun o'rtacha yolg'iz ma'lumotni to'liq tasvirlamaydi, va nega "markaz + tarqoqlik" birga statistikaning asosiy juftligi (nega ikkalasi ham kerak)?
Javob
Qisqa javob: O'rtacha yolg'iz to'liq emas, "markaz + tarqoqlik" asosiy juftlik, chunki: (1) markaz faqat qayerda — o'rtacha markazni ko'rsatadi (qiymatlar atrofida — 70), lekin qancha yoyilgan emas ([68,70,72] va [40,70,100] bir markaz — 70; lekin biri jipslashgan, biri tarqoq; o'rtacha ajratmaydi); (2) tarqoqlik qancha yoyilgan — std yoyilishni (past std — jipslashgan, barcha o'xshash; yuqori std — tarqoq, farqli); markaz + tarqoqlik to'liq (qayerda + qancha yoyilgan); (3) turli ma'no — bir o'rtacha, turli tarqoqlik = butunlay boshqa ma'lumot ([68,70,72] — bir xil talabalar; [40,70,100] — juda farqli; qaror boshqa). "Nega ikkalasi kerak": (a) to'liq rasm — markaz (markaz) + tarqoqlik (yoyilish) = ma'lumot shakli (ikkalasi — to'liq; biri — yarim); (b) qaror — markaz bir xil, tarqoqlik turli → turli qaror (A sinf — barcha o'rtacha; B sinf — kuchli va kuchsiz talaba alohida e'tibor; std farqli qaror); (c) xavf — moliyada markaz (daromad) + tarqoqlik (std=xavf); bir xil daromad, turli xavf → turli investitsiya (std past — xavfsiz; std yuqori — xavfli); (d) ishonch — tarqoqlik ishonchni belgilaydi (kichik std — o'rtacha ishonchli, tipik; katta std — o'rtacha kam ma'noli, keng yoyilgan); (e) taqsimot — markaz + tarqoqlik taqsimotni tasvirlaydi (normal — o'rtacha + std to'liq; 4.6). "Nega juftlik": statistika ma'lumotni umumlashtiradi (bitta-ikki son); markaz (bitta — markaz) yetmaydi (yoyilish yo'q); tarqoqlik (ikkinchi — yoyilish) qo'shadi (to'liq); "markaz + tarqoqlik" — minimal to'liq tavsif (ikkalasi — ma'lumot shakli). Saboqlar: markaz faqat qayerda (yoyilish yo'q); tarqoqlik qancha yoyilgan (jips/tarqoq); ikkalasi kerak (to'liq rasm — qaror, xavf, ishonch); juftlik (minimal to'liq tavsif). To'g'ri: markaz + tarqoqlik birga (mean, std yoki median, IQR); bitta yetmaydi (yarim hikoya). Muvozanat: soddalik (bitta son — markaz) vs to'liqlik (ikki son — markaz+tarqoqlik); to'liqlik afzal (ikkalasi — to'g'ri tushunish). Bu statistika asosiy juftlik (markaz + tarqoqlik — ma'lumot shakli; biri yetmaydi); "o'rtacha yolg'iz aldaydi" (tarqoqlik yashirin). Doim ikkalasi (mean+std — to'liq rasm).
1. Nega markaz yolg'iz to'liq emas
- Markaz faqat qayerda (atrofida — 70)
- Yoyilish yo'q ([68,70,72] va [40,70,100] bir markaz)
- O'rtacha ajratmaydi (jips/tarqoq)
2. Nega tarqoqlik kerak
- Qancha yoyilgan (past std jips, yuqori tarqoq)
- Markaz + tarqoqlik = to'liq
- Turli ma'no (bir markaz, turli ma'lumot)
3. Nega ikkalasi (juftlik)
- To'liq rasm (markaz + yoyilish — shakl)
- Qaror (turli tarqoqlik — turli qaror)
- Xavf (moliya — daromad + std)
- Ishonch (std — o'rtacha ishonchi)
4. Bir markaz, turli tarqoqlik
| A [68,70,72] | B [40,70,100] |
|---|---|
| O'rtacha 70 | O'rtacha 70 |
| Std past (jips) | Std yuqori (tarqoq) |
| Bir xil talaba | Juda farqli |
5. Saboqlar
- Markaz faqat qayerda (yoyilish yo'q)
- Tarqoqlik qancha yoyilgan
- Ikkalasi kerak (to'liq rasm)
- Juftlik (minimal to'liq tavsif)
6. Xulosa
- Markaz yolg'iz to'liq emas (yoyilish yo'q)
- Tarqoqlik — ikkinchi yarim
- Markaz + tarqoqlik (asosiy juftlik)
- Doim ikkalasi (mean+std — to'liq)
Nimani mustahkamlaydi: 2.2, 2.8-bo'limlar.
Xulosa
Bu darsda tarqoqlikni o'rgandik.
Eng muhim uch fikr:
Diapazon, dispersiya, std. Diapazon (
max-min— oddiy, chetga sezgir), dispersiya (var— o'rtacha kvadratik chetlanish; kvadrat birlik — tushunish qiyin), std (std— dispersiya ildizi; o'sha birlik — tushunarli, eng ko'p; "o'rtachadan o'rtacha uzoqlik"). Std ma'nosi — qiymatlar markazdan uzoqlik (katta — tarqoq, kichik — jipslashgan; 68-95-99.7 — 4.6).IQR va ddof. IQR (kvartillararo —
Q3 - Q1, o'rta 50%; chidamli — chet ta'sir qilmaydi, median hamrohi; outlier:Q1-1.5*IQRpast /Q3+1.5*IQRyuqori). ddof (populyatsiya vs namuna) —std()NumPyddof=0(populyatsiya),std(ddof=1)namuna (BesselN-1); Pandas.std()standartddof=1(NumPy'dan farqli — ehtiyot!).Ikkinchi yarim. Std ishlatilishi — xavf (moliya — o'zgaruvchanlik), barqarorlik (kichik std — ishonchli), standartlashtirish (z-score — ML 2.6), outlier (± 3 std). Tarqoqlik — hikoyaning ikkinchi yarmi (markaz — qayerda; tarqoqlik — qancha yoyilgan; ikkisi birga to'liq rasm — bir o'rtacha, turli std = boshqa ma'lumot). Data Science'da doim (markaz + tarqoqlik — qaror, xavf, ishonch). Tuzoqlar: markazsiz tarqoqlik (birga), ddof (NumPy 0/Pandas 1), std chetga sezgir (IQR), dispersiya birlik (kvadrat — std).
Keyingi darsda kvartillar va persentillarni o'rganamiz: ma'lumotni 100 qismga bo'lish — persentil, kvartil, box plot asoslari (ma'lumot taqsimotini ko'rish).
Izohlar (0)
Izoh yozish uchun kiring.
- Hozircha izoh yo'q. Birinchi bo'ling!