IlmHamroh
Data Science va sun'iy intellekt/Statistika3/14-dars17 daqiqa
Mundarija (22)

4.3-dars: Tarqoqlik (dispersiya, std, diapazon)

4-QISM — STATISTIKA · 3-dars


1. Kirish va motivatsiya

O'rtacha ma'lumotning markazini ko'rsatadi, lekin hikoyaning yarmi — ikkinchi yarmi tarqoqlik: qiymatlar markaz atrofida jipslashganmi yoki keng yoyilganmi? Ikki sinf bir xil o'rtacha ballga ega bo'lishi mumkin (70), lekin biri [68, 70, 72] (jipslashgan — barcha o'xshash), boshqasi [40, 70, 100] (tarqoq — juda farqli). O'rtacha ularni ajratmaydi — tarqoqlik ajratadi. Asosiy o'lchovlar: diapazon (max-min), dispersiya (variance — o'rtacha kvadratik chetlanish), standart chetlanish (std — dispersiya ildizi, eng ko'p ishlatiladigan), IQR (kvartillararo — chidamli). Nega muhim? (1) To'liq rasm — markaz + tarqoqlik; (2) Xavf/barqarorlik — moliyada std = xavf; (3) ML — standartlashtirish (std) modelga tayyorlash. Bu dars tarqoqlikni chuqur o'rgatadi — ma'lumot qanchalik tarqoq.

Tarqoqlik — ma'lumot markaz atrofida qancha yoyilgan: diapazon (range — max-min; oddiy, chetga sezgir), dispersiya (variance — o'rtacha kvadratik chetlanish), standart chetlanish (std — dispersiya ildizi; eng ko'p, o'sha birlikda), IQR (kvartillararo — Q3-Q1, chidamli), std ma'nosi (68-95-99.7 — 4.6), ddof (populyatsiya vs namuna). Foydalanish: to'liq rasm, xavf, standartlashtirish. Bu 4.2 (markazlashuv), 2.8 (std) bilan bog'liq. Tarqoqlik — std/dispersiya/IQR. Markaz + tarqoqlik. Yoyilish.

Real vaziyat. Data Scientist ikki sinf ballini solishtirdi: A sinf [68, 70, 72], B sinf [40, 70, 100]. O'rtacha bir xil (70) — lekin sinflar butunlay boshqa (A jipslashgan — barcha o'xshash; B tarqoq — juda farqli). Std ajratdi: A std ~1.6 (jipslashgan), B std ~24.5 (tarqoq). O'rtacha yarmi (markaz), std ikkinchi yarmi (tarqoqlik). Moliyada: ikki investitsiya bir xil o'rtacha daromad, lekin biri std past (barqaror — xavfsiz), biri std yuqori (o'zgaruvchan — xavfli). Tarqoqlik to'liq rasmni berdi (markaz + yoyilish). Std — Data Science asosiy o'lchovi (xavf, barqarorlik, standartlashtirish).

Bu darsda tarqoqlikni o'rganamiz.

Bu darsda:

  • Diapazon va dispersiya
  • Standart chetlanish (std)
  • IQR (kvartillararo)
  • std ma'nosi va ishlatilishi
  • Populyatsiya vs namuna (ddof)
  • Tarqoqlik amaliyoti
  • Tarqoqlik tuzoqlari
  • Amaliy: tarqoqlik modeli

ℹ Misollar real numpy/pandas bilan (deterministik) ishlaydi.


2. Nazariya — chuqur tushuntirish

2.1. Diapazon va dispersiya

Eng oddiy va kvadratik:

python
import numpy as np

data = np.array([10, 20, 30, 40, 50])

# DIAPAZON (range) — max - min
data.max() - data.min()    # 40 (oddiy, chetga sezgir)

# DISPERSIYA (variance) — o'rtacha kvadratik chetlanish
data.var()                 # 200.0
# har element o'rtachadan farqi kvadrati, o'rtachasi

Diapazon va dispersiya — oddiy va kvadratik: diapazon (range — max - min; eng oddiy — eng katta va kichik farqi; chetga sezgir — bir chet qiymat buzadi), dispersiya (variance — var(); o'rtacha kvadratik chetlanish — har element o'rtachadan farqi kvadrati, o'rtachasi). Sabab: diapazon (oddiy — chegaralar, lekin faqat 2 nuqta, chet sezgir); dispersiya (hamma element — o'rtachadan farq; kvadrat — manfiy yo'q, katta farq ko'proq jazolanadi). Dispersiya kvadrat birlikda (yosh kv — tushunish qiyin; std yechadi — 2.2). Diapazon (max-min), dispersiya (kvadratik chetlanish). Oddiy vs to'liq. Kvadrat.

2.2. Standart chetlanish (std)

Dispersiya ildizi (eng ko'p):

python
data = np.array([10, 20, 30, 40, 50])

data.std()         # 14.14 (dispersiya ildizi: sqrt(200))
np.sqrt(data.var())  # bir xil

# std — o'RTACHA birlikda (yosh, dollar — tushunarli)
# "o'rtachadan o'rtacha uzoqlik" (taxminan)

Standart chetlanish (std) — dispersiya ildizi: data.std() (dispersiya kvadrat ildizi — sqrt(var); sqrt(200)=14.14). Sabab: dispersiya kvadrat birlikda (yosh kv — tushunish qiyin); std ildizini oladi → o'sha birlikda (yosh, dollar — tushunarli); eng ko'p ishlatiladi (tarqoqlik — std). std ma'nosi — "o'rtachadan o'rtacha uzoqlik" (taxminan — qiymatlar markazdan qancha uzoq). Katta std (tarqoq), kichik std (jipslashgan). std — dispersiya ildizi (std, o'sha birlik). Eng ko'p. Tushunarli.

2.3. IQR (kvartillararo)

Chidamli tarqoqlik:

python
data = np.array([1, 2, 3, 4, 5, 6, 7, 8, 100])

Q1 = np.percentile(data, 25)    # 1-kvartil (25%)
Q3 = np.percentile(data, 75)    # 3-kvartil (75%)
IQR = Q3 - Q1                    # kvartillararo

# CHIDAMLI (chet qiymat ta'sir qilmaydi — 100 buzmaydi)
# outlier: Q1 - 1.5*IQR dan past yoki Q3 + 1.5*IQR dan yuqori

IQR (kvartillararo) — chidamli tarqoqlik: Q1 = percentile(data, 25) (1-kvartil — 25% pastda), Q3 = percentile(data, 75) (3-kvartil — 75%), IQR = Q3 - Q1 (o'rta 50% yoyilishi). Sabab: std/diapazon chetga sezgir (outlier buzadi); IQR — o'rta 50% (chet tashqarida — ta'sir qilmaydi; chidamli — median kabi 4.2). Outlier aniqlash: Q1 - 1.5*IQR dan past yoki Q3 + 1.5*IQR dan yuqori (box plot — 5-qism). IQR (chidamli — median hamrohi), std (sezgir — o'rtacha hamrohi). IQR — kvartillararo (Q3-Q1, chidamli). Chet. Outlier.

2.4. std ma'nosi va ishlatilishi

std ma'nosi va ishlatilishi: ma'no — qiymatlar markazdan o'rtacha uzoqlik (katta std — tarqoq, keng; kichik std — jipslashgan, markazga yaqin); 68-95-99.7 qoidasi (normal taqsimot — 4.6: ~68% ma'lumot o'rtacha ± 1 std, ~95% ± 2 std, ~99.7% ± 3 std); ishlatilish: (1) xavf (moliya — std = o'zgaruvchanlik = xavf; yuqori std — xavfli investitsiya), (2) barqarorlik (kichik std — barqaror, ishonchli), (3) standartlashtirish (z-score = (x - o'rtacha)/std — 2.6; ML tayyorgarlik), (4) outlier (o'rtacha ± 3 std tashqari — chet). Sabab: std tarqoqlikni o'lchaydi (markaz yetmaydi — yoyilish muhim: xavf, barqarorlik); Data Science'da keng (xavf, standartlashtirish). std ma'nosi — o'rtacha uzoqlik (68-95-99.7). Xavf. Standartlashtirish.

2.5. Populyatsiya vs namuna (ddof)

Populyatsiya vs namuna (ddof) — bo'luvchi farqi: populyatsiya std (std() — NumPy standart, ddof=0; bo'luvchi N), namuna std (std(ddof=1) — bo'luvchi N-1; namuna uchun). Sabab: namuna populyatsiyani baholaganda (4.1 — namuna → populyatsiya); namuna std populyatsiya std'ni kam baholaydi (namuna markazga yaqinroq); N-1 (Bessel tuzatishi) buni to'g'rilaydi (biroz kattaroq — xolisroq). NumPy standart ddof=0 (populyatsiya); Pandas standart ddof=1 (namuna!) — farqli! Ehtiyot (NumPy std() vs Pandas .std() — turli natija). Amalda ko'pincha ddof=1 (namuna — real ma'lumot). Populyatsiya/namuna — ddof (0 vs 1). Bessel. NumPy/Pandas farq.

2.6. Tarqoqlik amaliyoti

Tarqoqlik amaliyoti: diapazon (max-min — oddiy chegara); std (std — eng ko'p, o'sha birlik); dispersiya (var — kvadrat); IQR (percentile 75-25 — chidamli, outlier); markaz + tarqoqlik (mean+std yoki median+IQR); ddof (namuna ddof=1); 68-95-99.7 (std ma'nosi — 4.6); standartlashtirish (z-score — std). Tuzoqlar: markazsiz tarqoqlik (birga kerak), ddof (NumPy 0, Pandas 1 — farq), std chetga sezgir (outlier — IQR), dispersiya birlik (kvadrat — std), IQR/std chalkash. Amaliyot — std, IQR, markaz+tarqoqlik, ddof. Yoyilish. To'liq rasm.

2.7. Tarqoqlik tuzoqlari

Tarqoqlik asosiy tuzoqlari: markaz yetarli deb (o'rtacha yolg'iz — tarqoqlikni ko'rsatmaydi; [70,70] va [40,100] bir o'rtacha, turli std; markaz + tarqoqlik birga); ddof (NumPy vs Pandas) (NumPy std() — ddof=0 (populyatsiya); Pandas .std() — ddof=1 (namuna); turli natija — chalkash; real ma'lumot ddof=1); std chetga sezgir (outlier std'ni oshiradi (bir chet — katta std); chidamli kerak bo'lsa IQR); dispersiya birlik (variance kvadrat birlik (yosh kv) — tushunish qiyin; std o'sha birlik); IQR/std chalkash (std — o'rtacha hamrohi (sezgir); IQR — median hamrohi (chidamli); mos ishlatish); std manfiy emas (std ≥ 0 — chetlanish; manfiy std xato); kichik namuna std (kam element — beqaror std); std=0 (barcha bir xil — tarqoqlik yo'q; masalan [5,5,5]). Sabab: tarqoqlik markaz/ddof/chet nozik (yolg'iz markaz, ddof, outlier — jim xato). Yechim: markaz+tarqoqlik, ddof to'g'ri, IQR (chet), std birlik. Tuzoqlar — markaz, ddof, chet, birlik.

2.8. Tarqoqlik — hikoyaning ikkinchi yarmi

Tarqoqlik asosiy g'oyasi — hikoyaning ikkinchi yarmi: markaz (o'rtacha — 4.2) ma'lumotning yarmi (qayerda); tarqoqlik ikkinchi yarmi (qancha yoyilgan — jipslashgan yoki keng); ikkisi birga to'liq rasm ([70,70,70] va [40,70,100] bir o'rtacha, turli tarqoqlik — std ajratadi). Diapazon (max-min — oddiy), dispersiya (kvadratik chetlanish), std (dispersiya ildizi — eng ko'p, o'sha birlik, "o'rtacha uzoqlik"), IQR (o'rta 50% — chidamli, outlier). Std ishlatilishi: xavf (moliya — o'zgaruvchanlik), barqarorlik (kichik std — ishonchli), standartlashtirish (z-score — ML), outlier (± 3 std). ddof (namuna ddof=1 — Bessel; NumPy/Pandas farq). Data Science'da tarqoqlik doim (markaz bilan birga — to'liq rasm; xavf; ML tayyorgarlik). Bu 4.2 (markazlashuv) davomi va 4.5 (taqsimot), 4.6 (normal — 68-95-99.7), 2.6 (standartlashtirish) bilan. Tarqoqlik — hikoyaning ikkinchi yarmi (std/IQR). Markaz + tarqoqlik. To'liq rasm.


3. Tez ma'lumotnoma

python
import numpy as np

# DIAPAZON (oddiy, chetga sezgir):
data.max() - data.min()

# DISPERSIYA (kvadratik chetlanish):
data.var()                 # kvadrat birlik (yosh kv)

# STD (dispersiya ildizi — eng ko'p, o'sha birlik):
data.std()                 # "o'rtachadan o'rtacha uzoqlik"
np.sqrt(data.var())        # bir xil

# IQR (kvartillararo — chidamli):
Q1 = np.percentile(data, 25)
Q3 = np.percentile(data, 75)
IQR = Q3 - Q1
# outlier: Q1-1.5*IQR dan past / Q3+1.5*IQR dan yuqori

# DDOF (populyatsiya vs namuna):
data.std()          # NumPy ddof=0 (populyatsiya)
data.std(ddof=1)    # namuna (Bessel, N-1)
#   Pandas .std() — ddof=1 (namuna) — FARQLI!

# 68-95-99.7 (normal — 4.6):
#   ±1 std ~68% · ±2 std ~95% · ±3 std ~99.7%

QOIDA: markaz + tarqoqlik · std (sezgir) IQR (chidamli) · ddof (namuna 1)

Tarqoqlik xulosasi

Tarqoqlik — hikoyaning ikkinchi yarmi (markaz + tarqoqlik)
Diapazon (max-min) · dispersiya (kvadratik) · std (ildiz, eng ko'p)
std — "o'rtachadan o'rtacha uzoqlik" (o'sha birlik)
IQR — o'rta 50% (chidamli, outlier)
ddof — namuna (1, Bessel) · NumPy 0, Pandas 1 (farq!)

4. Batafsil misollar

Misollar real numpy/pandas bilan (deterministik) ishlaydi.

Misol 1 — Ikki sinf (bir o'rtacha, turli std)

python
"""Ikki sinf: bir o'rtacha, turli tarqoqlik (real numpy)."""

import numpy as np


def main() -> None:
    A = np.array([68, 70, 72])      # jipslashgan
    B = np.array([40, 70, 100])     # tarqoq

    print("=== 1. Bir xil o'rtacha ===")
    print(f"  A o'rtacha: {A.mean()}, B o'rtacha: {B.mean()}")

    print("\n=== 2. Turli std ===")
    print(f"  A std: {round(A.std(), 1)} (jipslashgan)")
    print(f"  B std: {round(B.std(), 1)} (tarqoq)")

    print("\n=== 3. Diapazon ===")
    print(f"  A: {A.max()-A.min()}, B: {B.max()-B.min()}")

    print("\n=== 4. Xulosa ===")
    print("  o'rtacha bir xil, tarqoqlik ajratadi")
    print("  ⭐ Std — hikoyaning ikkinchi yarmi")


if __name__ == "__main__":
    main()

Natijaning muhim qismi:

text
=== 1. Bir xil o'rtacha ===
  A o'rtacha: 70.0, B o'rtacha: 70.0

=== 2. Turli std ===
  A std: 1.6 (jipslashgan)
  B std: 24.5 (tarqoq)

=== 3. Diapazon ===
  A: 4, B: 60

=== 4. Xulosa ===
  o'rtacha bir xil, tarqoqlik ajratadi
  ⭐ Std — hikoyaning ikkinchi yarmi

Nima ko'rsatdi: 2.1, 2.2-bo'limlar.

Misol 2 — Diapazon, dispersiya, std

python
"""Diapazon, dispersiya, std (real numpy)."""

import numpy as np


def main() -> None:
    data = np.array([10, 20, 30, 40, 50])

    print("=== 1. Diapazon ===")
    print(f"  max-min: {data.max() - data.min()}")

    print("\n=== 2. Dispersiya (kvadrat) ===")
    print(f"  var: {data.var()} (kvadrat birlik)")

    print("\n=== 3. Std (ildiz) ===")
    print(f"  std: {round(data.std(), 2)} (sqrt(var))")

    print("\n=== 4. Bog'lanish ===")
    print(f"  sqrt(var) == std: {round(np.sqrt(data.var()), 2) == round(data.std(), 2)}")
    print("  ⭐ std = dispersiya ildizi (o'sha birlik)")


if __name__ == "__main__":
    main()

Natijaning muhim qismi:

text
=== 1. Diapazon ===
  max-min: 40

=== 2. Dispersiya (kvadrat) ===
  var: 200.0 (kvadrat birlik)

=== 3. Std (ildiz) ===
  std: 14.14 (sqrt(var))

=== 4. Bog'lanish ===
  sqrt(var) == std: True
  ⭐ std = dispersiya ildizi (o'sha birlik)

Nima ko'rsatdi: 2.1, 2.2-bo'limlar.

Misol 3 — IQR va outlier

python
"""IQR va outlier (real numpy)."""

import numpy as np


def main() -> None:
    data = np.array([10, 12, 14, 15, 16, 18, 20, 100])

    print("=== 1. Kvartillar ===")
    Q1 = np.percentile(data, 25)
    Q3 = np.percentile(data, 75)
    print(f"  Q1: {Q1}, Q3: {Q3}")

    print("\n=== 2. IQR ===")
    IQR = Q3 - Q1
    print(f"  IQR: {IQR} (o'rta 50%)")

    print("\n=== 3. std vs IQR (chet) ===")
    print(f"  std: {round(data.std(), 1)} (100 buzdi)")
    print(f"  IQR: {IQR} (100 ta'sir qilmadi)")

    print("\n=== 4. Outlier chegarasi ===")
    yuqori = Q3 + 1.5 * IQR
    print(f"  outlier > {yuqori}: {list(data[data > yuqori])}")
    print("  ⭐ IQR — chidamli (chet ta'sir qilmaydi)")


if __name__ == "__main__":
    main()

Natijaning muhim qismi:

text
=== 1. Kvartillar ===
  Q1: 13.5, Q3: 18.5

=== 2. IQR ===
  IQR: 5.0 (o'rta 50%)

=== 3. std vs IQR (chet) ===
  std: 28.3 (100 buzdi)
  IQR: 5.0 (100 ta'sir qilmadi)

=== 4. Outlier chegarasi ===
  outlier > 26.0: [np.int64(100)]
  ⭐ IQR — chidamli (chet ta'sir qilmaydi)

Nima ko'rsatdi: 2.3-bo'lim.

Misol 4 — Populyatsiya vs namuna (ddof)

python
"""Populyatsiya vs namuna std (real numpy/pandas)."""

import numpy as np
import pandas as pd


def main() -> None:
    data = np.array([10, 20, 30, 40, 50])

    print("=== 1. NumPy std (ddof=0) ===")
    print(f"  populyatsiya: {round(data.std(), 3)}")

    print("\n=== 2. NumPy namuna (ddof=1) ===")
    print(f"  namuna: {round(data.std(ddof=1), 3)}")

    print("\n=== 3. Pandas std (ddof=1) ===")
    s = pd.Series(data)
    print(f"  Pandas: {round(s.std(), 3)} (namuna!)")

    print("\n=== 4. Farq ===")
    print(f"  NumPy std != Pandas std: {round(data.std(),3) != round(s.std(),3)}")
    print("  ⭐ ddof — NumPy 0 (populyatsiya), Pandas 1 (namuna)")


if __name__ == "__main__":
    main()

Natijaning muhim qismi:

text
=== 1. NumPy std (ddof=0) ===
  populyatsiya: 14.142

=== 2. NumPy namuna (ddof=1) ===
  namuna: 15.811

=== 3. Pandas std (ddof=1) ===
  Pandas: 15.811 (namuna!)

=== 4. Farq ===
  NumPy std != Pandas std: True
  ⭐ ddof — NumPy 0 (populyatsiya), Pandas 1 (namuna)

Nima ko'rsatdi: 2.5-bo'lim.


5. To'g'ri va noto'g'ri tushunishlar

Noto'g'ri fikr To'g'risi
"o'rtacha yetarli" Markaz + tarqoqlik
"std = dispersiya" std = dispersiya ildizi
"NumPy std = Pandas std" ddof farqli (0 vs 1)
"std chetga chidamli" Sezgir (IQR chidamli)
"dispersiya o'sha birlik" Kvadrat (std o'sha)
"IQR = std" IQR chidamli, std sezgir
"std manfiy bo'ladi" ≥ 0 (chetlanish)
"diapazon eng yaxshi" Faqat 2 nuqta (chet sezgir)

6. Keng tarqalgan xatolar va yechimlari

1. Markazsiz tarqoqlik

python
data.mean()   # tarqoqlik yo'q                                # ⚠️
data.mean(), data.std()   # markaz + tarqoqlik                # ✅

2. ddof (NumPy vs Pandas)

python
np.std(data)   # ddof=0 · pd.Series(data).std()   # ddof=1   # ⚠️
data.std(ddof=1)   # namuna uchun aniq                        # ✅

3. std chetga sezgir

python
data.std()   # outlier oshiradi                               # ⚠️
Q3 - Q1   # IQR (chidamli)                                     # ✅

4. Dispersiya birlik

python
data.var()   # kvadrat (yosh kv) — tushunish qiyin              # ⚠️
data.std()   # o'sha birlik (yosh)                             # ✅

5. IQR/std chalkash

python
data.std()   # o'rtacha hamrohi (sezgir)                      # ⚠️
# chet bo'lsa median + IQR (chidamli)                          # ✅

6. Kichik namuna

python
np.std([5, 100])   # beqaror (kam element)                    # ⚠️
# katta namuna (barqaror)                                     # ✅

7. std=0 e'tibor

python
np.std([5, 5, 5])   # 0 (tarqoqlik yo'q)                      # ⚠️
# barcha bir xil — tekshir                                     # ✅

7. Integratsiya — bu bilim qayerda kerak bo'ladi

  • 4.2-dars (o'tilgan): Markazlashuv (markaz + tarqoqlik)
  • 2.6-dars (o'tilgan): Standartlashtirish (z-score — std)
  • 4.6-dars: Normal taqsimot (68-95-99.7)
  • 5-qism: Vizualizatsiya (box plot — IQR)
  • 20-qism: ML (standartlashtirish)

8. Eng yaxshi amaliyotlar

  1. Markaz + tarqoqlik (o'rtacha + std).

  2. std — eng ko'p (o'sha birlik).

  3. IQR — chidamli (chet/outlier).

  4. ddof=1 — namuna (real ma'lumot).

  5. NumPy (ddof=0) vs Pandas (ddof=1) — ehtiyot.

  6. std — xavf/barqarorlik (moliya).

  7. 68-95-99.7 (std ma'nosi).

  8. Tarqoqlik — hikoyaning ikkinchi yarmi.


9. Amaliy topshiriq

Vazifa 1: Bashorat qiling

python
1.  # tarqoqlik nima?
2.  # diapazon nima?
3.  # dispersiya nima?
4.  # std nima?
5.  # std vs dispersiya?
6.  # IQR nima?
7.  # std vs IQR (chet)?
8.  # ddof nima?
9.  # NumPy vs Pandas std?
10. # std ma'nosi?
11. # markaz yetarlimi?
12. # nega tarqoqlik muhim?
Javoblar
  1. Markaz atrofida yoyilish
  2. max - min
  3. O'rtacha kvadratik chetlanish
  4. Dispersiya ildizi
  5. std = sqrt(dispersiya)
  6. Q3 - Q1 (o'rta 50%)
  7. std sezgir, IQR chidamli
  8. Populyatsiya (0) vs namuna (1)
  9. NumPy 0, Pandas 1 (farq)
  10. O'rtachadan o'rtacha uzoqlik
  11. Yo'q (markaz + tarqoqlik)
  12. To'liq rasm, xavf, ML

Vazifa 2: Xatolarni tuzating

python
1.  data.mean()   # to'liq tasvir

2.  np.std(data)   # namuna kerak

3.  data.std()   # chet bor

4.  data.var()   # tushunarli birlik

5.  # o'rtacha bir xil → bir xil ma'lumot
Javoblar
python
1.  data.mean(), data.std()

2.  data.std(ddof=1)

3.  Q3 - Q1 (IQR)

4.  data.std() (o'sha birlik)

5.  std ham tekshir (turli tarqoqlik)

Vazifa 3: Diapazon/dispersiya

Modellang:

  1. Diapazon
  2. Dispersiya
  3. Kvadrat
  4. Oddiy

Vazifa 4: std

Modellang:

  1. Ildiz
  2. O'sha birlik
  3. Eng ko'p
  4. Uzoqlik

Vazifa 5: IQR

Modellang:

  1. Kvartil
  2. O'rta 50%
  3. Chidamli
  4. Outlier

Vazifa 6: ddof

Modellang:

  1. Populyatsiya
  2. Namuna
  3. Bessel
  4. NumPy/Pandas

Vazifa 7: O'ylash

Ikki sinf bir xil o'rtacha ballga (70) ega bo'lishi mumkin, lekin biri [68,70,72] (std past), boshqasi [40,70,100] (std yuqori). Nima uchun o'rtacha yolg'iz ma'lumotni to'liq tasvirlamaydi, va nega "markaz + tarqoqlik" birga statistikaning asosiy juftligi (nega ikkalasi ham kerak)?

Javob

Qisqa javob: O'rtacha yolg'iz to'liq emas, "markaz + tarqoqlik" asosiy juftlik, chunki: (1) markaz faqat qayerda — o'rtacha markazni ko'rsatadi (qiymatlar atrofida — 70), lekin qancha yoyilgan emas ([68,70,72] va [40,70,100] bir markaz — 70; lekin biri jipslashgan, biri tarqoq; o'rtacha ajratmaydi); (2) tarqoqlik qancha yoyilgan — std yoyilishni (past std — jipslashgan, barcha o'xshash; yuqori std — tarqoq, farqli); markaz + tarqoqlik to'liq (qayerda + qancha yoyilgan); (3) turli ma'no — bir o'rtacha, turli tarqoqlik = butunlay boshqa ma'lumot ([68,70,72] — bir xil talabalar; [40,70,100] — juda farqli; qaror boshqa). "Nega ikkalasi kerak": (a) to'liq rasm — markaz (markaz) + tarqoqlik (yoyilish) = ma'lumot shakli (ikkalasi — to'liq; biri — yarim); (b) qaror — markaz bir xil, tarqoqlik turli → turli qaror (A sinf — barcha o'rtacha; B sinf — kuchli va kuchsiz talaba alohida e'tibor; std farqli qaror); (c) xavf — moliyada markaz (daromad) + tarqoqlik (std=xavf); bir xil daromad, turli xavf → turli investitsiya (std past — xavfsiz; std yuqori — xavfli); (d) ishonch — tarqoqlik ishonchni belgilaydi (kichik std — o'rtacha ishonchli, tipik; katta std — o'rtacha kam ma'noli, keng yoyilgan); (e) taqsimot — markaz + tarqoqlik taqsimotni tasvirlaydi (normal — o'rtacha + std to'liq; 4.6). "Nega juftlik": statistika ma'lumotni umumlashtiradi (bitta-ikki son); markaz (bitta — markaz) yetmaydi (yoyilish yo'q); tarqoqlik (ikkinchi — yoyilish) qo'shadi (to'liq); "markaz + tarqoqlik" — minimal to'liq tavsif (ikkalasi — ma'lumot shakli). Saboqlar: markaz faqat qayerda (yoyilish yo'q); tarqoqlik qancha yoyilgan (jips/tarqoq); ikkalasi kerak (to'liq rasm — qaror, xavf, ishonch); juftlik (minimal to'liq tavsif). To'g'ri: markaz + tarqoqlik birga (mean, std yoki median, IQR); bitta yetmaydi (yarim hikoya). Muvozanat: soddalik (bitta son — markaz) vs to'liqlik (ikki son — markaz+tarqoqlik); to'liqlik afzal (ikkalasi — to'g'ri tushunish). Bu statistika asosiy juftlik (markaz + tarqoqlik — ma'lumot shakli; biri yetmaydi); "o'rtacha yolg'iz aldaydi" (tarqoqlik yashirin). Doim ikkalasi (mean+std — to'liq rasm).

1. Nega markaz yolg'iz to'liq emas

  • Markaz faqat qayerda (atrofida — 70)
  • Yoyilish yo'q ([68,70,72] va [40,70,100] bir markaz)
  • O'rtacha ajratmaydi (jips/tarqoq)

2. Nega tarqoqlik kerak

  • Qancha yoyilgan (past std jips, yuqori tarqoq)
  • Markaz + tarqoqlik = to'liq
  • Turli ma'no (bir markaz, turli ma'lumot)

3. Nega ikkalasi (juftlik)

  • To'liq rasm (markaz + yoyilish — shakl)
  • Qaror (turli tarqoqlik — turli qaror)
  • Xavf (moliya — daromad + std)
  • Ishonch (std — o'rtacha ishonchi)

4. Bir markaz, turli tarqoqlik

A [68,70,72] B [40,70,100]
O'rtacha 70 O'rtacha 70
Std past (jips) Std yuqori (tarqoq)
Bir xil talaba Juda farqli

5. Saboqlar

  1. Markaz faqat qayerda (yoyilish yo'q)
  2. Tarqoqlik qancha yoyilgan
  3. Ikkalasi kerak (to'liq rasm)
  4. Juftlik (minimal to'liq tavsif)

6. Xulosa

  1. Markaz yolg'iz to'liq emas (yoyilish yo'q)
  2. Tarqoqlik — ikkinchi yarim
  3. Markaz + tarqoqlik (asosiy juftlik)
  4. Doim ikkalasi (mean+std — to'liq)

Nimani mustahkamlaydi: 2.2, 2.8-bo'limlar.


Xulosa

Bu darsda tarqoqlikni o'rgandik.

Eng muhim uch fikr:

  1. Diapazon, dispersiya, std. Diapazon (max-min — oddiy, chetga sezgir), dispersiya (var — o'rtacha kvadratik chetlanish; kvadrat birlik — tushunish qiyin), std (std — dispersiya ildizi; o'sha birlik — tushunarli, eng ko'p; "o'rtachadan o'rtacha uzoqlik"). Std ma'nosi — qiymatlar markazdan uzoqlik (katta — tarqoq, kichik — jipslashgan; 68-95-99.7 — 4.6).

  2. IQR va ddof. IQR (kvartillararo — Q3 - Q1, o'rta 50%; chidamli — chet ta'sir qilmaydi, median hamrohi; outlier: Q1-1.5*IQR past / Q3+1.5*IQR yuqori). ddof (populyatsiya vs namuna) — std() NumPy ddof=0 (populyatsiya), std(ddof=1) namuna (Bessel N-1); Pandas .std() standart ddof=1 (NumPy'dan farqli — ehtiyot!).

  3. Ikkinchi yarim. Std ishlatilishi — xavf (moliya — o'zgaruvchanlik), barqarorlik (kichik std — ishonchli), standartlashtirish (z-score — ML 2.6), outlier (± 3 std). Tarqoqlik — hikoyaning ikkinchi yarmi (markaz — qayerda; tarqoqlik — qancha yoyilgan; ikkisi birga to'liq rasm — bir o'rtacha, turli std = boshqa ma'lumot). Data Science'da doim (markaz + tarqoqlik — qaror, xavf, ishonch). Tuzoqlar: markazsiz tarqoqlik (birga), ddof (NumPy 0/Pandas 1), std chetga sezgir (IQR), dispersiya birlik (kvadrat — std).

Keyingi darsda kvartillar va persentillarni o'rganamiz: ma'lumotni 100 qismga bo'lish — persentil, kvartil, box plot asoslari (ma'lumot taqsimotini ko'rish).

Ulashish:Telegram'da

Izohlar (0)

Izoh yozish uchun kiring.

  • Hozircha izoh yo'q. Birinchi bo'ling!
4.3-dars: Tarqoqlik (dispersiya, std, diapazon) — IlmHamroh