IlmHamroh
Data Science va sun'iy intellekt/Statistika8/14-dars17 daqiqa
Mundarija (22)

4.8-dars: Namuna olish

4-QISM — STATISTIKA · 8-dars


1. Kirish va motivatsiya

Xulosaviy statistika namunaga tayanadi 4.1-bob — lekin namuna qanday olinadi hal qiluvchi. Yomon namuna butun tahlilni buzadi ("garbage in, garbage out"). Tarixning eng mashhur xatosi: 1936-yil AQSh saylovi bashorati — 2 million kishi so'ralgan, lekin bashorat butunlay noto'g'ri chiqdi, chunki namuna vakilli emas edi (faqat boy qatlam). Bu darsda to'g'ri namuna olish usullarini (tasodifiy, qatlamli, klasterli) va bias (yon berish) turlarini o'rganamiz. Namuna sifati — miqdordan muhimroq (kichik vakilli namuna katta noxolis namunadan yaxshiroq). Nega muhim? (1) Ishonchli xulosa — namuna → populyatsiya to'g'ri; (2) Bias oldini — noxolislikni ko'rish; (3) Amaliy — so'rovnoma, tajriba, ML ma'lumot. Bu dars namuna olishni o'rgatadi — ishonchli xulosa uchun namuna sifati.

Namuna olish — vakilli namuna: tasodifiy namuna (har a'zo teng imkon — xolis), qatlamli (stratified — guruhlar mutanosib: yosh/jins), klasterli (guruhlar tanlash — arzon), bias turlari (tanlov bias, o'z-o'zini tanlash, javobsiz), sifat vs miqdor (vakilli > katta noxolis), np.random.choice (tasodifiy). Foydalanish: ishonchli xulosa, bias oldini, so'rovnoma. Bu 4.1 (namuna), 4.7 (MLT) bilan bog'liq. Namuna — tasodifiy/qatlamli. Bias. Sifat.

Real vaziyat. Data Scientist mamlakat fikrini o'rganmoqchi edi. Yomon namuna: faqat shahar markazida so'rov (qishloq yo'q — tanlov bias; noto'g'ri xulosa). Yaxshi namuna: tasodifiy (butun mamlakatdan har kishi teng imkon — np.random.choice); yoki qatlamli (yosh/jins/hudud mutanosib — populyatsiya kabi: 50% erkak, 30% yosh...). Tarixiy misol: 1936 AQSh (2 million so'rov — lekin telefon/avtomobil egalari, boy qatlam; noto'g'ri bashorat); kichik vakilli namuna (50000 — Gallup) to'g'ri topdi. Sifat > miqdor (vakilli muhim, katta emas). Namuna olish ishonchli xulosa berdi (vakilli — populyatsiya aks etadi). Namuna sifati — Data Science poydevori.

Bu darsda namuna olishni o'rganamiz.

Bu darsda:

  • Tasodifiy namuna
  • Qatlamli namuna
  • Bias turlari
  • Sifat vs miqdor
  • Namuna kattaligini tanlash
  • Namuna amaliyoti
  • Namuna tuzoqlari
  • Amaliy: namuna modeli

ℹ Misollar real numpy/pandas bilan (deterministik) ishlaydi.


2. Nazariya — chuqur tushuntirish

2.1. Tasodifiy namuna

Har a'zo teng imkon:

python
import numpy as np

np.random.seed(0)
populyatsiya = np.arange(1, 10001)   # 10000 kishi

# TASODIFIY namuna (har kishi teng imkon — xolis)
namuna = np.random.choice(populyatsiya, 100, replace=False)
# replace=False — takrorsiz (bir kishi bir marta)

# tasodifiy → vakilli (bias yo'q)

Tasodifiy namuna (simple random sample) — har a'zo teng imkon: np.random.choice(populyatsiya, n, replace=False) (har kishi tanlanish ehtimoli teng — takrorsiz). Sabab: xolis (bias yo'q — har a'zo teng; ma'lum guruh afzal ko'rilmaydi); tasodifiy → vakilli (populyatsiyani aks ettiradi — barcha guruh mutanosib, o'rtachada). Bu eng asosiy usul (oltin standart — xolis). replace=False (takrorsiz — bir kishi bir marta). Tasodifiy bias oldini (teng imkon — noxolislik yo'q). Tasodifiy namuna — teng imkon (choice; xolis). Vakilli. Oltin standart.

2.2. Qatlamli namuna

Guruhlar mutanosib:

python
import numpy as np
import pandas as pd

# QATLAMLI (stratified) — har guruhdan mutanosib
# populyatsiya: 70% shahar, 30% qishloq
# namuna ham: 70% shahar, 30% qishloq (mutanosib)

df = pd.DataFrame({"hudud": ["shahar"]*700 + ["qishloq"]*300})
namuna = df.groupby("hudud", group_keys=False).apply(
    lambda g: g.sample(frac=0.1, random_state=0)
)
# har guruhdan 10% (mutanosib)

Qatlamli namuna (stratified) — guruhlar mutanosib: populyatsiyani guruhlarga (qatlam — yosh, jins, hudud) bo'lib, har guruhdan mutanosib namuna (populyatsiyada 70% shahar → namunada ham 70%). Sabab: tasodifiy namuna kichik guruhni o'tkazib yuborishi mumkin (tasodifan kam qishloq); qatlamli kafolatlaydi (har guruh mutanosib — vakilli, aniqroq). Foydalanish: muhim guruhlar (kichik lekin muhim — kam uchraydigan kasallik; qatlamli — yetarli namuna). Qatlamli (guruh mutanosib) > tasodifiy (ba'zan guruh o'tib ketadi). Qatlamli namuna — guruhlar mutanosib (stratified). Vakilli. Aniqroq.

2.3. Bias turlari

Bias turlari (yon berish) — namunani buzadi: (1) tanlov bias (selection — namuna vakilli emas; faqat shahar so'rov → mamlakat deb; ma'lum guruh o'tib ketadi), (2) o'z-o'zini tanlash (self-selection — kim xohlasa javob beradi; onlayn so'rov — faqat qiziqqanlar; noxolis), (3) javobsizlik (nonresponse — ba'zi guruh javob bermaydi; band odamlar — o'tib ketadi), (4) omon qolgan bias (survivorship — faqat "omon qolgan" ko'rinadi; muvaffaqiyatli kompaniyalar — bankrotlar ko'rinmaydi). Sabab: bias namunani populyatsiyadan farqli qiladi (noxolis — xato xulosa); jim (sezilmaydi — 1936 AQSh). Katta namuna bias'ni tuzatmaydi (2 million noxolis — hali noto'g'ri). Bias turlari — tanlov, o'z-o'zini tanlash, javobsizlik, omon qolgan. Noxolis. Jim.

2.4. Sifat vs miqdor

Sifat vs miqdor — vakillik muhimroq: kichik vakilli namuna (xolis — populyatsiya aks etadi) > katta noxolis (bias — noto'g'ri, katta bo'lsa ham). Sabab: bias miqdor bilan tuzatilmaydi (2 million noxolis — hali noto'g'ri; 1936 AQSh); vakillik sifat (populyatsiyani to'g'ri aks ettiradi). Misol: 1936 (2 million — noxolis, xato) vs Gallup 50000 (vakilli — to'g'ri); kichik lekin xolis g'olib. Lekin vakilli + katta eng yaxshi (xolis va aniq — SE kichik 4.7). Miqdor faqat vakilli bo'lsa foydali (bias bo'lsa — behuda). Sifat > miqdor (vakilli muhim). Bias tuzatilmaydi. Vakillik.

2.5. Namuna kattaligini tanlash

Namuna kattaligini tanlash — qancha kerak: kattaroq → aniqroq (SE = std/√n — kichik SE; 4.7), lekin √n (foyda sekinlashadi — 100→400 yaxshi, keyin kam); balans (aniqlik vs qimmat — katta namuna qimmat/sekin); kerakli aniqlik (ishonch oralig'i kengligi — 4.13; ± 3% uchun ~1000 kishi so'rovnoma standart). Sabab: namuna yetarli bo'lishi kerak (kichik — ishonchsiz, katta SE) lekin cheksiz emas (√n — qimmatlashadi, kam foyda); kerakli aniqlikka qarab (ishonch kengligi). So'rovnoma: ~1000 (± 3%), ~400 (± 5%). Vakillik birinchi (kattalik keyin — noxolis katta behuda). Namuna kattaligi — kattaroq aniqroq (√n, balans). Aniqlik. Vakillik birinchi.

2.6. Namuna amaliyoti

Namuna amaliyoti: tasodifiy (np.random.choice(replace=False) — xolis); qatlamli (guruh mutanosib — groupby.sample); vakillik tekshir (namuna guruhlari ~ populyatsiya); bias e'tibor (kim o'tib ketdi — qishloq, band); sifat > miqdor (vakilli birinchi); namuna kattaligi (kerakli aniqlik — ~1000 so'rov); random_state (takrorlanuvchi — 2.10). Tuzoqlar: bias (noxolis — vakilli tekshir), katta noxolis (miqdor tuzatmaydi), qulay namuna (yaqin — noxolis), o'z-o'zini tanlash (onlayn). Amaliyot — tasodifiy, qatlamli, bias, sifat. Vakillik. Xolis.

2.7. Namuna tuzoqlari

Namuna asosiy tuzoqlari: qulay namuna (convenience — yaqin/oson olingan (do'stlar, o'tgan-ketgan); vakilli emas — noxolis; eng ko'p xato); katta noxolis (bias'ni miqdor tuzatmaydi — 2 million noxolis hali noto'g'ri; vakillik birinchi); o'z-o'zini tanlash (onlayn so'rov, sharh — faqat qiziqqanlar/norozilar javob beradi; noxolis); javobsizlik (ba'zi guruh javob bermaydi — band, keksa; o'tib ketadi); omon qolgan bias (faqat "omon qolgan" — muvaffaqiyatli startaplar (bankrotlar yo'q); noto'g'ri xulosa); 1936 tuzog'i (katta lekin noxolis — mashhur xato); populyatsiyani noto'g'ri aniqlash (kimni o'rganmoqchisiz — noto'g'ri populyatsiya); replace tuzog'i (replace=True — takror; so'rovda replace=False). Sabab: namuna bias/vakillik nozik (qulay, noxolis, o'z-o'zini tanlash — jim xato, xulosa buziladi). Yechim: tasodifiy/qatlamli, vakillik tekshir, sifat > miqdor. Tuzoqlar — qulay namuna, katta noxolis, o'z-o'zini tanlash, omon qolgan.

2.8. Namuna — ishonchli xulosaning poydevori

Namuna olish asosiy g'oyasi — ishonchli xulosaning poydevori: xulosaviy statistika 4.1-bob namunadan populyatsiya haqida xulosa; namuna qanday olingan hal qiluvchi (yomon namuna → yomon xulosa — "garbage in, garbage out"). Tasodifiy (har a'zo teng imkon — xolis, vakilli; oltin standart), qatlamli (guruhlar mutanosib — kichik guruh kafolat, aniqroq). Bias (tanlov, o'z-o'zini tanlash, javobsizlik, omon qolgan) namunani buzadi (noxolis — jim xato; katta namuna tuzatmaydi). Sifat > miqdor (vakilli kichik > noxolis katta; 1936 AQSh — mashhur xato). Namuna kattaligi (kerakli aniqlik — √n, balans). Data Science'da doim (so'rovnoma, tajriba, ML ma'lumot — vakilli namuna; noxolis ma'lumot → noxolis model). Bu 4.1 (namuna vs populyatsiya) davomi va 4.7 (MLT — namuna o'rtachasi), 4.13 (ishonch) uchun. Namuna — ishonchli xulosaning poydevori (tasodifiy, qatlamli, bias). Vakillik. Sifat.


3. Tez ma'lumotnoma

python
import numpy as np
import pandas as pd

# TASODIFIY (har a'zo teng imkon — xolis):
np.random.choice(populyatsiya, 100, replace=False)

# QATLAMLI (guruhlar mutanosib):
df.groupby("guruh", group_keys=False).apply(
    lambda g: g.sample(frac=0.1, random_state=0)
)

# BIAS TURLARI (noxolis):
#   tanlov bias (vakilli emas — faqat shahar)
#   o'z-o'zini tanlash (onlayn — qiziqqanlar)
#   javobsizlik (band guruh o'tib ketadi)
#   omon qolgan (faqat muvaffaqiyatli)

# SIFAT vs MIQDOR:
#   vakilli kichik > noxolis katta
#   bias miqdor bilan tuzatilmaydi (1936 AQSh)

# NAMUNA KATTALIGI:
#   kattaroq → aniqroq (SE=std/√n) · so'rov ~1000 (±3%)

QOIDA: tasodifiy/qatlamli · vakillik tekshir · sifat > miqdor · bias e'tibor

Namuna xulosasi

Namuna — ishonchli xulosaning poydevori (vakilli)
Tasodifiy — har a'zo teng imkon (xolis, oltin standart)
Qatlamli — guruhlar mutanosib (kichik guruh kafolat)
Bias — noxolis (tanlov, o'z-o'zini tanlash, omon qolgan)
Sifat > miqdor — vakilli kichik > noxolis katta (1936)

4. Batafsil misollar

Misollar real numpy/pandas bilan (deterministik) ishlaydi.

Misol 1 — Tasodifiy namuna

python
"""Tasodifiy namuna (real numpy)."""

import numpy as np


def main() -> None:
    np.random.seed(0)
    populyatsiya = np.random.normal(50, 10, 10000)

    print("=== 1. Tasodifiy namuna ===")
    namuna = np.random.choice(populyatsiya, 100, replace=False)
    print(f"  namuna o'rtacha: {round(namuna.mean(), 1)}")

    print("\n=== 2. Populyatsiya o'rtachasi ===")
    print(f"  populyatsiya o'rtacha: {round(populyatsiya.mean(), 1)}")

    print("\n=== 3. Vakilli (yaqin) ===")
    farq = abs(namuna.mean() - populyatsiya.mean())
    print(f"  farq: {round(farq, 1)} (vakilli — yaqin)")

    print("\n=== 4. Takrorsiz ===")
    print(f"  noyob elementlar: {len(np.unique(namuna))} (100 — takrorsiz)")
    print("  ⭐ Tasodifiy — teng imkon (xolis, vakilli)")


if __name__ == "__main__":
    main()

Natijaning muhim qismi:

text
=== 1. Tasodifiy namuna ===
  namuna o'rtacha: 50.2

=== 2. Populyatsiya o'rtachasi ===
  populyatsiya o'rtacha: 49.8

=== 3. Vakilli (yaqin) ===
  farq: 0.4 (vakilli — yaqin)

=== 4. Takrorsiz ===
  noyob elementlar: 100 (100 — takrorsiz)
  ⭐ Tasodifiy — teng imkon (xolis, vakilli)

Nima ko'rsatdi: 2.1-bo'lim.

Misol 2 — Qatlamli namuna

python
"""Qatlamli namuna (real pandas)."""

import pandas as pd


def main() -> None:
    # populyatsiya: 70% shahar, 30% qishloq
    df = pd.DataFrame({
        "hudud": ["shahar"] * 700 + ["qishloq"] * 300,
        "id": range(1000),
    })

    print("=== 1. Populyatsiya nisbati ===")
    print(f"  {(df['hudud'].value_counts(normalize=True) * 100).round(0).to_dict()}")

    print("\n=== 2. Qatlamli namuna (10%) ===")
    namuna = df.groupby("hudud", group_keys=False).apply(
        lambda g: g.sample(frac=0.1, random_state=0), include_groups=False
    )
    print(f"  namuna hajmi: {len(namuna)}")

    print("\n=== 3. Namuna nisbati (mutanosib) ===")
    n_nisbat = (df.loc[namuna.index, "hudud"].value_counts(normalize=True) * 100).round(0)
    print(f"  {n_nisbat.to_dict()}")

    print("\n=== 4. Xulosa ===")
    print("  qatlamli — guruhlar mutanosib (70/30 saqlanadi)")
    print("  ⭐ Qatlamli — guruhlar mutanosib (vakilli)")


if __name__ == "__main__":
    main()

Natijaning muhim qismi:

text
=== 1. Populyatsiya nisbati ===
  {'shahar': 70.0, 'qishloq': 30.0}

=== 2. Qatlamli namuna (10%) ===
  namuna hajmi: 100

=== 3. Namuna nisbati (mutanosib) ===
  {'shahar': 70.0, 'qishloq': 30.0}

=== 4. Xulosa ===
  qatlamli — guruhlar mutanosib (70/30 saqlanadi)
  ⭐ Qatlamli — guruhlar mutanosib (vakilli)

Nima ko'rsatdi: 2.2-bo'lim.

Misol 3 — Bias (noxolis namuna)

python
"""Bias: noxolis namuna (real numpy)."""

import numpy as np


def main() -> None:
    np.random.seed(0)
    # populyatsiya: shahar (yuqori daromad) + qishloq (past)
    shahar = np.random.normal(800, 100, 7000)
    qishloq = np.random.normal(400, 80, 3000)
    populyatsiya = np.concatenate([shahar, qishloq])

    print("=== 1. Populyatsiya o'rtacha ===")
    print(f"  o'rtacha daromad: {round(populyatsiya.mean(), 0)}")

    print("\n=== 2. Noxolis namuna (faqat shahar) ===")
    noxolis = np.random.choice(shahar, 500)
    print(f"  faqat shahar o'rtacha: {round(noxolis.mean(), 0)} (yuqori — bias!)")

    print("\n=== 3. Vakilli namuna (butun) ===")
    vakilli = np.random.choice(populyatsiya, 500)
    print(f"  butun o'rtacha: {round(vakilli.mean(), 0)} (to'g'ri)")

    print("\n=== 4. Xulosa ===")
    print("  noxolis (faqat shahar) → yuqori (xato)")
    print("  ⭐ Bias — noxolis namuna (xato xulosa)")


if __name__ == "__main__":
    main()

Natijaning muhim qismi:

text
=== 1. Populyatsiya o'rtacha ===
  o'rtacha daromad: 678.0

=== 2. Noxolis namuna (faqat shahar) ===
  faqat shahar o'rtacha: 796.0 (yuqori — bias!)

=== 3. Vakilli namuna (butun) ===
  butun o'rtacha: 684.0 (to'g'ri)

=== 4. Xulosa ===
  noxolis (faqat shahar) → yuqori (xato)
  ⭐ Bias — noxolis namuna (xato xulosa)

Nima ko'rsatdi: 2.3-bo'lim.

Misol 4 — Sifat vs miqdor

python
"""Sifat vs miqdor (real numpy)."""

import numpy as np


def main() -> None:
    np.random.seed(0)
    shahar = np.random.normal(800, 100, 7000)
    qishloq = np.random.normal(400, 80, 3000)
    populyatsiya = np.concatenate([shahar, qishloq])
    haqiqiy = populyatsiya.mean()

    print("=== 1. Katta noxolis (5000 shahar) ===")
    katta_noxolis = np.random.choice(shahar, 5000)
    xato1 = abs(katta_noxolis.mean() - haqiqiy)
    print(f"  o'rtacha: {round(katta_noxolis.mean(), 0)}, xato: {round(xato1, 0)}")

    print("\n=== 2. Kichik vakilli (200 butun) ===")
    kichik_vakilli = np.random.choice(populyatsiya, 200)
    xato2 = abs(kichik_vakilli.mean() - haqiqiy)
    print(f"  o'rtacha: {round(kichik_vakilli.mean(), 0)}, xato: {round(xato2, 0)}")

    print("\n=== 3. Kichik vakilli yaxshiroq ===")
    print(f"  vakilli xato < noxolis xato: {xato2 < xato1}")

    print("\n=== 4. Xulosa ===")
    print("  vakilli kichik > noxolis katta (bias tuzatilmaydi)")
    print("  ⭐ Sifat > miqdor (vakillik muhim)")


if __name__ == "__main__":
    main()

Natijaning muhim qismi:

text
=== 1. Katta noxolis (5000 shahar) ===
  o'rtacha: 799.0, xato: 121.0

=== 2. Kichik vakilli (200 butun) ===
  o'rtacha: 659.0, xato: 20.0

=== 3. Kichik vakilli yaxshiroq ===
  vakilli xato < noxolis xato: True

=== 4. Xulosa ===
  vakilli kichik > noxolis katta (bias tuzatilmaydi)
  ⭐ Sifat > miqdor (vakillik muhim)

Nima ko'rsatdi: 2.4-bo'lim.


5. To'g'ri va noto'g'ri tushunishlar

Noto'g'ri fikr To'g'risi
"katta namuna doim yaxshi" Vakilli muhim (sifat)
"bias miqdor bilan tuzatiladi" Yo'q (1936 AQSh)
"qulay namuna OK" Noxolis (vakilli emas)
"tasodifiy = qulay" Teng imkon (xolis)
"onlayn so'rov vakilli" O'z-o'zini tanlash
"hamma javob beradi" Javobsizlik (bias)
"faqat muvaffaqiyatli" Omon qolgan bias
"namuna qanday olinsa ham" Usul hal qiluvchi

6. Keng tarqalgan xatolar va yechimlari

1. Qulay namuna

python
# do'stlar/yaqinlar so'rov (noxolis)                          # ⚠️
np.random.choice(pop, n, replace=False)   # tasodifiy         # ✅

2. Katta noxolis

python
# 2 million noxolis (hali xato)                               # ⚠️
# vakilli namuna (kichik ham to'g'ri)                          # ✅

3. O'z-o'zini tanlash

python
# onlayn so'rov (qiziqqanlar — noxolis)                       # ⚠️
# tasodifiy tanlangan ishtirokchi                             # ✅

4. Guruh o'tib ketadi

python
np.random.choice(pop, n)   # kichik guruh o'tishi mumkin      # ⚠️
# qatlamli (guruh mutanosib)                                  # ✅

5. Populyatsiya noto'g'ri

python
# faqat mavjud mijoz (potensial yo'q)                         # ⚠️
# to'g'ri populyatsiya (kimni o'rganmoqchisiz)                # ✅

6. Omon qolgan bias

python
# faqat muvaffaqiyatli startaplar                             # ⚠️
# bankrotlar ham (omon qolgan bias)                           # ✅

7. replace tuzog'i

python
np.random.choice(pop, n)   # replace=True (takror)            # ⚠️
np.random.choice(pop, n, replace=False)   # takrorsiz         # ✅

7. Integratsiya — bu bilim qayerda kerak bo'ladi

  • 4.1-dars (o'tilgan): Namuna vs populyatsiya
  • 4.7-dars (o'tilgan): MLT (namuna o'rtachasi)
  • 4.13-dars (keyin): Ishonch oralig'i
  • 7-qism (reja): Ma'lumot yig'ish
  • 20-qism: ML (vakilli ma'lumot)

8. Eng yaxshi amaliyotlar

  1. Tasodifiy — teng imkon (xolis).

  2. Qatlamli — guruhlar mutanosib.

  3. Vakillik tekshir (namuna ~ populyatsiya).

  4. Sifat > miqdor (vakilli birinchi).

  5. Bias e'tibor (kim o'tib ketdi).

  6. Qulay namuna yo'q (noxolis).

  7. To'g'ri populyatsiya (kimni o'rganmoqchisiz).

  8. Namuna — ishonchli xulosaning poydevori.


9. Amaliy topshiriq

Vazifa 1: Bashorat qiling

python
1.  # tasodifiy namuna nima?
2.  # nega xolis?
3.  # qatlamli nima?
4.  # nega qatlamli?
5.  # bias nima?
6.  # tanlov bias?
7.  # o'z-o'zini tanlash?
8.  # sifat vs miqdor?
9.  # katta noxolis?
10. # 1936 AQSh?
11. # qulay namuna?
12. # nega namuna muhim?
Javoblar
  1. Har a'zo teng imkon
  2. Bias yo'q (teng)
  3. Guruhlar mutanosib
  4. Kichik guruh kafolat
  5. Noxolis (yon berish)
  6. Vakilli emas (faqat shahar)
  7. Qiziqqanlar (onlayn)
  8. Vakilli > katta noxolis
  9. Hali xato (bias tuzatilmaydi)
  10. Katta noxolis — mashhur xato
  11. Yaqin/oson (noxolis)
  12. Ishonchli xulosaning poydevori

Vazifa 2: Xatolarni tuzating

python
1.  # do'stlar so'rov

2.  # 2 million noxolis

3.  # onlayn so'rov

4.  np.random.choice(pop, n)   # kichik guruh

5.  np.random.choice(pop, n)   # takror
Javoblar
python
1.  tasodifiy (np.random.choice)

2.  vakilli namuna (kichik ham)

3.  tasodifiy ishtirokchi

4.  qatlamli (mutanosib)

5.  replace=False

Vazifa 3: Tasodifiy

Modellang:

  1. Teng imkon
  2. Xolis
  3. Vakilli
  4. replace=False

Vazifa 4: Qatlamli

Modellang:

  1. Guruhlar
  2. Mutanosib
  3. Kichik guruh
  4. Aniqroq

Vazifa 5: Bias

Modellang:

  1. Tanlov
  2. O'z-o'zini tanlash
  3. Javobsizlik
  4. Omon qolgan

Vazifa 6: Sifat

Modellang:

  1. Vakilli
  2. Miqdor
  3. Bias tuzatilmaydi
  4. 1936

Vazifa 7: O'ylash

1936-yil AQSh saylovida 2 million kishi so'ralgan bashorat noto'g'ri chiqdi, 50000 kishilik vakilli namuna esa to'g'ri topdi. Nima uchun "vakilli kichik namuna" "noxolis katta namuna"dan yaxshiroq — nega bias (noxolislik) miqdor bilan tuzatilmaydi, va bu Data Science'da ("garbage in, garbage out") qanday takrorlanadi?

Javob

Qisqa javob: Vakilli kichik namuna noxolis kattadan yaxshi, bias miqdor bilan tuzatilmaydi, chunki: (1) bias tizimli xato — bias muntazam yo'nalish (faqat shahar → doim yuqori; tasodifiy emas — tizimli); miqdor (ko'p namuna) tizimli xatoni tuzatmaydi (ko'proq shahar — hali faqat shahar; noto'g'ri yo'nalish saqlanadi); (2) noxolis = noto'g'ri populyatsiya — noxolis namuna boshqa populyatsiyani aks ettiradi (2 million telefon egasi — boy qatlam populyatsiyasi, butun mamlakat emas); katta bo'lsa ham noto'g'ri guruh (ko'p noto'g'ri — hali noto'g'ri); (3) vakilli = to'g'ri populyatsiya — vakilli (kichik) to'g'ri populyatsiyani aks ettiradi (barcha guruh mutanosib — butun mamlakat); kichik lekin to'g'ri yo'nalish (MLT — o'rtacha to'g'ri, SE biroz katta, lekin to'g'ri markazda). "Nega bias miqdor bilan tuzatilmaydi": (a) tizimli vs tasodifiy — tasodifiy xato (SE) miqdor bilan kamayadi (√n — 4.7; kichik SE); tizimli xato (bias) miqdor bilan kamaymaydi (doim bir yo'nalish — ko'proq ma'lumot bir xil noto'g'ri); (b) markaz noto'g'ri — bias o'rtachani noto'g'ri markazga suradi (shahar → yuqori); katta namuna noto'g'ri markaz atrofida tor (aniqlik katta, lekin noto'g'ri joyda — aniq lekin xato); (c) 1936 — 2 million (telefon/avtomobil — boy; noto'g'ri populyatsiya) vs Gallup 50000 (vakilli — to'g'ri); mashhur dars (sifat > miqdor). "Data Science'da (garbage in, garbage out)": (1) noxolis ma'lumot → noxolis model — ML ma'lumotdan o'rganadi; noxolis ma'lumot (bir guruh ko'p — bias) → model noxolis (yuz tanish — bir irq ko'p, boshqasida yomon; ishga olish — bir jins bias); (2) katta noxolis ma'lumot — ko'p ma'lumot bias'ni tuzatmaydi (million noxolis rasm — hali bias model); (3) vakilli ma'lumot — vakilli (barcha guruh) → adolatli model; (4) ehtiyot — ma'lumot kim/qayerdan (bias manbasi — tarixiy, tanlov). Saboqlar: bias tizimli (miqdor tuzatmaydi — √n faqat tasodifiy); noxolis noto'g'ri populyatsiya (katta ham); vakilli to'g'ri (kichik ham); garbage in-out (noxolis ma'lumot → noxolis model). To'g'ri: vakilli namuna (sifat — tasodifiy/qatlamli); ma'lumot manbasi tekshir (bias?); miqdor keyin (vakilli bo'lsa). Muvozanat: sifat (vakilli — to'g'ri) birinchi + miqdor (aniqroq — vakilli bo'lsa) keyin; noxolis katta behuda. Bu Data Science asosiy dars (ma'lumot sifati — model sifati; garbage in-out; bias — adolat, ishonch). Vakilli namuna — ishonchli tahlil/model poydevori (miqdor emas — sifat).

1. Nega bias miqdor bilan tuzatilmaydi

  • Bias tizimli (muntazam yo'nalish — doim shahar)
  • Miqdor tizimli xatoni tuzatmaydi (ko'p noto'g'ri)
  • Markaz noto'g'ri (aniq lekin xato joyda)

2. Nega vakilli kichik yaxshi

  • To'g'ri populyatsiya (barcha guruh mutanosib)
  • To'g'ri yo'nalish (MLT — o'rtacha to'g'ri)
  • Kichik SE biroz katta, lekin to'g'ri markaz

3. Tizimli vs tasodifiy

Tasodifiy (SE) Tizimli (bias)
Miqdor kamaytiradi (√n) Miqdor kamaymaydi
To'g'ri markaz Noto'g'ri markaz

4. Data Science (garbage in-out)

  • Noxolis ma'lumot → noxolis model (yuz, ishga olish)
  • Katta noxolis tuzatmaydi (million rasm bias)
  • Vakilli ma'lumot → adolatli model

5. Saboqlar

  1. Bias tizimli (miqdor tuzatmaydi)
  2. Noxolis noto'g'ri populyatsiya (katta ham)
  3. Vakilli to'g'ri (kichik ham)
  4. Garbage in-out (ma'lumot → model)

6. Xulosa

  1. Bias tizimli (miqdor bilan tuzatilmaydi)
  2. Vakilli kichik > noxolis katta (1936)
  3. Garbage in-out (noxolis → noxolis model)
  4. Vakilli namuna — poydevor (sifat > miqdor)

Nimani mustahkamlaydi: 2.3, 2.4-bo'limlar.


Xulosa

Bu darsda namuna olishni o'rgandik.

Eng muhim uch fikr:

  1. Tasodifiy va qatlamli. Tasodifiy namuna — har a'zo teng imkon (np.random.choice(replace=False); xolis — bias yo'q, vakilli; oltin standart). Qatlamli namuna — populyatsiyani guruhlarga (qatlam — yosh/jins/hudud) bo'lib, har guruhdan mutanosib (70% shahar → namunada ham 70%); kichik guruhni kafolatlaydi (tasodifiy o'tib ketishi mumkin), aniqroq.

  2. Bias va sifat. Bias turlari (noxolis): tanlov bias (vakilli emas — faqat shahar), o'z-o'zini tanlash (onlayn — qiziqqanlar), javobsizlik (band guruh o'tib ketadi), omon qolgan (faqat muvaffaqiyatli). Sifat > miqdor — vakilli kichik > noxolis katta (bias miqdor bilan tuzatilmaydi — tizimli xato; 1936 AQSh — 2 million noxolis xato, Gallup 50000 vakilli to'g'ri).

  3. Ishonchli xulosa poydevori. Namuna kattaligi — kattaroq aniqroq (SE=std/√n; ~1000 so'rov ±3%; √n balans); lekin vakillik birinchi (noxolis katta behuda). Namuna — ishonchli xulosaning poydevori (namuna qanday olingan hal qiluvchi — "garbage in, garbage out"). Data Science'da doim (so'rovnoma, ML ma'lumot — noxolis ma'lumot → noxolis model; adolat, ishonch). Bu 4.1 (namuna) davomi va 4.7 (MLT), 4.13 (ishonch) uchun. Tuzoqlar: qulay namuna (noxolis), katta noxolis (miqdor tuzatmaydi), o'z-o'zini tanlash, omon qolgan bias.

Keyingi darsda korrelyatsiyani o'rganamiz: ikki o'zgaruvchan qanday bog'liq (Pearson, Spearman) — bog'lanish kuchi va yo'nalishini o'lchash.

Ulashish:Telegram'da

Izohlar (0)

Izoh yozish uchun kiring.

  • Hozircha izoh yo'q. Birinchi bo'ling!
4.8-dars: Namuna olish — IlmHamroh