IlmHamroh
Data Science va sun'iy intellekt/Statistika1/14-dars17 daqiqa
Mundarija (22)

4.1-dars: Statistika nima

4-QISM — STATISTIKA · 1-dars


1. Kirish va motivatsiya

Ma'lumotni o'qish, tozalash, guruhlashni o'rgandik. Endi undan ishonchli xulosa chiqarishni o'rganamiz — bu statistika. Statistika — ma'lumotni tushunish, umumlashtirish va undan qaror chiqarish fani. Data Science'da statistika poydevor: nega o'rtacha ba'zan aldaydi, ikki guruh farqi haqiqiymi yoki tasodifmi, namuna butun aholi haqida nima aytadi — bularning hammasi statistika. Ikki turi bor: tavsifiy (descriptive — bor ma'lumotni umumlashtirish: o'rtacha, tarqoqlik) va xulosaviy (inferential — namunadan butun aholi haqida xulosa: gipoteza, ishonch). Va eng muhim tushuncha — namuna (sample) va populyatsiya (population) farqi. Nega muhim? (1) Ishonchli xulosa — ma'lumotdan to'g'ri qaror; (2) ML asosi — model statistikaga tayanadi; (3) Aldamaslik — statistik tuzoqlarni ko'rish. Bu dars statistikaning asoslarini o'rgatadi — ma'lumotdan ishonchli xulosa.

Statistika — ma'lumotdan xulosa fani: tavsifiy (descriptive — bor ma'lumot umumlashtirish: o'rtacha, tarqoqlik), xulosaviy (inferential — namunadan populyatsiya haqida xulosa: gipoteza, ishonch), namuna vs populyatsiya (qism vs butun), o'zgaruvchan turlari (son — miqdoriy; kategoriya — sifatiy), statistika roli (ML poydevori, qaror), statistik fikrlash (noaniqlik, ehtimol). Foydalanish: ishonchli xulosa, ML, aldamaslik. Bu 1.5 (statistik fikrlash), 3-qism (Pandas) bilan bog'liq. Statistika — xulosa fani. Tavsifiy/xulosaviy. Namuna/populyatsiya.

Real vaziyat. Data Scientist saylovda so'rovnoma o'tkazdi: 1000 kishi (namuna) — 55% A nomzodga. Savol: butun mamlakat (populyatsiya — million saylovchi) qanday ovoz beradi? Bu xulosaviy statistika (namunadan populyatsiya — 55% ± xato). Boshqa holatda: bor 1000 javobni umumlashtirdi (o'rtacha yosh 34, 60% erkak) — tavsifiy statistika (bor ma'lumot). Namuna vs populyatsiya muhim: 1000 kishi (namuna) butun million (populyatsiya) o'rniga — lekin namuna vakilli bo'lishi kerak (aks holda noto'g'ri xulosa). Statistika ma'lumotni ishonchli xulosaga aylantirdi (namuna → populyatsiya; noaniqlik bilan). Statistika — Data Science poydevori (ma'lumotdan qaror).

Bu darsda statistika asoslarini o'rganamiz.

Bu darsda:

  • Tavsifiy vs xulosaviy statistika
  • Namuna va populyatsiya
  • O'zgaruvchan turlari
  • Statistikaning roli (ML, qaror)
  • Statistik fikrlash (noaniqlik)
  • Statistika amaliyoti
  • Statistika tuzoqlari
  • Amaliy: statistika modeli

ℹ Misollar real numpy/pandas bilan (deterministik) ishlaydi.


2. Nazariya — chuqur tushuntirish

2.1. Tavsifiy vs xulosaviy statistika

Ikki asosiy tur:

python
import numpy as np

data = np.array([25, 30, 35, 28, 32])

# TAVSIFIY (descriptive) — bor ma'lumotni umumlashtirish
data.mean()        # 30.0 (o'rtacha)
data.std()         # tarqoqlik
# → bor ma'lumot haqida (aniq, taxmin yo'q)

# XULOSAVIY (inferential) — namunadan populyatsiya
# 5 kishi (namuna) → butun aholi (populyatsiya) haqida xulosa
# → taxmin + noaniqlik (ishonch oralig'i, gipoteza)

Tavsifiy vs xulosaviy — ikki asosiy tur: tavsifiy (descriptive — bor ma'lumotni umumlashtirish: o'rtacha, median, tarqoqlik; aniq — taxmin yo'q), xulosaviy (inferential — namunadan populyatsiya haqida xulosa: gipoteza, ishonch oralig'i; taxmin + noaniqlik). Sabab: ikki turli savol — tavsifiy ("bu ma'lumot qanday?" — o'rtacha, tarqoqlik; bor narsa), xulosaviy ("namuna butun aholi haqida nima aytadi?" — taxmin, ishonch). Tavsifiy (bor — aniq), xulosaviy (namuna → populyatsiya — noaniq). Tavsifiy — umumlashtirish (bor), xulosaviy — xulosa (namuna→populyatsiya). Aniq vs taxmin. Ikki tur.

2.2. Namuna va populyatsiya

Qism vs butun:

POPULYATSIYA (population) — BUTUN guruh
   masalan: butun mamlakat saylovchilari (million)
   
NAMUNA (sample) — qism (o'rganiladigan)
   masalan: so'rovnoma 1000 kishi

   NAMUNA → POPULYATSIYA haqida xulosa (xulosaviy)
   NAMUNA VAKILLI bo'lishi kerak (tasodifiy, xolis)

Namuna va populyatsiya — qism vs butun: populyatsiya (population — BUTUN guruh; butun mamlakat, barcha mijozlar — o'rganmoqchi bo'lgan hamma), namuna (sample — qism; so'rovnoma 1000 kishi — haqiqatda o'rganiladigan). Sabab: butun populyatsiyani o'rganish ko'pincha imkonsiz (million kishi — qimmat, sekin); namuna olinadi (qism — arzon, tez), undan populyatsiya haqida xulosa (xulosaviy). MUHIM: namuna vakilli bo'lishi kerak (populyatsiyani aks ettiradi — tasodifiy, xolis; noto'g'ri namuna → noto'g'ri xulosa — bias). Namuna (qism), populyatsiya (butun). Namuna → populyatsiya. Vakilli. Muhim.

2.3. O'zgaruvchan turlari

Ma'lumot turlari (1.3 dars):

python
import pandas as pd

df = pd.DataFrame({
    "yosh": [25, 30, 35],        # SON (miqdoriy) — o'rtacha mumkin
    "jins": ["M", "F", "M"],     # KATEGORIYA (sifatiy) — sanash
    "baho": ["yaxshi", "a'lo", "past"],  # TARTIBLI (ordinal)
})

# SON: o'rtacha, std, korrelyatsiya
# KATEGORIYA: sanash, foiz, mod

O'zgaruvchan turlari — statistika turga bog'liq: son (miqdoriy — yosh, narx; o'rtacha, std, korrelyatsiya mumkin), kategoriya (sifatiy — jins, shahar; sanash, foiz, mod), tartibli (ordinal — baho: past<yaxshi<a'lo; tartib bor lekin son emas). Sabab: statistika turga mos bo'lishi kerak (son — o'rtacha; kategoriya — o'rtacha ma'nosiz (jins o'rtachasi yo'q — foiz/mod)); tur usulni belgilaydi (son — mean/std; kategoriya — count/mode). Noto'g'ri usul (kategoriyaga o'rtacha — xato). Son (o'rtacha), kategoriya (sanash), tartibli (tartib). O'zgaruvchan turlari — son/kategoriya/tartibli. Statistika turga mos. Usul.

2.4. Statistikaning roli (ML, qaror)

Statistikaning roli — nega muhim: (1) ML poydevori — ML modellari statistikaga tayanadi (regressiya — o'rtacha/tarqoqlik; taqsimot — ehtimol; korrelyatsiya — bog'lanish); statistikani bilmasdan ML qorong'u quti (nega ishlaydi — statistika); (2) qaror — ma'lumotdan ishonchli qaror (A/B test — qaysi yaxshi; gipoteza — farq haqiqiy-mi); (3) aldamaslik — statistik tuzoqlarni ko'rish (o'rtacha aldaydi; korrelyatsiya ≠ sababiyat; namuna bias); (4) noaniqlik — statistika noaniqlikni o'lchaydi (ishonch oralig'i — taxmin ± xato; qat'iy emas, ehtimolli). Sabab: Data Science ma'lumotdan xulosa (statistika — xulosa fani); ML/qaror/aldamaslik statistikaga tayanadi. Statistikaning roli — ML poydevori, qaror, aldamaslik, noaniqlik. Poydevor. Muhim.

2.5. Statistik fikrlash (noaniqlik)

Statistik fikrlash (noaniqlik) — statistika noaniqlik bilan ishlaydi: dunyo qat'iy emas (o'lchovlar xato, namuna qism, tasodif); statistik fikrlash noaniqlikni tan oladi va o'lchaydi (aniq javob emas — ehtimol, ishonch). Misol: "A nomzod g'olib" (qat'iy — noto'g'ri) vs "A nomzod 55% ± 3% (95% ishonch)" (noaniqlik — to'g'ri). Sabab: ma'lumot namuna (qism — populyatsiya emas; noaniqlik); tasodif (har namuna boshqa — o'zgaruvchanlik); statistik fikrlash noaniqlikni hisobga oladi (taxmin ± xato — ehtimolli, qat'iy emas). "Ehtimol" (aniq emas — ehtimolli), "ishonch" (± xato). Bu 1.5 (statistik fikrlash) davomi. Statistik fikrlash — noaniqlik (ehtimol, ishonch). Qat'iy emas. O'lchash.

2.6. Statistika amaliyoti

Statistika amaliyoti: tavsifiy (bor ma'lumot — o'rtacha, std, describe 3.2); xulosaviy (namuna → populyatsiya — gipoteza, ishonch); namuna vs populyatsiya (qism vs butun — vakilli); tur (son — mean; kategoriya — count/mode); noaniqlik (± xato — ehtimol); describe (tavsifiy xulosa — 3.2); scipy.stats (statistik testlar — keyingi darslar). Tuzoqlar: namuna bias (noto'g'ri namuna — xato xulosa), tavsifiy/xulosaviy chalkash (bor vs taxmin), tur (kategoriyaga o'rtacha), qat'iylik (noaniqlik yo'q — xato), kichik namuna (ishonchsiz). Amaliyot — tavsifiy, xulosaviy, namuna, tur. Xulosa. Noaniqlik.

2.7. Statistika tuzoqlari

Statistika asosiy tuzoqlari: namuna bias (namuna vakilli emas — noto'g'ri xulosa; masalan faqat shahar so'rovi → butun mamlakat deb (qishloq yo'q); tasodifiy/xolis namuna); tavsifiy/xulosaviy chalkash (bor ma'lumot (tavsifiy — aniq) vs namuna → populyatsiya (xulosaviy — taxmin); farqni bil); kategoriyaga o'rtacha (jins/shahar — o'rtacha ma'nosiz; son emas — count/mode); qat'iylik (statistika noaniq (ehtimol, ± xato) — "aniq g'olib" xato; ishonch oralig'i); kichik namuna (kam namuna — ishonchsiz (tasodif katta; 5 kishi → million xulosa — noto'g'ri); katta namuna afzal); o'rtacha aldaydi (chet qiymat — o'rtacha buziladi, median afzal — 4.2); korrelyatsiya = sababiyat (bog'lanish ≠ sabab — 4.10); p-hacking (ko'p test — tasodifiy "farq" — 4-qism oxiri). Sabab: statistika noaniq/nozik (namuna, tur, noaniqlik — jim xato yoki noto'g'ri xulosa). Yechim: vakilli namuna, tur mos, noaniqlik, katta namuna. Tuzoqlar — namuna bias, tavsifiy/xulosaviy, tur, qat'iylik.

2.8. Statistika — ma'lumotdan ishonchli xulosa

Statistika asosiy g'oyasi — ma'lumotdan ishonchli xulosa: ma'lumot o'z-o'zidan xulosa emas (raqamlar — ma'no kerak); statistika ma'lumotni tushunish, umumlashtirish, xulosa qiladi (ishonchli qaror). Tavsifiy (bor ma'lumot — umumlashtirish: o'rtacha, tarqoqlik; aniq), xulosaviy (namuna → populyatsiya — xulosa: gipoteza, ishonch; taxmin + noaniqlik). Namuna vs populyatsiya (qism vs butun — vakilli namuna muhim). Statistika noaniqlik bilan ishlaydi (ehtimol, ± xato — qat'iy emas). Data Science'da statistika poydevor (ML model — statistikaga tayanadi; qaror — A/B, gipoteza; aldamaslik — tuzoqlar). Bu 1.5 (statistik fikrlash) davomi va butun 4-qism (markazlashuv, tarqoqlik, taqsimot, korrelyatsiya), ML (20-qism) uchun asos. Statistika — ma'lumotdan ishonchli xulosa (tavsifiy/xulosaviy, namuna/populyatsiya). Poydevor. Xulosa.


3. Tez ma'lumotnoma

python
import numpy as np
import pandas as pd

# TAVSIFIY (bor ma'lumot — aniq):
data.mean()        # o'rtacha · data.std() — tarqoqlik
df.describe()      # tavsifiy xulosa (3.2)

# XULOSAVIY (namuna → populyatsiya — taxmin):
#   gipoteza, ishonch oralig'i (keyingi darslar)
#   namuna → populyatsiya (noaniqlik: ± xato)

# NAMUNA vs POPULYATSIYA:
#   populyatsiya — BUTUN (million saylovchi)
#   namuna — qism (1000 so'rov) → xulosa
#   namuna VAKILLI (tasodifiy, xolis) bo'lishi kerak

# O'ZGARUVCHAN TURLARI:
#   son (miqdoriy) — mean/std/korrelyatsiya
#   kategoriya (sifatiy) — count/foiz/mode (o'rtacha YO'Q!)
#   tartibli (ordinal) — tartib bor

QOIDA: vakilli namuna · tur mos (son/kategoriya) · noaniqlik (ehtimol)

Statistika xulosasi

Statistika — ma'lumotdan ishonchli xulosa (poydevor)
Tavsifiy — bor ma'lumot umumlashtirish (o'rtacha, tarqoqlik; aniq)
Xulosaviy — namunadan populyatsiya (gipoteza, ishonch; taxmin)
Namuna (qism) → populyatsiya (butun) — vakilli namuna
Statistik fikrlash — noaniqlik (ehtimol, ± xato; qat'iy emas)

4. Batafsil misollar

Misollar real numpy/pandas bilan (deterministik) ishlaydi.

Misol 1 — Tavsifiy statistika

python
"""Tavsifiy statistika (real numpy)."""

import numpy as np


def main() -> None:
    yosh = np.array([25, 30, 35, 28, 32, 40, 27])

    print("=== 1. O'rtacha (markaz) ===")
    print(f"  mean: {yosh.mean()}")

    print("\n=== 2. Tarqoqlik ===")
    print(f"  std: {round(yosh.std(), 2)}")

    print("\n=== 3. Chegaralar ===")
    print(f"  min: {yosh.min()}, max: {yosh.max()}")

    print("\n=== 4. Tushuntirish ===")
    print("  tavsifiy — bor ma'lumot (aniq, taxmin yo'q)")
    print("  ⭐ Tavsifiy — umumlashtirish (o'rtacha, tarqoqlik)")


if __name__ == "__main__":
    main()

Natijaning muhim qismi:

text
=== 1. O'rtacha (markaz) ===
  mean: 31.0

=== 2. Tarqoqlik ===
  std: 4.78

=== 3. Chegaralar ===
  min: 25, max: 40

=== 4. Tushuntirish ===
  tavsifiy — bor ma'lumot (aniq, taxmin yo'q)
  ⭐ Tavsifiy — umumlashtirish (o'rtacha, tarqoqlik)

Nima ko'rsatdi: 2.1-bo'lim.

Misol 2 — Namuna va populyatsiya

python
"""Namuna va populyatsiya (real numpy)."""

import numpy as np


def main() -> None:
    np.random.seed(0)

    print("=== 1. Populyatsiya (butun) ===")
    populyatsiya = np.random.normal(50, 10, 100000)
    print(f"  populyatsiya o'rtacha: {round(populyatsiya.mean(), 1)}")

    print("\n=== 2. Namuna (qism) ===")
    namuna = np.random.choice(populyatsiya, 100)
    print(f"  namuna o'rtacha: {round(namuna.mean(), 1)}")

    print("\n=== 3. Namuna ~ populyatsiya ===")
    farq = abs(namuna.mean() - populyatsiya.mean())
    print(f"  farq: {round(farq, 1)} (namuna taxminan populyatsiya)")

    print("\n=== 4. Katta namuna aniqroq ===")
    katta = np.random.choice(populyatsiya, 5000)
    print(f"  katta namuna o'rtacha: {round(katta.mean(), 1)}")
    print("  ⭐ Namuna → populyatsiya (vakilli, katta aniqroq)")


if __name__ == "__main__":
    main()

Natijaning muhim qismi:

text
=== 1. Populyatsiya (butun) ===
  populyatsiya o'rtacha: 50.0

=== 2. Namuna (qism) ===
  namuna o'rtacha: 50.1

=== 3. Namuna ~ populyatsiya ===
  farq: 0.1 (namuna taxminan populyatsiya)

=== 4. Katta namuna aniqroq ===
  katta namuna o'rtacha: 50.0
  ⭐ Namuna → populyatsiya (vakilli, katta aniqroq)

Nima ko'rsatdi: 2.2-bo'lim.

Misol 3 — O'zgaruvchan turlari

python
"""O'zgaruvchan turlari (real pandas)."""

import pandas as pd


def main() -> None:
    df = pd.DataFrame({
        "yosh": [25, 30, 35, 28],
        "jins": ["M", "F", "M", "F"],
    })

    print("=== 1. Son (o'rtacha mumkin) ===")
    print(f"  yosh o'rtacha: {df['yosh'].mean()}")

    print("\n=== 2. Kategoriya (sanash) ===")
    print(f"  jins sanog'i: {df['jins'].value_counts().to_dict()}")

    print("\n=== 3. Kategoriya (foiz) ===")
    foiz = (df["jins"].value_counts(normalize=True) * 100).round(0)
    print(f"  jins foizi: {foiz.to_dict()}")

    print("\n=== 4. Mod (eng ko'p) ===")
    print(f"  eng ko'p jins: {df['jins'].mode().iloc[0]}")
    print("  ⭐ Son (o'rtacha), kategoriya (sanash/foiz)")


if __name__ == "__main__":
    main()

Natijaning muhim qismi:

text
=== 1. Son (o'rtacha mumkin) ===
  yosh o'rtacha: 29.5

=== 2. Kategoriya (sanash) ===
  jins sanog'i: {'M': 2, 'F': 2}

=== 3. Kategoriya (foiz) ===
  jins foizi: {'M': 50.0, 'F': 50.0}

=== 4. Mod (eng ko'p) ===
  eng ko'p jins: F
  ⭐ Son (o'rtacha), kategoriya (sanash/foiz)

Nima ko'rsatdi: 2.3-bo'lim.

Misol 4 — Namuna o'zgaruvchanligi

python
"""Namuna o'zgaruvchanligi (real numpy)."""

import numpy as np


def main() -> None:
    np.random.seed(0)
    populyatsiya = np.random.normal(100, 15, 100000)

    print("=== 1. Uch namuna (har biri boshqa) ===")
    for i in range(3):
        n = np.random.choice(populyatsiya, 50)
        print(f"  namuna {i+1} o'rtacha: {round(n.mean(), 1)}")

    print("\n=== 2. Kichik namuna (o'zgaruvchan) ===")
    kichik = [round(np.random.choice(populyatsiya, 10).mean(), 1) for _ in range(3)]
    print(f"  10 lik namunalar: {kichik}")

    print("\n=== 3. Katta namuna (barqaror) ===")
    katta = [round(np.random.choice(populyatsiya, 5000).mean(), 1) for _ in range(3)]
    print(f"  5000 lik namunalar: {katta}")

    print("\n=== 4. Xulosa ===")
    print("  kichik namuna — o'zgaruvchan · katta — barqaror")
    print("  ⭐ Namuna o'zgaruvchanligi (noaniqlik)")


if __name__ == "__main__":
    main()

Natijaning muhim qismi:

text
=== 1. Uch namuna (har biri boshqa) ===
  namuna 1 o'rtacha: 97.4
  namuna 2 o'rtacha: 102.9
  namuna 3 o'rtacha: 96.7

=== 2. Kichik namuna (o'zgaruvchan) ===
  10 lik namunalar: [np.float64(101.9), np.float64(90.1), np.float64(103.0)]

=== 3. Katta namuna (barqaror) ===
  5000 lik namunalar: [np.float64(100.1), np.float64(99.9), np.float64(99.9)]

=== 4. Xulosa ===
  kichik namuna — o'zgaruvchan · katta — barqaror
  ⭐ Namuna o'zgaruvchanligi (noaniqlik)

Nima ko'rsatdi: 2.5-bo'lim.


5. To'g'ri va noto'g'ri tushunishlar

Noto'g'ri fikr To'g'risi
"statistika — faqat o'rtacha" Xulosa fani (tavsifiy + xulosaviy)
"namuna = populyatsiya" Qism vs butun
"har namuna vakilli" Tasodifiy/xolis bo'lishi kerak
"kategoriyaga o'rtacha" Sanash/foiz/mode
"statistika aniq javob" Noaniqlik (ehtimol, ± xato)
"kichik namuna yetarli" Katta aniqroq
"tavsifiy = xulosaviy" Bor vs taxmin
"statistika ML uchun emas" ML poydevori

6. Keng tarqalgan xatolar va yechimlari

1. Namuna bias

python
# faqat shahar so'rovi → butun mamlakat deb                   # ⚠️
# tasodifiy/vakilli namuna (qishloq ham)                      # ✅

2. Kategoriyaga o'rtacha

python
df["jins"].mean()   # ma'nosiz (M/F)                          # ⚠️
df["jins"].value_counts()   # sanash                          # ✅

3. Qat'iylik

python
# "A g'olib" (qat'iy)                                          # ⚠️
# "A 55% ± 3% (95% ishonch)" (noaniqlik)                       # ✅

4. Kichik namuna

python
# 5 kishi → million xulosa (ishonchsiz)                       # ⚠️
# katta namuna (barqaror)                                     # ✅

5. Tavsifiy/xulosaviy chalkash

python
# namuna o'rtachasi = populyatsiya deb (aniq)                 # ⚠️
# namuna → populyatsiya (taxmin ± xato)                       # ✅

6. O'rtacha aldaydi

python
data.mean()   # chet qiymat buzadi                            # ⚠️
np.median(data)   # median (chidamli, 4.2)                     # ✅

7. Korrelyatsiya = sababiyat

python
# bog'lanish → sabab deb                                      # ⚠️
# korrelyatsiya ≠ sababiyat 4.10-bob                             # ✅

7. Integratsiya — bu bilim qayerda kerak bo'ladi

  • 1.5-dars (o'tilgan): Statistik fikrlash
  • 3.2-dars (o'tilgan): describe (tavsifiy)
  • 4.2-dars: Markazlashuv (o'rtacha, median)
  • 4.13-dars (keyin): Gipoteza tekshirish (xulosaviy)
  • 20-qism: ML (statistika poydevori)

8. Eng yaxshi amaliyotlar

  1. Vakilli namuna (tasodifiy, xolis).

  2. Tur mos (son — mean, kategoriya — count).

  3. Tavsifiy (bor) vs xulosaviy (taxmin).

  4. Noaniqlik (ehtimol, ± xato).

  5. Katta namuna (barqaror).

  6. Median — chet qiymat (o'rtacha aldaydi).

  7. Korrelyatsiya ≠ sababiyat.

  8. Statistika — ishonchli xulosa (poydevor).


9. Amaliy topshiriq

Vazifa 1: Bashorat qiling

python
1.  # statistika nima?
2.  # tavsifiy nima?
3.  # xulosaviy nima?
4.  # namuna nima?
5.  # populyatsiya nima?
6.  # namuna → populyatsiya?
7.  # vakilli namuna?
8.  # son statistikasi?
9.  # kategoriya statistikasi?
10. # statistika aniqmi?
11. # kichik vs katta namuna?
12. # nega statistika muhim?
Javoblar
  1. Ma'lumotdan xulosa fani
  2. Bor ma'lumot umumlashtirish (aniq)
  3. Namunadan populyatsiya (taxmin)
  4. Qism (o'rganiladigan)
  5. Butun guruh
  6. Xulosa (xulosaviy)
  7. Tasodifiy/xolis
  8. mean/std/korrelyatsiya
  9. count/foiz/mode
  10. Noaniq (ehtimol, ± xato)
  11. Katta barqaror
  12. ML poydevori, qaror, aldamaslik

Vazifa 2: Xatolarni tuzating

python
1.  # faqat shahar → mamlakat

2.  df["jins"].mean()   # kategoriya

3.  # "A g'olib" (qat'iy)

4.  # 5 kishi → million

5.  # namuna = populyatsiya (aniq)
Javoblar
python
1.  vakilli namuna (tasodifiy)

2.  df["jins"].value_counts()

3.  "A 55% ± 3% (ishonch)"

4.  katta namuna

5.  namuna → populyatsiya (taxmin)

Vazifa 3: Tavsifiy/xulosaviy

Modellang:

  1. Tavsifiy
  2. Xulosaviy
  3. Bor vs taxmin
  4. Aniq vs noaniq

Vazifa 4: Namuna

Modellang:

  1. Namuna
  2. Populyatsiya
  3. Vakilli
  4. Xulosa

Vazifa 5: Turlar

Modellang:

  1. Son
  2. Kategoriya
  3. Tartibli
  4. Usul

Vazifa 6: Noaniqlik

Modellang:

  1. Ehtimol
  2. ± xato
  3. Ishonch
  4. Qat'iy emas

Vazifa 7: O'ylash

Statistika "namuna" (kichik qism) dan "populyatsiya" (butun) haqida xulosa chiqaradi — masalan 1000 kishilik so'rovnomadan million saylovchi haqida. Nima uchun bu "qismdan butun haqida xulosa" imkoni Data Science'ning butun kuchini beradi (butun aholini o'rganmasdan), va nega "vakilli namuna" bunda hal qiluvchi (nega noto'g'ri namuna butun xulosani buzadi)?

Javob

Qisqa javob: Statistika namunadan populyatsiya haqida xulosa (1000 → million) — Data Science kuchi, vakilli namuna hal qiluvchi, chunki: (1) butun imkonsiz — populyatsiyani butun o'rganish ko'pincha imkonsiz (million kishi so'rovi — qimmat, sekin, ba'zan imkonsiz — barcha lampochka sifatini sinash (yonib ketadi)); namuna arzon/tez (1000 — mumkin); (2) namuna yetadi — vakilli namuna populyatsiyani aks ettiradi (1000 vakilli → million haqida aniq xulosa; statistika buni o'lchaydi — ishonch); (3) kuch — butun o'rganmasdan xulosa (Data Science — kichik namunadan katta bilim; so'rovnoma, sifat nazorati, tibbiyot sinovi — hammasi namuna); (4) samaradorlik — kam resurs (namuna) → katta bilim (populyatsiya). "Nega vakilli hal qiluvchi": (a) namuna = populyatsiya oynasi — vakilli namuna populyatsiyani to'g'ri aks ettiradi (barcha guruh — yosh/qari, shahar/qishloq — mutanosib); xulosa to'g'ri; (b) bias buzadi — vakilli emas namuna (faqat bir guruh — faqat yoshlar, faqat shahar) populyatsiyani noto'g'ri aks ettiradi; xulosa butunlay noto'g'ri (qishloq yo'q → mamlakat deb — xato); (c) katta namuna ham yordam bermaydi — bias bo'lsa katta namuna ham noto'g'ri (million shahar so'rovi — hali ham qishloq yo'q; miqdor bias'ni tuzatmaydi — vakillik kerak); mashhur xato: 1936 AQSh saylov (2 million so'rov, lekin bias — noto'g'ri bashorat); (d) tasodifiy — vakillik tasodifiy namunadan (har kishi teng imkon — barcha guruh; xolis). Saboqlar: butun imkonsiz (namuna — arzon/tez); vakilli yetadi (populyatsiya oynasi — to'g'ri xulosa); bias buzadi (noto'g'ri namuna → noto'g'ri xulosa, katta ham); tasodifiy (vakillik — xolis). To'g'ri: vakilli namuna (tasodifiy, barcha guruh); bias e'tibor (kim tushib qoldi — qishloq, qari). Muvozanat: samaradorlik (namuna — arzon) + to'g'rilik (vakilli — aniq) — ikkalasi; namuna arzon, lekin vakilli bo'lishi shart (aks holda arzon lekin noto'g'ri). Bu statistika kuchi (namuna → populyatsiya — Data Science asosi) va xavfi (bias — noto'g'ri namuna, jim xato). Vakilli namuna — statistika poydevori (to'g'ri xulosa uchun shart).

1. Nega namuna → populyatsiya kuchli

  • Butun imkonsiz (million — qimmat/sekin/imkonsiz)
  • Namuna arzon/tez (1000 — mumkin)
  • Namuna yetadi (vakilli → aniq xulosa)
  • Kam resurs → katta bilim (samaradorlik)

2. Nega vakilli hal qiluvchi

  • Namuna = populyatsiya oynasi (to'g'ri aks ettiradi)
  • Bias buzadi (noto'g'ri namuna → noto'g'ri xulosa)
  • Katta namuna ham yordam bermaydi (bias — miqdor emas)
  • Tasodifiy (vakillik — xolis)

3. Bias misoli

  • Faqat shahar so'rovi → mamlakat (qishloq yo'q)
  • 1936 AQSh (2M so'rov, bias — noto'g'ri)
  • Katta namuna bias'ni tuzatmaydi

4. Vakilli vs bias

Vakilli Bias
Barcha guruh (mutanosib) Bir guruh
To'g'ri xulosa Noto'g'ri (katta ham)

5. Saboqlar

  1. Butun imkonsiz (namuna — arzon)
  2. Vakilli yetadi (populyatsiya oynasi)
  3. Bias buzadi (noto'g'ri namuna)
  4. Tasodifiy (vakillik — xolis)

6. Xulosa

  1. Namuna → populyatsiya (Data Science kuchi)
  2. Butun imkonsiz (namuna — arzon/tez)
  3. Vakilli hal qiluvchi (bias buzadi)
  4. Tasodifiy namuna (vakillik — shart)

Nimani mustahkamlaydi: 2.2, 2.7-bo'limlar.


Xulosa

Bu darsda statistika asoslarini o'rgandik.

Eng muhim uch fikr:

  1. Tavsifiy va xulosaviy. Statistika — ma'lumotdan ishonchli xulosa fani. Ikki tur: tavsifiy (descriptive — bor ma'lumotni umumlashtirish: o'rtacha, tarqoqlik; aniq — taxmin yo'q), xulosaviy (inferential — namunadan populyatsiya haqida xulosa: gipoteza, ishonch; taxmin + noaniqlik). Tavsifiy (bor — aniq), xulosaviy (namuna → populyatsiya — noaniq).

  2. Namuna va populyatsiya. Populyatsiya (butun guruh — million saylovchi), namuna (qism — 1000 so'rov); butun imkonsiz (qimmat/sekin) → namuna olinadi, undan populyatsiya haqida xulosa. Vakilli namuna hal qiluvchi (tasodifiy, xolis — populyatsiyani aks ettiradi; bias — noto'g'ri namuna butun xulosani buzadi, katta namuna ham tuzatmaydi). O'zgaruvchan turlari — son (mean/std), kategoriya (count/foiz/mode — o'rtacha ma'nosiz), tartibli.

  3. Ishonchli xulosa. Statistik fikrlash — noaniqlik bilan (ehtimol, ± xato — qat'iy emas; "A 55% ± 3%" to'g'ri, "A g'olib" xato). Statistika — Data Science poydevori (ML model — statistikaga tayanadi; qaror — A/B, gipoteza; aldamaslik — tuzoqlar: o'rtacha aldaydi, korrelyatsiya ≠ sababiyat, namuna bias). Bu 1.5 (statistik fikrlash) davomi va butun 4-qism, ML uchun asos. Tuzoqlar: namuna bias, tavsifiy/xulosaviy chalkash, kategoriyaga o'rtacha, qat'iylik, kichik namuna.

Keyingi darsda markazlashuv (o'rtacha, median, mod)ni o'rganamiz: ma'lumot markazini o'lchash — qaysi biri qachon to'g'ri, nega o'rtacha ba'zan aldaydi.

Ulashish:Telegram'da

Izohlar (0)

Izoh yozish uchun kiring.

  • Hozircha izoh yo'q. Birinchi bo'ling!
4.1-dars: Statistika nima — IlmHamroh