IlmHamroh
Data Science va sun'iy intellekt/Statistika14/14-dars18 daqiqa
Mundarija (22)

4.14-dars: Statistik amaliy loyiha

4-QISM — STATISTIKA · 14-dars (yakuniy)


1. Kirish va motivatsiya

4-qism davomida statistikaning barcha qismlarini o'rgandik: tavsifiy statistika, markazlashuv, tarqoqlik, taqsimotlar, normal, MLT, namuna, korrelyatsiya, sababiyat, ehtimol, gipoteza, t-test. Endi bularni birlashtirib, real bir tahlil loyihasini bajaramiz — A/B test tahlili: yangi sayt dizayni eskisidan yaxshiroqmi? Bu Data Science'da eng ko'p uchraydigan statistik vazifa (biznes qarorlari, mahsulot yaxshilash). Loyiha butun statistik xulosa oqimini birlashtiradi: ma'lumotni tushunish (tavsifiy), taqsimotni tekshirish, farqni tekshirish (t-test, p-qiymat), ishonch oralig'i, effekt kattaligi, va to'g'ri xulosa (statistik + amaliy + sababiyat). Nega muhim? (1) Sintez — statistika ko'nikmalari birga; (2) Real vazifa — A/B test (eng ko'p); (3) To'g'ri xulosa — statistik tuzoqlarsiz qaror. Bu dars 4-qismni yakunlaydi va statistik xulosaning to'liq oqimini ko'rsatadi.

Statistik amaliy loyiha — A/B test tahlili: tavsifiy (o'rtacha/std/taqsimot — 4.2/4.3/4.5), taqsimot tekshirish (normal-mi — 4.6), t-test (farq — 4.12/4.13), ishonch oralig'i (o'rtacha ± chegara — 4.13), effekt kattaligi (Cohen's d — amaliy), to'g'ri xulosa (statistik + amaliy + sababiyat — 4.10/4.12). Foydalanish: A/B test, tajriba, biznes qaror. Bu butun 4-qism (4.1-4.13) yig'indisi va 20-qism (ML — statistik baholash) ga zamin. Loyiha — sintez. A/B test. To'g'ri xulosa.

Real vaziyat. Data Scientist do'kon A/B testini tahlil qildi: A guruh (eski sayt — 500 foydalanuvchi), B guruh (yangi — 500). Savol: yangi dizayn haqiqatan yaxshi-mi? Butun statistika ishga tushdi: tavsifiy (A o'rtacha 100$, B 108$ — 4.2; std, taqsimot — 4.3/4.5); taqsimot (normal-mi — t-test uchun, 4.6); t-test (p=0.002 — farq ahamiyatli, tasodif emas — 4.12/4.13); ishonch oralig'i (B: 104-112 — 4.13); effekt (Cohen's d=0.5 — o'rta, amaliy muhim); sababiyat (tasodifiy A/B — sabab, korrelyatsiya emas — 4.10). Xulosa: "yangi dizayn xaridni statistik va amaliy oshiradi (95% ishonch, sabab — tajriba)". Loyiha statistika sintezi (butun bilim — A/B). 4-qism yakuni.

Bu darsda butun statistika bilimini loyihada qo'llaymiz.

Bu darsda:

  • Loyiha rejasi (A/B test)
  • Tavsifiy va taqsimot
  • t-test va ishonch oralig'i
  • Effekt va sababiyat
  • To'g'ri xulosa
  • Loyiha amaliyoti
  • Loyiha tuzoqlari
  • Amaliy: to'liq A/B tahlil

ℹ Misollar real numpy/scipy bilan (deterministik) ishlaydi.


2. Nazariya — chuqur tushuntirish

2.1. Loyiha rejasi (A/B test)

Loyiha rejasi — A/B test tahlili (bosqichma-bosqich):

LOYIHA: A/B test (yangi sayt dizayni yaxshiroqmi?)

1. TAVSIFIY (o'rtacha, std, taqsimot) — 4.2/4.3
2. TAQSIMOT (normal-mi — t-test uchun) — 4.5/4.6
3. t-TEST (farq ahamiyatlimi — p) — 4.12/4.13
4. ISHONCH ORALIG'I (o'rtacha ± chegara) — 4.13
5. EFFEKT KATTALIGI (Cohen's d — amaliy)
6. SABABIYAT (tasodifiy A/B — sabab) — 4.10
7. XULOSA (statistik + amaliy + sababiyat)

Sabab: real statistik tahlil bosqichlarga (tavsifiy → taqsimot → test → xulosa); har bosqich statistika ko'nikmasi; reja to'liq xulosa (statistik + amaliy + sababiyat — tuzoqsiz). Bu A/B test (Data Science eng ko'p statistik vazifa — biznes qaror). Loyiha rejasi — bosqichma-bosqich (tavsifiy → xulosa). To'liq. Sintez.

2.2. Tavsifiy va taqsimot

Tavsifiy va taqsimot — birinchi bosqichlar:

python
import numpy as np
from scipy import stats

np.random.seed(0)
A = np.random.normal(100, 15, 500)   # eski
B = np.random.normal(108, 15, 500)   # yangi

# 1. TAVSIFIY (o'rtacha, std)
A.mean(), A.std()      # markaz, tarqoqlik (4.2/4.3)
B.mean(), B.std()

# 2. TAQSIMOT (normal-mi — t-test uchun)
stats.skew(A)          # qiyshiqlik (4.5)
# normal → t-test to'g'ri (4.6)

Tavsifiy va taqsimot — ma'lumotni tushunish: tavsifiy (mean/std — markaz/tarqoqlik, 4.2/4.3; A 100$, B 108$), taqsimot (skew/histogram — normal-mi, 4.5/4.6). Sabab: tahlildan oldin ma'lumotni tushunish (o'rtacha, tarqoqlik — farq bor-mi; taqsimot — t-test normal kutadi 4.13); avval ko'r (tavsifiy — 3.2 describe; shakl — histogram). Taqsimot tekshirish muhim (t-test normal faraz — juda qiyshiq bo'lsa boshqa test). Tavsifiy + taqsimot — mean/std, skew. Tushunish. Birinchi qadam.

2.3. t-test va ishonch oralig'i

t-test va ishonch oralig'i — farq va o'rtacha:

python
# 3. t-TEST (farq ahamiyatlimi)
t, p = stats.ttest_ind(A, B)
# p < 0.05 → farq ahamiyatli (4.12/4.13)

# 4. ISHONCH ORALIG'I (B o'rtachasi qayerda)
SE = B.std(ddof=1) / np.sqrt(len(B))
past = B.mean() - 1.96 * SE
yuqori = B.mean() + 1.96 * SE
# populyatsiya o'rtachasi 95% [past, yuqori]

t-test va ishonch oralig'i — statistik xulosa: t-test (ttest_ind — farq ahamiyatli-mi; p<0.05 → tasodif emas, 4.12/4.13), ishonch oralig'i (o'rtacha ± 1.96*SE — B o'rtachasi qayerda, 95%; 4.13). Sabab: farq haqiqiy-mi (t-test — p; A vs B tasodif-mi) va o'rtacha qayerda (ishonch oralig'i — noaniqlik, oraliq); ikkalasi statistik xulosa (farq + o'rtacha). t-test (farq — p), ishonch oralig'i (o'rtacha — ± chegara). t-test + ishonch oralig'i — farq (p), o'rtacha (oraliq). Statistik. Xulosa.

2.4. Effekt va sababiyat

Effekt va sababiyat — amaliy va sabab: effekt kattaligi (Cohen's d = farq/std — amaliy ahamiyat, 4.13; p statistik, d amaliy), sababiyat (A/B tasodifiy → farq sabab — 4.10; korrelyatsiya emas). Sabab: effekt (statistik ahamiyatli — lekin amaliy muhim-mi? d bilan; katta namunada arzimas farq p<0.05); sababiyat (A/B test tasodifiy guruh → uchinchi omil yo'q → farq sabab — 4.10; nazoratli tajriba). Sabab: to'g'ri xulosa statistik + amaliy + sababiyat (p yetmaydi — effekt, sabab ham). Effekt (Cohen's d — amaliy), sababiyat (tajriba — sabab). Effekt + sababiyat — amaliy (d), sabab (A/B). Amaliy. Sabab.

2.5. To'g'ri xulosa

To'g'ri xulosa — statistik + amaliy + sababiyat: yaxshi xulosa uchala darajani birlashtiradi: (1) statistik (p<0.05 — farq tasodif emas), (2) amaliy (effekt kattaligi — farq muhim-mi; d, ishonch oralig'i), (3) sababiyat (A/B tasodifiy → sabab; korrelyatsiya emas). Sabab: faqat p yetmaydi (statistik ahamiyatli — lekin amaliy kichik? sabab-mi?); to'g'ri xulosa hammasini (tasodif emas + amaliy muhim + sabab). Misol xulosa: "yangi dizayn xaridni 8$ oshiradi (95% ishonch 4-12$; d=0.5 o'rta — amaliy; tasodifiy A/B — sabab)". Yomon xulosa: "yangi yaxshi (p<0.05)" (faqat statistik — amaliy/sabab yo'q). To'g'ri xulosa — statistik + amaliy + sababiyat. To'liq. Tuzoqsiz.

2.6. Loyiha amaliyoti

Loyiha amaliyoti: reja (tavsifiy → xulosa); tavsifiy (mean/std — 4.2/4.3); taqsimot (normal — 4.5/4.6); t-test (farq — p, 4.12/4.13); ishonch oralig'i (o'rtacha — 4.13); effekt (Cohen's d — amaliy); sababiyat (A/B — sabab, 4.10); to'g'ri xulosa (uchala daraja). Tuzoqlar: faqat p (effekt/sabab yo'q), taqsimot tekshirmaslik (t-test normal), korrelyatsiya→sabab (A/B tasodifiy), p-hacking (ko'p test), kichik namuna (kam quvvat). Amaliyot — tavsifiy, t-test, ishonch oralig'i, effekt, sababiyat. Sintez. To'liq.

2.7. Loyiha tuzoqlari

Loyiha asosiy tuzoqlari (butun statistika tuzoqlari birga): faqat p (p<0.05 → "yaxshi" — lekin effekt kattaligi (amaliy) va sababiyat (A/B) ham; to'g'ri xulosa uchala); taqsimot tekshirmaslik (t-test normal kutadi — juda qiyshiq/kichik namuna noto'g'ri; tekshir — 4.5/4.6); korrelyatsiya → sabab (kuzatish ma'lumotda — uchinchi omil; A/B tasodifiy → sabab, 4.10); p-hacking (ko'p metrika/test — tasodifiy ahamiyatli; oldindan — 4.12); kichik namuna (kam quvvat — II tur; farqni o'tkazib yuborish; katta namuna); statistik ≠ amaliy (katta namunada arzimas farq p<0.05 — effekt kichik; 4.12); noto'g'ri t-test turi (mustaqil vs juftlangan — 4.13); bias namuna (A/B guruh vakilli — 4.8). Sabab: loyiha barcha statistika (har tuzoq mumkin — p, taqsimot, sabab, effekt). Yechim: uchala daraja (statistik+amaliy+sabab), taqsimot tekshir, tasodifiy A/B, effekt. Tuzoqlar — faqat p, taqsimot, korrelyatsiya→sabab, p-hacking (butun 4-qism).

2.8. Loyiha — statistik xulosaning to'liq oqimi

Loyiha asosiy g'oyasi — statistik xulosaning to'liq oqimi: 4-qism ko'nikmalar (tavsifiy, taqsimot, korrelyatsiya, gipoteza, t-test) real loyihada birga — A/B test tahlili (Data Science eng ko'p statistik vazifa). Oqim: tavsifiy (ma'lumot tushunish — 4.2/4.3) → taqsimot (normal tekshir — 4.5/4.6) → t-test (farq — 4.12/4.13) → ishonch oralig'i (o'rtacha — 4.13) → effekt (amaliy) → sababiyat (A/B — sabab, 4.10) → to'g'ri xulosa (statistik + amaliy + sababiyat). Eng muhim: to'g'ri xulosa (faqat p yetmaydi — effekt, sabab, taqsimot ham; tuzoqsiz). Data Science'da doim (A/B test — biznes qaror; tajriba — ilm; statistik xulosa — model baholash 20-qism). Sintez — o'rganishning eng muhim bosqichi (alohida statistika yetarli emas — birlashtirib to'g'ri xulosa). Bu butun 4-qism yig'indisi va 20-qism (ML — statistik baholash) ga zamin. Loyiha — statistik xulosaning to'liq oqimi (A/B test). Sintez. To'g'ri xulosa.


3. Tez ma'lumotnoma

python
import numpy as np
from scipy import stats

# A/B TEST TAHLILI (to'liq oqim):
np.random.seed(0)
A = np.random.normal(100, 15, 500)   # eski
B = np.random.normal(108, 15, 500)   # yangi

# 1. TAVSIFIY (4.2/4.3)
A.mean(), A.std(); B.mean(), B.std()

# 2. TAQSIMOT (normal-mi — 4.5/4.6)
stats.skew(A)   # t-test normal kutadi

# 3. t-TEST (farq — 4.12/4.13)
t, p = stats.ttest_ind(A, B)   # p < 0.05 → ahamiyatli

# 4. ISHONCH ORALIG'I (o'rtacha — 4.13)
SE = B.std(ddof=1) / np.sqrt(len(B))
B.mean() - 1.96*SE, B.mean() + 1.96*SE

# 5. EFFEKT (Cohen's d — amaliy)
d = (B.mean() - A.mean()) / A.std()

# 6. SABABIYAT (A/B tasodifiy → sabab — 4.10)

# 7. XULOSA: statistik (p) + amaliy (d, oraliq) + sababiyat (A/B)

QOIDA: faqat p yetmaydi (effekt+sabab) · taqsimot tekshir · A/B tasodifiy

Loyiha xulosasi

Loyiha — statistik xulosaning to'liq oqimi (A/B test)
Oqim: tavsifiy → taqsimot → t-test → ishonch oralig'i → effekt → sababiyat
To'g'ri xulosa — statistik (p) + amaliy (effekt) + sababiyat (A/B)
Faqat p yetmaydi (effekt kattaligi, sabab, taqsimot ham)
Sintez — statistika ko'nikmalari birga (A/B — eng ko'p vazifa)

4. Batafsil misollar

Misollar real numpy/scipy bilan (deterministik) ishlaydi.

Misol 1 — Tavsifiy va taqsimot

python
"""Loyiha 1: tavsifiy va taqsimot (real numpy/scipy)."""

import numpy as np
from scipy import stats


def main() -> None:
    np.random.seed(0)
    A = np.random.normal(100, 15, 500)
    B = np.random.normal(108, 15, 500)

    print("=== 1. Tavsifiy ===")
    print(f"  A: o'rtacha {round(A.mean(), 1)}, std {round(A.std(), 1)}")
    print(f"  B: o'rtacha {round(B.mean(), 1)}, std {round(B.std(), 1)}")

    print("\n=== 2. Farq ko'rinadi ===")
    print(f"  B - A: {round(B.mean() - A.mean(), 1)}")

    print("\n=== 3. Taqsimot (normal-mi) ===")
    print(f"  A skew: {round(stats.skew(A), 2)} (~0 normal)")

    print("\n=== 4. t-test uchun tayyor ===")
    print("  normal → t-test to'g'ri")
    print("  ⭐ Tavsifiy + taqsimot (birinchi qadam)")


if __name__ == "__main__":
    main()

Natijaning muhim qismi:

text
=== 1. Tavsifiy ===
  A: o'rtacha 99.6, std 15.0
  B: o'rtacha 107.0, std 14.6

=== 2. Farq ko'rinadi ===
  B - A: 7.4

=== 3. Taqsimot (normal-mi) ===
  A skew: 0.03 (~0 normal)

=== 4. t-test uchun tayyor ===
  normal → t-test to'g'ri
  ⭐ Tavsifiy + taqsimot (birinchi qadam)

Nima ko'rsatdi: 2.2-bo'lim.

Misol 2 — t-test va ishonch oralig'i

python
"""Loyiha 2: t-test va ishonch oralig'i (real scipy)."""

import numpy as np
from scipy import stats


def main() -> None:
    np.random.seed(0)
    A = np.random.normal(100, 15, 500)
    B = np.random.normal(108, 15, 500)

    print("=== 1. t-test ===")
    t, p = stats.ttest_ind(A, B)
    print(f"  p: {round(p, 6)} → farq ahamiyatli: {p < 0.05}")

    print("\n=== 2. B ishonch oralig'i ===")
    SE = B.std(ddof=1) / np.sqrt(len(B))
    past = B.mean() - 1.96 * SE
    yuqori = B.mean() + 1.96 * SE
    print(f"  B o'rtacha 95%: [{round(past, 1)}, {round(yuqori, 1)}]")

    print("\n=== 3. Farq oralig'i ===")
    farq = B.mean() - A.mean()
    print(f"  farq: {round(farq, 1)}$ (ishonchli)")

    print("\n=== 4. Xulosa ===")
    print("  farq ahamiyatli (p<0.05), o'rtacha oraliqda")
    print("  ⭐ t-test (farq) + ishonch oralig'i (o'rtacha)")


if __name__ == "__main__":
    main()

Natijaning muhim qismi:

text
=== 1. t-test ===
  p: 0.0 → farq ahamiyatli: True

=== 2. B ishonch oralig'i ===
  B o'rtacha 95%: [105.7, 108.3]

=== 3. Farq oralig'i ===
  farq: 7.4$ (ishonchli)

=== 4. Xulosa ===
  farq ahamiyatli (p<0.05), o'rtacha oraliqda
  ⭐ t-test (farq) + ishonch oralig'i (o'rtacha)

Nima ko'rsatdi: 2.3-bo'lim.

Misol 3 — Effekt va sababiyat

python
"""Loyiha 3: effekt va sababiyat (real numpy)."""

import numpy as np


def main() -> None:
    np.random.seed(0)
    A = np.random.normal(100, 15, 500)
    B = np.random.normal(108, 15, 500)

    print("=== 1. Effekt kattaligi (Cohen's d) ===")
    d = (B.mean() - A.mean()) / A.std()
    print(f"  Cohen's d: {round(d, 2)} (o'rta effekt — amaliy)")

    print("\n=== 2. Amaliy ahamiyat ===")
    print(f"  farq 8$ va d=0.5 — amaliy muhim")

    print("\n=== 3. Sababiyat (A/B tasodifiy) ===")
    print("  guruhlar tasodifiy → uchinchi omil yo'q → SABAB")

    print("\n=== 4. Korrelyatsiya emas ===")
    print("  A/B test — nazoratli tajriba (sabab, 4.10)")
    print("  ⭐ Effekt (amaliy) + sababiyat (A/B — sabab)")


if __name__ == "__main__":
    main()

Natijaning muhim qismi:

text
=== 1. Effekt kattaligi (Cohen's d) ===
  Cohen's d: 0.49 (o'rta effekt — amaliy)

=== 2. Amaliy ahamiyat ===
  farq 8$ va d=0.5 — amaliy muhim

=== 3. Sababiyat (A/B tasodifiy) ===
  guruhlar tasodifiy → uchinchi omil yo'q → SABAB

=== 4. Korrelyatsiya emas ===
  A/B test — nazoratli tajriba (sabab, 4.10)
  ⭐ Effekt (amaliy) + sababiyat (A/B — sabab)

Nima ko'rsatdi: 2.4-bo'lim.

Misol 4 — To'liq A/B tahlil (xulosa)

python
"""Loyiha 4: to'liq A/B tahlil (real numpy/scipy)."""

import numpy as np
from scipy import stats


def main() -> None:
    np.random.seed(0)
    A = np.random.normal(100, 15, 500)
    B = np.random.normal(108, 15, 500)

    print("=== A/B TEST HISOBOTI ===")
    print(f"  A (eski): {round(A.mean(), 1)}$, B (yangi): {round(B.mean(), 1)}$")

    t, p = stats.ttest_ind(A, B)
    d = (B.mean() - A.mean()) / A.std()
    SE = B.std(ddof=1) / np.sqrt(len(B))

    print("\n=== STATISTIK ===")
    print(f"  p-qiymat: {round(p, 6)} → ahamiyatli (tasodif emas)")

    print("\n=== AMALIY ===")
    print(f"  farq: {round(B.mean()-A.mean(), 1)}$, Cohen's d: {round(d, 2)} (o'rta)")
    print(f"  B ishonch oralig'i: [{round(B.mean()-1.96*SE, 1)}, {round(B.mean()+1.96*SE, 1)}]")

    print("\n=== SABABIYAT ===")
    print("  tasodifiy A/B → sabab (korrelyatsiya emas)")

    print("\n=== XULOSA ===")
    print("  yangi dizayn statistik + amaliy yaxshi (sabab — tajriba)")
    print("  ⭐ Loyiha — statistik xulosaning to'liq oqimi")


if __name__ == "__main__":
    main()

Natijaning muhim qismi:

text
=== A/B TEST HISOBOTI ===
  A (eski): 99.6$, B (yangi): 107.0$

=== STATISTIK ===
  p-qiymat: 0.0 → ahamiyatli (tasodif emas)

=== AMALIY ===
  farq: 7.4$, Cohen's d: 0.49 (o'rta)
  B ishonch oralig'i: [105.7, 108.3]

=== SABABIYAT ===
  tasodifiy A/B → sabab (korrelyatsiya emas)

=== XULOSA ===
  yangi dizayn statistik + amaliy yaxshi (sabab — tajriba)
  ⭐ Loyiha — statistik xulosaning to'liq oqimi

Nima ko'rsatdi: 2.8-bo'lim.


5. To'g'ri va noto'g'ri tushunishlar

Noto'g'ri fikr To'g'risi
"faqat p yetarli" Statistik + amaliy + sababiyat
"p<0.05 → yaxshi" Effekt, sabab ham
"taqsimot tekshirmasa" t-test normal kutadi
"korrelyatsiya → sabab" A/B tasodifiy (sabab)
"loyiha bitta test" Ko'nikmalar sintezi
"ishonch oralig'i keraksiz" Noaniqlik (oraliq)
"effekt keraksiz" Amaliy ahamiyat
"har bosqich mustaqil" Birga (oqim)

6. Keng tarqalgan xatolar va yechimlari

1. Faqat p

python
t, p = stats.ttest_ind(A, B)   # faqat p                     # ⚠️
# p + effekt (d) + sababiyat (A/B)                            # ✅

2. Taqsimot tekshirmaslik

python
stats.ttest_ind(A, B)   # normal faraz tekshirilmagan        # ⚠️
stats.skew(A)   # taqsimot tekshir (t-test normal)            # ✅

3. Korrelyatsiya → sabab

python
# kuzatish ma'lumotdan sabab                                  # ⚠️
# A/B tasodifiy tajriba (sabab — 4.10)                        # ✅

4. Statistik = amaliy

python
# p<0.05 → muhim                                              # ⚠️
# effekt kattaligi (Cohen's d — amaliy)                       # ✅

5. Kichik namuna

python
stats.ttest_ind(A[:10], B[:10])   # kam quvvat               # ⚠️
# katta namuna (quvvat, tor oraliq)                           # ✅

6. p-hacking

python
# ko'p metrika test, ahamiyatlisini e'lon                     # ⚠️
# oldindan asosiy metrika (bitta)                             # ✅

7. Bias namuna

python
# A/B guruh vakilli emas                                      # ⚠️
# tasodifiy vakilli guruh 4.8-bob                               # ✅

7. Integratsiya — bu bilim qayerda kerak bo'ladi

  • 4.1-4.13 (o'tilgan): Butun statistika (bu loyihada birga)
  • 20-qism: ML (model baholash — statistik)
  • 5-qism: Vizualizatsiya (natijalarni ko'rsatish)
  • Karyera: A/B test (biznes qaror)
  • 9-qism (reja): EDA (statistik tahlil)

8. Eng yaxshi amaliyotlar

  1. Reja — bosqichma-bosqich (tavsifiy → xulosa).

  2. Tavsifiy + taqsimot (avval tushunish).

  3. t-test — farq (normal tekshir).

  4. Ishonch oralig'i — o'rtacha (noaniqlik).

  5. Effekt kattaligi — amaliy (p bilan).

  6. Sababiyat — A/B tasodifiy (sabab).

  7. To'g'ri xulosa — statistik + amaliy + sababiyat.

  8. Loyiha — statistik xulosaning to'liq oqimi.


9. Amaliy topshiriq

Vazifa 1: Bashorat qiling

python
1.  # loyiha nima?
2.  # A/B test nima?
3.  # birinchi qadam?
4.  # taqsimot nima uchun?
5.  # t-test nima beradi?
6.  # ishonch oralig'i?
7.  # effekt kattaligi?
8.  # sababiyat qanday?
9.  # to'g'ri xulosa?
10. # faqat p yetarlimi?
11. # A/B sabab beradimi?
12. # loyiha nima o'rgatadi?
Javoblar
  1. Statistika ko'nikmalar sintezi (A/B)
  2. Ikki guruh taqqoslash (eski/yangi)
  3. Tavsifiy (o'rtacha, std)
  4. t-test normal kutadi
  5. Farq ahamiyatlimi (p)
  6. O'rtacha ± chegara (noaniqlik)
  7. Farq kattaligi (Cohen's d — amaliy)
  8. A/B tasodifiy → sabab
  9. Statistik + amaliy + sababiyat
  10. Yo'q (effekt, sabab ham)
  11. Ha (tasodifiy tajriba)
  12. Ko'nikmalar birga (to'g'ri xulosa)

Vazifa 2: Xatolarni tuzating

python
1.  t, p = ttest_ind(A, B)   # faqat p

2.  ttest_ind(A, B)   # taqsimot?

3.  # kuzatishdan sabab

4.  # p<0.05 → muhim

5.  ttest_ind(A[:10], B[:10])   # kichik
Javoblar
python
1.  p + effekt (d) + sababiyat

2.  stats.skew(A) tekshir

3.  A/B tasodifiy tajriba

4.  effekt kattaligi (amaliy)

5.  katta namuna

Vazifa 3: Reja

Modellang:

  1. Tavsifiy
  2. t-test
  3. Effekt
  4. Xulosa

Vazifa 4: Tavsifiy/taqsimot

Modellang:

  1. O'rtacha/std
  2. Taqsimot
  3. Normal
  4. Tushunish

Vazifa 5: t-test/ishonch

Modellang:

  1. Farq (p)
  2. O'rtacha (oraliq)
  3. Ahamiyatli
  4. Noaniqlik

Vazifa 6: Xulosa

Modellang:

  1. Statistik
  2. Amaliy
  3. Sababiyat
  4. To'liq

Vazifa 7: O'ylash

Yaxshi A/B test xulosasi uch darajani birlashtiradi: statistik (p<0.05 — tasodif emas), amaliy (effekt kattaligi — muhim), sababiyat (A/B tasodifiy — sabab). Nima uchun "yangi dizayn yaxshi (p<0.05)" degan xulosa yetarli emas, va nega uchala daraja birga to'g'ri qaror uchun zarur (statistika loyihada nima uchun "faqat p" xavfli)?

Javob

Qisqa javob: "Yangi yaxshi (p<0.05)" yetarli emas, uchala daraja (statistik + amaliy + sababiyat) zarur, "faqat p" xavfli, chunki: (1) p faqat tasodifni — p<0.05 → farq tasodif emas (statistik); lekin qancha katta (amaliy) va nega (sabab) ko'rsatmaydi; p bir daraja (uchtadan); (2) amaliy (effekt) muhim — p<0.05 (statistik) — lekin katta namunada arzimas farq ham ahamiyatli (0.5$ farq, p<0.05 — statistik, lekin biznesga foydasiz); effekt kattaligi (d, oraliq — farq qancha katta) amaliy qaror (8$ — arziydi; 0.5$ — yo'q); (3) sababiyat muhim — farq ahamiyatli (statistik) — lekin sabab-mi (yangi dizayn sabab yoki uchinchi omil)? A/B tasodifiy → sabab 4.10-bob; kuzatish bo'lsa — sabab noaniq (uchinchi omil); qaror sababga tayanadi (yangi dizaynga o'tish — sabab bo'lsa mantiqiy). "Nega faqat p xavfli": (a) arzimas farq — p<0.05 (katta namuna) → "yaxshi" deb (lekin d kichik — amaliy foydasiz; resurs isrofi); (b) sabab noaniq — p<0.05 (kuzatish) → "yangi sabab" deb (lekin uchinchi omil — noto'g'ri qaror); (c) taqsimot — t-test normal kutadi (tekshirmasa — p noto'g'ri); (d) p-hacking — ko'p metrika → tasodifiy p<0.05 (soxta); (e) noaniqlik — p nuqta (ishonch oralig'i — noaniqlik; oraliq keng bo'lsa ehtiyot). "Nega uchala zarur": qaror to'liq (tasodif emas + amaliy muhim + sabab) — biri yetmaydi (statistik — arzimas bo'lishi mumkin; amaliy — tasodif bo'lishi mumkin; sabab — korrelyatsiya bo'lishi mumkin); uchtasi birga to'g'ri qaror (yangi dizaynga o'tish — tasodif emas, arziydi, sabab). Saboqlar: p faqat tasodif (bir daraja); amaliy (effekt — arziydi-mi); sababiyat (A/B — sabab); faqat p xavfli (arzimas, sabab noaniq). To'g'ri: uchala daraja (statistik + amaliy + sababiyat); to'liq xulosa (tuzoqsiz). Muvozanat: statistik (tasodif emas) + amaliy (muhim) + sababiyat (sabab) — uchala; faqat biri chalg'ituvchi. Bu statistik savodxonlik (to'g'ri xulosa — uchala; faqat p — yarim, xavfli); Data Science qaror (A/B — biznes; to'liq tahlil). Loyiha — sintez (uchala daraja — to'g'ri qaror).

1. Nega p yetarli emas

  • p faqat tasodif (statistik — bir daraja)
  • Qancha katta (amaliy) ko'rsatmaydi
  • Nega (sabab) ko'rsatmaydi

2. Nega uchala zarur

  • Statistik (tasodif emas — p)
  • Amaliy (arziydi-mi — effekt, oraliq)
  • Sababiyat (sabab — A/B tasodifiy)
  • To'liq qaror (biri yetmaydi)

3. Nega faqat p xavfli

  • Arzimas farq (katta namuna p<0.05 — d kichik)
  • Sabab noaniq (kuzatish — uchinchi omil)
  • Taqsimot/p-hacking (p noto'g'ri/soxta)

4. Uch daraja

Daraja Savol
Statistik (p) Tasodif emas-mi?
Amaliy (effekt) Arziydi-mi?
Sababiyat (A/B) Sabab-mi?

5. Saboqlar

  1. p faqat tasodif (bir daraja)
  2. Amaliy (effekt — arziydi-mi)
  3. Sababiyat (A/B — sabab)
  4. Faqat p xavfli (arzimas, noaniq)

6. Xulosa

  1. "p<0.05 → yaxshi" yetarli emas (bir daraja)
  2. Uchala zarur (statistik + amaliy + sababiyat)
  3. Faqat p xavfli (arzimas, sabab noaniq)
  4. To'liq xulosa (to'g'ri qaror)

Nimani mustahkamlaydi: 2.4, 2.5-bo'limlar.


Xulosa

Bu darsda butun statistika bilimini loyihada qo'lladik — 4-qism yakuni.

Eng muhim uch fikr:

  1. Loyiha va oqim. Loyiha — statistika ko'nikmalar sintezi (A/B test tahlili — Data Science eng ko'p statistik vazifa). Oqim: tavsifiy (o'rtacha/std — 4.2/4.3) → taqsimot (normal tekshir — 4.5/4.6) → t-test (farq — 4.12/4.13) → ishonch oralig'i (o'rtacha — 4.13) → effekt (amaliy) → sababiyat (A/B — sabab, 4.10) → to'g'ri xulosa; bosqichma-bosqich.

  2. To'liq tahlil. Tavsifiy + taqsimot (ma'lumot tushunish — avval; t-test normal kutadi). t-test + ishonch oralig'i (farq — p; o'rtacha — ± chegara, noaniqlik). Effekt + sababiyat (Cohen's d — amaliy; A/B tasodifiy → sabab, korrelyatsiya emas).

  3. To'g'ri xulosa. To'g'ri xulosa — statistik (p<0.05 — tasodif emas) + amaliy (effekt kattaligi — muhim-mi) + sababiyat (A/B tasodifiy — sabab). Faqat p yetmaydi (statistik — lekin arzimas bo'lishi mumkin; amaliy, sabab ham); uchala daraja zarur (to'liq qaror). Loyiha — statistik xulosaning to'liq oqimi (A/B — biznes qaror; sintez — ko'nikmalar birga, to'g'ri xulosa). Data Science'da doim (A/B, tajriba, model baholash 20-qism). Tuzoqlar (butun 4-qism): faqat p, taqsimot tekshirmaslik, korrelyatsiya→sabab, p-hacking, kichik namuna.

4-QISM YAKUNLANDI. Statistikani to'liq o'rgandik: statistika nima 4.1-bob, markazlashuv 4.2-bob, tarqoqlik 4.3-bob, kvartillar 4.4-bob, taqsimotlar 4.5-bob, normal 4.6-bob, MLT 4.7-bob, namuna 4.8-bob, korrelyatsiya 4.9-bob, sababiyat 4.10-bob, ehtimol 4.11-bob, gipoteza 4.12-bob, t-test 4.13-bob, loyiha 4.14-bob. Statistika — Data Science matematik poydevori (ishonchli xulosa, ML asosi, aldamaslik).

Keyingi qismda (5-qism — Vizualizatsiya) ma'lumotni grafik bilan ko'rsatishni o'rganamiz: Matplotlib, Seaborn — chiziqli/ustunli grafik, histogram, box plot, heatmap, taqsimot — ma'lumotni ko'rish va tushuntirish (statistika + vizualizatsiya).

Ulashish:Telegram'da

Izohlar (0)

Izoh yozish uchun kiring.

  • Hozircha izoh yo'q. Birinchi bo'ling!