W celu zbadania liniowej zależności między dwiema zmiennymi ilościowymi można zastosować:
Testu chi-kwadrat nie użyjemy bezpośrednio do testowania:
Testy nieparametryczne opierają się na:
Hipotezę zerową odrzucamy, gdy:
Błąd I-go rodzaju popełniamy, gdy:
Załóżmy, że pobrana została $n$-elementowa próba z rozkładu normalnego ze znanym odchyleniem standardowym $\sigma$. Do oceny przedziałowej średniej populacyjnej możemy wykorzystać funkcję:
Jeżeli $X_1,\ldots,X_n$ jest dużą próbą z rozkładu o wartości oczekiwanej $\mu$ i odchyleniu standardowym $\sigma$, to suma $X_1+\cdots+X_n$ ma asymptotyczny rozkład:
Do weryfikacji hipotezy o dwóch średnich populacyjnych nie użyjemy:
Niech $f(x)$ będzie funkcją gęstości prawdopodobieństwa ciągłej zmiennej losowej $X$ i niech $F(x)$ będzie jej dystrybuantą. Wówczas $P(a < X < b)$ nie może być obliczone ze wzoru:
Dystrybuanta $F(x)$ zmiennej losowej oznacza:
Z wykresu pudełkowego nie odczytamy wartości:
Jeśli te same osoby rozwiązują kilka zadań w losowej kolejności i chcemy porównać rozkłady czasów ich rozwiązywania, użyjemy:
Funkcja `lillie.test` służy do:
Do testowania hipotezy o dwóch średnich populacyjnych dla dużych prób można wykorzystać funkcję:
Moda (dominanta):
Hipotezę zerową odrzucamy na poziomie istotności $\alpha$, gdy:
Notacja $H_0:\mu \geq 5$, $H_1:\mu < 5$ opisuje:
Niech $L$ i $U$ będą funkcjami zmiennych losowych tworzących próbkę spełniającą $P(L < \mu < U) = 0{,}99$. Wtedy z 99% pewnością przedział $(L,U)$ pokrywa prawdziwą wartość:
Analiza wariancji (ANOVA) służy do testowania hipotezy o równości:
Poziom ufności $1-\alpha$ oznacza:
Rozważmy eksperyment, w którym badana jest liczba niedopełnionych puszek w zależności od automatu napełniającego (jest 6 automatów). Eksperymentator zauważył, że z upływem czasu ilość napoju w puszce maleje, niezależnie od tego, który automat je napełnia. Zatem założenie o normalności rozkładu liczby niedopełnionych puszek nie ma sensu. Którego testu użyć do sprawdzenia, czy wybór automatu ma wpływ na liczbę niedopełnionych puszek?
Na wykresie pudełkowym można zobaczyć następujące wielkości:
Mediana (drugi kwartyl):
Dodatnia wartość kowariancji między zmiennymi $X$ i $Y$ oznacza, że:
Współczynniki liniowego modelu regresji $y=b_0+b_1x$ można wyznaczyć w R za pomocą:
Jeżeli chcemy sprawdzić, czy kolor samochodu wpływa na średnią sprzedaż danego modelu, a dostępne są co najmniej trzy kolory, najrozsądniej jest:
Mediana na wykresie pudełkowym jest zazwyczaj przedstawiona jako:
Która z poniższych wielkości jest statystyką?
Dla ciągłej zmiennej losowej dystrybuanta jest zwykle:
Estymatorów współczynników równania regresji nie wyznaczymy za pomocą: