środa, 10 kwietnia 2013

Introduction to LaTeX

Short introduction

LaTeX differs significantly from Office like editors (based on the principle of ``What You See Is What You Get'' or WYSIWYG), see detailed comparison: Word vs. LaTEX .

A short introduction to basic concepts of the system: LaTeX/Introduction.

Installation

LaTeX is an open source software. It runs on many computer platforms (Windows, Mac, Linux). Recommended version (called distribution) for MS Windows is MiKTeX. To edit a document use TeXworks (included with MiKTeX distribution).

Start working with LaTeX

Best way is to watch some videos:-)

Compilation of the 1st document (also shows how to recover from an error):

Font changing commands:

Watch other mathteacher1729's tutorials...

Manuals

Homework

Prepare a document (preferably in your native language; 12--15 pages long) with LaTeX. The subject is irrelevant but the document should contains: title page, sectioning commands, footnotes, figures, tables and bibliography.

Questions?

Ask.

wtorek, 9 kwietnia 2013

Zaliczenia przedmiotu Statystyka opisowa 2013

Zaliczenia przedmiotu Statystyka opisowa 2013

Warunkiem zaliczenia przedmiotu Statystyka opisowa jest przygotowanie w grupie maksimum 4 osób pracy, w której:

  • Należy wszechstronnie porównać rozkład cechy dla dwóch (lub więcej) różnych zbiorowości wykorzystując niżej podane zbiory danych.

oraz

  • Przeprowadzić analizę dynamiki szeregu czasowego.

Uwaga ważne: należy wykonać niezbędne obliczenia za pomocą arkuszy OOCalc (zalecany) lub MS Excel a opis i interpretację uzyskanych wyników opisać w dokumencie w formacie OOWriter/MS Word. Opis powinien bezwzględnie zawierać stronę tytułową z tytułem pracy oraz  nazwiskami i imionami autorów.

Oba pliki (arkusz+opis) należy wysłać elektronicznie na wiadomy adres. Dodatkowo proszę o wydrukowanie i dostarczenie opisu w formie papierowej. Sam plik arkusza bez niezbędnego opisu/interpretacji nie wystarczy do uzyskania zaliczenia.

Zbiory danych przekrojowych

Proszę każdą grupę o wybranie zbioru i niezwłoczne poinformowanie mnie o tym fakcie (wysyłając email). Każda grupa powinna wybrać inny zbiór (co wydaje się oczywiste). Proszę nie zaczynać pracy bez upewnienia się, czy inna grupa już pracuje z tym samym zbiorem danych.

Zbiory oznaczone przez przekreślenie zostały już przez kogoś wybrane.

Zbiory są porównywalne pod względem pracochłonności.

W razie trudności/problemów proszę o kontakt.

Uwaga: ponieważ pojawiły się problemy z dostępem do danych umieściłem je dodatkowo pod innym adresem (ten dodatkowy link jest umieszczony pod zestawieniem).

  1. Puchar Świata w Rugby. Porównać wagę i/lub wzrost zawodników w rozgrywkach z 2007 i 2011. Albo porównać wagę zawodników z drużyn Europejskich vs Australia i Oceania (Nowa Zelandia, Australia, Samoa Zachodnia, Fiji, Tonga). ##

  2. Polska liga piłkarska. Porównać wiek zawodników w 1 i drugiej lidze. ####

  3. Posłowie na Sejm. Porównać wiek posłów dwóch kadencji (np. 7. i 4.) #

  4. Działanie niemieckich łodzi podwodnych w 2 Wojnie Światowej. Porównać zatopienia i liczbę patroli łodzi typu VII i IX. Pominąć łodzie, które nie odbyły żadnego patrolu bojowego. #

    Zmiennie: typ -- typ łodzi; numer -- numer; patrole -- liczba patroli bojowych; statki -- liczba zatopionych statków; tonaz -- tonaż zatopionych statków (BRT); okrety -- liczba zatopionych okrętów; okrety.tonaz -- tonaż zatopionych okrętów

  5. Ludność wg powiatów. Porównać rok 2012 i 2005 (lub inny). Uwaga: dane trzeba przepisać z pliku PDF (ale nie jest aż tak pracochłonne, jak się wydaje na pierwszy rzut oka:-). ###

  6. Bezrobotni/stopa bezrobocia wg. powiatów. Porównać rok 2012 i 2005 (lub inny). ##

  7. Ważniejsze dane o stanie zagrożenia i ochronie środowiska. Porównać rok 2011 oraz 2007 (albo 2009). Klikamy w poniższy link, w plikach o nazwach zawierających ochrona_srodowiska szukamy tabeli pn. WAŻNIEJSZE DANE O STANIE, ZAGROŻENIU I OCHRONIE ŚRODOWISKA WEDŁUG POWIATÓW. | #

    Uwaga: dane trzeba przepisać z pliku PDF (ale nie jest aż tak pracochłonne, jak się wydaje na pierwszy rzut oka:-).

  8. Wypadki rowerowe w UK wg. okręgów wyborczych (constituency). Porównać 2 wybrane lata, np. 2010 oraz 2005. ##

  9. Bezrobocie w UK wg. okręgów wyborczych (constituency). Porównać dwa okresy czasu. ##

  10. Odsetek ludzi z nadwagą wg krajów świata. Porównać kobiety vs mężczyźni lub dwa okresy czasu. ##

Dodatkowe linki do danych (jeżeli powyższe nie działają): Sejm | Liga polska | PŚ w Rugby | Wypadki w UK | U-booty | Dane z GUSu (pkt 5--7).

Szeregi czasowe

Proszę wybrać szereg/szeregi spośród danych publikowanych w Biuletynie Statystycznym GUS:

Biuletyn Statystyczny -- Archiwum

Proszę upewnić się, że inna grupa już pracuje z tym samym zbiorem danych.

poniedziałek, 14 stycznia 2013

wtorek, 4 grudnia 2012

Esej na zaliczenie przedmiotu Ekonometria I -- 2012/2013

Esej powinien składać się z 4 części:

I. część makroekonomiczna -- krótki opis znaczenia wybranej kategorii makroekonomicznej na podstawie podręczników makroekonomii max 3--4 strony

II. Opis dynamiki szeregu z uwzględnieniem wahań sezonowych, wyznaczenie trendu metodą mechaniczną -- średnia ruchoma

III. Ekonometryczny model tendencji rozwojowej -- zastosować 2--3 postacie funkcji trendu (liniowa, kwadratowa, sprowadzana do liniowej), pełna diagnostyka modelu -- Mfit lub gretl.

IV. Wyznaczyć oraz porównać prognozy na 3 okresy uzyskane na podstawie: a) trendu mechanicznego b) modelu tendencji rozwojowej

Proponowana punktacja -- max 40 pkt. I. 9, II. 8 III. 15, IV. 8. Razem 40 pkt.

Uwaga: część I oraz II--IV nie muszą dotyczyć tego samego, tzn. opis kategorii nie musi dotyczyć danych wykorzystywanych w punktach II--IV.

Do analiz empirycznych proszę wykorzystać dane zawarte w pliku: https://docs.google.com/spreadsheet/ccc?key=0ApoiGfoEdPRCdG44dmt4N2prWUVybmg0ZVFVNTBMelE

Dane są w formacie Google Spreasheet. W razie problemów (których nie powinno być) proszę o kontakt.

wtorek, 12 czerwca 2012

Analiza zależności zmiennych ilościowych: regresja liniowa

Badamy jednostki statystyczne pod kątem dwóch różnych cech oznaczanych jako $X$ oraz $Y$. Symbolem $X$ oznaczamy zmienną objaśniającą (przyczynę) a symbolem $Y$ -- zmienną objaśnianą (skutek). Postulowana zależność pomiędzy $X$ oraz $Y$ może mieć różnoraki charakter. W najprostszym przypadku może to być zależność liniowa, którą można opisać równaniem: $$Y = \alpha + \beta X + \xi$$ gdzie: $Y$ --zmienna objaśniana; $X$ -- zmienna objaśniająca (w modelu bardziej ogólnym może być więcej niż jedna zmiennych objaśniających) $\alpha$, $\beta$ -- parametry; $\xi$ -- składnik losowy.

Czyni się dodatkowe założenia odnośnie rozkładu $\xi_i$ (które tutaj pominiemy).

Zadanie polega na wyznaczeniu parametrów $\alpha$, $\beta$ w oparciu o $n$-elementową próbę tj: $$y_i = \alpha + \beta x_i$$ gdzie: $y_i$ -- $i$-ta obserwacja na zmiennej objaśnianej ($i=1...n$); $x_i$ -- $i$-ta obserwacja na zmiennej objaśniającej ($i=1...n$) $\alpha$, $\beta$ -- parametry.

Zmienne $y_i$/$x_i$ mogą być szeregiem czasowym lub przekrojowym.

Metoda najmniejszych kwadratów (MNK) polega na wyznaczeniu takich ocen parametrów $\alpha$, $\beta$, aby suma kwadratów odchyleń zaobserwowanych wartości zmiennej objaśnianej ($y_i$) od jej wartości teoretycznych wyznaczonych przez funkcję regresji osiągnęła minimum. Można to zapisać: $$\Omega = \sum_{i=1}^n (y_i - (\alpha + \beta x_i))^2 \to \min$$

Rozwiązanie polega na porównaniu do zera pierwszych pochodnych cząstkowych funkcji $\Omega$ względem $\alpha$ i $\beta$ (wyprowadzenie pomijamy): $$ \begin{aligned} \hat \beta &= \frac{\sum_{i=1}^n (y_i -\bar y)(x_i - \bar x) }{ \sum_{i=1}^n (x_i - \bar x)^2 } \\ \hat \alpha &= \bar y - \bar \beta x \end{aligned} $$

Regresja przykład 2
Rysunek 1: Linia regresji może być lepiej lub gorzej dopasowana do danych empirycznych. Przykład dobrego dopasowania linii regresji do danych. Czerwone punkty mają współrzędne ($x_i, y_i$).
Regresja przykład 1
Rysunek 2: Linia regresji może być lepiej lub gorzej dopasowana do danych empirycznych. Przykład kiepskiego dopasowania linii regresji do danych. Czerwone punkty mają współrzędne ($x_i, y_i$). Wyrażenie widać, że ,,chmura punktów'' na rys. 1 zdecydowania bardziej układa się wzdłuż prostej niż na rys. 2.

Ocena jakości dopasowania linii regresji

Resztą nazywamy różnicę: $e_i = y_i - \hat y_i$, gdzie $\hat y_i = \alpha + \beta x_i $ (tzw. wartość teoretyczna zmiennej objaśnianej).

Standardowe odchylenie składnika resztowego: $$ s_{\xi} = \sqrt { \frac{1}{n-2} \sum_{i=1}^n (y_i - \hat y_i)^2 } $$ Zwane także błędem standardowym reszt. Interpretacja: ,,przeciętne odchylenie wartości teoretycznych od empirycznych zmiennej objaśnianej''.

Przykładowo dla linii regresji na rys 1 $s_{\xi}=1.21$, a na rys. 2 -- $s_{\xi}=2.77$. Jest to obiektywne i ścisłe potwierdzenie ,,wrażenia'', że jedna linia regresji jest zdecydowanie bliżej ,,chmury punktów'' niż druga. Jeżeli jednostką, w której wyrażona jest wartość $Y$ jest przykładowo hektar, to ,,przeciętne odchylenie wartości teoretycznych od empirycznych wynosi 1.21 hektara'' (dla linii regresji z rysunku 1).

Ocena przeciętnego błędu popełnianego przy szacowaniu prawdziwych wartości $\beta$ i $\alpha$. Odchylenie ocen parametrów (błąd standardowy oceny): $$ \begin{aligned} s(\beta) &= \sqrt { \frac{ s_{\xi}^2 }{\sum_{i=1}^n (x_i -\bar x)^2} } \\ s(\alpha) &= s_{\xi} \sqrt { \frac{\sum_{i=1}^n x_i^2}{n \sum (x_i -\bar x)^2} } \end{aligned} $$ Interpretacja: szacując prawdziwe wartości $\beta$ i $\alpha$ na podstawie próby losowej mylimy się przeciętnie (odpowiednio) $\pm s(\beta)$ oraz $\pm s(\alpha)$.

Przykładowo dla linii regresji z rys. 1 $s(\beta)=0.18$ a dla linii regresji z rys. 2 -- $s(\beta)=0.32$. Przeciętny błąd wynosi zatem odpowiednio około 26% wielkości ocen parametru ($s(\beta)/\beta\cdot100 \approx26$% lub $105$% ($0.32/0.303$). Kolejne potwierdzenie, że linia regresji z rys. 1 jest lepiej dopasowana.

Istotność parametrów strukturalnych ($H_0: \beta=0$). Statystyka: $$T_{n-2} = \frac{\hat \beta}{ s(\beta) } $$ ma rozkład $t$-Studenta z $n-2$ stopniami swobody. W modelu poprawnym hipoteza $H_0: \beta=0$ powinna zostać odrzucona (albo inaczej: brak podstaw do odrzucenia $H_0$ dyskwalifikuje model, bo $Y = 0 \cdot X + \alpha = \alpha$ -- zmienne $X$ i $Y$ nie są ze sobą związane)

Błąd standardowy oceny parametru $\beta$ winien być możliwie mały, i mniejszy tym lepiej. Zwróćmy uwagę, że niskim wartościom statystyki $T_{n-2}$ (co oznacza brak podstaw do odrzucenia $H_0$ -- a zatem brak podstaw do odrzucenia hipotezy o nieistotności parametru $\beta$) odpowiada sytuacja, kiedy wartość błędu standardowego oceny jest duża (względem oszacowanej wartości $\hat \beta$).

Ogólna ocena modelu -- Współczynnik zbieżności: $$ \phi^2 = \frac{\sum_{i=1}^n (y_i -\hat y_i)^2 }{ \sum_{i=1}^n (y_i -\bar y_i)^2 } \cdot 100% \quad 0\leq \phi^2 \leq 100 $$ Im $\phi^2$ jest bliższy 0, tym dopasowanie jest lepsze. Wartość $\phi^2$ interpretuje się jako ,,procent zmienności zmiennej $y$ nie objaśniony przez model regresji liniowej pomiędzy $y$ a $x$.''

Współczynnik determinacji $R^2=100-\phi^2$ interpretuje się jako ,,procent zmienności zmiennej $y$ objaśniony przez model regresji liniowej pomiędzy $y$ a $x$.''

Przykładowo dla linii regresji z rys. 1 $R^2=73$% (73% zmienności zmiennej $y$ jest objaśnione przez model regresji liniowej) a dla linii regresji z rys. 2 $R^2=46$%. Linia regresji z rys. 1 jest lepiej dopasowana.

Wyznaczenie parametrów linii regresji w arkuszu OpenOffice.org Calc

Do obliczania współczynników regresji liniowej oraz miar dopasowania w programach MS Excel oraz OpenOffice.org Calc służy polecenie REGLINP, którego składania jest następująca:


REGLINP(zakres-Y;zakres-X,1,1)

Jeżeli zmienna $x$ zapisana jest (przykładowo) w komórkach A2:A8, a zmienna $y$ w komórkach B2:B8, to wywołanie funkcji będzie miało postać:


REGLINP(B2:B8;A2:A8,1,1)

Funkcja REGLINP (w wersji OpenOffice) zwraca obszar o wielkości 5 wierszy na 2 kolumny. Poszczególne komórki tego obszaru zawierają co następuje:

$\beta$ $\alpha$
$s(\beta)$ $s(\alpha)$
$R^2$ $s_{\xi}$

Zawartość wierszy 4 i 5 nie interesuje nas....

Uwaga: funkcja REGLINP jest specjalna (bo zwraca obszar): po jej wpisaniu do komórki należy nacisnąć Ctrl-Shift-Enter a nie zwyczajne Enter.

Przykład

Przykładowy arkusz w formacie OOCalc zawiera 5 kolumn (por. tutaj: STATE -- kod stanu; TAX -- podatek od benzyny (centy/galon); INC -- dochód per capita (tysiące USD); ROAD -- długość dróg (thousands of miles of federal-aid primary highways in 1971); DLIC -- mieszkańcy stanu posiadający prawo jazdy (w procentach); FUEL -- przeciętne zużycie benzyny (gallons per person) w stanie.

Interesują nas tylko zmienne DLIC oraz FUEL.

Zależność pomiędzy przeciętnym zużyciem benzyny na mieszkańca a odsetkiem kierowców w stanie można zapisać jako: $$\mathit{FUEL} = \alpha + \beta \mathit{DLIC} + \xi$$

Oszacowana linia regresji dana jest równaniem: $$\mathit{FUEL} = 14,01 \cdot \mathit{DLIC} - 227,31$$ Zwiększenie o 1% odsetka mieszkańców posiadających prawo jazdy przeciętnie zwiększy zużycie na głowę o 14,01 galona.

Ocena dopasowania: $s_\xi=80.88$, Przeciętne odchylenie wartości teoretycznych od empirycznych wynosi 80.88 galona ($s_\xi$ jest zawsze mianowane w jednostkach zmiennej $Y$). Współczynnik zbieżności $R^2=48.9$% oznacza, że 48.9% zmienności zużycia benzyny na głowę jest objaśnione przez model regresji liniowej pomiędzy zużyciem benzyny na głowę a odsetkiem mieszkańców posiadających prawo jazdy.

Odchylenie ocen parametrów: $s(\beta)=2.13$ oraz $s(\alpha)=121.9$. Już na pierwszy rzut oka widać, że parametr $\beta$ jest istotny ($H_0: \beta=0$ należy odrzucić) ponieważ przeciętny błąd $s(\beta)$ stanowi zaledwie $15$% oceny parametru. Dokładniej: $T_{n-2} = 6.577$ (wartość krytyczna na poziomie istotności $\alpha=0.05$ dla $49-2 = 47$ stopni swobody wynosi $\approx 2.7$).

Przykładowy arkusz w formacie OOCalc jest tutaj.

Resztę proszę sobie doczytać ze slajdów....

wtorek, 15 maja 2012

Statystyka opisowa: dane oraz przykładowe zadania

Zaliczenia przedmiotu Statystyka opisowa

Warunkiem zaliczenia przedmiotu Statystyka opisowa jest przygotowanie w grupie maksimum 3 osób pracy, w której:

  • Należy wszechstronnie porównać (średnie, rozproszenie, asymetria, wykresy) rozkład cechy dla dwóch (lub więcej) różnych zbiorowości. Można wykorzystać dane indywidualne (przykład 1 poniżej) lub pogrupowane (przykład 2), albo:

  • Zamiast badania danych przekrojowych można przeprowadzić analizę dynamiki szeregu czasowego (obejmującą: średnie, różne wskaźniki dynamiki, trend+sezonowość (jeżeli występuje), wykresy), por. przykład 3.

Uwaga ważne: należy wykonać niezbędne obliczenia za pomocą arkuszy OOCalc (zalecany) lub MS Excel a opis i interpretację uzyskanych wyników zawrzeć w dokumencie w formacie OOWriter/MS Word. Opis powinien bezwzględnie zawierać stronę tytułową z tytułem pracy oraz  nazwiskami i imionami autorów.

Oba pliki (arkusz+opis) należy wysłać elektronicznie na wiadomy adres. Dodatkowo proszę o wydrukowanie i dostarczenie opisu w formie papierowej. Sam plik arkusza bez niezbędnego opisu/interpretacji nie wystarczy do uzyskania zaliczenia.

Przykładowe zadania

Przykład 1: Liczba głosów oddanych na posłów wybranych do Sejmu 7 kadencji. Porównamy dwie partie określające się jako lewicowe (cokolwiek to znaczy), tj. RP (Ruch Poparcia Palikota) oraz SLD (Sojusz Lewicy Demokratycznej)

Komentarz do obliczeń wykonanych w programie oocalc

Pobieramy dane i zapisujemy w odpowiednim formacie. Arkusz zawiera dane dotyczące wszystkich posłów. Aby oddzielić posłów RP/SLD od reszty można po prostu posortować (Dane→Sortuj) względem kolumny ,,I''. Następnie metodą kopiuj-wklej przenosimy, to co jest potrzebne do oddzielnego arkusza. Analizę przeprowadzamy oddzielnie dla posłów RP i SLD.

Przykładowy arkusz w formacie OOCalc jest tutaj.

Aby wykreślić histogram należy dane pogrupować w szereg rozdzielczy. Do tego celu służy funkcja CZĘSTOŚĆ, której składnia jest następująca:

CZĘSTOŚĆ (obszar-danych ; obszar-końców-przedziałów)

W omawianym przykładzie obszar-danych, to kolumna zawierająca liczbę oddanych na posła głosów (log). Argument obszar-końców-przedziałów to obszar górnych końców przedziałów szeregu rozdzielczego. Funkcja CZĘSTOŚĆ zwraca obszar o jedną komórkę większy od obszaru górnych końców przedziałów -- liczebność tej komórki, to liczba elementów większych od wartości ostatniego górnego końca przedziału. Krótki film ilustruje jak należy używać funkcji CZĘSTOŚĆ.

Uwaga: funkcja CZĘSTOŚĆ jest specjalna (bo zwraca obszar): po jej wpisaniu do komórki należy nacisnąć Ctrl-Shift-Enter a nie zwyczajne Enter.

Kształt histogramu (a co za tym idzie wnioski dotyczące kształtu rozkładu) zależą w dużym stopniu od sposobu pogrupowania danych w szereg rozdzielczy. Kolejny arkusz przedstawia kilka histogramów dla różnych wariantów grupowania danych.

Do obliczenia średniej, mediany, kwartyli, wariancji, odchylenia standardowego itp. służą odpowiednie funkcje. Przykładowo poniższa funkcja wyznaczy wartość mediany:

MEDIANA (obszar-danych)

Interpretacja otrzymanych wyników:

Średni liczba głosów oddanych na posła SLD wyniosła 13075 a na posła RP 14894. Jeżeli chodzi o posłów SLD to 50% zdobyło nie więcej niż 9941 głosów, 25% z nich zdobyło nie więcej niż 8041 głosów a 75% -- zdobyło nie więcej niż 15597 głosów Jeżeli chodzi o posłów RP to 50% zdobyło nie więcej niż 12828 głosów, 25% z nich zdobyło nie więcej niż 9984 głosów a 75% -- zdobyło nie więcej niż 15837 głosów Wielkości wszystkich miar średnich (oraz analiza histogramu) wskazuje, iż przeciętnie posłowie RP wybrani do Sejmu 7 kadencji zdobyli więcej głosów.

Przeciętne odchylenie liczby zdobytych głosów od średniej arytmetycznej wyniosło dla posłów SLD 9313,7 głosów a dla posłów RP 12825,5 głosów. W wartościach bezwzględnych bardziej jednorodną grupą wydają się być zatem posłowie SLD. Także wartości względne, tj. wartości współczynników zmienności (klasycznych) wynoszące odpowiednio 71,2% (SLD) oraz 90,6% (RP) wskazują na większe zróżnicowanie grupy posłów RP.

Wartości współczynników zmienności opartych o medianę i kwartyle wskazują natomiast, że zróżnicowanie liczby głosów w grupie posłów SLD ($V_q = 76%$ ) jest większe niż w grupie posłów RP ($V_q = 45%$). Podobnie wygląda wskaźnik definiowany jako $V_Q=(Q_3-Q_1)/(Q_3+Q_1)$, którego wartość dla posłów SLD wynosi 32% a dla posłów RP 22,7%.

Skąd taka dziwna wartość współczynnika $V_s$?

Obliczmy średnie i miary rozproszenia dla obu grup posłów pomijając obserwacje skrajnie nietypowe (cf. jeszcze inny arkusz). W każdej z obu grup jest jedna nietypowa obserwacja: wynik lidera listy (J. Palikot i R. Kalisz). Po usunięciu tej jednej obserwacji wszystkie współczynniki zmienności, bez wyjątku wykazują na większą zmienność grupy posłów SLD. Wniosek: miary klasyczne nie są właściwe w przypadku rozkładów zawierających wielkości nietypowe i/lub rozkładów znacznie odbiegających kształtem od rozkładu jednomodalnego.

Uwaga dla studentów: proszę obliczyć wszystkie miary a ew. zdyskwalifikować miary klasyczne jako wniosek z analizy a nie z góry założyć że miary klasyczne są do kitu i ich nie liczyć. Za takie postępowanie zostanie obniżona ocena!

Kształt rozkładów (histogram) wskazuje, że rozkłady cechuje asymetria dodatnia, przy czym asymetria w przypadku posłów SLD jest zauważalnie większa a dla posłów RP wydaje się być nieduża. Obliczone wielkości klasycznego współczynnika asymetrii ($\mu$) wskazują na ogromną asymetrię obu rozkładów ($\mu> 3$ dla SLD oraz $\mu> 5$ dla RP). Współczynniki Pearsona są znacznie niższe ($\mu = 38$ dla SLD oraz $\mu> 0,03$ dla RP) i wskazują na -- zgodną ze stanem faktycznym (wykres) sytuacją.

Wniosek: także klasyczne miary asymetrii nie są właściwe w przypadku rozkładów zawierających wielkości nietypowe i/lub rozkładów znacznie odbiegających kształtem od rozkładu jednomodalnego. Wniosek ten potwierdza analiza skośności po usunięciu wartości nietypowych (J. Palikot i R. Kalisz).

Przykład 2: porównanie struktury wieku posłów dwóch największych partii wybranych do Reichstagu w wyborach z 1930 r. (źródło cf. Młodzi, wykształceni z wielkich miast).

Obliczenia są w miarę oczywiste i nie wymagają dodatkowego komentarza. Stosowny arkusz jest tutaj.

Uwaga: analizowany szereg ma nieokreślone: dolny koniec pierwszego oraz górny koniec ostatniego przedziału. Arbitralnie przyjęliśmy 20 lat jako dolny koniec pierwszego a 80 lat jako górny koniec ostatniego przedziału. Ponieważ liczebności tych przedziałów są niewielkie ewentualny popełniony błąd także nie będzie duży.

Interpretacja otrzymanych wyników:

Średni wiek posła NSDAP wynosił 38,8 lat a posła KPD był nieco niższy bo wynosił 37,35 lat. 50% posłów NSDAP miało 37,1 lat i mniej. 25% posłów NSDAP nie było starszych niż 32,5 lat (pierwszy kwartyl, $Q_1$) a 75% nie było starszych niż 44,1 lat (trzeci kwartyl, $Q_3$). 50% posłów KPD miało 36,7 lat i mniej. 25% posłów KPD nie było starszych niż 32,4 lat a 75% nie było starszych niż 42,1 lat.

Wielkości wszystkich miar średnich (oraz analiza histogramu) wskazuje, iż przeciętnie posłowie KPD wybrani do Reichstagu w wyborach z 1930 r. byli nieco młodsi od posłów NSDAP.

Przeciętne odchylenie wieku od średniej arytmetycznej wyniosło dla posłów NSDAP 9,1 lat a dla posłów KPD 7,12 lat co wskazuje że posłowie KPD są grupą bardziej jednorodną. Potwierdzają to wartości względne, tj. wartości współczynników zmienności (klasycznych) wynoszące odpowiednio 23,5% (NSDAP) oraz 19,1% (KPD). Wartości współczynników zmienności opartych o medianę są nieco wyższe i wynoszą odpowiednio: 31,1% oraz 26,3%.

Kształt rozkładów (histogram) oraz różnica pomiędzy wielkościami miar średnich wskazuje, że rozkłady cechuje niewielka asymetria dodatnia. Co potwierdzają obliczone wielkości współczynników zarówno klasycznego ($\mu$) jak i Pearsona wykorzystującego różnice pomiędzy średnimi ($W_s$)

Przykład 3: Kwartalny skup mleka w mln litrów w Polsce w latach 1996--2003 (32 obserwacje)

Komentarz do obliczeń wykonanych w programie oocalc

Obliczenia są zawarte w arkuszu dostępnym tutaj.

Ponieważ z wykresu wynika, że mamy do czynienia z sezonowością roczną obliczamy średnią ruchomą 4-okresową (kolumna ,,D'' arkusza).

Kolumna ,,M'' zawiera obliczenia potrzebne do wyznaczenia wartości średniego błędu kwadratowego

Kolumny ,,N'' do ,,T'' zawierają obliczenia niezbędne do wyznaczenia parametrów trendu liniowego (i oceny dopasowania tegoż trendu) metodą najmniejszych kwadratów.

Kolumny ,,V'' do ,,Y'' zawierają obliczenia niezbędne do wyznaczenia wskaźników sezonowości. Wskaźniki surowe zawiera wiersz 37 a oczyszczone wiersz 40 (w kolumnach ,,V''--,,Y'')

Kolumna ,,Z'' zawiera obliczone wskaźniki sezonowości.

Skorygowane o wskaźniki sezonowości wartości funkcji trendu liniowego zawiera kolumna ,,AA''. Kolumna ,,AB'' zaś niezbędne obliczenia dla wyznaczenia RMSE (pierwiastek błędu średniokwadratowego) dla szeregu skorygowanego przez przemnożenie przez odpowiednie wskaźniki sezonowości.

Interpretacja otrzymanych wyników:

Funkcja trendu skupu mleka w Polsce w latach 1993--2003 jest następująca $$ \hat y_t = 1591849,4 + 5582,4 t $$ Z funkcji trendu wynika, że w latach 1996--2003 skup mleka w Polsce wzrastał z kwartału na kwartał średnio o 5582,4 mln litrów. Wyraz wolny funkcji trendu (1591849,4) informuje o teoretycznej wielkości skupu mleka w pierwszym kwartale 1996 r.

Odchylenie standardowe składnika losowego wynosi 258448,5 mln litrów. Średnie błędy szacunku parametrów są zaś równe $\bar \beta = 4948,3$ oraz $\bar \alpha = 93559,9$. Wielkość standardowe składnika losowego zwłaszcza w przypadku parametru $\beta$ jest znaczna co świadczy o słabym dopasowaniu do danych empirycznych. Można oczekiwać, iż test istotności parametru strukturalnego $\beta \neq 0$ wykaże iż nie ma podstaw do odrzucenia $H_0$ (sprawdzić samodzielnie!)

Słabe dopasowanie potwierdzają wielkości współczynników $\phi^2$ oraz $R^2$ wynoszące odpowiednio 96% oraz 4%, tj. 96% procent zmienności skupu mleka nie jest objaśniane przez liniową funkcję trendu. Albo: zaledwie 4% procent zmienności skupu mleka jest objaśniane przez liniową funkcję trendu.

Porównując wielkości współczynnika RMSE (pierwiastek błędu średniokwadratowego) dla liniowej funkcji trendu (RMSE_tl) oraz średniej ruchomej otrzymamy: $$ \begin{aligned} RMSE_{sr} &= \sqrt{53886700/30} =1796223.33 \\ RMSE_{tl} &= \sqrt{2003868574371/32} = 62620892949.09 \end{aligned} $$ co świadczy o dużo lepszym dopasowaniu średniej ruchomej do danych empirycznych (powodem jest oczywiście sezonowość--trend liniowy w takiej sytuacji dużo gorzej objaśnia kształtowanie się skupu mleka)

Sezonowość. Wielkość skupu mleka w pierwszym kwartale stanowiła 82,7% przeciętnej kwartalnej, zaś w drugim, trzecim i czwartym kwartale odpowiednio 110,6%, 116,9 oraz 89,8% przeciętnej kwartalnej.

Obliczenie RMSE dla danych skorygowanych dało w wyniku $232363367977,161/32 = 85213,6$ (dla danych nieskorygowanych było to $2003868574371,33/32 = 250241,7$ czyli znacznie więcej.

Dane

Pliki z przykładowymi danymi (w formacie CSV dla ułatwienia importu do różnych arkuszy i/lub innych narzędzi) oraz wyżej cytowane arkusze (w formacie OOCalc) są dostępne tutaj.

Literatura

Dokumentacja OOffice (niestety w języku).

poniedziałek, 14 maja 2012

Analiza dynamiki zjawisk

Średnia ruchoma (moving average)

Oblicznie $k$-okresowej średniej ruchomej w przypadku gdy $k$ jest liczbą nieparzystą: $$ y_{t + (k-1)/2} = \frac{1}{k} \sum_{i=t}^{t + k -1} y_i \quad t = 1,\dots,n - \frac{k-1}{2} \label{S-MovingAverage} $$

Przykładowo powyższy wzorek można rozpisać dla $k=3$ następująco: $$ \begin{aligned} \bar y_2 &= \frac{y_1 + y_2 + y_3}{3} \\ \bar y_3 &= \frac{y_2 + y_3 + y_4}{3} \\ \dots & \dots \\ \bar y_{n-1} &= \frac{y_{n-2} + y_{n-1} + y_n}{3} \end{aligned} $$

Oblicznie $k$-okresowej średniej ruchomej w przypadku gdy $k$ jest liczbą parzystą (średnia ruchoma scentrowana): $$ y_{t + k/2} = \frac{1}{k} (0,5 y_t + \sum_{i=t}^{t+k-1}y_i + 0,5 y_{t+k}) \quad t=1,\dots,n - \frac{k}{2} \label{S-MovingAverage-C} $$

Przykładowo powyższy wzorek można rozpisać dla $k=4$ następująco: $$ \begin{aligned} \bar y_3 &= \frac{0,5 y_1 + y_2 + y_3 + y_4 + 0,5 y_5}{4} \\ \bar y_4 &= \frac{0,5 y_2 + y_3 + y_4 + y_5 + 0,5 y_6}{4} \\ \dots & \dots \\ \bar y_{n-2} &= \frac{0,5 y_{n-4} + y_{n-3} + y_{n-2} + y_{n-1} + 0,5 y_n}{4} \end{aligned} $$

Ocena jakości dopasowania

Błędy prognoz ex-post

Średni błąd kwadratowy ($n^*=n -(k-1)/2$ lub $n^*=n -k/2$) w zależności od rodzaju średniej ruchomej: $$ MSE = \frac{1}{n^*} \sum_{i=1}^{n^*} (y_i -\bar y_i)^2 $$

Pierwiastek błędu średniokwadratowego: $$ RMSE = \sqrt{MSE} $$

Wykorzystanie modelu średniej ruchomej do prognozowania polega na wyznaczeniu prognozy jako średniej arytmetycznej zwykłej bądź ważonej z $k$ ostatnich wartości zmiennej, tj. $y^*_t = \frac{1}{k}\sum_{i=t-k}^{t-1}y_i$ przy czym $k$ należy wyznaczyć tak aby średni kwadratowy błąd ex post był minimalny.

Metoda analityczna

Liniowa funkcja trendu ma postać: $$y_t = \alpha + \beta t + \xi_t$$ gdzie: $y_t$ -- poziom zjawiska w okresie $t$; $\alpha$, $\beta$ -- parametry; $t$ -- zmienna czasowa (np. $t= 1,...n$) oraz $\xi_t$ -- składnik losowy.

Wartości (oceny) parametrów wyznaczone metodą najmniejszych kwadratów są następujące: $$ \begin{aligned} \hat \beta &= \frac{\sum_{t=1}^n (y_t -\bar y)(t - \bar t) }{ \sum_{i=1}^n (t - \bar t)^2 } \\ \hat \alpha &= \bar y - \bar \beta t \end{aligned} $$

Ocena jakości dopasowania

Standardowe odchylenie składnika resztowego: $$ s_{\xi} = \sqrt { \frac{1}{n-2} \sum_{t=1}^n (y_t - \hat y_t)^2 } $$

Odchylenie ocen parametrów (błąd standardowy oceny) $$ \begin{aligned} s(\beta) &= \sqrt { \frac{ s_{\xi}^2 }{\sum (t-\bar t)^2} } \\ s(\alpha) &= s_{\xi} \sqrt { \frac{\sum t^2}{n \sum (t-\bar t)^2} } \end{aligned} $$

Istotność parametrów strukturalnych ($H_0: \beta=0$). Statystyka: $$T_{n-2} = \frac{\hat \beta}{ s(\beta) } $$ ma rozkład $t$-Studenta z $n-2$ stopniami swobody.

Współczynnik zbieżności: $$ \phi^2 = \frac{\sum_{t=1}^n (y_t -\hat y_t)^2 }{ \sum_{t=1}^n (y_t -\bar y_t)^2 } \cdot 100% \quad 0\leq \phi^2 \leq 100 $$ Im $\phi^2$ jest bliższy 0, tym dopasowanie jest lepsze. Wartość $\phi^2$ interpretuje się jako ,,procent zmienności zmiennej $y$ nie objaśniony przez liniową funkcję trendu.''

Współczynnik determinacji $R^2=100-\phi^2$ interpretuje się jako ,,procent zmienności zmiennej $y$ objaśniony przez liniową funkcję trendu.''

Analiza wahań sezonowych

Zakładamy, że szereg dzieli się na $s$ powtórzeń a każde powtórzenie składa się z $k$ faz. Np. w szeregu 12 elementowym zawierającym obserwacje kwartalne $k=4$ a $s=3$.

Działania mające na celu wyodrębnienie wahań sezonowych są następujce:

Wygładzamy szereg czasowy analitycznie lub mechanicznie (średnia ruchoma).

Uwalniamy szereg czasowy od trendu. W tym celu wyliczamy wielkości $w_t = y_t/\hat y_t$

Pozbywamy się wahań przypadkowych w wielkościach $w_t$. W tym celu obliczamy średnie dla okresów jednoimiennych (surowe wskaźniki sezonowości): $$ c_i' = \frac{\sum_{j=1}^{s-1} w_{i+j\cdot k} }{s} \quad i=1, 2, \ldots ,k $$ Interpretacja: $(wskaźnik-surowy -1)\cdot 100%$ oznacza o ile procent poziom zjawiska w danej fazie jest wyższy/niższy od poziomu wyznaczonego przez trend.

Suma wskaźników surowych powinna być równa $k$, tj.  $\sum c_i'=k$. Jeżeli tak nie jest, to należy wskaźniki surowe pomnożyć przez współczynnik korygujący: $$ wk=\frac{k}{\sum c_i'} $$ Otrzymując w ten sposób czyste wskaźnik sezonowości.

Jeżeli pomnożymy w każdym okresie teoretyczny poziom zjawiska $\hat y_t$ przez odpowiedni dla danego okresu wskaźnik sezonowości, to otrzymamy teoretyczny poziom zjawiska uwzględniający wahania sezonowe.