SPB Git

spb/gsf6053 Public

GSF-6053 Financial Econometrics I — matériel de cours (Université Laval).

TeX 100%
17.5 KB · 525 lines latex
Raw Blame History
1% =============================================================================2% GSF-6053 : Économétrie Financière I3% Auteur  : Simon-Pierre Boucher4% Contact : contact@spboucher.ai5% =============================================================================6\documentclass{beamer}7\usepackage[utf8]{inputenc}8\usepackage{graphicx}9\usepackage{xcolor}10\usetheme{default}11\usecolortheme{default}1213\title[S02 Régression et MCO]{Section 02 : Régression et Moindres Carrés Ordinaires\\ (Application Stata)}14\subtitle{GSF-6053: Économétrie Financière}15\author[SP. Boucher]{Simon-Pierre Boucher\inst{1}}16\institute[Université Laval]17{18  \inst{1}%19  Département de finance, assurance et immobilier\\20  Faculté des sciences de l'administration\\21  Université Laval}22\date[Hiver 2022]{1 Février 2022}2324\begin{document}2526\begin{frame}27  \titlepage28\end{frame}2930\begin{frame}{Application STATA}31\begin{itemize}32\item Dans cette application Stata, nous allons analyser le jeu de données portant le nom \textbf{Wage1}33\item Il s’agit essentiellement de données collectées auprès de plusieurs travailleurs en 1976.34\item Dans cette analyse nous chercherons à quantifier et expliquer l’impact de certains facteurs propre au salarié sur son salaire.35\item Les variables que nous utiliserons dans cette analyse sont les suivantes:36\begin{itemize}37\item \textbf{lwage:} log du salaire horaire moyen38\item \textbf{educ:} années d'études39\item \textbf{exper:} années d'expérience potentielle40\item \textbf{tenutre:} années chez l'employeur actuel41\end{itemize}42\end{itemize}43\end{frame}4445\begin{frame}{Application STATA}4647\begin{block}{Code 1: Pour obtenir jeu de données Wage1 sur Stata}48\textbf{use http://fmwww.bc.edu/ec-p/data/wooldridge/wage1}49\end{block}5051\begin{block}{Code 2: Vérifier le format des variables utilisées}52\textbf{describe wage educ exper tenure}53\end{block}5455\begin{block}{Output 2:}56\begin{center}57\includegraphics[scale=.5]{describe}58\end{center}59\begin{itemize}60\item On peut voir que nos trois variables sont de type Float, ce qui indique qu'il s'agit d'une valeur numérique entière. 61\item On peut donc l'utiliser pour notre analyse.62\end{itemize}63\end{block}6465\end{frame}666768\begin{frame}{Application STATA}69\begin{block}{Code 3: Calculer et afficher des statistiques descriptives}70\textbf{summarize wage educ exper tenurex}71\end{block}72\begin{block}{Output 3:}73\begin{center}74\includegraphics[scale=.5]{summary}75\end{center}76\begin{itemize}77 \item On peut voir que notre jeu de données contient 526  observations 78 \item Que le salaire moyen horraire est de 5.89 et qu'en moyenne les salariés ont 12.56 années de scolarité. 79 \item Pour ce qui est de l'expérience de travail, en moyenne les salariés ont 17.02 années d'expériences et ils sont dans le même emploie depuis 5.10 ans, en moyenne.80\end{itemize}81\end{block}8283\end{frame}848586\begin{frame}{Application STATA}87\begin{block}{Code 4: Relation entre le salaire et l'éducation}88\textbf{twoway (scatter wage educ) (lfit wage educ)}89\end{block}9091\begin{block}{Output 4:}92\begin{center}93\includegraphics[scale=.3]{PLOT_1.png}94\end{center}95\end{block}96\end{frame}979899\begin{frame}{Application STATA}100\begin{block}{Code 5: Relation entre le salaire et l'expérience de travail}101\textbf{twoway (scatter wage exper) (lfit wage exper)}102\end{block}103104\begin{block}{Output 5:}105\begin{center}106\includegraphics[scale=.3]{PLOT_2.png}107\end{center}108\end{block}109\end{frame}110111\begin{frame}{Application STATA}112\begin{block}{Code 6: Relation entre le salaire et le nombre d'années chez l'employeur actuel}113\textbf{twoway (scatter wage tenure) (lfit wage tenure)}114\end{block}115116\begin{block}{Output 6:}117\begin{center}118\includegraphics[scale=.3]{PLOT_3.png}119\end{center}120\end{block}121\end{frame}122123\begin{frame}{Application STATA}124\begin{block}{Code 7: Distrbution de la variable \textbf{wage}}125\textbf{histogram wage, bin(50) normal normopts(lwidth(thick))}126\end{block}127128\begin{block}{Output 7:}129\begin{center}130\includegraphics[scale=.3]{PLOT_4.png}131\end{center}132\end{block}133\end{frame}134135\begin{frame}{Application STATA}136\begin{block}{Code 8: Distrbution de la variable \textbf{educ}}137\textbf{histogram educ, bin(20) normal normopts(lwidth(thick))}138\end{block}139140\begin{block}{Output 8:}141\begin{center}142\includegraphics[scale=.3]{PLOT_5.png}143\end{center}144\end{block}145\end{frame}146147148\begin{frame}{Application STATA}149\begin{block}{Code 9: Distrbution de la variable \textbf{exper}}150\textbf{histogram exper, bin(50) normal normopts(lwidth(thick))}151\end{block}152153\begin{block}{Output 9:}154\begin{center}155\includegraphics[scale=.3]{PLOT_6.png}156\end{center}157\end{block}158\end{frame}159160\begin{frame}{Application STATA}161\begin{block}{Code 10: Distrbution de la variable \textbf{tenure}}162\textbf{histogram tenure, bin(30) normal normopts(lwidth(thick))}163\end{block}164165\begin{block}{Output 10:}166\begin{center}167\includegraphics[scale=.3]{PLOT_7.png}168\end{center}169\end{block}170\end{frame}171172\begin{frame}{Application STATA}173\begin{block}{Régression linéaire simple}174\begin{equation}175wage = \beta_0 + \beta_1 educ  + \epsilon176\end{equation}177\begin{equation}178wage = \beta_0 + \beta_1 exper  + \epsilon179\end{equation}180\begin{equation}181wage = \beta_0 + \beta_1 tenure  + \epsilon182\end{equation}183\end{block}184\begin{block}{Régression linéaire multiple}185\begin{equation}186wage = \beta_0 + \beta_1 educ +\beta_2 exper + \beta_3 tenure  + \epsilon187\end{equation}188\end{block}189\end{frame}190191\begin{frame}{Application STATA}192\begin{block}{Code 11: $wage = \beta_0 + \beta_1 educ  + \epsilon$}193\textbf{reg wage educ}194\end{block}195196\begin{block}{Output 11:}197\begin{center}198\includegraphics[scale=.5]{REG1.png}199\end{center}200\end{block}201\end{frame}202203204\begin{frame}{Application STATA}205\begin{block}{Analyse: $wage = \beta_0 + \beta_1 educ  + \epsilon$}206\begin{itemize}207\item Avec un $R^2$ de 0.1648, le nombre d’années d’éducation d'un salarié semble expliquer environ 16\% des variations dans le salaire de ce dernier, et ce en moyenne.208\item La p-value du T-test pour le coefficient de la variable educ est de 0.000, ce qui implique que le coefficient est significativement différent de zéro. (À un seuil de 5\%)209\item Avec un coefficient estimé de 0.54 pour la variable educ, on peut comprendre qu’en moyenne, une année d’éducation additionnelle amène une augmentation du salaire horaire de 0.54.210\end{itemize}211\end{block}212\end{frame}213214215216217218\begin{frame}{Application STATA}219\begin{block}{Code 12: $wage = \beta_0 + \beta_1 exper  + \epsilon$}220\textbf{reg wage exper}221\end{block}222223\begin{block}{Output 12:}224\begin{center}225\includegraphics[scale=.5]{REG2.png}226\end{center}227\end{block}228\end{frame}229230\begin{frame}{Application STATA}231\begin{block}{Analyse: $wage = \beta_0 + \beta_1 exper  + \epsilon$}232\begin{itemize}233\item Avec un $R^2$ de 0.0127, le nombre d’années d’expérience d'un salarié semble expliquer environ 1\% des variations dans le salaire de ce dernier, et ce en moyenne.234\item La p-value du T-test pour le coefficient de la variable exper est de 0.01, ce qui implique que le coefficient est significativement différent de zéro. (À un seuil de 5\%)235\item Avec un coefficient estimé de 0.0307 pour la variable exper, on peut comprendre qu’en moyenne, une année d’expérience additionnelle amène une augmentation du salaire horaire de 0.0307.236\end{itemize}237\end{block}238\end{frame}239\begin{frame}{Application STATA}240\begin{block}{Code 13: $wage = \beta_0 + \beta_1 tenure  + \epsilon$}241\textbf{reg wage tenure}242\end{block}243244\begin{block}{Output 13:}245\begin{center}246\includegraphics[scale=.5]{REG3.png}247\end{center}248\end{block}249\end{frame}250251252\begin{frame}{Application STATA}253\begin{block}{Analyse: $wage = \beta_0 + \beta_1 tenure  + \epsilon$}254\begin{itemize}255\item Avec un $R^2$ de 0.1203, le nombre d’années chez l'employeur actuel d'un salarié semble expliquer environ 12\% des variations dans le salaire de ce dernier, et ce en moyenne.256\item La p-value du T-test pour le coefficient de la variable tenure est de 0.000, ce qui implique que le coefficient est significativement différent de zéro. (À un seuil de 5\%)257\item Avec un coefficient estimé de 0.177 pour la variable tenure, on peut comprendre qu’en moyenne, une année de plus chez l'employeur actuel amène une augmentation du salaire horaire de 0.177.258\end{itemize}259\end{block}260\end{frame}261262\begin{frame}{Application STATA}263\begin{block}{Code 14: $wage = \beta_0 + \beta_1 educ +\beta_2 exper + \beta_3 tenure  + \epsilon$}264\textbf{reg wage educ exper tenure}265\end{block}266267\begin{block}{Output 14:}268\begin{center}269\includegraphics[scale=.5]{REG4.png}270\end{center}271\end{block}272\end{frame}273274\begin{frame}{Application STATA}275\begin{block}{Analyse: $wage = \beta_0 + \beta_1 educ +\beta_2 exper + \beta_3 tenure  + \epsilon$}276\begin{itemize}277\item Avec un $R^2$ de 0.3064, les trois variables combinées ensemble semblent expliquer environ 31\% des variations dans le salaire de ce dernier, et ce en moyenne.278\item De plus, avec un $R^2$ ajusté de 0.3024 (relativement proche du $R^2$ standard), l'ajout de variables explicatives semble justifier étant donné que la valeur du $R^2$ ajusté ne semble pas avoir diminuer grandement par rapport au $R^2$ standard, suite à la pénalité pour l'ajout de variables explicatives dans le $R^2$ ajusté.279\item La p-value du F-test est de 0.000, ce qui implique que nous pouvons rejeter l'hypothèse nulle que tous les coefficients sont conjointement non significatifs. 280\end{itemize}281\end{block}282\end{frame}283284\begin{frame}{Détails sur le T-test}285286\begin{itemize}287\item Dans le T-test que nous venons de faire, nous avons utilisé la P-value pour vérifier si le coefficient est significativement différent de 0.288\item En effet si cette P-value est inférieur à 0.05, on rejette l’hypothèse nulle que le coefficient est pas significativement différent de 0.289\item Afin de bien comprendre comment le T-test fonctionne, il est important de bien faire l’analyse sans utiliser la P-value.290\item Nous allons reprendre la dernière régression que nous venons d’analyser, soit celle avec toutes les variables explicatives incluses.291\end{itemize}292293\end{frame}294295\begin{frame}{Détails sur le T-test}296\textbf{Test de Student:}297\begin{block}{Two-tailed test}298\begin{itemize}299\item Hypothèse nulle est la non-significativité du coefficient de régression300\item Hypothèses:301\begin{itemize}302\item $H_0:$ $\beta_k=0$ $\rightarrow$ \textbf{Hypothèse nule}303\item $H_1:$ $\beta_k \neq 0$ $\rightarrow$ \textbf{Hypothèse alternative}304\end{itemize}305\item Règle de décision:306Rejeter $H_0$ si:307\begin{align*}308t=\frac{\mid \hat{\beta}_k-\beta_0 \mid}{SE_{\hat{\beta}_k}} > t_{n-k,\alpha/2}309\end{align*}310\begin{itemize}311\item Ou $\beta_0$ est la valeur du coefficient sous l'hypothèse nulle, soit 0312\item $SE_{\hat{\beta}_k}$ est l'écart-type associé à l'estimation de $\hat{\beta}_k$313\end{itemize}314\end{itemize}315\end{block}316317\end{frame}318319\begin{frame}{Détails sur le T-test}320321\begin{itemize}322\item Le Modèle de régression:323\begin{align*}324wage = \beta_0 + \beta_1 educ +\beta_2 exper + \beta_3 tenure  + \epsilon325\end{align*}326\item Afin de pouvoir faire la comparaison de notre statistique T, nous devons obtenir une valeur critique à un seuil de 5\%, soit 327\begin{align*}328t_{n-k,\alpha/2}329\end{align*}330\item Sachant que nous avons $n=526$ observations et $k=3$ variables explicatives, nous devrons trouve la valeur critique:331\begin{align*}332t_{526-3,0.05/2}=t_{523,0.025}333\end{align*}334335\end{itemize}336337\end{frame}338339\begin{frame}{Détails sur le T-test}340341\begin{itemize}342\item Nous allons maintenant aller regarder dans une table statistique appelée \textbf{T-table} afin de trouver notre valeur critique.343\item Au niveau de la significativité, on prendra la colonne avec une valeur: 344\begin{itemize}345\item $\alpha= 0.025$ pour le \textbf{One-tail test}346\item $\alpha= 0.05$ pour le \textbf{Two-tail test}347\end{itemize}348\item Pour ce qui est du nombre de degrés de liberté, nous avons $df=523$, cependant la table ne fournit pas nécessairement une valeur pour tous les df possibles.349\begin{itemize}350\item Dans la table qui va suivre, nous avons seulement $df=100$ et $df=1000$ de dispo, nous allons donc prendre $df=1000$ par sécurité.351\end{itemize}352\end{itemize}353354\end{frame}355356\begin{frame}{Détails sur le T-test}357\begin{center}358\includegraphics[scale=.4]{tstat}359\end{center}360\end{frame}361362\begin{frame}{Détails sur le T-test}363\begin{itemize}364\item Notre valeur critique est de $t_{526-3,0.05/2}=t_{523,0.025}=1.962$365\item Pour le coefficient $\beta_1$ attaché à la variable \textbf{educ}:366\begin{align*}367t=\frac{\mid 0.5989651-0 \mid}{0.0512835} = 11.69 > 1.962368\end{align*}369\begin{itemize}370\item $t=11.69$ est plus grand que la valeur critique $t_{523,0.025}=1.962$, alors on peut rejetter l'hypothèse nulle et conclure que $\hat{\beta}_1$ est significativement différent de 0, à un seuil de 5\%.371\end{itemize}372\end{itemize}373\end{frame}374375\begin{frame}{Détails sur le T-test}376\begin{itemize}377\item Pour le coefficient $\beta_2$ attaché à la variable \textbf{exper}:378\begin{align*}379t=\frac{\mid 0.0223395-0 \mid}{0.0120568} = 1.85 < 1.962380\end{align*}381\begin{itemize}382\item $t=1.85$ est plus petit que la valeur critique $t_{523,0.025}=1.962$, alors on ne peut pas rejetter l'hypothèse nulle. $\hat{\beta}_2$ n'est pas significativement différent de 0, à un seuil de 5\%.383\end{itemize}384\end{itemize}385\end{frame}386387\begin{frame}{Détails sur le T-test}388\begin{itemize}389390\item Pour le coefficient $\beta_3$ attaché à la variable \textbf{tenure}:391\begin{align*}392t=\frac{\mid 0.1692687-0 \mid}{0.0216446} = 7.82 > 1.962393\end{align*}394\begin{itemize}395\item $t=7.82$ est plus grand que la valeur critique $t_{523,0.025}=1.962$, alors on peut rejetter l'hypothèse nulle et conclure que $\hat{\beta}_3$ est significativement différent de 0, à un seuil de 5\%.396\end{itemize}397\end{itemize}398\end{frame}399400401\begin{frame}{Détails sur le F-test}402\begin{itemize}403\item Comme pour le T-test, on veut également effectuer le F-test sans la P-value.404\end{itemize}405\textbf{F-test (significativité conjointe)}406\begin{block}{Hypothèses:}407\begin{itemize}408\item $H_O:$ $\beta_2 =0$ et/ou $\beta_3 = 0$ et/ou $...$ et/ou $\beta_k=0$409\item $H_1:$ $\beta_2 \neq 0$ et $\beta_3 \neq 0$ et $...$ et/ou $\beta_k \neq 0$410\end{itemize}411\end{block}412\begin{block}{Statistique de test:}413\begin{align*}414F=\frac{MS_{group}}{MS_{error}}>F(q,t-k;\alpha)415\end{align*}416Sachant417\begin{itemize}418\item $MS_{group}=\frac{SS_{group}}{df_{group}}$419\item $MS_{error}=\frac{SS_{error}}{df_{error}}$420\end{itemize}421\end{block}422\end{frame}423424\begin{frame}{Détails sur le F-test}425\begin{itemize}426\item On rejette $H_0$ si la statistique $F$ est supérieur à la valeur critique $F(q,t-k;\alpha)$.427\item Dans le cas qui nous concerne, nous avons 4 coefficients (k=4), soit $\beta_0, \beta_1, \beta_2$ et $\beta_3$428\item $q=k-1=4-1=3= df_{group}$429\item $t-k=526-4=522= df_{error}$430\item On pose un seuil de significativité de $\alpha=0.05$431\item La valeur critique sera représenté par $F(3,522;0.05)$432\item Nous allons maintenant regarder dans la table suivante la valeur critique $F(3,522;0.05)$433\end{itemize}434\end{frame}435436\begin{frame}{Détails sur le F-test}437\begin{center}438\includegraphics[scale=.2]{ftable}439\end{center}440\end{frame}441442\begin{frame}{Détails sur le F-test}443\begin{itemize}444\item La valeur de la statistique F est:445\begin{align*}446F(3,522;0.05)=2.60447\end{align*}448\item Voici maintenant le test:449\begin{align*}450F=\frac{\frac{SS_{group}}{df_{group}}}{\frac{SS_{error}}{df_{error}}}>F(q,t-k;\alpha)451\end{align*}452\begin{align*}453F=\frac{\frac{2194.1116}{3}}{\frac{4966.30269}{522}}=76.87>2.60454\end{align*}455\end{itemize}456\end{frame}457458459\begin{frame}{Détails sur le F-test}460\begin{itemize}461\item On rejette l'hypothèse nulle étant donné que la statistique $F=76.87$ est supérieur à la valeur critique $F(3,522;0.05)=2.60$.462\item On rejette donc l'hypothèse que tous les coefficients sont conjointement tous égaux à 0.463\item En d'autres mots, au moins un coefficient dans cette régression est significativement différent de 0.464\end{itemize}465\end{frame}466467468\begin{frame}{Application STATA}469470\begin{block}{Code 15: Générer les résidus de la régression}471\textbf{reg wage educ exper tenure}\\472\textbf{predict resid, residuals}473\end{block}474\begin{itemize}475\item Sans faire une analyse détaillée des résidus, nous allons créer une variable représentant les résidus de notre régression.476\item Afin de faire l'analyse, nous allons produire un histogramme de nos résidus et un nuage de points avec les résidus en axe des Y et la variable \textbf{wage} en axe des X.477\end{itemize}478\end{frame}479480\begin{frame}{Application STATA}481482\begin{block}{Code 16: Histogramme des résidus}483\textbf{histogram resid, bin(50) normal}484\end{block}485486\begin{block}{Output 16:}487\begin{center}488\includegraphics[scale=.3]{resid.png}489\end{center}490\end{block}491492\end{frame}493494495496\begin{frame}{Application STATA}497498\begin{block}{Code 17: Nuage de points des résidus}499\textbf{twoway (scatter red wage)}500\end{block}501502\begin{block}{Output 17:}503\begin{center}504\includegraphics[scale=.3]{scatter_resid.png}505\end{center}506\end{block}507508\end{frame}509510511\begin{frame}{Application STATA}512513\begin{block}{Analyse des résidus}514\begin{itemize}515\item Comme caractéristiques souhaitez pour nos résidus, nous souhaitons qu’il ressemble à une loi normale et qu’il n’ait pas de \textbf{patterns} entre ce résidu et la variable \textbf{wage}516\item Au niveau de l’histogramme des résidus, on peut voir que sans être parfaits les résidus prennent la forme d’une cloche. 517\item Il semble y avoir plus de résidus au niveau du centre (x=0), que ce qui est prévu par la loi normale.518\item Au niveau du nuage de point, nous avons un problème majeur, il y a clairement une relation entre notre résidu et la variable \textbf{wage}.519\end{itemize}520\end{block}521522\end{frame}523524525\end{document}