Övningar — Kvantitativa metoder

Statsvetenskapliga institutionen

Sirus Dehdari — sirus.dehdari@statsvet.su.se

Försök lösa varje uppgift själv innan du kollar lösningen.

Uppgift 1: Konfidensintervall

En skolsköterska som arbetar med en skola på landsbygden undersöker om eleverna i genomsnitt uppnår de nationella längdriktvärdena. Enligt nationell statistik är medellängden för barn i denna åldersgrupp 150 cm. Skolsköterskan mäter längden på ett slumpmässigt urval av 100 elever på skolan. Urvalet ger en medellängd på 147,5 cm, med en standardavvikelse på 12 cm.

Kan vi utifrån denna information dra slutsatsen, med 95 % konfidensnivå, att medellängden på skolan skiljer sig från riksgenomsnittet?

▸Visa lösningDölj lösning

Lösning

För att avgöra om \(\bar x\), skattningen av populationsmedelvärdet, är statistiskt signifikant skild från 150, konstruerar vi ett 95-procentigt konfidensintervall.

Vi använder följande formel:

\[\bar x \pm t \times \hat\sigma_{\bar x} = \bar x \pm t \times \frac{s}{\sqrt{n}}\]

\[\hat\sigma_{\bar x} = \frac{s}{\sqrt{n}} = \frac{12}{\sqrt{100}} = 1.2\]

Med \(t = 1.96\) blir konfidensintervallet:

\[147.5 \pm 1.96 \times 1.2 = 147.5 \pm 2.352 \;\Rightarrow\; CI = [145.15,\ 149.85]\]

Eftersom det 95-procentiga konfidensintervallet inte täcker 150 drar vi slutsatsen att medellängden på skolan är statistiskt skild från riksgenomsnittet.

Uppgift 2: Konfidensintervall

Stadsplanerare utvärderar trafikträngseln på Lindallén, en stor infartsled till centrum. De tror att antalet bilar som passerar under morgonrusningen 7–9 har ökat jämfört med det vanliga antalet på 800 fordon. För att undersöka detta räknar de antalet bilar som passerar korsningen under 64 slumpmässigt utvalda vardagar. Urvalet ger ett genomsnitt på 826 bilar per morgon, med en standardavvikelse på 80 bilar.

Kan planerarna med 95 % konfidensnivå dra slutsatsen att det genomsnittliga antalet bilar på Lindallén under rusningstrafik skiljer sig från 800?

▸Visa lösningDölj lösning

Lösning

För att avgöra om \(\bar x\), skattningen av populationsmedelvärdet, är statistiskt signifikant skild från 800, konstruerar vi ett 95-procentigt konfidensintervall.

\[\hat\sigma_{\bar x} = \frac{s}{\sqrt{n}} = \frac{80}{\sqrt{64}} = 10\]

Med \(t = 1.96\) blir konfidensintervallet:

\[826 \pm 1.96 \times 10 = 826 \pm 19.6 \;\Rightarrow\; CI = [806.4,\ 845.6]\]

Eftersom det 95-procentiga konfidensintervallet inte täcker 800 drar vi slutsatsen att det genomsnittliga antalet bilar under rusningstrafik är statistiskt skilt från 800.

Uppgift 3: Konfidensintervall

En folkhälsoforskare studerar universitetsstudenters dagliga koffeinintag. Enligt Folkhälsomyndigheten är den rekommenderade maxgränsen för koffeinintag för vuxna 400 mg per dag.

För att undersöka om studenter överskrider denna rekommendation, tillfrågar forskaren 49 slumpmässigt utvalda studenter och finner att deras genomsnittliga dagliga koffeinkonsumtion är 418 mg, med en standardavvikelse på 85 mg.

Kan vi utifrån detta urval dra slutsatsen att det genomsnittliga koffeinintaget bland studenter skiljer sig från den rekommenderade maxgränsen på 400 mg?

▸Visa lösningDölj lösning

Lösning

Beräkna först det skattade standardfelet:

\[\hat\sigma_{\bar x} = \frac{s}{\sqrt{n}} = \frac{85}{\sqrt{49}} = \frac{85}{7} = 12.14\]

Med \(t = 1.96\) blir det 95-procentiga konfidensintervallet:

\[418 \pm 1.96 \times 12.14 = 418 \pm 23.79 \;\Rightarrow\; CI_{95\%} = [394.21,\ 441.79]\]

Eftersom det 95-procentiga konfidensintervallet täcker 400 kan vi inte dra slutsatsen att det genomsnittliga koffeinintaget skiljer sig statistiskt från rekommendationen vid 95 % konfidensnivå.

Vi testar nu med 90 % konfidensnivå. Med \(t = 1.645\):

\[418 \pm 1.645 \times 12.14 = 418 \pm 19.97 \;\Rightarrow\; CI_{90\%} = [398.03,\ 437.97]\]

Eftersom det 90-procentiga konfidensintervallet också täcker 400 kan vi inte heller dra slutsatsen att skillnaden är statistiskt signifikant vid 90 % konfidensnivå.

Uppgift 4: Konfidensintervall

En transportforskare vill undersöka om studenter vid ett förortsuniversitet har längre dagliga pendlingstider än det allmänt accepterade genomsnittet på 35 minuter. Forskaren undersöker ett slumpmässigt urval av 36 studenter och finner att deras genomsnittliga pendlingstid är 38,2 minuter, med en standardavvikelse på 9 minuter.

Kan vi dra slutsatsen att studenternas genomsnittliga pendlingstid skiljer sig från 35 minuter?

▸Visa lösningDölj lösning

Lösning

Beräkna först det skattade standardfelet:

\[\hat\sigma_{\bar x} = \frac{9}{\sqrt{36}} = \frac{9}{6} = 1.5\]

Med \(t = 1.96\) blir det 95-procentiga konfidensintervallet:

\[38.2 \pm 1.96 \times 1.5 = 38.2 \pm 2.94 \;\Rightarrow\; CI_{95\%} = [35.26,\ 41.14]\]

Eftersom det 95-procentiga konfidensintervallet inte täcker 35 kan vi dra slutsatsen att den genomsnittliga pendlingstiden skiljer sig från 35 minuter vid 95 % konfidensnivå.

Uppgift 5: Konfidensintervall

En utbildningsforskare undersöker om det genomsnittliga antalet timmar gymnasieelever läser per vecka har minskat från det tidigare rapporterade riksgenomsnittet på 12 timmar. Forskaren tillfrågar 49 elever och finner en genomsnittlig lästid på 10 timmar per vecka, med en standardavvikelse på 4 timmar.

Kan vi dra slutsatsen att den genomsnittliga lästiden är statistiskt signifikant skild från 12 timmar?

▸Visa lösningDölj lösning

Lösning

Beräkna först det skattade standardfelet:

\[\hat\sigma_{\bar x} = \frac{4}{\sqrt{49}} = \frac{4}{7} \approx 0.57\]

Med \(t = 1.96\) blir det 95-procentiga konfidensintervallet:

\[10 \pm 1.96 \times 0.57 = 10 \pm 1.12 \;\Rightarrow\; CI_{95\%} = [8.88,\ 11.12]\]

Eftersom det 95-procentiga konfidensintervallet inte täcker 12 drar vi slutsatsen att den genomsnittliga lästiden är statistiskt signifikant skild från 12 vid 95 % konfidensnivå.

Vi testar sedan vid 99 % konfidensnivå med \(t = 2.58\):

\[10 \pm 2.58 \times 0.57 = 10 \pm 1.47 \;\Rightarrow\; CI_{99\%} = [8.53,\ 11.47]\]

Eftersom det 99-procentiga konfidensintervallet inte heller täcker 12 är skillnaden statistiskt signifikant även vid 99 % konfidensnivå.

Slutsats: Den genomsnittliga lästiden har minskat signifikant från riksgenomsnittet på 12 timmar per vecka.

Uppgift 6: Konfidensintervall

En forskare genomför en undersökning bland 400 slumpmässigt utvalda väljare för att skatta stödet för Socialdemokraterna inför ett kommande val. Av dessa svarande uppger 120 att de skulle rösta på Socialdemokraterna om valet hölls idag.

Finns det statistiskt signifikanta belägg, vid 95 % konfidensnivå, för att det sanna stödet för Socialdemokraterna i populationen skiljer sig från 30 %?

▸Visa lösningDölj lösning

Lösning

Vi använder följande formel för ett konfidensintervall för en andel:

\[\hat p \pm z \times \sqrt{\frac{\hat p (1-\hat p)}{n}}\]

där \(\hat p\) är andelen i urvalet, \(n\) är urvalsstorleken, och \(z = 1.96\) för 95 % konfidensnivå.

Beräkna andelen i urvalet:

\[\hat p = \frac{120}{400} = 0.30\]

Beräkna standardfelet:

\[SE = \sqrt{\frac{0.30 \times (1-0.30)}{400}} = \sqrt{\frac{0.21}{400}} = \sqrt{0.000525} \approx 0.0229\]

Konstruera det 95-procentiga konfidensintervallet:

\[0.30 \pm 1.96 \times 0.0229 = 0.30 \pm 0.0449 \;\Rightarrow\; CI_{95\%} = [0.2551,\ 0.3449]\]

Eftersom det 95-procentiga konfidensintervallet täcker 30 % (0,30) kan vi inte dra slutsatsen att det sanna stödet skiljer sig från 30 %.

Slutsats: Det finns inga statistiskt signifikanta belägg vid 95 % konfidensnivå för att stödet för Socialdemokraterna skiljer sig från 30 %.

Uppgift 7: Bivariat regressionsanalys

En forskare vill studera sambandet mellan antalet timmar studenter pluggar per vecka och deras resultat på slutprovet (mätt i procent). Forskaren skattar en enkel linjär regression på data från 50 studenter. Resultaten sammanfattas nedan:

Konstant 55,0
(5,0)
Antal pluggtimmar 3,2
(0,8)
Antal observationer 50
R² 0,30

(Standardfel inom parentes)

Besvara följande frågor:

  1. Hur tolkar du lutningskoefficienten?
  2. Är sambandet mellan pluggtimmar och provresultat statistiskt signifikant vid 95 % konfidensnivå? Motivera!
  3. Utifrån dina svar i a) och b), vilken slutsats kan du dra om sambandet mellan pluggtimmar och provresultat?
▸Visa lösningDölj lösning

Lösning

a) Vi tolkar lutningskoefficienten som: en ökning med en pluggtimme förväntas öka provresultatet med 3,2 procentenheter.

b) För att undersöka om sambandet är statistiskt signifikant konstruerar vi ett 95-procentigt konfidensintervall för lutningskoefficienten:

\[\hat b \pm t \times \hat\sigma_{\hat b} = 3.2 \pm 1.96 \times 0.8 = 3.2 \pm 1.57 \;\Rightarrow\; CI_{95\%} = [1.63,\ 4.77]\]

Eftersom konfidensintervallet inte täcker 0 är lutningen statistiskt signifikant vid 95 % konfidensnivå.

Vi kontrollerar även det 99-procentiga konfidensintervallet med \(t = 2.58\):

\[3.2 \pm 2.58 \times 0.8 = 3.2 \pm 2.06 \;\Rightarrow\; CI_{99\%} = [1.14,\ 5.26]\]

0 täcks inte heller av det 99-procentiga intervallet, så lutningen är signifikant även vid 99 % konfidensnivå.

c) Utifrån svaren i a) och b) drar vi slutsatsen att det finns ett statistiskt signifikant positivt samband mellan pluggtimmar och provresultat.

Uppgift 8: Bivariat regressionsanalys

En nationalekonom undersöker sambandet mellan utbildning och ekonomisk utveckling. Mer specifikt undersöker hon om länder med fler genomsnittliga år av skolgång tenderar att ha högre BNP per capita (mätt i tusentals USD). Hon samlar in data från 60 länder och skattar en enkel linjär regression där den beroende variabeln är BNP per capita och den oberoende variabeln är genomsnittligt antal år av skolgång. Regressionsresultaten presenteras nedan:

Konstant 5,2
(2,3)
Antal år av skolgång 1,8
(0,5)
Antal observationer 60
R² 0,42

(Standardfel inom parentes)

Besvara följande frågor:

  1. Hur tolkar du lutningskoefficienten? (Ange enheten.)
  2. Är sambandet mellan utbildning och BNP per capita statistiskt signifikant vid 95 % konfidensnivå? Förklara.
  3. Utifrån dina svar i a) och b), vilken slutsats kan du dra om sambandet mellan utbildning och BNP per capita?
▸Visa lösningDölj lösning

Lösning

a) Lutningskoefficienten 1,8 innebär att varje ytterligare år av skolgång i ett land förväntas öka BNP per capita med 1 800 USD.

b) Vi använder följande formel för att konstruera ett konfidensintervall för lutningskoefficienten:

\[b \pm t \times \hat\sigma_b = 1.8 \pm t \times 0.5\]

Vi konstruerar det 95-procentiga konfidensintervallet med \(t = 1.96\):

\[1.8 \pm 1.96 \times 0.5 = 1.8 \pm 0.98 \;\Rightarrow\; CI_{95\%} = [0.82,\ 2.78]\]

Eftersom konfidensintervallet inte täcker 0 är sambandet statistiskt signifikant vid 95 % konfidensnivå.

Vi testar även vid 99 % konfidensnivå, med \(t = 2.58\):

\[1.8 \pm 2.58 \times 0.5 = 1.8 \pm 1.29 \;\Rightarrow\; CI_{99\%} = [0.51,\ 3.09]\]

Konfidensintervallet täcker fortfarande inte 0, så sambandet är statistiskt signifikant även vid 99 % konfidensnivå.

c) Utifrån svaren i a) och b) drar vi slutsatsen att det finns ett statistiskt signifikant positivt samband mellan genomsnittligt antal år av skolgång och BNP per capita. Länder med mer utbildad befolkning tenderar att ha en högre ekonomisk utvecklingsnivå.

Uppgift 9: Bivariat regressionsanalys

En statsvetare vill undersöka om medborgares förtroende för staten hänger samman med valdeltagandet i nationella val. Hon samlar in data från 45 demokratiska länder. Den beroende variabeln är valdeltagande (i procent), och den oberoende variabeln är den genomsnittliga graden av förtroende för statliga institutioner (på en skala 0–10, baserat på enkätdata).

Hon skattar en bivariat linjär regressionsmodell, och resultaten presenteras nedan:

Konstant 52,1
(5,7)
Förtroende för staten 1,3
(0,9)
Antal observationer 45
R² 0,18

(Standardfel inom parentes)

Besvara följande frågor:

  1. Hur tolkar du lutningskoefficienten? (Ange enheten.)
  2. Är sambandet mellan förtroende för staten och valdeltagande statistiskt signifikant?
  3. Utifrån dina svar i a) och b), vilken slutsats kan du dra om sambandet mellan förtroende för staten och valdeltagande?
▸Visa lösningDölj lösning

Lösning

a) Lutningskoefficienten 1,3 innebär att en ökning med en enhet i förtroende för staten förväntas öka valdeltagandet med 1,3 procentenheter.

b) Vi använder följande formel för att konstruera ett konfidensintervall för lutningskoefficienten:

\[b \pm t \times \hat\sigma_b = 1.3 \pm t \times 0.9\]

Vi konstruerar det 95-procentiga konfidensintervallet med \(t = 1.96\):

\[1.3 \pm 1.96 \times 0.9 = 1.3 \pm 1.76 \;\Rightarrow\; CI_{95\%} = [-0.46,\ 3.06]\]

Eftersom konfidensintervallet täcker 0 är sambandet inte statistiskt signifikant vid 95 % konfidensnivå.

Vi konstruerar nu det 90-procentiga konfidensintervallet med \(t = 1.645\):

\[1.3 \pm 1.645 \times 0.9 = 1.3 \pm 1.48 \;\Rightarrow\; CI_{90\%} = [-0.18,\ 2.78]\]

Det 90-procentiga konfidensintervallet täcker inte 0, så vi drar slutsatsen att sambandet är statistiskt signifikant vid 90 % konfidensnivå.

c) Utifrån svaren i a) och b) drar vi slutsatsen att det finns ett positivt samband mellan förtroende för staten och valdeltagande, och att detta samband är statistiskt signifikant vid 90 % konfidensnivå (men inte vid 95 % nivå).

Uppgift 11: Centralmått och mätnivåer

En sociolog genomför en riksomfattande undersökning där 200 vuxna tillfrågas om sin högsta avslutade utbildningsnivå. Resultaten sammanfattas i tabellen nedan:

Utbildningsnivå Antal svarande
Ingen formell utbildning 12
Grundskola 58
Gymnasium 54
Eftergymnasial utbildning 42
Forskarutbildning 34
Totalt 200
  1. Vilket/vilka centralmått — medelvärde, median eller typvärde — är meningsfulla att beräkna för denna variabel? Förklara varför eller varför inte.
  2. Beräkna det/de mått som är meningsfulla.
▸Visa lösningDölj lösning

Lösning

a) Eftersom variabeln “högsta avslutade utbildningsnivå” är ordinal är det inte meningsfullt att beräkna medelvärdet. Medelvärdet förutsätter att avstånden mellan kategorierna är meningsfulla och lika stora, vilket vi inte kan anta för ordinaldata.

Både median och typvärde är däremot meningsfulla. Medianen identifierar den mittersta kategorin när svaren ordnas, och typvärdet identifierar den vanligast förekommande kategorin.

b) För att beräkna medianen identifierar vi den mittersta observationen i den ordnade listan av 200 svarande. Eftersom antalet är jämnt tittar vi på den 100:e och 101:a observationen.

Kumulativa summor: Ingen formell utbildning: 12. Grundskola: 12 + 58 = 70. Gymnasium: 70 + 54 = 124. Eftergymnasial utbildning: 124 + 42 = 166. Forskarutbildning: 166 + 34 = 200.

Både den 100:e och 101:a observationen hamnar i kategorin “Gymnasium”, eftersom denna kategori omfattar positionerna 71 till 124.

Medianen är därför Gymnasium.

För att hitta typvärdet identifierar vi kategorin med flest svarande. Det vanligaste svaret är “Grundskola”, med 58 svarande. Typvärdet är Grundskola.

Uppgift 12: Centralmått och mätnivåer

En forskare studerar hur universitetsstudenter tar del av politiska nyheter. Varje student i ett urval på 210 tillfrågades: “Vilken av följande källor använder du huvudsakligen för politiska nyheter?” Svaren sammanfattas i tabellen nedan:

Huvudsaklig nyhetskälla Antal svarande
Public service (t.ex. SVT, SR) 68
Tidningar (print eller digitalt) 47
Sociala medier 44
Kommersiella TV-kanaler 19
Nyhetsaggregatorer (t.ex. Omni) 12
Poddar 11
Annat 9
Totalt 210
  1. Vilket/vilka centralmått — medelvärde, median eller typvärde — är meningsfulla att beräkna för denna variabel? Förklara varför eller varför inte.
  2. Beräkna det/de mått som är meningsfulla.
▸Visa lösningDölj lösning

Lösning

a) Variabeln “huvudsaklig nyhetskälla” är nominal, vilket innebär att dess kategorier inte har någon naturlig numerisk eller ordnad rangordning. Det gör medelvärde och median olämpliga för analysen. Endast typvärdet är ett lämpligt centralmått för nominala variabler, eftersom det identifierar den vanligast förekommande kategorin.

b) Kategorin med flest svarande är “Public service”, med 68 studenter som valde den som sin huvudsakliga källa. Typvärdet är alltså Public service.