Thursday, January 19, 2017

Listing Missing Values In Stata Forex

Bienvenue à l'Institut de recherche et d'éducation numériques FAQ Stata: Comment puis-je voir le nombre de valeurs manquantes et de modèles de valeurs manquantes dans mon fichier de données Parfois, un ensemble de données peut avoir quotolesquot, c'est-à-dire des valeurs manquantes. Certaines procédures statistiques telles que l'analyse de régression ne fonctionneront pas aussi bien, ou du tout, sur un ensemble de données avec des valeurs manquantes. Les observations avec des valeurs manquantes doivent être supprimées ou les valeurs manquantes doivent être remplacées pour qu'une procédure statistique produise des résultats significatifs. La plupart des programmes statistiques (y compris SAS, SPSS et Stata) supprimeront automatiquement ces cas de toute analyse effectuée (sans supprimer les cas de l'ensemble de données). C'est pourquoi le quotnquot varie souvent de l'analyse à l'analyse, même si l'ensemble de données est le même. Différentes variables ont des quantités différentes de données manquantes et, par conséquent, la modification des variables dans un modèle modifie le nombre de cas avec des données complètes sur toutes les variables du modèle. Parce que le logiciel supprime des cas avec des valeurs manquantes pour nous, il est très facile de quotforgetquot sur les données manquantes entièrement. Cependant, la présence de données manquantes peut influencer nos résultats, surtout lorsqu'un ensemble de données ou même une seule variable, a un pourcentage élevé de valeurs manquantes. Il est donc toujours conseillé de vérifier un ensemble de données pour les données manquantes et de réfléchir à la façon dont les données manquantes peuvent influencer nos analyses. Cette page montre quelques méthodes de recherche des valeurs manquantes dans un ensemble de données, ces informations peuvent être utilisées pour prendre des décisions mieux informées sur la façon de gérer les valeurs manquantes. Avant de commencer, nous avons besoin de certaines données avec des valeurs manquantes, le code ci-dessous entrées un petit jeu de données dans Stata, puis affiche ces données. Dans un petit ensemble de données, comme celui ci-dessous, il est très facile de regarder les données brutes et de voir où les valeurs sont manquantes. Cependant, lorsque les ensembles de données sont importants, nous avons besoin d'une méthode plus systématique pour examiner notre ensemble de données pour les valeurs manquantes. Ci-dessous nous vous montrons quelques façons de le faire, en utilisant les données ci-dessous comme un exemple. 1. Nombre de valeurs manquantes par rapport au nombre de valeurs non manquantes La première chose que nous allons faire est de déterminer quelles variables ont beaucoup de valeurs manquantes. Nous avons créé un petit programme Stata appelé mdesc qui compte le nombre de valeurs manquantes dans les variables numériques et de caractère. Vous pouvez télécharger mdesc à partir de Stata en tapant findit mdesc (voir Comment puis-je utiliser la commande findit pour rechercher des programmes et obtenir de l'aide supplémentaire pour plus d'informations sur l'utilisation de finidit). Ensuite, vous pouvez exécuter mdesc pour une ou plusieurs variables comme illustré ci-dessous. Maintenant nous connaissons le nombre de valeurs manquantes dans chaque variable. Par exemple, salepric variable a quatre valeurs manquantes et saltoapr a deux valeurs manquantes. 2. Obtenir le nombre de valeurs manquantes par observation Nous pouvons également examiner la répartition des valeurs manquantes entre les observations. Le code ci-dessous crée une variable appelée nmis qui donne le nombre de valeurs manquantes pour chaque observation. La fonction rmiss2 () utilisée ici est une extension de la fonction egen rmiss (). Il compte le nombre de valeurs manquantes dans la varlist. Rmiss2 () accepte les variables de type chaîne et numérique. Vous pouvez télécharger rmiss2 () sur Internet à partir de Stata en tapant findit rmiss2 (voir Comment puis-je utiliser la commande findit pour rechercher des programmes et obtenir de l'aide supplémentaire pour plus d'informations sur l'utilisation de findit ). Ci-dessous nous tabulons la variable que nous venons de créer. En regardant la table des fréquences, nous savons qu'il y a quatre observations sans valeurs manquantes, neuf observations avec une valeur manquante, une observation avec deux valeurs manquantes et une observation avec trois valeurs manquantes. 3. Modèles de valeurs manquantes Nous pouvons également examiner les modèles de valeurs manquantes. Vous pouvez télécharger mvpatterns sur Internet à partir de Stata en tapant findit mvpatterns (voir Comment puis-je utiliser la commande findit pour rechercher des programmes et obtenir de l'aide supplémentaire pour plus d'informations sur l'utilisation de findit). La commande mvpatterns produit une sortie pour toutes les variables dans l'ensemble de données, pour les données manquantes à travers un sous-ensemble de variables, une liste de variables peut être incluse, par exemple, mvpatterns landval improval totval. La sortie produite par mvpatterns est montrée ci-dessous. Le premier tableau énumère les variables, leur type de mémoire (type), le nombre d'observations (obs), le nombre de valeurs manquantes (mv) et l'étiquette de variable si les variables en ont un. Le deuxième tableau contient les informations sur le schéma des valeurs manquantes. Le premier bloc de colonnes dans la sortie montre les modèles de données manquantes. Dans le bloc, chaque variable est représentée par une colonne, une quotquot indique que les valeurs de cette variable sont présentes dans un modèle donné de données manquantes, un quot. quot indique qu'elles sont manquantes. Les colonnes suivent le même ordre que la liste des variables de la première table, de sorte que la première colonne de la sortie ci-dessous représente landval. La deuxième amélioration. etc. Les modèles de données manquants sont répertoriés en fréquence descendante, ici le schéma de données manquantes le plus courant est des données complètes (quotquot). Le tableau indique également le nombre de valeurs manquantes dans ce modèle (mv) et le nombre de cas avec ce modèle de données manquantes (freq). Sur la base des informations du deuxième tableau nous savons qu'il ya quatre observations sans valeurs manquantes, deux cas manquant sur la seule variable salepric. Et une observation avec des valeurs manquantes sur l'amélioration. Salepric et saltoapr. 4. Lorsque toutes les variables d'intérêt sont numériques Les exemples ci-dessus fonctionnent tous indépendamment du fait que les variables d'intérêt (c'est-à-dire les variables dont les schémas de données manquants que vous voulez examiner) sont numériques ou de chaîne. Lorsque toutes les variables que vous souhaitez vérifier pour les valeurs manquantes sont numériques, nous pouvons utiliser un programme appelé misschk pour simplifier les étapes d'examen des données manquantes dans notre jeu de données. (Note: les variables numériques incluent celles avec des étiquettes de valeur qui sont des chaînes, aussi longtemps que les valeurs réelles des variables sont stockées sous forme de nombres.) Vous pouvez télécharger misschk à partir de Stata en tapant findit misschk (voir Comment puis-je utiliser la commande findit pour Rechercher des programmes et obtenir de l'aide supplémentaire pour plus d'informations sur l'utilisation de findit). Voici la commande pour misschk. Nous avons répertorié les cinq variables de notre ensemble de données dans la liste des variables après la commande misschk. Cependant, nous aurions pu simplement laisser la liste des variables en blanc (c'est-à-dire utilisée seulement misschk. Gen (miss) au lieu), si nous avions, misschk aurait exécuté en utilisant toutes les variables dans notre dataset. La liste des variables n'est nécessaire que si nous voulons lancer misschk uniquement sur certaines variables de notre jeu de données. L'option gen (miss) indique à misschk que nous voulons créer deux nouvelles variables, qui commencent toutes deux par quotmissquot. Ces deux variables seront nommées misspattern et missnumber. La variable misspattern indique lequel des modèles de données manquants suit chaque cas. La variable nombre_nom indique le nombre de valeurs manquantes pour chaque cas. La sortie pour misschk se compose de trois tables. Le premier tableau énumère le nombre de valeurs manquantes, ainsi que le pourcentage manquant pour chaque variable, ce qui est similaire au tableau produit par mdesc dans la partie 1 ci-dessus. Ce tableau contient également une colonne marquée qui attribue à chaque variable un nombre qui est utilisé pour identifier la variable plus tard dans la sortie. Le second tableau montre la répartition des valeurs manquantes. Le modèle de disparition est décrit à l'aide des nombres de variables de la première table et des soulignements (). Les nombres indiquent quelles variables manquent dans ce modèle, les soulignements représentent des observations non manquantes. Par exemple, à partir du deuxième tableau, nous voyons que deux cas ont des valeurs manquantes sur la variable 1 (landval), mais des données complètes sur toutes les autres variables et qu'un cas manque des données sur les variables 2, 4 et 5. La ligne du bas montre Que quatre cas ne manquent pas de valeurs du tout (tous les underscores). Ce tableau présente les mêmes informations générées dans la troisième partie, mais dans un format légèrement différent. Le modèle de données manquantes pour chaque cas est décrit dans la variable misspattern. Enfin, le troisième tableau montre la répartition du nombre de valeurs manquantes par cas. C'est la même information discutée ci-dessus dans la partie 2. Le nombre de variables que chaque cas est manquant est également contenu dans la variable nombre-erreur. Le contenu de ce site Web ne doit pas être interprété comme un endossement d'un site Web particulier, d'un livre ou d'un produit logiciel par l'Université de Californie. Bienvenue à l'Institut de recherche et d'éducation numériques STATA Learning Module Données manquantes 1. Introduction Ce module Explorer les données manquantes dans STATA, en se concentrant sur les données manquantes numériques. Il décrit comment indiquer les données manquantes dans vos fichiers de données brutes, ainsi que la façon dont les données manquantes sont traitées dans les commandes logiques STATA et les instructions d'affectation. Nous allons illustrer certaines des propriétés de données manquantes dans STATA en utilisant les données d'une étude de temps de réaction avec huit sujets indiqués par la variable id. Et les temps de réaction des sujets ont été mesurés à trois moments (essai 1 essai2 essai3). Le fichier de données d'entrée est illustré ci-dessous. Vous pouvez remarquer que certains des temps de réaction sont codés en utilisant un seul. Comme c'est le cas pour le sujet 2. La personne qui mesure le temps pour ce procès n'a pas mesuré le temps de réponse correctement, donc les données pour le deuxième essai sont manquantes. 2. Comment STATA gère les données manquantes dans les procédures STATA En règle générale, les commandes STATA qui exécutent des calculs de tout type gèrent les données manquantes en omettant les valeurs manquantes. Cependant, la façon dont les valeurs manquantes sont omises n'est pas toujours cohérente entre les commandes, alors prenez quelques exemples. Tout d'abord, résumons nos variables de temps de réaction et voyons comment STATA gère les valeurs manquantes. Comme vous le voyez dans la sortie ci-dessous, résumez les moyens calculés en utilisant 4 observations pour essai1 et essai2 et 6 observations pour essai3. En bref, la commande de résumé a effectué les calculs sur toutes les données disponibles. Un deuxième exemple montre comment la commande tabulation ou tab1 gère les données manquantes. Comme résumé, tab1 utilise uniquement les données disponibles. Notez que les pourcentages sont calculés en fonction du nombre total de cas non manquants. Il est possible que vous souhaitiez que les pourcentages soient calculés à partir du nombre total d'observations et le pourcentage manquant pour chaque variable indiquée dans le tableau. Cela peut être réalisé en incluant l'option manquante après la tabulation. Commande, Let39s regarder comment la commande correlate gère les données manquantes. Nous nous attendons à ce qu'il effectue les calculs basés sur les données disponibles, et omet les valeurs manquantes. Voici un exemple de commande. La sortie est montrée ci-dessous. Notez comment les valeurs manquantes ont été exclues. Stata exécutera la suppression de la liste et affiche uniquement la corrélation pour les observations qui ont des valeurs non manquantes sur toutes les variables répertoriées. Stata permet également la suppression par paires. Les corrélations sont affichées pour les observations qui ont des valeurs non manquantes pour chaque paire de variables. Cela peut être fait en utilisant la commande pwcorr. Nous utilisons l'option obs pour afficher le nombre d'observations utilisées pour chaque paire, comme vous pouvez le voir, elles diffèrent en fonction de la quantité manquante. 3. Résumé de la façon dont les valeurs manquantes sont traitées dans les procédures STATA résumer Pour chaque variable, le nombre de valeurs non manquantes est utilisé. Tabulation Par défaut, les valeurs manquantes sont exclues et les pourcentages sont basés sur le nombre de valeurs non manquantes. Si vous utilisez l'option manquante dans l'onglet, les pourcentages sont basés sur le nombre total d'observations (non manquantes et manquantes) et le pourcentage de valeurs manquantes est indiqué dans le tableau. Corr Par défaut, les corrélations sont calculées en fonction du nombre de paires avec des données non manquantes (suppression par paire des données manquantes). La commande pwcorr peut être utilisée pour demander que les corrélations soient calculées uniquement pour les observations qui ont des données non manquantes pour toutes les variables listées après la commande pwcorr (suppression de la liste des données manquantes). Reg Si l'une des variables listées après la commande reg est manquante, les observations manquantes sont exclues de l'analyse (c'est-à-dire la suppression de la liste des données manquantes). Pour d'autres procédures, reportez-vous au manuel STATA pour plus d'informations sur le traitement des données manquantes. 4. Valeurs manquantes dans les instructions d'affectation Il est important de comprendre comment les valeurs manquantes sont traitées dans les instructions d'affectation. Prenons l'exemple ci-dessous. La commande list ci-dessous illustre comment les valeurs manquantes sont traitées dans les instructions d'affectation. La variable sum1 est basée sur les variables trial1 trial2 et trial3. Si l'une de ces variables manquait, la valeur de sum1 était définie comme manquante. Par conséquent, la somme 1 est manquante pour les observations 2, 3 et 4, comme c'est le cas pour l'observation 7. En règle générale, les calculs impliquant des valeurs manquantes donnent des valeurs manquantes. Par exemple, 2 2 donne 4 2. Rendement. 2 2 rendements 1. 2. 2 3 rendements 6 2. Rendement. Chaque fois que vous ajoutez, soustraire, multiplier, diviser, etc valeurs qui impliquent des données manquantes, le résultat est manquant. Dans notre expérience de temps de réaction, la somme de temps de réaction totale1 est absente pour quatre cas sur sept. Nous pourrions essayer de totaliser les données pour les essais non manquants en utilisant la fonction rowtotal comme indiqué dans l'exemple ci-dessous. Les résultats ci-dessous montrent que sum2 contient maintenant la somme des essais non manquants. Notez que la fonction rowtotal traite les manquants comme une valeur zéro. Lors de la sommation de plusieurs variables, il peut ne pas être raisonnable de considérer l'absence comme nulle si des observations manquent sur toutes les variables à additionner. La fonction rowtotal avec l'option manquante renverra une valeur manquante si une observation est manquante sur toutes les variables. D'autres déclarations fonctionnent de la même façon. Par exemple, observé ce qui s'est passé lorsque nous essayons de créer une variable moyenne sans utiliser une fonction (comme dans l'exemple ci-dessous). Si l'une des variables trial1, trial2 ou trial3 manque, la valeur de avg1 est définie comme manquante. En variante, la fonction rowmean fait la moyenne des données des essais non manquants de la même manière que la fonction rowtotal. Note: S'il y avait eu un grand nombre d'essais, disons 50 essais, alors il serait ennuyeux de devoir taper avgrowmean (trial1 trial2 trial3 trial4.). Voici un raccourci que vous pouvez utiliser dans ce genre de situation: Enfin, vous pouvez utiliser les fonctions rowmiss et rownomiss pour déterminer le nombre de valeurs manquantes et le nombre de valeurs non manquantes, respectivement, dans une liste de variables. Ceci est illustré ci-dessous. Pour variable nomiss. Les observations 1, 5 et 6 avaient trois valeurs valides, les observations 2 et 3 avaient deux valeurs valides, l'observation 4 n'avait qu'une seule valeur valide et l'observation 7 n'avait aucune valeur valide. La variable miss montre le contraire, elle fournit un compte du nombre de valeurs manquantes. 5. Valeurs manquantes dans les instructions logiques Il est important de comprendre comment les valeurs manquantes sont traitées dans les instructions logiques. Par exemple, disons que vous voulez créer une variable 01 pour trial1 qui est 1 si elle est 1.5 ou moins et 0 si elle est supérieure à 1.5. Nous le montrons ci-dessous (incorrectement, comme vous le verrez). Il semble que quelque chose ait mal tourné avec notre nouvelle variable newvar1. Les observations avec des valeurs manquantes pour l'essai2 ont reçu un zéro pour newvar1. Let39s explorer pourquoi cela s'est produit en regardant la table de fréquence de l'essai2. Comme vous pouvez le voir dans la sortie, les valeurs manquantes sont dans la liste après la valeur la plus élevée. 2.1 C'est parce que STATA traite une valeur manquante comme la plus grande valeur possible (par exemple infini positif) et cette valeur est supérieure à 2.1, donc les valeurs pour Newvar1 devient 0. Maintenant que nous comprenons comment STATA traite les valeurs manquantes, nous excluons explicitement les valeurs manquantes pour nous assurer qu'elles sont traitées correctement, comme indiqué ci-dessous. Comme vous pouvez le voir dans la sortie STATA ci-dessous, la nouvelle variable newvar2 a des valeurs manquantes pour les observations qui sont également absentes pour trial2. 6. Valeurs manquantes dans les instructions logiques Lors de la création ou du recodage de variables qui impliquent des valeurs manquantes, faites toujours attention si la variable inclut des valeurs manquantes. 7. Pour plus d'informations Le contenu de ce site Web ne doit pas être interprété comme un endossement d'un site Web, d'un livre ou d'un logiciel particulier par l'Université de Californie.


No comments:

Post a Comment