Global ETD Search

1	Sur les estimateurs doublement robustes avec sélection de modèles et de variables pour les données administratives Bahamyirou, Asma 10 1900 (has links) Les essais cliniques randomisés (ECRs) constituent la meilleure solution pour obtenir des effets causaux et évaluer l’efficacité des médicaments. Toutefois, vu qu’ils ne sont pas toujours réalisables, les bases de données administratives servent de solution de remplacement. Le sujet principal de cette thèse peut être divisée en deux parties, le tout, repartie en trois articles. La première partie de cette thèse traite de l’utilisation des estimateurs doublement robustes en inférence causale sur des bases de données administratives avec intégration des méthodes d’apprentissage automatique. Nous pouvons citer, par exemple, l’estimateur par maximum de vraisemblance ciblé (TMLE) et l’estimateur par augmentation de l’inverse de la probabilité de traitement (AIPTW). Ces méthodes sont de plus en plus utilisées en pharmaco-épidémiologie pour l’estimation des paramètres causaux, comme l’effet moyen du traitement. Dans la deuxième partie de cette thèse, nous développons un estimateur doublement robuste pour les données administratives et nous étendons une méthode existante pour l’ajustement du biais de sélection utilisant un échantillon probabiliste de référence. Le premier manuscrit de cette thèse présente un outil de diagnostic pour les analystes lors de l’utilisation des méthodes doublement robustes. Ce manuscrit démontre à l’aide d’une étude de simulation l’impact de l’estimation du score de propension par des méthodes flexibles sur l’effet moyen du traitement, et ce, en absence de positivité pratique. L’article propose un outil capable de diagnostiquer l’instabilité de l’estimateur en absence de positivité pratique et présente une application sur les médicaments contre l’asthme durant la grossesse. Le deuxième manuscrit présente une procédure de sélection de modificateurs d’effet et d’estimation de l’effet conditionnel. En effet, cet article utilise une procédure de régularisation en deux étapes et peut être appliqué sur plusieurs logiciels standards. Finalement, il présente une application sur les médicaments contre l’asthme durant la grossesse. Le dernier manuscrit développe une méthodologie pour ajuster un biais de sélection dans une base de données administratives dans le but d’estimer une moyenne d’une population, et ce, en présence d’un échantillon probabiliste provenant de la même population avec des co-variables communes. En utilisant une méthode de régularisation, il montre qu’il est possible de sélectionner statistiquement les bonnes variables à ajuster dans le but de réduire l’erreur quadratique moyenne et la variance. Cet article décrit ensuite une application sur l’impact de la COVID-19 sur les Canadiens. / Randomized clinical trials (RCTs) are the gold standard for establishing causal effects and evaluating drug efficacy. However, RCTs are not always feasible and the usage of administrative data for the estimation of a causal parameter is an alternative solution. The main subject of this thesis can be divided into two parts, the whole comprised of three articles. The first part studies the usage of doubly robust estimators in causal inference using administrative data and machine learning. Examples of doubly robust estimators are Targeted Maximum Likelihood Estimation (TMLE; [73]) and Augmented Inverse Probability of Treatment Weighting (AIPTW; [51]). These methods are more and more present in pharmacoepidemiology [65, 102, 86, 7, 37]. In the second part of this thesis, we develop a doubly robust estimator and extend an existing one [121] for the setting of administrative data with a supplemental probability sample. The first paper of this thesis proposes a diagnostic tool that uses re-sampling methods to identify instability in doubly robust estimators when using data-adaptive methods in the presence of near practical positivity violations. It demonstrates the impact of machine learning methods for propensity score estimation when near practical positivity violations are induced. It then describes an analysis of asthma medication during pregnancy. The second manuscript develops a methodology to statistically select effect modifying variables using a two stage procedure in the context of a single time point exposure. It then describes an analysis of asthma medication during pregnancy. The third manuscript describes the development of a variable selection procedure using penalization for combining a nonprobability and probability sample in order to adjust for selection bias. It shows that we can statistically select the right subset of the variables when the true propensity score model is sparse. It demonstrates the benefit in terms of mean squared error and presents an application of the impact of COVID-19 on Canadians. Données administratives Inférence causale Apprentissage automatique. Doublement robuste Score de propension Causal inference Doubly robust Administrative data Propensity score Machine learning
2	Méthodes de rééchantillonnage en méthodologie d'enquête Mashreghi, Zeinab 10 1900 (has links) Le sujet principal de cette thèse porte sur l'étude de l'estimation de la variance d'une statistique basée sur des données d'enquête imputées via le bootstrap (ou la méthode de Cyrano). L'application d'une méthode bootstrap conçue pour des données d'enquête complètes (en absence de non-réponse) en présence de valeurs imputées et faire comme si celles-ci étaient de vraies observations peut conduire à une sous-estimation de la variance. Dans ce contexte, Shao et Sitter (1996) ont introduit une procédure bootstrap dans laquelle la variable étudiée et l'indicateur de réponse sont rééchantillonnés ensemble et les non-répondants bootstrap sont imputés de la même manière qu'est traité l'échantillon original. L'estimation bootstrap de la variance obtenue est valide lorsque la fraction de sondage est faible. Dans le chapitre 1, nous commençons par faire une revue des méthodes bootstrap existantes pour les données d'enquête (complètes et imputées) et les présentons dans un cadre unifié pour la première fois dans la littérature. Dans le chapitre 2, nous introduisons une nouvelle procédure bootstrap pour estimer la variance sous l'approche du modèle de non-réponse lorsque le mécanisme de non-réponse uniforme est présumé. En utilisant seulement les informations sur le taux de réponse, contrairement à Shao et Sitter (1996) qui nécessite l'indicateur de réponse individuelle, l'indicateur de réponse bootstrap est généré pour chaque échantillon bootstrap menant à un estimateur bootstrap de la variance valide même pour les fractions de sondage non-négligeables. Dans le chapitre 3, nous étudions les approches bootstrap par pseudo-population et nous considérons une classe plus générale de mécanismes de non-réponse. Nous développons deux procédures bootstrap par pseudo-population pour estimer la variance d'un estimateur imputé par rapport à l'approche du modèle de non-réponse et à celle du modèle d'imputation. Ces procédures sont également valides même pour des fractions de sondage non-négligeables. / The aim of this thesis is to study the bootstrap variance estimators of a statistic based on imputed survey data. Applying a bootstrap method designed for complete survey data (full response) in the presence of imputed values and treating them as true observations may lead to underestimation of the variance. In this context, Shao and Sitter (1996) introduced a bootstrap procedure in which the variable under study and the response status are bootstrapped together and bootstrap non-respondents are imputed using the imputation method applied on the original sample. The resulting bootstrap variance estimator is valid when the sampling fraction is small. In Chapter 1, we begin by doing a survey of the existing bootstrap methods for (complete and imputed) survey data and, for the first time in the literature, present them in a unified framework. In Chapter 2, we introduce a new bootstrap procedure to estimate the variance under the non-response model approach when the uniform non-response mechanism is assumed. Using only information about the response rate, unlike Shao and Sitter (1996) which requires the individual response status, the bootstrap response status is generated for each selected bootstrap sample leading to a valid bootstrap variance estimator even for non-negligible sampling fractions. In Chapter 3, we investigate pseudo-population bootstrap approaches and we consider a more general class of non-response mechanisms. We develop two pseudo-population bootstrap procedures to estimate the variance of an imputed estimator with respect to the non-response model and the imputation model approaches. These procedures are also valid even for non-negligible sampling fractions. Bootstrap Poids bootstrap Estimation doublement robuste Imputation Modèle d'imputation Non-réponse partielle Modèle de non-résponse Bootstrap par pseudo-population Estimation de la variance Bootstrap weights approach Doubly robust estimation Imputation model approach Item non-response Non-response model approach Pseudo-population bootstrap approach Variance estimation

Search results

Sur les estimateurs doublement robustes avec sélection de modèles et de variables pour les données administratives

Méthodes de rééchantillonnage en méthodologie d'enquête