Financial Institutions, Subsidiaries Expansion & ROH vs ROA via National Culture

Published: 3 July 2026| Version 1 | DOI: 10.17632/mgmvdhk8c7.1
Contributor:
Tariq H. Malik

Description

The dataset is an international firm-level panel constructed from the Orbis database, focusing on financial institutions classified under NACE Rev. 2 code 64 (monetary intermediation and related financial activities). The initial sample includes 70,961 active firms that meet a series of selection criteria, including minimum size thresholds, availability of subsidiary and ownership information, and reported financial data; after applying additional restrictions—most importantly retaining only firms with at least one subsidiary—the final analytical sample is reduced to 12,782 financial institutions. The dataset captures Subsidiary Share Intensity as a structural measure of organizational hierarchy, defined relative to country-level averages of subsidiary counts and standardized across firms. Firm performance is measured through two standardized outcomes: return on human capital, reflecting employee-based profitability, and return on assets, reflecting asset-based profitability. These firm-level variables are combined with country-level cultural indicators, particularly Hofstede’s individualism–collectivism (IDV) index, which is used to test cultural moderation effects. The dataset also includes a broad set of control variables at both firm and country levels (e.g., ownership structure, firm age, listing status, legal origin, and macro-financial indicators), allowing the analysis to isolate the relationship between subsidiary counts and performance, and cultural context.

Files

Steps to reproduce

1. Define the sample (panel structure) Construct a balanced/unbalanced panel dataset Coverage: 149 countries 1995–2020 (26 years) Unit of analysis: country-year observations 2. Collect core outcome variable (dependent variable) National Anxiety Prevalence (NAP) Source: World Health Organization (WHO) Measure: prevalence of anxiety and depression (population-level burden) Harmonise across countries using WHO standardized definitions Convert to a consistent scale (used later in log/standardized form) 3. Construct main explanatory variables (intellectual capital) (a) Sciences Source: Clarivate Journal Citation Reports (JCR) Measure: Scientific publications (STEM: science, technology, engineering, mathematics) Construction: Aggregate publications per country-year Normalize (e.g., per capita or population-adjusted intensity) Optionally log-transform and standardize (b) Arts Source: Clarivate Journal Citation Reports (JCR) Measure: Publications in: Social sciences Humanities Creative arts Construction: Aggregate arts-related publications per country-year Normalize per capita Log-transform and standardize (as in the regression tables) 4. Construct interaction term Multiply: Sciences × Arts Optionally include: squared interaction term (as used in robustness models) 5. Construct control variables From multiple global databases: GDP per capita → World Bank (WB 2021) Military expenditure → SIPRI database Institutional strength / economic freedom → Heritage Foundation Additional controls (as used in Table 2): Internet diffusion Healthcare spending R&D (% GDP) Education level (15+ attainment) Corruption index Political/institutional indicators Population size OECD vs developing dummy 6. Data preprocessing (a) Harmonisation Align all variables to: country ISO codes yearly frequency (1995–2020) (b) Missing data handling Use: interpolation or listwise deletion (depending on variable and model) ensure panel consistency for regression samples (N ≈ 3,800–3,900 observations) (c) Transformation Standard operations used in the study: Log transformation (for skewed variables like publications and GDP) Z-standardisation (mean = 0, SD = 1) Scaling to common range (e.g., 0–10 scale in some models) 7. Build final analytical dataset Merge all components into a single panel: Dataset structure: Country | Year | NAP | Sciences | Arts | Sciences×Arts | GDPpc | Controls... 8. Estimation-ready dataset versions Create multiple versions for different models: Raw (for descriptive statistics) Log-transformed (for mixed-effects models) Standardized (for comparability across variables) Lagged panels (for dynamic models, 1–5 year lags) Interaction datasets (moderation analysis) 9. Econometric structure preparation The dataset is explicitly prepared for: Mixed-effects models Fixed-effects (country FE) models Random-effects models Lag models (0–5 years) Moderation models (interaction effects) 10. Diagnostics dataset preparation

Institutions

Categories

Banking, Financial Economics, Financial Institution

Licence