Corporate Sustainability Data and Machine Learning
Researchers show that machine learning can predict corporate sustainability metrics like carbon emissions, water use, and board diversity using only financial data. Their flexible framework outperforms traditional models, especially when direct sustainability data is missing. Using a global dataset of thousands of companies, the study finds strong results for environmental metrics. The approach is practical for researchers and policymakers, but works best for large firms and faces challenges with small businesses, data gaps, and reporting biases.
What it examines
This paper presents a machine learning framework to estimate missing corporate sustainability data, such as carbon emissions and board diversity, using only widely available financial information. The approach also measures prediction uncertainty, making the results more reliable for decision-makers and researchers, especially when direct sustainability data is scarce.
What it concludes
The study shows machine learning can reliably predict firm-level sustainability metrics, expanding data access for research, policy, and finance. Applications include portfolio management, regulatory reporting, and climate risk analysis. Limitations include less accuracy for small firms; future work should address data gaps and adapt models for broader contexts.
Evidence objects
Machine learning can accurately predict diverse corporate sustainability metricslike carbon emissions and board diversityusing only financial data, outperforming traditional models and working even when direct sustainability disclosures are missing or inconsistent.
key_findings bullet 1 · key_findings · validation V0
The study introduces a flexible ML framework with advanced techniques, such as conformalized quantile regression and prediction-powered inference, enabling robust uncertainty quantification and reliable analysis across a massive dataset of thousands of companies in 95 countries.
key_findings bullet 2 · key_findings · validation V0
While the approach expands sustainability data access for researchers and policymakers, it works best for large, public firms; high computational demands and voluntary reporting biases remain key limitations, especially for smaller businesses or data-poor regions.
key_findings bullet 3 · key_findings · validation V0
This paper introduces a flexible, domain-agnostic machine learning framework for estimating diverse firm-level sustainability metrics from standard financial data, uniquely addressing incomplete ESG data. Incorporating prediction uncertainty quantification and prediction-powered inference, it advances methodological robustness, offering significant impact for quantitative finance as sustainability data becomes crucial for investment and risk management.
key_findings bullet 4 · key_findings · validation V0
Raw abstract and provenance
Sebastian Rink. Frankfurt School of Finance & Management. Date Written: November 28, 2025. Abstract. We first provide a machine learning based framework
Source row: 464 · abstract type: snippet