La brecha no estadounidense
EE. UU. es un único pull de EDGAR. El resto es un mosaico de reguladores y formatos. La mayoría de datasets cogen la mitad fácil y se adelgazan en el resto — sesgo de muestra horneado antes de la primera regresión.
Para investigación académica
Filings cross-market y KPI estandarizados en 58 mercados — ID estables, texto de secciones para NLP y un MCP gratis para investigadores individuales para que meses de grant no se vayan en lidiar con PDF.
Solicita el sandbox de investigadores, o empieza con MCP hoy.
El problema
EE. UU. es un único pull de EDGAR. El resto es un mosaico de reguladores y formatos. La mayoría de datasets cogen la mitad fácil y se adelgazan en el resto — sesgo de muestra horneado antes de la primera regresión.
Parsers a medida por mercado. Tablas que se descomponen al copiar y pegar. Meses de grant en preprocesado en lugar de en la pregunta de research.
Los datasets estructurados centrados en EE. UU. sesgan a large-cap. Las cotizadas continentales, nórdicas y asiáticas quedan infrarepresentadas — sesgo de supervivencia en el panel antes de que corra el modelo.
Los tickers se reciclan. Los ISIN cambian en operaciones corporativas. Faltan LEI. El emparejamiento entre bases se convierte en un segundo proyecto.
Qué obtienes
Filings tal como se informaron de 58 mercados — directos del regulador, con un enlace al documento fuente en cada registro.
canonical_key con LEI, ISIN, ticker y market_id — un join a identificadores estilo Compustat / CRSP es un merge, no un semestre de limpieza.
Partidas cross-GAAP estandarizadas para trabajo estructurado; secciones narrativas de texto completo buscable para NLP, sentimiento y modelos de temas.
ID de filing estables, marcas temporales de publicación y URL de origen — suficiente para la sección de metodología sin documentar a mano una versión de scraper.
De la consulta a la muestra
Lista filings, adjunta KPI estandarizados o busca a texto completo en cuerpos de sección — la misma búsqueda rápida e indexada detrás del producto, no un LIKE lento.
study_sample.py
from openfilings import Client
import pandas as pd
client = Client(api_key="of_...") # or OPENFILINGS_API_KEY
# Filing history for one market, then KPIs into a frame
filings = client.filings.list("AAPL", market_id="us", limit=50)
rows = []
for f in filings.filings:
if f.form_type not in ("10-K", "10-Q"):
continue
kpis = client.filings.kpis(f.id)
rows.append({
"filing_id": f.id,
"form_type": f.form_type,
"filing_date": f.filing_date,
"revenue": kpis.canonical.get("revenue"),
"gross_margin": kpis.canonical.get("gross_margin"),
})
df = pd.DataFrame(rows)
print(df.head())section search
# Full-text search over filing section bodies (FTS — not LIKE)
hits = client.filings.search(
"supply chain concentration",
registry="sec",
limit=20,
)
for hit in hits.items:
print(hit.get("filing_id"), hit.get("section_key"), hit.get("snippet"))Cobertura en vivo
Un matiz honesto para trabajo de panel: una cobertura no estadounidense más profunda reduce — pero no elimina — el sesgo de supervivencia que heredas de datasets centrados en EE. UU. La profundidad de cobertura varía por jurisdicción; documéntalo en la sección de construcción de muestra.
Sandbox de investigadores
Se prefiere email universitario o de research. Respondemos en un día hábil con una clave API acotada en el tiempo y orientación MCP. Hay licencias institucionales para laboratorios y departamentos.
FAQ
El servidor MCP es gratis para investigadores individuales — consulta el índice desde Claude o cualquier cliente MCP sin coste. Para extracciones de corpus programáticas, el acceso API institucional es un solo acuerdo, no por asiento. Solicita el sandbox de investigadores abajo para una clave API acotada en el tiempo.
Complemento, no reemplazo. Compustat / WRDS son fuertes en fundamentos estructurados large-cap de EE. UU. OpenFilings es la capa de filings tal como se informaron y de texto/KPI cross-market — con resolución LEI/ISIN/ticker para que un join estilo CRSP sea un paso de merge.
Sí. Cita la fecha de recuperación y el filing_id (y la URL de origen) de cada observación. Hoy no hay DOI formal de dataset — usa los ID y marcas temporales estables que ya tiene cada registro.
Dinos tu modelo de aprovisionamiento en el formulario (clave de laboratorio compartida, factura de departamento, SSO más adelante). Acotamos un acuerdo institucional para que cualquier investigador de esa organización trabaje bajo un contrato, no una bandeja nominada.
Las transcripciones de llamadas de resultados están en OpenFilings donde se procesan — véase /transcripts. La profundidad de cobertura varía por emisor; documéntalo en tu sección de construcción de muestra.
No cubrimos empresas privadas ni servimos precios de acciones. La estandarización de partidas entre países es progresiva — tal como se informó más mapeo estandarizado donde la taxonomía lo soporta, no una afirmación de unidad GAAP global perfecta.