Para investigación académica

Tal como se informó, identificadores resueltos,
hecho para la sección de metodología.

Filings cross-market y KPI estandarizados en 58 mercados — ID estables, texto de secciones para NLP y un MCP gratis para investigadores individuales para que meses de grant no se vayan en lidiar con PDF.

Solicita el sandbox de investigadores, o empieza con MCP hoy.

El problema

Dónde desaparecen los meses de un doctorado

La brecha no estadounidense

EE. UU. es un único pull de EDGAR. El resto es un mosaico de reguladores y formatos. La mayoría de datasets cogen la mitad fácil y se adelgazan en el resto — sesgo de muestra horneado antes de la primera regresión.

Lidiar con PDF

Parsers a medida por mercado. Tablas que se descomponen al copiar y pegar. Meses de grant en preprocesado en lugar de en la pregunta de research.

Small-caps y Asia delgadas

Los datasets estructurados centrados en EE. UU. sesgan a large-cap. Las cotizadas continentales, nórdicas y asiáticas quedan infrarepresentadas — sesgo de supervivencia en el panel antes de que corra el modelo.

Joins fragmentados

Los tickers se reciclan. Los ISIN cambian en operaciones corporativas. Faltan LEI. El emparejamiento entre bases se convierte en un segundo proyecto.

Qué obtienes

Primitivas de muestra de estudio, no otro scraper

Cross-market, fuente primaria

Filings tal como se informaron de 58 mercados — directos del regulador, con un enlace al documento fuente en cada registro.

Identificadores resueltos

canonical_key con LEI, ISIN, ticker y market_id — un join a identificadores estilo Compustat / CRSP es un merge, no un semestre de limpieza.

KPI + texto de secciones

Partidas cross-GAAP estandarizadas para trabajo estructurado; secciones narrativas de texto completo buscable para NLP, sentimiento y modelos de temas.

Reproducible por construcción

ID de filing estables, marcas temporales de publicación y URL de origen — suficiente para la sección de metodología sin documentar a mano una versión de scraper.

De la consulta a la muestra

Lleva filings a pandas en unas pocas líneas

Lista filings, adjunta KPI estandarizados o busca a texto completo en cuerpos de sección — la misma búsqueda rápida e indexada detrás del producto, no un LIKE lento.

study_sample.py

from openfilings import Client
import pandas as pd

client = Client(api_key="of_...")  # or OPENFILINGS_API_KEY

# Filing history for one market, then KPIs into a frame
filings = client.filings.list("AAPL", market_id="us", limit=50)
rows = []
for f in filings.filings:
    if f.form_type not in ("10-K", "10-Q"):
        continue
    kpis = client.filings.kpis(f.id)
    rows.append({
        "filing_id": f.id,
        "form_type": f.form_type,
        "filing_date": f.filing_date,
        "revenue": kpis.canonical.get("revenue"),
        "gross_margin": kpis.canonical.get("gross_margin"),
    })

df = pd.DataFrame(rows)
print(df.head())

section search

# Full-text search over filing section bodies (FTS — not LIKE)
hits = client.filings.search(
    "supply chain concentration",
    registry="sec",
    limit=20,
)
for hit in hits.items:
    print(hit.get("filing_id"), hit.get("section_key"), hit.get("snippet"))

Cobertura en vivo

En vivo
5,722
Publicados en 24 h
67,306
Empresas indexadas
2,100,577
Filings indexados

Un matiz honesto para trabajo de panel: una cobertura no estadounidense más profunda reduce — pero no elimina — el sesgo de supervivencia que heredas de datasets centrados en EE. UU. La profundidad de cobertura varía por jurisdicción; documéntalo en la sección de construcción de muestra.

Sandbox de investigadores

Solicitar acceso

Se prefiere email universitario o de research. Respondemos en un día hábil con una clave API acotada en el tiempo y orientación MCP. Hay licencias institucionales para laboratorios y departamentos.

  • Valida modelos NLP contra filings de fuente primaria y KPI estandarizados.
  • Sáltate meses de preprocesado — empieza la regresión antes.
  • Cita ID de filing estables y URL de origen en la sección de metodología.

Or email [email protected] directly.

FAQ

Para revisión por pares y la sección de metodología

No tenemos presupuesto de datos — ¿qué es gratis?

El servidor MCP es gratis para investigadores individuales — consulta el índice desde Claude o cualquier cliente MCP sin coste. Para extracciones de corpus programáticas, el acceso API institucional es un solo acuerdo, no por asiento. Solicita el sandbox de investigadores abajo para una clave API acotada en el tiempo.

Ya usamos WRDS / Compustat — ¿por qué añadir esto?

Complemento, no reemplazo. Compustat / WRDS son fuertes en fundamentos estructurados large-cap de EE. UU. OpenFilings es la capa de filings tal como se informaron y de texto/KPI cross-market — con resolución LEI/ISIN/ticker para que un join estilo CRSP sea un paso de merge.

¿Puedo citar esto en un paper o tesis?

Sí. Cita la fecha de recuperación y el filing_id (y la URL de origen) de cada observación. Hoy no hay DOI formal de dataset — usa los ID y marcas temporales estables que ya tiene cada registro.

¿Cómo funciona el acceso de campus / institución?

Dinos tu modelo de aprovisionamiento en el formulario (clave de laboratorio compartida, factura de departamento, SSO más adelante). Acotamos un acuerdo institucional para que cualquier investigador de esa organización trabaje bajo un contrato, no una bandeja nominada.

¿Y las transcripciones de resultados?

Las transcripciones de llamadas de resultados están en OpenFilings donde se procesan — véase /transcripts. La profundidad de cobertura varía por emisor; documéntalo en tu sección de construcción de muestra.

¿Límites honestos?

No cubrimos empresas privadas ni servimos precios de acciones. La estandarización de partidas entre países es progresiva — tal como se informó más mapeo estandarizado donde la taxonomía lo soporta, no una afirmación de unidad GAAP global perfecta.