शैक्षणिक शोध के लिए

जैसा-रिपोर्ट, पहचानकर्ता-हल,
कार्यप्रणाली अनुभाग के लिए बना।

58 बाज़ारों में क्रॉस-बाज़ार फाइलिंग और मानकीकृत KPI — स्थिर ID, NLP के लिए अनुभाग पाठ, और व्यक्तिगत शोधकर्ताओं के लिए मुफ़्त MCP ताकि अनुदान के महीने PDF से न जाएँ।

शोधकर्ता सैंडबॉक्स के लिए आवेदन करें, या आज MCP से शुरू करें।

समस्या

PhD के महीने कहाँ गायब होते हैं

गैर-US अंतर

US एक EDGAR पुल है। बाकी हर जगह नियामकों और प्रारूपों का पैचवर्क है। अधिकांश डेटासेट आसान आधा लेते हैं और बाकी पर पतले पड़ जाते हैं — पहला रिग्रेशन चलने से पहले सैंपल बायस।

PDF से जूझना

प्रति बाज़ार अलग पार्सर। कॉपी-पेस्ट पर टूटती तालिकाएँ। शोध प्रश्न के बजाय प्री-प्रोसेसिंग पर अनुदान के महीने।

पतले स्मॉल-कैप और एशिया

US-केंद्रित संरचित डेटासेट लार्ज-कैप की ओर झुकते हैं। महाद्वीपीय, नॉर्डिक और एशियाई लिस्टिंग कम कवर रहती हैं — मॉडल चलने से पहले पैनल में सरवाइवरशिप बायस।

खंडित जॉइन

टिकर पुनर्चक्रित होते हैं। कॉर्पोरेट कार्रवाई पर ISIN बदलते हैं। LEI गायब हैं। क्रॉस-डेटाबेस मिलान दूसरा प्रोजेक्ट बन जाता है।

आपको क्या मिलता है

अध्ययन सैंपल प्रिमिटिव, एक और स्क्रेपर नहीं

क्रॉस-बाज़ार, प्राथमिक-स्रोत

58 बाज़ारों से जैसा-रिपोर्ट फाइलिंग — नियामक-सीधा, हर रिकॉर्ड पर स्रोत दस्तावेज़ का लिंक।

पहचानकर्ता हल

LEI, ISIN, टिकर और market_id वाला canonical_key — Compustat / CRSP-शैली पहचानकर्ताओं से जॉइन एक मर्ज है, सफाई का सेमेस्टर नहीं।

KPI + अनुभाग पाठ

संरचित काम के लिए मानकीकृत क्रॉस-GAAP लाइन आइटम; NLP, सेंटीमेंट और टॉपिक मॉडल के लिए पूर्ण-पाठ खोजने योग्य कथा अनुभाग।

निर्माण से पुनरुत्पादन योग्य

स्थिर फाइलिंग ID, प्रकाशन टाइमस्टैम्प और स्रोत URL — स्क्रेपर संस्करण हाथ से दस्तावेज़ किए बिना कार्यप्रणाली अनुभाग के लिए पर्याप्त।

क्वेरी से सैंपल

कुछ पंक्तियों में फाइलिंग pandas में खींचें

फाइलिंग सूचीबद्ध करें, मानकीकृत KPI जोड़ें, या अनुभाग बॉडी पूर्ण-पाठ खोजें — उत्पाद के पीछे वही तेज़, इंडेक्स खोज, धीमा LIKE स्कैन नहीं।

study_sample.py

from openfilings import Client
import pandas as pd

client = Client(api_key="of_...")  # or OPENFILINGS_API_KEY

# Filing history for one market, then KPIs into a frame
filings = client.filings.list("AAPL", market_id="us", limit=50)
rows = []
for f in filings.filings:
    if f.form_type not in ("10-K", "10-Q"):
        continue
    kpis = client.filings.kpis(f.id)
    rows.append({
        "filing_id": f.id,
        "form_type": f.form_type,
        "filing_date": f.filing_date,
        "revenue": kpis.canonical.get("revenue"),
        "gross_margin": kpis.canonical.get("gross_margin"),
    })

df = pd.DataFrame(rows)
print(df.head())

section search

# Full-text search over filing section bodies (FTS — not LIKE)
hits = client.filings.search(
    "supply chain concentration",
    registry="sec",
    limit=20,
)
for hit in hits.items:
    print(hit.get("filing_id"), hit.get("section_key"), hit.get("snippet"))

लाइव कवरेज

लाइव
5,776
पिछले 24 घंटे में प्रकाशित
67,308
सूचीबद्ध कंपनियाँ
2,124,688
सूचीबद्ध फाइलिंग

पैनल काम के लिए एक ईमानदार चेतावनी: गहरा गैर-US कवरेज US-केंद्रित डेटासेट से विरासत सरवाइवरशिप बायस कम करता है — समाप्त नहीं करता। कवरेज गहराई अधिकार क्षेत्र के अनुसार अलग है; सैंपल-निर्माण अनुभाग में दस्तावेज़ करें।

शोधकर्ता सैंडबॉक्स

एक्सेस के लिए आवेदन करें

विश्वविद्यालय या शोध ईमेल पसंद। हम एक व्यावसायिक दिन में समय-सीमित API कुंजी और MCP मार्गदर्शन के साथ जवाब देते हैं। लैब और विभागों के लिए संस्थान-व्यापी लाइसेंस उपलब्ध हैं।

  • प्राथमिक-स्रोत फाइलिंग और मानकीकृत KPI के विरुद्ध NLP मॉडल सत्यापित करें।
  • प्री-प्रोसेसिंग के महीने छोड़ें — रिग्रेशन जल्दी शुरू करें।
  • कार्यप्रणाली अनुभाग में स्थिर फाइलिंग ID और स्रोत URL उद्धृत करें।

Or email [email protected] directly.

FAQ

पीयर रिव्यू और कार्यप्रणाली अनुभाग के लिए

हमारे पास डेटा बजट नहीं — क्या मुफ़्त है?

MCP सर्वर व्यक्तिगत शोधकर्ताओं के लिए मुफ़्त है — Claude या किसी MCP क्लाइंट से बिना लागत इंडेक्स क्वेरी करें। प्रोग्रामेटिक कॉर्पस पुल के लिए संस्थान-व्यापी API एक्सेस प्रति-सीट के बजाय एक समझौता है। समय-सीमित API कुंजी के लिए नीचे शोधकर्ता सैंडबॉक्स का अनुरोध करें।

हम पहले से WRDS / Compustat इस्तेमाल करते हैं — यह क्यों जोड़ें?

पूरक, प्रतिस्थापन नहीं। Compustat / WRDS US लार्ज-कैप संरचित फंडामेंटल्स पर मजबूत हैं। OpenFilings जैसा-रिपोर्ट फाइलिंग और क्रॉस-बाज़ार पाठ/KPI परत है — LEI/ISIN/टिकर हल के साथ ताकि CRSP-शैली जॉइन एक मर्ज चरण हो।

क्या मैं पेपर या थीसिस में इसे उद्धृत कर सकता हूँ?

हाँ। प्रत्येक अवलोकन के लिए प्राप्ति तिथि और filing_id (और स्रोत URL) उद्धृत करें। औपचारिक डेटासेट DOI आज नहीं भेजा गया — हर रिकॉर्ड पर पहले से मौजूद स्थिर ID और टाइमस्टैम्प इस्तेमाल करें।

कैंपस / संस्थान एक्सेस कैसे काम करता है?

फ़ॉर्म पर अपना प्रावधान मॉडल बताएँ (साझा लैब कुंजी, विभाग चालान, बाद में SSO)। हम संस्थान समझौता स्कोप करते हैं ताकि उस संगठन के तहत कोई भी शोधकर्ता एक नामित इनबॉक्स के बजाय एक अनुबंध के तहत काम करे।

अर्निंग्स ट्रांसक्रिप्ट के बारे में?

अर्निंग्स कॉल ट्रांसक्रिप्ट OpenFilings पर उपलब्ध हैं जहाँ संसाधित — देखें /transcripts। कवरेज गहराई जारीकर्ता के अनुसार अलग है; अपने सैंपल-निर्माण अनुभाग में दस्तावेज़ करें।

ईमानदार किनारे?

हम निजी कंपनियाँ कवर नहीं करते और स्टॉक मूल्य नहीं देते। क्रॉस-देश लाइन-आइटम मानकीकरण प्रगतिशील है — जैसा-रिपोर्ट प्लस जहाँ वर्गीकरण समर्थन करता है मानकीकृत मैपिंग, पूर्ण वैश्विक GAAP एकता का दावा नहीं।