הפער מחוץ לארה״ב
ארה״ב היא שליפת EDGAR אחת. בכל מקום אחר זה טלאים של רגולטורים ופורמטים. רוב מערכי הנתונים מקבלים את החצי הקל ומידלדלים בשאר — הטיית מדגם אפויה עוד לפני הרגרסיה הראשונה.
למחקר אקדמי
דיווחים חוצי-שווקים ו-KPI מתוקננים ב-58 שווקים — מזהים יציבים, טקסט קטעים ל-NLP, ו-MCP חינם לחוקרים יחידים כדי שחודשי מענק לא יבוזבזו על התעסקות ב-PDF.
הגישו בקשה ל-sandbox לחוקרים, או התחילו עם MCP היום.
הבעיה
ארה״ב היא שליפת EDGAR אחת. בכל מקום אחר זה טלאים של רגולטורים ופורמטים. רוב מערכי הנתונים מקבלים את החצי הקל ומידלדלים בשאר — הטיית מדגם אפויה עוד לפני הרגרסיה הראשונה.
מנתחים מותאמים לכל שוק. טבלאות שמתפרקות בהעתקה. חודשי מענק על עיבוד מקדים במקום על שאלת המחקר.
מערכי נתונים מובנים ממורכזים בארה״ב נוטים לשווי שוק גדול. רישומים יבשתיים, נורדיים ואסייתיים נשארים בכיסוי חסר — הטיית הישרדות בפאנל לפני שהמודל רץ.
טיקרים ממוחזרים. ISIN משתנים בפעולות תאגידיות. LEI חסרים. התאמה בין מסדי נתונים הופכת לפרויקט שני.
מה מקבלים
דיווחים כפי שדווחו מ-58 שווקים — ישירות מהרגולטור, עם קישור חזרה למסמך המקור בכל רשומה.
canonical_key עם LEI, ISIN, טיקר ו-market_id מצורפים — חיבור למזהים בסגנון Compustat / CRSP הוא מיזוג, לא סמסטר של ניקוי.
פריטי שורה מתוקננים חוצי-GAAP לעבודה מובנית; קטעי נרטיב ניתנים לחיפוש טקסט מלא ל-NLP, סנטימנט ומודלי נושא.
מזהי דיווח יציבים, חותמות זמן פרסום וכתובות מקור — מספיק למדור המתודולוגיה בלי לתעד ידנית גרסת סקרייפר.
משאילתה למדגם
רשמו דיווחים, צרפו KPI מתוקננים, או חפשו טקסט מלא בגופי קטעים — אותו חיפוש מהיר וממודר מאחורי המוצר, לא סריקת LIKE איטית.
study_sample.py
from openfilings import Client
import pandas as pd
client = Client(api_key="of_...") # or OPENFILINGS_API_KEY
# Filing history for one market, then KPIs into a frame
filings = client.filings.list("AAPL", market_id="us", limit=50)
rows = []
for f in filings.filings:
if f.form_type not in ("10-K", "10-Q"):
continue
kpis = client.filings.kpis(f.id)
rows.append({
"filing_id": f.id,
"form_type": f.form_type,
"filing_date": f.filing_date,
"revenue": kpis.canonical.get("revenue"),
"gross_margin": kpis.canonical.get("gross_margin"),
})
df = pd.DataFrame(rows)
print(df.head())section search
# Full-text search over filing section bodies (FTS — not LIKE)
hits = client.filings.search(
"supply chain concentration",
registry="sec",
limit=20,
)
for hit in hits.items:
print(hit.get("filing_id"), hit.get("section_key"), hit.get("snippet"))כיסוי חי
הסתייגות כנה אחת לעבודת פאנל: כיסוי עמוק יותר מחוץ לארה״ב מפחית — אך אינו מבטל — את הטיית ההישרדות שאתם יורשים ממערכי נתונים ממורכזים בארה״ב. עומק הכיסוי משתנה לפי תחום שיפוט; תעדו זאת במדור בניית המדגם.
Sandbox לחוקרים
מועדף אימייל אוניברסיטאי או מחקרי. נשיב תוך יום עסקים אחד עם מפתח API מוגבל בזמן והנחיות ל-MCP. רישיונות לכל המוסד זמינים למעבדות ולמחלקות.
שאלות נפוצות
שרת MCP חינם לחוקרים יחידים — שאלו את האינדקס מ-Claude או מכל לקוח MCP ללא עלות. לשליפות קורפוס תוכנתיות, גישת API לכל המוסד היא הסכם אחד ולא לפי מושב. בקשו את ה-sandbox לחוקרים למטה למפתח API מוגבל בזמן.
השלמה, לא תחליף. Compustat / WRDS חזקים ביסודות מובנים של שווי שוק גדול בארה״ב. OpenFilings הוא שכבת הדיווחים כפי שדווחו והטקסט/KPI חוצי-השווקים — עם זיהוי LEI/ISIN/טיקר כך שחיבור בסגנון CRSP הוא שלב מיזוג אחד.
כן. צטטו את תאריך השליפה ואת filing_id (וכתובת המקור) לכל תצפית. DOI פורמלי למערך נתונים אינו זמין היום — השתמשו במזהים היציבים ובחותמות הזמן שכבר נמצאים בכל רשומה.
ספרו לנו את מודל האספקה בטופס (מפתח מעבדה משותף, חשבונית מחלקה, SSO בהמשך). נמקד הסכם מוסדי כך שכל חוקר תחת הארגון עובד תחת חוזה אחד ולא תיבת דואר אחת בשם.
תמלילי שיחות רווחים זמינים ב-OpenFilings במקומות שעובדו — ראו /transcripts. עומק הכיסוי משתנה לפי מנפיק; תעדו זאת במדור בניית המדגם.
אנחנו לא מכסים חברות פרטיות ולא מגישים מחירי מניות. תקינון פריטי שורה בין מדינות הוא מתקדם — כפי שדווח ועוד מיפוי מתוקנן במקומות שהטקסונומיה תומכת, לא טענה לאחדות GAAP גלובלית מושלמת.