財(cái)務(wù)數(shù)據(jù)分析:從數(shù)據(jù)清洗到綜合評(píng)分模型實(shí)戰(zhàn))
簡(jiǎn)介本資源是面向經(jīng)濟(jì)學(xué)、管理學(xué)研究者、政策分析人員及中小企業(yè)實(shí)務(wù)工作者的國(guó)家級(jí)專精特新“小巨人”企業(yè)財(cái)務(wù)數(shù)據(jù)集覆蓋2013–2024年全部六批共1.59萬(wàn)家企業(yè)聚焦專業(yè)化、精細(xì)化、特色化與新穎化中小企業(yè)的成長(zhǎng)性與財(cái)務(wù)健康度分析。壓縮包共10個(gè)文件36.12MB含核心結(jié)構(gòu)化數(shù)據(jù)Excel.xlsx與Stata.dta雙格式財(cái)務(wù)表支持直接導(dǎo)入分析6份分批PDF名單便于企業(yè)級(jí)匹配與行業(yè)歸類HTML數(shù)據(jù)來(lái)源說(shuō)明與TXT版README清晰標(biāo)注采集口徑、字段定義及使用規(guī)范另有完整企業(yè)名錄用于交叉驗(yàn)證與樣本篩選。目前已有49人學(xué)習(xí)下載用戶可直接開(kāi)展跨年度財(cái)務(wù)趨勢(shì)建模、政策效果評(píng)估、細(xì)分行業(yè)對(duì)比研究或投資價(jià)值初篩無(wú)需額外清洗即可投入實(shí)證分析顯著降低數(shù)據(jù)獲取與預(yù)處理門(mén)檻。1. 項(xiàng)目概述一份“小巨人”企業(yè)的財(cái)務(wù)數(shù)據(jù)寶藏如果你正在關(guān)注制造業(yè)的轉(zhuǎn)型升級(jí)或者對(duì)中國(guó)的產(chǎn)業(yè)政策、企業(yè)發(fā)展有研究興趣那么“專精特新‘小巨人’企業(yè)財(cái)務(wù)數(shù)據(jù)”這個(gè)數(shù)據(jù)集絕對(duì)是一個(gè)值得你花時(shí)間深入挖掘的寶藏。這個(gè)壓縮包通常包含了從2013年到2024年間國(guó)家認(rèn)定的第一至第五批“小巨人”企業(yè)的核心財(cái)務(wù)數(shù)據(jù)。它不是一個(gè)簡(jiǎn)單的名單而是一個(gè)結(jié)構(gòu)化的、時(shí)間序列的財(cái)務(wù)數(shù)據(jù)庫(kù)涵蓋了營(yíng)收、利潤(rùn)、研發(fā)投入、資產(chǎn)狀況等關(guān)鍵指標(biāo)。簡(jiǎn)單來(lái)說(shuō)這份數(shù)據(jù)能幫你回答很多實(shí)際問(wèn)題哪些“小巨人”企業(yè)真正實(shí)現(xiàn)了高增長(zhǎng)它們的盈利模式有什么特點(diǎn)研發(fā)投入與市場(chǎng)表現(xiàn)之間是否存在強(qiáng)關(guān)聯(lián)不同批次、不同地域的“小巨人”發(fā)展路徑有何差異無(wú)論是做行業(yè)研究、投資分析、政策評(píng)估還是學(xué)術(shù)論文寫(xiě)作這份數(shù)據(jù)都提供了第一手的、未經(jīng)加工的“原料”。對(duì)于金融從業(yè)者、咨詢分析師、高校研究者以及企業(yè)戰(zhàn)略部門(mén)的人來(lái)說(shuō)拿到它就像是拿到了一張藏寶圖關(guān)鍵在于你如何解讀和使用。2. 數(shù)據(jù)價(jià)值與應(yīng)用場(chǎng)景深度解析2.1 “專精特新”與“小巨人”的政策背景與核心內(nèi)涵在深入數(shù)據(jù)之前必須理解“專精特新”和“小巨人”這兩個(gè)標(biāo)簽背后的重量。“專精特新”指的是專業(yè)化、精細(xì)化、特色化、新穎化這是國(guó)家引導(dǎo)中小企業(yè)特別是制造業(yè)企業(yè)不走同質(zhì)化、低價(jià)競(jìng)爭(zhēng)的老路而是聚焦主業(yè)、苦練內(nèi)功、強(qiáng)化創(chuàng)新的發(fā)展路徑。而“小巨人”企業(yè)則是“專精特新”中小企業(yè)中的佼佼者是專注于細(xì)分市場(chǎng)、創(chuàng)新能力強(qiáng)、市場(chǎng)占有率高、掌握關(guān)鍵核心技術(shù)、質(zhì)量效益優(yōu)的排頭兵企業(yè)。國(guó)家從2019年開(kāi)始分批認(rèn)定至今已超過(guò)五批累計(jì)數(shù)量近萬(wàn)家。這意味著這份數(shù)據(jù)集追蹤的是中國(guó)產(chǎn)業(yè)體系中一批最具活力、最具潛力的“隱形冠軍”或“潛在冠軍”群體。分析它們的財(cái)務(wù)數(shù)據(jù)本質(zhì)上是在觀測(cè)中國(guó)制造業(yè)轉(zhuǎn)型升級(jí)和產(chǎn)業(yè)鏈關(guān)鍵環(huán)節(jié)強(qiáng)化的微觀脈搏。2.2 核心數(shù)據(jù)字段與商業(yè)洞察映射一個(gè)典型的“小巨人”企業(yè)財(cái)務(wù)數(shù)據(jù)集通常會(huì)包含以下維度的字段每一類都對(duì)應(yīng)著不同的分析視角企業(yè)基本信息企業(yè)名稱、統(tǒng)一社會(huì)信用代碼、所屬批次第1-5批、認(rèn)定年份、注冊(cè)地、所屬行業(yè)通常精確到國(guó)民經(jīng)濟(jì)行業(yè)分類四位代碼。這是所有分析的基石用于企業(yè)篩選、區(qū)域?qū)Ρ群托袠I(yè)聚類。規(guī)模與成長(zhǎng)性指標(biāo)營(yíng)業(yè)收入分析企業(yè)市場(chǎng)擴(kuò)張能力的核心。可以計(jì)算復(fù)合增長(zhǎng)率CAGR對(duì)比不同批次、不同行業(yè)企業(yè)的成長(zhǎng)速度。營(yíng)業(yè)收入增長(zhǎng)率直接反映企業(yè)短期增長(zhǎng)動(dòng)能。盈利能力指標(biāo)凈利潤(rùn)企業(yè)經(jīng)營(yíng)的最終成果。毛利率營(yíng)業(yè)收入-營(yíng)業(yè)成本/營(yíng)業(yè)收入。反映企業(yè)產(chǎn)品或服務(wù)的直接競(jìng)爭(zhēng)力與附加值高低?!靶【奕恕逼髽I(yè)往往在細(xì)分領(lǐng)域有技術(shù)壁壘毛利率通常高于行業(yè)平均水平。凈利率凈利潤(rùn)/營(yíng)業(yè)收入。綜合反映企業(yè)的管理效率和費(fèi)用控制能力。凈資產(chǎn)收益率ROE凈利潤(rùn)/凈資產(chǎn)。衡量企業(yè)為股東創(chuàng)造價(jià)值的能力是投資分析中的關(guān)鍵指標(biāo)。研發(fā)與創(chuàng)新指標(biāo)研發(fā)費(fèi)用絕對(duì)投入值。研發(fā)費(fèi)用占營(yíng)業(yè)收入比例這是衡量企業(yè)創(chuàng)新決心的關(guān)鍵相對(duì)指標(biāo)。國(guó)家認(rèn)定“小巨人”對(duì)此有明確要求通常最近一年不低于3%分析實(shí)際數(shù)據(jù)可以看企業(yè)是否持續(xù)投入以及投入強(qiáng)度與業(yè)績(jī)的關(guān)聯(lián)。研發(fā)人員數(shù)量/占比輔助判斷企業(yè)的創(chuàng)新人才結(jié)構(gòu)。運(yùn)營(yíng)效率與財(cái)務(wù)健康度指標(biāo)總資產(chǎn)、資產(chǎn)負(fù)債率反映企業(yè)資產(chǎn)規(guī)模和財(cái)務(wù)杠桿風(fēng)險(xiǎn)。應(yīng)收賬款周轉(zhuǎn)率、存貨周轉(zhuǎn)率衡量企業(yè)運(yùn)營(yíng)管理效率。經(jīng)營(yíng)活動(dòng)產(chǎn)生的現(xiàn)金流量?jī)纛~企業(yè)“造血”能力的試金石比利潤(rùn)更能真實(shí)反映經(jīng)營(yíng)狀況。2.3 多元化的應(yīng)用場(chǎng)景實(shí)戰(zhàn)擁有這些字段你可以開(kāi)展多種深度分析投資篩選與盡職調(diào)查投資者可以用它構(gòu)建初篩模型。例如設(shè)定條件近三年?duì)I收復(fù)合增長(zhǎng)率25%、毛利率40%、研發(fā)費(fèi)用率8%、資產(chǎn)負(fù)債率50%快速鎖定一批高質(zhì)量潛力的標(biāo)的再進(jìn)行深度研究。行業(yè)研究與對(duì)標(biāo)分析如果你關(guān)注“工業(yè)機(jī)器人”或“半導(dǎo)體材料”行業(yè)可以提取該行業(yè)所有“小巨人”數(shù)據(jù)分析行業(yè)平均的盈利水平、研發(fā)投入強(qiáng)度、增長(zhǎng)梯隊(duì)為行業(yè)內(nèi)企業(yè)定位自身、尋找差距提供量化依據(jù)。區(qū)域產(chǎn)業(yè)政策效果評(píng)估按注冊(cè)地匯總可以分析哪些省份、哪些城市培育的“小巨人”數(shù)量多、質(zhì)量高平均營(yíng)收、利潤(rùn)、研發(fā)強(qiáng)度。這能為地方政府的產(chǎn)業(yè)政策制定和效果評(píng)估提供數(shù)據(jù)支撐。學(xué)術(shù)研究研究創(chuàng)新投入研發(fā)費(fèi)用與企業(yè)績(jī)效營(yíng)收增長(zhǎng)、利潤(rùn)率的實(shí)證關(guān)系探討政府認(rèn)定“小巨人”標(biāo)簽是否對(duì)企業(yè)融資約束有緩解作用可結(jié)合其他數(shù)據(jù)庫(kù)如企業(yè)信貸數(shù)據(jù)分析“小巨人”企業(yè)的生存與發(fā)展軌跡。注意數(shù)據(jù)集通常來(lái)源于公開(kāi)的企業(yè)年報(bào)上市公司或工商稅務(wù)報(bào)送數(shù)據(jù)非上市公司。非上市公司的數(shù)據(jù)完整性和準(zhǔn)確性可能遜于上市公司在分析時(shí)需注意數(shù)據(jù)口徑的一致性和可能存在的數(shù)據(jù)缺失問(wèn)題。3. 數(shù)據(jù)處理與清洗的關(guān)鍵步驟拿到一個(gè)名為“專精特新‘小巨人’-財(cái)務(wù)數(shù)據(jù)第1-5批2013-2024年.zip”的壓縮包興奮之余第一步不是直接分析而是進(jìn)行規(guī)范的數(shù)據(jù)處理。原始數(shù)據(jù)往往存在各種問(wèn)題直接分析會(huì)導(dǎo)致結(jié)論錯(cuò)誤。3.1 數(shù)據(jù)導(dǎo)入與初步探查我通常使用Python的pandas庫(kù)進(jìn)行處理。假設(shè)解壓后得到一個(gè)CSV文件little_giants_financial_data.csv。import pandas as pd import numpy as np # 1. 導(dǎo)入數(shù)據(jù)注意編碼問(wèn)題中文數(shù)據(jù)常用‘utf-8’或‘gbk’ try: df pd.read_csv(little_giants_financial_data.csv, encodingutf-8) except UnicodeDecodeError: df pd.read_csv(little_giants_financial_data.csv, encodinggbk) # 2. 初步查看 print(f數(shù)據(jù)集形狀{df.shape}) # 查看行數(shù)企業(yè)*年份和列數(shù)字段 print(df.info()) # 查看每列數(shù)據(jù)類型、非空值數(shù)量 print(df.head()) # 查看前幾行了解數(shù)據(jù)樣貌這一步可能會(huì)發(fā)現(xiàn)日期列可能是字符串格式營(yíng)收、利潤(rùn)等數(shù)值列可能因?yàn)閱挝蝗f(wàn)元/元不統(tǒng)一或包含“-”、“N/A”等字符而被識(shí)別為對(duì)象Object類型企業(yè)名稱可能有重復(fù)或前后空格。3.2 核心清洗操作解決五大常見(jiàn)“臟數(shù)據(jù)”問(wèn)題列名標(biāo)準(zhǔn)化將中文列名改為簡(jiǎn)潔的英文名方便后續(xù)代碼處理。df.columns [company_name, credit_code, batch, year, region, industry_code, revenue, revenue_growth_rate, net_profit, gross_margin, net_margin, roe, rd_expense, rd_ratio, total_assets, asset_liability_ratio]處理重復(fù)值基于“企業(yè)名稱年份”判斷是否為重復(fù)記錄。duplicate_rows df[df.duplicated(subset[company_name, year], keepFalse)] if not duplicate_rows.empty: print(f發(fā)現(xiàn)重復(fù)記錄\n{duplicate_rows}) # 通常保留第一條或根據(jù)數(shù)據(jù)來(lái)源可靠性進(jìn)行手動(dòng)判斷 df df.drop_duplicates(subset[company_name, year], keepfirst)處理缺失值這是最耗時(shí)但也最關(guān)鍵的一步。不能簡(jiǎn)單刪除或填充。策略性刪除對(duì)于關(guān)鍵標(biāo)識(shí)字段如企業(yè)名稱、年份缺失的行直接刪除。分情況填充數(shù)值型字段如營(yíng)收、利潤(rùn)如果缺失比例不高對(duì)于非上市公司謹(jǐn)慎使用均值填充因?yàn)椤靶【奕恕逼髽I(yè)差異極大。我通常更傾向于用中位數(shù)填充或者按行業(yè)和年份分組后的中位數(shù)填充這樣受極端值影響小。# 按行業(yè)和年份分組填充營(yíng)收中位數(shù) df[revenue] df.groupby([industry_code, year])[revenue].apply( lambda x: x.fillna(x.median()))增長(zhǎng)率字段如果缺失且前后年份數(shù)據(jù)存在可以計(jì)算得出。分類字段如批次、地區(qū)嘗試通過(guò)其他信息如企業(yè)名稱匹配其他數(shù)據(jù)庫(kù)補(bǔ)全或暫時(shí)標(biāo)記為“未知”。格式與類型轉(zhuǎn)換將年份year轉(zhuǎn)換為整數(shù)型。清洗數(shù)值列去除“%”符號(hào)將“萬(wàn)元”統(tǒng)一轉(zhuǎn)換為“元”如果需要將字符串轉(zhuǎn)換為浮點(diǎn)數(shù)。# 示例清洗毛利率假設(shè)原始數(shù)據(jù)為“35.5%”這樣的字符串 df[gross_margin] df[gross_margin].str.rstrip(%).astype(float) / 100.0 # 示例假設(shè)營(yíng)收單位為萬(wàn)元統(tǒng)一為元 df[revenue] df[revenue] * 10000異常值檢測(cè)與處理邏輯異常毛利率大于1或小于0營(yíng)收增長(zhǎng)率為-100%以下等需要核查原始數(shù)據(jù)或標(biāo)記為缺失。統(tǒng)計(jì)異常使用箱線圖或3σ原則檢查。例如凈利率遠(yuǎn)超100%或遠(yuǎn)低于-50%的需要單獨(dú)審視。# 使用箱線圖法則找出凈利率的極端異常值 Q1 df[net_margin].quantile(0.25) Q3 df[net_margin].quantile(0.75) IQR Q3 - Q1 lower_bound Q1 - 3 * IQR # 使用3倍IQR標(biāo)準(zhǔn)更寬松一些 upper_bound Q3 3 * IQR outliers df[(df[net_margin] lower_bound) | (df[net_margin] upper_bound)] print(f凈利率異常值數(shù)量{len(outliers)}) # 對(duì)于異常值不建議直接刪除可以單獨(dú)存放或替換為上下限值縮尾處理實(shí)操心得數(shù)據(jù)清洗沒(méi)有“標(biāo)準(zhǔn)答案”每一步選擇都要基于對(duì)數(shù)據(jù)來(lái)源和業(yè)務(wù)的理解。我的習(xí)慣是清洗后的每一步都保存一個(gè)中間版本并記錄下清洗邏輯方便回溯和審計(jì)。對(duì)于“小巨人”數(shù)據(jù)要特別注意非上市公司的數(shù)據(jù)質(zhì)量可能波動(dòng)較大需要更保守的處理方式。4. 核心分析思路與可視化實(shí)戰(zhàn)數(shù)據(jù)清洗干凈后就進(jìn)入了最有趣的探索分析階段。這里分享幾個(gè)我常用的分析思路和對(duì)應(yīng)的Python可視化方法。4.1 整體畫(huà)像多批次“小巨人”的成長(zhǎng)對(duì)比首先我們可以從宏觀上看看不同批次認(rèn)定的企業(yè)在整體財(cái)務(wù)表現(xiàn)上是否有差異。import matplotlib.pyplot as plt import seaborn as sns plt.style.use(seaborn-v0_8-darkgrid) # 設(shè)置一個(gè)好看的樣式 # 1. 各批次企業(yè)年均營(yíng)收與利潤(rùn)對(duì)比箱線圖非常適合看分布 fig, axes plt.subplots(1, 2, figsize(14, 5)) # 繪制營(yíng)收分布箱線圖 sns.boxplot(datadf, xbatch, yrevenue, axaxes[0], showfliersFalse) # 暫時(shí)不顯示異常值 axes[0].set_yscale(log) # 因?yàn)闋I(yíng)收差異巨大用對(duì)數(shù)坐標(biāo)更清晰 axes[0].set_title(各批次小巨人企業(yè)營(yíng)業(yè)收入分布對(duì)數(shù)坐標(biāo)) axes[0].set_ylabel(營(yíng)業(yè)收入元) axes[0].set_xlabel(認(rèn)定批次) # 繪制凈利率分布箱線圖 sns.boxplot(datadf, xbatch, ynet_margin, axaxes[1], showfliersFalse) axes[1].set_title(各批次小巨人企業(yè)凈利率分布) axes[1].set_ylabel(凈利率) axes[1].set_xlabel(認(rèn)定批次) plt.tight_layout() plt.show()這個(gè)分析可以直觀看出越往后批次的“小巨人”其營(yíng)收規(guī)模的中位數(shù)是否在提升盈利能力的集中度如何通常會(huì)發(fā)現(xiàn)早期批次的企業(yè)可能因?yàn)榘l(fā)展時(shí)間更長(zhǎng)規(guī)模更大但后期批次中也可能涌現(xiàn)出許多高增長(zhǎng)的“新星”。4.2 創(chuàng)新驅(qū)動(dòng)分析研發(fā)投入與業(yè)績(jī)關(guān)聯(lián)性這是分析“小巨人”的核心。我們想驗(yàn)證研發(fā)投入越高的企業(yè)是否成長(zhǎng)越快、利潤(rùn)越高# 2. 研發(fā)強(qiáng)度與營(yíng)收增長(zhǎng)率的散點(diǎn)圖回歸線 plt.figure(figsize(10, 6)) # 過(guò)濾掉缺失值和極端值 plot_df df[(df[rd_ratio].notna()) (df[revenue_growth_rate].notna())] plot_df plot_df[(plot_df[rd_ratio] 0.5) (plot_df[revenue_growth_rate].between(-1, 5))] # 限制范圍 sns.regplot(dataplot_df, xrd_ratio, yrevenue_growth_rate, scatter_kws{alpha:0.4, s:30}, line_kws{color:red}) plt.title(研發(fā)投入強(qiáng)度與營(yíng)業(yè)收入增長(zhǎng)率關(guān)系散點(diǎn)圖) plt.xlabel(研發(fā)費(fèi)用占營(yíng)業(yè)收入比例) plt.ylabel(營(yíng)業(yè)收入增長(zhǎng)率) plt.grid(True, linestyle--, alpha0.5) plt.show() # 可以分組計(jì)算相關(guān)性 correlation plot_df[[rd_ratio, revenue_growth_rate, net_margin]].corr() print(研發(fā)強(qiáng)度、營(yíng)收增長(zhǎng)與凈利率的相關(guān)系數(shù)矩陣) print(correlation)如果散點(diǎn)圖呈現(xiàn)右上傾斜的趨勢(shì)且相關(guān)系數(shù)為正則能在一定程度上支持“創(chuàng)新驅(qū)動(dòng)增長(zhǎng)”的假設(shè)。但務(wù)必注意相關(guān)性不等于因果??赡苄枰霑r(shí)間滯后用t年的研發(fā)投入對(duì)比t1年的增長(zhǎng)或使用更復(fù)雜的模型來(lái)控制其他變量。4.3 區(qū)域競(jìng)爭(zhēng)力地圖利用注冊(cè)地信息我們可以繪制一幅中國(guó)“小巨人”企業(yè)的經(jīng)濟(jì)地圖。# 3. 按省份統(tǒng)計(jì)企業(yè)數(shù)量及平均研發(fā)強(qiáng)度 province_stats df.groupby(region).agg( company_count(company_name, nunique), avg_rd_ratio(rd_ratio, mean), avg_revenue_growth(revenue_growth_rate, mean) ).reset_index().sort_values(company_count, ascendingFalse) print(小巨人企業(yè)數(shù)量省份TOP10:) print(province_stats.head(10)) # 可以進(jìn)一步使用pyecharts或geopandas繪制中國(guó)地圖熱力圖更直觀。 # 這里用條形圖示意 top20_provinces province_stats.head(20) fig, ax1 plt.subplots(figsize(12, 8)) x range(len(top20_provinces)) ax1.bar(x, top20_provinces[company_count], colorskyblue, label企業(yè)數(shù)量) ax1.set_xlabel(省份) ax1.set_ylabel(企業(yè)數(shù)量, colorskyblue) ax1.set_xticks(x) ax1.set_xticklabels(top20_provinces[region], rotation45, haright) ax1.tick_params(axisy, labelcolorskyblue) ax2 ax1.twinx() ax2.plot(x, top20_provinces[avg_rd_ratio], colorcoral, markero, linewidth2, label平均研發(fā)強(qiáng)度) ax2.set_ylabel(平均研發(fā)費(fèi)用率, colorcoral) ax2.tick_params(axisy, labelcolorcoral) fig.suptitle(TOP20省份小巨人企業(yè)數(shù)量與平均研發(fā)強(qiáng)度) fig.legend(locupper right) plt.tight_layout() plt.show()這張圖能清晰展示“小巨人”企業(yè)的地理分布結(jié)合平均研發(fā)強(qiáng)度可以看出哪些地區(qū)不僅是“數(shù)量高地”更是“創(chuàng)新高地”。5. 深度挖掘構(gòu)建企業(yè)綜合評(píng)分模型對(duì)于投資或研究而言僅僅看單一指標(biāo)是不夠的。我們可以嘗試構(gòu)建一個(gè)簡(jiǎn)單的綜合評(píng)分模型從多個(gè)維度篩選出最優(yōu)質(zhì)的“小巨人”企業(yè)。5.1 模型構(gòu)建思路我們選取成長(zhǎng)性、盈利能力、創(chuàng)新投入、運(yùn)營(yíng)穩(wěn)健性四個(gè)維度每個(gè)維度選取1-2個(gè)核心指標(biāo)成長(zhǎng)性權(quán)重30%近兩年平均營(yíng)收增長(zhǎng)率。盈利能力權(quán)重30%平均凈利率、平均ROE。創(chuàng)新投入權(quán)重25%平均研發(fā)費(fèi)用率。運(yùn)營(yíng)穩(wěn)健性權(quán)重15%平均資產(chǎn)負(fù)債率反向指標(biāo)越低越好、經(jīng)營(yíng)現(xiàn)金流凈額/營(yíng)業(yè)收入。注意權(quán)重設(shè)置沒(méi)有絕對(duì)標(biāo)準(zhǔn)完全取決于你的分析目的。如果是風(fēng)險(xiǎn)投資可能更看重成長(zhǎng)性和創(chuàng)新如果是債權(quán)投資則更看重盈利能力和穩(wěn)健性。5.2 數(shù)據(jù)標(biāo)準(zhǔn)化與評(píng)分計(jì)算由于各指標(biāo)量綱不同增長(zhǎng)率是百分比營(yíng)收是絕對(duì)數(shù)我們需要先進(jìn)行標(biāo)準(zhǔn)化處理。這里使用分位數(shù)排名法它比Z-score標(biāo)準(zhǔn)化更能抵抗極端值影響。# 假設(shè)我們針對(duì)2023年的數(shù)據(jù)進(jìn)行分析 df_2023 df[df[year] 2023].copy() # 定義指標(biāo)計(jì)算函數(shù)假設(shè)數(shù)據(jù)已清洗 def calculate_scores(sub_df): # 1. 計(jì)算各指標(biāo)的分位數(shù)排名0-1之間 metrics { growth_score: sub_df[revenue_growth_rate].rank(pctTrue), profit_score: ((sub_df[net_margin].rank(pctTrue) sub_df[roe].rank(pctTrue)) / 2), innovation_score: sub_df[rd_ratio].rank(pctTrue), stability_score: ((1 - sub_df[asset_liability_ratio].rank(pctTrue)) # 資產(chǎn)負(fù)債率反向 sub_df[operating_cashflow_ratio].rank(pctTrue)) / 2 # 假設(shè)已計(jì)算該比率 } # 2. 加權(quán)計(jì)算綜合得分 weights {growth: 0.3, profit: 0.3, innovation: 0.25, stability: 0.15} sub_df[composite_score] (metrics[growth_score] * weights[growth] metrics[profit_score] * weights[profit] metrics[innovation_score] * weights[innovation] metrics[stability_score] * weights[stability]) # 3. 將得分轉(zhuǎn)換為百分制可選 sub_df[composite_score_pct] sub_df[composite_score] * 100 return sub_df.sort_values(composite_score_pct, ascendingFalse) # 應(yīng)用評(píng)分函數(shù) scored_df calculate_scores(df_2023) print(2023年度小巨人企業(yè)綜合評(píng)分TOP20:) print(scored_df[[company_name, region, industry_code, revenue_growth_rate, net_margin, rd_ratio, composite_score_pct]].head(20))5.3 模型結(jié)果解讀與驗(yàn)證得到評(píng)分排名后切勿直接將其作為投資或決策的唯一依據(jù)。模型是工具不是圣旨。你需要人工復(fù)核點(diǎn)開(kāi)排名前20的企業(yè)逐一查看其主營(yíng)業(yè)務(wù)、客戶構(gòu)成、技術(shù)亮點(diǎn)等定性信息需要結(jié)合其他渠道如公司官網(wǎng)、新聞報(bào)道、招股書(shū)?;厮輽z驗(yàn)如果數(shù)據(jù)時(shí)間跨度夠長(zhǎng)可以用2021年的數(shù)據(jù)對(duì)2022年的表現(xiàn)做預(yù)測(cè)看高評(píng)分企業(yè)是否在次年確實(shí)有更好的市場(chǎng)表現(xiàn)如更高的增長(zhǎng)、更可能獲得下一輪融資等。調(diào)整與迭代根據(jù)復(fù)核和檢驗(yàn)結(jié)果回頭調(diào)整指標(biāo)選擇、權(quán)重分配甚至標(biāo)準(zhǔn)化方法。例如你可能發(fā)現(xiàn)某些行業(yè)天然資產(chǎn)負(fù)債率高這時(shí)就需要分行業(yè)進(jìn)行評(píng)分而不是全樣本混在一起。6. 常見(jiàn)問(wèn)題、數(shù)據(jù)陷阱與應(yīng)對(duì)策略在實(shí)際操作這套數(shù)據(jù)的過(guò)程中我踩過(guò)不少坑也總結(jié)了一些必須警惕的問(wèn)題。6.1 數(shù)據(jù)質(zhì)量問(wèn)題與應(yīng)對(duì)問(wèn)題表現(xiàn)可能原因應(yīng)對(duì)策略關(guān)鍵財(cái)務(wù)指標(biāo)大面積缺失或?yàn)?非上市公司未強(qiáng)制披露數(shù)據(jù)抓取或整合錯(cuò)誤。分層處理對(duì)上市公司和非上市公司分開(kāi)分析。對(duì)非上市公司的關(guān)鍵分析如盈利模型要格外謹(jǐn)慎或?qū)ふ姨娲鷶?shù)據(jù)源如行業(yè)報(bào)告交叉驗(yàn)證。同一企業(yè)不同年份數(shù)據(jù)跳躍巨大企業(yè)合并重組單位錯(cuò)誤萬(wàn)/元混淆數(shù)據(jù)錯(cuò)誤。趨勢(shì)分析優(yōu)先關(guān)注長(zhǎng)期趨勢(shì)而非單點(diǎn)值。繪制企業(yè)生命線圖對(duì)異常跳點(diǎn)進(jìn)行核實(shí)。計(jì)算復(fù)合增長(zhǎng)率時(shí)使用首尾年份值。行業(yè)分類代碼不準(zhǔn)或過(guò)時(shí)企業(yè)業(yè)務(wù)變更分類標(biāo)準(zhǔn)更新。手動(dòng)復(fù)核重點(diǎn)企業(yè)對(duì)于分析結(jié)論依賴度高的樣本企業(yè)手動(dòng)核查其主營(yíng)業(yè)務(wù)必要時(shí)重新歸類。使用文本挖掘技術(shù)從企業(yè)名稱或簡(jiǎn)介中提取關(guān)鍵詞輔助分類?!靶掖嬲咂睢睌?shù)據(jù)集只包含存活至今或成功被認(rèn)定的企業(yè)缺少已倒閉或未獲認(rèn)定的企業(yè)。明確結(jié)論邊界所有分析結(jié)論應(yīng)表述為“在已獲認(rèn)定的‘小巨人’企業(yè)中…”避免推廣到全體中小企業(yè)。在學(xué)術(shù)研究中需說(shuō)明此偏差。6.2 分析邏輯陷阱混淆相關(guān)與因果這是最經(jīng)典的錯(cuò)誤。研發(fā)投入高和增長(zhǎng)快同時(shí)出現(xiàn)不代表是研發(fā)投入導(dǎo)致了增長(zhǎng)??赡苁瞧髽I(yè)本身增長(zhǎng)快、利潤(rùn)高從而有更多資金投入研發(fā)。在陳述結(jié)論時(shí)應(yīng)使用“呈現(xiàn)正相關(guān)關(guān)系”、“伴隨…特征”等表述而非“導(dǎo)致”、“驅(qū)動(dòng)”。忽視樣本異質(zhì)性“小巨人”企業(yè)橫跨上百個(gè)細(xì)分行業(yè)從軟件到新材料從醫(yī)療器械到精密零件。把所有人放在一起算“平均研發(fā)強(qiáng)度”意義有限。必須進(jìn)行行業(yè)分組對(duì)比。例如軟件企業(yè)的研發(fā)強(qiáng)度普遍高于機(jī)械制造企業(yè)。靜態(tài)截面分析局限只看一年的數(shù)據(jù)截面數(shù)據(jù)就像拍照片只能看靜態(tài)分布。更有價(jià)值的是看企業(yè)自身隨時(shí)間的變化面板數(shù)據(jù)。例如分析企業(yè)在獲得“小巨人”認(rèn)定前后的財(cái)務(wù)表現(xiàn)是否有顯著變化這更能評(píng)估政策效果。指標(biāo)片面化只盯著營(yíng)收增長(zhǎng)和利潤(rùn)率可能忽略了現(xiàn)金流。有些高增長(zhǎng)企業(yè)可能是以巨額應(yīng)收賬款和存貨為代價(jià)的現(xiàn)金流為負(fù)風(fēng)險(xiǎn)很高。一定要結(jié)合現(xiàn)金流量表相關(guān)指標(biāo)如果數(shù)據(jù)包含進(jìn)行分析。6.3 工具與實(shí)操技巧數(shù)據(jù)存儲(chǔ)清洗后的數(shù)據(jù)建議保存為Parquet或Feather格式它們比CSV讀寫(xiě)速度快得多特別是數(shù)據(jù)量大的時(shí)候。分析效率如果數(shù)據(jù)量真的非常大比如包含所有中小企業(yè)的海量數(shù)據(jù)可以考慮使用Dask庫(kù)進(jìn)行并行處理或者將數(shù)據(jù)導(dǎo)入數(shù)據(jù)庫(kù)如DuckDB, PostgreSQL中用SQL進(jìn)行聚合查詢速度更快??梢暬x擇看分布箱線圖、直方圖、密度圖??搓P(guān)系散點(diǎn)圖加回歸線、熱力圖相關(guān)系數(shù)矩陣??蹿厔?shì)折線圖針對(duì)單一企業(yè)或聚合群體??礃?gòu)成堆疊柱狀圖、餅圖慎用。看地理分布地圖。報(bào)告輸出使用Jupyter Notebook或Jupyter Lab進(jìn)行分析可以無(wú)縫集成代碼、圖表和文字說(shuō)明最后用nbconvert導(dǎo)出為HTML或PDF報(bào)告分析過(guò)程可復(fù)現(xiàn)專業(yè)又高效。處理“專精特新小巨人”財(cái)務(wù)數(shù)據(jù)更像是一次在微觀經(jīng)濟(jì)海洋中的潛水探險(xiǎn)。數(shù)據(jù)是你的氧氣瓶和地圖但方向感和對(duì)水下地形行業(yè)知識(shí)的理解才是帶你找到寶藏的關(guān)鍵。從基礎(chǔ)的清洗整理到中觀的描述性統(tǒng)計(jì)和可視化再到嘗試構(gòu)建綜合評(píng)分模型每一步都需要嚴(yán)謹(jǐn)?shù)膽B(tài)度和批判性思維。這份數(shù)據(jù)集的價(jià)值會(huì)隨著你挖掘的深度而倍增。最后記住所有的數(shù)字背后都是一家家真實(shí)的企業(yè)保持對(duì)商業(yè)世界復(fù)雜性的敬畏你的分析才會(huì)更有力量。本文還有配套的精品資源點(diǎn)擊獲取