人文社科 × 数据科学 × AI:数字人文与计算社会科学

📖 一个中文系学生的”跨界”
小雅是北京大学中文系的研究生,研究方向是”宋代文人社交网络”。在传统的做法里,她要翻遍宋人笔记和书信集,手动记录”A跟B有交往”——然后画出关系图。光整理资料就花了半年。
2025年,她的导师建议她试试NLP(自然语言处理)方法。小雅学了两个月Python,用NLP工具从《全宋文》中自动提取人名和关系。AI+Python用了3天做了她原计划半年的事——从百万字文献中识别出了超过5000个人物实体和3万多条人物关系。
更妙的是,AI发现了几个她在手动阅读时完全没注意到的人物关联——后来的历史考证证明AI的发现是对的。小雅2026年毕业时,同时拿到了北大读博的录取通知书和一家科技公司”数字人文研究员”的offer(年薪35万)。
“以前所有人都告诉我’中文系跟代码没关系’。现在我反而觉得,能用计算工具处理海量文本,才是研究宏大课题的唯一办法。“——小雅
1. 文科生为什么突然”吃香”了?
2025-2026年出现的几个重要变化:
- 大模型改变了门槛——你不需要会C++,只需要会写自然语言的Prompt就能调用AI能力
- 内容产业的爆发——抖音、小红书、B站的内容生态需要大量既懂内容又懂数据的”文艺+分析”复合人才
- AI公司发现了一个问题——纯技术人员做出来的AI产品太”冷”了。AI需要”人性”——需要懂语言学的人在调Prompt,需要懂心理学的人在做用户体验,需要懂社会学的人在做AI伦理
- 数字人文从一个”小众学术领域”变成了一个”产业方向”
💡 一个很有意思的数据:2025-2026年,大模型公司的”Prompt工程师”和”AI训练师”岗位中,文科背景的候选人占比从5%升到了35%。因为写Prompt的本质是语言和逻辑,不是代码。
2. 三个”文科+AI”走出来的案例
案例一:一位北大语言学博士的AI公司创业
林博士2024年从北大语言学博士毕业。她的研究课题是”现代汉语的语用规律”——说出来很学术,其实就是”人在什么场合说什么话有什么规律”。
她毕业后没去高校,而是跟两个程序员朋友创办了一家AI公司,专门为电商客服AI做”语用层优化”。普通客服AI的回答虽然语法正确,但听起来像机器人——生硬、不亲切。林博士做的事情是”让人工客服AI说得更像人”——知道什么时候该用”啦”、什么时候该用”呢”,知道面对投诉的客户先说”我理解您的心情”而不是直接念解决方案。
她一年内签下了超过50家企业客户,包括两家头部电商平台。2025年公司营收超过2000万。
案例二:小红书内容数据专家——“用数据读懂人心”
小红书2025年招聘了超过30名”内容数据专家”——**大多数是社会学、传播学、人类学、心理学背景,而不是计算机背景。**他们的工作是:用数据分析用户在讨论什么、为什么关心这个话题、情绪从哪来、趋势会往哪走。
比如2025年”City Walk(城市漫步)“在小红书引爆——内容数据专家早在两个月前就通过语义分析发现了这个趋势的萌芽,并分析了引爆它的关键人群(一线城市28-35岁职场女性)。品牌方根据这些洞察提前布局内容,抓住了一波红利。
**这些岗位的薪资中位数:月薪2万-4万。**不比程序员低。
案例三:《永乐大典》数字化——让千年文献”开口说话”
2025年,国家图书馆与字节跳动合作,启动了一个宏大的数字人文项目:将《永乐大典》(明朝编纂的世界上最大百科全书,存世约400册)进行AI数字化处理。AI做的工作包括:
- 古籍OCR识别(草书、行书、楷书混合,比现代印刷体难百倍)
- 自动标点、断句
- 实体识别——自动标注文中的人名、地名、书名、官职名
- 跨文本关联——将大典中的内容与同时代其他文献中的相关内容关联
**这个项目的团队里:计算机专家占40%,文献学/历史学专家占60%。**纯技术团队做不了这个——因为他们看不懂古文;纯文献学团队也做不了——因为他们不知道AI能怎么用。
3. 人文社科×技术的前景地图
| 方向 | 说明 | 需求 | 薪资区间 |
|---|---|---|---|
| AI内容策略师 | 为AI生成内容定调性、设规则 | 爆发增长 | 20K-45K |
| Prompt工程师 | 设计AI对话的提示词和交互逻辑 | 快速增长 | 18K-40K |
| 内容数据分析师 | 分析社交媒体趋势和用户洞察 | 极度紧缺 | 18K-35K |
| AI伦理研究员 | 确保AI系统公平、安全、合规 | 新兴刚需 | 25K-60K |
| 数字人文研究员 | 用计算工具做人文研究 | 前沿稀缺 | 15K-50K+ |
🎯 核心逻辑:AI越聪明,越需要”懂人”的人。因为AI能生成内容,但不知道内容好不好、合适不合适、符不符合人性。这个判断力,恰恰是文科生的核心能力。
4. 入门实战:做一些很”文科”但很”AI”的事
4.1 用Python分析一部小说的情感曲线
# 分析《活着》全书的情感变化——从苦难到希望# 不需要你写复杂的NLP算法,用简单的情感词典即可
import re
# 正面情感词和负面情感词的简单词典positive_words = {'幸福','快乐','温暖','希望','笑容','美好','团圆','满足','安宁', '坚强','乐观','勇敢','善良','热爱'}negative_words = {'痛苦','悲伤','绝望','死亡','哭泣','贫穷','饥饿','孤独','压抑', '恐惧','愤怒','残酷','凄凉','折磨','苦难'}
# 读《活着》全文with open('活着.txt', 'r', encoding='utf-8') as f: text = f.read()
# 按章节或按5000字为一个窗口,计算情感密度window_size = 5000results = []for i in range(0, len(text), window_size): chunk = text[i:i + window_size] pos_count = sum(chunk.count(w) for w in positive_words) neg_count = sum(chunk.count(w) for w in negative_words) if pos_count + neg_count > 0: sentiment = (pos_count - neg_count) / (pos_count + neg_count) else: sentiment = 0 results.append({ '段落': i // window_size + 1, '正面词数': pos_count, '负面词数': neg_count, '情感得分': round(sentiment, 3) })
# 输出情感曲线print("📈 《活着》全书情感变化(数值越正越积极,越负越沉重):")for r in results: bar = '█' * abs(int(r['情感得分'] * 50)) if r['情感得分'] > 0 else '░' * abs(int(r['情感得分'] * 50)) side = '😊' if r['情感得分'] > 0 else '😢' if r['情感得分'] < 0 else '😐' print(f" 第{r['段落']}段 {side} " f"情感{r['情感得分']:+.2f} (正面{r['正面词数']} 负面{r['负面词数']}) {bar}")4.2 用AI做历史文本分析
# 场景:你有一篇出土文献的拓片文字,想请AI帮你翻译和解读
ancient_text = """(这是一段汉代简牍文字,你让AI帮你解读)"""
prompt = f"""你是古文字学和秦汉史专家。请解读以下出土文献:
文献内容:{ancient_text}
请提供:1. 释文(将古文字转写为现代繁体字)2. 白话翻译(用初中生也能看懂的话)3. 历史背景(这份文献写于什么时代?发生了什么事?)4. 学术价值(对秦汉史研究有什么意义?)5. 趣味点(讲一件这份文献揭示的有趣的历史细节)
语言风格:像一个很会讲历史故事的朋友,不要学术腔。"""
# response = openai_client.chat.completions.create(...)5. 写给文科同学的最后几句话
🌟 你不需要成为程序员。你永远不需要。
但你可以学会用AI和简单的代码,把那些别人觉得”太宏大、没法做”的问题变得可操作——研究1000年的文学演变、分析100万条社会情绪、挖掘一个时代的思想图谱。
过去这些研究需要一整个团队、几十年时间。现在你加一台电脑就够了。
编程和AI只是工具,**就像计算器是数学的工具,显微镜是生物学的工具,望远镜是天文学的工具。**它们把门槛降低,让更多普通人能够去探索那些曾经只属于精英学者的宏大问题。
你不用变成程序员。你只需要学会驾驶这辆”AI快车”——方向盘在你手里,目的地你来定。技术只是让你更快到达。」
入门路径——文科生友好版:
- 第1个月:玩ChatGPT/Claude,学会写好的Prompt。感受一下”跟AI正确沟通”是一门手艺。
- 第2-3个月:学Python最基础的部分——变量、列表、for循环、字符串处理。目标是用Python处理文本文件。
- 第4-5个月:学pandas,目标是能用Python做”关键词统计""情感分析""文本分类”这类文本分析任务。
- 第6个月:做一个小项目——分析你最爱的一部小说、分析一个热门事件的网络舆论、分析一位诗人的用词习惯变迁。做一个有趣的东西,而不是去写枯燥的作业。
文章分享
如果这篇文章对你有帮助,欢迎分享给更多人!











