[[2024-4-12]]\
excalidraw-plugin: raw tags: [excalidraw]
==⚠ Switch to EXCALIDRAW VIEW in the MORE OPTIONS menu of this document. ⚠== You can decompress Drawing data with the command palette: ‘Decompress current Excalidraw file’. For more info check in plugin settings under ‘Saving’
2024-4-12\
Section titled “2024-4-12\”Excalidraw Data
Section titled “Excalidraw Data”Text Elements
Section titled “Text Elements”扇贝技能课程 ^UrrcasRZ
二、提问的艺术 1)提示词:生成AI运作的关键 2)提示词编写:提出好问题 3)样本提示与链式思考:规范格式,引导思考 4)交叉验证:慎思、辨伪 ^XymyQzNT
笔记页 ^HLzdyYZ6
标签 ^g6Foj0jc
引用 ^pHqLTv81
画板 ^srNCuHMZ
Obsidian笔记系统 ^fqyLX5ow
即便输入大量的专业领域知识 也无法将GPT训练为该领域的 专家; 理论上可行,实际无法办到 人类,知识存于大脑中 GPT,知识存于模型中 ^eqgzzdWH
大型语言模型(LLM)的训练依赖于多种数据来源,以确保模型具备广泛的语言理解和生成能力。以下是主要的数据来源类别: ^yEpxn7Cn
⸻ ^CM778K4W
📚 1. 通用文本数据 ^L9tPlMmg
这些数据涵盖了广泛的主题和语言风格,是训练语言模型的基础: ^LVYeb6uO
• 网页抓取数据:如 Common Crawl 提供的大规模网页数据集。  ^EQ7pWtSd
• 维基百科:多语言版本的维基百科为模型提供了结构化的百科知识。 ^Y8YVB1lV
• 书籍语料库:例如 BookCorpus,包含了大量未出版书籍的文本。  ^U6dj9ujr
• 新闻文章:来自各大新闻网站的文章,涵盖时事、政治、经济等领域。 ^GJ0LUDrv
• 对话数据:从论坛、社交媒体等获取的对话文本,有助于模型理解人类交流方式。  ^EpcnmsHv
⸻ ^DIvvqcUO
🧑💻 2. 专业领域数据 ^erTWZ0YC
为了提升模型在特定领域的表现,训练数据还包括: ^PM5rRJEx
• 科学论文:如 arXiv、PubMed 提供的科研论文,增强模型的专业知识。  ^RMJjUO9m
• 代码数据:来自 GitHub、StackOverflow 等平台的代码和相关讨论,支持模型的编程能力。 ^PLL1r3R8
• 法律、医疗等行业数据:专业领域的文档和记录,帮助模型理解行业术语和规范。 ^ZR8eBvgY
⸻ ^00zyAzlE
🌐 3. 社交媒体和用户生成内容 ^g9Y7IXw5
这些数据反映了真实世界的语言使用情况: ^TaSSIccB
• 社交平台内容:如 Reddit、微博、知乎等用户发布的帖子和评论。  ^Yegzwfzk
• 博客和论坛:个人博客、技术论坛等提供的非正式文本。 ^IeKDuegv
• 问答社区:如 StackExchange 系列网站的问答内容,涵盖多种主题。 ^XiVf8ybR
⸻ ^qPDGThnb
🏢 4. 企业和合作数据 ^xufK8hOv
一些模型还利用了特定组织或合作伙伴提供的数据: ^TOHwVLY2
• 企业内部数据:如客户服务记录、产品文档等,用于定制模型以满足特定业务需求。 ^4gj1IqaQ
• 合作伙伴数据:通过与其他组织合作,获取特定领域的数据资源。 ^Gx2bywzt
⸻ ^pIRmzXhy
⚠️ 数据使用的法律和伦理考量 ^mD7ufm1K
在使用上述数据进行模型训练时,必须注意: ^V6Idak65
• 版权问题:确保数据的使用符合版权法规,避免侵犯原作者权益。 ^WsY0qTxb
• 隐私保护:对包含个人信息的数据进行脱敏处理,保护用户隐私。 ^cScO5t2h
• 数据偏见:识别并尽量减少训练数据中的偏见,防止模型输出不公正或歧视性的内容。 ^9AQKCI1D
⸻ ^EYX2SC6S
通过多样化的数据来源,语言模型能够学习丰富的语言结构和知识。然而,数据的质量和合法性直接影响模型的性能和可靠性。因此,在数据收集和使用过程中,遵守相关法律法规和伦理准则至关重要。 ^JFSs7UOY
提词器的用途与价值? ^YIiFPNck
1)上下文信息 2)待处理数据 3)输出格式要求 ^mL4x77U2
GPT运作机制是文字接龙,不断预测下一个位置可能出现的字 这是基于概率与所学习的资料得出的 ^1RR5PkHM
规范格式 举例子 在例子在给出思考过程(少样本链式思考提示法) ^lKEMMORN
提高GPT理解 扮演 引导 符号 ^jgXBEUCF
ABC分析法 ^l7xHrkdd
A 类商品:单品利润高,占总商品类别的 20%,不出意外会带来总利润的 80% 左右,需要作为下一季的主推商品; B 类商品:单品利润一般,占总商品类别的 15%,带来总利润的 15% 左右; C 类商品:单品利润低,占总商品类别的 65%,不出意外带来的利润只占总利润的 5% 左右,需要清仓处理。 ^zTohuTqK
绘制用户画像 ^91rO95lN
对用户行为和特征的一种概述。我们根据用户在使用产品时留下的种种数据, 给他们贴上一系列标签,并预测他们的行为。比如根据用户是什么性别,哪里人,兴趣爱好是什么等等, 据此找出同类人的共同特征,以便提供更精准的服务。 ^i4l9gpwr
案例,构建用户画像目标 用户的地区分布、性别分布、年龄段分布和手机平台分布是怎样的? 不同性别、手机平台、地区与年龄段的用户,付费意愿如何? 北京与上海两市,不同性别、手机平台、与年龄段的用户,付费意愿如何? ^HyDVOWbe
Element Links
Section titled “Element Links”uHIt6OGy: 扇贝-技能课
Embedded Files
Section titled “Embedded Files”4f3691913d4cf623d1ea64c8514ebd938b3bbfcf: Pasted Image 20250409023516_407.png
958d4e173b5c6a60dcc91e42f5284dec1c8d0194: Pasted Image 20250409023600_018.png
13dc765e4bfb69e6ed6ac9e0a8f71dc35d16d83b: Pasted Image 20250412003332_883.png
768055794b89c20ecc209131a6937dcf4bbbdb76: Pasted Image 20250412003846_866.png
238032578e588331437dc7c168b4d10788b693d0: Pasted Image 20250412004726_729.png
a2a0e28d6637f6a609059e063321f25640b3cfaa: Pasted Image 20250412005334_318.png
301921f8a883d466b4ba7b680f7d6c486fcda7c0: Pasted Image 20250412102946_811.png
3cc0d87451cef1eff59aa172c650ebb0457c54fa: Pasted Image 20250412103305_231.png
ff75061e6826af3ed6e8b1edc1b25a42c54d6a5e: Pasted Image 20250412103810_975.png
64cec232e933badb1824ac1b0c52e6db299a74b4: Pasted Image 20250412104105_831.png
4500b52960b703cac02baea9fe9cdc3c94f663c0: Pasted Image 20250412155336_061.png
fbda0a50d3197272accb0a57a175410c772712ed: Pasted Image 20250412160146_963.png
e55fa15c2baebb687b4469c0746c1709b98021ef: Pasted Image 20250413130409_765.png
09af521672baa1d79a4e027d2e962e70fe55a8a9: IMG_1832.png
a3fe131e8300ca23970af4056deb7d786e978c90: IMG_1833.png
4ade1e75539dc2137e616f58301d22e1a254d798: IMG_1834.png
044900623c1a292d2397370c23f310ee5f6a47e8: IMG_1835.png
2dec43dc2acf221a2b9d2ac3407fcb90357f9887: IMG_1836.png
f96352284407b754244cc2a2cc742f6d77d53942: IMG_1837.png