大模型如何理解代码的,如何输入、输出的


从工程角度彻底拆解 LLM 的"输入→处理→输出"全过程 全局流程一览 你输入的文字 ↓ ① Tokenization 文字 → Token ID 数字序列 ↓ ② Embedding 数字 → 高维向量 ↓ ③ Transformer 向量

LLM 为什么算"理解"语义


LLM 为什么算"理解"语义? 这是一个非常有深度的问题,答案是:LLM 的"理解"和人类的理解不同,但确实捕获了语义结构。 先从一个问题出发 传统关键词搜索: "苹果" → 只匹配含"苹果"字符串的文档 LLM / Embedding: "苹果" → 能区分"水果苹果" vs "苹果公司

语义如何理解


"语义如何理解"可以从几个层面来讲——看你是指日常语言中的语义、计算语言学里的语义理解,还是AI/NLP 中模型怎么"理解"语义。下面分层说明: 一、什么是语义(Semantics) 语义 = 符号(词/句子)所指代的实际含义、与真实世界概念或意图的对应关系 "苹果"→ 可能指水果 🍎,也可能指公

Neo4j​ 简介


Neo4j 是业界最主流的原生图数据库,专门用于存储、查询和分析节点-关系-属性构成的知识图谱/关联数据,核心查询语言是 Cypher。 一、核心概念(类比关系型 DB)

OpenSIPS 简介


什么是 OpenSIPS? OpenSIPS(Open SIP Server)是一个高性能、开源的 SIP 服务器平台,用于构建各种 VoIP 和实时通信应用。起源于 2008 年从 OpenSER 项目分叉,使用 C 语言编写,以超高并发、灵活路由著称。 💡 如果说 FreeSWITCH 是"媒

Elasticsearch 向量检索


什么是向量检索? 向量检索(Vector Search) 是将文本、图片、音频等非结构化数据转换为高维向量(Embedding),通过计算向量间的相似度来找到语义相近的内容,而非传统的关键词匹配。 传统搜索: "苹果手机" → 精确匹配 "苹果" "手机" 关键词 向量搜索: "苹果手机"

ASR 语音识别的大模型方案


🌍 主流开源大模型方案 1. 🏆 OpenAI Whisper(最流行) 目前最广泛使用的开源 ASR 大模型

FreeSWITCH 简介


Hadoop 现在还在用吗?


还在用,但地位已大不如前。 整体趋势是"HDFS 还活着,MapReduce 基本凉了"。 📊 现状分解 组件 现状

RAG 检索增强生成 完整技术指南


RAG 检索增强生成 完整技术指南 一、什么是 RAG? RAG = Retrieval Augmented Generation 检索 + 增强 + 生成 核心思想: 不把知识"硬编码"进模型参数 而是在回答时实时"查阅外部资料"再作答 类比: