极境
  • 首页
  • tags
  • about
从零手写Transformer_使用PyTorch实现简化版英汉机器翻译

从零手写Transformer_使用PyTorch实现简化版英汉机器翻译

在上一篇文章中,我们手动实现了 Transformer 的核心组件,并详细解析了其结构原理。本文将在此基础上,演示一个简化版的英汉机器翻译系统,完整呈现其训练与推理流程。我们将使用 PyTorch 逐步搭建整个流程,重点突出核心逻辑,代码简洁易懂,便于理解。 需要说明的是,本文的目标并非构建高精度的
2026-07-23
AI 工程
#Transformer#PyTorch#NLP#深度学习#机器翻译
从我不再使用 Axure 说起,AI First 需要哪些条件

从我不再使用 Axure 说起,AI First 需要哪些条件

1. 从画原型说起:我扔掉了 Axure 最近用 AI 画原型和需求文档逐渐标准化了,可以完全替代传统的方式,做到高效满分。 这让我觉得,现在所有产品用 Axure 画原型、手动码字的方式都是落伍的,浪费时间的。 用 AI 的优势表现在输出的流畅高效,思维不会被打断。 设想一下以前画一个原型,画半天
2026-07-23
AI 工作流
#原型设计#Cursor#Claude Code#AI 工作流#AI First#Axure#需求文档
从零实现 vLLM(1.3):如何加速 Attention 计算

从零实现 vLLM(1.3):如何加速 Attention 计算

1. 从零实现 vLLM(1.3):如何加速 Attention 计算 vLLM 是目前最主流的 LLM 推理框架,它主要解决了 LLM 推理时的内存瓶颈问题。 本文主要介绍 vLLM 如何加速 Attention 计算。 1.1. Attention 计算过程
2026-07-23
vLLM
#vLLM#推理优化#FlashAttention#KV Cache#PagedAttention#LLM 推理
从零到一开发_Text-to-SQL_MCP_数据查询服务器

从零到一开发_Text-to-SQL_MCP_数据查询服务器

1- 引言 在数据驱动的时代,自然语言到 SQL 的转换(Text-to-SQL)技术正变得越来越重要。它允许非技术用户通过自然语言查询数据库,极大降低了数据分析的门槛。本文将详细介绍如何从零开始构建一个基于 FastMCP 框架的 Text-to-SQL 服务器,实现安全、可控的数据库查询服务。
2026-07-23
从0到1,彻底搞懂 RAG 分块的艺术(附开源代码)

从0到1,彻底搞懂 RAG 分块的艺术(附开源代码)

你是否也曾困惑:为什么我的 RAG 系统总答非所问?明明喂给它了完整的文档,为什么还是抓不住重点? 答案可能藏在最基础、也最容易被忽视的一环——分块(Chunking)。 分块是 RAG 系统的"数据预处理器",它连接着原始文档和语义检索,是决定模型能否"读懂"资料、并给出精准回答的命脉。今天,我们
2026-07-23
AI 开发
#RAG#向量检索#分块#Chunking#嵌入模型#语义检索
彻底搞懂深度学习-循环神经网络_RNN_LSTM_GRU__动图讲解

彻底搞懂深度学习-循环神经网络_RNN_LSTM_GRU__动图讲解

想象一下,如果你在阅读这篇文章时,每读完一个词就忘记前面的内容,你还能理解文章的意思吗?这正是传统神经网络面临的问题——它们没有记忆能力。 处理完一个输入后,就完全忘记了之前的信息。这种设计在处理图像等任务时没问题,但面对文本、语音、时间序列等需要上下文的数据时就力不从心了。 循环神经网络 (RNN
2026-07-23
AI
#深度学习#RNN#LSTM#GRU#循环神经网络
常用 Web 实时通信技术原理选型一篇通关

常用 Web 实时通信技术原理选型一篇通关

在 Web 开发中,实时通信技术的核心目标是实现客户端(Browser)与服务器之间低延迟、双向/单向的动态数据交互,而非传统 HTTP 的"请求-响应"模式。 以下是 Web 端最常用的实时通信技术,从概念、原理特点、适用场景、对比选型进行详细解析。 1. WebSocket 1.1. 核心概念
2026-07-23
前端开发
#技术选型#WebSocket#SSE#WebRTC#轮询#实时通信
不会 CUDA 也能轻松看懂的 FlashAttention 教程 算法原理篇

不会 CUDA 也能轻松看懂的 FlashAttention 教程 算法原理篇

以 Attention 计算为核心的 Transformer 模型是当今深度学习的基石。 虽然 Attention 计算十分有效,但其高昂的计算成本往往成为了模型性能优化的瓶颈。 为了在 GPU 上高效执行 Attention 计算,现在开发者们普遍都使用了 FlashAttention——一种高效
2026-07-23
编程
#CUDA#GPU 编程#深度学习#FlashAttention#Attention#算子融合
不藏了OpenAI2025开发者日ChatGPT要变成操作系统8分钟拖拽可构建超复杂Agent

不藏了OpenAI2025开发者日ChatGPT要变成操作系统8分钟拖拽可构建超复杂Agent

1- 引言 今天 OpenAI 的开发者日简直太硬核了,OpenAI 的开发者已经达到了惊人的 400 万,ChatGPT 周活跃用户达到 8 亿,每分钟 API 处理的 60 亿 token
2026-07-23
并行计算SIMD_vs_SIMT_全面对比分析

并行计算SIMD_vs_SIMT_全面对比分析

1- 全面对比表格 特性 SIMD (Single Instruction, Multiple Data) SIMT (Single Instruction, Multiple Threads) 核心本质 一种数据并行执行范式/指令类型。一条指令同时操作多个数据元素。 一种线程并行执行模型。一条指令
2026-07-23
1 … 36 37 38 … 113
© 极境 · 保持好奇