0%

有美本的好朋友邀请我一起探索量化。作为(准)程序员,以及(前)做题家,在对投资与金融完全零了解的情况下,我自然对这种似乎用纯粹的算法与数学对抗通货膨胀的技术产生了兴趣,立刻克隆下来了朋友的仓库。

在 GPT-5.4 连续几天的指导下,我学了一些基本的理论与算法,跑了几个回测。

这时再回过头来反思量化这个想法,发现还是存在一些误解。

首先是我作为(前)做题家的先验偏见,对金融领域的完全陌生、畏难导致了潜意识里对基础金融知识的“不屑”,大概的感觉就是“我用数学和编程就能秒了,为什么需要学习”,不想离开舒适圈。其次就是量化在国内难为普通人所用,需要一定的资金积累,大部分是企业在做。

所以,这些误解需要我改正。尽管算法学起来很好玩,但还是应当先积累些认知。例如:对投资的一些思考 | 🌀riba2534’s Blog程序员该用哪种姿势来理财 - 楼主的人生博客,都可以帮忙了解金融领域。

想看看 CC 使用的 SDK。基于对 Claude Code v2.1.88 源码 src/services/api/src/query.ts 的阅读。

阅读全文 »

现在来学习一下 Claude Code 的架构与设计思想。

一下子也看不完,准备持续记录笔记,对哪里感兴趣就先看哪;互联网上,各种 CC 源码报告充斥着无数自相矛盾的 LLM 幻觉,真是越看越红温,不如用自己的 CC 专门读几个方向的代码。

阅读全文 »

Assignment 1, Writeup

包含:

  1. Byte-pair encoding (BPE) tokenizer
  2. Transformer language model (LM)
  3. The cross-entropy loss function and the AdamW optimizer
  4. The training loop, with support for serializing and loading model and optimizer state

Byte-Pair Encoding (BPE) Tokenizer

Problem (unicode1): Understanding Unicode (1 point)

(a) What Unicode character does chr(0) return?

Null 字符。

(b) How does this character’s string representation (__repr__()) differ from its printed representation?

交互环境下输入 chr(0) 就是调用 __repr__(),看到 ‘\x00’。print(chr(0)) 什么都不显示。

阅读全文 »

Lecture 2 (一)

几个表格,快速回顾知识

缩写 全称 中文含义 常见解释
B Batch size 批大小 一次并行送进模型的样本数
H Heads 注意力头数 Multi-Head Attention 里的头数
T Time steps / Sequence length 时间步 / 序列长度 序列中 token 的数量
D Dimension / Hidden size 特征维度 / 隐藏维度 向量长度、embedding 维度
V Vocabulary size 词表大小 不同 token 的总数
d Head dim 每个 head 的维度 D / H
阅读全文 »

Lecture 1

第一次课程包括实现 Byte-Pair Encoding (BPE) tokenizer。

tokenizer 不应该使用字节级别操作,因为会导致长 sequence。

如果 tokenizer 使用 word-based tokenization 会导致 vocabulary size 过大。

因此采用 BPE。核心逻辑是把经常一起出现的 byte 凑成一个新组合,并反复执行这个过程:

  1. 把每个字节(Byte)都看作一个独立的 Token。
  2. 看看哪两个 Token 挨在一起出现的次数最多。
  3. 把这对 Token 合并成一个新的 Token。
  4. 重复这个过程直到达到合适的词表大小。

基本代码实现如下。

阅读全文 »

由于基础薄弱,希望调研也能作为笔记来帮助我个人进行复习,我额外记录了一些名词解释、新知识,而不是单独写论文的总结,所以内容可能有点啰嗦。

调研了以下优秀的论文。

阅读全文 »

简单记一下笔记

Detecting hallucinations in large language models using semantic entropy | Nature

作者想出了一种办法,可以检测大语言模型的一种幻觉:捏造(confabulation)。因为一个想法在语义层面(meaning level)可以计算不确定性,而不是只在特定的词序列上计算。类似于:同一个想法可以用很多不同方式表达。

阅读全文 »