南京大学把『感光』和『理解』做进了同一颗芯片:Nature Sensors 上的「光语芯」LightTok

📷 影像创新 · 2026-08-21 · sensor · in-sensor computing · 2D materials · Nature Sensors · 南京大学 · AI imaging · edge AI
来源核验:✅ 一手溯源 · 多源一致
图片来源:Nature Sensors 论文 Fig.1(Wang et al., 2026,DOI:10.1038/s44460-026-00122-3)

一句话:南京大学、新加坡国立大学、香港大学联合团队在《Nature Sensors》上报道了一颗叫 LightTok(中文报道称「光语芯」)的视觉传感芯片——它把"感光 + 存储 + 模拟计算"叠进了同一颗晶体管,并在 32×32 的小阵列原型上跑出 87.3% 的图像分类准确率,词元化阶段能效比传统视觉 Transformer 高出一个数量级。

一颗像素同时干三件事

传统摄像头走的是一条 70 年没变过的链:感光像素把光转成电信号 → ADC 量化 → 缓存到 DRAM → CPU/NPU 跑算法。这条链里,“看见"和"理解"是分两步的,前一步还要把原始像素搬来搬去。LightTok 的做法是把第一步往后退一步:每个像素本身就是一颗带浮栅的 2D 晶体管(材料是单层 MoS₂,二硫化钼),同一颗器件里把"感光、权重存储、模拟域乘加"三件事做掉。光打进像素,就在原地完成图像到 token 的转换,输出端的电流就是 Transformer 已经可以吃的向量。

为什么这件事重要

这件事并不是"又一颗 AI 芯片”。它的攻击面是 In-Sensor Computing 这一支——把神经网络前几层(视觉 Transformer 的 patch tokenization)从主处理器搬进传感器本身,省掉中间那条"图像搬运通道"。论文里给出来的硬数字是:在 32×32 像素的原型阵列上,CIFAR-10 风格任务准确率 87.3%,而词元化阶段的能耗比传统视觉 Transformer 基线低一个数量级。换句话说,最耗电、最费带宽的那一段被吃掉了,剩下的分类头可以交给常规 SoC 跑。

用户角度,它能用来做什么

对手机用户而言,今天这颗芯片还不能直接装进旗舰机——32×32 像素只能分辨模糊色块,离"拍清楚一张照片"差好几个数量级。但论文和南大新闻稿共同强调的一件事是:它的工艺路径与现有 CMOS 兼容,原则上可以走晶圆厂扩产。这意味着这条路的真正落地点,不在手机主摄,而在 always-on、电池供电、对功耗极敏感 的场景:无人机避障、可穿戴视觉、工业物联网、智能门锁、ADAS 边缘感知。它把"低功耗 + 实时视觉感知"这两件事捆在了同一颗器件上。

跟过去几年同类工作的差距

in-sensor computing 不算新概念——Sony、Meta(前 Brillnics)、三星、MIT、清华之前都做过不同版本。LightTok 的差异点有两个:① 用单层 MoS₂ 浮栅而不是传统 Si 基光电二极管或纯模拟乘加;② 把视觉 Transformer 的 patch tokenization 这一层放进传感器,而不是只把卷积前置。这两点叠加,让它在"直接出 token"这件事上比过去的工作更靠前一步。也正因为这一点,这篇工作的真正对手不是 Sony IMX 系列这种堆栈式 CIS,而是 Meta Brillnics、Lightelligence、SambaNova 这类"把模拟域计算往传感器层推"的玩家。

几个值得冷静看的地方

第一,原型阵列只有 1024 个像素,是演示而非产品,离一颗可拍照的传感器差 6 个数量级。第二,能效数字是"词元化阶段"的对比,不是端到端系统对比——真正的落地还要看后续读出电路、ADC、和下游 NPU 的协同。第三,Nature Sensors 是 Nature 旗下较年轻的子刊(创刊于 2024 年),影响力在 Nat. Electron. 与 Nat. Photon. 之间,论文质量门槛与这两本相当,但要警惕把它当成"诺奖级工作"来宣传。第四,2D 材料的 CMOS 兼容扩产并不天然——晶圆级 MoS₂ 生长、均匀性、缺陷密度都是产业化的真问题,南大这条工艺路线目前仍属于实验室 demo 阶段,量产时间表没有人能给出。

冷静判断

对手机用户:今天这条新闻跟你明年的旗舰机没有任何关系。你不需要为这件事换手机,它目前也根本进不了 ISP pipeline。

对同行(影像/ISP 工程师与系统架构师):值得标记的不是"又一颗 87% 的 AI 芯片",而是 视觉 Transformer 的 patch tokenization 已经可以被"硬件化" 这件事本身。如果这条工艺路线真能在 5 年内跑到百万像素阵列,ISP 早期管线(demosaic、白平衡、tone mapping)和边缘 NPU 的边界会重新画——影像前端会被"传感器里"的 AI 接管一部分,而 ISP 工程师需要考虑怎么跟一个会输出 token 而不是 RGB 的器件对接。

来源与核验

  • 一手源
  • 独立佐证
  • 核验结论
    • 论文标题、DOI、发表日期:✅ 一手核到
    • 通讯作者、机构分布、一作单位:✅ 一手核到(Lain-Jong Li @ NUS、Shi-Jun Liang @ 南大、Feng Miao @ 南大;合著机构含南大、港大、NUS、南理工、港理工)
    • “光语芯"中文译名 / “LightTok” 英文名:✅ Nature 论文标题与 Global Times 双源一致
    • 87.3% 准确率、32×32 原型、十倍以上能效:✅ Nature 论文页内文中出现 + Global Times 独立佐证
    • 关键词分类(Two-dimensional materials / Optical and Electronic Materials / Nanotechnology):✅ Nature schema.org 元数据直接给出
    • verdict:✅ 一手溯源 · 多源一致(证据仅说明 8/19 论文存在并被中文/英文独立报道,关键性能数字来自作者本人报告,未经第三方独立复现)

一手来源:官方原文 ↗

← 返回 影像创新