TEX 70,
将上述面粉样品放置在漫反射样品台的样
品杯中
,
进行近红外光谱采集
.
大样品杯旋转采样
,
环境温度
23 ~ 25 益,
扫描次数
64
次
,
波数范围
12 000 ~ 4 000 cm
- 1
,
分辨率
8 cm
- 1
.
对
60
个面粉样
本进行近红外漫反射扫描后的光谱图如图
1
.
图
1摇
面粉样本的近红外漫反射光谱图
Fig. 1摇 NIR diffuse reflectance spectra of flour samples
1郾 4摇
马氏距离与蒙特卡洛交叉验证算法
1郾 4郾 1摇
马氏距离算法
将面粉的光谱图转换成数据矩阵后将成为一个
n
伊
k
的矩阵
A
.
计算
n
个样品的平均光谱
:
A
=
移
n
i =
1
A
ij
/ n
,
(1)
式
(1)
中
,
A
ij
为样品光谱矩阵元素
;
n
为样品的个数
;
j
为波长序号
;
A
样品光谱的平均值
.
将光谱数据减去平均值做光谱数据中心化处理
:
A
u
=
A
-
A
,
(2)
式
(2)
中
,
A
u
代表中心化处理后的光谱矩阵
,
A
代表
原光谱矩阵
,
A
代表光谱的平均值阵
.
然后计算出原标准光谱数据集的协方差阵
:
M
=
A
T
u
A
u
/
(
n
- 1),
(3)
式
(3)
中
,
M
代表标准光谱数据集的协方差阵
,
A
T
u
代表中心化处理后的光谱矩阵的转置
,
A
u
代表中心
化后的光谱阵
,
n
代表样品数
.
根据校正集样品数据和平均光谱数据计算两者
之间的马氏距离
:
D
2
= (
A
i
-
A
)
M
- 1
(
A
i
-
A
)
T
,
(4)
式
(4)
中
,
A
i
代表校正集样品数据
,
A
代表平均光谱
数据
.
M
- 1
代表标准光谱数据集的协方差阵的逆
矩阵
.
为了检验
n
个样品中是否存在异常样本
,
首先
要设置一个阈值
,
这个阈值是根据计算出的
n
个马
氏距离设置的
.
计算阈值范围如下
:
D
t
=
D
+
e
伊
滓
D
,
(5)
式
(5)
中
,
D
代表马氏距离的平均值
;
滓
D
代表马氏距
离的标准差
;
e
代表调整闭值范围的参数
.
当样品
i
与样品的平均光谱十分相近时
,
即存
在
D
i
臆
D
t
,
则称之为平均样品的邻近样品
.
陈
斌
[10 - 13]
等人详细介绍了如何通过设置不同的阈值
范围参数
e
,
调节样品的临近样品个数
,
并采用
PLS
建模进行回归预测
,
根据预测结果选取最佳
e
值
.
1郾 4郾 2摇
蒙特卡洛交叉验证算法
蒙特卡洛交叉验证算法
(Monte Carlo cross vali鄄
dation,MCCV)
又称为统计模拟方法
,
能够用于解决
复杂统计模型和矩阵高维问题
[14 - 15]
.
蒙特卡洛交
叉验证算法的核心是对样本的抽取
,
如何从给定的
目标函数分布中进行高效抽样成为关键所在
.
蒙特
卡洛随机取样
(Monte Carlo sampling,MCS)
法提出
选取一定的校正集
(
占样品量的
80
%
)
建立偏最小
二乘模型
,
剩余的
20
%
作预测集对模型进行验证
,
经过多次循环后能够得到一组预测残差
,
通过预测
残差计算出预测残差的均值
( MEAN )
与方差
(STD),
从而判断异常样本
.
通过校正集相关系数
(
R
2
)、
交叉验证均方差
RMSECV、
预测均方差
RMSEP
对模型进行评价
,
从
而验证剔除异常样本是否有利于模型精度的提高
.
2摇
结果与讨论
2郾 1摇
含异常样品的面粉近红外光谱分析
将
60
个样本应用于近红外定量分析
,
通过
Kennard鄄Stone(KS)
方法
,
确定校正集
50
个样本
,
剩
余
10
个样本用于模型验证
.
通过
OPUS 6郾 5
软件的
分析和优化
,
选择最优处理算法
,
寻找面粉的吸收光
谱较丰富的波段
.
分析表明
,
面粉对光谱信息贡献
量最大的谱区范围是
4 848郾 4 ~ 4 246郾 7 cm
- 1
,
维数
为
6,
利用
PLS
方法进行建模
,
可得相关系数
(
R
2
)
为
85郾 69,
交互验证均方差
RMSECV
为
0郾 067 2,50
个
面粉样本近红外光谱图交叉验证后灰分的近红外计
算值与化学分析值如图
2
.
部分异常样品的存在使模型的相关系数比较
低
,
模型预测结果缺乏可信度
,
所以需要把异常样本
剔除
.
2郾 2摇
马氏距离法剔除异常样品
对
50
个校正集样本的近红外光谱进行马氏距
离计算
,
可得到马氏距离分布图
,
如图
3
.
57
第
32
卷 第
5
期
摇 摇 摇 摇 摇 摇 摇 摇 摇 摇 摇 摇
刘翠玲等
:
近红外光谱奇异样本剔除方法研究