JsonCpp第五课读取带BOM的UTF-8编码文本

发布时间：2020-07-03 04:58:04 阅读：494 作者：fengyuzaitu 栏目：编程语言

前端开发者测试专用服务器限时活动，0元免费领，库存有限，领完即止！点击查看>>

知识解读
在Windows通过记事本打开的UTF-8编码文件，默认会在保存的时候，往文件开头多添加三个字节EF BB BF，表明文本的编码方式是UTF-8，这种技术就叫做BOM（Byte Order Mark，就是字节序标记）。在Unix或者Linux操作系统中不会出现这种情况。如果该文本是ANSI格式编码的，也没有添加其他的字符。

文本内容读取差异
带有BOM的文本字节流
"锘縖\r\n{\r\n\t\"version\": \"1.0.0\",\r\n\t\"messagetype\": \"alarm\",\r\n\t\"cmdtype\": 10009,\r\n\t\"sn\":\"202039248932482934\"

不带BOM的文本字节流
"[\r\n{\r\n\t\"version\": \"1.0.0\",\r\n\t\"messagetype\": \"alarm\",\r\n\t\"cmdtype\": 10009,\r\n\t\"sn\": \"202039248932482934\"

问题
默认情况下传递带有BOM的文本字节流给JsonCpp解析，肯定是解析不出来的，因为多了EF BB BF三个字节，所以需要将这三个字节从文本中剔除

代码
std::ifstream ifs;
ifs.open(pFileName, std::ifstream::in | std::ifstream::binary);

std::string str((std::istreambuf_iterator<char>(ifs)), std::istreambuf_iterator<char>());
std::string strValidJson;
if ((0xef == (unsigned char)str[0]) && (0xbb == (unsigned char)str[1]) && (0xbf == (unsigned char)str[2]))
{
strValidJson = str.substr(3, str.length() - 3);
}
else
{
strValidJson = str;
}
//开始解析Json文本
Json::Reader reader;
Json::Value root;
if (NULL == reader.parse(strJson, root))

{

ifstream.close();

return;

}

亿速云「云服务器」，即开即用、新一代英特尔至强铂金CPU、三副本存储NVMe SSD云盘，价格低至29元/月。点击查看>>

向AI问一下细节

JsonCpp第五课 读取带BOM的UTF-8编码文本

猜你喜欢

最新资讯

相关推荐

开发者交流群：

相关标签

JsonCpp第五课读取带BOM的UTF-8编码文本