simdutf 9.0.0
Unicode at GB/s.
Loading...
Searching...
No Matches
latin1_to_utf8.h
1#ifndef SIMDUTF_LATIN1_TO_UTF8_H
2#define SIMDUTF_LATIN1_TO_UTF8_H
3
4#include <cstring>
5
6namespace simdutf {
7namespace scalar {
8namespace {
9namespace latin1_to_utf8 {
10
11template <typename InputPtr, typename OutputPtr>
12#if SIMDUTF_CPLUSPLUS20
13 requires(simdutf::detail::indexes_into_byte_like<InputPtr> &&
14 simdutf::detail::index_assignable_from_char<OutputPtr>)
15#endif
16simdutf_constexpr23 size_t convert(InputPtr data, size_t len,
17 OutputPtr utf8_output) {
18 // const unsigned char *data = reinterpret_cast<const unsigned char *>(buf);
19 size_t pos = 0;
20 size_t utf8_pos = 0;
21
22 while (pos < len) {
23#if SIMDUTF_CPLUSPLUS23
24 if !consteval
25#endif
26 {
27 // try to convert the next block of 16 ASCII bytes
28 if (pos + 16 <= len) { // if it is safe to read 16 more bytes, check that
29 // they are ascii
30 uint64_t v1;
31 ::memcpy(&v1, data + pos, sizeof(uint64_t));
32 uint64_t v2;
33 ::memcpy(&v2, data + pos + sizeof(uint64_t), sizeof(uint64_t));
34 uint64_t v{v1 |
35 v2}; // We are only interested in these bits: 1000 1000 1000
36 // 1000, so it makes sense to concatenate everything
37 if ((v & 0x8080808080808080) ==
38 0) { // if NONE of these are set, e.g. all of them are zero, then
39 // everything is ASCII
40 size_t final_pos = pos + 16;
41 while (pos < final_pos) {
42 utf8_output[utf8_pos++] = char(data[pos]);
43 pos++;
44 }
45 continue;
46 }
47 } // if (pos + 16 <= len)
48 } // !consteval scope
49
50 unsigned char byte = data[pos];
51 if ((byte & 0x80) == 0) { // if ASCII
52 // will generate one UTF-8 bytes
53 utf8_output[utf8_pos++] = char(byte);
54 pos++;
55 } else {
56 // will generate two UTF-8 bytes
57 utf8_output[utf8_pos++] = char((byte >> 6) | 0b11000000);
58 utf8_output[utf8_pos++] = char((byte & 0b111111) | 0b10000000);
59 pos++;
60 }
61 } // while
62 return utf8_pos;
63}
64
65simdutf_really_inline size_t convert(const char *buf, size_t len,
66 char *utf8_output) {
67 return convert(reinterpret_cast<const unsigned char *>(buf), len,
68 utf8_output);
69}
70
71inline size_t convert_safe(const char *buf, size_t len, char *utf8_output,
72 size_t utf8_len) {
73 const unsigned char *data = reinterpret_cast<const unsigned char *>(buf);
74 size_t pos = 0;
75 size_t skip_pos = 0;
76 size_t utf8_pos = 0;
77 while (pos < len && utf8_pos < utf8_len) {
78 // try to convert the next block of 16 ASCII bytes
79 if (pos >= skip_pos && pos + 16 <= len &&
80 utf8_pos + 16 <= utf8_len) { // if it is safe to read 16 more bytes,
81 // check that they are ascii
82 uint64_t v1;
83 ::memcpy(&v1, data + pos, sizeof(uint64_t));
84 uint64_t v2;
85 ::memcpy(&v2, data + pos + sizeof(uint64_t), sizeof(uint64_t));
86 uint64_t v{v1 |
87 v2}; // We are only interested in these bits: 1000 1000 1000
88 // 1000, so it makes sense to concatenate everything
89 if ((v & 0x8080808080808080) ==
90 0) { // if NONE of these are set, e.g. all of them are zero, then
91 // everything is ASCII
92 ::memcpy(utf8_output + utf8_pos, buf + pos, 16);
93 utf8_pos += 16;
94 pos += 16;
95 } else {
96 // At least one of the next 16 bytes are not ASCII, we will process them
97 // one by one
98 skip_pos = pos + 16;
99 }
100 } else {
101 const auto byte = data[pos];
102 if ((byte & 0x80) == 0) { // if ASCII
103 // will generate one UTF-8 bytes
104 utf8_output[utf8_pos++] = char(byte);
105 pos++;
106 } else if (utf8_pos + 2 <= utf8_len) {
107 // will generate two UTF-8 bytes
108 utf8_output[utf8_pos++] = char((byte >> 6) | 0b11000000);
109 utf8_output[utf8_pos++] = char((byte & 0b111111) | 0b10000000);
110 pos++;
111 } else {
112 break;
113 }
114 }
115 }
116 return utf8_pos;
117}
118
119template <typename InputPtr, typename OutputPtr>
120#if SIMDUTF_CPLUSPLUS20
121 requires(simdutf::detail::indexes_into_byte_like<InputPtr> &&
122 simdutf::detail::index_assignable_from_char<OutputPtr>)
123#endif
124simdutf_constexpr23 size_t convert_safe_constexpr(InputPtr data, size_t len,
125 OutputPtr utf8_output,
126 size_t utf8_len) {
127 size_t pos = 0;
128 size_t utf8_pos = 0;
129 while (pos < len && utf8_pos < utf8_len) {
130 const unsigned char byte = data[pos];
131 if ((byte & 0x80) == 0) { // if ASCII
132 // will generate one UTF-8 bytes
133 utf8_output[utf8_pos++] = char(byte);
134 pos++;
135 } else if (utf8_pos + 2 <= utf8_len) {
136 // will generate two UTF-8 bytes
137 utf8_output[utf8_pos++] = char((byte >> 6) | 0b11000000);
138 utf8_output[utf8_pos++] = char((byte & 0b111111) | 0b10000000);
139 pos++;
140 } else {
141 break;
142 }
143 }
144 return utf8_pos;
145}
146
147template <typename InputPtr>
148#if SIMDUTF_CPLUSPLUS20
149 requires simdutf::detail::indexes_into_byte_like<InputPtr>
150#endif
151simdutf_constexpr23 simdutf_warn_unused size_t
152utf8_length_from_latin1(InputPtr input, size_t length) noexcept {
153 size_t answer = length;
154 size_t i = 0;
155
156#if SIMDUTF_CPLUSPLUS23
157 if !consteval
158#endif
159 {
160 auto pop = [](uint64_t v) {
161 return (size_t)(((v >> 7) & UINT64_C(0x0101010101010101)) *
162 UINT64_C(0x0101010101010101) >>
163 56);
164 };
165 for (; i + 32 <= length; i += 32) {
166 uint64_t v;
167 memcpy(&v, input + i, 8);
168 answer += pop(v);
169 memcpy(&v, input + i + 8, sizeof(v));
170 answer += pop(v);
171 memcpy(&v, input + i + 16, sizeof(v));
172 answer += pop(v);
173 memcpy(&v, input + i + 24, sizeof(v));
174 answer += pop(v);
175 }
176 for (; i + 8 <= length; i += 8) {
177 uint64_t v;
178 memcpy(&v, input + i, sizeof(v));
179 answer += pop(v);
180 }
181 } // !consteval scope
182 for (; i + 1 <= length; i += 1) {
183 answer += static_cast<uint8_t>(input[i]) >> 7;
184 }
185 return answer;
186}
187
188} // namespace latin1_to_utf8
189} // unnamed namespace
190} // namespace scalar
191} // namespace simdutf
192
193#endif
helpers placed in namespace detail are not a part of the public API
simdutf_warn_unused size_t utf8_length_from_latin1(const char *input, size_t length) noexcept
Return the number of bytes that this Latin1 string would require in UTF-8 format.